Pular para o conteúdo principal

Questão de Engenharia de Software — Inteligencia Artificial — CESPE / CEBRASPE 2025

Engenharia de SoftwareInteligencia Artificial
Código
ce219042
Banca
CESPE / CEBRASPE
Órgão
TRF - 6ª REGIÃO
Ano
2025
Nível
Superior
Cargo
Analista Judiciário – Área: Apoio Especializado – Especialidade: Análise de Sistemas de Informação
Julgue o item que se segue, em relação a grandes modelos de linguagem (LLMs) e a redes neurais.O uso de tokenizadores subword permite que LLMs aprendam palavras fora do vocabulário de treinamento, otimizando a compreensão sem estar restrito a um único idioma.
  1. CCerto
  2. EErrado
Revelar gabarito e comentário

GabaritoC — Certo

Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.

Grandes Modelos de Linguagem (LLMs) e Tokenizadores Subword

CERTO. A afirmação está correta. Tokenizadores subword, como BPE (Byte-Pair Encoding) e WordPiece, são amplamente utilizados em LLMs modernos. Eles permitem que o modelo represente palavras fora do vocabulário de treinamento (OOV) combinando subpalavras conhecidas. Isso otimiza a compreensão porque o modelo pode lidar com palavras novas ou raras sem depender de um vocabulário fixo, e a abordagem é intrinsecamente independente de idioma, já que os tokens são baseados em padrões de caracteres ou substrings comuns.

SE LIGUE NESSA!

O conteúdo de apoio menciona que "modelos de linguagem maiores empregam predominantemente a tokenização de subpalavras", o que está em linha com a afirmação. Essa técnica é um dos pilares da flexibilidade dos LLMs atuais.

💡 Dica: Lembre-se de que a tokenização subword resolve o problema de palavras desconhecidas e permite que o modelo generalize para múltiplos idiomas com um mesmo vocabulário. É uma característica fundamental de LLMs como GPT, BERT e LLaMA.

Gabarito: ✅ CERTO.

Link permanente: /questoes/ce219042