Questão de Engenharia de Software — Inteligencia Artificial — CESPE / CEBRASPE 2025
Engenharia de Software›Inteligencia Artificial
Código
ce219662
Banca
CESPE / CEBRASPE
Órgão
TRF - 6ª REGIÃO
Ano
2025
Nível
Superior
Cargo
Analista Judiciário – Área: Apoio Especializado – Especialidade: Governança e Gestão de Tecnologia da Informação
Julgue o item subsequente, a respeito de LLM e IA generativa.No processo de inferência, o LLaMA utiliza decodificação paralela em vez de decodificação sequencial, gerando todos os tokens simultaneamente, sem depender do contexto anterior, o que elimina a necessidade de otimizações como layer-wise quantization.
CCerto
EErrado
Revelar gabarito e comentário▾
GabaritoE — Errado
Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.
LLaMA e Decodificação em LLMs
Gabarito: ❌ ERRADO. A afirmação está incorreta. O modelo LLaMA, assim como a maioria dos grandes modelos de linguagem (GPT, BERT apenas para encoding, etc.), utiliza decodificação sequencial (autoregressiva) durante a inferência, gerando um token por vez, dependendo do contexto anterior. A decodificação paralela (não-autoregressiva) não é uma característica do LLaMA. Além disso, otimizações como layer-wise quantization são frequentemente aplicadas mesmo em modelos autoregressivos para reduzir o uso de memória e acelerar a inferência, não sendo eliminadas por uma suposta decodificação paralela.
1Entrada do prompt
2Gera 1º token (autoregressivo)
3Token vira novo contexto
4Gera próximo token
5Repete até token de parada
LEVEL · soulevel.com.br
NÃO CAIA NESSA!
A banca tenta confundir o candidato ao trocar o conceito de decodificação sequencial (real) por paralela (falsa), além de sugerir que isso eliminaria a necessidade de técnicas de otimização amplamente utilizadas. Lembre-se: LLMs como LLaMA, GPT e outros são autoregressivos – cada token depende dos anteriores.
PEGA ESSA DICA!
Em questões sobre arquitetura de LLMs, fixe: a maioria gera texto sequencialmente (token a token). Modelos que geram todos os tokens de uma vez (paralelo) são uma abordagem diferente e menos comum (ex.: Mask-Predict, alguns modelos de difusão para texto). Além disso, quantização é uma técnica de compressão independente do modo de decodificação.