Pular para o conteúdo principal

Questão de Engenharia de Software — Inteligencia Artificial — CESPE / CEBRASPE 2025

Engenharia de SoftwareInteligencia Artificial
Código
ce219662
Banca
CESPE / CEBRASPE
Órgão
TRF - 6ª REGIÃO
Ano
2025
Nível
Superior
Cargo
Analista Judiciário – Área: Apoio Especializado – Especialidade: Governança e Gestão de Tecnologia da Informação
Julgue o item subsequente, a respeito de LLM e IA generativa.No processo de inferência, o LLaMA utiliza decodificação paralela em vez de decodificação sequencial, gerando todos os tokens simultaneamente, sem depender do contexto anterior, o que elimina a necessidade de otimizações como layer-wise quantization.
  1. CCerto
  2. EErrado
Revelar gabarito e comentário

GabaritoE — Errado

Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.

LLaMA e Decodificação em LLMs

Gabarito: ❌ ERRADO. A afirmação está incorreta. O modelo LLaMA, assim como a maioria dos grandes modelos de linguagem (GPT, BERT apenas para encoding, etc.), utiliza decodificação sequencial (autoregressiva) durante a inferência, gerando um token por vez, dependendo do contexto anterior. A decodificação paralela (não-autoregressiva) não é uma característica do LLaMA. Além disso, otimizações como layer-wise quantization são frequentemente aplicadas mesmo em modelos autoregressivos para reduzir o uso de memória e acelerar a inferência, não sendo eliminadas por uma suposta decodificação paralela.

  1. 1Entrada do prompt
  2. 2Gera 1º token (autoregressivo)
  3. 3Token vira novo contexto
  4. 4Gera próximo token
  5. 5Repete até token de parada
LEVEL · soulevel.com.br
NÃO CAIA NESSA!

A banca tenta confundir o candidato ao trocar o conceito de decodificação sequencial (real) por paralela (falsa), além de sugerir que isso eliminaria a necessidade de técnicas de otimização amplamente utilizadas. Lembre-se: LLMs como LLaMA, GPT e outros são autoregressivos – cada token depende dos anteriores.

PEGA ESSA DICA!

Em questões sobre arquitetura de LLMs, fixe: a maioria gera texto sequencialmente (token a token). Modelos que geram todos os tokens de uma vez (paralelo) são uma abordagem diferente e menos comum (ex.: Mask-Predict, alguns modelos de difusão para texto). Além disso, quantização é uma técnica de compressão independente do modo de decodificação.

Link permanente: /questoes/ce219662