Questão de Engenharia de Software — Inteligencia Artificial — FGV 2022
Engenharia de Software›Inteligencia Artificial
Código
fg055314
Banca
FGV
Órgão
TCU
Ano
2022
Nível
Superior
Cargo
Auditor Federal de Controle Externo
Uma organização está implementando um sistema de busca de informações interno, e a equipe de desenvolvimento resolveu avaliar diferentes modelos de linguagem vetoriais que ajudariam a conectar melhor documentos e consultas em departamentos que usam terminologias distintas em áreas de negócio que se sobrepõem. Um dos analistas ressaltou que seria interessante guardar os vetores de todo o vocabulário do modelo em um cache, de forma a aumentar a eficiência de acesso e reduzir certos custos de implantação.Das alternativas abaixo, aquela que lista apenas os modelos compatíveis com essa estratégia de caching é:
ATF-IDF, BERT;
BWord2Vec, BERT, GPT-2;
CGloVe, GPT-2;
DWord2Vec, GloVe;
EGPT-2, BERT.
Revelar gabarito e comentário▾
GabaritoD — Word2Vec, GloVe;
Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.
Modelos de linguagem vetoriais e cache de vocabulário
Gabarito: letra D. Apenas os modelos que produzem vetores fixos por palavra (estáticos) permitem o armazenamento em cache de todo o vocabulário. Word2Vec e GloVe são modelos estáticos; BERT, GPT-2 e TF-IDF (embora estático, mas não listado isoladamente) são contextuais ou não se encaixam na alternativa correta. A chave está em distinguir embeddings estáticos (um vetor por palavra) de contextuais (vetor depende da sentença).
O caching de vetores de todo o vocabulário só é viável quando cada palavra tem um vetor fixo, independente do contexto. Modelos estáticos (Word2Vec, GloVe, e também TF-IDF) atendem a esse requisito. Modelos contextuais (BERT, GPT-2) geram representações dinâmicas — a mesma palavra em diferentes contextos produz vetores diferentes —, impossibilitando o cache prévio.
A tabela a seguir resume os modelos mencionados:
Modelo
Tipo de embedding
Cacheável?
Word2Vec
Estático
Sim
GloVe
Estático
Sim
BERT
Contextual
Não
GPT-2
Contextual
Não
TF-IDF
Estático
Sim (mas não listado isoladamente)
Embeddings
1Estáticos (vetor fixo por palavra)
Word2Vec
GloVe
TF-IDF
2Contextuais (vetor depende da sentença)
BERT
GPT-2
LEVEL · soulevel.com.br
Alternativa A — ❌ Incorreta
Inclui TF-IDF (estático) e BERT (contextual). BERT não é compatível com o caching de vetores fixos.
Alternativa B — ❌ Incorreta
Lista Word2Vec (estático), BERT e GPT-2 (ambos contextuais). Os contextuais inviabilizam a estratégia.
Alternativa C — ❌ Incorreta
Contém GloVe (estático) e GPT-2 (contextual). Novamente, a presença de um modelo contextual torna a alternativa inválida.
Alternativa D — ✅ Correta ⟵ GABARITO
Word2Vec e GloVe são ambos modelos de embeddings estáticos. Cada palavra do vocabulário tem um vetor fixo, permitindo o armazenamento em cache para consultas rápidas. Nenhum modelo contextual aparece na lista.
Alternativa E — ❌ Incorreta
GPT-2 e BERT são modelos contextuais. Nenhum deles é compatível com a estratégia de caching descrita.
NÃO CAIA NESSA!
A banca explora a confusão entre modelos estáticos e contextuais. É comum o candidato achar que BERT e GPT-2 também podem ser cacheados, mas por serem contextuais, o vetor de uma palavra só é gerado no momento da inferência, dependendo do contexto. Memorize: estáticos → Word2Vec, GloVe, FastText (e TF-IDF); contextuais → BERT, GPT, ELMo.