Pular para o conteúdo principal

Questão de Engenharia de Software — Inteligencia Artificial — FGV 2022

Engenharia de SoftwareInteligencia Artificial
Código
fg055314
Banca
FGV
Órgão
TCU
Ano
2022
Nível
Superior
Cargo
Auditor Federal de Controle Externo
Uma organização está implementando um sistema de busca de informações interno, e a equipe de desenvolvimento resolveu avaliar diferentes modelos de linguagem vetoriais que ajudariam a conectar melhor documentos e consultas em departamentos que usam terminologias distintas em áreas de negócio que se sobrepõem. Um dos analistas ressaltou que seria interessante guardar os vetores de todo o vocabulário do modelo em um cache, de forma a aumentar a eficiência de acesso e reduzir certos custos de implantação.Das alternativas abaixo, aquela que lista apenas os modelos compatíveis com essa estratégia de caching é:
  1. ATF-IDF, BERT;
  2. BWord2Vec, BERT, GPT-2;
  3. CGloVe, GPT-2;
  4. DWord2Vec, GloVe;
  5. EGPT-2, BERT.
Revelar gabarito e comentário

GabaritoD — Word2Vec, GloVe;

Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.

Modelos de linguagem vetoriais e cache de vocabulário

Gabarito: letra D. Apenas os modelos que produzem vetores fixos por palavra (estáticos) permitem o armazenamento em cache de todo o vocabulário. Word2Vec e GloVe são modelos estáticos; BERT, GPT-2 e TF-IDF (embora estático, mas não listado isoladamente) são contextuais ou não se encaixam na alternativa correta. A chave está em distinguir embeddings estáticos (um vetor por palavra) de contextuais (vetor depende da sentença).

O caching de vetores de todo o vocabulário só é viável quando cada palavra tem um vetor fixo, independente do contexto. Modelos estáticos (Word2Vec, GloVe, e também TF-IDF) atendem a esse requisito. Modelos contextuais (BERT, GPT-2) geram representações dinâmicas — a mesma palavra em diferentes contextos produz vetores diferentes —, impossibilitando o cache prévio.

A tabela a seguir resume os modelos mencionados:

Modelo

Tipo de embedding

Cacheável?

Word2Vec

Estático

Sim

GloVe

Estático

Sim

BERT

Contextual

Não

GPT-2

Contextual

Não

TF-IDF

Estático

Sim (mas não listado isoladamente)

Embeddings
  • 1Estáticos (vetor fixo por palavra)
    • Word2Vec
    • GloVe
    • TF-IDF
  • 2Contextuais (vetor depende da sentença)
    • BERT
    • GPT-2
LEVEL · soulevel.com.br

Alternativa A — ❌ Incorreta

Inclui TF-IDF (estático) e BERT (contextual). BERT não é compatível com o caching de vetores fixos.

Alternativa B — ❌ Incorreta

Lista Word2Vec (estático), BERT e GPT-2 (ambos contextuais). Os contextuais inviabilizam a estratégia.

Alternativa C — ❌ Incorreta

Contém GloVe (estático) e GPT-2 (contextual). Novamente, a presença de um modelo contextual torna a alternativa inválida.

Alternativa D — ✅ Correta ⟵ GABARITO

Word2Vec e GloVe são ambos modelos de embeddings estáticos. Cada palavra do vocabulário tem um vetor fixo, permitindo o armazenamento em cache para consultas rápidas. Nenhum modelo contextual aparece na lista.

Alternativa E — ❌ Incorreta

GPT-2 e BERT são modelos contextuais. Nenhum deles é compatível com a estratégia de caching descrita.

NÃO CAIA NESSA!

A banca explora a confusão entre modelos estáticos e contextuais. É comum o candidato achar que BERT e GPT-2 também podem ser cacheados, mas por serem contextuais, o vetor de uma palavra só é gerado no momento da inferência, dependendo do contexto. Memorize: estáticos → Word2Vec, GloVe, FastText (e TF-IDF); contextuais → BERT, GPT, ELMo.

Gabarito: letra D.

Link permanente: /questoes/fg055314