Questão de Engenharia de Software — Inteligencia Artificial — FGV 2023
Engenharia de Software›Inteligencia Artificial
Código
fg071337
Banca
FGV
Órgão
TCE-ES
Ano
2023
Nível
Superior
Cargo
Auditor de Controle Externo - Tecnologia da informação
Ao ser contratado por uma empresa da área de e-commerce, o cientista de dados Pedro foi alocado a um importante projeto: desenvolver um classificador para análise de sentimentos considerando as opiniões emitidas no Twitter pelos clientes dessa empresa. Para o início do trabalho, Pedro recebeu um pequeno conjunto de dados de tweets parcialmente anotados, que foram coletados da rede social por intermédio de uma API, usando como palavras-chave na busca os nomes de diversas empresas de e-commerce.Como parte das escolhas de técnicas a serem utilizadas no projeto, Pedro optou pelo uso de word embeddings, com o objetivo de resolver o problema muito comum em processamento de linguagem natural de:
Afalta de anotação nos tweets, pois essa técnica gera automaticamente a anotação a partir das palavras que compõem o texto;
Bbaixa quantidade de instâncias no conjunto de dados, pois essa técnica produz sobreamostragem da classe minoritária do conjunto de dados, incrementando-o;
Cmaldição da dimensionalidade, pois essa técnica permite a representação das palavras como vetores de baixa dimensionalidade;
Dpresença de outliers, pois essa técnica elimina as instâncias que não apresentam similaridade ao conjunto de dados como um todo;
Eflexão de palavras, pois essa técnica reduz substantivos flexionados em gênero ou número e verbos conjugados às suas formas mais básicas.
Revelar gabarito e comentário▾
GabaritoC — maldição da dimensionalidade, pois essa técnica permite a representação das palavras como vetores de baixa dimensionalidade;
Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.
Word Embeddings em Processamento de Linguagem Natural
Gabarito: letra C. Word embeddings (como Word2Vec, GloVe) representam palavras como vetores densos e de baixa dimensionalidade, combatendo a maldição da dimensionalidade inerente a representações esparsas (one-hot encoding). Essa é a principal motivação para seu uso em tarefas de PLN.
Alternativa
Descrição
Correta?
Motivo
A
Gera anotação automaticamente
❌
Word embeddings não geram anotação; aprendem representações vetoriais.
B
Produz sobreamostragem da classe minoritária
❌
Oversampling é feito por métodos como SMOTE, não por embeddings.
C
Representa palavras como vetores de baixa dimensionalidade
✅
Reduz a maldição da dimensionalidade, principal motivação do uso.
D
Elimina outliers
❌
Detecção de outliers é etapa separada; embeddings não eliminam instâncias.
E
Reduz flexões de palavras (stemming/lematização)
❌
Normalização morfológica é feita por algoritmos específicos, não por embeddings.
Alternativa A — ❌ Incorreta
Word embeddings não geram anotação automaticamente; eles aprendem representações vetoriais a partir de um corpus. Anotação é tarefa de rotulagem manual ou semi-supervisionada.
Alternativa B — ❌ Incorreta
A técnica não realiza sobreamostragem. Oversampling é feito por métodos como SMOTE, não por embeddings.
Alternativa C — ✅ Correta ⟵ GABARITO
Como explicado, embeddings reduzem a dimensionalidade e capturam relações semânticas, solucionando a maldição da dimensionalidade em PLN.
Alternativa D — ❌ Incorreta
Embeddings não eliminam outliers; a detecção de outliers é uma etapa separada.
Alternativa E — ❌ Incorreta
A redução de flexões (stemização/lematização) é feita por algoritmos específicos (Porter, Snowball, etc.), não por word embeddings. Embeddings podem até manter informações morfológicas, mas não têm como objetivo normalizar flexões.
NÃO CAIA NESSA!
A banca pode confundir word embeddings com técnicas de stemming ou lematização (alternativa E). Lembre-se: embeddings geram vetores densos para capturar significado; stemming/lematização reduzem palavras à raiz. São objetivos diferentes.
PEGA ESSA DICA!
Word embeddings são vetores densos de centenas de dimensões, enquanto one-hot encoding gera vetores esparsos do tamanho do vocabulário. O ganho é justamente evitar a maldição da dimensionalidade.