Pular para o conteúdo principal

Questão de Engenharia de Software — Inteligencia Artificial — FGV 2023

Engenharia de SoftwareInteligencia Artificial
Código
fg071337
Banca
FGV
Órgão
TCE-ES
Ano
2023
Nível
Superior
Cargo
Auditor de Controle Externo - Tecnologia da informação
Ao ser contratado por uma empresa da área de e-commerce, o cientista de dados Pedro foi alocado a um importante projeto: desenvolver um classificador para análise de sentimentos considerando as opiniões emitidas no Twitter pelos clientes dessa empresa. Para o início do trabalho, Pedro recebeu um pequeno conjunto de dados de tweets parcialmente anotados, que foram coletados da rede social por intermédio de uma API, usando como palavras-chave na busca os nomes de diversas empresas de e-commerce.Como parte das escolhas de técnicas a serem utilizadas no projeto, Pedro optou pelo uso de word embeddings, com o objetivo de resolver o problema muito comum em processamento de linguagem natural de:
  1. Afalta de anotação nos tweets, pois essa técnica gera automaticamente a anotação a partir das palavras que compõem o texto;
  2. Bbaixa quantidade de instâncias no conjunto de dados, pois essa técnica produz sobreamostragem da classe minoritária do conjunto de dados, incrementando-o;
  3. Cmaldição da dimensionalidade, pois essa técnica permite a representação das palavras como vetores de baixa dimensionalidade;
  4. Dpresença de outliers, pois essa técnica elimina as instâncias que não apresentam similaridade ao conjunto de dados como um todo;
  5. Eflexão de palavras, pois essa técnica reduz substantivos flexionados em gênero ou número e verbos conjugados às suas formas mais básicas.
Revelar gabarito e comentário

GabaritoC — maldição da dimensionalidade, pois essa técnica permite a representação das palavras como vetores de baixa dimensionalidade;

Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.

Word Embeddings em Processamento de Linguagem Natural

Gabarito: letra C. Word embeddings (como Word2Vec, GloVe) representam palavras como vetores densos e de baixa dimensionalidade, combatendo a maldição da dimensionalidade inerente a representações esparsas (one-hot encoding). Essa é a principal motivação para seu uso em tarefas de PLN.

Alternativa

Descrição

Correta?

Motivo

A

Gera anotação automaticamente

Word embeddings não geram anotação; aprendem representações vetoriais.

B

Produz sobreamostragem da classe minoritária

Oversampling é feito por métodos como SMOTE, não por embeddings.

C

Representa palavras como vetores de baixa dimensionalidade

Reduz a maldição da dimensionalidade, principal motivação do uso.

D

Elimina outliers

Detecção de outliers é etapa separada; embeddings não eliminam instâncias.

E

Reduz flexões de palavras (stemming/lematização)

Normalização morfológica é feita por algoritmos específicos, não por embeddings.

Alternativa A — ❌ Incorreta

Word embeddings não geram anotação automaticamente; eles aprendem representações vetoriais a partir de um corpus. Anotação é tarefa de rotulagem manual ou semi-supervisionada.

Alternativa B — ❌ Incorreta

A técnica não realiza sobreamostragem. Oversampling é feito por métodos como SMOTE, não por embeddings.

Alternativa C — ✅ Correta ⟵ GABARITO

Como explicado, embeddings reduzem a dimensionalidade e capturam relações semânticas, solucionando a maldição da dimensionalidade em PLN.

Alternativa D — ❌ Incorreta

Embeddings não eliminam outliers; a detecção de outliers é uma etapa separada.

Alternativa E — ❌ Incorreta

A redução de flexões (stemização/lematização) é feita por algoritmos específicos (Porter, Snowball, etc.), não por word embeddings. Embeddings podem até manter informações morfológicas, mas não têm como objetivo normalizar flexões.

NÃO CAIA NESSA!

A banca pode confundir word embeddings com técnicas de stemming ou lematização (alternativa E). Lembre-se: embeddings geram vetores densos para capturar significado; stemming/lematização reduzem palavras à raiz. São objetivos diferentes.

PEGA ESSA DICA!

Word embeddings são vetores densos de centenas de dimensões, enquanto one-hot encoding gera vetores esparsos do tamanho do vocabulário. O ganho é justamente evitar a maldição da dimensionalidade.

Gabarito: letra C.

Link permanente: /questoes/fg071337