Pular para o conteúdo principal

Questão de Programação — Linguagens de programação — FGV 2024

ProgramaçãoLinguagens de programação
Código
fg077339
Banca
FGV
Órgão
CVM
Ano
2024
Nível
Superior
Cargo
Analista - Perfil 7 - Ciência de Dados - Tarde
Texto 1


Aline, cientista de dados da CVM, foi designada para aferir a reação à prova da CVM entre os usuários de uma rede social de textos curtos usando técnicas de análise de sentimentos. Para isso, ela realiza um processo de KDD. Nesse processo, Aline opta por representar os textos obtidos da rede social no formato de vetores reais de baixa dimensionalidade, calculados a partir das representações das palavras obtidas de um modelo de linguagem pré-treinado utilizando a técnica word2vec.
Considerando o texto 1, a representação das palavras que será utilizada por Aline é chamada de:
  1. ATF-IDF;
  2. Btokens;
  3. Cn-gramas;
  4. Dbag-of-words;
  5. Eword embeddings.
Revelar gabarito e comentário

GabaritoE — word embeddings.

Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.

Representação de Palavras em PLN

Gabarito: letra E. A técnica word2vec gera vetores reais densos e de baixa dimensionalidade que capturam relações semânticas entre as palavras, conhecidos como word embeddings. O texto 1 descreve exatamente esse processo: "vetores reais de baixa dimensionalidade, calculados a partir das representações das palavras obtidas de um modelo de linguagem pré-treinado utilizando a técnica word2vec".

A questão testa o conhecimento das diferentes formas de representar texto em Processamento de Linguagem Natural (PLN). Vamos analisar cada alternativa:

Representação de palavras em PLN
  • 1Vetores esparsos (alta dimensionalidade)
    • TF-IDF (ponderação estatística)
    • Bag-of-words (frequência, sem contexto)
  • 2Unidades discretas
    • Tokens (palavras/subpalavras)
    • N-gramas (sequências contíguas)
  • 3Vetores densos (baixa dimensionalidade)
    • Word embeddings (word2vec)
      • Capturam semântica e sintaxe
LEVEL · soulevel.com.br

Alternativa A — ❌ Incorreta

TF-IDF (Term Frequency–Inverse Document Frequency) é uma técnica estatística que pondera a importância de uma palavra em um documento, gerando vetores esparsos de alta dimensionalidade, não vetores densos de baixa dimensionalidade como os produzidos por word2vec.

Alternativa B — ❌ Incorreta

Tokens são as unidades básicas (palavras ou subpalavras) obtidas após a tokenização de um texto. Não são uma representação vetorial em si, mas sim os elementos que podem ser usados como entrada para modelos.

Alternativa C — ❌ Incorreta

N-gramas são sequências contíguas de n itens (palavras ou caracteres) extraídas de um texto. Eles não geram vetores de baixa dimensionalidade; geralmente são usados como features em modelos de linguagem simples.

Alternativa D — ❌ Incorreta

Bag-of-words (BoW) representa um texto como um vetor esparso contando a frequência de cada palavra no vocabulário, ignorando a ordem e o contexto. É de alta dimensionalidade e não captura semântica, ao contrário dos embeddings.

Alternativa E — ✅ Correta ⟵ GABARITO

Word embeddings são representações densas de palavras em um espaço vetorial contínuo de baixa dimensionalidade, aprendidas por modelos como word2vec. Elas codificam similaridades semânticas e sintáticas, exatamente o que Aline utiliza.

Gabarito: letra E.

Link permanente: /questoes/fg077339