Pular para o conteúdo principal

Questão de Algoritmos e Estrutura de Dados — Algoritmos — IV - UFG 2024

Algoritmos e Estrutura de DadosAlgoritmos
Código
qg121349
Banca
IV - UFG
Órgão
TJ-AC
Ano
2024
Nível
Superior
Cargo
CS-UFG - - Analista Judiciário - Analista de Ciência de Dados
O Processamento de Linguagem Natural (PLN) é a área da inteligência artificial que analisa, reconhece e/ou gera textos em linguagens humanas (ou natural). Para processar dados textuais, é necessário primeiramente transformá-los em valores numéricos, sendo utilizados algoritmos do tipo word embeddings, tais como glove, tf-idf, word2vector e bag of words (BOW). São características do algoritmo word2vector:
  1. Arepresentação das palavras em um espaço vetorial de frequência de ocorrência, sem considerar a ordem que aparecem no texto.
  2. Bcriação de um espaço de contagem baseado na relevância dos termos, considerando o contexto.
  3. Catribuição de valor semântico às palavras de acordo com a posição que elas possuem no corpus textual, representando-as num espaço vetorial.
  4. Dcriação de um espaço de contagem a partir da distribuição de frequência de ocorrência das palavras, considerando a ordem de ocorrência no texto.
Revelar gabarito e comentário

GabaritoC — atribuição de valor semântico às palavras de acordo com a posição que elas possuem no corpus textual, representando-as num espaço vetorial.

Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.

Word2Vec e técnicas de word embedding

Gabarito: letra C. O word2vec é um algoritmo de word embedding que gera vetores densos representando o significado semântico das palavras com base no contexto em que aparecem (distribuição), atribuindo a cada palavra uma representação vetorial que captura relações semânticas e sintáticas.

A questão testa a capacidade de distinguir o word2vec de outras técnicas de representação vetorial de texto, como Bag of Words, TF-IDF e abordagens baseadas apenas em contagem de frequência.

Word embeddings
  • 1Contagem (frequência)
    • Bag of Words (BoW)
      • Ignora ordem e contexto
    • TF-IDF
      • Ponderação global, sem contexto local
    • N-gramas
      • Considera ordem
      • Apenas contagem
  • 2Preditivos (contexto)
    • Word2Vec
      • Valor semântico por contexto
      • Vetores densos
      • CBOW (contexto → palavra)
      • Skip-gram (palavra → contexto)
LEVEL · soulevel.com.br

Alternativa A — ❌ Incorreta

Descreve o Bag of Words (BoW): representação das palavras em um espaço vetorial de frequência de ocorrência, sem considerar a ordem. No BoW, cada documento é um vetor de contagem de palavras, ignorando contexto e ordem. O word2vec, ao contrário, utiliza janelas de contexto (CBOW ou Skip-gram) para aprender vetores densos que capturam similaridade semântica.

Alternativa B — ❌ Incorreta

Descreve o TF-IDF (Term Frequency–Inverse Document Frequency): cria um espaço de contagem baseado na relevância dos termos, ponderando a frequência no documento pela raridade no corpus. O TF-IDF também é uma técnica de ponderação de termos, não preditiva. O word2vec não calcula relevância global; ele aprende representações a partir de contextos locais.

Alternativa C — ✅ Correta ⟵ GABARITO

O word2vec atribui valor semântico às palavras de acordo com a posição (contexto) que elas ocupam no corpus textual, representando-as num espaço vetorial contínuo. Durante o treinamento (CBOW prevê a palavra a partir do contexto; Skip-gram prevê o contexto a partir da palavra), o modelo ajusta os vetores para que palavras com contextos semelhantes fiquem próximas no espaço vetorial. Isso captura relações semânticas e sintáticas (ex.: vetor("rei") - vetor("homem") + vetor("mulher") ≈ vetor("rainha")).

Alternativa D — ❌ Incorreta

Descreve uma abordagem de contagem de frequência considerando a ordem, como n-gramas ou modelos de linguagem baseados em contagem (ex.: Good-Turing). Embora a ordem seja relevante, o word2vec não se baseia exclusivamente em distribuição de frequência; ele usa aprendizado preditivo com redes neurais rasas para gerar embeddings densos.

NÃO CAIA NESSA!

A banca troca as definições de diferentes técnicas. O aluno pode confundir word2vec com bag of words (A) ou com TF-IDF (B) porque todos produzem vetores de palavras. A chave é lembrar que word2vec é um modelo preditivo baseado em contexto que gera embeddings densos e semanticamente ricos, enquanto BoW e TF-IDF são métodos de contagem esparsos.

Técnica

Representação

Considera contexto?

Tipo

Bag of Words

Vetor esparso de contagem

Não (só frequência)

Contagem

TF-IDF

Vetor esparso ponderado

Parcial (IDF global)

Contagem

Word2Vec

Vetor denso (embedding)

Sim (janela local)

Preditivo

n-gramas (ordem)

Vetor esparso de contagem sequencial

Sim (ordem local)

Contagem

PEGA ESSA DICA!

Para fixar, lembre-se: word2vec = predição de contexto (CBOW/Skip-gram) → vetores densos e semânticos; Bag of Words = saco de palavras → vetor esparso sem ordem; TF-IDF = frequência × raridade → destaca termos importantes. Na prova, leia atentamente se a descrição menciona "frequência" (BoW/TF-IDF) ou "contexto semântico" (word2vec/GloVe).

Gabarito: letra C — a única alternativa que descreve corretamente o word2vec.

Link permanente: /questoes/qg121349