Questão de Algoritmos e Estrutura de Dados — Algoritmos — IV - UFG 2024
Algoritmos e Estrutura de Dados›Algoritmos
Código
qg121349
Banca
IV - UFG
Órgão
TJ-AC
Ano
2024
Nível
Superior
Cargo
CS-UFG - - Analista Judiciário - Analista de Ciência de Dados
O Processamento de Linguagem Natural (PLN) é a área da inteligência artificial que analisa, reconhece e/ou gera textos em linguagens humanas (ou natural). Para processar dados textuais, é necessário primeiramente transformá-los em valores numéricos, sendo utilizados algoritmos do tipo word embeddings, tais como glove, tf-idf, word2vector e bag of words (BOW). São características do algoritmo word2vector:
Arepresentação das palavras em um espaço vetorial de frequência de ocorrência, sem considerar a ordem que aparecem no texto.
Bcriação de um espaço de contagem baseado na relevância dos termos, considerando o contexto.
Catribuição de valor semântico às palavras de acordo com a posição que elas possuem no corpus textual, representando-as num espaço vetorial.
Dcriação de um espaço de contagem a partir da distribuição de frequência de ocorrência das palavras, considerando a ordem de ocorrência no texto.
Revelar gabarito e comentário▾
GabaritoC — atribuição de valor semântico às palavras de acordo com a posição que elas possuem no corpus textual, representando-as num espaço vetorial.
Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.
Word2Vec e técnicas de word embedding
Gabarito: letra C. O word2vec é um algoritmo de word embedding que gera vetores densos representando o significado semântico das palavras com base no contexto em que aparecem (distribuição), atribuindo a cada palavra uma representação vetorial que captura relações semânticas e sintáticas.
A questão testa a capacidade de distinguir o word2vec de outras técnicas de representação vetorial de texto, como Bag of Words, TF-IDF e abordagens baseadas apenas em contagem de frequência.
Word embeddings
1Contagem (frequência)
Bag of Words (BoW)
Ignora ordem e contexto
TF-IDF
Ponderação global, sem contexto local
N-gramas
Considera ordem
Apenas contagem
2Preditivos (contexto)
Word2Vec
Valor semântico por contexto
Vetores densos
CBOW (contexto → palavra)
Skip-gram (palavra → contexto)
LEVEL · soulevel.com.br
Alternativa A — ❌ Incorreta
Descreve o Bag of Words (BoW): representação das palavras em um espaço vetorial de frequência de ocorrência, sem considerar a ordem. No BoW, cada documento é um vetor de contagem de palavras, ignorando contexto e ordem. O word2vec, ao contrário, utiliza janelas de contexto (CBOW ou Skip-gram) para aprender vetores densos que capturam similaridade semântica.
Alternativa B — ❌ Incorreta
Descreve o TF-IDF (Term Frequency–Inverse Document Frequency): cria um espaço de contagem baseado na relevância dos termos, ponderando a frequência no documento pela raridade no corpus. O TF-IDF também é uma técnica de ponderação de termos, não preditiva. O word2vec não calcula relevância global; ele aprende representações a partir de contextos locais.
Alternativa C — ✅ Correta ⟵ GABARITO
O word2vec atribui valor semântico às palavras de acordo com a posição (contexto) que elas ocupam no corpus textual, representando-as num espaço vetorial contínuo. Durante o treinamento (CBOW prevê a palavra a partir do contexto; Skip-gram prevê o contexto a partir da palavra), o modelo ajusta os vetores para que palavras com contextos semelhantes fiquem próximas no espaço vetorial. Isso captura relações semânticas e sintáticas (ex.: vetor("rei") - vetor("homem") + vetor("mulher") ≈ vetor("rainha")).
Alternativa D — ❌ Incorreta
Descreve uma abordagem de contagem de frequência considerando a ordem, como n-gramas ou modelos de linguagem baseados em contagem (ex.: Good-Turing). Embora a ordem seja relevante, o word2vec não se baseia exclusivamente em distribuição de frequência; ele usa aprendizado preditivo com redes neurais rasas para gerar embeddings densos.
NÃO CAIA NESSA!
A banca troca as definições de diferentes técnicas. O aluno pode confundir word2vec com bag of words (A) ou com TF-IDF (B) porque todos produzem vetores de palavras. A chave é lembrar que word2vec é um modelo preditivo baseado em contexto que gera embeddings densos e semanticamente ricos, enquanto BoW e TF-IDF são métodos de contagem esparsos.
Técnica
Representação
Considera contexto?
Tipo
Bag of Words
Vetor esparso de contagem
Não (só frequência)
Contagem
TF-IDF
Vetor esparso ponderado
Parcial (IDF global)
Contagem
Word2Vec
Vetor denso (embedding)
Sim (janela local)
Preditivo
n-gramas (ordem)
Vetor esparso de contagem sequencial
Sim (ordem local)
Contagem
PEGA ESSA DICA!
Para fixar, lembre-se: word2vec = predição de contexto (CBOW/Skip-gram) → vetores densos e semânticos; Bag of Words = saco de palavras → vetor esparso sem ordem; TF-IDF = frequência × raridade → destaca termos importantes. Na prova, leia atentamente se a descrição menciona "frequência" (BoW/TF-IDF) ou "contexto semântico" (word2vec/GloVe).
Gabarito: letra C — a única alternativa que descreve corretamente o word2vec.