Questão de Algoritmos e Estrutura de Dados — Algoritmos — IV - UFG 2024
Algoritmos e Estrutura de Dados›Algoritmos
Código
qg121358
Banca
IV - UFG
Órgão
TJ-AC
Ano
2024
Nível
Superior
Cargo
CS-UFG - - Analista Judiciário - Analista de Ciência de Dados
PV-DM (do inglês, Paragraph Vector Distributed Memory) é um método de aprendizado de máquina utilizado no processamento de dados textuais. A ideia central é prever uma palavra (de contexto) a partir de um conjunto de palavras amostrado aleatoriamente – palavras de contexto e ID de parágrafo. Quando aplicado sobre um conjunto de documentos textuais (por exemplo, os processos deferidos arquivados no TJ-AC), qual a vantagem desse método em relação ao método BOW, baseado em contagem de palavras?
ATer menor custo computacional.
BResultar em vetores mais compactos.
CConsiderar a ordem das palavras.
DTer maior expressividade dos vetores.
Revelar gabarito e comentário▾
GabaritoC — Considerar a ordem das palavras.
Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.
Gabarito: letra C. O PV-DM considera a ordem das palavras ao prever uma palavra-alvo a partir das palavras de contexto e do identificador do parágrafo, diferentemente do BOW, que ignora a sequência e trata o documento como um saco de palavras. Essa é a vantagem central descrita no enunciado.
O método PV-DM (uma variação do Doc2Vec) utiliza uma janela deslizante para capturar o contexto local, preservando a ordem em que as palavras aparecem. O BOW, por outro lado, produz vetores esparsos baseados apenas na frequência, sem qualquer informação de ordem.
Método
Considera ordem das palavras?
Base de representação
Custo computacional
Tipo de vetor
PV-DM
Sim (janela deslizante)
Contexto + ID do parágrafo
Alto (treinamento de rede neural)
Denso e de menor dimensionalidade
BOW
Não
Contagem de frequência
Baixo (contagem simples)
Esparso e de alta dimensionalidade
Alternativa A — ❌ Incorreta
O BOW tem menor custo computacional por ser baseado em contagem simples, enquanto o PV-DM requer treinamento de uma rede neural, sendo mais custoso. Portanto, essa não é uma vantagem do PV-DM.
Alternativa B — ❌ Incorreta
É verdade que o PV-DM gera vetores densos e de menor dimensionalidade em comparação aos vetores esparsos do BOW (que têm dimensão igual ao tamanho do vocabulário). No entanto, a pergunta foca na ideia descrita no enunciado: a previsão da palavra a partir de contexto e ID do parágrafo. A vantagem explícita é a consideração da ordem, não a compactação. Além disso, "vetores mais compactos" é uma consequência, não o objetivo principal do método descrito.
Alternativa C — ✅ Correta ⟵ GABARITO
O PV-DM, ao usar uma janela de contexto com palavras em sequência e o identificador do parágrafo, considera a ordem das palavras. O BOW não faz isso: ele apenas conta ocorrências, perdendo toda a informação de sequência. Esse é o principal diferencial apontado pela literatura.
Alternativa D — ❌ Incorreta
"Maior expressividade dos vetores" é uma afirmação genérica e subjetiva. Embora os vetores do PV-DM capturem mais informações semânticas, a vantagem específica mencionada no enunciado é a incorporação da ordem das palavras. A expressividade não é o foco da descrição do método.
PEGA ESSA DICA!
Em questões sobre representação de texto, lembre-se: modelos baseados em janela deslizante (Word2Vec, Doc2Vec) preservam ordem; modelos de saco de palavras (BOW, TF-IDF) ignoram ordem. A banca testa exatamente essa distinção.