Pular para o conteúdo principal

Questão de Algoritmos e Estrutura de Dados — Algoritmos — IV - UFG 2024

Algoritmos e Estrutura de DadosAlgoritmos
Código
qg121358
Banca
IV - UFG
Órgão
TJ-AC
Ano
2024
Nível
Superior
Cargo
CS-UFG - - Analista Judiciário - Analista de Ciência de Dados
PV-DM (do inglês, Paragraph Vector Distributed Memory) é um método de aprendizado de máquina utilizado no processamento de dados textuais. A ideia central é prever uma palavra (de contexto) a partir de um conjunto de palavras amostrado aleatoriamente – palavras de contexto e ID de parágrafo. Quando aplicado sobre um conjunto de documentos textuais (por exemplo, os processos deferidos arquivados no TJ-AC), qual a vantagem desse método em relação ao método BOW, baseado em contagem de palavras?
  1. ATer menor custo computacional.
  2. BResultar em vetores mais compactos.
  3. CConsiderar a ordem das palavras.
  4. DTer maior expressividade dos vetores.
Revelar gabarito e comentário

GabaritoC — Considerar a ordem das palavras.

Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.

PV-DM (Paragraph Vector Distributed Memory) × Bag-of-Words

Gabarito: letra C. O PV-DM considera a ordem das palavras ao prever uma palavra-alvo a partir das palavras de contexto e do identificador do parágrafo, diferentemente do BOW, que ignora a sequência e trata o documento como um saco de palavras. Essa é a vantagem central descrita no enunciado.

O método PV-DM (uma variação do Doc2Vec) utiliza uma janela deslizante para capturar o contexto local, preservando a ordem em que as palavras aparecem. O BOW, por outro lado, produz vetores esparsos baseados apenas na frequência, sem qualquer informação de ordem.

Método

Considera ordem das palavras?

Base de representação

Custo computacional

Tipo de vetor

PV-DM

Sim (janela deslizante)

Contexto + ID do parágrafo

Alto (treinamento de rede neural)

Denso e de menor dimensionalidade

BOW

Não

Contagem de frequência

Baixo (contagem simples)

Esparso e de alta dimensionalidade

Alternativa A — ❌ Incorreta

O BOW tem menor custo computacional por ser baseado em contagem simples, enquanto o PV-DM requer treinamento de uma rede neural, sendo mais custoso. Portanto, essa não é uma vantagem do PV-DM.

Alternativa B — ❌ Incorreta

É verdade que o PV-DM gera vetores densos e de menor dimensionalidade em comparação aos vetores esparsos do BOW (que têm dimensão igual ao tamanho do vocabulário). No entanto, a pergunta foca na ideia descrita no enunciado: a previsão da palavra a partir de contexto e ID do parágrafo. A vantagem explícita é a consideração da ordem, não a compactação. Além disso, "vetores mais compactos" é uma consequência, não o objetivo principal do método descrito.

Alternativa C — ✅ Correta ⟵ GABARITO

O PV-DM, ao usar uma janela de contexto com palavras em sequência e o identificador do parágrafo, considera a ordem das palavras. O BOW não faz isso: ele apenas conta ocorrências, perdendo toda a informação de sequência. Esse é o principal diferencial apontado pela literatura.

Alternativa D — ❌ Incorreta

"Maior expressividade dos vetores" é uma afirmação genérica e subjetiva. Embora os vetores do PV-DM capturem mais informações semânticas, a vantagem específica mencionada no enunciado é a incorporação da ordem das palavras. A expressividade não é o foco da descrição do método.

PEGA ESSA DICA!

Em questões sobre representação de texto, lembre-se: modelos baseados em janela deslizante (Word2Vec, Doc2Vec) preservam ordem; modelos de saco de palavras (BOW, TF-IDF) ignoram ordem. A banca testa exatamente essa distinção.

Gabarito: letra C.

Link permanente: /questoes/qg121358