Pular para o conteúdo principal

Questão de Sistemas de Informação — Gerenciamento de Conteúdo — FGV 2022

Sistemas de InformaçãoGerenciamento de Conteúdo
Código
fg055493
Banca
FGV
Órgão
TJ-DFT
Ano
2022
Nível
Superior
Cargo
Analista Judiciário - Análise de Dados
Um cientista de dados está ponderando sobre a aplicação de um modelo Paragraph Vector (PV-DM) sobre uma coleção de documentos, no lugar de usar a média de vetores de palavras em cada documento.Uma razão pela qual ele deveria aplicar PV-DM, e uma contrapartida à sua aplicação, são, respectivamente:
  1. Aconsidera a ordem das palavras; maior custo computacional;
  2. Bmenor custo computacional; menor precisão;
  3. Cvetores mais compactos; menor expressividade dos vetores;
  4. Dmaior expressividade dos vetores; não considera a ordem das palavras;
  5. Evetores mais densos, não considera a ordem das sentenças.
Revelar gabarito e comentário

GabaritoA — considera a ordem das palavras; maior custo computacional;

Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.

Paragraph Vector (PV-DM) – Vantagens e Desvantagens

Gabarito: alternativa A. O modelo PV-DM (Paragraph Vector – Distributed Memory) considera a ordem das palavras no contexto, capturando relações sintáticas e semânticas que a simples média de vetores de palavras ignora. Essa vantagem, porém, vem com um maior custo computacional, pois o treinamento envolve a otimização de vetores de documento junto com os vetores de palavras.

Critério

PV-DM (Paragraph Vector – Distributed Memory)

Média de Vetores de Palavras

Consideração da ordem das palavras

Sim (captura contexto local)

Não (bag-of-words)

Custo computacional

Maior (treinamento conjunto)

Menor (apenas média)

Expressividade dos vetores

Maior (relações sintáticas e semânticas)

Menor (perde ordem)

PV-DM vs. Média de vetores
  • 1Considera ordem das palavras
  • 2Maior custo computacional
LEVEL · soulevel.com.br

Alternativa A — ✅ Correta ⟵ GABARITO

Exatamente como descreve: a razão para usar PV-DM é que ele considera a ordem das palavras (ao contrário da bag-of-words), e a contrapartida é o maior custo computacional devido ao aprendizado conjunto.

Alternativa B — ❌ Incorreta

Afirma que PV-DM tem menor custo computacional e menor precisão. Na verdade, o custo é maior (não menor) e a precisão tende a ser maior (não menor) do que a média de vetores.

Alternativa C — ❌ Incorreta

Diz que os vetores são mais compactos e com menor expressividade. PV-DM não produz vetores mais compactos; o tamanho é comparável. Além disso, a expressividade é maior, não menor.

Alternativa D — ❌ Incorreta

Apresenta a primeira parte como correta (maior expressividade), mas a segunda parte é falsa: PV-DM considera a ordem das palavras, não a ignora. A alternativa troca o benefício real por uma desvantagem inventada.

Alternativa E — ❌ Incorreta

Fala em vetores mais densos (não é uma característica peculiar) e afirma que o modelo não considera a ordem das sentenças. PV-DM considera a ordem das palavras dentro da janela de contexto, não das sentenças como um todo, mas o erro principal é que ele considera a ordem local, o que a alternativa nega.

NÃO CAIA NESSA!

Para questões sobre representação de documentos, lembre-se: modelos baseados em média de vetores (como word2vec + média) são mais rápidos, mas perdem a ordem; PV-DM (e modelos sequenciais como RNNs) capturam ordem com maior custo. A banca costuma inverter esses pares nas alternativas.

Gabarito: letra A

Link permanente: /questoes/fg055493