Questão de Sistemas de Informação — Gerenciamento de Conteúdo — FGV 2022
Sistemas de Informação›Gerenciamento de Conteúdo
Código
fg055493
Banca
FGV
Órgão
TJ-DFT
Ano
2022
Nível
Superior
Cargo
Analista Judiciário - Análise de Dados
Um cientista de dados está ponderando sobre a aplicação de um modelo Paragraph Vector (PV-DM) sobre uma coleção de documentos, no lugar de usar a média de vetores de palavras em cada documento.Uma razão pela qual ele deveria aplicar PV-DM, e uma contrapartida à sua aplicação, são, respectivamente:
Aconsidera a ordem das palavras; maior custo computacional;
Bmenor custo computacional; menor precisão;
Cvetores mais compactos; menor expressividade dos vetores;
Dmaior expressividade dos vetores; não considera a ordem das palavras;
Evetores mais densos, não considera a ordem das sentenças.
Revelar gabarito e comentário▾
GabaritoA — considera a ordem das palavras; maior custo computacional;
Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.
Paragraph Vector (PV-DM) – Vantagens e Desvantagens
Gabarito: alternativa A. O modelo PV-DM (Paragraph Vector – Distributed Memory) considera a ordem das palavras no contexto, capturando relações sintáticas e semânticas que a simples média de vetores de palavras ignora. Essa vantagem, porém, vem com um maior custo computacional, pois o treinamento envolve a otimização de vetores de documento junto com os vetores de palavras.
Critério
PV-DM (Paragraph Vector – Distributed Memory)
Média de Vetores de Palavras
Consideração da ordem das palavras
Sim (captura contexto local)
Não (bag-of-words)
Custo computacional
Maior (treinamento conjunto)
Menor (apenas média)
Expressividade dos vetores
Maior (relações sintáticas e semânticas)
Menor (perde ordem)
PV-DM vs. Média de vetores
1Considera ordem das palavras
2Maior custo computacional
LEVEL · soulevel.com.br
Alternativa A — ✅ Correta ⟵ GABARITO
Exatamente como descreve: a razão para usar PV-DM é que ele considera a ordem das palavras (ao contrário da bag-of-words), e a contrapartida é o maior custo computacional devido ao aprendizado conjunto.
Alternativa B — ❌ Incorreta
Afirma que PV-DM tem menor custo computacional e menor precisão. Na verdade, o custo é maior (não menor) e a precisão tende a ser maior (não menor) do que a média de vetores.
Alternativa C — ❌ Incorreta
Diz que os vetores são mais compactos e com menor expressividade. PV-DM não produz vetores mais compactos; o tamanho é comparável. Além disso, a expressividade é maior, não menor.
Alternativa D — ❌ Incorreta
Apresenta a primeira parte como correta (maior expressividade), mas a segunda parte é falsa: PV-DM considera a ordem das palavras, não a ignora. A alternativa troca o benefício real por uma desvantagem inventada.
Alternativa E — ❌ Incorreta
Fala em vetores mais densos (não é uma característica peculiar) e afirma que o modelo não considera a ordem das sentenças. PV-DM considera a ordem das palavras dentro da janela de contexto, não das sentenças como um todo, mas o erro principal é que ele considera a ordem local, o que a alternativa nega.
NÃO CAIA NESSA!
Para questões sobre representação de documentos, lembre-se: modelos baseados em média de vetores (como word2vec + média) são mais rápidos, mas perdem a ordem; PV-DM (e modelos sequenciais como RNNs) capturam ordem com maior custo. A banca costuma inverter esses pares nas alternativas.