Questão de Banco de Dados — Banco de Dados Textuais — FGV 2022
Banco de Dados›Banco de Dados Textuais
Código
fg055319
Banca
FGV
Órgão
TCU
Ano
2022
Nível
Superior
Cargo
Auditor Federal de Controle Externo
Um analista do TCU gostaria de aplicar um modelo de Latent Dirichlet Allocation (LDA) em um conjunto de textos.A alternativa que melhor descreve o resultado do modelo é:
Auma lista de tópicos, cada um com um título diferente;
Buma lista das palavras mais importantes no conjunto de documentos;
Ccada documento é classificado em somente um tópico, onde cada tópico é formado por uma lista de palavras;
Dcada documento possui uma distribuição de probabilidade de pertencer a algum dos tópicos, onde cada tópico é formado por uma lista de palavras e cada palavra pertence a somente um tópico;
Ecada documento possui uma distribuição de probabilidade de pertencer a algum dos tópicos, onde cada tópico é formado por uma distribuição de probabilidade sobre todas as palavras presentes nos documentos.
Revelar gabarito e comentário▾
GabaritoE — cada documento possui uma distribuição de probabilidade de pertencer a algum dos tópicos, onde cada tópico é formado por uma distribuição de probabilidade sobre todas as palavras presentes nos documentos.
Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.
Latent Dirichlet Allocation (LDA)
Gabarito: letra E. O LDA é um modelo de tópicos probabilístico em que cada documento é representado como uma mistura de tópicos e cada tópico é uma distribuição de probabilidade sobre o vocabulário. Isso está descrito exatamente na alternativa E.
A alternativa correta é a E, pois descreve com precisão o resultado do modelo LDA: cada documento possui uma distribuição de probabilidade sobre os tópicos (indicando o quanto pertence a cada um), e cada tópico é formado por uma distribuição de probabilidade sobre todas as palavras do conjunto (ou seja, um tópico é uma distribuição multinomial sobre o vocabulário). Isso reflete a essência do LDA como um modelo generativo bayesiano.
Alternativa
Descrição do resultado do LDA
Correção
A
Lista de tópicos, cada um com um título diferente
❌ Incorreta
B
Lista das palavras mais importantes no conjunto de documentos
❌ Incorreta
C
Cada documento classificado em um único tópico, cada tópico formado por lista de palavras
❌ Incorreta
D
Cada documento com distribuição de probabilidade sobre tópicos; cada tópico formado por lista de palavras; cada palavra pertence a um único tópico
❌ Incorreta
E
Cada documento com distribuição de probabilidade sobre tópicos; cada tópico formado por distribuição de probabilidade sobre todas as palavras
✅ Correta
Alternativa A — ❌ Incorreta
Afirma que o LDA gera uma lista de tópicos com títulos. Na verdade, o LDA não cria títulos; ele produz distribuições de palavras que caracterizam cada tópico, cabendo ao analista interpretá-los e rotulá-los manualmente.
Alternativa B — ❌ Incorreta
Diz que o resultado é uma lista das palavras mais importantes do conjunto de documentos. Isso corresponde a uma análise de frequência (TF-IDF, por exemplo), e não ao LDA, que modela tópicos latentes.
Alternativa C — ❌ Incorreta
Afirma que cada documento é classificado em somente um tópico. O LDA é um modelo de mistura suave (soft clustering): cada documento é uma combinação de vários tópicos, com diferentes pesos. Atribuir um único tópico por documento seria uma simplificação (como no k-means), mas não é o que o LDA produz.
Alternativa D — ❌ Incorreta
Ela acerta ao dizer que cada documento tem uma distribuição de probabilidade sobre os tópicos, mas erra ao afirmar que cada palavra pertence a somente um tópico. No LDA, palavras podem aparecer em múltiplos tópicos (cada ocorrência de palavra é atribuída a um tópico, mas a mesma palavra pode estar associada a tópicos diferentes em contextos distintos). O correto é que cada tópico seja uma distribuição de probabilidade sobre todas as palavras.
Alternativa E — ✅ Correta ⟵ GABARITO
Descreve fielmente o modelo: para cada documento, uma distribuição sobre tópicos; para cada tópico, uma distribuição sobre o vocabulário. Essa é a representação padrão do LDA.
NÃO CAIA NESSA!
A alternativa D engana ao misturar uma afirmação correta (distribuição de tópicos por documento) com uma restrição incorreta (palavras pertencendo a um único tópico). O candidato pode achar que está certo, mas o LDA permite que uma palavra contribua para vários tópicos, com diferentes probabilidades.