Questão de Banco de Dados — Data Mining — CESPE / CEBRASPE 2026
Banco de Dados›Data Mining
Código
ce228766
Banca
CESPE / CEBRASPE
Órgão
TCE-MG
Ano
2026
Nível
Superior
Cargo
Analista de Controle Externo - Especialidade: Ciência da Computação
Assinale a opção correta acerca do modelo LDA (latent dirichlet allocation), amplamente utilizado para extração de tópicos em tarefas de mineração de textos.
AO LDA assume que cada documento é gerado por uma combinação de tópicos, e que cada tópico corresponde a uma distribuição de probabilidade sobre palavras.
BO LDA é um modelo supervisionado que aprende tópicos por meio de documentos previamente rotulados.
CNo LDA, cada documento pertence a um único tópico, que deve ser explicitamente indicado pelo modelo.
DO LDA utiliza variáveis latentes que podem ser estimadas diretamente a partir das frequências observadas, sem necessidade de inferência probabilística.
EO LDA gera automaticamente o número ideal de tópicos com base em máxima verossimilhança, sem necessidade de definição prévia.
Revelar gabarito e comentário▾
GabaritoA — O LDA assume que cada documento é gerado por uma combinação de tópicos, e que cada tópico corresponde a uma distribuição de probabilidade sobre palavras.
Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.
LDA (Latent Dirichlet Allocation) – Análise de Tópicos
Gabarito: Letra A. O LDA é um modelo probabilístico não supervisionado que assume que cada documento é uma mistura de tópicos, e cada tópico é uma distribuição sobre palavras. Essa característica fundamental está correta na alternativa A e é a base do algoritmo.
A banca testa o conhecimento sobre o funcionamento do LDA, um dos métodos mais populares para modelagem de tópicos em mineração de textos. As demais alternativas distorcem propositalmente conceitos-chave.
LDA (Latent Dirichlet Allocation): Modelo (Não supervisionado, Probabilístico gerativo); Documento (Mistura de tópicos, Múltiplos tópicos (proporções)); Tópico (Distribuição sobre palavras, Variável latente); Inferência (Amostragem de Gibbs, Inferência variacional); Hiperparâmetros (Nº de tópicos (K) definido pelo usuário, Não é automático)
Alternativa A — ✅ Correta ⟵ GABARITO
A descrição é precisa: o LDA é um modelo gerativo não supervisionado. Cada documento é representado como uma combinação (mistura) de tópicos latentes, e cada tópico é uma distribuição de probabilidade sobre o vocabulário de palavras. Esse é o pressuposto central do modelo, conforme a publicação original de Blei, Ng e Jordan (2003).
Alternativa B — ❌ Incorreta
Afirma que o LDA é supervisionado. Na verdade, o LDA é um modelo não supervisionado: ele descobre tópicos a partir apenas dos documentos, sem necessidade de rótulos prévios. Modelos supervisionados de tópicos, como o sLDA (supervised Latent Dirichlet Allocation), existem, mas o LDA clássico é não supervisionado.
Alternativa C — ❌ Incorreta
Afirma que cada documento pertence a um único tópico. O LDA permite que cada documento seja composto por múltiplos tópicos com diferentes proporções (por exemplo, 60% esportes, 40% política). A atribuição a um único tópico é característica de modelos como o mixture of unigrams, não do LDA. Além disso, os tópicos são variáveis latentes inferidas, não explicitamente indicadas.
Alternativa D — ❌ Incorreta
Afirma que as variáveis latentes podem ser estimadas diretamente das frequências observadas. Na prática, a inferência no LDA é computacionalmente complexa e requer métodos aproximados, como amostragem de Gibbs ou inferência variacional. Não há solução analítica direta.
Alternativa E — ❌ Incorreta
Afirma que o LDA determina automaticamente o número ideal de tópicos. Na verdade, o número de tópicos (K) é um hiperparâmetro definido pelo usuário antes da execução. Existem heurísticas para escolher (K) (como perplexidade, coerência de tópicos), mas o modelo não o gera automaticamente por máxima verossimilhança.
NÃO CAIA NESSA!
A banca inverte características de modelos supervisionados vs. não supervisionados (alternativa B) e confunde a modelagem de tópico único com a de mistura (alternativa C). Além disso, tenta fazer o candidato acreditar que o LDA dispensa inferência probabilística (D) ou define tópicos sozinho (E). Fique atento: LDA é não supervisionado, usa mistura de tópicos e exige inferência aproximada.