Pular para o conteúdo principal

Questão de Banco de Dados — Data Mining — CESPE / CEBRASPE 2026

Banco de DadosData Mining
Código
ce228766
Banca
CESPE / CEBRASPE
Órgão
TCE-MG
Ano
2026
Nível
Superior
Cargo
Analista de Controle Externo - Especialidade: Ciência da Computação
Assinale a opção correta acerca do modelo LDA (latent dirichlet allocation), amplamente utilizado para extração de tópicos em tarefas de mineração de textos.
  1. AO LDA assume que cada documento é gerado por uma combinação de tópicos, e que cada tópico corresponde a uma distribuição de probabilidade sobre palavras.
  2. BO LDA é um modelo supervisionado que aprende tópicos por meio de documentos previamente rotulados.
  3. CNo LDA, cada documento pertence a um único tópico, que deve ser explicitamente indicado pelo modelo.
  4. DO LDA utiliza variáveis latentes que podem ser estimadas diretamente a partir das frequências observadas, sem necessidade de inferência probabilística.
  5. EO LDA gera automaticamente o número ideal de tópicos com base em máxima verossimilhança, sem necessidade de definição prévia.
Revelar gabarito e comentário

GabaritoA — O LDA assume que cada documento é gerado por uma combinação de tópicos, e que cada tópico corresponde a uma distribuição de probabilidade sobre palavras.

Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.

LDA (Latent Dirichlet Allocation) – Análise de Tópicos

Gabarito: Letra A. O LDA é um modelo probabilístico não supervisionado que assume que cada documento é uma mistura de tópicos, e cada tópico é uma distribuição sobre palavras. Essa característica fundamental está correta na alternativa A e é a base do algoritmo.

A banca testa o conhecimento sobre o funcionamento do LDA, um dos métodos mais populares para modelagem de tópicos em mineração de textos. As demais alternativas distorcem propositalmente conceitos-chave.

1Modelo
Não supervisionado
Probabilístico gerativo
2Documento
Mistura de tópicos
Múltiplos tópicos (proporções)
3Tópico
Distribuição sobre palavras
Variável latente
4Inferência
Amostragem de Gibbs
Inferência variacional
5Hiperparâmetros
Nº de tópicos (K) definido pelo usuário
Não é automático
LDA (Latent Dirichlet Allocation)
LEVELsoulevel.com.br
LDA (Latent Dirichlet Allocation): Modelo (Não supervisionado, Probabilístico gerativo); Documento (Mistura de tópicos, Múltiplos tópicos (proporções)); Tópico (Distribuição sobre palavras, Variável latente); Inferência (Amostragem de Gibbs, Inferência variacional); Hiperparâmetros (Nº de tópicos (K) definido pelo usuário, Não é automático)

Alternativa A — ✅ Correta ⟵ GABARITO

A descrição é precisa: o LDA é um modelo gerativo não supervisionado. Cada documento é representado como uma combinação (mistura) de tópicos latentes, e cada tópico é uma distribuição de probabilidade sobre o vocabulário de palavras. Esse é o pressuposto central do modelo, conforme a publicação original de Blei, Ng e Jordan (2003).

Alternativa B — ❌ Incorreta

Afirma que o LDA é supervisionado. Na verdade, o LDA é um modelo não supervisionado: ele descobre tópicos a partir apenas dos documentos, sem necessidade de rótulos prévios. Modelos supervisionados de tópicos, como o sLDA (supervised Latent Dirichlet Allocation), existem, mas o LDA clássico é não supervisionado.

Alternativa C — ❌ Incorreta

Afirma que cada documento pertence a um único tópico. O LDA permite que cada documento seja composto por múltiplos tópicos com diferentes proporções (por exemplo, 60% esportes, 40% política). A atribuição a um único tópico é característica de modelos como o mixture of unigrams, não do LDA. Além disso, os tópicos são variáveis latentes inferidas, não explicitamente indicadas.

Alternativa D — ❌ Incorreta

Afirma que as variáveis latentes podem ser estimadas diretamente das frequências observadas. Na prática, a inferência no LDA é computacionalmente complexa e requer métodos aproximados, como amostragem de Gibbs ou inferência variacional. Não há solução analítica direta.

Alternativa E — ❌ Incorreta

Afirma que o LDA determina automaticamente o número ideal de tópicos. Na verdade, o número de tópicos (K) é um hiperparâmetro definido pelo usuário antes da execução. Existem heurísticas para escolher (K) (como perplexidade, coerência de tópicos), mas o modelo não o gera automaticamente por máxima verossimilhança.

NÃO CAIA NESSA!

A banca inverte características de modelos supervisionados vs. não supervisionados (alternativa B) e confunde a modelagem de tópico único com a de mistura (alternativa C). Além disso, tenta fazer o candidato acreditar que o LDA dispensa inferência probabilística (D) ou define tópicos sozinho (E). Fique atento: LDA é não supervisionado, usa mistura de tópicos e exige inferência aproximada.

Gabarito: Letra A

Link permanente: /questoes/ce228766