Pular para o conteúdo principal

Questão de Algoritmos e Estrutura de Dados — Algoritmos — IV - UFG 2024

Algoritmos e Estrutura de DadosAlgoritmos
Código
qg121348
Banca
IV - UFG
Órgão
TJ-AC
Ano
2024
Nível
Superior
Cargo
CS-UFG - - Analista Judiciário - Analista de Ciência de Dados
O LDA (do inglês, Latent Dirichlet Allocation) é um modelo de aprendizado não supervisionado e estatístico utilizado no Processamento de Linguagem Natural (PLN). No processo de treinamento, o modelo LDA gera tópicos, sendo que cada tópico incorpora uma quantidade de palavras. Sob a mesma lógica, o resultado da aplicação do LDA sobre um conjunto de documentos textuais pode ser resumido como:
  1. Auma lista de tópicos, sendo cada um composto pelas palavras mais relevantes do conjunto de documentos, em termos de frequência de ocorrência.
  2. Bum tópico por documento, sendo cada tópico formado pelas palavras mais frequentes do documento.
  3. Cuma distribuição de probabilidade para cada documento, que indica o pertencimento do mesmo a algum dos tópicos, sendo cada tópico é formado por uma lista de palavras.
  4. Duma distribuição de probabilidade para cada documento, que indica a pertinência do mesmo a algum dos tópicos e onde cada tópico é formado por uma distribuição de probabilidade das palavras presentes nos documentos.
Revelar gabarito e comentário

GabaritoD — uma distribuição de probabilidade para cada documento, que indica a pertinência do mesmo a algum dos tópicos e onde cada tópico é formado por uma distribuição de probabilidade das palavras presentes nos documentos.

Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.

Latent Dirichlet Allocation (LDA)

Gabarito: letra D. O LDA é um modelo probabilístico generativo que, para cada documento, produz uma distribuição de probabilidade sobre tópicos, e cada tópico é uma distribuição de probabilidade sobre palavras. A alternativa D descreve exatamente isso: "uma distribuição de probabilidade para cada documento, que indica a pertinência do mesmo a algum dos tópicos e onde cada tópico é formado por uma distribuição de probabilidade das palavras presentes nos documentos".

O LDA é um método não supervisionado de modelagem de tópicos, que assume que cada documento é uma mistura de tópicos e cada tópico é uma mistura de palavras, conforme o material de apoio: "O LDA se baseia na ideia de que cada tópico é uma mistura de conjuntos de palavras e que cada documento é uma mistura de um conjunto de tópicos."

Alternativa A — ❌ Incorreta

Afirma que cada tópico é composto pelas palavras mais relevantes em termos de frequência de ocorrência. O LDA não se baseia apenas na frequência; ele modela tópicos como distribuições de probabilidade sobre o vocabulário, e não como listas de palavras mais frequentes. Essa descrição se aproxima mais de técnicas como TF-IDF.

Alternativa B — ❌ Incorreta

Diz que o resultado é "um tópico por documento", sendo cada tópico formado pelas palavras mais frequentes do documento. Na verdade, cada documento possui uma distribuição sobre todos os tópicos (não apenas um), e os tópicos são distribuições globais, não específicas de um documento.

Alternativa C — ❌ Incorreta

Esta alternativa quase acerta, mas comete um erro sutil: afirma que cada tópico é formado por "uma lista de palavras". No LDA, cada tópico é uma distribuição de probabilidade sobre as palavras, não uma lista. A palavra "lista" sugere uma seleção discreta, enquanto o modelo é probabilístico e contínuo.

Alternativa D — ✅ Correta ⟵ GABARITO

Descreve corretamente o resultado: distribuição de probabilidade para cada documento sobre tópicos, e cada tópico como distribuição de probabilidade sobre as palavras. Isso reflete a essência do LDA como modelo generativo.

NÃO CAIA NESSA!

A alternativa C pode enganar por mencionar "distribuição de probabilidade para cada documento", mas troca "distribuição de probabilidade" por "lista de palavras" ao descrever os tópicos. A banca explora essa diferença entre uma lista (conjunto fixo) e uma distribuição (probabilidades sobre todo o vocabulário).

Gabarito: letra D.

Link permanente: /questoes/qg121348