Pular para o conteúdo principal

Questão de Engenharia de Software — Inteligencia Artificial — CESPE / CEBRASPE 2025

Engenharia de SoftwareInteligencia Artificial
Código
ce219044
Banca
CESPE / CEBRASPE
Órgão
TRF - 6ª REGIÃO
Ano
2025
Nível
Superior
Cargo
Analista Judiciário – Área: Apoio Especializado – Especialidade: Análise de Sistemas de Informação
Acerca de técnicas de pré-processamento de dados não estruturados, julgue o próximo item.A técnica TF-IDF majora a importância de um termo que aparece muitas vezes em um documento e poucas vezes nos outros documentos de um mesmo corpus.
  1. CCerto
  2. EErrado
Revelar gabarito e comentário

GabaritoC — Certo

Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.

TF-IDF e importância de termos

Gabarito: Certo (C). A afirmação está correta: a técnica TF-IDF (Term Frequency – Inverse Document Frequency) atribui maior peso a um termo que aparece com alta frequência em um determinado documento (TF alto) e que aparece em poucos documentos do corpus (IDF alto, pois o logaritmo do inverso da frequência nos documentos é elevado).

A medida TF-IDF é calculada como:

TF-IDFt,d=TFt,d×log(ndft)\text{TF-IDF}_{t,d} = \text{TF}_{t,d} \times \log\left(\frac{n}{\text{df}_t}\right)

onde:

  • TFt,d\text{TF}_{t,d} é a frequência do termo tt no documento dd;

  • nn é o número total de documentos no corpus;

  • dft\text{df}_t é o número de documentos que contêm o termo tt.

Se um termo aparece muitas vezes no documento dd, seu TF\text{TF} é alto. Se aparece em poucos outros documentos, dft\text{df}_t é pequeno, fazendo com que log(n/dft)\log(n/\text{df}_t) seja grande. Assim, o produto resulta em um valor elevado, indicando que o termo é relevante para aquele documento e discriminador no corpus. Por isso, a técnica "majora" (aumenta) a importância de termos com essa característica, exatamente como descrito no item.

1TF (frequência no documento)
Alta → maior peso
2IDF (frequência no corpus)
Aparece em muitos docs → peso baixo
Aparece em poucos docs → peso alto
3Fórmula
TF × log(n / df_t)
TF-IDF
LEVELsoulevel.com.br
TF-IDF: TF (frequência no documento) (Alta → maior peso); IDF (frequência no corpus) (Aparece em muitos docs → peso baixo, Aparece em poucos docs → peso alto); Fórmula (TF × log(n / df_t))

CERTO.

Link permanente: /questoes/ce219044