Questão de Engenharia de Software — Inteligencia Artificial — CESPE / CEBRASPE 2025
Engenharia de Software›Inteligencia Artificial
Código
ce219044
Banca
CESPE / CEBRASPE
Órgão
TRF - 6ª REGIÃO
Ano
2025
Nível
Superior
Cargo
Analista Judiciário – Área: Apoio Especializado – Especialidade: Análise de Sistemas de Informação
Acerca de técnicas de pré-processamento de dados não estruturados, julgue o próximo item.A técnica TF-IDF majora a importância de um termo que aparece muitas vezes em um documento e poucas vezes nos outros documentos de um mesmo corpus.
CCerto
EErrado
Revelar gabarito e comentário▾
GabaritoC — Certo
Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.
TF-IDF e importância de termos
Gabarito: Certo (C). A afirmação está correta: a técnica TF-IDF (Term Frequency – Inverse Document Frequency) atribui maior peso a um termo que aparece com alta frequência em um determinado documento (TF alto) e que aparece em poucos documentos do corpus (IDF alto, pois o logaritmo do inverso da frequência nos documentos é elevado).
A medida TF-IDF é calculada como:
onde:
é a frequência do termo no documento ;
é o número total de documentos no corpus;
é o número de documentos que contêm o termo .
Se um termo aparece muitas vezes no documento , seu é alto. Se aparece em poucos outros documentos, é pequeno, fazendo com que seja grande. Assim, o produto resulta em um valor elevado, indicando que o termo é relevante para aquele documento e discriminador no corpus. Por isso, a técnica "majora" (aumenta) a importância de termos com essa característica, exatamente como descrito no item.
TF-IDF: TF (frequência no documento) (Alta → maior peso); IDF (frequência no corpus) (Aparece em muitos docs → peso baixo, Aparece em poucos docs → peso alto); Fórmula (TF × log(n / df_t))