Pular para o conteúdo principal

Questão de Algoritmos e Estrutura de Dados — Estrutura de Dados — FGV 2022

Algoritmos e Estrutura de DadosEstrutura de Dados
Código
fg055317
Banca
FGV
Órgão
TCU
Ano
2022
Nível
Superior
Cargo
Auditor Federal de Controle Externo
Considere os documentos A e B a seguir.A = “Há pessoas que choram por saber que as rosas têm espinho”B = “Há outras que sorriem por saber que os espinhos têm rosas”A submatriz da matriz de TF-IDF desses dois documentos correspondente aos termos “Rosas”, “Choram” e “Sorriem”, nessa ordem, é:
  1. AImagem associada para resolução da questão
  2. BImagem associada para resolução da questão
  3. CImagem associada para resolução da questão
  4. DImagem associada para resolução da questão
  5. EImagem associada para resolução da questão
Revelar gabarito e comentário

GabaritoC — [imagem]

Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.

Cálculo de TF-IDF

Gabarito: letra C. O valor de TF-IDF é calculado pelo produto da frequência do termo no documento (TF) pela frequência inversa do documento (IDF). Para os documentos A e B, com um total de N=2N=2 documentos, o cálculo para os termos "Rosas", "Choram" e "Sorriem" resulta na matriz apresentada na letra C.

Para resolver, primeiro identificamos a frequência de cada termo em cada documento:

  • Documento A: "Há pessoas que choram por saber que as rosas têm espinho" (11 palavras). Termos: "Rosas" (1), "Choram" (1), "Sorriem" (0).

  • Documento B: "Há outras que sorriem por saber que os espinhos têm rosas" (11 palavras). Termos: "Rosas" (1), "Choram" (0), "Sorriem" (1).

O cálculo do TF (frequência do termo / total de palavras no documento) e do IDF (log(N/df)\log(N/df), onde dfdf é o número de documentos que contêm o termo) é:

  • "Rosas": aparece em A e B (df=2df=2). IDF=log(2/2)=log(1)=0IDF = \log(2/2) = \log(1) = 0.

  • "Choram": aparece em A (df=1df=1). IDF=log(2/1)=log(2)IDF = \log(2/1) = \log(2).

  • "Sorriem": aparece em B (df=1df=1). IDF=log(2/1)=log(2)IDF = \log(2/1) = \log(2).

Montando a matriz (linhas = documentos A e B; colunas = "Rosas", "Choram", "Sorriem"):

  • Linha A: [TF("Rosas")IDF("Rosas"), TF("Choram")IDF("Choram"), TF("Sorriem")IDF("Sorriem")] = [(1/11)0, (1/11)log(2), (0/11)log(2)] = [0, log(2)/11, 0].

  • Linha B: [TF("Rosas")IDF("Rosas"), TF("Choram")IDF("Choram"), TF("Sorriem")IDF("Sorriem")] = [(1/11)0, (0/11)log(2), (1/11)log(2)] = [0, 0, log(2)/11].

  1. 1Frequência dos termos (TF)
  2. 2Frequência inversa (IDF)
  3. 3Produto TF × IDF
  4. 4Montar matriz resultado
LEVEL · soulevel.com.br

Alternativa C — ✅ Correta ⟵ GABARITO

Esta alternativa apresenta exatamente a matriz calculada: a primeira linha contém os valores para o documento A (0, log(2)/11, 0) e a segunda linha para o documento B (0, 0, log(2)/11).

PEGA ESSA DICA!

Lembre-se que o IDF penaliza termos que aparecem em muitos documentos. Como "Rosas" aparece em ambos, seu IDF é zero, anulando o valor de TF-IDF para esse termo em qualquer documento.

Gabarito: letra C

Link permanente: /questoes/fg055317