Questão de Algoritmos e Estrutura de Dados — Estrutura de Dados — FGV 2022
- Código
- fg055317
- Banca
- FGV
- Órgão
- TCU
- Ano
- 2022
- Nível
- Superior
- Cargo
- Auditor Federal de Controle Externo
- A

- B

- C

- D

- E






GabaritoC — [imagem]
Gabarito: letra C. O valor de TF-IDF é calculado pelo produto da frequência do termo no documento (TF) pela frequência inversa do documento (IDF). Para os documentos A e B, com um total de documentos, o cálculo para os termos "Rosas", "Choram" e "Sorriem" resulta na matriz apresentada na letra C.
Para resolver, primeiro identificamos a frequência de cada termo em cada documento:
Documento A: "Há pessoas que choram por saber que as rosas têm espinho" (11 palavras). Termos: "Rosas" (1), "Choram" (1), "Sorriem" (0).
Documento B: "Há outras que sorriem por saber que os espinhos têm rosas" (11 palavras). Termos: "Rosas" (1), "Choram" (0), "Sorriem" (1).
O cálculo do TF (frequência do termo / total de palavras no documento) e do IDF (, onde é o número de documentos que contêm o termo) é:
"Rosas": aparece em A e B (). .
"Choram": aparece em A (). .
"Sorriem": aparece em B (). .
Montando a matriz (linhas = documentos A e B; colunas = "Rosas", "Choram", "Sorriem"):
Linha A: [TF("Rosas")IDF("Rosas"), TF("Choram")IDF("Choram"), TF("Sorriem")IDF("Sorriem")] = [(1/11)0, (1/11)log(2), (0/11)log(2)] = [0, log(2)/11, 0].
Linha B: [TF("Rosas")IDF("Rosas"), TF("Choram")IDF("Choram"), TF("Sorriem")IDF("Sorriem")] = [(1/11)0, (0/11)log(2), (1/11)log(2)] = [0, 0, log(2)/11].
Esta alternativa apresenta exatamente a matriz calculada: a primeira linha contém os valores para o documento A (0, log(2)/11, 0) e a segunda linha para o documento B (0, 0, log(2)/11).
Lembre-se que o IDF penaliza termos que aparecem em muitos documentos. Como "Rosas" aparece em ambos, seu IDF é zero, anulando o valor de TF-IDF para esse termo em qualquer documento.
Gabarito: letra C
Link permanente: /questoes/fg055317