Questão de Banco de Dados — Banco de Dados Textuais — Quadrix 2025
- Código
- qg603659
- Banca
- Quadrix
- Órgão
- SEDF
- Ano
- 2025
- Nível
- Superior
- Cargo
- Professor de Educação Básica: Informática
- CCerto
- EErrado
GabaritoC — Certo
✅ CERTO. A afirmação está correta: índices invertidos em sistemas de recuperação de informação não se limitam a mapear termos para documentos — eles armazenam, na posting list, informações adicionais como a frequência do termo em cada documento (TF), que são essenciais para algoritmos de ranqueamento. Essa é a estrutura clássica descrita na literatura de recuperação de informação (modelo vetorial, TF-IDF).
O índice invertido é a estrutura de dados mais fundamental em sistemas de busca textual (como motores de busca e bancos de dados textuais). Ele funciona como um dicionário: para cada termo (palavra) que aparece na coleção, guarda uma lista dos documentos em que esse termo ocorre — a chamada posting list. Mas a versão mais útil e comum do índice invertido não para por aí: ela também registra, para cada par (termo, documento), a frequência do termo naquele documento (term frequency, TF).
Por que isso é tão importante? Porque a frequência é a matéria-prima dos algoritmos de ranqueamento. O modelo mais conhecido, o TF-IDF (Term Frequency – Inverse Document Frequency), usa exatamente dois componentes: a frequência do termo no documento (TF) e a frequência inversa nos documentos da coleção (IDF). Quanto mais vezes um termo aparece em um documento, maior a relevância daquele documento para uma consulta que contenha esse termo — mas isso é ponderado pela raridade do termo na coleção (um termo muito comum, como "o" ou "de", tem pouco poder discriminativo). Sem a frequência armazenada no índice, o sistema não teria como calcular essa relevância de forma eficiente.
Na prática, um índice invertido com frequências permite responder a consultas como "documentos que contêm 'banco' e 'dados'" e, em seguida, ordenar os resultados pela soma dos pesos TF-IDF de cada termo. É exatamente isso que um motor de busca faz em milissegundos. A alternativa de armazenar apenas o termo e a lista de documentos (sem frequências) seria insuficiente para qualquer ranqueamento minimamente sofisticado — só serviria para recuperação booleana simples (o documento contém ou não o termo).
A pegadinha que a banca poderia explorar aqui seria inverter a afirmação, dizendo que os índices invertidos armazenam apenas o termo e a lista de documentos, sem informações adicionais. Mas o enunciado está alinhado com a definição padrão da área: a posting list com frequências é o coração do ranqueamento. Guarde essa estrutura: termo → lista de (documento, frequência) — é ela que sustenta os algoritmos de relevância.
A assertiva descreve com precisão a estrutura de um índice invertido em sistemas de recuperação de informação. Vamos decompor:
"índices invertidos geralmente não armazenam apenas o termo e a lista de documentos" — correto. O índice invertido básico mapeia cada termo para uma lista de documentos (posting list).
"mas também informações adicionais como a frequência de cada termo em cada documento (posting list)" — correto. A posting list, na prática, armazena não só os identificadores dos documentos, mas também a frequência do termo em cada um (TF), e frequentemente também a posição do termo no documento (para consultas por frase).
"fundamentais para algoritmos de ranqueamento" — correto. A frequência (TF) é um dos pilares do modelo TF-IDF e de outros algoritmos de relevância (BM25, por exemplo). Sem ela, não há como ordenar resultados por relevância.
A afirmação está tecnicamente correta e reflete o consenso da literatura de recuperação de informação. Não há nenhum erro conceitual ou de terminologia.
Gabarito: ✅ CERTO
Link permanente: /questoes/qg603659