Pular para o conteúdo principal

Questão de Banco de Dados — Banco de Dados Textuais — Quadrix 2025

Banco de DadosBanco de Dados Textuais
Código
qg603659
Banca
Quadrix
Órgão
SEDF
Ano
2025
Nível
Superior
Cargo
Professor de Educação Básica: Informática
Acerca das linguagens de definição e manipulação de dados, dos conceitos e comandos SQL SERVER e DB2 e dos bancos de dados textuais, julgue o item a seguir. Em recuperação de informação em bancos de dados textuais, índices invertidos geralmente não armazenam apenas o termo e a lista de documentos, mas também informações adicionais como a frequência de cada termo em cada documento (posting list), fundamentais para algoritmos de ranqueamento.
  1. CCerto
  2. EErrado
Revelar gabarito e comentário

GabaritoC — Certo

Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.

Índices invertidos em bancos de dados textuais

CERTO. A afirmação está correta: índices invertidos em sistemas de recuperação de informação não se limitam a mapear termos para documentos — eles armazenam, na posting list, informações adicionais como a frequência do termo em cada documento (TF), que são essenciais para algoritmos de ranqueamento. Essa é a estrutura clássica descrita na literatura de recuperação de informação (modelo vetorial, TF-IDF).

O índice invertido é a estrutura de dados mais fundamental em sistemas de busca textual (como motores de busca e bancos de dados textuais). Ele funciona como um dicionário: para cada termo (palavra) que aparece na coleção, guarda uma lista dos documentos em que esse termo ocorre — a chamada posting list. Mas a versão mais útil e comum do índice invertido não para por aí: ela também registra, para cada par (termo, documento), a frequência do termo naquele documento (term frequency, TF).

Por que isso é tão importante? Porque a frequência é a matéria-prima dos algoritmos de ranqueamento. O modelo mais conhecido, o TF-IDF (Term Frequency – Inverse Document Frequency), usa exatamente dois componentes: a frequência do termo no documento (TF) e a frequência inversa nos documentos da coleção (IDF). Quanto mais vezes um termo aparece em um documento, maior a relevância daquele documento para uma consulta que contenha esse termo — mas isso é ponderado pela raridade do termo na coleção (um termo muito comum, como "o" ou "de", tem pouco poder discriminativo). Sem a frequência armazenada no índice, o sistema não teria como calcular essa relevância de forma eficiente.

Na prática, um índice invertido com frequências permite responder a consultas como "documentos que contêm 'banco' e 'dados'" e, em seguida, ordenar os resultados pela soma dos pesos TF-IDF de cada termo. É exatamente isso que um motor de busca faz em milissegundos. A alternativa de armazenar apenas o termo e a lista de documentos (sem frequências) seria insuficiente para qualquer ranqueamento minimamente sofisticado — só serviria para recuperação booleana simples (o documento contém ou não o termo).

A pegadinha que a banca poderia explorar aqui seria inverter a afirmação, dizendo que os índices invertidos armazenam apenas o termo e a lista de documentos, sem informações adicionais. Mas o enunciado está alinhado com a definição padrão da área: a posting list com frequências é o coração do ranqueamento. Guarde essa estrutura: termo → lista de (documento, frequência) — é ela que sustenta os algoritmos de relevância.

1Estrutura básica
Termo → lista de documentos
2Posting list (completa)
Frequência do termo (TF)
Posição do termo
3Finalidade
Ranqueamento (TF-IDF, BM25)
Consultas por frase
Índice invertido
LEVELsoulevel.com.br
Índice invertido: Estrutura básica (Termo → lista de documentos); Posting list (completa) (Frequência do termo (TF), Posição do termo); Finalidade (Ranqueamento (TF-IDF, BM25), Consultas por frase)

Item — ✅ CERTO

A assertiva descreve com precisão a estrutura de um índice invertido em sistemas de recuperação de informação. Vamos decompor:

  • "índices invertidos geralmente não armazenam apenas o termo e a lista de documentos" — correto. O índice invertido básico mapeia cada termo para uma lista de documentos (posting list).

  • "mas também informações adicionais como a frequência de cada termo em cada documento (posting list)" — correto. A posting list, na prática, armazena não só os identificadores dos documentos, mas também a frequência do termo em cada um (TF), e frequentemente também a posição do termo no documento (para consultas por frase).

  • "fundamentais para algoritmos de ranqueamento" — correto. A frequência (TF) é um dos pilares do modelo TF-IDF e de outros algoritmos de relevância (BM25, por exemplo). Sem ela, não há como ordenar resultados por relevância.

A afirmação está tecnicamente correta e reflete o consenso da literatura de recuperação de informação. Não há nenhum erro conceitual ou de terminologia.

Gabarito: ✅ CERTO

Link permanente: /questoes/qg603659