Pular para o conteúdo principal

Questão de Banco de Dados — Data Mining — CESPE / CEBRASPE 2021

Banco de DadosData Mining
Código
ce123255
Banca
CESPE / CEBRASPE
Órgão
Prefeitura de Aracaju - SE
Ano
2021
Nível
Superior
Cargo
Auditor de Tributos Municipais - Tecnologia da Informação
O enriquecimento de dados da etapa de pré-processamento e preparação do data mining tem como objetivo
  1. Aa deduplicidade de registros.
  2. Ba seleção de amostras.
  3. Ca integração de bases diferentes.
  4. Do tratamento de valores nulos.
  5. Eo acréscimo de dados à base já existente.
Revelar gabarito e comentário

GabaritoE — o acréscimo de dados à base já existente.

Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.

Data Mining: Etapa de Pré-processamento e Enriquecimento de Dados

Gabarito: letra E. O enriquecimento de dados (data enrichment) na etapa de pré-processamento do data mining consiste em agregar novas informações à base já existente, geralmente provenientes de fontes externas, com o objetivo de enriquecer o conjunto de dados para análises mais precisas. Essa prática difere de outras atividades de preparação, como deduplicação, seleção de amostras, integração de bases ou tratamento de valores nulos.

A banca cobra o conhecimento específico sobre as tarefas da fase de pré-processamento do processo KDD (Knowledge Discovery in Databases). O data mining é uma etapa do KDD, e antes dele há o pré-processamento, que inclui limpeza, integração, transformação, redução e enriquecimento dos dados. O enriquecimento é justamente a adição de dados complementares.

Atividade de Pré-processamento

Descrição

Objetivo Principal

Relação com Enriquecimento

Deduplicação (Alternativa A)

Remoção de registros duplicados

Limpeza de dados (eliminar redundância)

Não enriquece; apenas reduz volume

Seleção de Amostras (Alternativa B)

Escolha de subconjunto representativo

Redução de dados (amostragem)

Não enriquece; apenas seleciona

Integração de Bases (Alternativa C)

Combinação de dados de múltiplas fontes

Unificação de dados existentes

Pode gerar conjunto mais completo, mas não foca em adicionar atributos externos

Tratamento de Valores Nulos (Alternativa D)

Preenchimento, exclusão ou imputação de dados ausentes

Limpeza de dados (correção de lacunas)

Não acrescenta novos dados

Enriquecimento de Dados (Alternativa E)

Acréscimo de dados à base já existente (fontes externas)

Aumentar poder preditivo dos modelos

É a definição exata do conceito

Alternativa A — ❌ Incorreta

A deduplicidade de registros (remoção de duplicatas) é uma atividade de limpeza de dados (data cleaning), que visa eliminar registros redundantes, e não enriquecer a base com novos dados.

Alternativa B — ❌ Incorreta

A seleção de amostras (sampling) é uma técnica de redução de dados, na qual se escolhe um subconjunto representativo do todo para análise. Não se trata de enriquecimento, pois não acrescenta novos dados, apenas reduz o volume.

Alternativa C — ❌ Incorreta

A integração de bases diferentes é a combinação de dados de múltiplas fontes em um único repositório, podendo gerar um conjunto mais completo, mas não é especificamente enriquecimento, pois o foco está em unificar dados existentes, não em adicionar atributos externos adicionais.

Alternativa D — ❌ Incorreta

O tratamento de valores nulos (missing values) é uma tarefa de limpeza de dados, que pode envolver preenchimento, exclusão ou imputação de valores ausentes, mas não acrescenta novos dados à base.

Alternativa E — ✅ Correta ⟵ GABARITO

O enriquecimento de dados consiste no acréscimo de dados à base já existente, geralmente obtidos de fontes externas (ex.: dados demográficos, socioeconômicos) para aumentar o poder preditivo dos modelos de data mining. É uma etapa opcional, mas valiosa, que amplia o conjunto de atributos disponíveis para análise.

PEGA ESSA DICA!

Para memorizar, associe "enriquecimento" a "acréscimo" – é a única atividade de pré-processamento que adiciona novas informações ao dataset original, enquanto as demais (limpeza, integração, redução, transformação) atuam sobre os dados já existentes.

Gabarito: letra E

Link permanente: /questoes/ce123255