Pular para o conteúdo principal

Questão de Banco de Dados — Banco de Dados — Quadrix 2024

Banco de DadosBanco de Dados
Código
qg354202
Banca
Quadrix
Órgão
IBICT
Ano
2024
Nível
Superior
Cargo
Tecnologista - Tecnologia da Informação
Quanto aos processos de ETL, ao JSON, ao XML e às técnicas para pré‑processamento de dados, julgue o item.A imputação por moda é uma técnica comumente utilizada no pré‑processamento de dados, para se lidar com valores ausentes.
  1. CCerto
  2. EErrado
Revelar gabarito e comentário

GabaritoC — Certo

Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.

Imputação de dados ausentes no pré-processamento

Gabarito: CERTO. A imputação por moda é, de fato, uma técnica clássica de pré-processamento de dados para tratar valores ausentes, substituindo o valor faltante pela moda (valor mais frequente) daquela variável. Essa é uma prática consagrada na literatura de mineração de dados e preparação de dados, e o enunciado a descreve corretamente.

A imputação de dados é uma etapa do pré-processamento que visa lidar com valores ausentes (missing values) em um conjunto de dados. Quando um atributo possui lacunas, o analista pode optar por remover as linhas ou colunas afetadas, ou por preencher esses valores com estimativas — e é exatamente isso que a imputação faz. A escolha da técnica de imputação depende do tipo de dado e do contexto: para variáveis categóricas, a moda é a medida mais adequada; para variáveis numéricas, costuma-se usar a média ou a mediana.

A moda é o valor que aparece com maior frequência em um conjunto de dados. Por exemplo, em uma coluna com os valores [vermelho, azul, vermelho, verde, vermelho], a moda é "vermelho". Ao imputar pela moda, substituímos cada valor ausente por esse valor mais comum, preservando a distribuição da variável e evitando a perda de dados que ocorreria com a remoção das linhas.

Essa técnica é amplamente utilizada porque é simples, rápida e não exige suposições complexas sobre os dados. No entanto, ela tem limitações: se a proporção de valores ausentes for alta, a imputação pela moda pode distorcer a distribuição e introduzir viés. Por isso, em cenários mais críticos, utilizam-se métodos mais sofisticados, como imputação por regressão, k-vizinhos mais próximos (KNN) ou modelos de aprendizado de máquina.

A banca explora aqui um conhecimento básico de pré-processamento de dados, que é um dos pilares do processo de mineração de dados (CRISP-DM). O pré-processamento engloba limpeza, integração, transformação e redução de dados, e a imputação de valores ausentes é uma das tarefas mais comuns da limpeza. O enunciado afirma exatamente isso: a imputação por moda é uma técnica comumente utilizada para lidar com valores ausentes — e isso é verdadeiro.

1Técnicas
Moda (categóricas)
Média (numéricas sem outliers)
Mediana (numéricas com outliers)
2Métodos avançados
Regressão
KNN
Aprendizado de máquina
3Alternativas à imputação
Remover linhas
Remover colunas
Imputação de valores ausentes
LEVELsoulevel.com.br
Imputação de valores ausentes: Técnicas (Moda (categóricas), Média (numéricas sem outliers), Mediana (numéricas com outliers)); Métodos avançados (Regressão, KNN, Aprendizado de máquina); Alternativas à imputação (Remover linhas, Remover colunas)
PEGA ESSA DICA!

Para questões sobre imputação, lembre-se da regra prática: moda para variáveis categóricas, média para numéricas sem outliers e mediana para numéricas com outliers. Essa distinção é frequentemente cobrada em provas de banco de dados e ciência de dados.

CERTO — a afirmação está correta.

Gabarito: CERTO.

Link permanente: /questoes/qg354202