Questão de Banco de Dados — Data Mining — FGV 2023
Banco de Dados›Data Mining
Código
fg070551
Banca
FGV
Órgão
SMF-RJ
Ano
2023
Nível
Superior
Cargo
Fiscal de Rendas
Observe a seguinte estrutura do conjunto de dados PESSOA que contém dados sobre pessoas e a sua renda anual.O conjunto de dados PESSOA será usado para a tarefa de aprendizagem supervisionada de classificação com a finalidade de prever se a renda (Classe) de uma pessoa excede 50 mil por ano.Para isso, a operação de pré-processamento de dados que deve ser executada no conjunto de dados PESSOA é:
Aexclusão da coluna do tipo categórica "Classe" que possui outlier;
Bdiscretização das colunas do tipo categórica "Sexo, Raça / Etnia e Educação";
Cnormalização por padronização das colunas do tipo categórica "Ocupação e Classe_trabalho";
Dnormalização das colunas do tipo continua "Idade, Ganho_capital, Anos_estudo e Horas_trabalhadas";
Eimputação de valores com base na média dos valores existentes na coluna do tipo categórica "Sexo" que possui valores faltantes.
Revelar gabarito e comentário▾
GabaritoD — normalização das colunas do tipo continua "Idade, Ganho_capital, Anos_estudo e Horas_trabalhadas";
Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.
Pré-processamento de dados em Data Mining: normalização de atributos contínuos
SE LIGUE NESSA!
Esta questão depende de uma figura/tabela que descreve a estrutura do conjunto de dados PESSOA; o raciocínio abaixo é o método — confira os valores e os tipos das colunas na imagem original.
Gabarito: letra D. A operação de pré-processamento correta é a normalização das colunas do tipo contínua (Idade, Ganho_capital, Anos_estudo e Horas_trabalhadas), pois algoritmos de classificação supervisionada, como os baseados em distância (k-NN, SVM, redes neurais), são sensíveis à escala dos atributos numéricos — sem normalizar, atributos com faixas de valores maiores dominariam o cálculo de similaridade. As demais alternativas confundem o tipo de dado (categórico vs. contínuo) com a técnica de pré-processamento adequada.
O pré-processamento de dados é uma etapa fundamental no processo de descoberta de conhecimento em bancos de dados (KDD) e no CRISP-DM, preparando os dados brutos para a mineração. Entre as técnicas mais comuns estão a limpeza (tratamento de valores ausentes, ruído e outliers), a transformação (normalização, discretização, agregação) e a redução (seleção de atributos, redução de dimensionalidade). A escolha da técnica depende diretamente do tipo do atributo: contínuo (numérico, com escala de medida) ou categórico (nominal, com valores discretos sem ordem natural).
A normalização é aplicada a atributos contínuos para ajustar seus valores a uma escala comum, geralmente entre 0 e 1 (min-max) ou com média 0 e desvio padrão 1 (padronização/z-score). Isso é crucial porque muitos algoritmos de aprendizado de máquina calculam distâncias entre instâncias; se um atributo tem faixa de 0 a 100 e outro de 0 a 1.000.000, o segundo dominaria a distância, distorcendo o modelo. No conjunto PESSOA, as colunas contínuas são exatamente Idade, Ganho_capital, Anos_estudo e Horas_trabalhadas — todas com escalas diferentes (anos, valores monetários, anos de estudo, horas), o que torna a normalização indispensável.
A discretização, por outro lado, converte atributos contínuos em categóricos (ex.: faixas etárias), mas não se aplica a atributos que já são categóricos. A imputação trata valores faltantes e pode usar a média, mas apenas para atributos numéricos — usar a média em uma coluna categórica como "Sexo" é um erro conceitual, pois a média de categorias não faz sentido. A exclusão de coluna com outlier é uma decisão drástica e não se justifica apenas pela presença de outliers, especialmente quando a coluna é o rótulo (Classe) que se deseja prever.
A pegadinha central desta questão é a troca entre tipo de dado e técnica de pré-processamento: a banca apresenta alternativas que aplicam técnicas inadequadas ao tipo de coluna (normalizar categórica, discretizar categórica, imputar média em categórica). O candidato que não domina a distinção entre atributos contínuos e categóricos, e qual técnica cabe a cada um, tende a cair em uma das alternativas erradas. Guarde o par: contínuo → normalização/padronização; categórico → codificação (one-hot, label encoding) ou tratamento de valores ausentes por moda.
Alternativa A — ❌ Incorreta
A exclusão da coluna "Classe" é absurda: ela é a variável alvo (rótulo) da classificação supervisionada — sem ela, não há como treinar o modelo. Além disso, a presença de outliers em uma coluna categórica não é um conceito bem definido (outliers são típicos de dados numéricos), e a exclusão de uma coluna inteira por causa de outliers é uma medida extrema, raramente recomendada sem análise prévia.
Alternativa B — ❌ Incorreta
A discretização é uma técnica para atributos contínuos (transformar valores numéricos em intervalos/fatias), não para atributos categóricos como Sexo, Raça/Etnia e Educação. Essas colunas já são categóricas; o pré-processamento adequado para elas seria codificação (ex.: one-hot encoding) ou, se houvesse valores faltantes, imputação pela moda — nunca discretização.
Alternativa C — ❌ Incorreta
A normalização por padronização (z-score) é aplicada a atributos contínuos, não a categóricos. Ocupação e Classe_trabalho são colunas categóricas (nominais); padronizá-las não faz sentido, pois não há uma escala numérica a ser ajustada. A técnica correta para essas colunas seria codificação categórica.
Alternativa D — ✅ Correta ⟵ GABARITO
As colunas Idade, Ganho_capital, Anos_estudo e Horas_trabalhadas são todas do tipo contínuo (numérico). A normalização (min-max ou padronização z-score) é a operação de pré-processamento adequada para atributos contínuos, pois ajusta suas escalas para que nenhum atributo domine o cálculo de distância nos algoritmos de classificação. Esta é a única alternativa que associa corretamente a técnica ao tipo de dado.
Alternativa E — ❌ Incorreta
A imputação pela média é uma técnica para atributos numéricos com valores faltantes. A coluna "Sexo" é categórica; calcular a média de categorias (ex.: média entre "Masculino" e "Feminino") não tem significado estatístico. Para dados categóricos, a imputação adequada seria pela moda (categoria mais frequente) ou por outra técnica específica.
Gabarito: letra D — a normalização das colunas contínuas é a operação de pré-processamento correta para a tarefa de classificação supervisionada.