Pular para o conteúdo principal

Questão de TI - Ciência de Dados e Inteligência Artificial — Tópicos Mesclados de Ciência de Dados — FGV 2023

TI - Ciência de Dados e Inteligência ArtificialTópicos Mesclados de Ciência de Dados
Código
fg161213
Banca
FGV
Órgão
Pref RJ
Ano
2023
Cargo
FR ( )

Observe a seguinte estrutura do conjunto de dados PESSOA que contém dados sobre pessoas e a sua renda anual.

 

Coluna

Tipo

Descrição

Idade

Contínua

Idade em anos

Ganho_capital

Contínua

Ganho de capital

Anos_estudo

Contínua

Anos de estudo

Horas_trabalhadas

Contínua

Horas trabalhadas

Sexo

Categórica

Sexo

Raça / Etnia

Categórica

Raça / Etnia

Educação

Categórica

Educação

Ocupação

Categórica

Ocupação

Classe_trabalho

Categórica

Classe de trabalho

Classe

Categórica

Renda (> 50 mil, <= 50 mil)

 

O conjunto de dados PESSOA será usado para a tarefa de aprendizagem supervisionada de classificação com a finalidade de prever se a renda (Classe) de uma pessoa excede 50 mil por ano.

 

Para isso, a operação de pré-processamento de dados que deve ser executada no conjunto de dados PESSOA é:

  1. Aexclusão da coluna do tipo categórica “Classe” que possui outlier;
  2. Bdiscretização das colunas do tipo categórica “Sexo, Raça / Etnia e Educação”;
  3. Cnormalização por padronização das colunas do tipo categórica “Ocupação e Classe_trabalho”;
  4. Dnormalização das colunas do tipo contínua “Idade, Ganho_capital, Anos_estudo e Horas_trabalhadas”;
  5. Eimputação de valores com base na média dos valores existentes na coluna do tipo categórica “Sexo” que possui valores faltantes.
Revelar gabarito e comentário

GabaritoD — normalização das colunas do tipo contínua “Idade, Ganho_capital, Anos_estudo e Horas_trabalhadas”;

Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.

Pré-processamento de Dados: Normalização de Atributos Contínuos

Gabarito: letra D. A operação de pré-processamento que deve ser executada no conjunto de dados PESSOA é a normalização das colunas contínuas (Idade, Ganho_capital, Anos_estudo e Horas_trabalhadas), pois algoritmos de classificação baseados em distância (como k-NN, SVM e redes neurais) são sensíveis à escala dos atributos — sem padronização, a variável de maior magnitude dominaria o cálculo da distância, distorcendo o modelo. As demais alternativas confundem o tratamento adequado para dados categóricos e contínuos.

A normalização (ou padronização) é uma etapa fundamental no pré-processamento de dados para algoritmos de aprendizado de máquina que dependem de métricas de distância. O objetivo é transformar os valores das colunas contínuas para uma escala comum, geralmente com média 0 e desvio padrão 1 (padronização z-score) ou em um intervalo fixo, como [0, 1] (min-max). Isso evita que atributos com magnitudes maiores (como Ganho_capital, que pode variar de 0 a dezenas de milhares) dominem o cálculo de similaridade entre instâncias, fazendo com que atributos com escalas menores (como Anos_estudo, que varia de 0 a 20) tenham influência desprezível.

A razão pela qual a normalização é necessária está no funcionamento dos algoritmos: modelos como k-NN calculam a distância euclidiana entre os pontos, e se uma variável tem escala muito maior, ela contribui desproporcionalmente para a distância total. Por exemplo, se compararmos duas pessoas com a mesma idade e anos de estudo, mas com ganhos de capital de R$ 0 e R$ 50.000, a diferença no ganho de capital dominará completamente a distância, tornando as outras características irrelevantes. A padronização resolve esse problema ao colocar todas as variáveis na mesma escala.

É importante distinguir o tratamento de dados contínuos e categóricos. Enquanto colunas contínuas são normalizadas, colunas categóricas (como Sexo, Raça/Etnia, Educação, Ocupação, Classe_trabalho) geralmente passam por codificação (como one-hot encoding ou label encoding) para serem convertidas em números que o algoritmo possa processar. A normalização não se aplica a dados categóricos, pois eles não possuem uma ordem ou escala numérica intrínseca que faça sentido padronizar. A coluna Classe, sendo o alvo da classificação, não deve ser normalizada nem removida — ela é a variável dependente que o modelo deve prever.

A pegadinha desta questão está em associar técnicas de pré-processamento ao tipo errado de dado. A banca explora a confusão comum entre normalização (para dados contínuos) e codificação (para dados categóricos). O candidato que não domina essa distinção pode cair em alternativas que aplicam normalização a colunas categóricas ou discretização a colunas contínuas. Guarde a regra: dados contínuos → normalização/padronização; dados categóricos → codificação (one-hot, label); dados faltantes → imputação (média, mediana, moda). É exatamente essa fronteira que separa as alternativas corretas das incorretas.

Alternativa A — ❌ Incorreta

A exclusão da coluna "Classe" é um erro grave, pois ela é a variável alvo da classificação — é exatamente o que se deseja prever. Sem ela, não há tarefa de aprendizado supervisionado. Além disso, a justificativa "possui outlier" é equivocada: outliers são tratados com técnicas de detecção e tratamento (como winsorização ou remoção de instâncias), não com a exclusão da coluna inteira, e a coluna Classe é categórica, não tendo sentido falar em outlier numérico.

Alternativa B — ❌ Incorreta

A discretização é uma técnica aplicada a dados contínuos para transformá-los em categóricos (por exemplo, dividir Idade em faixas etárias). Aplicá-la a colunas que já são categóricas (Sexo, Raça/Etnia, Educação) é redundante e sem sentido — elas já estão no formato categórico. O tratamento correto para essas colunas seria a codificação (one-hot encoding ou label encoding), não a discretização.

Alternativa C — ❌ Incorreta

A normalização por padronização é uma técnica para dados contínuos, não para dados categóricos. Aplicá-la a colunas categóricas como Ocupação e Classe_trabalho não faz sentido, pois esses atributos não possuem uma escala numérica com significado — padronizar valores como "Engenheiro" ou "Professor" não tem interpretação válida. O correto para essas colunas seria codificá-las (por exemplo, one-hot encoding) para que o algoritmo possa utilizá-las.

Alternativa D — ✅ Correta ⟵ GABARITO

A normalização das colunas contínuas (Idade, Ganho_capital, Anos_estudo e Horas_trabalhadas) é a operação correta. Essas variáveis possuem escalas muito diferentes: Idade varia de 0 a ~100, Ganho_capital pode chegar a dezenas de milhares, Anos_estudo varia de 0 a ~20, e Horas_trabalhadas de 0 a ~100. Sem normalização, algoritmos baseados em distância seriam dominados por Ganho_capital, tornando as outras características praticamente irrelevantes. A padronização (z-score) ou a normalização min-max colocam todas na mesma escala, garantindo que cada atributo contribua de forma equilibrada para o modelo.

Alternativa E — ❌ Incorreta

A imputação de valores é uma técnica para tratar dados faltantes, e a imputação pela média é adequada para dados contínuos, não para dados categóricos. Aplicar a média a uma coluna categórica como Sexo não faz sentido — calcular a "média" de categorias como "Masculino" e "Feminino" não produz um valor válido. Para dados categóricos com valores faltantes, a imputação correta seria pela moda (categoria mais frequente) ou a criação de uma nova categoria "Desconhecido". Além disso, o enunciado não indica que a coluna Sexo possui valores faltantes, tornando a premissa da alternativa infundada.

Gabarito: letra D — a normalização das colunas contínuas é a operação de pré-processamento necessária para o modelo de classificação.

Link permanente: /questoes/fg161213