Questão de TI - Ciência de Dados e Inteligência Artificial — Tópicos Mesclados de Ciência de Dados — FGV 2023
TI - Ciência de Dados e Inteligência Artificial›Tópicos Mesclados de Ciência de Dados
Código
fg161213
Banca
FGV
Órgão
Pref RJ
Ano
2023
Cargo
FR ( )
Observe a seguinte estrutura do conjunto de dados PESSOA que contém dados sobre pessoas e a sua renda anual.
Coluna
Tipo
Descrição
Idade
Contínua
Idade em anos
Ganho_capital
Contínua
Ganho de capital
Anos_estudo
Contínua
Anos de estudo
Horas_trabalhadas
Contínua
Horas trabalhadas
Sexo
Categórica
Sexo
Raça / Etnia
Categórica
Raça / Etnia
Educação
Categórica
Educação
Ocupação
Categórica
Ocupação
Classe_trabalho
Categórica
Classe de trabalho
Classe
Categórica
Renda (> 50 mil, <= 50 mil)
O conjunto de dados PESSOA será usado para a tarefa de aprendizagem supervisionada de classificação com a finalidade de prever se a renda (Classe) de uma pessoa excede 50 mil por ano.
Para isso, a operação de pré-processamento de dados que deve ser executada no conjunto de dados PESSOA é:
Aexclusão da coluna do tipo categórica “Classe” que possui outlier;
Bdiscretização das colunas do tipo categórica “Sexo, Raça / Etnia e Educação”;
Cnormalização por padronização das colunas do tipo categórica “Ocupação e Classe_trabalho”;
Dnormalização das colunas do tipo contínua “Idade, Ganho_capital, Anos_estudo e Horas_trabalhadas”;
Eimputação de valores com base na média dos valores existentes na coluna do tipo categórica “Sexo” que possui valores faltantes.
Revelar gabarito e comentário▾
GabaritoD — normalização das colunas do tipo contínua “Idade, Ganho_capital, Anos_estudo e Horas_trabalhadas”;
Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.
Pré-processamento de Dados: Normalização de Atributos Contínuos
Gabarito: letra D. A operação de pré-processamento que deve ser executada no conjunto de dados PESSOA é a normalização das colunas contínuas (Idade, Ganho_capital, Anos_estudo e Horas_trabalhadas), pois algoritmos de classificação baseados em distância (como k-NN, SVM e redes neurais) são sensíveis à escala dos atributos — sem padronização, a variável de maior magnitude dominaria o cálculo da distância, distorcendo o modelo. As demais alternativas confundem o tratamento adequado para dados categóricos e contínuos.
A normalização (ou padronização) é uma etapa fundamental no pré-processamento de dados para algoritmos de aprendizado de máquina que dependem de métricas de distância. O objetivo é transformar os valores das colunas contínuas para uma escala comum, geralmente com média 0 e desvio padrão 1 (padronização z-score) ou em um intervalo fixo, como [0, 1] (min-max). Isso evita que atributos com magnitudes maiores (como Ganho_capital, que pode variar de 0 a dezenas de milhares) dominem o cálculo de similaridade entre instâncias, fazendo com que atributos com escalas menores (como Anos_estudo, que varia de 0 a 20) tenham influência desprezível.
A razão pela qual a normalização é necessária está no funcionamento dos algoritmos: modelos como k-NN calculam a distância euclidiana entre os pontos, e se uma variável tem escala muito maior, ela contribui desproporcionalmente para a distância total. Por exemplo, se compararmos duas pessoas com a mesma idade e anos de estudo, mas com ganhos de capital de R$ 0 e R$ 50.000, a diferença no ganho de capital dominará completamente a distância, tornando as outras características irrelevantes. A padronização resolve esse problema ao colocar todas as variáveis na mesma escala.
É importante distinguir o tratamento de dados contínuos e categóricos. Enquanto colunas contínuas são normalizadas, colunas categóricas (como Sexo, Raça/Etnia, Educação, Ocupação, Classe_trabalho) geralmente passam por codificação (como one-hot encoding ou label encoding) para serem convertidas em números que o algoritmo possa processar. A normalização não se aplica a dados categóricos, pois eles não possuem uma ordem ou escala numérica intrínseca que faça sentido padronizar. A coluna Classe, sendo o alvo da classificação, não deve ser normalizada nem removida — ela é a variável dependente que o modelo deve prever.
A pegadinha desta questão está em associar técnicas de pré-processamento ao tipo errado de dado. A banca explora a confusão comum entre normalização (para dados contínuos) e codificação (para dados categóricos). O candidato que não domina essa distinção pode cair em alternativas que aplicam normalização a colunas categóricas ou discretização a colunas contínuas. Guarde a regra: dados contínuos → normalização/padronização; dados categóricos → codificação (one-hot, label); dados faltantes → imputação (média, mediana, moda). É exatamente essa fronteira que separa as alternativas corretas das incorretas.
Alternativa A — ❌ Incorreta
A exclusão da coluna "Classe" é um erro grave, pois ela é a variável alvo da classificação — é exatamente o que se deseja prever. Sem ela, não há tarefa de aprendizado supervisionado. Além disso, a justificativa "possui outlier" é equivocada: outliers são tratados com técnicas de detecção e tratamento (como winsorização ou remoção de instâncias), não com a exclusão da coluna inteira, e a coluna Classe é categórica, não tendo sentido falar em outlier numérico.
Alternativa B — ❌ Incorreta
A discretização é uma técnica aplicada a dados contínuos para transformá-los em categóricos (por exemplo, dividir Idade em faixas etárias). Aplicá-la a colunas que já são categóricas (Sexo, Raça/Etnia, Educação) é redundante e sem sentido — elas já estão no formato categórico. O tratamento correto para essas colunas seria a codificação (one-hot encoding ou label encoding), não a discretização.
Alternativa C — ❌ Incorreta
A normalização por padronização é uma técnica para dados contínuos, não para dados categóricos. Aplicá-la a colunas categóricas como Ocupação e Classe_trabalho não faz sentido, pois esses atributos não possuem uma escala numérica com significado — padronizar valores como "Engenheiro" ou "Professor" não tem interpretação válida. O correto para essas colunas seria codificá-las (por exemplo, one-hot encoding) para que o algoritmo possa utilizá-las.
Alternativa D — ✅ Correta ⟵ GABARITO
A normalização das colunas contínuas (Idade, Ganho_capital, Anos_estudo e Horas_trabalhadas) é a operação correta. Essas variáveis possuem escalas muito diferentes: Idade varia de 0 a ~100, Ganho_capital pode chegar a dezenas de milhares, Anos_estudo varia de 0 a ~20, e Horas_trabalhadas de 0 a ~100. Sem normalização, algoritmos baseados em distância seriam dominados por Ganho_capital, tornando as outras características praticamente irrelevantes. A padronização (z-score) ou a normalização min-max colocam todas na mesma escala, garantindo que cada atributo contribua de forma equilibrada para o modelo.
Alternativa E — ❌ Incorreta
A imputação de valores é uma técnica para tratar dados faltantes, e a imputação pela média é adequada para dados contínuos, não para dados categóricos. Aplicar a média a uma coluna categórica como Sexo não faz sentido — calcular a "média" de categorias como "Masculino" e "Feminino" não produz um valor válido. Para dados categóricos com valores faltantes, a imputação correta seria pela moda (categoria mais frequente) ou a criação de uma nova categoria "Desconhecido". Além disso, o enunciado não indica que a coluna Sexo possui valores faltantes, tornando a premissa da alternativa infundada.
Gabarito: letra D — a normalização das colunas contínuas é a operação de pré-processamento necessária para o modelo de classificação.