Questão de TI - Ciência de Dados e Inteligência Artificial — Tópicos Mesclados de Ciência de Dados — INSTITUTO AOCP 2024
TI - Ciência de Dados e Inteligência Artificial›Tópicos Mesclados de Ciência de Dados
Código
qa630937
Banca
INSTITUTO AOCP
Órgão
MPE PR
Ano
2024
Cargo
Ana ( )
Sobre técnicas para pré-processamento de dados, analise as assertivas e assinale a alternativa correta.
I. A normalização de dados, no contexto do pré- processamento de dados, é uma técnica que visa reduzir a redundância e a dependência dos dados, organizando-os em tabelas relacionais.
II. A técnica de discretização transforma dados contínuos em um número finito de intervalos ou categorias.
III. A imputação de dados faltantes pode ser realizada substituindo valores ausentes pela média, mediana ou moda dos dados existentes.
IV. A detecção de outliers é um processo que identifica e trata valores que estão fora do padrão normal dos dados, podendo impactar negativamente a análise.
AApenas I está correta.
BApenas I está incorreta.
CApenas II e III estão corretas.
DApenas I e IV estão corretas.
EI, II, III e IV estão incorretas.
Revelar gabarito e comentário▾
GabaritoB — Apenas I está incorreta.
Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.
Pré-processamento de dados: normalização, discretização, imputação e outliers
Gabarito: letra B — apenas a assertiva I está incorreta. A normalização, no contexto de pré-processamento de dados, não tem relação com reduzir redundância e dependência organizando tabelas relacionais; esse é o conceito de normalização de banco de dados. No pré-processamento, normalizar significa ajustar a escala dos valores (ex.: min-max, z-score). As assertivas II, III e IV estão corretas: discretização transforma contínuos em intervalos, imputação preenche faltantes com média/mediana/moda, e detecção de outliers identifica valores fora do padrão.
A questão mistura dois usos distintos do termo "normalização" — um da área de banco de dados e outro da área de ciência de dados — e é exatamente essa ambiguidade que a banca explora. No contexto de pré-processamento de dados, a normalização é uma técnica de escalonamento de atributos: ela transforma os valores numéricos de uma variável para uma faixa comum (como 0 a 1 ou média 0 e desvio padrão 1), evitando que uma variável com escala maior domine o modelo. Isso é essencial para algoritmos baseados em distância (k-NN, SVM, k-means) e para redes neurais.
Já a normalização de banco de dados é um processo de modelagem relacional que visa eliminar redundâncias e anomalias de inserção, atualização e exclusão, decompondo tabelas em formas normais (1FN, 2FN, 3FN, BCNF). A assertiva I descreve exatamente esse conceito de banco de dados, não o de pré-processamento. Portanto, está incorreta no contexto da questão.
As demais assertivas estão corretas e são técnicas clássicas de limpeza e preparação de dados:
Discretização: converte uma variável contínua em categorias discretas (ex.: idade em faixas etárias). É usada, por exemplo, para simplificar modelos ou aplicar algoritmos que exigem dados categóricos.
Imputação: preenche valores ausentes com estatísticas da coluna (média, mediana, moda) ou com técnicas mais avançadas (regressão, k-NN). A média é sensível a outliers; a mediana é mais robusta; a moda é usada para dados categóricos.
Detecção de outliers: identifica observações que se distanciam do padrão geral (ex.: z-score > 3, IQR). Outliers podem distorcer médias, correlações e o treinamento de modelos, por isso precisam ser tratados (remoção, transformação ou winsorização).
A pegadinha central é a troca de contexto do termo "normalização". O candidato que conhece banco de dados marca a assertiva I como correta, caindo na armadilha. A dica é: sempre verifique o contexto — se a questão fala de pré-processamento, normalização é escala; se fala de modelagem relacional, é decomposição em formas normais.
Critério
Normalização (pré-processamento)
Normalização (banco de dados)
Objetivo
Ajustar a escala dos valores numéricos (ex.: min-max, z-score)
Reduzir redundância e dependência, organizando em tabelas relacionais
Contexto
Ciência de dados / machine learning
Modelagem relacional (1FN, 2FN, 3FN, BCNF)
Técnica típica
Escalonamento de atributos para faixa comum (0 a 1, média 0)
Decomposição de tabelas em formas normais
Assertiva I da questão
❌ Não corresponde a este conceito
✅ Corresponde exatamente ao que a assertiva descreve
Item I — ❌ Incorreto
A assertiva descreve a normalização de banco de dados (reduzir redundância e dependência, organizar em tabelas relacionais), não a normalização de pré-processamento de dados. No pré-processamento, normalizar é escalonar valores numéricos para uma faixa comum (min-max, z-score). A banca troca o contexto do termo para induzir ao erro.
Item II — ✅ Correto
A discretização é exatamente isso: transformar dados contínuos em um número finito de intervalos ou categorias. Exemplo: transformar a variável "idade" (contínua) em faixas "0-18", "19-30", "31-60", "60+". É uma técnica comum para simplificar modelos ou adequar dados a algoritmos categóricos.
Item III — ✅ Correto
A imputação de dados faltantes pode ser feita substituindo valores ausentes pela média, mediana ou moda dos dados existentes. A média é usada para distribuições simétricas; a mediana para distribuições assimétricas ou com outliers; a moda para dados categóricos. É uma das abordagens mais simples e difundidas de tratamento de missing values.
Item IV — ✅ Correto
A detecção de outliers identifica valores que se afastam do padrão normal dos dados (ex.: z-score, IQR, boxplot). Esses valores podem impactar negativamente a análise, distorcendo estatísticas e modelos, por isso devem ser tratados (remoção, transformação, winsorização). A assertiva está correta.
Conclusão: corretas as assertivas II, III e IV; incorreta apenas a I. Portanto, a alternativa correta é a letra B (Apenas I está incorreta).