Pular para o conteúdo principal

Questão de TI - Ciência de Dados e Inteligência Artificial — Tópicos Mesclados de Ciência de Dados — INSTITUTO AOCP 2024

TI - Ciência de Dados e Inteligência ArtificialTópicos Mesclados de Ciência de Dados
Código
qa630937
Banca
INSTITUTO AOCP
Órgão
MPE PR
Ano
2024
Cargo
Ana ( )

Sobre técnicas para pré-processamento de dados, analise as assertivas e assinale a alternativa correta.

 

I. A normalização de dados, no contexto do pré- processamento de dados, é uma técnica que visa reduzir a redundância e a dependência dos dados, organizando-os em tabelas relacionais.

 

II. A técnica de discretização transforma dados contínuos em um número finito de intervalos ou categorias.

 

III. A imputação de dados faltantes pode ser realizada substituindo valores ausentes pela média, mediana ou moda dos dados existentes.

 

IV. A detecção de outliers é um processo que identifica e trata valores que estão fora do padrão normal dos dados, podendo impactar negativamente a análise.

  1. AApenas I está correta.
  2. BApenas I está incorreta.
  3. CApenas II e III estão corretas.
  4. DApenas I e IV estão corretas.
  5. EI, II, III e IV estão incorretas.
Revelar gabarito e comentário

GabaritoB — Apenas I está incorreta.

Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.

Pré-processamento de dados: normalização, discretização, imputação e outliers

Gabarito: letra B — apenas a assertiva I está incorreta. A normalização, no contexto de pré-processamento de dados, não tem relação com reduzir redundância e dependência organizando tabelas relacionais; esse é o conceito de normalização de banco de dados. No pré-processamento, normalizar significa ajustar a escala dos valores (ex.: min-max, z-score). As assertivas II, III e IV estão corretas: discretização transforma contínuos em intervalos, imputação preenche faltantes com média/mediana/moda, e detecção de outliers identifica valores fora do padrão.

A questão mistura dois usos distintos do termo "normalização" — um da área de banco de dados e outro da área de ciência de dados — e é exatamente essa ambiguidade que a banca explora. No contexto de pré-processamento de dados, a normalização é uma técnica de escalonamento de atributos: ela transforma os valores numéricos de uma variável para uma faixa comum (como 0 a 1 ou média 0 e desvio padrão 1), evitando que uma variável com escala maior domine o modelo. Isso é essencial para algoritmos baseados em distância (k-NN, SVM, k-means) e para redes neurais.

Já a normalização de banco de dados é um processo de modelagem relacional que visa eliminar redundâncias e anomalias de inserção, atualização e exclusão, decompondo tabelas em formas normais (1FN, 2FN, 3FN, BCNF). A assertiva I descreve exatamente esse conceito de banco de dados, não o de pré-processamento. Portanto, está incorreta no contexto da questão.

As demais assertivas estão corretas e são técnicas clássicas de limpeza e preparação de dados:

  • Discretização: converte uma variável contínua em categorias discretas (ex.: idade em faixas etárias). É usada, por exemplo, para simplificar modelos ou aplicar algoritmos que exigem dados categóricos.

  • Imputação: preenche valores ausentes com estatísticas da coluna (média, mediana, moda) ou com técnicas mais avançadas (regressão, k-NN). A média é sensível a outliers; a mediana é mais robusta; a moda é usada para dados categóricos.

  • Detecção de outliers: identifica observações que se distanciam do padrão geral (ex.: z-score > 3, IQR). Outliers podem distorcer médias, correlações e o treinamento de modelos, por isso precisam ser tratados (remoção, transformação ou winsorização).

A pegadinha central é a troca de contexto do termo "normalização". O candidato que conhece banco de dados marca a assertiva I como correta, caindo na armadilha. A dica é: sempre verifique o contexto — se a questão fala de pré-processamento, normalização é escala; se fala de modelagem relacional, é decomposição em formas normais.

Critério

Normalização (pré-processamento)

Normalização (banco de dados)

Objetivo

Ajustar a escala dos valores numéricos (ex.: min-max, z-score)

Reduzir redundância e dependência, organizando em tabelas relacionais

Contexto

Ciência de dados / machine learning

Modelagem relacional (1FN, 2FN, 3FN, BCNF)

Técnica típica

Escalonamento de atributos para faixa comum (0 a 1, média 0)

Decomposição de tabelas em formas normais

Assertiva I da questão

❌ Não corresponde a este conceito

✅ Corresponde exatamente ao que a assertiva descreve

Item I — ❌ Incorreto

A assertiva descreve a normalização de banco de dados (reduzir redundância e dependência, organizar em tabelas relacionais), não a normalização de pré-processamento de dados. No pré-processamento, normalizar é escalonar valores numéricos para uma faixa comum (min-max, z-score). A banca troca o contexto do termo para induzir ao erro.

Item II — ✅ Correto

A discretização é exatamente isso: transformar dados contínuos em um número finito de intervalos ou categorias. Exemplo: transformar a variável "idade" (contínua) em faixas "0-18", "19-30", "31-60", "60+". É uma técnica comum para simplificar modelos ou adequar dados a algoritmos categóricos.

Item III — ✅ Correto

A imputação de dados faltantes pode ser feita substituindo valores ausentes pela média, mediana ou moda dos dados existentes. A média é usada para distribuições simétricas; a mediana para distribuições assimétricas ou com outliers; a moda para dados categóricos. É uma das abordagens mais simples e difundidas de tratamento de missing values.

Item IV — ✅ Correto

A detecção de outliers identifica valores que se afastam do padrão normal dos dados (ex.: z-score, IQR, boxplot). Esses valores podem impactar negativamente a análise, distorcendo estatísticas e modelos, por isso devem ser tratados (remoção, transformação, winsorização). A assertiva está correta.

Conclusão: corretas as assertivas II, III e IV; incorreta apenas a I. Portanto, a alternativa correta é a letra B (Apenas I está incorreta).

Gabarito: letra B

Link permanente: /questoes/qa630937