Pular para o conteúdo principal

Questão de TI - Ciência de Dados e Inteligência Artificial — Ciência de Dados - Objetivos e Etapas — CESPE / CEBRASPE 2026

TI - Ciência de Dados e Inteligência ArtificialCiência de Dados - Objetivos e Etapas
Código
ce391450
Banca
CESPE / CEBRASPE
Órgão
TCE RN
Ano
2026
Cargo
AudCE ( )
Julgue o item subsequente, relativo a mineração de dados.   Na etapa de pré-processamento, a normalização e a padronização são técnicas distintas: a normalização muda a escala dos valores para um intervalo fixo (geralmente entre 0 e 1), enquanto a padronização transforma os dados para que tenham média zero e desvio padrão igual a 1, sendo esta segunda mais adequada quando os dados possuem outliers severos.
  1. CCerto
  2. EErrado
Revelar gabarito e comentário

GabaritoE — Errado

Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.

Mineração de dados: normalização × padronização no pré-processamento

Gabarito: ERRADO. A afirmativa está incorreta porque, embora a definição de normalização (reescalonar para um intervalo fixo, geralmente [0,1]) e a de padronização (transformar para média 0 e desvio padrão 1) estejam corretas, a conclusão final inverte a recomendação prática: a padronização (z-score) é mais adequada quando os dados possuem outliers severos, e não a normalização min-max, que é sensível a outliers por depender do valor mínimo e máximo observados. O erro está na última oração do item.

A etapa de pré-processamento é uma das fases mais importantes do processo de mineração de dados (KDD — Knowledge Discovery in Databases), pois a qualidade dos dados de entrada determina diretamente a qualidade dos modelos gerados. Dentro dessa etapa, a transformação de escala é uma técnica fundamental, especialmente para algoritmos baseados em distância (como k-NN, SVM e k-means), que são dominados pela variável de maior magnitude — sem o reescalonamento, uma variável que varia de 0 a 100.000 teria influência desproporcional sobre uma que varia de 0 a 1.

A normalização (também chamada de min-max scaling) reescala os dados para um intervalo fixo, geralmente [0, 1], por meio da fórmula x=xxminxmaxxminx' = \frac{x - x_{min}}{x_{max} - x_{min}}. Ela é simples e intuitiva, mas tem uma fragilidade conhecida: como depende dos valores mínimo e máximo observados, é altamente sensível a outliers. Um único valor extremo pode comprimir todos os demais valores em uma faixa muito estreita, distorcendo a distribuição original.

A padronização (também chamada de z-score ou standardization) transforma os dados para que tenham média 0 e desvio padrão 1, por meio da fórmula z=xμσz = \frac{x - \mu}{\sigma}. Diferentemente da normalização, ela não depende dos valores extremos, mas sim da média e do desvio padrão — medidas que são mais robustas à presença de outliers. Por isso, quando os dados possuem outliers severos, a padronização é a técnica recomendada, pois preserva melhor a forma da distribuição e não comprime os dados em um intervalo artificialmente estreito.

A pegadinha da banca está exatamente na última oração: o item afirma que a padronização é mais adequada quando há outliers severos, mas a recomendação correta é o oposto — a normalização min-max é que sofre com outliers, enquanto a padronização é mais robusta a eles. É uma inversão clássica de recomendação, que confunde o candidato que conhece as definições mas não domina as implicações práticas de cada técnica.

Guarde a fronteira decisiva: normalização = depende de min/max (sensível a outliers); padronização = depende de média/desvio (robusta a outliers). É exatamente nessa distinção que o item se divide — a definição conceitual está certa, mas a aplicação prática está invertida.

Item — ❌ ERRADO

A afirmativa contém três partes: (1) a definição de normalização, (2) a definição de padronização e (3) a recomendação sobre qual usar com outliers severos. As duas primeiras estão corretas, mas a terceira está invertida.

A normalização de fato reescala os valores para um intervalo fixo, geralmente [0, 1], usando os valores mínimo e máximo. A padronização de fato transforma os dados para média 0 e desvio padrão 1, usando a média e o desvio padrão da amostra. Até aqui, o item está correto.

O erro está na conclusão: a padronização é mais adequada quando os dados possuem outliers severos — e não a normalização. A normalização min-max é justamente a técnica mais sensível a outliers, pois um valor extremo distorce o intervalo e comprime os demais valores. A padronização, por usar média e desvio padrão, é mais robusta e preserva melhor a distribuição dos dados na presença de outliers.

NÃO CAIA NESSA!

Para fixar, lembre-se do par: min-max = mínimo e máximo = sensível a outlier; z-score = média e desvio = robusto a outlier. Na prova, quando a questão mencionar outliers severos, a resposta quase sempre aponta para a padronização — e a banca adora inverter essa recomendação, como fez aqui.

Gabarito: ERRADO.

Link permanente: /questoes/ce391450