Pular para o conteúdo principal

Questão de TI - Ciência de Dados e Inteligência Artificial — Conceitos Gerais de Machine Learning — FGV 2024

TI - Ciência de Dados e Inteligência ArtificialConceitos Gerais de Machine Learning
Código
fg165302
Banca
FGV
Órgão
CGE PB
Ano
2024
Cargo
ACP ( )

No contexto de pré-processamento de dados, o auditor de contas públicas João está trabalhando em um projeto de análise de dados e percebe que as variáveis numéricas no conjunto de dados têm escalas muito diferentes, como a escala dos preços sendo maior do que a escala dos pesos, como demonstrado nos produtos A e B:

 

\bullet Produto A (Preço: R$ 50 e Peso: 300g)

 

\bullet Produto B (Preço: R$ 500 e Peso: 1000g)

 

Além disso, ele observa a presença de outliers nos dados. Nesse sentido, João deverá tratar os dados para garantir que as variáveis tenham uma distribuição normal, isto é, com média igual a zero e desvio padrão igual a um.

 

Para isso, a técnica de tratamento de dados que João deverá utilizar, levando em consideração a presença de outliers, é:

  1. Adiscretização (kbins discretization);
  2. Bcodificação (one-hot encoding);
  3. Cnormalização (min-max scaling);
  4. Dpadronização (standardization Z-Score);
  5. Etransformação logarítmica (log transformation).
Revelar gabarito e comentário

GabaritoD — padronização (standardization Z-Score);

Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.

Padronização (Z-Score) vs. Normalização (Min-Max) no pré-processamento de dados

Gabarito: letra D. João deve usar a padronização (standardization Z-Score), pois ela transforma os dados para que tenham média 0 e desvio padrão 1, exatamente o que o enunciado pede, e é robusta à presença de outliers — ao contrário da normalização min-max, que é sensível a valores extremos. A técnica é amplamente utilizada em machine learning e estatística para colocar variáveis em escalas comparáveis.

A padronização (ou standardization) é uma técnica de pré-processamento que reescala as variáveis numéricas para que tenham média zero e desvio padrão um. A fórmula é:

z=xμσz = \frac{x - \mu}{\sigma}

onde xx é o valor original, μ\mu é a média da variável e σ\sigma é o desvio padrão. O resultado é uma distribuição com média 0 e desvio padrão 1, o que é exatamente o que João precisa. Essa transformação é recomendada quando há outliers, pois o desvio padrão é uma medida que considera todos os valores, mas a padronização não é tão influenciada por valores extremos quanto a normalização min-max, que usa o mínimo e o máximo — valores que são diretamente afetados por outliers.

Vamos aplicar a fórmula aos dados do enunciado para ver como funciona na prática. Para o Produto A (Preço: R$ 50, Peso: 300g) e Produto B (Preço: R$ 500, Peso: 1000g), primeiro calculamos a média e o desvio padrão de cada variável:

  • Preço: média = (50 + 500) / 2 = 275; desvio padrão = √[((50-275)² + (500-275)²) / 2] = √[(50625 + 50625) / 2] = √50625 = 225.

  • Peso: média = (300 + 1000) / 2 = 650; desvio padrão = √[((300-650)² + (1000-650)²) / 2] = √[(122500 + 122500) / 2] = √122500 = 350.

Agora, padronizamos cada valor:

  • Produto A: Preço z = (50 - 275) / 225 = -1; Peso z = (300 - 650) / 350 = -1.

  • Produto B: Preço z = (500 - 275) / 225 = 1; Peso z = (1000 - 650) / 350 = 1.

Após a padronização, ambas as variáveis têm média 0 e desvio padrão 1, e os valores estão na mesma escala, o que permite compará-los diretamente. Note que, com apenas dois pontos, os valores padronizados são sempre -1 e 1, mas o conceito se aplica a qualquer conjunto de dados.

A principal distinção que a banca explora é entre padronização (Z-Score) e normalização (Min-Max). Enquanto a padronização usa média e desvio padrão, a normalização min-max usa mínimo e máximo para reescalar os dados para um intervalo fixo, geralmente [0, 1]:

xnorm=xmin(x)max(x)min(x)x_{norm} = \frac{x - \min(x)}{\max(x) - \min(x)}

A normalização min-max é sensível a outliers, pois um valor extremo pode comprimir os demais valores em um intervalo muito pequeno. Por exemplo, se houvesse um preço de R$ 10.000, o valor R$ 500 ficaria muito próximo de 0, distorcendo a distribuição. A padronização, por outro lado, é menos afetada por outliers, pois o desvio padrão é uma medida mais robusta do que a amplitude.

A pegadinha desta questão está em associar a necessidade de "distribuição normal" com a normalização min-max, quando na verdade o que se pede é média 0 e desvio padrão 1, que é a definição de padronização. Além disso, a presença de outliers é um indicador claro de que a padronização é a escolha correta, pois a normalização min-max seria inadequada.

Guarde a fronteira entre padronização e normalização: padronização = média 0 e desvio 1, robusta a outliers; normalização = intervalo [0,1], sensível a outliers. É exatamente nessa fronteira que as alternativas se dividem.

Critério

Padronização (Z-Score)

Normalização (Min-Max)

Fórmula

(z=xμσ)( z = \frac{x - \mu}{\sigma} )

xnorm=xmin(x)max(x)min(x)x_{norm} = \frac{x - \min(x)}{\max(x) - \min(x)}

Resultado

Média 0 e desvio padrão 1

Intervalo fixo, geralmente [0, 1]

Sensibilidade a outliers

Robusta (usa desvio padrão)

Sensível (usa mínimo e máximo)

Adequação ao caso de João

✅ Atende ao requisito de média 0 e desvio 1

❌ Não atende ao requisito e é inadequada com outliers

Alternativa A — ❌ Incorreta

A discretização (KBinsDiscretizer) é uma técnica que transforma variáveis contínuas em variáveis categóricas, dividindo o intervalo de valores em bins (intervalos). Ela não tem relação com a padronização para média 0 e desvio padrão 1, e não é indicada para lidar com outliers dessa forma. O objetivo da discretização é simplificar a variável, não reescalá-la.

Alternativa B — ❌ Incorreta

A codificação one-hot encoding é usada para transformar variáveis categóricas em variáveis numéricas binárias (0 ou 1), criando uma coluna para cada categoria. Não se aplica a variáveis numéricas contínuas e não realiza qualquer reescalonamento. É uma técnica de codificação, não de padronização.

Alternativa C — ❌ Incorreta

A normalização (min-max scaling) reescala os dados para um intervalo fixo, geralmente [0, 1], usando a fórmula xnorm=xmin(x)max(x)min(x)x_{norm} = \frac{x - \min(x)}{\max(x) - \min(x)}. Embora seja uma técnica de reescalonamento, ela não garante média 0 e desvio padrão 1 — apenas coloca os valores em um intervalo. Além disso, é sensível a outliers, pois o mínimo e o máximo são diretamente afetados por valores extremos, o que a torna inadequada quando há outliers, como no caso de João.

Alternativa D — ✅ Correta ⟵ GABARITO

A padronização (standardization Z-Score) transforma os dados para que tenham média 0 e desvio padrão 1, exatamente o que o enunciado pede. A fórmula é z=xμσz = \frac{x - \mu}{\sigma}, onde μ\mu é a média e σ\sigma é o desvio padrão. Essa técnica é robusta à presença de outliers, pois o desvio padrão é uma medida que considera a dispersão de todos os valores, mas não é tão influenciada por valores extremos quanto a amplitude (máx - mín). Portanto, é a escolha correta para o cenário descrito.

Alternativa E — ❌ Incorreta

A transformação logarítmica (log transformation) aplica o logaritmo aos dados, o que pode ajudar a reduzir a assimetria e a influência de outliers, mas não garante média 0 e desvio padrão 1. Ela é útil para dados com distribuição assimétrica ou exponencial, mas não é a técnica adequada para o objetivo específico de padronizar para média 0 e desvio 1.

NÃO CAIA NESSA!

A banca troca a padronização (Z-Score) pela normalização (Min-Max), aproveitando que ambas são técnicas de reescalonamento. O candidato que vê "distribuição normal" pensa em normalização, mas o que define a resposta é o requisito de média 0 e desvio padrão 1, que é a assinatura da padronização. Além disso, a menção a outliers é uma pista: a normalização min-max é sensível a eles, enquanto a padronização é mais robusta. Fique atento a essa distinção clássica!

PEGA ESSA DICA!

Para diferenciar rapidamente na prova, lembre-se: padronização = Z-Score = média 0 e desvio 1; normalização = Min-Max = intervalo [0,1]. Se o enunciado pedir "média 0 e desvio padrão 1", a resposta é padronização. Se pedir "intervalo [0,1]", é normalização. E se houver outliers, prefira padronização.

Gabarito: letra D

Link permanente: /questoes/fg165302