Pular para o conteúdo principal

Questão de Noções de Informática — Inteligência Artificial e Automação — FGV 2025

Noções de InformáticaInteligência Artificial e Automação
Código
fg106555
Banca
FGV
Órgão
CGE-SP
Ano
2025
Nível
Superior
Cargo
Auditor Estadual de Controle - Tecnologia da Informação - tarde
Um cientista de dados da Controladoria está preparando um dataset de despesas públicas para ser utilizado em um algoritmo de Machine Learning baseado em distâncias como K-Nearest Neighbors - KNN.A coluna Valor_Despesa varia amplamente, com valores entre R$ 100,00 (mínimo) e R$ 5.000.000,00 (máximo).Assinale a opção que indica a técnica de Normalização Numérica mais adequada para reescalonar os dados da coluna Valor_Despesa, para que todos os seus valores sejam mapeados para um intervalo fixo entre 0 e 1.
  1. ADiscretização baseada em largura (Equal Width Binning).
  2. BPadronização (Standardization ou Z-Score).
  3. CDiscretização baseada em frequência.
  4. DCodificação One-Hot Encoding.
  5. ENormalização Min-Max.
Revelar gabarito e comentário

GabaritoE — Normalização Min-Max.

Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.

Técnicas de normalização numérica para KNN

Gabarito: letra E (Normalização Min-Max). A questão pede uma técnica que reescalone os dados da coluna Valor_Despesa (R$ 100 a R$ 5.000.000) para um intervalo fixo entre 0 e 1. A normalização Min-Max é a abordagem que exatamente faz isso: ela transforma cada valor através da fórmula (Xmin)/(maxmin)(X - \text{min}) / (\text{max} - \text{min}), resultando em valores no intervalo [0,1]. As demais opções ou são técnicas de discretização (que criam categorias) ou não garantem o intervalo fixo pedido.

Técnica

Tipo de transformação

Intervalo de saída

Preserva distribuição original

Adequada para KNN

Normalização Min-Max (E)

Reescala linear

[0,1] fixo

Sim (apenas redimensiona)

Sim

Padronização Z-Score (B)

Centralização por média/desvio

Valores negativos e positivos (>1)

Sim

Sim (mas não fixa em 0-1)

Discretização Equal Width (A)

Categorização em bins

Categorias discretas

Não (perde continuidade)

Não

Discretização por frequência (C)

Categorização em bins

Categorias discretas

Não (perde continuidade)

Não

One-Hot Encoding (D)

Codificação binária de categóricas

0 ou 1 (binário)

Não se aplica (variável numérica)

Não

Alternativa A — ❌ Incorreta

A discretização baseada em largura (Equal Width Binning) divide os dados em intervalos de mesma amplitude, mas não os mapeia para 0-1 de forma contínua. Ela transforma valores numéricos em categorias (bins), o que não atende ao requisito de reescalonamento linear para o intervalo [0,1].

Alternativa B — ❌ Incorreta

A padronização (Z-Score) transforma os dados para ter média 0 e desvio padrão 1. Após a padronização, os valores não ficam confinados entre 0 e 1; podem ser negativos ou maiores que 1. Portanto, não serve ao propósito da questão.

Alternativa C — ❌ Incorreta

A discretização baseada em frequência (também chamada de equal frequency binning) divide os dados em intervalos com o mesmo número de observações, novamente criando categorias. É uma técnica de discretização, não de normalização contínua.

Alternativa D — ❌ Incorreta

O One-Hot Encoding é uma técnica para transformar variáveis categóricas em uma representação binária (colunas de 0 e 1). Não se aplica a variáveis numéricas contínuas como Valor_Despesa.

Alternativa E — ✅ Correta ⟵ GABARITO

A normalização Min-Max (também chamada de normalização de reescala) é a técnica padrão para mapear valores numéricos para um intervalo fixo, geralmente [0,1]. A fórmula é:

X=XXminXmaxXminX' = \frac{X - X_{\min}}{X_{\max} - X_{\min}}

Para o dataset dado, Xmin=100X_{\min}=100 e Xmax=5.000.000X_{\max}=5.000.000, todos os valores serão convertidos para números entre 0 e 1, preservando a distribuição original e sendo adequada para algoritmos baseados em distância como KNN.

PEGA ESSA DICA!

Em pré-processamento para algoritmos de distância (KNN, SVM, k-means), a normalização Min-Max é preferida quando se conhece os limites dos dados e se deseja manter a escala original entre 0 e 1. Já a padronização (Z-score) é mais indicada quando os dados têm distribuição aproximadamente normal e se deseja remover a influência da escala sem forçar um intervalo fixo. Na dúvida, para intervalo fixo [0,1], use Min-Max.

Gabarito: letra E

Link permanente: /questoes/fg106555