Questão de Banco de Dados — Administração de banco de dados — FGV 2024
Banco de Dados›Administração de banco de dados
Código
fg077003
Banca
FGV
Órgão
CGE-PB
Ano
2024
Nível
Superior
Cargo
Auditor de Contas Públicas - Auditoria de Tecnologia da Informação
No contexto de pré-processamento de dados, o auditor de contas públicas João está trabalhando em um projeto de análise de dados e percebe que as variáveis numéricas no conjunto de dados têm escalas muito diferentes, como a escala dos preços sendo maior do que a escala dos pesos, como demonstrado nos produtos A e B:• Produto A (Preço: R$ 50 e Peso: 300g) • Produto B (Preço: R$ 500 e Peso: 1000g) Além disso, ele observa a presença de outliers nos dados. Nesse sentido, João deverá tratar os dados para garantir que as variáveis tenham uma distribuição normal, isto é, com média igual a zero e desvio padrão igual a um. Para isso, a técnica de tratamento de dados que João deverá utilizar, levando em consideração a presença de outliers, é:
Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.
Pré-processamento de dados: Padronização (Z-Score)
Gabarito: letra D. A técnica que transforma variáveis para terem média zero e desvio padrão um, mesmo na presença de outliers, é a padronização Z-Score. As demais opções não atingem esse objetivo: min-max scaling não garante média zero e é sensível a outliers; log transformation não garante média e desvio padrão específicos; discretização e codificação não são adequadas para normalizar distribuições.
O requisito central é obter uma distribuição com média 0 e desvio padrão 1. A padronização (Z-Score) calcula , exatamente o que se pede. As alternativas comuns, como min-max scaling (normalização), transformam para um intervalo [0,1], mas sem controle sobre média e desvio padrão, e são fortemente afetadas por outliers.
Característica
Min-Max Scaling
Z-Score Padronização
Fórmula
(X - min)/(max - min)
(X - μ)/σ
Média resultante
Qualquer (não garantida 0)
0
Desvio padrão resultante
Não garantido 1
1
Sensibilidade a outliers
Alta (depende de min/max)
Moderada (afeta μ e σ)
Mantém forma da distribuição?
Sim (apenas escala)
Sim (apenas desloca e escala)
Alternativa A — ❌ Incorreta
Discretização (kbins discretization) transforma variáveis contínuas em categóricas, não altera a distribuição para normal com média zero e desvio padrão um.
Alternativa B — ❌ Incorreta
One-hot encoding é usado para variáveis categóricas, não para normalizar variáveis numéricas.
Alternativa C — ❌ Incorreta
Normalização (min-max scaling) escala os dados para um intervalo [0,1] (ou outro) e não garante média zero e desvio padrão um. Além disso, é sensível a outliers, pois depende do valor mínimo e máximo.
Alternativa D — ✅ Correta ⟵ GABARITO
Padronização (standardization Z-Score) calcula Z = (X - μ)/σ, resultando em média 0 e desvio padrão 1. É a técnica que atende exatamente ao objetivo descrito.
Alternativa E — ❌ Incorreta
Transformação logarítmica (log transformation) reduz assimetria, mas não garante média zero nem desvio padrão um; o resultado tem distribuição aproximadamente normal, mas não padronizada.
NÃO CAIA NESSA!
Cuidado com o termo "normalização". Em pré-processamento de dados, "normalização" geralmente se refere a min-max scaling (reescalonamento para intervalo), enquanto "padronização" é o Z-Score. A banca explora essa confusão: a alternativa C (normalização min-max) parece tentadora, mas não atende ao requisito de média zero e desvio padrão um. Já a alternativa D (padronização) é a correta. Lembre-se: Z-Score = (valor - média) / desvio padrão.