Questão de Banco de Dados — Banco de Dados — FUNDATEC 2023
Banco de Dados›Banco de Dados
Código
qq890145
Banca
FUNDATEC
Órgão
BRDE
Ano
2023
Nível
Superior
Cargo
Analista de Sistemas - Ciência de Dados
A análise de dados depende diretamente de dados representativos, válidos e sem viés. Assinale a alternativa correta relativa às técnicas de pré-processamento de dados.
ARemover todas as colunas que possuem valores nulos ou faltantes.
BTransformar atributos numéricos em nominais, pois os algoritmos têm um melhor desempenho com texto.
CManter os dados como nas fontes originais, permitindo haver escalas de ordens de grandezas diferentes.
DRemover outliers se os valores estiverem fora do intervalo estatístico esperado quando eles podem influenciar negativamente o resultado da análise.
ERemover todas as colunas que possuem pelo menos um valor inválido.
Revelar gabarito e comentário▾
GabaritoD — Remover outliers se os valores estiverem fora do intervalo estatístico esperado quando eles podem influenciar negativamente o resultado da análise.
Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.
Pré-processamento de dados
Gabarito: letra D. A remoção de outliers estatisticamente significativos e que possam distorcer a análise é uma técnica válida de pré-processamento. As demais alternativas apresentam práticas inadequadas ou excessivamente radicais.
A alternativa A propõe remover todas as colunas com valores nulos, o que descarta informações úteis e desnecessariamente reduz a dimensionalidade. Técnicas como imputação (média, mediana, regressão) ou remoção apenas de linhas com muitos nulos são mais adequadas.
A alternativa B sugere converter atributos numéricos em nominais (categóricos) porque algoritmos teriam melhor desempenho com texto – isso é incorreto. A maioria dos algoritmos de aprendizado de máquina exige entrada numérica; a conversão para texto ou categorias perde a informação ordinal e a relação quantitativa, além de exigir codificação adicional (one-hot, label encoding).
A alternativa C defende manter os dados sem normalização/escalonamento, mesmo com ordens de grandeza diferentes. Na prática, atributos com escalas muito distintas (ex.: idade 0–100 vs. renda 0–10⁶) podem dominar modelos baseados em distância (KNN, SVM, redes neurais) ou gradiente, sendo essencial aplicar normalização ou padronização.
A alternativa D está correta: outliers podem ser removidos quando são fruto de erro de medição, ruído ou não representam a população de interesse, e quando sua presença prejudica a performance do modelo. A decisão deve ser baseada em critérios estatísticos (intervalo interquartil, Z-score, etc.) e conhecimento de domínio.
A alternativa E repete o erro da letra A de forma ainda mais drástica: remover toda coluna que tenha ao menos um valor inválido elimina muitas variáveis potencialmente úteis. Valores inválidos podem ser tratados com limpeza, correção ou imputação.
Portanto, apenas a alternativa D apresenta uma prática recomendada e condizente com as boas técnicas de pré-processamento de dados.