Questão de Banco de Dados — Data Mining — FCC 2025
Banco de Dados›Data Mining
Código
fc074745
Banca
FCC
Órgão
TRT - 15ª Região (SP)
Ano
2025
Nível
Superior
Cargo
Analista Judiciário - Área Apoio Especializado - Especialidade Tecnologia da Informação
Uma equipe está trabalhando em um projeto de análise preditiva com base em dados estruturados provenientes de diferentes fontes de um Tribunal Regional do Trabalho. Durante a etapa de pré-processamento, o time precisa lidar com valores ausentes/faltantes, escalonar os dados para uniformizar as unidades e selecionar as variáveis mais importantes para treinar um modelo supervisionado. Para realizar estas tarefas nesta etapa, a equipe deve
Autilizar uma Convolutional Neural Network (CNN) para preencher valores ausentes, normalizar os dados com a técnica Principal Component Analysis (PCA) e realizar redução dimensional com regressão logística.
Baplicar a imputação de valores ausentes, escalonar os dados utilizando-se CNN e identificar variáveis importantes por meio da análise
Cpreencher os valores ausentes com imputação (média ou mediana), escalonar os dados com standard scaler e realizar a seleção de variáveis com base na importância de features calculada por um modelo de árvore de decisão.
Dremover diretamente todas as linhas com valores ausentes, normalizar os dados com decomposição em valores singulares (SVD) e utilizar o algoritmo k-means para selecionar variáveis mais relevantes.
Eusar o algoritmo supervisionado análise de cluster hierárquico (HCA) para prever valores ausentes, aplicar normalização z-score nos dados e calcular a importância das variáveis com uma rede neural profunda.
Revelar gabarito e comentário▾
GabaritoC — preencher os valores ausentes com imputação (média ou mediana), escalonar os dados com standard scaler e realizar a seleção de variáveis com base na importância de features calculada por um modelo de árvore de decisão.
Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.
Pré-processamento em Data Mining
Gabarito: letra C. A alternativa C reúne corretamente as três técnicas adequadas para dados estruturados: imputação (média/mediana) para valores ausentes, standard scaler para escalonamento (normalização z-score) e importância de features de árvore de decisão para seleção supervisionada de variáveis. As demais misturam técnicas impróprias (CNN, PCA, SVD, k-means, HCA) ou invertem papéis de pré-processamento e modelagem.
A banca testa o conhecimento de técnicas clássicas de pré-processamento, que são essenciais antes da mineração. Veja cada alternativa:
Alternativa A — ❌ Incorreta
CNNs são projetadas para dados de imagem, não para preencher valores ausentes em dados estruturados. PCA é técnica de redução dimensional, não de normalização. Regressão logística é um modelo de classificação, não serve para redução dimensional.
Alternativa B — ❌ Incorreta
Embora a imputação esteja correta, escalonar dados com CNN é inadequado (CNN não é técnica de escalonamento). A parte sobre identificação de variáveis está incompleta no enunciado, mas o uso de CNN para escalonamento já invalida a alternativa.
Alternativa C — ✅ Correta ⟵ GABARITO
Aqui cada etapa é atendida corretamente:
Valores ausentes: imputação pela média ou mediana (técnica simples e eficaz).
Escalonamento: standard scaler (normalização z-score) que transforma os dados para média 0 e desvio padrão 1, uniformizando as unidades.
Seleção de variáveis: árvores de decisão fornecem a importância de cada feature, permitindo selecionar as mais relevantes para o modelo supervisionado.
Alternativa D — ❌ Incorreta
Remover todas as linhas com valores ausentes não é boa prática (pode perder amostras importantes). SVD é decomposição em valores singulares, usada para redução dimensional, não para normalização. K-means é algoritmo de clusterização não supervisionado, inadequado para seleção de variáveis em contexto supervisionado.
Alternativa E — ❌ Incorreta
HCA (Hierarchical Cluster Analysis) é não supervisionado e não serve para prever valores ausentes (seria imputação). Normalização z-score está correta, mas o uso de rede neural profunda para calcular importância de variáveis não é típico (embora possível) e a alternativa como um todo é confusa e não segue a melhor prática.
PEGA ESSA DICA!
Para pré-processamento em problemas supervisionados com dados estruturados, lembre-se da tríade: imputação (média, mediana, moda), escalonamento (standard scaler ou min-max scaler) e seleção de variáveis (importância de árvore, correlação, técnicas wrapper). Evite confundir técnicas de redução dimensional (PCA, SVD) com normalização, e algoritmos não supervisionados (k-means, HCA) com seleção supervisionada.