Questão de Banco de Dados — Data Mining — FGV 2026
Banco de Dados›Data Mining
Código
fg125982
Banca
FGV
Órgão
AL-GO
Ano
2026
Nível
Superior
Cargo
Analista Legislativo - Analista de Ciência de Dados
Os analistas de Ciência de Dados da ALEGO reconhecem que a abordagem tradicional de análise de dados envolve um ciclo composto por diversas etapas e uma vez que tenham definidos seus modelos preditivos, eles podem ser aplicados a novos conjuntos de dados. A figura criada pelos analistas representa um ciclo de análise preditiva e score de dados. Analise a figura e relacione a numeração indicada nas etapas com as suas respectivas operações.A relação correta, na ordem dada, é:
A1 = Operações de Integração de Dados,2 = Operações de Extração de Dados,3 = Operações de Preparação de Dados,4 = Operações de Construção de Modelos e Score.
B1 = Operações de Preparação de Dados,2 = Operações de Extração de Dados,3 = Operações de Construção de Modelos e Score,4 = Operações de Integração de Dados.
C1 = Operações de Construção de Modelos e Score,2 = Operações de Preparação de Dados,3 = Operações de Integração de Dados,4 = Operações de Extração de Dados.
D1 = Operações de Extração de Dados,2 = Operações de Integração de Dados,3 = Operações de Construção de Modelos e Score,4 = Operações de Preparação de Dados.
E1 = Operações de Extração de Dados,2 = Operações de Integração de Dados,3 = Operações de Preparação de Dados,4 = Operações de Construção de Modelos e Score.
Revelar gabarito e comentário▾
GabaritoE — 1 = Operações de Extração de Dados,
2 = Operações de Integração de Dados,
3 = Operações de Preparação de Dados,
4 = Operações de Construção de Modelos e Score.
Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.
Ciclo de análise preditiva e score de dados
Gabarito: letra E. A sequência correta do ciclo de análise preditiva é: 1 = Extração de Dados, 2 = Integração de Dados, 3 = Preparação de Dados, 4 = Construção de Modelos e Score. Essa ordem reflete o fluxo natural do processo de descoberta de conhecimento em bases de dados (KDD), no qual os dados brutos são primeiro extraídos das fontes, depois integrados em um repositório único, em seguida preparados (limpeza, transformação) para, finalmente, serem usados na construção de modelos preditivos e na geração de scores.
O ciclo de análise preditiva é uma aplicação prática do processo de Knowledge Discovery in Databases (KDD), que organiza o trabalho do cientista de dados em etapas sequenciais e interdependentes. A figura da questão representa exatamente esse fluxo, e a banca cobra o conhecimento da ordem lógica dessas operações. Vamos entender cada uma delas em profundidade, porque é isso que permite acertar a questão sem depender da imagem.
Extração de Dados é o ponto de partida: consiste em coletar os dados brutos de suas fontes originais, que podem ser bancos de dados transacionais (OLTP), planilhas, arquivos texto, APIs, entre outros. É a operação de "puxar" os dados de onde eles estão armazenados para o ambiente de análise. Sem extração, não há matéria-prima para trabalhar.
Integração de Dados é a etapa seguinte, na qual os dados extraídos de diferentes fontes são combinados em um repositório único e coerente. Aqui entram os processos de ETL (Extract, Transform, Load), que consolidam dados heterogêneos, resolvem conflitos de formato e criam uma visão unificada. A integração é necessária porque, em geral, os dados relevantes para uma análise preditiva estão espalhados em vários sistemas.
Preparação de Dados (também chamada de pré-processamento) é a fase de limpeza e transformação: remoção de erros e inconsistências, tratamento de valores ausentes, normalização, redução de dimensionalidade e criação de novos atributos. É aqui que os dados são moldados para se tornarem adequados aos algoritmos de mineração. Essa etapa é crucial porque a qualidade do modelo final depende diretamente da qualidade dos dados de entrada — o conhecido princípio "garbage in, garbage out".
Construção de Modelos e Score é a etapa final do ciclo, na qual os algoritmos de machine learning e data mining são aplicados sobre os dados preparados para identificar padrões, fazer previsões e gerar scores (pontuações) para novos registros. É o momento em que o modelo preditivo é treinado, validado e, uma vez definido, aplicado a novos conjuntos de dados — exatamente como descreve o enunciado.
A pegadinha desta questão está na tentativa de inverter a ordem das etapas intermediárias, especialmente entre Integração e Preparação. Muitos candidatos confundem a sequência, colocando a Preparação antes da Integração, mas o fluxo lógico exige primeiro unificar as fontes (Integração) e só então limpar e transformar o conjunto integrado (Preparação). A banca explora essa confusão nas alternativas B e D.
Guarde a sequência canônica: Extração → Integração → Preparação → Modelagem/Score. É exatamente essa ordem que as alternativas tentam embaralhar, e é nela que você deve se apoiar para resolver a questão.
Etapa
Operação
Descrição resumida
1
Extração de Dados
Coleta dos dados brutos das fontes originais (bancos, APIs, arquivos)
2
Integração de Dados
Combinação dos dados extraídos em um repositório único e coerente
3
Preparação de Dados
Limpeza, transformação e tratamento de inconsistências para adequar os dados
4
Construção de Modelos e Score
Aplicação de algoritmos preditivos e geração de scores para novos dados
Alternativa A — ❌ Incorreta
Inverte as duas primeiras etapas: coloca a Integração (1) antes da Extração (2). O fluxo lógico exige primeiro extrair os dados das fontes e somente depois integrá-los em um repositório único. Não é possível integrar dados que ainda não foram extraídos.
Alternativa B — ❌ Incorreta
Começa com Preparação (1), o que está errado: antes de preparar, é preciso extrair e integrar os dados. Além disso, coloca a Extração (2) depois da Preparação, invertendo completamente a ordem natural do processo. A Preparação é uma etapa intermediária, que pressupõe dados já extraídos e integrados.
Alternativa C — ❌ Incorreta
Inverte totalmente o fluxo, começando pela Construção de Modelos (1), que é a etapa final, e terminando com a Extração (4), que é a etapa inicial. A ordem apresentada é o oposto do ciclo correto, o que demonstra desconhecimento do processo sequencial de análise preditiva.
Alternativa D — ❌ Incorreta
Acerta as duas primeiras etapas (Extração e Integração), mas troca as duas últimas: coloca Construção de Modelos (3) antes de Preparação (4). A Preparação dos dados é pré-requisito para a construção de modelos — não se pode modelar sobre dados não preparados. A ordem correta das etapas finais é Preparação → Construção de Modelos.
Alternativa E — ✅ Correta ⟵ GABARITO
Apresenta exatamente a sequência canônica do ciclo de análise preditiva: Extração (1) → Integração (2) → Preparação (3) → Construção de Modelos e Score (4). Essa ordem reflete o processo de KDD, no qual os dados são primeiro coletados das fontes, depois unificados, em seguida limpos e transformados, e finalmente utilizados para treinar modelos preditivos e gerar scores para novos dados.
PEGA ESSA DICA!
Para questões de ciclo de análise de dados, memorize a sequência E-I-P-M (Extração, Integração, Preparação, Modelagem). Na prova, identifique primeiro qual etapa é a inicial (Extração) e qual é a final (Modelagem/Score) — isso elimina imediatamente as alternativas que invertem o fluxo. Depois, foque na ordem das etapas intermediárias: Integração sempre antes de Preparação, pois é preciso unificar as fontes antes de limpar e transformar o conjunto integrado.