Pular para o conteúdo principal

Questão de Banco de Dados — ETL (Extract Transform Load) — FCC 2026

Banco de DadosETL (Extract Transform Load)
Código
fc077304
Banca
FCC
Órgão
SEFAZ-SP
Ano
2026
Nível
Superior
Cargo
Auditor Fiscal da Receita Estadual - AFRE - Gestão Tributária - Conhecimentos Específicos (P3)
Uma Secretaria da Fazenda Estadual recebeu uma base de dados contendo 2,3 milhões de registros de declarações fiscais para análise de conformidade tributária. Durante a fase de exploração inicial, a equipe técnica identificou diversos problemas: campos de CNPJ com formatações inconsistentes (alguns com pontuação, outros sem), valores monetários registrados com separadores decimais divergentes (vírgula e ponto), datas em formatos distintos (DD/MM/AÄAA, AAAA-MM-DD), campos obrigatórios vazios em aproximadamente 12% dos registros, e a presença de valores extremos de receita bruta (outliers) que distorciam as análises estatísticas. Além disso, a variável "regime tributário" apresentava categorias redundantes devidoa erros de digitação (ex: "Simples Nacional", "SIMPLES NACIONAL", "Simples nacional"). Para viabilizar a análise de risco fiscal e a construção de modelos preditivos, tornou-se necessário aplicar técnicas sistemáticas de preparação dos dados antes do processamento analítico. Considerando as melhores práticas de pré-processamento de dados, o tratamento correto e adequado para essa situação é
  1. Aaplicar tokenização em campos textuais para fragmentar as informações em unidades menores, utilização de técnicas de stemming e lemmatização para uniformizar as categorias de regime tributário, implementação de métodos de detecção de anomalias baseados em Isolation Forest para identificar registros fiscais suspeitos e preenchimento de valores ausentes mediante algoritmos de interpolação linear ou polinomial, assegurando a completude da base de dados para processamento posterior.
  2. Biniciar com a aplicação de técnicas de feature scaling através de padronização z-score em todas as variáveis numéricas para centralizá-las em média zero e desvio padrão unitário, seguida de codificação ordinal para variáveis categóricas respeitando hierarquias naturais, detecção de outliers multivariados mediante distância de Mahalanobis e imputação de dados faltantes exclusivamente por valores constantes predefinidos conforme regras de negócio tributário, evitando métodos estatísticos que alterem distribuições originais.
  3. Cpriorizar, inicialmente, a exclusão automática de todos os registros que apresentem campos obrigatórios vazios, seguida da aplicação de técnicas de winsorização para substituir valores extremos pelos percentis 5 e 95, padronização das strings mediante conversão para maiúsculas e remoção de acentuação, garantindo assim a integridade da base sem necessidade de imputação de dados faltantes que poderia introduzir viés nas análises tributárias.
  4. Daplicar técnicas de normalização min-max em todas as variáveis numéricas para escaloná-las entre 0 e 1, realizar a codificação one-hot encoding nas variáveis categóricas incluindo a variável regime tributário, implementar detecção de outliers através do método de Tukey (IQR) com remoção automática dos valores identificados e utilizar forward fill para preencher dados faltantes sequencialmente, preservando a ordenação temporal dos registros fiscais.
  5. Epadronizar formatos mediante expressões regulares para unificar CNPJ, valores monetários e datas em padrões consistentes, tratamento de dados faltantes através de análise contextual para decidir entre imputação (por média, mediana ou algoritmos como KNN) ou exclusão baseada em criticidade, normalização de texto com conversão para caixa baixa, remoção de espaços extras para eliminar duplicatas categóricas e análise criteriosa de outliers distinguindo valores legítimos de erros de registro antes de qualquer ação corretiva.
Revelar gabarito e comentário

GabaritoE — padronizar formatos mediante expressões regulares para unificar CNPJ, valores monetários e datas em padrões consistentes, tratamento de dados faltantes através de análise contextual para decidir entre imputação (por média, mediana ou algoritmos como KNN) ou exclusão baseada em criticidade, normalização de texto com conversão para caixa baixa, remoção de espaços extras para eliminar duplicatas categóricas e análise criteriosa de outliers distinguindo valores legítimos de erros de registro antes de qualquer ação corretiva.

Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.

Pré-processamento de dados em ETL — Tratamento adequado

Gabarito: letra E. A alternativa E propõe um tratamento sistemático e contextual: padronização de formatos via expressões regulares, análise contextual para dados faltantes (imputação ou exclusão conforme criticidade), normalização de texto (caixa baixa, remoção de espaços) para unificar categorias, e análise criteriosa de outliers distinguindo valores legítimos de erros. Essa abordagem segue as melhores práticas da fase de transformação do ETL, que envolve limpeza, deduplicação, revisão de formato e validação de dados conforme o conteúdo de apoio.

A questão descreve problemas típicos de uma base de dados real: inconsistências em CNPJ, valores monetários, datas, campos vazios (12%), outliers e categorias redundantes. O tratamento correto deve resolver cada um desses pontos de forma integrada, sem descartar informações importantes ou aplicar técnicas inadequadas.

Critério

Alternativa A

Alternativa B

Alternativa C

Alternativa D

Alternativa E (Gabarito)

Padronização de formatos (CNPJ, moeda, data)

Não aborda diretamente

Não aborda diretamente

Parcial (apenas strings)

Não aborda diretamente

Sim, via expressões regulares

Tratamento de dados faltantes

Interpolação linear/polinomial (inadequada)

Imputação por constantes fixas (enviesada)

Exclusão automática de 12% (perde informação)

Forward fill (presume ordenação temporal)

Análise contextual: imputação ou exclusão conforme criticidade

Unificação de categorias redundantes (ex.: regime tributário)

Stemming/lematização (inadequado para categorias curtas)

Codificação ordinal (hierarquia nem sempre existe)

Conversão para maiúsculas e remoção de acentos (parcial)

One-hot encoding (não resolve redundância prévia)

Normalização de texto: caixa baixa e remoção de espaços extras

Tratamento de outliers

Isolation Forest (plausível, mas mistura técnicas)

Distância de Mahalanobis (supõe normalidade)

Winsorização fixa (percentis 5 e 95, sem distinguir erros)

Tukey (IQR) com remoção automática (descarta valores legítimos)

Análise criteriosa: distingue valores legítimos de erros de registro

Abordagem geral

Foco em PLN e interpolação, inadequada para dados fiscais

Prematura (z-score antes de tratar outliers) e rígida

Drástica (exclusão em massa) e mecânica

Automática e sequencial, sem contexto

Sistemática e contextual, seguindo boas práticas de ETL

Alternativa A — ❌ Incorreta

Tokenização, stemming e lemmatization são técnicas de processamento de linguagem natural (PLN) para texto livre, inadequadas para categorias curtas como "Simples Nacional". Interpolação linear/polinomial para valores ausentes pressupõe dados ordenados ou com relação funcional, o que não é o caso de variáveis fiscais transversais. Isolation Forest para detecção de anomalias é plausível, mas a mistura de técnicas mostra falta de foco nos problemas reais.

Alternativa B — ❌ Incorreta

Aplicar z-score em todas as variáveis numéricas é prematuro antes de tratar outliers e missing, pois o z-score é sensível a eles. Codificação ordinal exige hierarquia natural nem sempre presente (ex.: regime tributário não tem ordem). Distância de Mahalanobis supõe normalidade multivariada, rara em dados reais. Imputação por constantes fixas introduz viés e ignora a análise contextual.

Alternativa C — ❌ Incorreta

Excluir automaticamente registros com campos vazios (12% da base) descarta informação valiosa e pode enviesar a análise. Winsorização substitui outliers por percentis fixos (5 e 95) sem distinguir erros de valores legítimos. A padronização de strings (maiúsculas e sem acentos) resolve parte do problema de redundância, mas a abordagem agressiva não é a mais adequada.

Alternativa D — ❌ Incorreta

Normalização min-max é sensível a outliers — mais adequada após tratamento deles. One-hot encoding é correto para variáveis nominais, mas não substitui a etapa de padronização de formatos. Remoção automática de outliers via IQR pode eliminar dados legítimos (ex.: grandes contribuintes). Forward fill é apropriado apenas para séries temporais, não para dados fiscais sem ordenação temporal explícita.

Alternativa E — ✅ Correta ⟵ GABARITO

A alternativa E segue uma sequência lógica e contextual: (1) padronização de formatos com expressões regulares (resolve CNPJ, valores, datas); (2) tratamento contextual de missing (imputação por média/mediana/KNN ou exclusão baseada em criticidade, evitando perda desnecessária); (3) normalização de texto (caixa baixa, remoção de espaços) que unifica categorias como "Simples Nacional"; (4) análise criteriosa de outliers, distinguindo erros de valores legítimos antes de agir. Essa abordagem respeita as melhores práticas de pré-processamento e a fase de transformação do ETL, conforme descrito no conteúdo de apoio: "limpeza, deduplicação, revisão de formato, validação de dado".

Gabarito: letra E

Link permanente: /questoes/fc077304