Questão de Banco de Dados — DW - Data Warehouse — CESPE / CEBRASPE 2025
Banco de Dados›DW - Data Warehouse
Código
ce214848
Banca
CESPE / CEBRASPE
Órgão
SEFAZ-SE
Ano
2025
Nível
Superior
Cargo
Auditor Fiscal Tributário - Geral
No que diz respeito aos desafios e às técnicas de integração de dados, assinale a opção correta.
AEm ambientes com dados semiestruturados e não estruturados, a integração de dados limita-se à replicação dos dados originais, a fim de se evitarem perdas de informação.
BA integração de dados pode ser realizada sem políticas de qualidade e validação, pois qualquer inconsistência é detectada e corrigida automaticamente pelos sistemas de origem.
CO uso de middleware para integração de dados elimina a necessidade de mapeamento entre os esquemas heterogêneos dos diferentes sistemas.
DA utilização de um modelo unificado de dados e de um dicionário de dados corporativo é essencial para a resolução de conflitos semânticos e a garantia da governança da integração.
EA técnica de extração, transformação e carga (ETL) tradicional é insuficiente para integrar dados em tempo real, sendo necessária a adoção de processos ELT (extract, load, transform) em todos os casos.
Revelar gabarito e comentário▾
GabaritoD — A utilização de um modelo unificado de dados e de um dicionário de dados corporativo é essencial para a resolução de conflitos semânticos e a garantia da governança da integração.
Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.
Integração de dados: desafios e técnicas
Gabarito: letra D. Um modelo unificado de dados e um dicionário de dados corporativo são fundamentais para resolver conflitos semânticos entre fontes heterogêneas e garantir a governança da integração — essa é a única alternativa que reflete corretamente as boas práticas de integração de dados.
A banca testa o conhecimento sobre os desafios reais da integração: heterogeneidade de esquemas, qualidade dos dados, e a diferença entre abordagens ETL e ELT. Vamos analisar cada alternativa:
Alternativa A — ❌ Incorreta
Afirma que a integração de dados semiestruturados e não estruturados se limita à replicação para evitar perdas. Na prática, a integração envolve transformações (limpeza, padronização, enriquecimento) mesmo em dados não estruturados; replicar sem transformar não resolve conflitos semânticos e não garante a qualidade. Exemplo: textos extraídos de PDFs podem exigir tratamento de OCR e normalização antes de serem integrados.
Alternativa B — ❌ Incorreta
Diz que políticas de qualidade e validação são dispensáveis porque inconsistências seriam corrigidas automaticamente pelos sistemas de origem. Isso é falso: cada sistema de origem tem seus próprios padrões e limitações; não há detecção automática de todas as inconsistências. A integração exige regras de qualidade, limpeza e validação para garantir a confiabilidade dos dados no destino.
Alternativa C — ❌ Incorreta
Alega que o uso de middleware elimina a necessidade de mapeamento entre esquemas heterogêneos. Middleware (como um barramento de integração) facilita a comunicação, mas o mapeamento entre os diferentes modelos de dados continua sendo obrigatório para interpretar corretamente os dados de cada fonte. O middleware não resolve automaticamente as diferenças semânticas.
Alternativa D — ✅ Correta ⟵ GABARITO
Um modelo unificado de dados (como um esquema comum) e um dicionário de dados corporativo (catálogo de definições, significados e regras) são essenciais para tratar conflitos semânticos — por exemplo, duas fontes que chamam o mesmo conceito de nomes diferentes (ex.: "cliente" vs. "cliente_pf"). Eles também garantem a governança ao padronizar os dados e permitir rastreabilidade. É a alternativa que, conceitualmente, está mais alinhada com as boas práticas de integração.
Alternativa E — ❌ Incorreta
Afirma que ETL tradicional é insuficiente para integração em tempo real e que ELT seria necessária "em todos os casos". Embora ELT seja útil em cenários com data lakes e grandes volumes, existem outras abordagens para tempo real, como streaming ETL (usando ferramentas como Apache Kafka e Spark Streaming) ou Change Data Capture (CDC). A generalização "em todos os casos" torna a assertiva falsa.
Conclusão
A única alternativa que reflete corretamente um princípio fundamental da integração de dados é a letra D.