Questão de Banco de Dados — DW - Data Warehouse — FGV 2024
Banco de Dados›DW - Data Warehouse
Código
fg086773
Banca
FGV
Órgão
MF
Ano
2024
Nível
Superior
Cargo
Auditor Federal de Finanças e Controle - Área de Tecnologia da Informação (Transformação Digital) - manhã
Considere as seguintes afirmativas a respeito da diferença entre data warehouse e data lake.I. Tipicamente, data warehouses armazenam dados em esquemas definidos, o que permite otimizar consultas em SQL.II. Data lakes prestam-se a armazenar dados oriundos de fontes externas, tais como sensores e mídias sociais, dentre outras, com formatos diversificados e estruturas não completamente definidas.III. Embora haja diferenças importantes, ambos são implementados e operados por meio de Sistemas Gerenciados de Bancos de Dados (SGBD) e coletam dados por meio de ferramentas de ETL.Está correto somente o que se afirma em
AI.
BII.
CIII.
DI e II.
EII e III.
Revelar gabarito e comentário▾
GabaritoD — I e II.
Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.
Data Warehouse vs Data Lake: diferenças fundamentais
Gabarito: letra D — I e II estão corretas. Data warehouses armazenam dados estruturados em esquemas definidos (schema-on-write), otimizando consultas SQL. Data lakes armazenam dados brutos de variadas fontes (sensores, redes sociais) em formatos diversos, sem esquema rígido (schema-on-read). A afirmativa III erra ao dizer que ambos são implementados com SGBD — data lakes tipicamente usam sistemas de arquivos distribuídos (HDFS) ou armazenamento em nuvem, não SGBDs tradicionais. Além disso, data lakes frequentemente adotam ELT, não apenas ETL.
Característica
Data Warehouse (DW)
Data Lake
Esquema de armazenamento
Esquema definido (schema-on-write)
Esquema flexível (schema-on-read)
Tipo de dado
Dados estruturados
Dados estruturados, semiestruturados e não estruturados
Fonte típica de dados
Sistemas transacionais internos
Sensores, mídias sociais, logs, arquivos diversos
Tecnologia de armazenamento
SGBD relacional ou multidimensional
Sistema de arquivos distribuído (HDFS) ou armazenamento objeto (S3)
Processo de carga
ETL (Extract, Transform, Load)
ELT (Extract, Load, Transform)
Otimização de consulta
Otimizado para consultas SQL analíticas
Consultas variadas, dependem de processamento posterior
Armazenamento de dados
1Data Warehouse
Esquema definido (schema-on-write)
Otimizado para SQL
SGBD relacional/multidimensional
2Data Lake
Dados brutos (schema-on-read)
Formatos diversos (JSON, CSV, logs)
Sistema de arquivos (HDFS, S3)
LEVEL · soulevel.com.br
Afirmativa I — ✅ Correta
Data warehouses (DW) são bancos de dados relacionais ou multidimensionais com esquemas pré-definidos (star schema, snowflake). Isso permite modelagem otimizada para consultas analíticas em SQL, com índices e agregações. A afirmativa está correta.
Afirmativa II — ✅ Correta
Data lakes são repositórios centralizados que aceitam dados em qualquer formato (JSON, CSV, logs, imagens) e não exigem definição de esquema no momento da ingestão (schema-on-read). Fontes típicas incluem sensores IoT, mídias sociais, arquivos de logs etc. Portanto, correta.
Afirmativa III — ❌ Incorreta
O erro principal é afirmar que ambos são implementados com SGBD. Data lakes costumam ser construídos sobre Hadoop Distributed File System (HDFS), Amazon S3, Azure Data Lake Storage, que não são SGBDs relacionais ou multidimensionais. A ferramenta de ETL/ELT é comum, mas a base de armazenamento difere. Portanto, falsa.
NÃO CAIA NESSA!
A banca tenta confundir dizendo que data lake também usa SGBD, quando na verdade utiliza sistemas de arquivos distribuídos ou armazenamento objeto. O candidato pode associar “banco de dados” a qualquer repositório, mas o termo SGBD tem significado técnico específico.
Conclusão: apenas as afirmativas I e II são verdadeiras → gabarito D.