Questão de Banco de Dados — DW - Data Warehouse — Quadrix 2023
- Código
- qg025987
- Banca
- Quadrix
- Órgão
- CREA-GO
- Ano
- 2023
- Nível
- Superior
- Cargo
- Analista de Área - T.I
- CCerto
- EErrado
GabaritoC — Certo
Gabarito: CERTO (letra C). Um Data Lake é, por definição, um repositório centralizado que armazena dados em seu formato nativo — estruturados, semiestruturados ou não estruturados — sem exigir transformação prévia, ao contrário do Data Warehouse, que trabalha com dados estruturados e modelados. A afirmação do enunciado está correta.
O Data Lake é um conceito fundamental em arquiteturas de Big Data e Business Intelligence. Enquanto o Data Warehouse (DW) é um repositório de dados orientado a assunto, integrado, não volátil e variável no tempo — que exige que os dados passem por um processo de ETL (extração, transformação e carga) antes de serem armazenados —, o Data Lake adota uma abordagem diferente: ele armazena os dados brutos, em seu formato original, sem a necessidade de pré-processamento. Essa característica é o que permite a captura de dados de diversas fontes, como bancos de dados relacionais (estruturados), arquivos JSON ou XML (semiestruturados) e logs, imagens, vídeos ou áudios (não estruturados).
A principal vantagem dessa abordagem é a flexibilidade: como os dados são armazenados em seu formato nativo, eles podem ser utilizados para análises futuras e imprevistas, sem que seja necessário definir previamente um esquema ou modelo de dados. Isso contrasta com o DW, onde o esquema é definido antes da carga (schema-on-write). No Data Lake, o esquema é aplicado no momento da leitura (schema-on-read), o que permite maior agilidade na exploração dos dados.
Outra distinção importante é o custo-benefício. Data Lakes geralmente são mais econômicos para armazenar grandes volumes de dados, pois utilizam infraestrutura de baixo custo (como Hadoop HDFS ou serviços de nuvem). Além disso, são altamente escaláveis, adaptando-se a volumes crescentes sem necessidade de reestruturação. No entanto, essa flexibilidade traz desafios: sem uma governança adequada, um Data Lake pode se tornar um "data swamp" (pântano de dados), onde os dados ficam inacessíveis ou de baixa qualidade.
A banca explora aqui a confusão entre Data Lake e Data Warehouse. O candidato que não domina a diferença entre os dois pode marcar "Errado" por associar a definição ao DW. Mas a questão é clara: a definição apresentada é exatamente a de Data Lake. Para fixar:
Característica | Data Warehouse | Data Lake |
|---|---|---|
Tipo de dados | Estruturados | Estruturados, semiestruturados e não estruturados |
Processamento | ETL (schema-on-write) | ELT (schema-on-read) |
Formato de armazenamento | Modelo multidimensional (tabelas fato/dimensão) | Formato nativo (bruto) |
Objetivo | Análise de dados já modelados | Armazenamento de dados para análises futuras |
Custo | Alto (infraestrutura e modelagem) | Baixo (armazenamento em massa) |
Guarde essa fronteira: DW = dados estruturados e modelados; Data Lake = dados em formato nativo, de qualquer tipo. É exatamente nela que a questão se resolve.
A afirmação está correta. O Data Lake é um repositório que armazena dados em seu formato nativo, aceitando dados estruturados (como tabelas de bancos relacionais), semiestruturados (como JSON e XML) e não estruturados (como logs, imagens e vídeos). Essa é a definição clássica do conceito, que o diferencia do Data Warehouse, focado em dados estruturados e processados via ETL.
Na prova, quando a questão falar em "formato nativo", "dados brutos" ou "sem pré-processamento", associe imediatamente a Data Lake. Quando falar em "modelo multidimensional", "ETL" ou "dados estruturados", associe a Data Warehouse. Essa distinção resolve a maioria das questões sobre o tema.
Gabarito: letra C (CERTO).
Link permanente: /questoes/qg025987