Questão de Banco de Dados — Big Data — Quadrix 2024
- Código
- qg347322
- Banca
- Quadrix
- Órgão
- CFP
- Ano
- 2024
- Nível
- Superior
- Cargo
- Analista Técnico/TI/Desenvolvimento
- CCerto
- EErrado
GabaritoE — Errado
Gabarito: ERRADO (letra E). O Data Lake é exatamente o oposto do que a assertiva afirma: ele armazena dados em seu formato bruto, sem exigir estrutura rígida ou pré-modelagem, permitindo que o esquema seja definido apenas no momento da leitura (schema-on-read). A característica de "estrutura rigidamente definida e pré-modelada" pertence ao Data Warehouse, que aplica o esquema no momento da escrita (schema-on-write).
O Data Lake é um repositório centralizado e escalável, projetado para armazenar grandes volumes de dados em diversos formatos — estruturados, semiestruturados e não estruturados — sem a necessidade de pré-processamento ou transformação na ingestão. Essa é a sua principal vantagem em relação ao Data Warehouse: a flexibilidade. Enquanto o Data Warehouse exige que os dados sejam limpos, combinados e organizados antes do armazenamento (processo ETL), o Data Lake armazena os dados "como estão", brutos, e só os transforma quando necessário, geralmente no momento da análise (processo ELT).
Essa diferença fundamental é capturada pelos conceitos de schema-on-write e schema-on-read. No Data Warehouse, o esquema é definido no momento da escrita: os dados precisam se adequar a uma estrutura pré-existente (tabelas, colunas, tipos). No Data Lake, o esquema é definido no momento da leitura: os dados são armazenados sem estrutura e o consumidor (cientista de dados, analista) define a estrutura ao consultá-los. É por isso que o Data Lake é ideal para Big Data e Machine Learning, onde os dados vêm de fontes heterogêneas e imprevisíveis.
Para fixar o contraste, veja a comparação direta entre os dois conceitos:
Critério | Data Warehouse | Data Lake |
|---|---|---|
Estrutura dos dados | Rigidamente definida e pré-modelada | Bruta, sem pré-modelagem |
Momento da definição do esquema | Na escrita (schema-on-write) | Na leitura (schema-on-read) |
Tipos de dados | Foco em estruturados | Estruturados, semiestruturados e não estruturados |
Processamento | ETL (transforma antes de carregar) | ELT (carrega e transforma depois) |
Usuários típicos | Analistas de negócios, gestores | Cientistas de dados, engenheiros de dados |
Flexibilidade | Baixa | Alta |
A pegadinha da banca está exatamente em inverter as características: ela atribui ao Data Lake a rigidez estrutural que é própria do Data Warehouse. O candidato que conhece apenas o nome "Data Lake" pode até associá-lo a um "depósito de dados" e imaginar que ele tem estrutura definida, mas a essência do conceito é justamente a ausência de pré-modelagem. Guarde a fronteira entre schema-on-write (Data Warehouse) e schema-on-read (Data Lake): é nela que esta questão se decide.
A assertiva afirma que o Data Lake "mantém uma estrutura de dados rigidamente definida e pré-modelada". Isso é incorreto. O Data Lake armazena dados em seu formato original, sem exigir estrutura prévia, e o esquema é aplicado apenas no momento da leitura (schema-on-read). A descrição apresentada corresponde ao Data Warehouse, que aplica o esquema no momento da escrita (schema-on-write) e exige que os dados sejam tratados e modelados antes do armazenamento.
Na prova, identifique o conceito pela palavra-chave: se a questão menciona "esquema definido na escrita" ou "dados pré-modelados", é Data Warehouse; se menciona "esquema definido na leitura" ou "dados brutos, sem pré-processamento", é Data Lake. Essa distinção cai com frequência em questões de Big Data e BI.
Gabarito: ERRADO (letra E).
Link permanente: /questoes/qg347322