Questão de Banco de Dados — DW - Data Warehouse — Quadrix 2023
- Código
- qg025986
- Banca
- Quadrix
- Órgão
- CREA-GO
- Ano
- 2023
- Nível
- Superior
- Cargo
- Analista de Área - T.I
- CCerto
- EErrado
GabaritoE — Errado
Gabarito: ERRADO. O Data Lake não exige que o usuário defina, no mínimo, dois esquemas (um para metadados e outro para dados). Pelo contrário, uma de suas principais características é a flexibilidade de armazenar dados em seu formato original, sem a necessidade de pré-processamento ou definição prévia de esquema — o que se conhece como schema-on-read (esquema aplicado na leitura), em oposição ao schema-on-write (esquema aplicado na escrita) típico de Data Warehouses. A afirmação confunde o Data Lake com o Data Warehouse, que exige modelagem e estruturação prévia dos dados.
O Data Lake é um repositório centralizado que armazena grandes volumes de dados em seu formato bruto, sejam eles estruturados, semiestruturados ou não estruturados. Diferentemente do Data Warehouse, que é orientado a assunto, integrado, não volátil e variável no tempo — e que exige um modelo dimensional definido antes da carga —, o Data Lake aceita dados sem transformação prévia. Essa característica é o que permite análises futuras e imprevistas, pois os dados ficam disponíveis em sua forma original para serem explorados conforme novas necessidades surgirem.
A distinção fundamental entre os dois repositórios está no momento em que o esquema é aplicado. No Data Warehouse, o esquema é definido antes da carga dos dados (schema-on-write), garantindo consistência e integridade, mas exigindo um processo de ETL (extração, transformação e carga) que padroniza os dados. No Data Lake, o esquema é aplicado apenas no momento da leitura (schema-on-read), permitindo que os dados sejam armazenados sem qualquer estruturação prévia. É por isso que o Data Lake não exige a definição de esquemas mínimos — ele aceita dados de qualquer formato, e a interpretação fica a cargo da aplicação que os consome.
A afirmação também erra ao sugerir que o Data Lake exige um esquema específico para metadados. Embora os metadados — informações sobre os dados, como origem, data de atualização e regras de transformação — sejam importantes para a rastreabilidade e confiabilidade das informações, eles não são armazenados em um esquema obrigatório separado. Em arquiteturas de Data Lake, os metadados podem ser gerenciados por catálogos de dados (como o Hive Metastore ou o AWS Glue Data Catalog), mas isso é uma prática recomendada, não um requisito mínimo imposto pela tecnologia. O Data Lake, por definição, aceita dados sem exigir estruturação prévia, incluindo a ausência de esquemas obrigatórios.
A pegadinha desta questão está em atribuir ao Data Lake uma característica que é típica do Data Warehouse. O candidato que confunde os dois conceitos tende a marcar como correto, pois o Data Warehouse realmente exige modelagem e definição de esquemas. No entanto, a essência do Data Lake é justamente a ausência dessa exigência — a flexibilidade de armazenar dados brutos sem pré-processamento. Guarde essa distinção: Data Warehouse = esquema na escrita (dados estruturados, modelagem prévia); Data Lake = esquema na leitura (dados brutos, flexibilidade total).
A banca inverte a lógica dos dois repositórios. No Data Warehouse, o esquema é definido antes da carga (schema-on-write); no Data Lake, o esquema é aplicado na leitura (schema-on-read). A afirmação atribui ao Data Lake a exigência de esquemas mínimos, que é justamente o oposto de sua característica central. Quem confunde os conceitos cai na armadilha.
A afirmação está incorreta porque o Data Lake não exige a definição de, no mínimo, dois esquemas. Sua principal característica é armazenar dados em formato bruto, sem pré-processamento ou estruturação prévia. O conceito de schema-on-read permite que os dados sejam interpretados apenas no momento da consulta, dispensando qualquer esquema obrigatório. A exigência de esquemas é típica do Data Warehouse, que aplica o schema-on-write e exige modelagem dimensional antes da carga. Além disso, a afirmação de que um esquema é destinado a metadados e outro a dados não corresponde a nenhum requisito técnico do Data Lake — metadados podem ser gerenciados por catálogos, mas não há obrigatoriedade de esquemas separados.
Gabarito: ERRADO
Link permanente: /questoes/qg025986