Pular para o conteúdo principal

Questão de Banco de Dados — DW - Data Warehouse — Quadrix 2023

Banco de DadosDW - Data Warehouse
Código
qg025986
Banca
Quadrix
Órgão
CREA-GO
Ano
2023
Nível
Superior
Cargo
Analista de Área - T.I
Acerca da modelagem de dados para DataWarehouse e do Data Lake, julgue o item.Com a finalidade de manter organizado o repositório, o Data Lake exige que o usuário defina, no mínimo, dois esquemas (schema) para os dados, sendo um para armazenar os metadados e o outro para os dados.
  1. CCerto
  2. EErrado
Revelar gabarito e comentário

GabaritoE — Errado

Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.

Data Lake: esquemas e metadados

Gabarito: ERRADO. O Data Lake não exige que o usuário defina, no mínimo, dois esquemas (um para metadados e outro para dados). Pelo contrário, uma de suas principais características é a flexibilidade de armazenar dados em seu formato original, sem a necessidade de pré-processamento ou definição prévia de esquema — o que se conhece como schema-on-read (esquema aplicado na leitura), em oposição ao schema-on-write (esquema aplicado na escrita) típico de Data Warehouses. A afirmação confunde o Data Lake com o Data Warehouse, que exige modelagem e estruturação prévia dos dados.

O Data Lake é um repositório centralizado que armazena grandes volumes de dados em seu formato bruto, sejam eles estruturados, semiestruturados ou não estruturados. Diferentemente do Data Warehouse, que é orientado a assunto, integrado, não volátil e variável no tempo — e que exige um modelo dimensional definido antes da carga —, o Data Lake aceita dados sem transformação prévia. Essa característica é o que permite análises futuras e imprevistas, pois os dados ficam disponíveis em sua forma original para serem explorados conforme novas necessidades surgirem.

A distinção fundamental entre os dois repositórios está no momento em que o esquema é aplicado. No Data Warehouse, o esquema é definido antes da carga dos dados (schema-on-write), garantindo consistência e integridade, mas exigindo um processo de ETL (extração, transformação e carga) que padroniza os dados. No Data Lake, o esquema é aplicado apenas no momento da leitura (schema-on-read), permitindo que os dados sejam armazenados sem qualquer estruturação prévia. É por isso que o Data Lake não exige a definição de esquemas mínimos — ele aceita dados de qualquer formato, e a interpretação fica a cargo da aplicação que os consome.

A afirmação também erra ao sugerir que o Data Lake exige um esquema específico para metadados. Embora os metadados — informações sobre os dados, como origem, data de atualização e regras de transformação — sejam importantes para a rastreabilidade e confiabilidade das informações, eles não são armazenados em um esquema obrigatório separado. Em arquiteturas de Data Lake, os metadados podem ser gerenciados por catálogos de dados (como o Hive Metastore ou o AWS Glue Data Catalog), mas isso é uma prática recomendada, não um requisito mínimo imposto pela tecnologia. O Data Lake, por definição, aceita dados sem exigir estruturação prévia, incluindo a ausência de esquemas obrigatórios.

A pegadinha desta questão está em atribuir ao Data Lake uma característica que é típica do Data Warehouse. O candidato que confunde os dois conceitos tende a marcar como correto, pois o Data Warehouse realmente exige modelagem e definição de esquemas. No entanto, a essência do Data Lake é justamente a ausência dessa exigência — a flexibilidade de armazenar dados brutos sem pré-processamento. Guarde essa distinção: Data Warehouse = esquema na escrita (dados estruturados, modelagem prévia); Data Lake = esquema na leitura (dados brutos, flexibilidade total).

NÃO CAIA NESSA!

A banca inverte a lógica dos dois repositórios. No Data Warehouse, o esquema é definido antes da carga (schema-on-write); no Data Lake, o esquema é aplicado na leitura (schema-on-read). A afirmação atribui ao Data Lake a exigência de esquemas mínimos, que é justamente o oposto de sua característica central. Quem confunde os conceitos cai na armadilha.

Data Lake
  • 1Armazenamento
    • Dados brutos
    • Formato original
    • Sem pré-processamento
  • 2Esquema
    • Não exige definição prévia
    • Schema-on-read (na leitura)
  • 3Metadados
    • Gerenciados por catálogos
    • Sem esquema obrigatório
  • 4Data Warehouse
    • Armazenamento
      • Dados estruturados
      • Modelagem prévia
    • Esquema
      • Schema-on-write (na escrita)
      • Exige definição antes da carga
LEVEL · soulevel.com.br

Item — ❌ ERRADO

A afirmação está incorreta porque o Data Lake não exige a definição de, no mínimo, dois esquemas. Sua principal característica é armazenar dados em formato bruto, sem pré-processamento ou estruturação prévia. O conceito de schema-on-read permite que os dados sejam interpretados apenas no momento da consulta, dispensando qualquer esquema obrigatório. A exigência de esquemas é típica do Data Warehouse, que aplica o schema-on-write e exige modelagem dimensional antes da carga. Além disso, a afirmação de que um esquema é destinado a metadados e outro a dados não corresponde a nenhum requisito técnico do Data Lake — metadados podem ser gerenciados por catálogos, mas não há obrigatoriedade de esquemas separados.

Gabarito: ERRADO

Link permanente: /questoes/qg025986