Pular para o conteúdo principal

Questão de Banco de Dados — DW - Data Warehouse — Quadrix 2023

Banco de DadosDW - Data Warehouse
Código
qg025987
Banca
Quadrix
Órgão
CREA-GO
Ano
2023
Nível
Superior
Cargo
Analista de Área - T.I
Acerca da modelagem de dados para DataWarehouse e do Data Lake, julgue o item.Um Data Lake é um repositório de dados que pode armazenar dados em seu formato nativo, seja estruturado, semiestruturado ou não estruturado.
  1. CCerto
  2. EErrado
Revelar gabarito e comentário

GabaritoC — Certo

Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.

Data Lake: repositório de dados em formato nativo

Gabarito: CERTO (letra C). Um Data Lake é, por definição, um repositório centralizado que armazena dados em seu formato nativo — estruturados, semiestruturados ou não estruturados — sem exigir transformação prévia, ao contrário do Data Warehouse, que trabalha com dados estruturados e modelados. A afirmação do enunciado está correta.

O Data Lake é um conceito fundamental em arquiteturas de Big Data e Business Intelligence. Enquanto o Data Warehouse (DW) é um repositório de dados orientado a assunto, integrado, não volátil e variável no tempo — que exige que os dados passem por um processo de ETL (extração, transformação e carga) antes de serem armazenados —, o Data Lake adota uma abordagem diferente: ele armazena os dados brutos, em seu formato original, sem a necessidade de pré-processamento. Essa característica é o que permite a captura de dados de diversas fontes, como bancos de dados relacionais (estruturados), arquivos JSON ou XML (semiestruturados) e logs, imagens, vídeos ou áudios (não estruturados).

A principal vantagem dessa abordagem é a flexibilidade: como os dados são armazenados em seu formato nativo, eles podem ser utilizados para análises futuras e imprevistas, sem que seja necessário definir previamente um esquema ou modelo de dados. Isso contrasta com o DW, onde o esquema é definido antes da carga (schema-on-write). No Data Lake, o esquema é aplicado no momento da leitura (schema-on-read), o que permite maior agilidade na exploração dos dados.

Outra distinção importante é o custo-benefício. Data Lakes geralmente são mais econômicos para armazenar grandes volumes de dados, pois utilizam infraestrutura de baixo custo (como Hadoop HDFS ou serviços de nuvem). Além disso, são altamente escaláveis, adaptando-se a volumes crescentes sem necessidade de reestruturação. No entanto, essa flexibilidade traz desafios: sem uma governança adequada, um Data Lake pode se tornar um "data swamp" (pântano de dados), onde os dados ficam inacessíveis ou de baixa qualidade.

A banca explora aqui a confusão entre Data Lake e Data Warehouse. O candidato que não domina a diferença entre os dois pode marcar "Errado" por associar a definição ao DW. Mas a questão é clara: a definição apresentada é exatamente a de Data Lake. Para fixar:

Característica

Data Warehouse

Data Lake

Tipo de dados

Estruturados

Estruturados, semiestruturados e não estruturados

Processamento

ETL (schema-on-write)

ELT (schema-on-read)

Formato de armazenamento

Modelo multidimensional (tabelas fato/dimensão)

Formato nativo (bruto)

Objetivo

Análise de dados já modelados

Armazenamento de dados para análises futuras

Custo

Alto (infraestrutura e modelagem)

Baixo (armazenamento em massa)

Guarde essa fronteira: DW = dados estruturados e modelados; Data Lake = dados em formato nativo, de qualquer tipo. É exatamente nela que a questão se resolve.

Alternativa C — ✅ CERTO ⟵ GABARITO

A afirmação está correta. O Data Lake é um repositório que armazena dados em seu formato nativo, aceitando dados estruturados (como tabelas de bancos relacionais), semiestruturados (como JSON e XML) e não estruturados (como logs, imagens e vídeos). Essa é a definição clássica do conceito, que o diferencia do Data Warehouse, focado em dados estruturados e processados via ETL.

PEGA ESSA DICA!

Na prova, quando a questão falar em "formato nativo", "dados brutos" ou "sem pré-processamento", associe imediatamente a Data Lake. Quando falar em "modelo multidimensional", "ETL" ou "dados estruturados", associe a Data Warehouse. Essa distinção resolve a maioria das questões sobre o tema.

Gabarito: letra C (CERTO).

Link permanente: /questoes/qg025987