Pular para o conteúdo principal

Questão de Banco de Dados — Big Data — Quadrix 2024

Banco de DadosBig Data
Código
qg347322
Banca
Quadrix
Órgão
CFP
Ano
2024
Nível
Superior
Cargo
Analista Técnico/TI/Desenvolvimento
A respeito do Data Lake, da discretização e do tratamento de outliers, julgue o item a seguir.O Data Lake é uma plataforma que mantém uma estrutura de dados rigidamente definida e pré‑modelada.
  1. CCerto
  2. EErrado
Revelar gabarito e comentário

GabaritoE — Errado

Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.

Data Lake: armazenamento flexível e sem esquema rígido

Gabarito: ERRADO (letra E). O Data Lake é exatamente o oposto do que a assertiva afirma: ele armazena dados em seu formato bruto, sem exigir estrutura rígida ou pré-modelagem, permitindo que o esquema seja definido apenas no momento da leitura (schema-on-read). A característica de "estrutura rigidamente definida e pré-modelada" pertence ao Data Warehouse, que aplica o esquema no momento da escrita (schema-on-write).

O Data Lake é um repositório centralizado e escalável, projetado para armazenar grandes volumes de dados em diversos formatos — estruturados, semiestruturados e não estruturados — sem a necessidade de pré-processamento ou transformação na ingestão. Essa é a sua principal vantagem em relação ao Data Warehouse: a flexibilidade. Enquanto o Data Warehouse exige que os dados sejam limpos, combinados e organizados antes do armazenamento (processo ETL), o Data Lake armazena os dados "como estão", brutos, e só os transforma quando necessário, geralmente no momento da análise (processo ELT).

Essa diferença fundamental é capturada pelos conceitos de schema-on-write e schema-on-read. No Data Warehouse, o esquema é definido no momento da escrita: os dados precisam se adequar a uma estrutura pré-existente (tabelas, colunas, tipos). No Data Lake, o esquema é definido no momento da leitura: os dados são armazenados sem estrutura e o consumidor (cientista de dados, analista) define a estrutura ao consultá-los. É por isso que o Data Lake é ideal para Big Data e Machine Learning, onde os dados vêm de fontes heterogêneas e imprevisíveis.

Para fixar o contraste, veja a comparação direta entre os dois conceitos:

Critério

Data Warehouse

Data Lake

Estrutura dos dados

Rigidamente definida e pré-modelada

Bruta, sem pré-modelagem

Momento da definição do esquema

Na escrita (schema-on-write)

Na leitura (schema-on-read)

Tipos de dados

Foco em estruturados

Estruturados, semiestruturados e não estruturados

Processamento

ETL (transforma antes de carregar)

ELT (carrega e transforma depois)

Usuários típicos

Analistas de negócios, gestores

Cientistas de dados, engenheiros de dados

Flexibilidade

Baixa

Alta

A pegadinha da banca está exatamente em inverter as características: ela atribui ao Data Lake a rigidez estrutural que é própria do Data Warehouse. O candidato que conhece apenas o nome "Data Lake" pode até associá-lo a um "depósito de dados" e imaginar que ele tem estrutura definida, mas a essência do conceito é justamente a ausência de pré-modelagem. Guarde a fronteira entre schema-on-write (Data Warehouse) e schema-on-read (Data Lake): é nela que esta questão se decide.

Item — ❌ ERRADO

A assertiva afirma que o Data Lake "mantém uma estrutura de dados rigidamente definida e pré-modelada". Isso é incorreto. O Data Lake armazena dados em seu formato original, sem exigir estrutura prévia, e o esquema é aplicado apenas no momento da leitura (schema-on-read). A descrição apresentada corresponde ao Data Warehouse, que aplica o esquema no momento da escrita (schema-on-write) e exige que os dados sejam tratados e modelados antes do armazenamento.

PEGA ESSA DICA!

Na prova, identifique o conceito pela palavra-chave: se a questão menciona "esquema definido na escrita" ou "dados pré-modelados", é Data Warehouse; se menciona "esquema definido na leitura" ou "dados brutos, sem pré-processamento", é Data Lake. Essa distinção cai com frequência em questões de Big Data e BI.

Gabarito: ERRADO (letra E).

Link permanente: /questoes/qg347322