Data Lake: armazenamento de dados brutos
Gabarito: ERRADO. O data lake é, por definição, um repositório centralizado que armazena dados brutos em seu formato original (raw data), sem transformação ou normalização prévia — a transformação ocorre apenas no momento da leitura (schema-on-read). A afirmativa inverte essa lógica ao dizer que o data lake deve armazenar dados já transformados e normalizados, o que é característica de um data warehouse, não de um data lake.
O data lake é uma arquitetura de armazenamento projetada para receber grandes volumes de dados em diversos formatos — estruturados, semiestruturados e não estruturados — sem exigir que eles sejam previamente modelados ou limpos. A ideia central é ingestar primeiro, transformar depois: os dados são armazenados como estão, e a estruturação (definição de esquema, limpeza, normalização) fica para o momento em que forem consultados ou processados. Isso contrasta com o data warehouse, que aplica o esquema na escrita (schema-on-write), ou seja, os dados já entram transformados e normalizados, prontos para análises estruturadas.
Na prática, imagine que a INFRA S.A. receba arquivos de sensores de tráfego em formato JSON, relatórios de campo em PDF e séries temporais de GPS. Em um data lake, todos esses arquivos são armazenados em sua forma bruta, sem conversão para tabelas relacionais. Quando um analista precisar cruzar esses dados, ele aplica as transformações necessárias naquele momento — por exemplo, extrai os campos relevantes do JSON e os converte em colunas. Essa flexibilidade é o que permite explorar dados sem saber antecipadamente quais perguntas serão feitas.
A distinção entre data lake e data warehouse é uma das mais cobradas em provas de banco de dados e engenharia de dados. A tabela abaixo resume os principais contrastes:
Critério | Data Lake | Data Warehouse |
|---|
Tipo de dado | Bruto, em formato original | Transformado, normalizado |
Esquema | Aplicado na leitura (schema-on-read) | Aplicado na escrita (schema-on-write) |
Finalidade | Exploração, ciência de dados, big data | Relatórios, BI, análises estruturadas |
Flexibilidade | Alta (aceita qualquer formato) | Baixa (exige modelagem prévia) |
Custo de armazenamento | Geralmente menor (dados crus) | Geralmente maior (processamento e modelagem) |
A pegadinha da questão está em inverter o conceito: a banca apresenta o data lake como se fosse um data warehouse. O candidato que confunde os dois erra a questão. Lembre-se: data lake = dados brutos; data warehouse = dados transformados. A afirmativa diz exatamente o oposto do que define um data lake, portanto está ERRADA.
Alternativa E — ✅ Correta (gabarito)
A afirmativa está errada porque o data lake armazena dados brutos, sem transformação ou normalização prévia. A transformação ocorre apenas no momento da leitura (schema-on-read). O que a afirmativa descreve — dados já transformados e normalizados — é a característica de um data warehouse, não de um data lake. Portanto, o item é ERRADO.
Gabarito: ERRADO (letra E).