Questão de Banco de Dados — Big Data — Quadrix 2024
- Código
- qg347323
- Banca
- Quadrix
- Órgão
- CFP
- Ano
- 2024
- Nível
- Superior
- Cargo
- Analista Técnico/TI/Desenvolvimento
- CCerto
- EErrado
GabaritoC — Certo
Gabarito: ✅ CERTO. A afirmativa está correta porque uma característica fundamental de um Data Lake é, de fato, suportar dados estruturados, semiestruturados e não estruturados em sua forma original (bruta), sem a imposição de um esquema prévio no momento da ingestão — diferentemente do que ocorre em um Data Warehouse.
O Data Lake é um repositório centralizado e escalável projetado para armazenar grandes volumes de dados em seu formato nativo. A expressão-chave é "forma original" ou "forma bruta": os dados são ingeridos exatamente como foram capturados, sejam eles planilhas (estruturados), arquivos JSON ou XML (semiestruturados) ou imagens, vídeos e documentos de texto (não estruturados). Essa característica contrasta diretamente com o Data Warehouse, que tradicionalmente exige que os dados sejam previamente tratados, limpos e organizados em um esquema definido antes do armazenamento (abordagem conhecida como schema-on-write).
No Data Lake, a definição do esquema ocorre apenas no momento da leitura (schema-on-read), o que confere enorme flexibilidade para análises exploratórias, ciência de dados e machine learning. Essa é a essência do conceito: armazenar tudo em estado bruto e só então, quando necessário, estruturar e transformar os dados para atender a uma necessidade específica de análise.
A banca explora aqui a distinção fundamental entre os dois principais repositórios de dados analíticos. Enquanto o Data Warehouse foca em dados estruturados e já processados (via ETL), o Data Lake aceita qualquer tipo de dado sem tratamento prévio (via ELT). A pegadinha comum seria afirmar que o Data Lake converte dados não estruturados em estruturados durante a ingestão — o que é incorreto, pois ele os armazena como estão.
Para fixar o contraste, veja a comparação:
Critério | Data Warehouse | Data Lake |
|---|---|---|
Tipo de dados | Foco em estruturados | Estruturados, semiestruturados e não estruturados |
Forma de armazenamento | Tratados, limpos e organizados | Brutos, em sua forma original |
Esquema | Definido na escrita (schema-on-write) | Definido na leitura (schema-on-read) |
Processamento | ETL (Extrair, Transformar, Carregar) | ELT (Extrair, Carregar, Transformar) |
Usuários típicos | Analistas de negócios, gestores | Cientistas de dados, engenheiros de dados |
Guarde essa fronteira entre "forma original/bruta" e "dados tratados": é exatamente nela que a questão se decide. A afirmativa descreve com precisão a característica central do Data Lake.
A afirmativa está correta. O Data Lake é definido justamente por sua capacidade de armazenar dados de qualquer tipo — estruturados, semiestruturados e não estruturados — em sua forma original, sem transformação prévia. Isso é o que o diferencia do Data Warehouse, que exige dados tratados e um esquema definido antes do armazenamento. A expressão "em sua forma original" é o termo decisivo: o Data Lake armazena os dados brutos, como foram capturados, permitindo que a estruturação e a transformação ocorram apenas quando necessário, no momento da análise.
Gabarito: ✅ CERTO
Link permanente: /questoes/qg347323