Questão de Banco de Dados — Big Data — CESPE / CEBRASPE 2024
Banco de Dados›Big Data
Código
ce185215
Banca
CESPE / CEBRASPE
Órgão
SEBRAE-NACIONAL
Ano
2024
Nível
Superior
Cargo
Analista Técnico II – Dados – Business Intelligence
Data lake é um repositório em que é permitidoI processar e proteger grandes quantidades de dados estruturados.II armazenar dados sem a necessidade de primeiro estruturá-los para que possam ser executados diferentes tipos de análises neles.III armazenar dados semiestruturados ou dados em formato nativo.Assinale a opção correta.
AApenas o item I está certo.
BApenas o item II está certo.
CApenas o item III está certo.
DTodos os itens estão certos.
Revelar gabarito e comentário▾
GabaritoD — Todos os itens estão certos.
Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.
Data Lake: conceito e características
Gabarito: letra D. Todos os itens (I, II e III) estão corretos. O Data Lake é um repositório que armazena dados em formato bruto (nativo), admite dados estruturados, semiestruturados e não estruturados, permite processamento e proteção de grandes volumes e não exige estruturação prévia para análises diversas — exatamente o oposto do Data Warehouse, que requer esquema definido antes do armazenamento (schema-on-write).
A questão explora a diferença fundamental entre Data Lake e Data Warehouse. Enquanto o Data Warehouse exige dados tratados e estruturados antes do armazenamento, o Data Lake armazena dados como capturados, permitindo flexibilidade analítica posterior (schema-on-read). A tabela comparativa abaixo resume as principais diferenças:
Característica
Data Warehouse
Data Lake
Tratamento dos dados
Limpos, combinados, organizados antes de armazenar
Brutos, sem tratamento, como capturados
Tipos de dados suportados
Foco em estruturados
Estruturados, semiestruturados e não estruturados
Esquema
Definido antes do armazenamento (schema-on-write)
Definido após o armazenamento (schema-on-read)
Volume
Grande
Gigantesco
Custo de armazenamento
Mais caro e lento
Mais barato e rápido
Usuário típico
Operacional
Cientista de dados
NÃO CAIA NESSA!
Muitos candidatos associam Data Lake exclusivamente a dados não estruturados, mas ele também armazena e processa dados estruturados (item I). A banca explora essa confusão para induzir ao erro de considerar apenas o item II ou III como correto.
Item I — ✅ Correto
O Data Lake permite processar e proteger grandes quantidades de dados estruturados, sim. Embora seja conhecido por dados não estruturados, ele não exclui os estruturados. A própria definição do contexto afirma que o Data Lake armazena "dados estruturados, semi-estruturados e não-estruturados".
Item II — ✅ Correto
O Data Lake armazena dados sem necessidade de estruturá-los previamente, permitindo diferentes tipos de análises posteriormente. Isso é a essência do schema-on-read: os dados são ingeridos em formato bruto e a estrutura é aplicada no momento da consulta.
Item III — ✅ Correto
O Data Lake armazena dados semiestruturados (XML, JSON) e dados em formato nativo (bruto, como capturados). A tabela comparativa reforça que ele suporta "dados estruturados, semi-estruturados e não-estruturados".
Alternativa A — ❌ Incorreta
Afirma que apenas o item I está certo, ignorando que os itens II e III também são verdadeiros. Logo, a alternativa é falsa.
Alternativa B — ❌ Incorreta
Afirma que apenas o item II está certo, mas os itens I e III também estão corretos. Portanto, incorreta.
Alternativa C — ❌ Incorreta
Afirma que apenas o item III está certo, desconsiderando os itens I e II, que são verdadeiros. Incorreta.
Alternativa D — ✅ Correta ⟵ GABARITO
Todos os itens estão certos, conforme demonstrado acima.