Pular para o conteúdo principal

Questão de Banco de Dados — Big Data — CESPE / CEBRASPE 2024

Banco de DadosBig Data
Código
ce185215
Banca
CESPE / CEBRASPE
Órgão
SEBRAE-NACIONAL
Ano
2024
Nível
Superior
Cargo
Analista Técnico II – Dados – Business Intelligence
Data lake é um repositório em que é permitidoI processar e proteger grandes quantidades de dados estruturados.II armazenar dados sem a necessidade de primeiro estruturá-los para que possam ser executados diferentes tipos de análises neles.III armazenar dados semiestruturados ou dados em formato nativo.Assinale a opção correta.
  1. AApenas o item I está certo.
  2. BApenas o item II está certo.
  3. CApenas o item III está certo.
  4. DTodos os itens estão certos.
Revelar gabarito e comentário

GabaritoD — Todos os itens estão certos.

Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.

Data Lake: conceito e características

Gabarito: letra D. Todos os itens (I, II e III) estão corretos. O Data Lake é um repositório que armazena dados em formato bruto (nativo), admite dados estruturados, semiestruturados e não estruturados, permite processamento e proteção de grandes volumes e não exige estruturação prévia para análises diversas — exatamente o oposto do Data Warehouse, que requer esquema definido antes do armazenamento (schema-on-write).

A questão explora a diferença fundamental entre Data Lake e Data Warehouse. Enquanto o Data Warehouse exige dados tratados e estruturados antes do armazenamento, o Data Lake armazena dados como capturados, permitindo flexibilidade analítica posterior (schema-on-read). A tabela comparativa abaixo resume as principais diferenças:

Característica

Data Warehouse

Data Lake

Tratamento dos dados

Limpos, combinados, organizados antes de armazenar

Brutos, sem tratamento, como capturados

Tipos de dados suportados

Foco em estruturados

Estruturados, semiestruturados e não estruturados

Esquema

Definido antes do armazenamento (schema-on-write)

Definido após o armazenamento (schema-on-read)

Volume

Grande

Gigantesco

Custo de armazenamento

Mais caro e lento

Mais barato e rápido

Usuário típico

Operacional

Cientista de dados

NÃO CAIA NESSA!

Muitos candidatos associam Data Lake exclusivamente a dados não estruturados, mas ele também armazena e processa dados estruturados (item I). A banca explora essa confusão para induzir ao erro de considerar apenas o item II ou III como correto.

Item I — ✅ Correto

O Data Lake permite processar e proteger grandes quantidades de dados estruturados, sim. Embora seja conhecido por dados não estruturados, ele não exclui os estruturados. A própria definição do contexto afirma que o Data Lake armazena "dados estruturados, semi-estruturados e não-estruturados".

Item II — ✅ Correto

O Data Lake armazena dados sem necessidade de estruturá-los previamente, permitindo diferentes tipos de análises posteriormente. Isso é a essência do schema-on-read: os dados são ingeridos em formato bruto e a estrutura é aplicada no momento da consulta.

Item III — ✅ Correto

O Data Lake armazena dados semiestruturados (XML, JSON) e dados em formato nativo (bruto, como capturados). A tabela comparativa reforça que ele suporta "dados estruturados, semi-estruturados e não-estruturados".

Alternativa A — ❌ Incorreta

Afirma que apenas o item I está certo, ignorando que os itens II e III também são verdadeiros. Logo, a alternativa é falsa.

Alternativa B — ❌ Incorreta

Afirma que apenas o item II está certo, mas os itens I e III também estão corretos. Portanto, incorreta.

Alternativa C — ❌ Incorreta

Afirma que apenas o item III está certo, desconsiderando os itens I e II, que são verdadeiros. Incorreta.

Alternativa D — ✅ Correta ⟵ GABARITO

Todos os itens estão certos, conforme demonstrado acima.

Gabarito: letra D.

Link permanente: /questoes/ce185215