Pular para o conteúdo principal

Questão de Banco de Dados — Big Data — Quadrix 2024

Banco de DadosBig Data
Código
qg347323
Banca
Quadrix
Órgão
CFP
Ano
2024
Nível
Superior
Cargo
Analista Técnico/TI/Desenvolvimento
A respeito do Data Lake, da discretização e do tratamento de outliers, julgue o item a seguir.Uma característica fundamental de um Data Lake é que suporta tanto dados estruturados quanto não estruturados em sua forma original.
  1. CCerto
  2. EErrado
Revelar gabarito e comentário

GabaritoC — Certo

Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.

Data Lake: armazenamento de dados em sua forma original

Gabarito: ✅ CERTO. A afirmativa está correta porque uma característica fundamental de um Data Lake é, de fato, suportar dados estruturados, semiestruturados e não estruturados em sua forma original (bruta), sem a imposição de um esquema prévio no momento da ingestão — diferentemente do que ocorre em um Data Warehouse.

O Data Lake é um repositório centralizado e escalável projetado para armazenar grandes volumes de dados em seu formato nativo. A expressão-chave é "forma original" ou "forma bruta": os dados são ingeridos exatamente como foram capturados, sejam eles planilhas (estruturados), arquivos JSON ou XML (semiestruturados) ou imagens, vídeos e documentos de texto (não estruturados). Essa característica contrasta diretamente com o Data Warehouse, que tradicionalmente exige que os dados sejam previamente tratados, limpos e organizados em um esquema definido antes do armazenamento (abordagem conhecida como schema-on-write).

No Data Lake, a definição do esquema ocorre apenas no momento da leitura (schema-on-read), o que confere enorme flexibilidade para análises exploratórias, ciência de dados e machine learning. Essa é a essência do conceito: armazenar tudo em estado bruto e só então, quando necessário, estruturar e transformar os dados para atender a uma necessidade específica de análise.

A banca explora aqui a distinção fundamental entre os dois principais repositórios de dados analíticos. Enquanto o Data Warehouse foca em dados estruturados e já processados (via ETL), o Data Lake aceita qualquer tipo de dado sem tratamento prévio (via ELT). A pegadinha comum seria afirmar que o Data Lake converte dados não estruturados em estruturados durante a ingestão — o que é incorreto, pois ele os armazena como estão.

Para fixar o contraste, veja a comparação:

Critério

Data Warehouse

Data Lake

Tipo de dados

Foco em estruturados

Estruturados, semiestruturados e não estruturados

Forma de armazenamento

Tratados, limpos e organizados

Brutos, em sua forma original

Esquema

Definido na escrita (schema-on-write)

Definido na leitura (schema-on-read)

Processamento

ETL (Extrair, Transformar, Carregar)

ELT (Extrair, Carregar, Transformar)

Usuários típicos

Analistas de negócios, gestores

Cientistas de dados, engenheiros de dados

Guarde essa fronteira entre "forma original/bruta" e "dados tratados": é exatamente nela que a questão se decide. A afirmativa descreve com precisão a característica central do Data Lake.

Item — ✅ CERTO

A afirmativa está correta. O Data Lake é definido justamente por sua capacidade de armazenar dados de qualquer tipo — estruturados, semiestruturados e não estruturados — em sua forma original, sem transformação prévia. Isso é o que o diferencia do Data Warehouse, que exige dados tratados e um esquema definido antes do armazenamento. A expressão "em sua forma original" é o termo decisivo: o Data Lake armazena os dados brutos, como foram capturados, permitindo que a estruturação e a transformação ocorram apenas quando necessário, no momento da análise.

Gabarito: ✅ CERTO

Link permanente: /questoes/qg347323