Pular para o conteúdo principal

Questão de TI - Ciência de Dados e Inteligência Artificial — Data Lake — CESPE / CEBRASPE 2026

TI - Ciência de Dados e Inteligência ArtificialData Lake
Código
ce391230
Banca
CESPE / CEBRASPE
Órgão
INFRA S.A.
Ano
2026
Cargo
Analista ( )

A INFRA S.A. implantou uma arquitetura corporativa de dados híbrida para suportar suas atividades estratégicas, sobretudo a estruturação de projetos de infraestrutura logística. Nessa arquitetura, o Oracle Database 21C é utilizado para sistemas críticos de gestão contratual e execução orçamentária; bancos de dados NoSQL são empregados para armazenar dados semiestruturados oriundos de sensores, documentos técnicos e relatórios de campo; e um data lake corporativo é adotado para ingestão massiva de dados brutos históricos, inclusive dados geoespaciais e séries temporais.


Considerando a situação hipotética apresentada, julgue o item a seguir.

 

O data lake corporativo da INFRA S.A. deve armazenar dados já transformados e normalizados, evitando a ingestão de dados brutos.

  1. CCerto
  2. EErrado
Revelar gabarito e comentário

GabaritoE — Errado

Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.

Data Lake: armazenamento de dados brutos

Gabarito: ERRADO. O data lake é, por definição, um repositório centralizado que armazena dados brutos em seu formato original (raw data), sem transformação ou normalização prévia — a transformação ocorre apenas no momento da leitura (schema-on-read). A afirmativa inverte essa lógica ao dizer que o data lake deve armazenar dados já transformados e normalizados, o que é característica de um data warehouse, não de um data lake.

O data lake é uma arquitetura de armazenamento projetada para receber grandes volumes de dados em diversos formatos — estruturados, semiestruturados e não estruturados — sem exigir que eles sejam previamente modelados ou limpos. A ideia central é ingestar primeiro, transformar depois: os dados são armazenados como estão, e a estruturação (definição de esquema, limpeza, normalização) fica para o momento em que forem consultados ou processados. Isso contrasta com o data warehouse, que aplica o esquema na escrita (schema-on-write), ou seja, os dados já entram transformados e normalizados, prontos para análises estruturadas.

Na prática, imagine que a INFRA S.A. receba arquivos de sensores de tráfego em formato JSON, relatórios de campo em PDF e séries temporais de GPS. Em um data lake, todos esses arquivos são armazenados em sua forma bruta, sem conversão para tabelas relacionais. Quando um analista precisar cruzar esses dados, ele aplica as transformações necessárias naquele momento — por exemplo, extrai os campos relevantes do JSON e os converte em colunas. Essa flexibilidade é o que permite explorar dados sem saber antecipadamente quais perguntas serão feitas.

A distinção entre data lake e data warehouse é uma das mais cobradas em provas de banco de dados e engenharia de dados. A tabela abaixo resume os principais contrastes:

Critério

Data Lake

Data Warehouse

Tipo de dado

Bruto, em formato original

Transformado, normalizado

Esquema

Aplicado na leitura (schema-on-read)

Aplicado na escrita (schema-on-write)

Finalidade

Exploração, ciência de dados, big data

Relatórios, BI, análises estruturadas

Flexibilidade

Alta (aceita qualquer formato)

Baixa (exige modelagem prévia)

Custo de armazenamento

Geralmente menor (dados crus)

Geralmente maior (processamento e modelagem)

A pegadinha da questão está em inverter o conceito: a banca apresenta o data lake como se fosse um data warehouse. O candidato que confunde os dois erra a questão. Lembre-se: data lake = dados brutos; data warehouse = dados transformados. A afirmativa diz exatamente o oposto do que define um data lake, portanto está ERRADA.

Alternativa E — ✅ Correta (gabarito)

A afirmativa está errada porque o data lake armazena dados brutos, sem transformação ou normalização prévia. A transformação ocorre apenas no momento da leitura (schema-on-read). O que a afirmativa descreve — dados já transformados e normalizados — é a característica de um data warehouse, não de um data lake. Portanto, o item é ERRADO.

Gabarito: ERRADO (letra E).

Link permanente: /questoes/ce391230