Pular para o conteúdo principal

Questão de Banco de Dados — Big Data — CESPE / CEBRASPE 2026

Banco de DadosBig Data
Código
ce229669
Banca
CESPE / CEBRASPE
Órgão
TCE-RN
Ano
2026
Nível
Superior
Cargo
Auditor de Controle Externo - Especialidade: Tecnologia da Informação
A respeito de dados estruturados e não estruturados, de banco de dados NoSQL, de modelagem e normalização de dados e de Big Data, julgue o item a seguir.Sabendo-se que, no contexto da implementação de uma arquitetura de Big Data, o uso de um data lake distribuído para o armazenamento de dados brutos favorece a escalabilidade horizontal e a flexibilidade de esquemas, a adoção de formatos de arquivo colunares, como o Apache Parquet, é uma prática recomendada para otimizar a performance de leitura e reduzir o consumo de armazenamento por meio de técnicas de compressão e codificação eficientes.
  1. CCerto
  2. EErrado
Revelar gabarito e comentário

GabaritoC — Certo

Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.

Big Data: Data Lake e formatos colunares

CERTO. A afirmativa está correta porque descreve com precisão as vantagens do uso de data lakes distribuídos e de formatos colunares como Apache Parquet em arquiteturas de Big Data.

Um data lake é um repositório centralizado que armazena dados em seu formato bruto (schema-on-read), permitindo alta flexibilidade de esquemas. Quando implementado de forma distribuída (ex: HDFS, Amazon S3), oferece escalabilidade horizontal, adicionando mais nós conforme a necessidade. Essas características são essenciais para Big Data.

Já os formatos colunares (Parquet, ORC) organizam os dados por colunas, em vez de linhas. Isso traz dois benefícios principais:

  • Performance de leitura: consultas analíticas que acessam apenas algumas colunas leem menos dados do disco.

  • Compressão eficiente: dados do mesmo tipo em uma coluna comprimem melhor (ex: run-length encoding, dictionary encoding).

A combinação de data lake com Parquet é uma prática recomendada e amplamente adotada no mercado (ex: ecossistema Hadoop, Spark).

Big Data: Data Lake + Parquet
  • 1Data Lake
    • Dados brutos (schema-on-read)
    • Distribuído (HDFS, S3)
    • Escalabilidade horizontal
    • Flexibilidade de esquemas
  • 2Formato colunar (Parquet)
    • Organização por colunas
    • Performance de leitura
    • Compressão eficiente
      • Run-length encoding
      • Dictionary encoding
LEVEL · soulevel.com.br

CERTO — a afirmação está de acordo com os conceitos fundamentais de Big Data.

Link permanente: /questoes/ce229669