Arquitetura de Big Data: Camadas e Processamento
Gabarito: letra A. A alternativa A descreve corretamente os modelos de computação distribuída que viabilizam processamento tanto em lote (batch) quanto em fluxos contínuos (streaming), transformando dados brutos em informações estruturadas ou semiestruturadas — alinhada aos pilares de volume, velocidade e variedade do Big Data.
A banca testa o conhecimento sobre as camadas funcionais (ingestão, persistência, processamento, consumo) e paradigmas de processamento. Vamos analisar cada alternativa.
Alternativa A — ✅ Correta ⟵ GABARITO
O processamento em Big Data emprega frameworks como MapReduce (batch) e Spark Streaming (streaming) para executar cargas de trabalho em lote e contínuas, convertendo dados brutos em formatos estruturados ou semiestruturados para consumo posterior. A afirmação está perfeita.
Alternativa B — ❌ Incorreta
Afirma que o paradigma predominante é schema-on-write, com validação rígida antes da persistência. Na realidade, Big Data adota schema-on-read: os dados são armazenados em formato bruto e a estrutura é aplicada na leitura, garantindo flexibilidade para dados não estruturados. É uma troca clássica de conceito.
Alternativa C — ❌ Incorreta
Diz que a camada de consumo/visualização é opcional e que a extração de valor ocorre automaticamente durante o transporte entre nós. Isso é falso: a camada de consumo é essencial para apresentar resultados e apoiar a tomada de decisão; a extração de valor depende de processamento e análise.
Alternativa D — ❌ Incorreta
Afirma que a camada de persistência fundamenta-se obrigatoriamente em sistemas relacionais com ACID. Na prática, Big Data utiliza bancos NoSQL (HDFS, Cassandra, MongoDB) que priorizam escalabilidade e disponibilidade, relaxando consistência (teorema CAP). Sistemas relacionais ACID não são obrigatórios.
Alternativa E — ❌ Incorreta
Limita a camada de ingestão a processos batch, incapaz de capturar fluxos contínuos. Ferramentas como Apache Kafka, Flume e Amazon Kinesis são amplamente usadas para streaming de dados de sensores e logs. A ingestão captura tanto dados em repouso quanto em movimento.
Gabarito: letra A.