Pular para o conteúdo principal

Questão de Banco de Dados — Big Data — FCC 2025

Banco de DadosBig Data
Código
fc073224
Banca
FCC
Órgão
Prefeitura de São Paulo - SP
Ano
2025
Nível
Superior
Cargo
Analista de Planejamento e Desenvolvimento Organizacional Tecnologia da Informação e Comunicação
A prefeitura de uma grande cidade deseja processar dados provenientes de sensores instalados no trânsito urbano, coletados em tempo real, para identificar padrões de congestionamento e propor soluções automatizadas. Nesse caso, o componente específico do Apache Spark que o torna adequado para realizar esta tarefa é o
  1. AMapReduce, que processa dados de forma distribuída, sendo ideal para o processamento em batch de grandes volumes de dados em tempo real.
  2. Bframework Spark SQL, que é usado para configurar bancos de dados relacionais em tempo real, otimizando o armazenamento dos dados do trânsito.
  3. Cmódulo spark MLlib, que é utilizado para a coleta e processamento de dados de sensores em tempo real.
  4. DHadoop Distributed File System (HDFS), que permite o processamento em tempo real de dados em fluxo, utilizando clusters locais para garantir baixa latência.
  5. Emódulo Spark Streaming, que permite o processamento em tempo real de dados em fluxo, utilizando micro-batches para garantir baixa latência.
Revelar gabarito e comentário

GabaritoE — módulo Spark Streaming, que permite o processamento em tempo real de dados em fluxo, utilizando micro-batches para garantir baixa latência.

Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.

Apache Spark: Componentes para Processamento em Tempo Real

Gabarito: letra E. O módulo Spark Streaming é o componente do Apache Spark projetado para processamento em tempo real de dados em fluxo, utilizando micro-batches para alcançar baixa latência. As demais alternativas confundem ferramentas de batch, armazenamento, consulta SQL ou machine learning com a finalidade de streaming em tempo real.

A questão exige conhecimento dos componentes do ecossistema Apache Spark e suas aplicações típicas. O Spark Streaming é a resposta correta, pois trata dados em fluxo contínuo, dividindo-os em pequenos lotes (micro-batches) para processamento de baixa latência.

Componente do Apache Spark

Função Principal

Adequado para Processamento em Tempo Real?

Descrição Correta?

MapReduce

Processamento batch (em lote) de grandes volumes de dados

❌ Não

❌ Não é componente específico do Spark

Spark SQL

Consultas em dados estruturados usando SQL

❌ Não (foco em consultas, não em configuração de bancos)

❌ Não

MLlib

Biblioteca de machine learning para treinar modelos e fazer predições

❌ Não

❌ Não

HDFS (Hadoop Distributed File System)

Sistema de arquivos distribuído para armazenamento

❌ Não

❌ Não

Spark Streaming

Processamento em tempo real de dados em fluxo, utilizando micro-batches para baixa latência

✅ Sim

✅ Sim

Alternativa A — ❌ Incorreta

O MapReduce é um modelo de programação do Hadoop para processamento batch (em lote) de grandes volumes de dados, não em tempo real. Além disso, não é um componente específico do Apache Spark (o Spark tem seu próprio mecanismo de processamento baseado em RDDs, DAGs, etc.). O enunciado pede um componente do Spark, e MapReduce é do ecossistema Hadoop.

Alternativa B — ❌ Incorreta

O Spark SQL é utilizado para consultas em dados estruturados usando SQL, não para configurar bancos de dados relacionais em tempo real. Ele processa dados já armazenados ou em streaming (via Structured Streaming), mas não é voltado para armazenamento ou configuração de bancos. A descrição está incorreta.

Alternativa C — ❌ Incorreta

O MLlib é a biblioteca de machine learning do Spark, usada para treinar modelos e fazer predições, não para coleta e processamento de dados de sensores em tempo real. Ele pode ser utilizado sobre dados processados, mas não é o componente de streaming.

Alternativa D — ❌ Incorreta

O HDFS (Hadoop Distributed File System) é um sistema de arquivos distribuído para armazenamento, não para processamento em tempo real. Ele não faz parte do Spark (embora o Spark possa ler dele), e não oferece baixa latência para streaming. O processamento em tempo real não é sua função.

Alternativa E — ✅ Correta ⟵ GABARITO

O Spark Streaming é o módulo do Apache Spark que permite processar dados em tempo real a partir de fontes como sensores, utilizando a abordagem de micro-batches (DStreams) ou Structured Streaming. Ele garante baixa latência e tolerância a falhas, sendo ideal para o cenário descrito de sensores de trânsito.

NÃO CAIA NESSA!

A banca testa se você confunde componentes do Spark. Muitos candidatos marcam MapReduce (batch) por associar a processamento distribuído, mas ele não é do Spark nem é em tempo real. O Spark Streaming é a única opção voltada a fluxos contínuos com baixa latência.

Gabarito: letra E.

Link permanente: /questoes/fc073224