Analista de Planejamento e Desenvolvimento Organizacional Tecnologia da Informação e Comunicação
A prefeitura de uma grande cidade deseja processar dados provenientes de sensores instalados no trânsito urbano, coletados em tempo real, para identificar padrões de congestionamento e propor soluções automatizadas. Nesse caso, o componente específico do Apache Spark que o torna adequado para realizar esta tarefa é o
AMapReduce, que processa dados de forma distribuída, sendo ideal para o processamento em batch de grandes volumes de dados em tempo real.
Bframework Spark SQL, que é usado para configurar bancos de dados relacionais em tempo real, otimizando o armazenamento dos dados do trânsito.
Cmódulo spark MLlib, que é utilizado para a coleta e processamento de dados de sensores em tempo real.
DHadoop Distributed File System (HDFS), que permite o processamento em tempo real de dados em fluxo, utilizando clusters locais para garantir baixa latência.
Emódulo Spark Streaming, que permite o processamento em tempo real de dados em fluxo, utilizando micro-batches para garantir baixa latência.
Revelar gabarito e comentário▾
GabaritoE — módulo Spark Streaming, que permite o processamento em tempo real de dados em fluxo, utilizando micro-batches para garantir baixa latência.
Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.
Apache Spark: Componentes para Processamento em Tempo Real
Gabarito: letra E. O módulo Spark Streaming é o componente do Apache Spark projetado para processamento em tempo real de dados em fluxo, utilizando micro-batches para alcançar baixa latência. As demais alternativas confundem ferramentas de batch, armazenamento, consulta SQL ou machine learning com a finalidade de streaming em tempo real.
A questão exige conhecimento dos componentes do ecossistema Apache Spark e suas aplicações típicas. O Spark Streaming é a resposta correta, pois trata dados em fluxo contínuo, dividindo-os em pequenos lotes (micro-batches) para processamento de baixa latência.
Componente do Apache Spark
Função Principal
Adequado para Processamento em Tempo Real?
Descrição Correta?
MapReduce
Processamento batch (em lote) de grandes volumes de dados
❌ Não
❌ Não é componente específico do Spark
Spark SQL
Consultas em dados estruturados usando SQL
❌ Não (foco em consultas, não em configuração de bancos)
❌ Não
MLlib
Biblioteca de machine learning para treinar modelos e fazer predições
❌ Não
❌ Não
HDFS (Hadoop Distributed File System)
Sistema de arquivos distribuído para armazenamento
❌ Não
❌ Não
Spark Streaming
Processamento em tempo real de dados em fluxo, utilizando micro-batches para baixa latência
✅ Sim
✅ Sim
Alternativa A — ❌ Incorreta
O MapReduce é um modelo de programação do Hadoop para processamento batch (em lote) de grandes volumes de dados, não em tempo real. Além disso, não é um componente específico do Apache Spark (o Spark tem seu próprio mecanismo de processamento baseado em RDDs, DAGs, etc.). O enunciado pede um componente do Spark, e MapReduce é do ecossistema Hadoop.
Alternativa B — ❌ Incorreta
O Spark SQL é utilizado para consultas em dados estruturados usando SQL, não para configurar bancos de dados relacionais em tempo real. Ele processa dados já armazenados ou em streaming (via Structured Streaming), mas não é voltado para armazenamento ou configuração de bancos. A descrição está incorreta.
Alternativa C — ❌ Incorreta
O MLlib é a biblioteca de machine learning do Spark, usada para treinar modelos e fazer predições, não para coleta e processamento de dados de sensores em tempo real. Ele pode ser utilizado sobre dados processados, mas não é o componente de streaming.
Alternativa D — ❌ Incorreta
O HDFS (Hadoop Distributed File System) é um sistema de arquivos distribuído para armazenamento, não para processamento em tempo real. Ele não faz parte do Spark (embora o Spark possa ler dele), e não oferece baixa latência para streaming. O processamento em tempo real não é sua função.
Alternativa E — ✅ Correta ⟵ GABARITO
O Spark Streaming é o módulo do Apache Spark que permite processar dados em tempo real a partir de fontes como sensores, utilizando a abordagem de micro-batches (DStreams) ou Structured Streaming. Ele garante baixa latência e tolerância a falhas, sendo ideal para o cenário descrito de sensores de trânsito.
NÃO CAIA NESSA!
A banca testa se você confunde componentes do Spark. Muitos candidatos marcam MapReduce (batch) por associar a processamento distribuído, mas ele não é do Spark nem é em tempo real. O Spark Streaming é a única opção voltada a fluxos contínuos com baixa latência.