Analista de Planejamento e Desenvolvimento Organizacional Tecnologia da Informação e Comunicação
Uma Prefeitura Municipal está desenvolvendo uma solução de Big Data para gerenciar dados de mobilidade, saúde pública e planejamento urbano. O objetivo é processar grandes volumes de dados provenientes de diversas fontes, como sensores de tráfego, prontuários eletrônicos e imagens. Optando por integrar as tecnologias Hadoop e Spark, a equipe técnica decidiu
Autilizar o HDFS do Hadoop para armazenamento distribuído dos grandes volumes de dados e o Spark Core para processar os dados em memória, integrando o Spark Streaming para transmissões em tempo real.
Badotar o Hadoop Common para processamento em memória e o Spark Streaming para armazenamento distribuído, otimizando a integração entre os componentes.
Cconfigurar o YARN do Hadoop como um sistema de armazenamento nativo para o Spark, utilizando o Spark SOL para processar 05 dados em tempo real.
Dutilizar à MapReduce do Hadoop para processamento em lotes e o GraphX do Spark como sistema de arquivos para dados distribuídos, garantindo escalabilidade.
Eimplementar o Mlib do Spark para armazenamento distribuído e o MapReduce do Hadoop para processamento em tempo real, aproveitando a capacidade paralela das tecnologias.
Revelar gabarito e comentário▾
GabaritoA — utilizar o HDFS do Hadoop para armazenamento distribuído dos grandes volumes de dados e o Spark Core para processar os dados em memória, integrando o Spark Streaming para transmissões em tempo real.
Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.
Hadoop e Spark: Papéis de cada componente no ecossistema Big Data
Gabarito: letra A. A alternativa A descreve corretamente os papéis: HDFS (Hadoop Distributed File System) para armazenamento distribuído, Spark Core para processamento em memória, e Spark Streaming para processamento em tempo real. As demais alternativas trocam as funções de componentes ou usam ferramentas para finalidades erradas.
A questão exige conhecer a função de cada componente do ecossistema Hadoop e do Spark. O Hadoop fornece armazenamento distribuído (HDFS) e processamento batch (MapReduce), enquanto o Spark oferece processamento em memória (Spark Core), processamento streaming (Spark Streaming), consultas SQL (Spark SQL), aprendizado de máquina (MLlib) e processamento de grafos (GraphX). A pegadinha comum é inverter os papéis, como tentar usar o YARN (gerenciador de recursos) como armazenamento ou o GraphX como sistema de arquivos.
Hadoop
Spark
Processamento
HDFS
Spark Core (memória)
Armazenamento
MapReduce (batch)
Spark Streaming (tempo real)
LEVEL · soulevel.com.br
Alternativa A — ✅ Correta ⟵ GABARITO
Descreve corretamente: HDFS para armazenamento distribuído, Spark Core para processamento em memória e Spark Streaming para transmissões em tempo real. É a arquitetura típica de integração Hadoop + Spark.
Alternativa B — ❌ Incorreta
Troca os papéis: Hadoop Common é uma biblioteca de utilitários, não faz processamento em memória (quem faz é o Spark Core). Spark Streaming não é sistema de armazenamento distribuído (quem faz é o HDFS).
Alternativa C — ❌ Incorreta
YARN é um gerenciador de recursos e agendamento, não é sistema de armazenamento nativo para o Spark. Spark SOL (provavelmente Spark SQL) é para consultas estruturadas, não para processamento em tempo real (quem faz é o Spark Streaming).
Alternativa D — ❌ Incorreta
MapReduce é de fato para processamento em lotes, mas GraphX é uma API para processamento de grafos, não um sistema de arquivos para dados distribuídos (quem faz é o HDFS).
Alternativa E — ❌ Incorreta
MLlib é uma biblioteca de machine learning, não faz armazenamento distribuído (quem faz é o HDFS). MapReduce é para processamento em lotes, não em tempo real (quem faz é o Spark Streaming ou Apache Storm).
NÃO CAIA NESSA!
A banca inverte as funções dos componentes. O candidato precisa saber que HDFS é armazenamento, Spark Core é processamento em memória, Spark Streaming é tempo real, YARN é gerenciador, GraphX é grafos, MLlib é machine learning, MapReduce é batch. Memorizar cada papel evita cair nessas trocas.