Assinale a opção que melhor descreve a diferença entre os frameworks Apache Spark e Apache Hadoop, no contexto do processamento de Big Data.
AO processamento de dados no Spark é mais rápido do que no Hadoop, pois ele é baseado em memória e utiliza RDDs, enquanto o Hadoop é baseado em disco e utiliza MapReduce.
BO processamento de dados no Hadoop é mais rápido do que no Spark, pois o Hadoop é mais escalável e utiliza clusters maiores, enquanto o Spark é limitado pelo tamanho do cluster.
CO Spark é mais adequado para cargas de trabalho mais pesadas, enquanto o Hadoop é melhor para cargas de trabalho mais leves e interativas.
DO Spark e o Hadoop utilizam as mesmas técnicas de processamento de dados, mas o Spark é mais adequado para casos de uso em que a latência é um fator crítico, enquanto o Hadoop é mais adequado para casos de uso em que a capacidade de processamento em lote é mais importante.
EO Hadoop é uma tecnologia mais recente que oferece melhorias, em relação ao Spark, em termos de desempenho e velocidade de processamento.
Revelar gabarito e comentário▾
GabaritoA — O processamento de dados no Spark é mais rápido do que no Hadoop, pois ele é baseado em memória e utiliza RDDs, enquanto o Hadoop é baseado em disco e utiliza MapReduce.
Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.
Apache Spark vs Hadoop: diferenças fundamentais
Gabarito: letra A. O Spark é mais rápido que o Hadoop porque processa dados principalmente em memória (RAM) usando a abstração RDD (Resilient Distributed Dataset), enquanto o Hadoop MapReduce grava resultados intermediários em disco. Essa é a principal diferença arquitetural entre os frameworks, conforme abordado no material de apoio.
O contexto de apoio reforça: "Hadoop = Disco / Spark = Memória" e "O Apache Spark é um framework de processamento de dados paralelo que pode executar programas em até 100 vezes mais rápido do que o Hadoop MapReduce na memória".
Critério
Apache Spark
Apache Hadoop (MapReduce)
Base de processamento
Memória (RAM)
Disco
Abstração principal
RDD (Resilient Distributed Dataset)
MapReduce
Velocidade relativa
Mais rápido (até 100x)
Mais lento
Carga de trabalho típica
Iterativa, interativa, batch
Batch (processamento em lote)
Modelo de execução
DAG (Directed Acyclic Graph)
Map e Reduce sequenciais
Lançamento
Mais recente (2014)
Mais antigo
Alternativa A — ✅ Correta ⟵ GABARITO
O Spark é baseado em processamento em memória e utiliza RDDs, enquanto o Hadoop MapReduce é baseado em disco. Isso confere ao Spark uma vantagem significativa de velocidade, especialmente em cargas de trabalho iterativas e interativas. A descrição está correta.
Alternativa B — ❌ Incorreta
Afirma que o Hadoop é mais rápido que o Spark, o que é falso. A banca inverteu a relação: o Spark é mais rápido devido ao uso de memória, e não o contrário. Além disso, a escalabilidade é uma característica comum a ambos, não sendo o fator decisivo.
Alternativa C — ❌ Incorreta
Diz que o Spark é adequado para cargas pesadas e o Hadoop para cargas leves e interativas. Na verdade, o Hadoop é voltado para processamento batch (pesado) e não é adequado para cargas leves e interativas, enquanto o Spark é mais versátil e rápido, sendo usado tanto para cargas pesadas quanto para interativas.
Alternativa D — ❌ Incorreta
Afirma que Spark e Hadoop utilizam as mesmas técnicas de processamento. Eles são fundamentalmente diferentes: Hadoop usa o modelo MapReduce com gravação em disco; Spark usa processamento em memória com DAG (Directed Acyclic Graph) e RDDs. A afirmação sobre latência e lote também é imprecisa.
Alternativa E — ❌ Incorreta
Alega que o Hadoop é mais recente e oferece melhorias em relação ao Spark. Na realidade, o Spark é mais recente (lançado em 2014) e foi projetado para superar as limitações do Hadoop MapReduce em velocidade e facilidade de uso.
NÃO CAIA NESSA!
A banca tenta confundir invertendo a relação de velocidade entre os frameworks. Lembre-se: Spark é o mais rápido por usar memória; Hadoop é mais lento por usar disco. Essa é a "regra de ouro" para FGV e FCC.