Pular para o conteúdo principal

Questão de Banco de Dados — Big Data — FGV 2023

Banco de DadosBig Data
Código
fg067750
Banca
FGV
Órgão
Receita Federal
Ano
2023
Nível
Superior
Cargo
Analista-Tributário (manhã)
Assinale a opção que melhor descreve a diferença entre os frameworks Apache Spark e Apache Hadoop, no contexto do processamento de Big Data.
  1. AO processamento de dados no Spark é mais rápido do que no Hadoop, pois ele é baseado em memória e utiliza RDDs, enquanto o Hadoop é baseado em disco e utiliza MapReduce.
  2. BO processamento de dados no Hadoop é mais rápido do que no Spark, pois o Hadoop é mais escalável e utiliza clusters maiores, enquanto o Spark é limitado pelo tamanho do cluster.
  3. CO Spark é mais adequado para cargas de trabalho mais pesadas, enquanto o Hadoop é melhor para cargas de trabalho mais leves e interativas.
  4. DO Spark e o Hadoop utilizam as mesmas técnicas de processamento de dados, mas o Spark é mais adequado para casos de uso em que a latência é um fator crítico, enquanto o Hadoop é mais adequado para casos de uso em que a capacidade de processamento em lote é mais importante.
  5. EO Hadoop é uma tecnologia mais recente que oferece melhorias, em relação ao Spark, em termos de desempenho e velocidade de processamento.
Revelar gabarito e comentário

GabaritoA — O processamento de dados no Spark é mais rápido do que no Hadoop, pois ele é baseado em memória e utiliza RDDs, enquanto o Hadoop é baseado em disco e utiliza MapReduce.

Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.

Apache Spark vs Hadoop: diferenças fundamentais

Gabarito: letra A. O Spark é mais rápido que o Hadoop porque processa dados principalmente em memória (RAM) usando a abstração RDD (Resilient Distributed Dataset), enquanto o Hadoop MapReduce grava resultados intermediários em disco. Essa é a principal diferença arquitetural entre os frameworks, conforme abordado no material de apoio.

O contexto de apoio reforça: "Hadoop = Disco / Spark = Memória" e "O Apache Spark é um framework de processamento de dados paralelo que pode executar programas em até 100 vezes mais rápido do que o Hadoop MapReduce na memória".

Critério

Apache Spark

Apache Hadoop (MapReduce)

Base de processamento

Memória (RAM)

Disco

Abstração principal

RDD (Resilient Distributed Dataset)

MapReduce

Velocidade relativa

Mais rápido (até 100x)

Mais lento

Carga de trabalho típica

Iterativa, interativa, batch

Batch (processamento em lote)

Modelo de execução

DAG (Directed Acyclic Graph)

Map e Reduce sequenciais

Lançamento

Mais recente (2014)

Mais antigo

Alternativa A — ✅ Correta ⟵ GABARITO

O Spark é baseado em processamento em memória e utiliza RDDs, enquanto o Hadoop MapReduce é baseado em disco. Isso confere ao Spark uma vantagem significativa de velocidade, especialmente em cargas de trabalho iterativas e interativas. A descrição está correta.

Alternativa B — ❌ Incorreta

Afirma que o Hadoop é mais rápido que o Spark, o que é falso. A banca inverteu a relação: o Spark é mais rápido devido ao uso de memória, e não o contrário. Além disso, a escalabilidade é uma característica comum a ambos, não sendo o fator decisivo.

Alternativa C — ❌ Incorreta

Diz que o Spark é adequado para cargas pesadas e o Hadoop para cargas leves e interativas. Na verdade, o Hadoop é voltado para processamento batch (pesado) e não é adequado para cargas leves e interativas, enquanto o Spark é mais versátil e rápido, sendo usado tanto para cargas pesadas quanto para interativas.

Alternativa D — ❌ Incorreta

Afirma que Spark e Hadoop utilizam as mesmas técnicas de processamento. Eles são fundamentalmente diferentes: Hadoop usa o modelo MapReduce com gravação em disco; Spark usa processamento em memória com DAG (Directed Acyclic Graph) e RDDs. A afirmação sobre latência e lote também é imprecisa.

Alternativa E — ❌ Incorreta

Alega que o Hadoop é mais recente e oferece melhorias em relação ao Spark. Na realidade, o Spark é mais recente (lançado em 2014) e foi projetado para superar as limitações do Hadoop MapReduce em velocidade e facilidade de uso.

NÃO CAIA NESSA!

A banca tenta confundir invertendo a relação de velocidade entre os frameworks. Lembre-se: Spark é o mais rápido por usar memória; Hadoop é mais lento por usar disco. Essa é a "regra de ouro" para FGV e FCC.

Gabarito: letra A

Link permanente: /questoes/fg067750