Pular para o conteúdo principal

Questão de Banco de Dados — Big Data — FGV 2025

Banco de DadosBig Data
Código
fg121750
Banca
FGV
Órgão
TCE-PI
Ano
2025
Nível
Superior
Cargo
Auditor de Controle Externo - Controle Externo - Específica de Tecnologia da Informação - Sistemas, Engenharia de Dados e Ciência de Dados (Manhã)
Com a diversificação das aplicações que empregam conjuntos de dados classificados como Big Data, foram desenvolvidos frameworks, heurísticas e metodologias para armazenar, acessar e processá-los sem comprometer o desempenho dos sistemas envolvidos. Duas soluções que se destacam nesse contexto são o Apache Hadoop e o Apache Spark.A respeito dessas soluções, assinale a afirmativa correta.
  1. AO GraphX é um componente do Hadoop permite visualizar e analisar dados com gráficos.
  2. BO Apache Spark copia os dados para a RAM antes de processá-los em vez de acessar dados do armazenamento externo.
  3. CO Yet Another Resource Negotiator (YARN) é um componente do Spark que aloca recursos para a execução de aplicações.
  4. DO Apache Spark não tem bibliotecas de machine learning integradas, enquanto o Apache Spark dispõe da biblioteca de machine learning MLlib.
  5. EO Apache Hadoop conta com uma tecnologia especial de processamento de dados chamada Conjunto de Dados Distribuídos Resiliente (RDD).
Revelar gabarito e comentário

GabaritoB — O Apache Spark copia os dados para a RAM antes de processá-los em vez de acessar dados do armazenamento externo.

Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.

Apache Hadoop e Apache Spark

Gabarito: letra B. O Apache Spark processa dados primariamente na memória RAM, o que o torna significativamente mais rápido que o Hadoop MapReduce, que depende de leitura/escrita em disco. A alternativa B captura exatamente essa característica essencial do Spark.

A banca cobra a distinção entre os dois frameworks, especialmente os componentes que pertencem a cada um e as abstrações de processamento. A seguir, a análise detalhada de cada alternativa.

Característica

Apache Hadoop

Apache Spark

Processamento principal

Leitura/escrita em disco (MapReduce)

Em memória (RAM)

Componente de grafos

Não possui nativamente

GraphX

Gerenciador de recursos

YARN (próprio)

Pode usar YARN, Mesos ou próprio standalone

Biblioteca de Machine Learning

Não possui nativamente

MLlib

Abstração de dados principal

HDFS + MapReduce

RDD (Resilient Distributed Dataset)

Apache Hadoop
  • 1Componentes
    • HDFS (armazenamento)
    • YARN (gerenciador de recursos)
    • MapReduce (processamento em disco)
  • 2Característica
    • Processamento em disco (lento)
  • 3Apache Spark
    • Componentes
      • Spark Core (motor)
      • GraphX (grafos)
      • MLlib (machine learning)
    • Característica
      • Processamento em RAM (rápido)
      • RDD (abstração resiliente)
LEVEL · soulevel.com.br

Alternativa A — ❌ Incorreta

Afirma que GraphX é um componente do Hadoop para visualização e análise de dados com gráficos. Erro: GraphX é uma biblioteca do Apache Spark para processamento de grafos e algoritmos de grafos, não faz parte do Hadoop. O Hadoop possui outros componentes como HDFS, YARN e MapReduce, mas não o GraphX.

Alternativa B — ✅ Correta ⟵ GABARITO

Afirma que o Apache Spark copia os dados para a RAM antes de processá-los, em vez de acessar dados do armazenamento externo. Correto: O Spark foi projetado para processamento em memória (in-memory computing), o que reduz drasticamente a latência em relação ao Hadoop MapReduce, que escreve resultados intermediários em disco. Essa é uma das principais vantagens do Spark.

Alternativa C — ❌ Incorreta

Afirma que o YARN (Yet Another Resource Negotiator) é um componente do Spark. Erro: YARN é o gerenciador de recursos do Hadoop, responsável por alocar recursos computacionais no cluster. O Spark pode executar sobre YARN (como um de seus modos de cluster), mas o YARN pertence ao ecossistema Hadoop, não ao Spark. O Spark tem seu próprio gerenciador standalone ou pode usar outros como Mesos.

Alternativa D — ❌ Incorreta

Afirma que o Apache Spark não tem bibliotecas de machine learning integradas, enquanto o Apache Spark dispõe da MLlib. Erro: A afirmação é contraditória e falsa. O Apache Spark possui sim a biblioteca MLlib para aprendizado de máquina, que é integrada e amplamente utilizada. Além disso, há um erro de redação (repete "Apache Spark" duas vezes), mas o conteúdo está incorreto.

Alternativa E — ❌ Incorreta

Afirma que o Hadoop conta com uma tecnologia chamada RDD (Resilient Distributed Dataset). Erro: RDD é a principal abstração de dados do Apache Spark, não do Hadoop. O Hadoop trabalha com o conceito de splits e o modelo MapReduce, mas não com RDDs. Essa é uma troca clássica de atribuições entre os frameworks.

NÃO CAIA NESSA!

A banca tenta confundir o candidato atribuindo ao Hadoop elementos que são do Spark (GraphX, RDD) e vice-versa (YARN como componente do Spark). Memorize que RDD e GraphX são do Spark; YARN e HDFS são do Hadoop. O Spark processa em memória; o Hadoop processa em disco.

PEGA ESSA DICA!

Para gravar: Spark = RAM + RDD + MLlib + GraphX; Hadoop = HDFS + YARN + MapReduce. Em questões comparativas, foque no que é exclusivo de cada um.

Gabarito: letra B.

Link permanente: /questoes/fg121750