Pular para o conteúdo principal

Questão de Banco de Dados — Big Data — FCC 2025

Banco de DadosBig Data
Código
fc073249
Banca
FCC
Órgão
Prefeitura de São Paulo - SP
Ano
2025
Nível
Superior
Cargo
Analista de Planejamento e Desenvolvimento Organizacional Tecnologia da Informação e Comunicação
Uma Prefeitura Municipal está desenvolvendo uma solução de Big Data para gerenciar dados de mobilidade, saúde pública e planejamento urbano. O objetivo é processar grandes volumes de dados provenientes de diversas fontes, como sensores de tráfego, prontuários eletrônicos e imagens. Optando por integrar as tecnologias Hadoop e Spark, a equipe técnica decidiu
  1. Autilizar o HDFS do Hadoop para armazenamento distribuído dos grandes volumes de dados e o Spark Core para processar os dados em memória, integrando o Spark Streaming para transmissões em tempo real.
  2. Badotar o Hadoop Common para processamento em memória e o Spark Streaming para armazenamento distribuído, otimizando a integração entre os componentes.
  3. Cconfigurar o YARN do Hadoop como um sistema de armazenamento nativo para o Spark, utilizando o Spark SOL para processar 05 dados em tempo real.
  4. Dutilizar à MapReduce do Hadoop para processamento em lotes e o GraphX do Spark como sistema de arquivos para dados distribuídos, garantindo escalabilidade.
  5. Eimplementar o Mlib do Spark para armazenamento distribuído e o MapReduce do Hadoop para processamento em tempo real, aproveitando a capacidade paralela das tecnologias.
Revelar gabarito e comentário

GabaritoA — utilizar o HDFS do Hadoop para armazenamento distribuído dos grandes volumes de dados e o Spark Core para processar os dados em memória, integrando o Spark Streaming para transmissões em tempo real.

Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.

Hadoop e Spark: Papéis de cada componente no ecossistema Big Data

Gabarito: letra A. A alternativa A descreve corretamente os papéis: HDFS (Hadoop Distributed File System) para armazenamento distribuído, Spark Core para processamento em memória, e Spark Streaming para processamento em tempo real. As demais alternativas trocam as funções de componentes ou usam ferramentas para finalidades erradas.

A questão exige conhecer a função de cada componente do ecossistema Hadoop e do Spark. O Hadoop fornece armazenamento distribuído (HDFS) e processamento batch (MapReduce), enquanto o Spark oferece processamento em memória (Spark Core), processamento streaming (Spark Streaming), consultas SQL (Spark SQL), aprendizado de máquina (MLlib) e processamento de grafos (GraphX). A pegadinha comum é inverter os papéis, como tentar usar o YARN (gerenciador de recursos) como armazenamento ou o GraphX como sistema de arquivos.

Hadoop
Spark
Processamento
HDFS
Spark Core (memória)
Armazenamento
MapReduce (batch)
Spark Streaming (tempo real)
LEVEL · soulevel.com.br

Alternativa A — ✅ Correta ⟵ GABARITO

Descreve corretamente: HDFS para armazenamento distribuído, Spark Core para processamento em memória e Spark Streaming para transmissões em tempo real. É a arquitetura típica de integração Hadoop + Spark.

Alternativa B — ❌ Incorreta

Troca os papéis: Hadoop Common é uma biblioteca de utilitários, não faz processamento em memória (quem faz é o Spark Core). Spark Streaming não é sistema de armazenamento distribuído (quem faz é o HDFS).

Alternativa C — ❌ Incorreta

YARN é um gerenciador de recursos e agendamento, não é sistema de armazenamento nativo para o Spark. Spark SOL (provavelmente Spark SQL) é para consultas estruturadas, não para processamento em tempo real (quem faz é o Spark Streaming).

Alternativa D — ❌ Incorreta

MapReduce é de fato para processamento em lotes, mas GraphX é uma API para processamento de grafos, não um sistema de arquivos para dados distribuídos (quem faz é o HDFS).

Alternativa E — ❌ Incorreta

MLlib é uma biblioteca de machine learning, não faz armazenamento distribuído (quem faz é o HDFS). MapReduce é para processamento em lotes, não em tempo real (quem faz é o Spark Streaming ou Apache Storm).

NÃO CAIA NESSA!

A banca inverte as funções dos componentes. O candidato precisa saber que HDFS é armazenamento, Spark Core é processamento em memória, Spark Streaming é tempo real, YARN é gerenciador, GraphX é grafos, MLlib é machine learning, MapReduce é batch. Memorizar cada papel evita cair nessas trocas.

Componente

Função correta

HDFS (Hadoop)

Armazenamento distribuído

MapReduce (Hadoop)

Processamento batch

YARN (Hadoop)

Gerenciamento de recursos

Spark Core

Processamento em memória

Spark Streaming

Processamento em tempo real

Spark SQL

Consultas SQL

MLlib

Machine learning

GraphX

Processamento de grafos

Gabarito: letra A

Link permanente: /questoes/fc073249