Auditor de Controle Externo - Controle Externo - Específica de Tecnologia da Informação - Sistemas, Engenharia de Dados e Ciência de Dados (Manhã)
Com a diversificação das aplicações que empregam conjuntos de dados classificados como Big Data, foram desenvolvidos frameworks, heurísticas e metodologias para armazenar, acessar e processá-los sem comprometer o desempenho dos sistemas envolvidos. Duas soluções que se destacam nesse contexto são o Apache Hadoop e o Apache Spark.A respeito dessas soluções, assinale a afirmativa correta.
AO GraphX é um componente do Hadoop permite visualizar e analisar dados com gráficos.
BO Apache Spark copia os dados para a RAM antes de processá-los em vez de acessar dados do armazenamento externo.
CO Yet Another Resource Negotiator (YARN) é um componente do Spark que aloca recursos para a execução de aplicações.
DO Apache Spark não tem bibliotecas de machine learning integradas, enquanto o Apache Spark dispõe da biblioteca de machine learning MLlib.
EO Apache Hadoop conta com uma tecnologia especial de processamento de dados chamada Conjunto de Dados Distribuídos Resiliente (RDD).
Revelar gabarito e comentário▾
GabaritoB — O Apache Spark copia os dados para a RAM antes de processá-los em vez de acessar dados do armazenamento externo.
Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.
Apache Hadoop e Apache Spark
Gabarito: letra B. O Apache Spark processa dados primariamente na memória RAM, o que o torna significativamente mais rápido que o Hadoop MapReduce, que depende de leitura/escrita em disco. A alternativa B captura exatamente essa característica essencial do Spark.
A banca cobra a distinção entre os dois frameworks, especialmente os componentes que pertencem a cada um e as abstrações de processamento. A seguir, a análise detalhada de cada alternativa.
Característica
Apache Hadoop
Apache Spark
Processamento principal
Leitura/escrita em disco (MapReduce)
Em memória (RAM)
Componente de grafos
Não possui nativamente
GraphX
Gerenciador de recursos
YARN (próprio)
Pode usar YARN, Mesos ou próprio standalone
Biblioteca de Machine Learning
Não possui nativamente
MLlib
Abstração de dados principal
HDFS + MapReduce
RDD (Resilient Distributed Dataset)
Apache Hadoop
1Componentes
HDFS (armazenamento)
YARN (gerenciador de recursos)
MapReduce (processamento em disco)
2Característica
Processamento em disco (lento)
3Apache Spark
Componentes
Spark Core (motor)
GraphX (grafos)
MLlib (machine learning)
Característica
Processamento em RAM (rápido)
RDD (abstração resiliente)
LEVEL · soulevel.com.br
Alternativa A — ❌ Incorreta
Afirma que GraphX é um componente do Hadoop para visualização e análise de dados com gráficos. Erro: GraphX é uma biblioteca do Apache Spark para processamento de grafos e algoritmos de grafos, não faz parte do Hadoop. O Hadoop possui outros componentes como HDFS, YARN e MapReduce, mas não o GraphX.
Alternativa B — ✅ Correta ⟵ GABARITO
Afirma que o Apache Spark copia os dados para a RAM antes de processá-los, em vez de acessar dados do armazenamento externo. Correto: O Spark foi projetado para processamento em memória (in-memory computing), o que reduz drasticamente a latência em relação ao Hadoop MapReduce, que escreve resultados intermediários em disco. Essa é uma das principais vantagens do Spark.
Alternativa C — ❌ Incorreta
Afirma que o YARN (Yet Another Resource Negotiator) é um componente do Spark. Erro: YARN é o gerenciador de recursos do Hadoop, responsável por alocar recursos computacionais no cluster. O Spark pode executar sobre YARN (como um de seus modos de cluster), mas o YARN pertence ao ecossistema Hadoop, não ao Spark. O Spark tem seu próprio gerenciador standalone ou pode usar outros como Mesos.
Alternativa D — ❌ Incorreta
Afirma que o Apache Spark não tem bibliotecas de machine learning integradas, enquanto o Apache Spark dispõe da MLlib. Erro: A afirmação é contraditória e falsa. O Apache Spark possui sim a biblioteca MLlib para aprendizado de máquina, que é integrada e amplamente utilizada. Além disso, há um erro de redação (repete "Apache Spark" duas vezes), mas o conteúdo está incorreto.
Alternativa E — ❌ Incorreta
Afirma que o Hadoop conta com uma tecnologia chamada RDD (Resilient Distributed Dataset). Erro: RDD é a principal abstração de dados do Apache Spark, não do Hadoop. O Hadoop trabalha com o conceito de splits e o modelo MapReduce, mas não com RDDs. Essa é uma troca clássica de atribuições entre os frameworks.
NÃO CAIA NESSA!
A banca tenta confundir o candidato atribuindo ao Hadoop elementos que são do Spark (GraphX, RDD) e vice-versa (YARN como componente do Spark). Memorize que RDD e GraphX são do Spark; YARN e HDFS são do Hadoop. O Spark processa em memória; o Hadoop processa em disco.
PEGA ESSA DICA!
Para gravar: Spark = RAM + RDD + MLlib + GraphX; Hadoop = HDFS + YARN + MapReduce. Em questões comparativas, foque no que é exclusivo de cada um.