Auditor de Controle Externo - Tecnologia com Especialidade em Análise de Dados
O Apache Spark é um mecanismo de análise unificado para processamento de dados em grande escala com diversas aplicações em ciência de dados, machine learning e processamento de gráficos.Considerando essa ferramenta, julgue as afirmativas a seguir.I. O Spark pode ser executado no Apache Hadoop, Kubernetes, por conta própria, na nuvem, em máquinas isoladas ou em clusters.II. DataFrames, SQL e Structured Streaming são exemplos de APIs do Spark.III. Uma diferença entre o Spark e o MapReduce é que o Spark processa e mantém os dados na memória para as etapas subsequentes, sem gravar ou ler do disco, gerando maior velocidade de processamento.Está correto o que se afirma em
AI, apenas.
BII, apenas.
CI e II, apenas.
DII e III, apenas.
EI, II e III.
Revelar gabarito e comentário▾
GabaritoE — I, II e III.
Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.
Apache Spark: Características e APIs
Gabarito: letra E — as três afirmativas estão corretas. O Spark é um motor de processamento unificado que pode ser executado em diversos ambientes, oferece APIs como DataFrames, SQL e Structured Streaming, e difere do MapReduce por manter dados em memória, o que acelera o processamento.
Apache Spark
1Implantação
Hadoop
Kubernetes
Modo standalone
Nuvem
Máquinas isoladas
Clusters
2APIs
DataFrames
SQL
Structured Streaming
3Vantagem sobre MapReduce
Processa em memória
Sem leitura/escrita em disco
Maior velocidade
LEVEL · soulevel.com.br
Item I — ✅ Correto
O Spark suporta modos de implantação variados: modo standalone, gerenciadores de cluster como Hadoop YARN e Kubernetes, ambientes de nuvem, máquinas isoladas e clusters. A afirmativa reflete corretamente essa flexibilidade.
Item II — ✅ Correto
DataFrames (estrutura tabular distribuída), Spark SQL (consultas relacionais) e Structured Streaming (processamento contínuo) são APIs nativas do ecossistema Spark, integradas ao módulo Spark SQL. Todas permitem desenvolvimento unificado para cargas de trabalho batch e streaming.
Item III — ✅ Correto
Diferentemente do MapReduce, que persiste dados intermediários em disco, o Spark processa dados preferencialmente na memória RAM, reduzindo drastically o tempo de leitura/escrita e obtendo maior velocidade. Essa é uma vantagem central do Spark sobre o modelo clássico do Hadoop.
Conclusão: Todos os itens (I, II e III) estão corretos. Portanto, a alternativa que os reúne é a letra E.