Pular para o conteúdo principal

Questão de Banco de Dados — SQL — FGV 2025

Banco de DadosSQL
Código
fg122143
Banca
FGV
Órgão
TCE-RR
Ano
2025
Nível
Superior
Cargo
Auditor de Controle Externo - Tecnologia com Especialidade em Análise de Dados
O Apache Spark é um mecanismo de análise unificado para processamento de dados em grande escala com diversas aplicações em ciência de dados, machine learning e processamento de gráficos.Considerando essa ferramenta, julgue as afirmativas a seguir.I. O Spark pode ser executado no Apache Hadoop, Kubernetes, por conta própria, na nuvem, em máquinas isoladas ou em clusters.II. DataFrames, SQL e Structured Streaming são exemplos de APIs do Spark.III. Uma diferença entre o Spark e o MapReduce é que o Spark processa e mantém os dados na memória para as etapas subsequentes, sem gravar ou ler do disco, gerando maior velocidade de processamento.Está correto o que se afirma em
  1. AI, apenas.
  2. BII, apenas.
  3. CI e II, apenas.
  4. DII e III, apenas.
  5. EI, II e III.
Revelar gabarito e comentário

GabaritoE — I, II e III.

Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.

Apache Spark: Características e APIs

Gabarito: letra E — as três afirmativas estão corretas. O Spark é um motor de processamento unificado que pode ser executado em diversos ambientes, oferece APIs como DataFrames, SQL e Structured Streaming, e difere do MapReduce por manter dados em memória, o que acelera o processamento.

Apache Spark
  • 1Implantação
    • Hadoop
    • Kubernetes
    • Modo standalone
    • Nuvem
    • Máquinas isoladas
    • Clusters
  • 2APIs
    • DataFrames
    • SQL
    • Structured Streaming
  • 3Vantagem sobre MapReduce
    • Processa em memória
    • Sem leitura/escrita em disco
    • Maior velocidade
LEVEL · soulevel.com.br

Item I — ✅ Correto

O Spark suporta modos de implantação variados: modo standalone, gerenciadores de cluster como Hadoop YARN e Kubernetes, ambientes de nuvem, máquinas isoladas e clusters. A afirmativa reflete corretamente essa flexibilidade.

Item II — ✅ Correto

DataFrames (estrutura tabular distribuída), Spark SQL (consultas relacionais) e Structured Streaming (processamento contínuo) são APIs nativas do ecossistema Spark, integradas ao módulo Spark SQL. Todas permitem desenvolvimento unificado para cargas de trabalho batch e streaming.

Item III — ✅ Correto

Diferentemente do MapReduce, que persiste dados intermediários em disco, o Spark processa dados preferencialmente na memória RAM, reduzindo drastically o tempo de leitura/escrita e obtendo maior velocidade. Essa é uma vantagem central do Spark sobre o modelo clássico do Hadoop.

Conclusão: Todos os itens (I, II e III) estão corretos. Portanto, a alternativa que os reúne é a letra E.

Link permanente: /questoes/fg122143