Questão de Banco de Dados — Conceitos Básicos em Banco de Dados — FGV 2024
Banco de Dados›Conceitos Básicos em Banco de Dados
Código
fg096763
Banca
FGV
Órgão
TCE-PA
Ano
2024
Nível
Superior
Cargo
Auditor de Controle Externo - Área Administrativa - Ciência de Dados
Analise o trecho a seguir:É um padrão de transformação de dados em lote que foi introduzido como uma alternativa para lidar com grandes volumes de dados. Consiste em tarefas de mapa que leem blocos de dados individuais espalhados pelos nós, seguidas por uma etapa de shuffle que redistribui os dados de resultado e uma etapa de redução que agrega os dados em cada nó. Seu paradigma foi construído em torno da ideia de que a capacidade e largura de banda do disco magnético eram tão baratas que fazia sentido simplesmente usar uma enorme quantidade de disco para realizar consultas ultrarrápidas.A tecnologia em questão é:
AApache Spark.
BHadoop MapReduce.
CBusiness Warehouse.
DETL (Extract, Transform, Load).
EGIS (Geographic Information System).
Revelar gabarito e comentário▾
GabaritoB — Hadoop MapReduce.
Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.
Processamento de dados em lote: MapReduce
Gabarito: letra B (Hadoop MapReduce). O texto descreve exatamente o paradigma MapReduce: tarefas de "map" que leem blocos de dados distribuídos, uma etapa de "shuffle" para redistribuir os resultados e uma etapa de "reduce" para agregação. A menção à "enorme quantidade de disco" por ser "barato" é característica do modelo original do Google MapReduce e sua implementação Hadoop, que priorizava o uso intensivo de disco em vez de memória.
A banca FGV cobra a identificação de tecnologias de processamento de big data. O distrator principal é o Apache Spark, que também usa map/reduce, mas com processamento em memória e não depende de disco barato como premissa.
1Map (leitura distribuída)
2Shuffle (redistribuição)
3Reduce (agregação)
LEVEL · soulevel.com.br
Alternativa A — ❌ Incorreta
O Apache Spark é um framework de processamento distribuído que pode usar operações map/reduce, mas seu paradigma foi construído para explorar a memória RAM (in-memory), reduzindo acesso a disco. A descrição da questão enfatiza "capacidade e largura de banda do disco magnético eram tão baratas que fazia sentido ... usar uma enorme quantidade de disco", o que é oposto à proposta do Spark.
Alternativa B — ✅ Correta ⟵ GABARITO
O Hadoop MapReduce é a implementação concreta do paradigma MapReduce descrito. Surgiu como alternativa para processar grandes volumes de dados em lote, utilizando discos baratos. As fases de map, shuffle e reduce são exatamente as citadas, e a filosofia de usar disco intensamente é uma marca registrada do MapReduce original.
Alternativa C — ❌ Incorreta
Business Warehouse (BW) é um componente da SAP para data warehousing e relatórios, não um padrão de transformação de dados em lote baseado em map/reduce. Não envolve as etapas de mapa, shuffle e redução descritas.
Alternativa D — ❌ Incorreta
ETL (Extract, Transform, Load) é um processo de integração de dados, não um paradigma computacional com tarefas de mapa e redução distribuídas. Embora ETL possa ser executado em lote, a descrição técnica (map, shuffle, reduce) não se aplica.
Alternativa E — ❌ Incorreta
GIS (Sistema de Informação Geográfica) é um sistema para capturar, armazenar e analisar dados geográficos. Não é um padrão de transformação de dados em lote nem envolve map/reduce.