Questão de Sistemas de Informação — Sistemas de Informação — FGV 2025
Sistemas de Informação›Sistemas de Informação
Código
fg106594
Banca
FGV
Órgão
CGE-SP
Ano
2025
Nível
Superior
Cargo
Auditor Estadual de Controle - Tecnologia da Informação - tarde
O Processamento MapReduce é o paradigma fundamental para o processamento distribuído de Big Data em clusters.
Um cientista de dados usou essa técnica para processar milhões de logs de auditoria, em que a fase Map já emitiu pares chavevalor intermediários (ex: (UsuárioID, 1)).
De acordo com modelo MapReduce, assinale a opção que apresenta a função exata e sequencial da fase Shuffle & Sort que é crítica para preparar os dados para a posterior agregação na fase Reduce.
AColetar a saída intermediária dos Mappers, transportar, particionar e ordenar esses pares chave-valor, garantindo que todas as ocorrências de uma mesma chave sejam agrupadas e enviadas ao mesmo Reducer.
BColetar os dados brutos da fonte de dados distribuída e aplicar a função de filtragem inicial (Map) em cada nó de processamento.
CAplicar a função de agregação de redução (Reduce) nas chaves recebidas, calculando a soma final em uma única operação.
DPersistir a saída final no HDFS e coordenar a distribuição de blocos entre os DataNodes do cluster.
ERealizar o split lógico dos arquivos de entrada em blocos menores e garantir a tolerância a falhas através da replicação automática.
Revelar gabarito e comentário▾
GabaritoA — Coletar a saída intermediária dos Mappers, transportar, particionar e ordenar esses pares chave-valor, garantindo que todas as ocorrências de uma mesma chave sejam agrupadas e enviadas ao mesmo Reducer.
Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.
Processamento MapReduce — Fase Shuffle & Sort
Gabarito: letra A. A fase Shuffle & Sort é a etapa intermediária que coleta a saída dos mappers, transporta, particiona e ordena os pares chave-valor, garantindo que todas as ocorrências de uma mesma chave sejam agrupadas e enviadas ao mesmo reducer. Essa descrição corresponde exatamente à alternativa A.
A banca testa o conhecimento do fluxo do MapReduce. O paradigma é dividido em três fases principais: Map (processa os dados brutos e gera pares intermediários), Shuffle & Sort (organiza esses pares) e Reduce (agrega os valores por chave). A pegadinha comum é confundir as atribuições de cada fase.
Fase
Função
Map
Processa dados brutos e emite pares chave-valor intermediários
Shuffle & Sort
Coleta, transporta, particiona, ordena e agrupa pares por chave
Reduce
Agrega valores associados a cada chave (soma, contagem, etc.)
1MapProcessa dados brutos
2Shuffle & SortAgrupa pares por chave
3ReduceAgrega valores por chave
LEVEL · soulevel.com.br
Alternativa A — ✅ Correta ⟵ GABARITO
Descreve exatamente o papel da Shuffle & Sort: "Coletar a saída intermediária dos Mappers, transportar, particionar e ordenar esses pares chave-valor, garantindo que todas as ocorrências de uma mesma chave sejam agrupadas e enviadas ao mesmo Reducer." Cada termo (coletar, transportar, particionar, ordenar, agrupar) corresponde às operações reais executadas pelo framework nessa etapa.
Alternativa B — ❌ Incorreta
Refere-se a "coletar os dados brutos e aplicar a função de filtragem inicial (Map)". Isso é a fase Map, não a Shuffle & Sort. Confunde as etapas iniciais com a intermediária.
Alternativa C — ❌ Incorreta
Diz "aplicar a função de agregação de redução (Reduce)". Isso é a fase Reduce, que ocorre depois que os dados já foram embaralhados e ordenados. A Shuffle & Sort apenas prepara os dados para a Reduce, mas não executa a agregação.
Alternativa D — ❌ Incorreta
"Persistir a saída final no HDFS e coordenar a distribuição de blocos" são tarefas do HDFS ou do OutputFormat, não da Shuffle & Sort. A saída final é gerada pelos reducers e depois escrita no HDFS.
Alternativa E — ❌ Incorreta
"Realizar o split lógico dos arquivos de entrada e garantir a tolerância a falhas" são funções do InputSplit (divisão dos dados) e da replicação do HDFS, respectivamente. Não fazem parte da Shuffle & Sort.
NÃO CAIA NESSA!
Decore o fluxo: Map → Shuffle & Sort → Reduce. A Shuffle & Sort é o "meio do caminho": pega o que o Map produziu, ordena por chave e manda para o Reduce. Não confunda com as outras fases. A banca adora trocar as descrições.