Pular para o conteúdo principal

Questão de Sistemas de Informação — Sistemas de Informação — FGV 2025

Sistemas de InformaçãoSistemas de Informação
Código
fg106594
Banca
FGV
Órgão
CGE-SP
Ano
2025
Nível
Superior
Cargo
Auditor Estadual de Controle - Tecnologia da Informação - tarde
O Processamento MapReduce é o paradigma fundamental para o processamento distribuído de Big Data em clusters.Um cientista de dados usou essa técnica para processar milhões de logs de auditoria, em que a fase Map já emitiu pares chavevalor intermediários (ex: (UsuárioID, 1)).De acordo com modelo MapReduce, assinale a opção que apresenta a função exata e sequencial da fase Shuffle & Sort que é crítica para preparar os dados para a posterior agregação na fase Reduce.
  1. AColetar a saída intermediária dos Mappers, transportar, particionar e ordenar esses pares chave-valor, garantindo que todas as ocorrências de uma mesma chave sejam agrupadas e enviadas ao mesmo Reducer.
  2. BColetar os dados brutos da fonte de dados distribuída e aplicar a função de filtragem inicial (Map) em cada nó de processamento.
  3. CAplicar a função de agregação de redução (Reduce) nas chaves recebidas, calculando a soma final em uma única operação.
  4. DPersistir a saída final no HDFS e coordenar a distribuição de blocos entre os DataNodes do cluster.
  5. ERealizar o split lógico dos arquivos de entrada em blocos menores e garantir a tolerância a falhas através da replicação automática.
Revelar gabarito e comentário

GabaritoA — Coletar a saída intermediária dos Mappers, transportar, particionar e ordenar esses pares chave-valor, garantindo que todas as ocorrências de uma mesma chave sejam agrupadas e enviadas ao mesmo Reducer.

Link permanente: /questoes/fg106594