Pular para o conteúdo principal

Questão de Sistemas de Informação — Sistemas de Informação — FGV 2025

Sistemas de InformaçãoSistemas de Informação
Código
fg106594
Banca
FGV
Órgão
CGE-SP
Ano
2025
Nível
Superior
Cargo
Auditor Estadual de Controle - Tecnologia da Informação - tarde
O Processamento MapReduce é o paradigma fundamental para o processamento distribuído de Big Data em clusters.

Um cientista de dados usou essa técnica para processar milhões de logs de auditoria, em que a fase Map já emitiu pares chavevalor intermediários (ex: (UsuárioID, 1)).

De acordo com modelo MapReduce, assinale a opção que apresenta a função exata e sequencial da fase Shuffle & Sort que é crítica para preparar os dados para a posterior agregação na fase Reduce.
  1. AColetar a saída intermediária dos Mappers, transportar, particionar e ordenar esses pares chave-valor, garantindo que todas as ocorrências de uma mesma chave sejam agrupadas e enviadas ao mesmo Reducer.
  2. BColetar os dados brutos da fonte de dados distribuída e aplicar a função de filtragem inicial (Map) em cada nó de processamento.
  3. CAplicar a função de agregação de redução (Reduce) nas chaves recebidas, calculando a soma final em uma única operação.
  4. DPersistir a saída final no HDFS e coordenar a distribuição de blocos entre os DataNodes do cluster.
  5. ERealizar o split lógico dos arquivos de entrada em blocos menores e garantir a tolerância a falhas através da replicação automática.
Revelar gabarito e comentário

GabaritoA — Coletar a saída intermediária dos Mappers, transportar, particionar e ordenar esses pares chave-valor, garantindo que todas as ocorrências de uma mesma chave sejam agrupadas e enviadas ao mesmo Reducer.

Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.

Processamento MapReduce — Fase Shuffle & Sort

Gabarito: letra A. A fase Shuffle & Sort é a etapa intermediária que coleta a saída dos mappers, transporta, particiona e ordena os pares chave-valor, garantindo que todas as ocorrências de uma mesma chave sejam agrupadas e enviadas ao mesmo reducer. Essa descrição corresponde exatamente à alternativa A.

A banca testa o conhecimento do fluxo do MapReduce. O paradigma é dividido em três fases principais: Map (processa os dados brutos e gera pares intermediários), Shuffle & Sort (organiza esses pares) e Reduce (agrega os valores por chave). A pegadinha comum é confundir as atribuições de cada fase.

Fase

Função

Map

Processa dados brutos e emite pares chave-valor intermediários

Shuffle & Sort

Coleta, transporta, particiona, ordena e agrupa pares por chave

Reduce

Agrega valores associados a cada chave (soma, contagem, etc.)

  1. 1MapProcessa dados brutos
  2. 2Shuffle & SortAgrupa pares por chave
  3. 3ReduceAgrega valores por chave
LEVEL · soulevel.com.br

Alternativa A — ✅ Correta ⟵ GABARITO

Descreve exatamente o papel da Shuffle & Sort: "Coletar a saída intermediária dos Mappers, transportar, particionar e ordenar esses pares chave-valor, garantindo que todas as ocorrências de uma mesma chave sejam agrupadas e enviadas ao mesmo Reducer." Cada termo (coletar, transportar, particionar, ordenar, agrupar) corresponde às operações reais executadas pelo framework nessa etapa.

Alternativa B — ❌ Incorreta

Refere-se a "coletar os dados brutos e aplicar a função de filtragem inicial (Map)". Isso é a fase Map, não a Shuffle & Sort. Confunde as etapas iniciais com a intermediária.

Alternativa C — ❌ Incorreta

Diz "aplicar a função de agregação de redução (Reduce)". Isso é a fase Reduce, que ocorre depois que os dados já foram embaralhados e ordenados. A Shuffle & Sort apenas prepara os dados para a Reduce, mas não executa a agregação.

Alternativa D — ❌ Incorreta

"Persistir a saída final no HDFS e coordenar a distribuição de blocos" são tarefas do HDFS ou do OutputFormat, não da Shuffle & Sort. A saída final é gerada pelos reducers e depois escrita no HDFS.

Alternativa E — ❌ Incorreta

"Realizar o split lógico dos arquivos de entrada e garantir a tolerância a falhas" são funções do InputSplit (divisão dos dados) e da replicação do HDFS, respectivamente. Não fazem parte da Shuffle & Sort.

NÃO CAIA NESSA!

Decore o fluxo: Map → Shuffle & Sort → Reduce. A Shuffle & Sort é o "meio do caminho": pega o que o Map produziu, ordena por chave e manda para o Reduce. Não confunda com as outras fases. A banca adora trocar as descrições.

Gabarito: letra A

Link permanente: /questoes/fg106594