Pular para o conteúdo principal

Questão de Algoritmos e Estrutura de Dados — Algoritmos — IV - UFG 2024

Algoritmos e Estrutura de DadosAlgoritmos
Código
qg121369
Banca
IV - UFG
Órgão
TJ-AC
Ano
2024
Nível
Superior
Cargo
CS-UFG - - Analista Judiciário - Analista de Ciência de Dados
O ecossistema Hadoop se refere aos vários componentes da biblioteca de software Apache Hadoop, incluindo projetos de código aberto e ferramentas complementares para armazenar e processar Big Data. Algumas das ferramentas mais conhecidas incluem HDFS, Pig, YARN, MapReduce, Spark, HBase Oozie, Sqoop e Kafka, cada uma com função específica no ecossistema Hadoop. São funções dos componentes do ecossistema Hadoop:
  1. AHDFS gerencia o armazenamento e o MapReduce gerencia o processamento de dados.
  2. BSpark é uma ferramenta para o armazenamento, desenvolvido para substituir o HDFS.
  3. CKafka é uma ferramenta para processamento de dados distribuídos, em substituição ao processamento em lote.
  4. DHDFS gerencia o processamento e o MapReduce gerencia o armazenamento de dados.
Revelar gabarito e comentário

GabaritoA — HDFS gerencia o armazenamento e o MapReduce gerencia o processamento de dados.

Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.

Ecossistema Hadoop

Gabarito: letra A. O HDFS (Hadoop Distributed File System) é o sistema de arquivos distribuído responsável pelo armazenamento dos dados, enquanto o MapReduce é o modelo de programação para processamento paralelo e distribuído desses dados. As demais alternativas confundem os papéis de Spark, Kafka e invertem as funções de HDFS e MapReduce.

A banca testa o conhecimento básico sobre os principais componentes do ecossistema Hadoop, que são frequentemente cobrados em concursos de TI.

1Armazenamento
HDFS (sistema de arquivos distribuído)
2Processamento
MapReduce (batch, paralelo)
Spark (batch e streaming)
3Mensageria/Streaming
Kafka (eventos em tempo real)
Ecossistema Hadoop
LEVELsoulevel.com.br
Ecossistema Hadoop: Armazenamento (HDFS (sistema de arquivos distribuído)); Processamento (MapReduce (batch, paralelo), Spark (batch e streaming)); Mensageria/Streaming (Kafka (eventos em tempo real))

Alternativa A — ✅ Correta ⟵ GABARITO

O HDFS gerencia o armazenamento distribuído e tolerante a falhas dos dados no cluster Hadoop. O MapReduce é o framework de processamento que opera em dois estágios (Map e Reduce) para processar grandes volumes de dados de forma paralela. A descrição está correta e alinhada com a função de cada componente.

Alternativa B — ❌ Incorreta

Afirma que o Spark é uma ferramenta de armazenamento desenvolvida para substituir o HDFS. Na verdade, o Spark é um motor de processamento de dados (batch e streaming) que pode utilizar HDFS como fonte de dados, mas não substitui o HDFS. O HDFS continua sendo o sistema de arquivos padrão do Hadoop para armazenamento.

Alternativa C — ❌ Incorreta

Diz que o Kafka é uma ferramenta para processamento de dados distribuídos em substituição ao processamento em lote. O Kafka é uma plataforma de mensageria e streaming de eventos, usada para pipelines de dados em tempo real, mas não substitui o processamento em lote (como o MapReduce); ambos coexistem no ecossistema, atendendo a necessidades diferentes.

Alternativa D — ❌ Incorreta

Inverte as funções de HDFS e MapReduce: HDFS não gerencia processamento (gerencia armazenamento), e MapReduce não gerencia armazenamento (gerencia processamento). A inversão é um erro clássico.

Gabarito: letra A.

Link permanente: /questoes/qg121369