Questão de Algoritmos e Estrutura de Dados — Algoritmos — IV - UFG 2024
Algoritmos e Estrutura de Dados›Algoritmos
Código
qg121369
Banca
IV - UFG
Órgão
TJ-AC
Ano
2024
Nível
Superior
Cargo
CS-UFG - - Analista Judiciário - Analista de Ciência de Dados
O ecossistema Hadoop se refere aos vários componentes da biblioteca de software Apache Hadoop, incluindo projetos de código aberto e ferramentas complementares para armazenar e processar Big Data. Algumas das ferramentas mais conhecidas incluem HDFS, Pig, YARN, MapReduce, Spark, HBase Oozie, Sqoop e Kafka, cada uma com função específica no ecossistema Hadoop. São funções dos componentes do ecossistema Hadoop:
AHDFS gerencia o armazenamento e o MapReduce gerencia o processamento de dados.
BSpark é uma ferramenta para o armazenamento, desenvolvido para substituir o HDFS.
CKafka é uma ferramenta para processamento de dados distribuídos, em substituição ao processamento em lote.
DHDFS gerencia o processamento e o MapReduce gerencia o armazenamento de dados.
Revelar gabarito e comentário▾
GabaritoA — HDFS gerencia o armazenamento e o MapReduce gerencia o processamento de dados.
Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.
Ecossistema Hadoop
Gabarito: letra A. O HDFS (Hadoop Distributed File System) é o sistema de arquivos distribuído responsável pelo armazenamento dos dados, enquanto o MapReduce é o modelo de programação para processamento paralelo e distribuído desses dados. As demais alternativas confundem os papéis de Spark, Kafka e invertem as funções de HDFS e MapReduce.
A banca testa o conhecimento básico sobre os principais componentes do ecossistema Hadoop, que são frequentemente cobrados em concursos de TI.
Ecossistema Hadoop: Armazenamento (HDFS (sistema de arquivos distribuído)); Processamento (MapReduce (batch, paralelo), Spark (batch e streaming)); Mensageria/Streaming (Kafka (eventos em tempo real))
Alternativa A — ✅ Correta ⟵ GABARITO
O HDFS gerencia o armazenamento distribuído e tolerante a falhas dos dados no cluster Hadoop. O MapReduce é o framework de processamento que opera em dois estágios (Map e Reduce) para processar grandes volumes de dados de forma paralela. A descrição está correta e alinhada com a função de cada componente.
Alternativa B — ❌ Incorreta
Afirma que o Spark é uma ferramenta de armazenamento desenvolvida para substituir o HDFS. Na verdade, o Spark é um motor de processamento de dados (batch e streaming) que pode utilizar HDFS como fonte de dados, mas não substitui o HDFS. O HDFS continua sendo o sistema de arquivos padrão do Hadoop para armazenamento.
Alternativa C — ❌ Incorreta
Diz que o Kafka é uma ferramenta para processamento de dados distribuídos em substituição ao processamento em lote. O Kafka é uma plataforma de mensageria e streaming de eventos, usada para pipelines de dados em tempo real, mas não substitui o processamento em lote (como o MapReduce); ambos coexistem no ecossistema, atendendo a necessidades diferentes.
Alternativa D — ❌ Incorreta
Inverte as funções de HDFS e MapReduce: HDFS não gerencia processamento (gerencia armazenamento), e MapReduce não gerencia armazenamento (gerencia processamento). A inversão é um erro clássico.