Pular para o conteúdo principal

Questão de TI - Ciência de Dados e Inteligência Artificial — Ecossistema Hadoop — CESPE / CEBRASPE 2025

TI - Ciência de Dados e Inteligência ArtificialEcossistema Hadoop
Código
ce417483
Banca
CESPE / CEBRASPE
Órgão
EMBRAPA
Ano
2025
Cargo
Ana ( )
A respeito do tratamento e análise de grandes volumes de dados, julgue o item a seguir.   O pré-processamento de dados, que inclui as etapas de limpeza e normalização, é opcional no tratamento de grandes volumes de dados, pois ferramentas modernas como o Spark conseguem lidar com dados brutos de forma eficiente.
  1. CCerto
  2. EErrado
Revelar gabarito e comentário

GabaritoE — Errado

Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.

Pré-processamento de dados no ecossistema Hadoop

Gabarito: ERRADO. O pré-processamento de dados — que inclui limpeza e normalização — não é opcional no tratamento de grandes volumes de dados; ele é uma etapa fundamental para garantir a qualidade e a confiabilidade dos resultados. Embora ferramentas como o Spark sejam capazes de processar dados brutos de forma eficiente, isso não elimina a necessidade de preparar os dados antes da análise, pois a qualidade do dado bruto impacta diretamente a validade das conclusões.

O pré-processamento de dados é o conjunto de técnicas aplicadas aos dados brutos para transformá-los em um formato adequado para análise e modelagem. Ele engloba diversas etapas, como limpeza (tratamento de valores ausentes, remoção de duplicatas, correção de inconsistências), integração (combinação de dados de múltiplas fontes), transformação (normalização, padronização, agregação) e redução (seleção de atributos, amostragem). A importância dessas etapas reside no fato de que dados brutos frequentemente contêm ruídos, erros, valores discrepantes e formatos inconsistentes que podem enviesar ou invalidar os resultados de qualquer análise.

A normalização, por exemplo, é uma técnica de transformação que ajusta os valores de uma variável para uma escala comum, geralmente entre 0 e 1, sem distorcer as diferenças nos intervalos de valores. Isso é crucial para algoritmos que calculam distâncias entre pontos de dados, como k-NN (k-Nearest Neighbors) e SVM (Support Vector Machines), pois variáveis com escalas maiores dominariam o cálculo da distância, tornando o modelo tendencioso. A padronização, por sua vez, transforma os dados para que tenham média 0 e desvio padrão 1, o que é útil para algoritmos que assumem dados com distribuição normal, como regressão linear e análise de componentes principais (PCA).

A afirmativa da questão tenta justificar a opcionalidade do pré-processamento citando a eficiência do Spark. É verdade que o Spark é um motor de processamento distribuído projetado para lidar com grandes volumes de dados de forma rápida e escalável, utilizando memória RAM e processamento em cluster. No entanto, a eficiência do Spark se refere à capacidade de processar grandes volumes de dados em termos de velocidade e escala, não à qualidade dos dados. O Spark pode processar dados brutos rapidamente, mas se os dados estiverem sujos, inconsistentes ou mal formatados, os resultados da análise serão igualmente ruins, independentemente da velocidade de processamento. Em outras palavras, a eficiência computacional não substitui a necessidade de garantir a qualidade dos dados.

A pegadinha da banca está em confundir a capacidade de processamento com a qualidade do dado. O candidato pode ser levado a acreditar que, como o Spark é eficiente, ele pode "pular" a etapa de pré-processamento. No entanto, a eficiência do Spark é uma característica de desempenho, enquanto o pré-processamento é uma questão de qualidade e adequação dos dados para a análise. Mesmo com ferramentas modernas, a etapa de preparação dos dados é indispensável para obter resultados confiáveis e significativos.

Guarde a distinção entre eficiência de processamento (capacidade de lidar com grandes volumes rapidamente) e qualidade dos dados (adequação dos dados para análise). É exatamente essa distinção que a questão explora: a banca tenta usar a eficiência do Spark como justificativa para tornar o pré-processamento opcional, o que é um erro conceitual.

Item — ❌ ERRADO

A afirmativa está incorreta porque o pré-processamento de dados não é opcional, mesmo com ferramentas modernas como o Spark. A eficiência do Spark em processar dados brutos não elimina a necessidade de limpeza e normalização, que são etapas essenciais para garantir a qualidade e a confiabilidade dos resultados analíticos. Dados brutos frequentemente contêm erros, inconsistências e valores discrepantes que, se não tratados, podem levar a conclusões equivocadas. Portanto, o pré-processamento é uma etapa obrigatória no tratamento de grandes volumes de dados, independentemente da ferramenta utilizada.

Gabarito: ERRADO.

Link permanente: /questoes/ce417483