Questão de Estatística — Estatística descritiva (análise exploratória de dados) — CESPE / CEBRASPE 2025
- Código
- ce222609
- Banca
- CESPE / CEBRASPE
- Órgão
- BDMG
- Ano
- 2025
- Nível
- Superior
- CCerto
- EErrado
GabaritoE — Errado
Gabarito: letra E (ERRADO). A afirmação está incorreta porque confunde dois conceitos distintos: um valor textual em um campo numérico não é um outlier, mas sim um dado inválido ou um erro de digitação/coleta. O outlier é um valor atípico, porém válido, que se distancia do padrão dos demais dados — e a identificação de ambos ocorre na etapa de limpeza de dados, que é parte da preparação, mas a definição apresentada no item está equivocada.
A análise exploratória de dados (AED) é a etapa inicial de qualquer estudo estatístico, cuja finalidade é examinar os dados antes da aplicação de técnicas mais sofisticadas. É nela que se identificam padrões, tendências e comportamentos anômalos. Dentro desse processo, a preparação de dados envolve várias subetapas, incluindo a limpeza de dados, onde se trata de valores ausentes, inconsistentes e erros de digitação.
O ponto central da questão é a definição de outlier. Um outlier (ou valor discrepante, atípico ou exterior) é uma observação que se afasta significativamente das demais, mas que é um valor legítimo — ou seja, foi corretamente medido ou registrado, apenas é extremo em relação ao conjunto. Por exemplo, em um conjunto de alturas de pessoas, um valor de 2,10 m pode ser um outlier, mas ainda é uma altura válida. Já um valor textual em uma coluna numérica (como "abc" em uma coluna de idades) não é um outlier: é um dado inválido, um erro de coleta ou digitação que deve ser corrigido ou removido na limpeza de dados.
A banca explora exatamente essa confusão: o candidato que sabe que valores anômalos são tratados na preparação de dados pode marcar "certo", mas a definição de outlier apresentada no item está errada. O outlier não é um valor inválido; é um valor válido, porém atípico.
A afirmação diz que "valores outliers, isto é, inválidos para a amostra, como um valor textual em vez de um valor que deveria ser numérico, devem ser identificados na etapa de preparação de dados".
O erro está na definição de outlier. Um valor textual em um campo numérico é um dado inválido ou erro de digitação, não um outlier. O outlier é um valor válido, porém atípico, que se distancia do padrão dos demais dados. A identificação de ambos (dados inválidos e outliers) ocorre na etapa de preparação/limpeza de dados, mas a definição apresentada no item está incorreta.
Para não errar em questões sobre outliers, lembre-se: outlier é um valor válido e atípico. Se o valor é inválido (como texto em campo numérico), não é outlier — é um erro de digitação ou coleta. Na prova, desconfie de definições que tratem outlier como "valor inválido" ou "erro".
Gabarito: letra E (ERRADO).
Link permanente: /questoes/ce222609