Questão de TI - Ciência de Dados e Inteligência Artificial — Algoritmos de Machine Learning (Classificação, Regressão e Clusterização) — CESPE / CEBRASPE 2024
- Código
- ce403785
- Banca
- CESPE / CEBRASPE
- Órgão
- STJ
- Ano
- 2024
- Cargo
- AJ
- CCerto
- EErrado
GabaritoE — Errado
Gabarito: ERRADO. O método não paramétrico para calcular a área sob a curva ROC (AUC) não assume que os dados seguem uma distribuição específica, como a normal. Pelo contrário, a principal vantagem dos métodos não paramétricos é justamente não fazer suposições sobre a distribuição dos dados. A afirmação inverte o conceito: métodos paramétricos é que assumem distribuições (como a normal), enquanto os não paramétricos são livres de distribuição.
A curva ROC (Receiver Operating Characteristic) é uma ferramenta fundamental em aprendizado de máquina para avaliar o desempenho de classificadores binários. Ela é construída plotando a taxa de verdadeiros positivos (sensibilidade) no eixo y contra a taxa de falsos positivos (1 - especificidade) no eixo x, para diferentes limiares de classificação. A área sob essa curva (AUC) resume o desempenho global do modelo em um único número, variando de 0,5 (classificador aleatório) a 1,0 (classificador perfeito).
O cálculo da AUC pode ser feito por métodos paramétricos ou não paramétricos. Os métodos paramétricos, como o modelo binormal, assumem que as pontuações do classificador seguem uma distribuição específica (geralmente a normal) para as classes positiva e negativa. Já os métodos não paramétricos, como o estimador de Mann-Whitney U (ou Wilcoxon rank-sum), calculam a AUC diretamente a partir das pontuações observadas, sem qualquer suposição sobre a distribuição subjacente. O estimador não paramétrico é equivalente à probabilidade de que um exemplo positivo escolhido aleatoriamente tenha uma pontuação maior do que um exemplo negativo escolhido aleatoriamente.
A pegadinha da questão está em associar erroneamente o método não paramétrico a uma suposição de distribuição. Essa é uma confusão comum, pois muitos testes estatísticos paramétricos (como o teste t) assumem normalidade, mas os não paramétricos (como o teste de Mann-Whitney) são justamente a alternativa que não faz essa suposição. A banca explora exatamente essa inversão de conceitos.
Na prática, quando você tem um modelo de machine learning e quer calcular a AUC, o método mais comum é o não paramétrico, que simplesmente ordena as pontuações e calcula a área sob a curva empírica. Isso é feito, por exemplo, pela função roc_auc_score da biblioteca scikit-learn, que usa o método de Mann-Whitney. Nenhuma suposição de normalidade é feita.
Portanto, a afirmação está incorreta porque inverte a definição: o método não paramétrico é exatamente aquele que não assume distribuição, enquanto o paramétrico é que assume.
A afirmação diz que o método não paramétrico para calcular a AUC assume que os dados seguem uma distribuição, como a normal. Isso é falso. O método não paramétrico, por definição, não faz suposições sobre a distribuição dos dados. Ele é baseado em postos (ranks) e na comparação direta das pontuações. A suposição de normalidade é característica de métodos paramétricos, como o modelo binormal, que ajusta duas distribuições normais (uma para cada classe) para estimar a curva ROC. Portanto, a alternativa está errada.
A banca inverte o conceito: ela troca o método não paramétrico pelo paramétrico. O candidato que sabe que a normal é uma distribuição comum pode marcar "certo" sem perceber que a palavra "não paramétrico" é o termo decisivo. Lembre-se: não paramétrico = sem suposição de distribuição; paramétrico = assume distribuição (como a normal).
Para questões sobre ROC/AUC, lembre-se da regra de ouro: a AUC não paramétrica é calculada pela estatística de Mann-Whitney, que compara as pontuações das classes sem assumir distribuição. Se a questão mencionar "distribuição normal" ou "paramétrico", desconfie: a AUC padrão é não paramétrica.
Gabarito: ERRADO
Link permanente: /questoes/ce403785