Pular para o conteúdo principal

Questão de Estatística — Modelos lineares — FGV 2025

EstatísticaModelos lineares
Código
fg106567
Banca
FGV
Órgão
CGE-SP
Ano
2025
Nível
Superior
Cargo
Auditor Estadual de Controle - Tecnologia da Informação - tarde
Um cientista de dados de uma agência reguladora está desenvolvendo modelos de Machine Learning para dois problemas distintos: classificar empresas de alto e baixo risco de fraude focando na Classificação Binária e prever o valor futuro de um indicador econômico tendo por base os fundamentos da Regressão.

Sobre as técnicas de modelagem e avaliação mais adequadas para cada cenário, avalie as afirmativas a seguir.


I. No problema de Classificação Binária com uma base desbalanceada, a métrica do coeficiente de determinação R 2 deve ser priorizada sobre a acurácia.


II. No problema de Regressão, o erro quadrático médio (MSE - Mean Squared Error) é altamente sensível a outliers, e sua raiz quadrada RMSE possui a mesma unidade de medida da variável alvo.


III. O modelo de Regressão Logística é uma técnica de classificação que é adequada para estimar a probabilidade de um evento, mas é incorreto utilizá-lo para prever um valor contínuo como na Regressão.


Está correto o que se afirma em
  1. AI, apenas.
  2. BI e II, apenas.
  3. CI e III, apenas.
  4. DII e III, apenas.
  5. EI, II e III.
Revelar gabarito e comentário

GabaritoD — II e III, apenas.

Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.

Métricas de avaliação e modelos de classificação e regressão

Gabarito: letra D — estão corretas apenas as afirmativas II e III. A afirmativa I está errada porque, em problemas de classificação binária com base desbalanceada, o coeficiente de determinação R2R^2 não é a métrica adequada; deve-se priorizar métricas como precisão, recall, F1-score ou AUC-ROC, que lidam melhor com o desbalanceamento. As afirmativas II e III estão corretas: o MSE é sensível a outliers e o RMSE tem a mesma unidade da variável alvo; e a regressão logística é uma técnica de classificação que estima probabilidades, não sendo adequada para prever valores contínuos.

O enunciado mistura dois problemas de Machine Learning: classificação binária (empresas de alto/baixo risco de fraude) e regressão (prever valor futuro de indicador econômico). A banca cobra o conhecimento das métricas de avaliação e da natureza de cada modelo.

Classificação binária e métricas: Em problemas de classificação, o objetivo é atribuir uma categoria a cada observação. A acurácia (proporção de acertos) é a métrica mais intuitiva, mas em bases desbalanceadas (ex.: 95% de empresas de baixo risco e 5% de alto risco) ela pode ser enganosa — um modelo que classifica tudo como "baixo risco" teria 95% de acurácia sem aprender nada. Por isso, usam-se métricas como precisão, recall, F1-score e AUC-ROC. O R2R^2 é uma métrica de regressão, que mede a proporção da variância da variável dependente explicada pelo modelo; não faz sentido aplicá-lo a um problema de classificação binária.

Regressão e métricas de erro: Em regressão, o objetivo é prever um valor contínuo. O erro quadrático médio (MSE) é a média dos quadrados das diferenças entre valores previstos e reais: MSE=1ni=1n(yiy^i)2MSE = \frac{1}{n}\sum_{i=1}^{n}(y_i - \hat{y}_i)^2. Como ele eleva os erros ao quadrado, erros grandes (outliers) têm peso desproporcional, tornando o MSE sensível a outliers. O RMSE é a raiz quadrada do MSE: RMSE=MSERMSE = \sqrt{MSE}. Como a raiz quadrada "desfaz" a elevação ao quadrado, o RMSE fica na mesma unidade da variável alvo (ex.: se a variável é R$, o RMSE é em R$), o que facilita a interpretação.

Regressão logística: Apesar do nome, a regressão logística é um modelo de classificação, não de regressão. Ela modela a probabilidade de um evento pertencer a uma classe (ex.: risco de fraude) usando a função logística (curva em S), que retorna valores entre 0 e 1. Portanto, é adequada para estimar probabilidades, mas não para prever valores contínuos — para isso, usa-se regressão linear ou outros modelos de regressão.

ClassificaçãoRegressãoR², acurácia, F1, AUC-ROCMSE, RMSE, outliersRegressão Logística (probabilidade)LEVELsoulevel.com.br
Métricas e modelos de ML — só Classificação: R², acurácia, F1, AUC-ROC; só Regressão: MSE, RMSE, outliers; Classificação∩Regressão: Regressão Logística (probabilidade)

Item I — ❌ Incorreto

A afirmativa diz que, em classificação binária com base desbalanceada, o R2R^2 deve ser priorizado sobre a acurácia. Há dois erros: (1) R2R^2 é métrica de regressão, não de classificação; (2) em base desbalanceada, nem a acurácia é a melhor métrica — deve-se usar precisão, recall, F1 ou AUC-ROC. Portanto, a afirmativa está incorreta.

Item II — ✅ Correto

A afirmativa está correta. O MSE é altamente sensível a outliers porque eleva os erros ao quadrado, dando peso maior a erros grandes. O RMSE, por ser a raiz quadrada do MSE, retorna à unidade original da variável alvo, o que é uma propriedade desejável para interpretação.

Item III — ✅ Correto

A afirmativa está correta. A regressão logística é uma técnica de classificação que estima a probabilidade de um evento (saída entre 0 e 1). Não é adequada para prever valores contínuos, pois sua saída é limitada ao intervalo [0,1] e modela probabilidades, não valores numéricos contínuos.

Conclusão: Corretos apenas os itens II e III → Gabarito: letra D.

Link permanente: /questoes/fg106567