Questão de Banco de Dados — Banco de Dados — FGV 2024
- Código
- fg077299
- Banca
- FGV
- Órgão
- CVM
- Ano
- 2024
- Nível
- Superior
- Cargo
- Analista - Perfil 7 - Ciência de Dados - Tarde
- Aacurácia;
- Brevocação;
- CF1-score;
- Dprecisão;
- EAUC.
GabaritoB — revocação;
Gabarito: letra B — revocação (recall). No cenário descrito, o custo de não detectar um caso complexo (falso negativo) é muito elevado, podendo anular qualquer ganho de eficiência. A métrica que maximiza a capacidade de identificar corretamente os casos complexos, minimizando falsos negativos, é a revocação (recall), também chamada de sensibilidade ou taxa de verdadeiros positivos.
A questão aborda a escolha da métrica de classificação adequada para um problema onde o erro mais crítico é o falso negativo — um caso complexo classificado como simples, deixando de ser examinado detalhadamente. As métricas disponíveis têm focos diferentes:
Métrica | O que mede | Foco principal | Quando usar |
|---|---|---|---|
Acurácia | Proporção de acertos totais (VP+VN)/total | Equilíbrio geral | Classes balanceadas e custos iguais |
Revocação (Recall) | VP / (VP + FN) | Minimizar falsos negativos | Quando o custo de FN é alto (ex.: doenças graves, fraudes, riscos) |
Precisão | VP / (VP + FP) | Minimizar falsos positivos | Quando o custo de FP é alto (ex.: alarmes falsos) |
F1-score | Média harmônica entre precisão e revocação | Equilíbrio entre precisão e revocação | Classes desbalanceadas, sem preferência clara |
AUC | Área sob a curva ROC | Discriminação geral entre classes | Avaliação global de ranking, independente de threshold |
O enunciado deixa claro que "não examinar detalhadamente um caso complexo pode custar muito caro", o que aponta diretamente para a minimização de falsos negativos — função da revocação. O candidato desatento pode confundir com precisão (que foca em falsos positivos) ou com acurácia (que não pondera o erro). A banca testa o entendimento do impacto do tipo de erro na escolha da métrica.
Acurácia mede o percentual geral de acertos, mas não diferencia o custo de cada tipo de erro. Se a classe positiva (casos complexos) for minoria, a acurácia pode ser alta mesmo falhando em detectá-los — exatamente o que o governo quer evitar.
Revocação (recall) é a fração de casos complexos que o sistema consegue identificar: . Maximizar essa métrica equivale a minimizar os falsos negativos, que são os erros de maior custo no cenário. Portanto, é a escolha ideal.
F1-score é a média harmônica entre precisão e revocação. Embora útil em classes desbalanceadas, ela pondera igualmente precisão e revocação. No problema, a revocação é mais importante que a precisão; portanto, otimizar F1 pode sacrificar revocação em favor de precisão, o que não atende ao objetivo principal.
Precisão mede a proporção de casos classificados como complexos que realmente são complexos (). Ela foca em evitar falsos positivos (gastar tempo desnecessário), mas o enunciado destaca que o custo maior é o falso negativo, não o falso positivo. Otimizar precisão pode reduzir falsos positivos, mas aumenta o risco de perder casos complexos.
AUC (Area Under the ROC Curve) mede a capacidade do modelo de separar as classes independentemente do threshold, sendo uma métrica de desempenho global. Não reflete diretamente a minimização de falsos negativos para um ponto de corte específico, e pode ser alta mesmo que a revocação em um determinado threshold seja baixa.
Em problemas de classificação assimétricos (custos diferentes para FP e FN), a escolha da métrica deve refletir o custo do erro mais grave. Memorize: falso negativo custoso → maximize revocação; falso positivo custoso → maximize precisão. Para o cenário de auditoria, onde perder uma fraude ou irregularidade é caro, recall é a métrica-rei.
Gabarito: letra B.
Link permanente: /questoes/fg077299