Machine Learning: Detecção de Anomalias
Gabarito: letra B. Isolation Forest é a técnica mais adequada para detecção de valores atípicos em dados não rotulados, pois isola anomalias diretamente sem necessidade de definir previamente o que é "normal".
A questão explica que se deseja identificar decisões judiciais com valores indenizatórios atípicos, sem dispor de um banco de dados pré-classificado como "normal" ou "anômalo". Isso caracteriza um problema de aprendizado não supervisionado (sem rótulos), focado em detecção de anomalias (outliers). Entre as técnicas, a mais direta e eficiente é o Isolation Forest.
Técnica | Tipo de Aprendizado | Objetivo Principal | Adequação para Detecção de Anomalias sem Rótulos | Motivo da Correção/Incorreção |
|---|
DBSCAN | Não supervisionado | Agrupamento baseado em densidade | Indireta (pontos isolados como ruído) | ❌ Incorreta. Não é a mais direta; Isolation Forest é mais eficiente para este fim. |
Isolation Forest | Não supervisionado | Detecção de anomalias | Direta e eficiente | ✅ Correta (Gabarito). Isola anomalias por partições aleatórias, sem necessidade de definir "normal". |
K-means | Não supervisionado | Agrupamento por centróides | Indireta (distância ao centroide) | ❌ Incorreta. Método indireto e sensível ao número de clusters. |
Autoencoders | Não supervisionado | Reconstrução de dados | Funcional, mas complexa | ❌ Incorreta. Exige mais dados e ajustes; menos prático que Isolation Forest. |
PCA | Não supervisionado | Redução de dimensionalidade | Visualização de outliers | ❌ Incorreta. Não é uma técnica de detecção direta de anomalias. |
Alternativa A — ❌ Incorreta
DBSCAN é um algoritmo de agrupamento baseado em densidade que pode identificar pontos não pertencentes a nenhum cluster como ruído. Embora possa detectar anomalias, não é a técnica mais adequada, pois o Isolation Forest foi projetado especificamente para esse fim, sendo mais eficiente e direto.
Alternativa B — ✅ Correta ⟵ GABARITO
Isolation Forest é um método não supervisionado que isola pontos anômalos por meio de partições aleatórias da amostra. Quanto mais rápido um ponto é isolado nas árvores de decisão, maior a probabilidade de ser uma anomalia. É amplamente utilizado em detecção de outliers em bases sem rótulos e atende perfeitamente ao cenário descrito.
Alternativa C — ❌ Incorreta
K-means é um algoritmo de clusterização que agrupa dados em K clusters baseados em centróides. Para detecção de anomalias, seria necessário medir a distância de cada ponto ao centroide mais próximo, o que é indireto e sensível ao número de clusters. Não é a técnica mais adequada para detecção de valores atípicos.
Alternativa D — ❌ Incorreta
Autoencoders são redes neurais que aprendem a reconstruir os dados de entrada. Pontos com alto erro de reconstrução são considerados anomalias. Embora funcionem para detecção de outliers, exigem maior quantidade de dados e ajuste de hiperparâmetros, sendo menos práticos que Isolation Forest para o problema específico.
Alternativa E — ❌ Incorreta
PCA (Análise de Componentes Principais) é uma técnica de redução de dimensionalidade que projeta os dados em componentes principais. Pode auxiliar na visualização de outliers em gráficos, mas não é um método de detecção de anomalias por si só. Isolation Forest é mais direto e eficaz.
Gabarito: letra B.