Aprendizado de Máquina Não Supervisionado – Clustering
Gabarito: letra A – Apenas as afirmativas I e II estão corretas. O k-means é um algoritmo de particionamento iterativo que atribui instâncias ao centroide mais próximo e recalcula os centroides como a média dos pontos do cluster. O coeficiente de silhueta mede a qualidade do agrupamento variando de -1 a 1. O DBSCAN é um método baseado em densidade, não em centroides, e não exige definição prévia do número de clusters.
A banca testa conhecimentos fundamentais de algoritmos de agrupamento (clustering) no aprendizado não supervisionado. A afirmativa III contém dois erros: DBSCAN não é baseado em centroides (é baseado em densidade) e o número de clusters não é definido previamente (ele é descoberto automaticamente).
Afirmativa | Conteúdo | Correção | Justificativa |
|---|
I | No k-means, atribuição ao centroide mais próximo e atualização pela média iterativamente | ✅ Correta | Descreve exatamente o funcionamento do algoritmo k-means |
II | Coeficiente de silhouette usa a(i) e b(i) e varia em [-1, 1] | ✅ Correta | Definição precisa da métrica de avaliação de agrupamento |
III | DBSCAN é baseado em centroides e exige k pré-definido | ❌ Incorreta | DBSCAN é baseado em densidade e descobre clusters automaticamente |
Afirmativa I — ✅ Correta
O algoritmo k-means segue exatamente o descrito: atribui cada instância ao cluster cujo centroide está mais próximo (menor distância, geralmente euclidiana) e depois recalcula cada centroide como a média aritmética das instâncias daquele cluster. Esse processo se repete iterativamente até convergência (p. ex., quando os centroides não se movem mais de um limiar).
Afirmativa II — ✅ Correta
O coeficiente de silhueta é definido por:
onde:
O valor varia em : próximo de 1 indica agrupamento adequado, próximo de -1 indica má classificação.
Afirmativa III — ❌ Incorreta
O DBSCAN (Density-Based Spatial Clustering of Applications with Noise) é um algoritmo baseado em densidade. Ele agrupa pontos que estão próximos entre si (dentro de um raio eps) e que têm um número mínimo de vizinhos (minPts). Não usa centroides nem exige que se defina k previamente. Pelo contrário, descobre clusters de formato arbitrário e identifica ruídos (outliers).
Conclusão: Estão corretas apenas I e II → gabarito letra A.