Questão de Algoritmos e Estrutura de Dados — Algoritmos — CESPE / CEBRASPE 2024
Algoritmos e Estrutura de Dados›Algoritmos
Código
ce185158
Banca
CESPE / CEBRASPE
Órgão
SEBRAE-NACIONAL
Ano
2024
Nível
Superior
Cargo
Analista Técnico II – Cientista de Dados
Em relação aos conceitos do algoritmo k-means, julgue os itens a seguir.I É importante continuar as iterações do algoritmo k-means até que a mudança na posição dos centroides entre as iterações seja menor que um limite predefinido.II No coeficiente de silhueta, quanto mais próximo o coeficiente estiver de 1, menor a distância entre os clusters; 0 indica que os dados podem estar no cluster errado; valores negativos sugerem que o ponto está na borda.III Apesar de um maior número clusters sempre reduzir o SSE (sum of squared errors), isso não significa que mais clusters sempre sejam melhores, pois um número muito grande de clusters pode levar a overfitting do modelo.Assinale a opção correta.
AApenas o item I está certo.
BApenas o item II está certo.
CApenas os itens I e III estão certos.
DApenas os itens II e III estão certos.
Revelar gabarito e comentário▾
GabaritoC — Apenas os itens I e III estão certos.
Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.
Algoritmo k-means e coeficiente de silhueta
Gabarito: alternativa C (itens I e III corretos). O item I está correto ao descrever a condição de parada do k-means; o item III está correto ao relacionar SSE e overfitting; o item II inverte a interpretação do coeficiente de silhueta, tornando-se falso.
Coeficiente de silhueta: Próximo de 1 (Bem agrupado, Clusters bem separados); 0 (Fronteira entre clusters); Negativo (Cluster errado)
Item I — ✅ Correto
No algoritmo k-means, a convergência é tipicamente verificada quando a mudança na posição dos centroides entre iterações é menor que um limiar predefinido, ou quando não há mais realocação de pontos. Essa é uma condição de parada padrão, conforme descrito no Algoritmo 28.4 do material de apoio. Portanto, o item está correto.
Item II — ❌ Incorreto
O coeficiente de silhueta mede o quão bem um ponto se encaixa em seu próprio cluster em comparação com outros clusters. Sua interpretação correta é:
Próximo de 1: o ponto está bem agrupado e os clusters estão bem separados (distância grande entre clusters).
0: o ponto está na fronteira entre dois clusters (não indica cluster errado).
Negativo: o ponto pode estar atribuído ao cluster errado.
A afirmação do item inverte esses significados: "menor a distância entre os clusters" é o oposto do correto, e "valores negativos sugerem que o ponto está na borda" também está errado. Logo, o item II é falso.
NÃO CAIA NESSA!
A banca explora a inversão dos significados do coeficiente de silhueta. Lembre-se: quanto mais próximo de 1, melhor separados estão os clusters (maior distância entre eles); 0 é fronteira; negativo é cluster errado. Não confunda.
Item III — ✅ Correto
Em k-means, a soma dos erros quadráticos (SSE) diminui à medida que o número de clusters k aumenta, pois cada cluster pode se ajustar mais aos dados. No entanto, aumentar k excessivamente leva a overfitting: o modelo se ajusta aos ruídos e não generaliza para novos dados. O item expressa exatamente esse trade-off, estando correto.
Conclusão: Apenas os itens I e III estão corretos. Portanto, a alternativa correta é a letra C (Apenas os itens I e III estão certos).