Pular para o conteúdo principal

Questão de Algoritmos e Estrutura de Dados — Algoritmos — CESPE / CEBRASPE 2024

Algoritmos e Estrutura de DadosAlgoritmos
Código
ce185158
Banca
CESPE / CEBRASPE
Órgão
SEBRAE-NACIONAL
Ano
2024
Nível
Superior
Cargo
Analista Técnico II – Cientista de Dados
Em relação aos conceitos do algoritmo k-means, julgue os itens a seguir.I É importante continuar as iterações do algoritmo k-means até que a mudança na posição dos centroides entre as iterações seja menor que um limite predefinido.II No coeficiente de silhueta, quanto mais próximo o coeficiente estiver de 1, menor a distância entre os clusters; 0 indica que os dados podem estar no cluster errado; valores negativos sugerem que o ponto está na borda.III Apesar de um maior número clusters sempre reduzir o SSE (sum of squared errors), isso não significa que mais clusters sempre sejam melhores, pois um número muito grande de clusters pode levar a overfitting do modelo.Assinale a opção correta.
  1. AApenas o item I está certo.
  2. BApenas o item II está certo.
  3. CApenas os itens I e III estão certos.
  4. DApenas os itens II e III estão certos.
Revelar gabarito e comentário

GabaritoC — Apenas os itens I e III estão certos.

Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.

Algoritmo k-means e coeficiente de silhueta

Gabarito: alternativa C (itens I e III corretos). O item I está correto ao descrever a condição de parada do k-means; o item III está correto ao relacionar SSE e overfitting; o item II inverte a interpretação do coeficiente de silhueta, tornando-se falso.

1Próximo de 1
Bem agrupado
Clusters bem separados
20
Fronteira entre clusters
3Negativo
Cluster errado
Coeficiente de silhueta
LEVELsoulevel.com.br
Coeficiente de silhueta: Próximo de 1 (Bem agrupado, Clusters bem separados); 0 (Fronteira entre clusters); Negativo (Cluster errado)

Item I — ✅ Correto

No algoritmo k-means, a convergência é tipicamente verificada quando a mudança na posição dos centroides entre iterações é menor que um limiar predefinido, ou quando não há mais realocação de pontos. Essa é uma condição de parada padrão, conforme descrito no Algoritmo 28.4 do material de apoio. Portanto, o item está correto.

Item II — ❌ Incorreto

O coeficiente de silhueta mede o quão bem um ponto se encaixa em seu próprio cluster em comparação com outros clusters. Sua interpretação correta é:

  • Próximo de 1: o ponto está bem agrupado e os clusters estão bem separados (distância grande entre clusters).

  • 0: o ponto está na fronteira entre dois clusters (não indica cluster errado).

  • Negativo: o ponto pode estar atribuído ao cluster errado.

A afirmação do item inverte esses significados: "menor a distância entre os clusters" é o oposto do correto, e "valores negativos sugerem que o ponto está na borda" também está errado. Logo, o item II é falso.

NÃO CAIA NESSA!

A banca explora a inversão dos significados do coeficiente de silhueta. Lembre-se: quanto mais próximo de 1, melhor separados estão os clusters (maior distância entre eles); 0 é fronteira; negativo é cluster errado. Não confunda.

Item III — ✅ Correto

Em k-means, a soma dos erros quadráticos (SSE) diminui à medida que o número de clusters k aumenta, pois cada cluster pode se ajustar mais aos dados. No entanto, aumentar k excessivamente leva a overfitting: o modelo se ajusta aos ruídos e não generaliza para novos dados. O item expressa exatamente esse trade-off, estando correto.

Conclusão: Apenas os itens I e III estão corretos. Portanto, a alternativa correta é a letra C (Apenas os itens I e III estão certos).

Link permanente: /questoes/ce185158