Pular para o conteúdo principal

Questão de Algoritmos e Estrutura de Dados — Algoritmos — IV - UFG 2024

Algoritmos e Estrutura de DadosAlgoritmos
Código
qg121365
Banca
IV - UFG
Órgão
TJ-AC
Ano
2024
Nível
Superior
Cargo
CS-UFG - - Analista Judiciário - Analista de Ciência de Dados
Uma das métricas mais comumente utilizadas para comparar resultados de algoritmos de clusterização é obtida por meio da fórmula (b-a)/ max(a,b), em que:a é a distância média entre os pontos dentro de cada cluster (distância média intra-cluster) eb é a distância média para o cluster mais próximo (distância média para os pontos do cluster mais próximo).A métrica descrita recebe o nome de:
  1. AR².
  2. Bsilhouette score.
  3. CF1-score.
  4. DROC.
Revelar gabarito e comentário

GabaritoB — silhouette score.

Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.

Métricas de avaliação em clusterização

Gabarito: letra B. A métrica descrita pela fórmula (ba)/max(a,b)(b-a)/\max(a,b), onde aa é a distância média intra-cluster e bb é a distância média para o cluster mais próximo, é o silhouette score (coeficiente de silhueta). Essa métrica avalia a coesão e a separação dos clusters, variando de -1 a 1, sendo que valores próximos de 1 indicam agrupamentos bem definidos.

A banca testa o conhecimento de métricas comuns em aprendizado não supervisionado, especialmente em algoritmos de clusterização. O silhouette score é amplamente utilizado por combinar em uma única medida a compactação dos clusters e a distância entre eles.

Alternativa A — ❌ Incorreta

O coeficiente R2R^2 é uma métrica de regressão que indica a proporção da variância dos dados explicada pelo modelo. Não se aplica à avaliação de clusters, pois não mede coesão ou separação entre grupos.

Alternativa B — ✅ Correta ⟵ GABARITO

O silhouette score (coeficiente de silhueta) é exatamente a métrica definida pela fórmula apresentada. Para cada ponto ii, calcula-se s(i)=b(i)a(i)max(a(i),b(i))s(i) = \frac{b(i) - a(i)}{\max(a(i), b(i))}, onde a(i)a(i) é a distância média aos demais pontos do mesmo cluster e b(i)b(i) é a menor distância média aos pontos de outro cluster. O valor global é a média sobre todos os pontos.

Alternativa C — ❌ Incorreta

O F1F1-score é uma métrica de classificação supervisionada, que combina precisão e revocação. Não é utilizado para avaliar resultados de clusterização, pois exige rótulos verdadeiros para comparação.

Alternativa D — ❌ Incorreta

A curva ROC (Receiver Operating Characteristic) é uma ferramenta para avaliar classificadores binários, baseada na taxa de verdadeiros positivos e falsos positivos. Não se aplica a problemas de clusterização não supervisionada.

Gabarito: letra B.

Link permanente: /questoes/qg121365