Pular para o conteúdo principal

Questão de Banco de Dados — Data Mining — FGV 2025

Banco de DadosData Mining
Código
fg122144
Banca
FGV
Órgão
TCE-RR
Ano
2025
Nível
Superior
Cargo
Auditor de Controle Externo - Tecnologia com Especialidade em Análise de Dados
Sobre algoritmos de mineração de dados, avalie as afirmativas a seguir e assinale (V) para a verdadeira e (F) para a falsa.( ) K-means, também conhecido como K-NN, é um algoritmo baseado na ideia de que objetos semelhantes estão próximos uns dos outros.( )Árvore de decisão é uma estrutura hierárquica constituída por nós. Nela, o coeficiente de Gini de um nó é sempre maior do que o do seu nó pai.( ) O algoritmo SVM, utilizado apenas para a tarefa de classificação, emprega classificadores lineares que separam o conjunto de dados por meio de hiperplanos, não sendo possível seu uso com problemas não linearmente separáveis.As afirmativas são, respectivamente,
  1. AV – V – F.
  2. BF – V – V.
  3. CF – F – V.
  4. DV – F – F.
  5. EF – F – F.
Revelar gabarito e comentário

GabaritoE — F – F – F.

Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.

Algoritmos de Mineração de Dados

Gabarito: letra E — F – F – F. Todas as três afirmativas contêm erros conceituais sobre K-means/K-NN, coeficiente de Gini em árvores de decisão e SVM. A banca testa o conhecimento básico desses algoritmos, e a sequência correta é de três falsas.

A questão exige que o candidato conheça as características fundamentais dos principais algoritmos de mineração de dados: clusterização (K-means), árvores de decisão e máquinas de vetores de suporte (SVM).

Primeira afirmativa — ❌ Falsa

Afirma que "K-means, também conhecido como K-NN". Isso é um erro grave: K-means é um algoritmo de clusterização (agrupamento não supervisionado), enquanto K-NN (K-Nearest Neighbors) é um algoritmo de classificação (supervisionado). Embora ambos usem noção de proximidade, são algoritmos distintos. O K-means atribui cada ponto ao cluster cujo centróide (média) é mais próximo, enquanto o K-NN classifica um ponto com base na maioria dos k vizinhos mais próximos. Portanto, a afirmativa é falsa.

Segunda afirmativa — ❌ Falsa

Diz que "o coeficiente de Gini de um nó é sempre maior do que o do seu nó pai". Na construção de árvores de decisão, a impureza de Gini é uma medida de heterogeneidade. O objetivo da partição é reduzir a impureza: o nó filho deve ter impureza menor (ou no máximo igual) que o nó pai. A afirmativa inverte o sentido, afirmando que o filho tem Gini maior, o que contradiz o princípio de pureza crescente na árvore. Logo, é falsa.

Terceira afirmativa — ❌ Falsa

Afirma que "SVM é utilizado apenas para classificação" e "não é possível seu uso com problemas não linearmente separáveis". O SVM (Support Vector Machine) é um algoritmo versátil: pode ser usado tanto para classificação quanto para regressão (SVR). Além disso, para problemas não linearmente separáveis, o SVM utiliza o truque do kernel (funções de kernel, como RBF, polinomial, sigmoide), que mapeia os dados para um espaço de maior dimensão onde se torna possível separá-los linearmente. Portanto, ambas as restrições são falsas.

Afirmativa

Conteúdo

Classificação

Motivo

K-means, também conhecido como K-NN, é um algoritmo baseado na ideia de que objetos semelhantes estão próximos uns dos outros.

Falsa

K-means é clusterização não supervisionada; K-NN é classificação supervisionada. São algoritmos distintos, embora ambos usem proximidade.

Árvore de decisão é uma estrutura hierárquica constituída por nós. Nela, o coeficiente de Gini de um nó é sempre maior do que o do seu nó pai.

Falsa

O coeficiente de Gini deve diminuir (ou no máximo ser igual) do nó pai para o nó filho, pois a partição busca reduzir a impureza.

O algoritmo SVM, utilizado apenas para a tarefa de classificação, emprega classificadores lineares que separam o conjunto de dados por meio de hiperplanos, não sendo possível seu uso com problemas não linearmente separáveis.

Falsa

SVM também serve para regressão (SVR) e, com o truque do kernel, resolve problemas não linearmente separáveis.

NÃO CAIA NESSA!

A banca mistura conceitos próximos (K-means versus K-NN) e inverte relações esperadas (Gini do filho maior que do pai). Cuidado com afirmações que usam "sempre" ou "apenas", pois geralmente são falsas quando o algoritmo admite variações.

Conclusão: as três afirmativas são falsas, sequência F – F – F.

Gabarito: letra E

Link permanente: /questoes/fg122144