Questão de Banco de Dados — Data Mining — FGV 2025
Banco de Dados›Data Mining
Código
fg122144
Banca
FGV
Órgão
TCE-RR
Ano
2025
Nível
Superior
Cargo
Auditor de Controle Externo - Tecnologia com Especialidade em Análise de Dados
Sobre algoritmos de mineração de dados, avalie as afirmativas a seguir e assinale (V) para a verdadeira e (F) para a falsa.( ) K-means, também conhecido como K-NN, é um algoritmo baseado na ideia de que objetos semelhantes estão próximos uns dos outros.( )Árvore de decisão é uma estrutura hierárquica constituída por nós. Nela, o coeficiente de Gini de um nó é sempre maior do que o do seu nó pai.( ) O algoritmo SVM, utilizado apenas para a tarefa de classificação, emprega classificadores lineares que separam o conjunto de dados por meio de hiperplanos, não sendo possível seu uso com problemas não linearmente separáveis.As afirmativas são, respectivamente,
AV – V – F.
BF – V – V.
CF – F – V.
DV – F – F.
EF – F – F.
Revelar gabarito e comentário▾
GabaritoE — F – F – F.
Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.
Algoritmos de Mineração de Dados
Gabarito: letra E — F – F – F. Todas as três afirmativas contêm erros conceituais sobre K-means/K-NN, coeficiente de Gini em árvores de decisão e SVM. A banca testa o conhecimento básico desses algoritmos, e a sequência correta é de três falsas.
A questão exige que o candidato conheça as características fundamentais dos principais algoritmos de mineração de dados: clusterização (K-means), árvores de decisão e máquinas de vetores de suporte (SVM).
Primeira afirmativa — ❌ Falsa
Afirma que "K-means, também conhecido como K-NN". Isso é um erro grave: K-means é um algoritmo de clusterização (agrupamento não supervisionado), enquanto K-NN (K-Nearest Neighbors) é um algoritmo de classificação (supervisionado). Embora ambos usem noção de proximidade, são algoritmos distintos. O K-means atribui cada ponto ao cluster cujo centróide (média) é mais próximo, enquanto o K-NN classifica um ponto com base na maioria dos k vizinhos mais próximos. Portanto, a afirmativa é falsa.
Segunda afirmativa — ❌ Falsa
Diz que "o coeficiente de Gini de um nó é sempre maior do que o do seu nó pai". Na construção de árvores de decisão, a impureza de Gini é uma medida de heterogeneidade. O objetivo da partição é reduzir a impureza: o nó filho deve ter impureza menor (ou no máximo igual) que o nó pai. A afirmativa inverte o sentido, afirmando que o filho tem Gini maior, o que contradiz o princípio de pureza crescente na árvore. Logo, é falsa.
Terceira afirmativa — ❌ Falsa
Afirma que "SVM é utilizado apenas para classificação" e "não é possível seu uso com problemas não linearmente separáveis". O SVM (Support Vector Machine) é um algoritmo versátil: pode ser usado tanto para classificação quanto para regressão (SVR). Além disso, para problemas não linearmente separáveis, o SVM utiliza o truque do kernel (funções de kernel, como RBF, polinomial, sigmoide), que mapeia os dados para um espaço de maior dimensão onde se torna possível separá-los linearmente. Portanto, ambas as restrições são falsas.
Afirmativa
Conteúdo
Classificação
Motivo
1ª
K-means, também conhecido como K-NN, é um algoritmo baseado na ideia de que objetos semelhantes estão próximos uns dos outros.
Falsa
K-means é clusterização não supervisionada; K-NN é classificação supervisionada. São algoritmos distintos, embora ambos usem proximidade.
2ª
Árvore de decisão é uma estrutura hierárquica constituída por nós. Nela, o coeficiente de Gini de um nó é sempre maior do que o do seu nó pai.
Falsa
O coeficiente de Gini deve diminuir (ou no máximo ser igual) do nó pai para o nó filho, pois a partição busca reduzir a impureza.
3ª
O algoritmo SVM, utilizado apenas para a tarefa de classificação, emprega classificadores lineares que separam o conjunto de dados por meio de hiperplanos, não sendo possível seu uso com problemas não linearmente separáveis.
Falsa
SVM também serve para regressão (SVR) e, com o truque do kernel, resolve problemas não linearmente separáveis.
NÃO CAIA NESSA!
A banca mistura conceitos próximos (K-means versus K-NN) e inverte relações esperadas (Gini do filho maior que do pai). Cuidado com afirmações que usam "sempre" ou "apenas", pois geralmente são falsas quando o algoritmo admite variações.
Conclusão: as três afirmativas são falsas, sequência F – F – F.