Questão de Banco de Dados — Data Mining — FGV 2023
Banco de Dados›Data Mining
Código
fg071482
Banca
FGV
Órgão
TCE-SP
Ano
2023
Nível
Superior
Cargo
Agente da Fiscalização - TI
João precisa criar um modelo interpretável de previsão de cancelamento de serviços com base em dados de cliente, demográficos e de tipo de serviço. Para tanto, João deve considerar que o problema é tabular, com vários atributos e regras de escolha complexas.No contexto de técnicas de classificação, o tipo de algoritmo que João deverá utilizar é:
Anaive bayes;
Bárvore de decisão;
Ck-vizinhos mais próximos;
Drede neural convolucional;
Emáquina de vetores de suporte.
Revelar gabarito e comentário▾
GabaritoB — árvore de decisão;
Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.
Classificação no contexto de Data Mining
Gabarito: letra B. João precisa de um modelo interpretável para um problema tabular com regras complexas. A árvore de decisão é o algoritmo mais adequado por ser intrinsecamente interpretável, lidar bem com atributos tabulares e representar regras de decisão de forma hierárquica e compreensível.
A questão testa o conhecimento sobre algoritmos de classificação e suas características, especialmente a interpretabilidade exigida pelo enunciado.
Algoritmo
Interpretabilidade
Adequação a dados tabulares
Captura de regras complexas
Motivo da (in)adequação
Árvore de Decisão
Alta (regras if-then explícitas)
Sim (ideal)
Sim (particionamento hierárquico)
Modelo transparente que representa interações não lineares
Naive Bayes
Média (probabilidades condicionais)
Sim
Não (assume independência)
Premissa simplificadora limita captura de interações
k-Vizinhos Mais Próximos
Baixa (caixa-preta)
Sim
Não (baseado em instâncias)
Não gera regras; sofre com muitos atributos
Rede Neural Convolucional
Baixa (caixa-preta)
Não (projetada para imagens)
Não
Inadequada para dados tabulares e não interpretável
Máquina de Vetores de Suporte
Baixa (caixa-preta)
Sim
Sim (com kernels)
Falta de interpretabilidade exigida pelo enunciado
Algoritmos de classificação
1Interpretáveis
Árvore de decisão
Regras if-then explícitas
Captura interações complexas
Ideal para dados tabulares
Naive Bayes
Assume independência condicional
Menos adequado para regras complexas
2Caixa-preta
k-NN
Não gera regras explícitas
Degrada com muitos atributos
SVM
Hiperplano não interpretável
Rede neural convolucional
Projetada para imagens
Não interpretável
LEVEL · soulevel.com.br
Alternativa A — ❌ Incorreta
O Naive Bayes é um modelo probabilístico que assume independência condicional entre os atributos – premissa que pode não se sustentar para regras complexas. Embora seja interpretável (probabilidades condicionais), sua suposição simplificadora reduz a capacidade de capturar interações complexas entre atributos, o que o torna menos adequado para o cenário descrito.
Alternativa B — ✅ Correta ⟵ GABARITO
A árvore de decisão é um modelo que particiona o espaço de atributos com nós de decisão baseados em valores dos atributos, gerando regras if-then facilmente interpretáveis. É ideal para problemas tabulares com múltiplos atributos e regras complexas, pois pode capturar interações não lineares enquanto mantém a transparência total do modelo – exatamente o que João busca.
Alternativa C — ❌ Incorreta
K-vizinhos mais próximos (k-NN) é um algoritmo baseado em instâncias que armazena todos os dados de treino e classifica por similaridade. Ele é considerado um modelo de caixa-preta (não oferece regras explícitas) e não é interpretável diretamente. Além disso, seu desempenho se degrada com muitos atributos (maldição da dimensionalidade) e não produz uma representação clara das regras de decisão.
Alternativa D — ❌ Incorreta
Redes neurais convolucionais (CNN) são projetadas para dados com topologia em grade, como imagens. Para dados tabulares, seu uso é incomum e, mesmo quando adaptadas, o modelo resultante não é interpretável (caixa-preta). O enunciado deixa claro que a interpretabilidade é essencial, o que inviabiliza o uso de CNNs.
Alternativa E — ❌ Incorreta
Máquina de vetores de suporte (SVM) é um classificador que encontra hiperplanos de separação com margem máxima. Embora possa ser eficaz em dados tabulares, o modelo resultante não é trivialmente interpretável (a menos que se use kernel linear e se analisem os pesos, o que é limitado). Para regras complexas com múltiplos atributos, a interpretabilidade é prejudicada, especialmente com kernels não lineares.