Pular para o conteúdo principal

Questão de Banco de Dados — Data Mining — FGV 2023

Banco de DadosData Mining
Código
fg071482
Banca
FGV
Órgão
TCE-SP
Ano
2023
Nível
Superior
Cargo
Agente da Fiscalização - TI
João precisa criar um modelo interpretável de previsão de cancelamento de serviços com base em dados de cliente, demográficos e de tipo de serviço. Para tanto, João deve considerar que o problema é tabular, com vários atributos e regras de escolha complexas.No contexto de técnicas de classificação, o tipo de algoritmo que João deverá utilizar é:
  1. Anaive bayes;
  2. Bárvore de decisão;
  3. Ck-vizinhos mais próximos;
  4. Drede neural convolucional;
  5. Emáquina de vetores de suporte.
Revelar gabarito e comentário

GabaritoB — árvore de decisão;

Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.

Classificação no contexto de Data Mining

Gabarito: letra B. João precisa de um modelo interpretável para um problema tabular com regras complexas. A árvore de decisão é o algoritmo mais adequado por ser intrinsecamente interpretável, lidar bem com atributos tabulares e representar regras de decisão de forma hierárquica e compreensível.

A questão testa o conhecimento sobre algoritmos de classificação e suas características, especialmente a interpretabilidade exigida pelo enunciado.

Algoritmo

Interpretabilidade

Adequação a dados tabulares

Captura de regras complexas

Motivo da (in)adequação

Árvore de Decisão

Alta (regras if-then explícitas)

Sim (ideal)

Sim (particionamento hierárquico)

Modelo transparente que representa interações não lineares

Naive Bayes

Média (probabilidades condicionais)

Sim

Não (assume independência)

Premissa simplificadora limita captura de interações

k-Vizinhos Mais Próximos

Baixa (caixa-preta)

Sim

Não (baseado em instâncias)

Não gera regras; sofre com muitos atributos

Rede Neural Convolucional

Baixa (caixa-preta)

Não (projetada para imagens)

Não

Inadequada para dados tabulares e não interpretável

Máquina de Vetores de Suporte

Baixa (caixa-preta)

Sim

Sim (com kernels)

Falta de interpretabilidade exigida pelo enunciado

Algoritmos de classificação
  • 1Interpretáveis
    • Árvore de decisão
      • Regras if-then explícitas
      • Captura interações complexas
      • Ideal para dados tabulares
    • Naive Bayes
      • Assume independência condicional
      • Menos adequado para regras complexas
  • 2Caixa-preta
    • k-NN
      • Não gera regras explícitas
      • Degrada com muitos atributos
    • SVM
      • Hiperplano não interpretável
    • Rede neural convolucional
      • Projetada para imagens
      • Não interpretável
LEVEL · soulevel.com.br

Alternativa A — ❌ Incorreta

O Naive Bayes é um modelo probabilístico que assume independência condicional entre os atributos – premissa que pode não se sustentar para regras complexas. Embora seja interpretável (probabilidades condicionais), sua suposição simplificadora reduz a capacidade de capturar interações complexas entre atributos, o que o torna menos adequado para o cenário descrito.

Alternativa B — ✅ Correta ⟵ GABARITO

A árvore de decisão é um modelo que particiona o espaço de atributos com nós de decisão baseados em valores dos atributos, gerando regras if-then facilmente interpretáveis. É ideal para problemas tabulares com múltiplos atributos e regras complexas, pois pode capturar interações não lineares enquanto mantém a transparência total do modelo – exatamente o que João busca.

Alternativa C — ❌ Incorreta

K-vizinhos mais próximos (k-NN) é um algoritmo baseado em instâncias que armazena todos os dados de treino e classifica por similaridade. Ele é considerado um modelo de caixa-preta (não oferece regras explícitas) e não é interpretável diretamente. Além disso, seu desempenho se degrada com muitos atributos (maldição da dimensionalidade) e não produz uma representação clara das regras de decisão.

Alternativa D — ❌ Incorreta

Redes neurais convolucionais (CNN) são projetadas para dados com topologia em grade, como imagens. Para dados tabulares, seu uso é incomum e, mesmo quando adaptadas, o modelo resultante não é interpretável (caixa-preta). O enunciado deixa claro que a interpretabilidade é essencial, o que inviabiliza o uso de CNNs.

Alternativa E — ❌ Incorreta

Máquina de vetores de suporte (SVM) é um classificador que encontra hiperplanos de separação com margem máxima. Embora possa ser eficaz em dados tabulares, o modelo resultante não é trivialmente interpretável (a menos que se use kernel linear e se analisem os pesos, o que é limitado). Para regras complexas com múltiplos atributos, a interpretabilidade é prejudicada, especialmente com kernels não lineares.

Gabarito: letra B.

Link permanente: /questoes/fg071482