Pular para o conteúdo principal

Questão de Banco de Dados — Data Mining — FGV 2024

Banco de DadosData Mining
Código
fg089950
Banca
FGV
Órgão
Prefeitura de Macaé - RJ
Ano
2024
Nível
Superior
Cargo
Analista Previdenciário - Especialidade: Analista de Sistemas
Data Mining é o processo de explorar grandes conjuntos de dados para identificar padrões, tendências e informações valiosas que não são imediatamente evidentes. Utiliza técnicas de estatística, aprendizado de máquina e análise de dados para extrair conhecimento útil a partir de dados brutos. No contexto de Data Mining, a seguinte técnica é mais adequada para descobrir padrões ocultos em grandes conjuntos de dados categóricos sem a necessidade de rótulos de classe:
  1. ARegressão Linear.
  2. BAnálise de Componentes Principais (PCA).
  3. CK-means.
  4. DApriori.
  5. ESupport Vector Machine (SVM).
Revelar gabarito e comentário

GabaritoD — Apriori.

Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.

Data Mining: Técnica para Padrões Ocultos em Dados Categóricos

Gabarito: letra D (Apriori). A questão pede a técnica mais adequada para descobrir padrões ocultos em grandes conjuntos de dados categóricos sem a necessidade de rótulos de classe. O algoritmo Apriori é o padrão-ouro para mineração de regras de associação, exatamente o que se aplica a dados categóricos (ex.: cestas de compras) sem supervisão – ele encontra itens frequentes e regras de coocorrência, revelando padrões implícitos.

A banca explora a diferença entre tarefas de aprendizado supervisionado e não supervisionado, e o tipo de dado que cada técnica manipula. Enquanto algumas alternativas são para dados numéricos ou exigem rótulos, o Apriori opera diretamente sobre dados categóricos (transações) sem necessidade de classes predefinidas, sendo a única entre as opções que casa perfeitamente com o enunciado.

Técnica

Tipo de Aprendizado

Tipo de Dado

Objetivo Principal

Adequada para Dados Categóricos sem Rótulos?

Regressão Linear

Supervisionado

Numérico contínuo

Predição de valor numérico

❌ Não

PCA

Não supervisionado

Numérico contínuo

Redução de dimensionalidade

❌ Não

K-means

Não supervisionado

Numérico contínuo

Agrupamento (clusterização)

❌ Não

Apriori

Não supervisionado

Categórico (transações)

Mineração de regras de associação

✅ Sim

SVM

Supervisionado

Numérico/categórico (com rótulos)

Classificação/regressão

❌ Não (exige rótulos)

Técnicas de Data Mining
  • 1Supervisionadas (com rótulo)
    • Regressão Linear (numérica contínua)
    • SVM (classificação)
  • 2Não supervisionadas (sem rótulo)
    • Dados numéricos
      • PCA (redução de dimensionalidade)
      • K-means (clusterização)
    • Dados categóricos
      • Apriori (regras de associação)
LEVEL · soulevel.com.br

Alternativa A — ❌ Incorreta

Regressão Linear é um método de aprendizado supervisionado para prever um valor numérico contínuo a partir de variáveis independentes. Não se aplica a dados categóricos nem descobre padrões ocultos sem rótulos: ela modela relações lineares entre variáveis, exigindo uma variável alvo numérica – portanto, foge completamente ao cenário proposto.

Alternativa B — ❌ Incorreta

Análise de Componentes Principais (PCA) é uma técnica de redução de dimensionalidade não supervisionada, mas trabalha com dados numéricos contínuos (variâncias e covariâncias). Não é adequada para dados categóricos e, embora possa revelar estruturas latentes, seu foco é comprimir dados, e não descobrir padrões de coocorrência entre itens como pede o enunciado.

Alternativa C — ❌ Incorreta

K-means é um algoritmo de clusterização (agrupamento) não supervisionado, que particiona dados em k grupos com base em distâncias (normalmente euclidiana). Ele é projetado para dados numéricos contínuos e não lida bem com dados categóricos sem transformação. Embora descubra padrões de agrupamento, não é a técnica mais direta para padrões ocultos em dados categóricos – o Apriori é mais específico para esse tipo.

Alternativa D — ✅ Correta ⟵ GABARITO

O algoritmo Apriori é a técnica clássica e mais adequada para mineração de regras de associação em grandes conjuntos de dados categóricos. Ele opera sobre dados de transações (ex.: itens comprados juntos) e encontra itens frequentes e regras de associação do tipo “se A então B”, revelando padrões ocultos sem qualquer rótulo de classe. O próprio conceito de suporte e confiança permite extrair relacionamentos sistemáticos entre variáveis categóricas – exatamente o que o enunciado descreve.

Alternativa E — ❌ Incorreta

Support Vector Machine (SVM) é um método de aprendizado supervisionado para classificação ou regressão. Ele necessita de dados rotulados para treinar o modelo, o que contraria a premissa de “sem a necessidade de rótulos de classe”. Além disso, SVM é mais adequado para dados numéricos e tarefas de fronteira de decisão, não para descobrir padrões associativos em dados categóricos.

NÃO CAIA NESSA!

A banca pode levar o candidato a pensar em K-means (alternativa C) por ser não supervisionado, mas K-means não é o mais adequado para dados categóricos nem para “padrões ocultos” no sentido de regras de associação. O termo “padrões ocultos” remete a relacionamentos entre itens (coocorrência), que é o forte do Apriori. Além disso, confundir PCA (redução) ou Regressão/SVM (supervisionados) com mineração de padrões não supervisionada é comum. Lembre-se: dados categóricos + sem rótulos + padrões ocultos = regras de associação → Apriori.

Gabarito: letra D (Apriori).

Link permanente: /questoes/fg089950