Questão de Banco de Dados — Data Mining — FGV 2024
Banco de Dados›Data Mining
Código
fg089950
Banca
FGV
Órgão
Prefeitura de Macaé - RJ
Ano
2024
Nível
Superior
Cargo
Analista Previdenciário - Especialidade: Analista de Sistemas
Data Mining é o processo de explorar grandes conjuntos de dados para identificar padrões, tendências e informações valiosas que não são imediatamente evidentes. Utiliza técnicas de estatística, aprendizado de máquina e análise de dados para extrair conhecimento útil a partir de dados brutos. No contexto de Data Mining, a seguinte técnica é mais adequada para descobrir padrões ocultos em grandes conjuntos de dados categóricos sem a necessidade de rótulos de classe:
ARegressão Linear.
BAnálise de Componentes Principais (PCA).
CK-means.
DApriori.
ESupport Vector Machine (SVM).
Revelar gabarito e comentário▾
GabaritoD — Apriori.
Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.
Data Mining: Técnica para Padrões Ocultos em Dados Categóricos
Gabarito: letra D (Apriori). A questão pede a técnica mais adequada para descobrir padrões ocultos em grandes conjuntos de dados categóricos sem a necessidade de rótulos de classe. O algoritmo Apriori é o padrão-ouro para mineração de regras de associação, exatamente o que se aplica a dados categóricos (ex.: cestas de compras) sem supervisão – ele encontra itens frequentes e regras de coocorrência, revelando padrões implícitos.
A banca explora a diferença entre tarefas de aprendizado supervisionado e não supervisionado, e o tipo de dado que cada técnica manipula. Enquanto algumas alternativas são para dados numéricos ou exigem rótulos, o Apriori opera diretamente sobre dados categóricos (transações) sem necessidade de classes predefinidas, sendo a única entre as opções que casa perfeitamente com o enunciado.
Técnica
Tipo de Aprendizado
Tipo de Dado
Objetivo Principal
Adequada para Dados Categóricos sem Rótulos?
Regressão Linear
Supervisionado
Numérico contínuo
Predição de valor numérico
❌ Não
PCA
Não supervisionado
Numérico contínuo
Redução de dimensionalidade
❌ Não
K-means
Não supervisionado
Numérico contínuo
Agrupamento (clusterização)
❌ Não
Apriori
Não supervisionado
Categórico (transações)
Mineração de regras de associação
✅ Sim
SVM
Supervisionado
Numérico/categórico (com rótulos)
Classificação/regressão
❌ Não (exige rótulos)
Técnicas de Data Mining
1Supervisionadas (com rótulo)
Regressão Linear (numérica contínua)
SVM (classificação)
2Não supervisionadas (sem rótulo)
Dados numéricos
PCA (redução de dimensionalidade)
K-means (clusterização)
Dados categóricos
Apriori (regras de associação)
LEVEL · soulevel.com.br
Alternativa A — ❌ Incorreta
Regressão Linear é um método de aprendizado supervisionado para prever um valor numérico contínuo a partir de variáveis independentes. Não se aplica a dados categóricos nem descobre padrões ocultos sem rótulos: ela modela relações lineares entre variáveis, exigindo uma variável alvo numérica – portanto, foge completamente ao cenário proposto.
Alternativa B — ❌ Incorreta
Análise de Componentes Principais (PCA) é uma técnica de redução de dimensionalidade não supervisionada, mas trabalha com dados numéricos contínuos (variâncias e covariâncias). Não é adequada para dados categóricos e, embora possa revelar estruturas latentes, seu foco é comprimir dados, e não descobrir padrões de coocorrência entre itens como pede o enunciado.
Alternativa C — ❌ Incorreta
K-means é um algoritmo de clusterização (agrupamento) não supervisionado, que particiona dados em k grupos com base em distâncias (normalmente euclidiana). Ele é projetado para dados numéricos contínuos e não lida bem com dados categóricos sem transformação. Embora descubra padrões de agrupamento, não é a técnica mais direta para padrões ocultos em dados categóricos – o Apriori é mais específico para esse tipo.
Alternativa D — ✅ Correta ⟵ GABARITO
O algoritmo Apriori é a técnica clássica e mais adequada para mineração de regras de associação em grandes conjuntos de dados categóricos. Ele opera sobre dados de transações (ex.: itens comprados juntos) e encontra itens frequentes e regras de associação do tipo “se A então B”, revelando padrões ocultos sem qualquer rótulo de classe. O próprio conceito de suporte e confiança permite extrair relacionamentos sistemáticos entre variáveis categóricas – exatamente o que o enunciado descreve.
Alternativa E — ❌ Incorreta
Support Vector Machine (SVM) é um método de aprendizado supervisionado para classificação ou regressão. Ele necessita de dados rotulados para treinar o modelo, o que contraria a premissa de “sem a necessidade de rótulos de classe”. Além disso, SVM é mais adequado para dados numéricos e tarefas de fronteira de decisão, não para descobrir padrões associativos em dados categóricos.
NÃO CAIA NESSA!
A banca pode levar o candidato a pensar em K-means (alternativa C) por ser não supervisionado, mas K-means não é o mais adequado para dados categóricos nem para “padrões ocultos” no sentido de regras de associação. O termo “padrões ocultos” remete a relacionamentos entre itens (coocorrência), que é o forte do Apriori. Além disso, confundir PCA (redução) ou Regressão/SVM (supervisionados) com mineração de padrões não supervisionada é comum. Lembre-se: dados categóricos + sem rótulos + padrões ocultos = regras de associação → Apriori.