Questão de Banco de Dados — Data Mining — CESPE / CEBRASPE 2025
Banco de Dados›Data Mining
Código
ce193429
Banca
CESPE / CEBRASPE
Órgão
AEB
Ano
2025
Nível
Superior
Cargo
Tecnologista Júnior – Especialidade: Tecnologia da Informação
No contexto da mineração de dados, diferentes algoritmos são utilizados para solucionar problemas específicos, como segmentação de dados, descoberta de padrões e construção de modelos preditivos. Considerando os métodos Apriori, FP-Growth, k-means e árvores de decisão, assinale a opção que corresponde à descrição correta do funcionamento de um desses algoritmos.
AO Apriori gera padrões frequentes analisando apenas pares de itens, sem a necessidade de avaliar conjuntos de itens maiores ao longo do processo.
BO algoritmo FP-Growth é amplamente utilizado para descoberta de padrões frequentes em grandes bases de dados, sendo uma alternativa eficiente ao Apriori ao evitar a geração de candidatos.
CO k-means automaticamente determina o número ideal de clusters com base na densidade dos dados, sem necessidade de parametrização prévia.
DO k-means é um algoritmo de agrupamento que pode identificar clusters de formatos arbitrários e é robusto contra outliers, sendo adequado para dados com distribuições não esféricas.
EA árvore de decisão é insensível a ruídos, sendo capaz de generalizar bem para novos dados, independentemente da qualidade do conjunto de treinamento.
Revelar gabarito e comentário▾
GabaritoB — O algoritmo FP-Growth é amplamente utilizado para descoberta de padrões frequentes em grandes bases de dados, sendo uma alternativa eficiente ao Apriori ao evitar a geração de candidatos.
Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.
Mineração de dados: algoritmos de padrões, agrupamento e classificação
Gabarito: letra B. O FP-Growth (Frequent Pattern Growth) é um algoritmo eficiente para descoberta de padrões frequentes, que supera o Apriori ao evitar a geração explícita de candidatos, construindo uma árvore compacta (FP-tree) a partir da base de dados. As demais alternativas incorrem em erros conceituais: o Apriori não analisa apenas pares; o k-means não determina automaticamente o número de clusters nem lida bem com formas arbitrárias e outliers; e árvores de decisão são sensíveis a ruídos.
A banca testa o conhecimento das características essenciais de cada algoritmo. Vejamos cada alternativa.
Algoritmo
Funcionamento Correto
Erro Comum na Alternativa
Apriori
Gera padrões frequentes avaliando conjuntos de itens de tamanhos crescentes (1-itemsets, 2-itemsets, ...) usando o princípio apriori.
Alternativa A erra ao afirmar que analisa apenas pares de itens, sem avaliar conjuntos maiores.
FP-Growth
Constrói uma FP-tree (Frequent Pattern Tree) a partir das transações, evitando a geração explícita de candidatos, sendo mais eficiente que o Apriori.
Alternativa B está correta e é o gabarito.
k-means
Requer que o número de clusters (k) seja fornecido pelo usuário; assume clusters esféricos e é sensível a outliers.
Alternativa C erra ao dizer que determina automaticamente o número ideal de clusters; Alternativa D erra ao afirmar que identifica clusters de formatos arbitrários e é robusto contra outliers.
Árvore de Decisão
É sensível a ruídos nos dados de treinamento, podendo gerar overfitting se não for podada.
Alternativa E erra ao afirmar que é insensível a ruídos e generaliza bem independentemente da qualidade dos dados.
Algoritmos de mineração
1Padrões frequentes
Apriori
Gera candidatos
Avalia itensets crescentes
FP-Growth
Evita geração de candidatos
Constrói FP-tree
2Agrupamento (clustering)
k-means
Requer k pré-definido
Clusters esféricos
Sensível a outliers
3Classificação
Árvore de decisão
Sensível a ruídos
LEVEL · soulevel.com.br
Alternativa A — ❌ Incorreta
O Apriori gera padrões frequentes avaliando conjuntos de itens de tamanhos crescentes (1-itemsets, 2-itemsets, …) usando o princípio apriori (subconjuntos de um itemset frequente também são frequentes). Ele não se limita a pares; analisa itensets maiores até que nenhum candidato frequente seja encontrado. A descrição dada é incompleta e enganosa.
Alternativa B — ✅ Correta ⟵ GABARITO
O FP-Growth é uma alternativa ao Apriori que evita a geração de candidatos ao construir uma FP-tree (Frequent Pattern Tree) a partir das transações. Essa estrutura compacta permite minerar padrões frequentes diretamente, sem a necessidade de gerar e testar milhares de candidatos, tornando-o mais eficiente em grandes bases de dados.
Alternativa C — ❌ Incorreta
O k-means não determina automaticamente o número ideal de clusters. Esse parâmetro (k) deve ser fornecido pelo usuário. Ademais, o algoritmo baseia-se na distância (geralmente euclidiana) e não na densidade dos dados. Métodos como DBSCAN ou Mean Shift é que podem inferir o número de clusters a partir da densidade.
Alternativa D — ❌ Incorreta
O k-means assume clusters esféricos e é sensível a outliers, pois a média (centróide) é fortemente influenciada por pontos extremos. Algoritmos como DBSCAN ou OPTICS são mais adequados para clusters de formatos arbitrários e robustez contra outliers.
Alternativa E — ❌ Incorreta
Árvores de decisão são sensíveis a ruídos e podem sofrer overfitting se o conjunto de treinamento for ruidoso ou desbalanceado. Técnicas como poda (pruning) ajudam a generalizar, mas a afirmação de que são "insensíveis a ruídos" e que generalizam independentemente da qualidade dos dados é falsa.
NÃO CAIA NESSA!
A banca inverte propriedades: o k-means é apresentado como se determinasse automaticamente k e lidasse com formas arbitrárias, quando na verdade exige parametrização e supõe clusters esféricos. Já o FP-Growth é corretamente descrito como alternativa ao Apriori sem geração de candidatos.