Pular para o conteúdo principal

Questão de Banco de Dados — Data Mining — CESPE / CEBRASPE 2025

Banco de DadosData Mining
Código
ce193429
Banca
CESPE / CEBRASPE
Órgão
AEB
Ano
2025
Nível
Superior
Cargo
Tecnologista Júnior – Especialidade: Tecnologia da Informação
No contexto da mineração de dados, diferentes algoritmos são utilizados para solucionar problemas específicos, como segmentação de dados, descoberta de padrões e construção de modelos preditivos. Considerando os métodos Apriori, FP-Growth, k-means e árvores de decisão, assinale a opção que corresponde à descrição correta do funcionamento de um desses algoritmos.
  1. AO Apriori gera padrões frequentes analisando apenas pares de itens, sem a necessidade de avaliar conjuntos de itens maiores ao longo do processo.
  2. BO algoritmo FP-Growth é amplamente utilizado para descoberta de padrões frequentes em grandes bases de dados, sendo uma alternativa eficiente ao Apriori ao evitar a geração de candidatos.
  3. CO k-means automaticamente determina o número ideal de clusters com base na densidade dos dados, sem necessidade de parametrização prévia.
  4. DO k-means é um algoritmo de agrupamento que pode identificar clusters de formatos arbitrários e é robusto contra outliers, sendo adequado para dados com distribuições não esféricas.
  5. EA árvore de decisão é insensível a ruídos, sendo capaz de generalizar bem para novos dados, independentemente da qualidade do conjunto de treinamento.
Revelar gabarito e comentário

GabaritoB — O algoritmo FP-Growth é amplamente utilizado para descoberta de padrões frequentes em grandes bases de dados, sendo uma alternativa eficiente ao Apriori ao evitar a geração de candidatos.

Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.

Mineração de dados: algoritmos de padrões, agrupamento e classificação

Gabarito: letra B. O FP-Growth (Frequent Pattern Growth) é um algoritmo eficiente para descoberta de padrões frequentes, que supera o Apriori ao evitar a geração explícita de candidatos, construindo uma árvore compacta (FP-tree) a partir da base de dados. As demais alternativas incorrem em erros conceituais: o Apriori não analisa apenas pares; o k-means não determina automaticamente o número de clusters nem lida bem com formas arbitrárias e outliers; e árvores de decisão são sensíveis a ruídos.

A banca testa o conhecimento das características essenciais de cada algoritmo. Vejamos cada alternativa.

Algoritmo

Funcionamento Correto

Erro Comum na Alternativa

Apriori

Gera padrões frequentes avaliando conjuntos de itens de tamanhos crescentes (1-itemsets, 2-itemsets, ...) usando o princípio apriori.

Alternativa A erra ao afirmar que analisa apenas pares de itens, sem avaliar conjuntos maiores.

FP-Growth

Constrói uma FP-tree (Frequent Pattern Tree) a partir das transações, evitando a geração explícita de candidatos, sendo mais eficiente que o Apriori.

Alternativa B está correta e é o gabarito.

k-means

Requer que o número de clusters (k) seja fornecido pelo usuário; assume clusters esféricos e é sensível a outliers.

Alternativa C erra ao dizer que determina automaticamente o número ideal de clusters; Alternativa D erra ao afirmar que identifica clusters de formatos arbitrários e é robusto contra outliers.

Árvore de Decisão

É sensível a ruídos nos dados de treinamento, podendo gerar overfitting se não for podada.

Alternativa E erra ao afirmar que é insensível a ruídos e generaliza bem independentemente da qualidade dos dados.

Algoritmos de mineração
  • 1Padrões frequentes
    • Apriori
      • Gera candidatos
      • Avalia itensets crescentes
    • FP-Growth
      • Evita geração de candidatos
      • Constrói FP-tree
  • 2Agrupamento (clustering)
    • k-means
      • Requer k pré-definido
      • Clusters esféricos
      • Sensível a outliers
  • 3Classificação
    • Árvore de decisão
      • Sensível a ruídos
LEVEL · soulevel.com.br

Alternativa A — ❌ Incorreta

O Apriori gera padrões frequentes avaliando conjuntos de itens de tamanhos crescentes (1-itemsets, 2-itemsets, …) usando o princípio apriori (subconjuntos de um itemset frequente também são frequentes). Ele não se limita a pares; analisa itensets maiores até que nenhum candidato frequente seja encontrado. A descrição dada é incompleta e enganosa.

Alternativa B — ✅ Correta ⟵ GABARITO

O FP-Growth é uma alternativa ao Apriori que evita a geração de candidatos ao construir uma FP-tree (Frequent Pattern Tree) a partir das transações. Essa estrutura compacta permite minerar padrões frequentes diretamente, sem a necessidade de gerar e testar milhares de candidatos, tornando-o mais eficiente em grandes bases de dados.

Alternativa C — ❌ Incorreta

O k-means não determina automaticamente o número ideal de clusters. Esse parâmetro (k) deve ser fornecido pelo usuário. Ademais, o algoritmo baseia-se na distância (geralmente euclidiana) e não na densidade dos dados. Métodos como DBSCAN ou Mean Shift é que podem inferir o número de clusters a partir da densidade.

Alternativa D — ❌ Incorreta

O k-means assume clusters esféricos e é sensível a outliers, pois a média (centróide) é fortemente influenciada por pontos extremos. Algoritmos como DBSCAN ou OPTICS são mais adequados para clusters de formatos arbitrários e robustez contra outliers.

Alternativa E — ❌ Incorreta

Árvores de decisão são sensíveis a ruídos e podem sofrer overfitting se o conjunto de treinamento for ruidoso ou desbalanceado. Técnicas como poda (pruning) ajudam a generalizar, mas a afirmação de que são "insensíveis a ruídos" e que generalizam independentemente da qualidade dos dados é falsa.

NÃO CAIA NESSA!

A banca inverte propriedades: o k-means é apresentado como se determinasse automaticamente k e lidasse com formas arbitrárias, quando na verdade exige parametrização e supõe clusters esféricos. Já o FP-Growth é corretamente descrito como alternativa ao Apriori sem geração de candidatos.

Gabarito: letra B.

Link permanente: /questoes/ce193429