Pular para o conteúdo principal

Questão de TI - Ciência de Dados e Inteligência Artificial — Data Mining (Mineração de Dados): Etapas, Algoritmos e Modelos (KDD, CRISP-DM, etc.) — INSTITUTO AOCP 2024

TI - Ciência de Dados e Inteligência ArtificialData Mining (Mineração de Dados): Etapas, Algoritmos e Modelos (KDD, CRISP-DM, etc.)
Código
qa630910
Banca
INSTITUTO AOCP
Órgão
MGI
Ano
2024
Cargo
Esp ( )
A regra de associação determina quanto um conjunto de dados implica a presença de um outro conjunto de dados distinto em uma transação, encontrando padrões frequentes, associações ou correlações.   Nesse contexto, assinale a alternativa correta.
  1. ASão restrições normalmente aplicadas para evitar regras que não sejam interessantes: confiança mínima e probabilidade.
  2. BO Apriori é um algoritmo comumente utilizado para regras de associação.
  3. CPara a descoberta de regras de associação, deve ser usado um conjunto de dados não transacionais.
  4. DAs regras de associação só são usadas com conjunto de dados que não tem números.
  5. EO nível de confiança de uma regra de associação varia entre 1-2.
Revelar gabarito e comentário

GabaritoB — O Apriori é um algoritmo comumente utilizado para regras de associação.

Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.

Regras de associação e o algoritmo Apriori

Gabarito: letra B. O Apriori é, de fato, um dos algoritmos mais clássicos e amplamente utilizados para a descoberta de regras de associação em mineração de dados — ele opera encontrando conjuntos de itens frequentes para, a partir deles, gerar regras que atendam a um suporte e uma confiança mínimos. As demais alternativas distorcem conceitos fundamentais dessa técnica, como as medidas de avaliação, o tipo de dado necessário e o domínio de aplicação.

A regra de associação é uma técnica de aprendizado de máquina não supervisionado que busca identificar relações interessantes entre itens em um conjunto de dados transacionais. O exemplo mais conhecido é a análise da cesta de compras: se um cliente compra pão e manteiga, qual a probabilidade de também comprar leite? A regra é expressa na forma X → Y, onde X é o antecedente e Y é o consequente, indicando que a presença de X implica, com certa probabilidade, a presença de Y.

Para avaliar a qualidade e a relevância dessas regras, utilizam-se medidas como suporte, confiança e lift. O suporte indica a frequência com que um conjunto de itens aparece no total de transações; a confiança mede a probabilidade de Y ocorrer dado que X ocorreu; e o lift compara a confiança observada com a confiança esperada se os itens fossem independentes. Essas métricas são essenciais para filtrar regras que, embora matematicamente válidas, não são interessantes do ponto de vista prático.

O algoritmo Apriori é um dos métodos mais tradicionais para essa tarefa. Ele funciona em duas etapas principais: primeiro, identifica todos os conjuntos de itens que aparecem com frequência maior que um suporte mínimo definido; depois, a partir desses conjuntos frequentes, gera regras de associação que atendam a um limiar de confiança. A propriedade fundamental do Apriori é a de que todo subconjunto de um conjunto frequente também é frequente, o que permite podar o espaço de busca de forma eficiente.

É importante destacar que as regras de associação são aplicadas a dados transacionais, ou seja, dados que registram eventos ou compras, como uma lista de itens adquiridos em uma transação. Esses dados podem conter tanto atributos categóricos (como nomes de produtos) quanto numéricos (como quantidade ou preço), desde que sejam devidamente tratados. A técnica não se restringe a dados sem números, nem a conjuntos de dados não transacionais.

A pegadinha central desta questão está nas alternativas que confundem as medidas de avaliação das regras. A banca troca o conceito de confiança por probabilidade na alternativa A, e apresenta um intervalo de valores absurdo na alternativa E. O candidato que não domina os conceitos de suporte, confiança e lift pode facilmente cair nessas armadilhas.

Regras de associação
  • 1Objetivo
    • Encontrar padrões frequentes
    • Relações X → Y (antecedente → consequente)
  • 2Medidas de avaliação
    • Suporte (frequência do conjunto)
    • Confiança (P(Y|X), varia 0–1)
    • Lift (independência dos itens)
  • 3Algoritmo Apriori
    • Conjuntos de itens frequentes
    • Gera regras por suporte/confiança mínimos
  • 4Dados
    • Transacionais (cesta de compras)
    • Categóricos e numéricos (discretizáveis)
LEVEL · soulevel.com.br

Alternativa A — ❌ Incorreta

A alternativa afirma que as restrições aplicadas para evitar regras não interessantes são "confiança mínima e probabilidade". O erro está em substituir o conceito de suporte por probabilidade. As duas medidas clássicas de restrição são o suporte mínimo e a confiança mínima. O suporte mede a frequência do conjunto de itens, enquanto a confiança mede a força da implicação. A probabilidade, embora relacionada à confiança, não é uma medida de restrição utilizada nesse contexto.

Alternativa B — ✅ Correta ⟵ GABARITO

O Apriori é, de fato, um algoritmo clássico e amplamente utilizado para a descoberta de regras de associação. Ele foi proposto por Agrawal e Srikant em 1994 e é a base de muitos sistemas de mineração de dados. O algoritmo identifica conjuntos de itens frequentes e, a partir deles, gera regras que atendem aos limiares de suporte e confiança definidos pelo usuário.

Alternativa C — ❌ Incorreta

A alternativa afirma que deve ser usado um conjunto de dados não transacionais. Isso é exatamente o oposto do correto. As regras de associação são projetadas para trabalhar com dados transacionais, ou seja, dados que registram eventos ou compras, como uma lista de itens adquiridos em uma transação. Um exemplo típico é a análise da cesta de compras em supermercados.

Alternativa D — ❌ Incorreta

A alternativa afirma que as regras de associação só são usadas com conjuntos de dados que não têm números. Isso é falso. As regras de associação podem ser aplicadas a dados que contenham tanto atributos categóricos quanto numéricos. Atributos numéricos podem ser discretizados (transformados em intervalos) para que possam ser utilizados na geração de regras. A técnica não se restringe a dados sem números.

Alternativa E — ❌ Incorreta

A alternativa afirma que o nível de confiança de uma regra de associação varia entre 1 e 2. Isso é um absurdo. A confiança é uma medida de probabilidade condicional e, portanto, varia entre 0 e 1 (ou 0% e 100%). Um valor de confiança de 1 indica que a regra é sempre verdadeira, enquanto um valor de 0 indica que nunca é verdadeira. O intervalo 1-2 não faz sentido para essa métrica.

Gabarito: letra B

Link permanente: /questoes/qa630910