Questão de Noções de Informática — Inteligência Artificial e Automação — INSTITUTO AOCP 2024
Noções de Informática›Inteligência Artificial e Automação
Código
qg261792
Banca
INSTITUTO AOCP
Órgão
SANEPAR
Ano
2024
Nível
Superior
Cargo
Profissional - Analista de Informática
O analista de informática da Sanepar foi designado para analisar os padrões de consumo de água em diferentes regiões. Para isso, ele pretende agrupar os dados de consumo utilizando técnicas de aprendizado de máquina que se baseiam em similaridades, sem a necessidade de rótulos pré-definidos, com o objetivo de identificar perfis distintos de usuários e otimizar a distribuição de água. Sabendo que nem todos os algoritmos de aprendizado de máquina são adequados para essa tarefa, o analista deve escolher algoritmos que sejam exclusivamente utilizados para clusterização.Nesse sentido, assinale a alternativa que apresenta apenas algoritmos de clusterização que podem atender à necessidade desse analista.
AK-Means e DBSCAN (Density-Based Spatial Clustering of Applications with Noise).
BDBSCAN (Density-Based Spatial Clustering of Applications with Noise) e SVM (Support Vector Machines).
CKNN (K-Nearest Neighbors) e Apriori.
DFP-Growth (Frequent Pattern Growth) e DQL (Deep Q-Networks).
EHierarchical Clustering e FP-Growth.
Revelar gabarito e comentário▾
GabaritoA — K-Means e DBSCAN (Density-Based Spatial Clustering of Applications with Noise).
Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.
Clusterização: algoritmos de agrupamento não supervisionado
Gabarito: letra A. A questão pede algoritmos exclusivamente de clusterização (agrupamento não supervisionado, sem rótulos). K-Means e DBSCAN são, ambos, algoritmos clássicos de agrupamento por similaridade — o primeiro baseado em centróides e o segundo em densidade —, atendendo exatamente à necessidade do analista de identificar perfis de consumo sem dados rotulados.
A clusterização (ou agrupamento) é uma técnica de aprendizado não supervisionado que organiza dados em grupos (clusters) de modo que elementos do mesmo grupo sejam similares entre si e dissimilares aos de outros grupos. Diferentemente da classificação (supervisionada), não há rótulos pré-definidos: o algoritmo descobre a estrutura dos dados por conta própria, com base em medidas de similaridade/distância. É exatamente o cenário do enunciado: agrupar padrões de consumo de água para identificar perfis distintos de usuários.
Os principais algoritmos de clusterização dividem-se em:
Métodos de partição: dividem os dados em K grupos disjuntos. O K-Means é o representante mais famoso — define K centróides iniciais (aleatoriamente), atribui cada ponto ao centróide mais próximo e itera recalculando os centróides até a convergência. Exige que o número de clusters (K) seja informado previamente.
Métodos hierárquicos: constroem uma árvore de agrupamentos (dendrograma), sem exigir K pré-definido. Podem ser aglomerativos (bottom-up: cada ponto começa como um cluster e os mais próximos vão sendo mesclados — AGNES) ou divisivos (top-down: todos os pontos começam num único cluster e vão sendo divididos — DIANA).
Métodos baseados em densidade: identificam clusters como regiões densas de pontos separadas por regiões de baixa densidade. O DBSCAN é o exemplo clássico — não exige K pré-definido, detecta outliers (ruído) e encontra clusters de formatos arbitrários.
A pegadinha central da questão é misturar algoritmos de outras categorias (classificação supervisionada, regras de associação, aprendizado por reforço) com os de clusterização. O candidato que não domina a classificação dos algoritmos acaba marcando uma alternativa que contém, por exemplo, SVM (classificador supervisionado) ou FP-Growth (regra de associação), achando que são técnicas de agrupamento.
NÃO CAIA NESSA!
A banca mistura algoritmos de aprendizado supervisionado (SVM, KNN), regras de associação (Apriori, FP-Growth) e aprendizado por reforço (DQN) com os de clusterização. O candidato que decora nomes sem saber a categoria de cada um cai nas alternativas B, C, D ou E. A dica é: clusterização = agrupamento por similaridade sem rótulos; se o algoritmo precisa de rótulos para treinar (SVM, KNN) ou descobre regras de associação entre itens (Apriori, FP-Growth), ele não é de clusterização.
Algoritmos de ML: Clusterização (não supervisionado) (K-Means (partição), DBSCAN (densidade), Hierarchical (aglomerativo/divisivo)); Classificação (supervisionado) (SVM, KNN); Regras de associação (Apriori, FP-Growth); Aprendizado por reforço (DQN)
Alternativa A — ✅ Correta ⟵ GABARITO
K-Means é o algoritmo de clusterização por partição mais conhecido: divide os dados em K grupos com base na distância aos centróides. DBSCAN é o algoritmo de clusterização baseado em densidade: agrupa pontos próximos e marca pontos isolados como ruído. Ambos são exclusivamente de agrupamento não supervisionado e atendem à necessidade de identificar perfis de consumo sem rótulos.
Alternativa B — ❌ Incorreta
DBSCAN é de clusterização, mas SVM (Support Vector Machines) é um algoritmo de classificação supervisionada — precisa de dados rotulados para treinar e encontrar um hiperplano que separa classes. Não é usado para agrupar dados sem rótulos.
Alternativa C — ❌ Incorreta
KNN (K-Nearest Neighbors) é um algoritmo de classificação (e regressão) supervisionada — classifica novos pontos com base nos rótulos dos vizinhos mais próximos. Apriori é um algoritmo de regras de associação (mineração de dados não supervisionada, mas para descobrir relações entre itens, como em cestas de compras), não de clusterização.
Alternativa D — ❌ Incorreta
FP-Growth (Frequent Pattern Growth) é um algoritmo de regras de associação (mineração de padrões frequentes), não de clusterização. DQN (Deep Q-Networks) é um algoritmo de aprendizado por reforço (deep reinforcement learning), usado para treinar agentes a tomar decisões sequenciais, não para agrupar dados.
Alternativa E — ❌ Incorreta
Hierarchical Clustering é, sim, um método de clusterização (hierárquico). Porém, FP-Growth é um algoritmo de regras de associação, não de agrupamento. Como a alternativa exige que apenas algoritmos de clusterização estejam presentes, ela é incorreta.
Gabarito: letra A — K-Means e DBSCAN são os únicos algoritmos exclusivamente de clusterização entre as opções.