Questão de Estatística — Análise Multivariada — FGV 2025
- Código
- fg120662
- Banca
- FGV
- Órgão
- SEFAZ-PR
- Ano
- 2025
- Nível
- Superior
- Cargo
- Auditor Fiscal (Manhã)
- ADijkstra.
- BPCA.
- CLSTM.
- DK-means.
- EARIMA.
GabaritoD — K-means.
Gabarito: letra D. O K-means é o algoritmo de aprendizado não supervisionado mais apropriado para agrupar beneficiários em perfis homogêneos, pois particiona os dados em grupos com base na similaridade das características, exatamente o que o enunciado descreve. As demais opções — Dijkstra (caminho mínimo em grafos), PCA (redução de dimensionalidade), LSTM (rede neural recorrente para séries temporais) e ARIMA (modelo de previsão de séries temporais) — não realizam agrupamento de observações.
A tarefa descrita é um problema clássico de análise de cluster (ou análise de agrupamento), uma técnica multivariada exploratória cujo objetivo é dividir um conjunto de observações em grupos (clusters) de modo que elementos do mesmo grupo sejam semelhantes entre si e diferentes dos elementos dos demais grupos. O K-means é o algoritmo mais popular dessa família: o usuário define o número de grupos , e o algoritmo itera entre (1) atribuir cada observação ao centróide mais próximo e (2) recalcular os centróides como a média dos pontos do grupo, até convergir. É exatamente o que o servidor precisa: agrupar beneficiários por perfil (valores de benefício, idade, tipo de benefício etc.) para permitir políticas específicas por grupo.
A banca explora a confusão entre técnicas de agrupamento e outras famílias de algoritmos — redução de dimensionalidade, previsão de séries temporais, redes neurais e otimização em grafos. O candidato que não domina o vocabulário de aprendizado de máquina pode marcar PCA (por ser "multivariado") ou ARIMA (por ser "estatístico"), mas nenhum deles agrupa observações.
O algoritmo de Dijkstra resolve o problema do caminho mínimo em um grafo ponderado — encontra a rota de menor custo entre dois nós. Não tem relação com agrupamento de dados; é um algoritmo de otimização em grafos, usado em redes de computadores, mapas e logística.
PCA (Análise de Componentes Principais) é uma técnica de redução de dimensionalidade: transforma um conjunto de variáveis correlacionadas em um número menor de componentes não correlacionados que retêm a maior parte da variância. Não agrupa observações — apenas reexpressa as variáveis. É comum confundir PCA com cluster porque ambas são técnicas multivariadas exploratórias, mas a finalidade é distinta.
LSTM (Long Short-Term Memory) é um tipo de rede neural recorrente projetada para modelar sequências e dependências de longo prazo, tipicamente usada em previsão de séries temporais, processamento de linguagem natural e reconhecimento de fala. Não é um algoritmo de agrupamento.
O K-means é o algoritmo de clusterização por particionamento: dado um número de grupos, ele atribui cada observação ao centróide mais próximo e recalcula os centróides iterativamente. É o mais adequado para agrupar beneficiários por perfis, pois trabalha com dados numéricos e produz grupos homogêneos — exatamente a necessidade descrita no enunciado.
ARIMA (AutoRegressive Integrated Moving Average) é um modelo estatístico para previsão de séries temporais — analisa a autocorrelação e a tendência de dados ordenados no tempo para prever valores futuros. Não agrupa observações; é usado, por exemplo, para prever o número de benefícios concedidos ao longo dos meses, não para segmentar beneficiários.
A banca mistura algoritmos de famílias diferentes para testar se você sabe a finalidade de cada um. O erro mais comum é marcar PCA (letra B) por ser "multivariado" ou ARIMA (letra E) por ser "estatístico". Lembre-se: agrupar perfis = clusterização = K-means; PCA reduz variáveis, ARIMA prevê séries, LSTM processa sequências e Dijkstra acha caminhos. Com esse mapa mental, você elimina as quatro erradas de imediato 💪
Na prova, identifique a palavra-chave do enunciado: "agrupar", "segmentar", "perfis", "grupos homogêneos" → clusterização (K-means, hierárquico, DBSCAN). "Reduzir dimensionalidade" → PCA. "Prever valores futuros" → ARIMA. "Rede neural para sequências" → LSTM. "Caminho mínimo" → Dijkstra. Guarde essa correspondência e a questão vira trivial.
Gabarito: letra D.
Link permanente: /questoes/fg120662