Questão de Banco de Dados — Data Mining — FCC 2025
Banco de Dados›Data Mining
Código
fc073212
Banca
FCC
Órgão
Prefeitura de São Paulo - SP
Ano
2025
Nível
Superior
Cargo
Analista de Planejamento e Desenvolvimento Organizacional Tecnologia da Informação e Comunicação
Suponha que a Prefeitura de São Paulo deseje implementar um sistema de análise de dados para prever demandas de transporte público e identificar padrões de deslocamento em diferentes horários e regiões. Os dados disponíveis incluem registros históricos de viagens, horários de pico, informações demográficas e localizações geográficas. Para prever o aumento na demanda em horários específicos e identificar agrupamentos de regiões com padrões semelhantes de uso, deve-se
Autilizar um modelo de Regressão Logística para prever as demandas de transporte público e Redes Neurais Convulsionais (CNN) para identificar padrões de deslocamento em horários de pico.
Baplicar Regressão Linear para prever a demanda futura com base em variáveis como horário e histórico de viagens e utilizar o algoritmo não supervisionado K-Means para identificar agrupamentos de regiões com padrões similares de uso.
Ctreinar um modelo não supervisionado de Support Vector Machine (SVM) para prever a demanda em horários específicos e Redes Neurais Recorrentes (RNN) para identificar padrões de deslocamento ao longo do tempo.
Dusar Árvores de Decisão para prever demandas futuras é treinar um modelo supervisionado de clusterização hierárquica para identificar padrões de deslocamento em horários específicos, através de dendogramas.
Eaplicar Regressão Logística para prever a demanda futura com base em histórico de viagens e utilizar o método ARIMA (Autoregressive Integrated Moving Average) para identificar agrupamentos de regiões para segmentação de dados geográficos.
Revelar gabarito e comentário▾
GabaritoB — aplicar Regressão Linear para prever a demanda futura com base em variáveis como horário e histórico de viagens e utilizar o algoritmo não supervisionado K-Means para identificar agrupamentos de regiões com padrões similares de uso.
Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.
Previsão de demanda e clusterização em transporte público
Gabarito: letra B. Para prever a demanda futura (variável contínua, como número de passageiros) utiliza-se Regressão Linear, um método de aprendizado supervisionado que modela a relação entre variáveis independentes (horário, histórico, demografia) e a variável alvo contínua. Para identificar agrupamentos de regiões com padrões de uso semelhantes, utiliza-se o algoritmo K-Means, um método não supervisionado que particiona os dados em clusters com base em similaridade. A alternativa B combina corretamente as duas tarefas com as técnicas adequadas.
As demais alternativas cometem erros conceituais ao aplicar técnicas inadequadas para cada tipo de problema:
Alternativa A — ❌ Incorreta
Utiliza Regressão Logística para prever demanda – a regressão logística é indicada para classificação binária (sim/não), não para previsão de valores contínuos como demanda. Além disso, Redes Neurais Convolucionais (CNN) são projetadas para dados com estrutura espacial (imagens) e não para identificar padrões de deslocamento em séries temporais.
Alternativa B — ✅ Correta ⟵ GABARITO
Aplica Regressão Linear para previsão contínua e K-Means para clusterização não supervisionada, exatamente o que o problema exige.
Alternativa C — ❌ Incorreta
Support Vector Machine (SVM) é um algoritmo supervisionado (não não supervisionado) e, embora possa ser usado para regressão (SVR), a alternativa o descreve como não supervisionado. Redes Neurais Recorrentes (RNN) são adequadas para padrões sequenciais, mas a alternativa falha ao classificar o SVM incorretamente.
Alternativa D — ❌ Incorreta
Árvores de Decisão podem ser usadas para previsão (regressão), mas a segunda parte menciona "treinar um modelo supervisionado de clusterização hierárquica". Clusterização é não supervisionada; o termo "supervisionado" contradiz o conceito. Dendogramas são usados em clusterização hierárquica, mas a abordagem é inconsistente.
Alternativa E — ❌ Incorreta
Regressão Logística novamente inapropriada para previsão contínua. ARIMA é um modelo de séries temporais para previsão, não para clusterização ou segmentação geográfica. Mistura funções das técnicas.
O quadro abaixo resume a adequação das técnicas para cada tarefa:
Técnica
Tipo de aprendizado
Tarefa adequada
Regressão Linear
Supervisionado
Previsão de valor contínuo
K-Means
Não supervisionado
Clusterização (agrupamento)
Regressão Logística
Supervisionado
Classificação binária
SVM
Supervisionado
Classificação ou regressão
CNN
Supervisionado (geralmente)
Processamento de imagens
RNN
Supervisionado
Dados sequenciais/temporais
Árvore de Decisão
Supervisionado
Classificação ou regressão
Clusterização Hierárquica
Não supervisionado
Agrupamento hierárquico
ARIMA
-
Previsão de séries temporais
NÃO CAIA NESSA!
A banca explora a confusão entre técnicas supervisionadas e não supervisionadas, e entre regressão (valor contínuo) e classificação (categórico). Memorize: para prever valores numéricos contínuos → regressão linear; para agrupar dados sem rótulos → K-Means ou clusterização hierárquica.