Pular para o conteúdo principal

Questão de Banco de Dados — Data Mining — FCC 2025

Banco de DadosData Mining
Código
fc073212
Banca
FCC
Órgão
Prefeitura de São Paulo - SP
Ano
2025
Nível
Superior
Cargo
Analista de Planejamento e Desenvolvimento Organizacional Tecnologia da Informação e Comunicação
Suponha que a Prefeitura de São Paulo deseje implementar um sistema de análise de dados para prever demandas de transporte público e identificar padrões de deslocamento em diferentes horários e regiões. Os dados disponíveis incluem registros históricos de viagens, horários de pico, informações demográficas e localizações geográficas. Para prever o aumento na demanda em horários específicos e identificar agrupamentos de regiões com padrões semelhantes de uso, deve-se
  1. Autilizar um modelo de Regressão Logística para prever as demandas de transporte público e Redes Neurais Convulsionais (CNN) para identificar padrões de deslocamento em horários de pico.
  2. Baplicar Regressão Linear para prever a demanda futura com base em variáveis como horário e histórico de viagens e utilizar o algoritmo não supervisionado K-Means para identificar agrupamentos de regiões com padrões similares de uso.
  3. Ctreinar um modelo não supervisionado de Support Vector Machine (SVM) para prever a demanda em horários específicos e Redes Neurais Recorrentes (RNN) para identificar padrões de deslocamento ao longo do tempo.
  4. Dusar Árvores de Decisão para prever demandas futuras é treinar um modelo supervisionado de clusterização hierárquica para identificar padrões de deslocamento em horários específicos, através de dendogramas.
  5. Eaplicar Regressão Logística para prever a demanda futura com base em histórico de viagens e utilizar o método ARIMA (Autoregressive Integrated Moving Average) para identificar agrupamentos de regiões para segmentação de dados geográficos.
Revelar gabarito e comentário

GabaritoB — aplicar Regressão Linear para prever a demanda futura com base em variáveis como horário e histórico de viagens e utilizar o algoritmo não supervisionado K-Means para identificar agrupamentos de regiões com padrões similares de uso.

Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.

Previsão de demanda e clusterização em transporte público

Gabarito: letra B. Para prever a demanda futura (variável contínua, como número de passageiros) utiliza-se Regressão Linear, um método de aprendizado supervisionado que modela a relação entre variáveis independentes (horário, histórico, demografia) e a variável alvo contínua. Para identificar agrupamentos de regiões com padrões de uso semelhantes, utiliza-se o algoritmo K-Means, um método não supervisionado que particiona os dados em clusters com base em similaridade. A alternativa B combina corretamente as duas tarefas com as técnicas adequadas.

As demais alternativas cometem erros conceituais ao aplicar técnicas inadequadas para cada tipo de problema:

Alternativa A — ❌ Incorreta

Utiliza Regressão Logística para prever demanda – a regressão logística é indicada para classificação binária (sim/não), não para previsão de valores contínuos como demanda. Além disso, Redes Neurais Convolucionais (CNN) são projetadas para dados com estrutura espacial (imagens) e não para identificar padrões de deslocamento em séries temporais.

Alternativa B — ✅ Correta ⟵ GABARITO

Aplica Regressão Linear para previsão contínua e K-Means para clusterização não supervisionada, exatamente o que o problema exige.

Alternativa C — ❌ Incorreta

Support Vector Machine (SVM) é um algoritmo supervisionado (não não supervisionado) e, embora possa ser usado para regressão (SVR), a alternativa o descreve como não supervisionado. Redes Neurais Recorrentes (RNN) são adequadas para padrões sequenciais, mas a alternativa falha ao classificar o SVM incorretamente.

Alternativa D — ❌ Incorreta

Árvores de Decisão podem ser usadas para previsão (regressão), mas a segunda parte menciona "treinar um modelo supervisionado de clusterização hierárquica". Clusterização é não supervisionada; o termo "supervisionado" contradiz o conceito. Dendogramas são usados em clusterização hierárquica, mas a abordagem é inconsistente.

Alternativa E — ❌ Incorreta

Regressão Logística novamente inapropriada para previsão contínua. ARIMA é um modelo de séries temporais para previsão, não para clusterização ou segmentação geográfica. Mistura funções das técnicas.

O quadro abaixo resume a adequação das técnicas para cada tarefa:

Técnica

Tipo de aprendizado

Tarefa adequada

Regressão Linear

Supervisionado

Previsão de valor contínuo

K-Means

Não supervisionado

Clusterização (agrupamento)

Regressão Logística

Supervisionado

Classificação binária

SVM

Supervisionado

Classificação ou regressão

CNN

Supervisionado (geralmente)

Processamento de imagens

RNN

Supervisionado

Dados sequenciais/temporais

Árvore de Decisão

Supervisionado

Classificação ou regressão

Clusterização Hierárquica

Não supervisionado

Agrupamento hierárquico

ARIMA

-

Previsão de séries temporais

NÃO CAIA NESSA!

A banca explora a confusão entre técnicas supervisionadas e não supervisionadas, e entre regressão (valor contínuo) e classificação (categórico). Memorize: para prever valores numéricos contínuos → regressão linear; para agrupar dados sem rótulos → K-Means ou clusterização hierárquica.

Gabarito: letra B.

Link permanente: /questoes/fc073212