Pular para o conteúdo principal

Questão de Geografia — Sensoriamento Remoto e Geoprocessamento — FGV 2024

GeografiaSensoriamento Remoto e Geoprocessamento
Código
fg085006
Banca
FGV
Órgão
EPE
Ano
2024
Nível
Superior
Cargo
Analista de Pesquisa Energética (Meio Ambiente / Geoprocessamento Meio Físico)

Uma organização ambiental está buscando prever o fluxo de água em um rio baseado em dados históricos de precipitação e outros fatores climáticos. A análise envolve a captura de relações complexas entre múltiplas variáveis para melhorar a precisão das previsões.


Para isso, a organização deve adotar, como modelo de machine learning,

  1. Aa Regressão Linear Simples, porque é eficaz na previsão de valores futuros ao encontrar grupos naturais dentro dos dados.
  2. Bas Redes Neurais Artificiais, porque são utilizadas para modelar a relação linear entre uma variável dependente e uma variável independente.
  3. Co Random Forest, porque combina múltiplas árvores de decisão para melhorar a precisão e capturar relações complexas.
  4. Do K-means Clustering, porque reduz a dimensionalidade dos dados mantendo a variabilidade.
  5. Ea Análise de Principais Componentes, porque é uma técnica de agrupamento que identifica grupos naturais dentro dos dados.
Revelar gabarito e comentário

GabaritoC — o Random Forest, porque combina múltiplas árvores de decisão para melhorar a precisão e capturar relações complexas.

Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.

Machine Learning aplicado à previsão hidrológica

Gabarito: letra C. O Random Forest é o modelo adequado porque combina múltiplas árvores de decisão (ensemble) para melhorar a precisão e capturar relações complexas e não lineares entre múltiplas variáveis — exatamente o que o enunciado descreve: prever o fluxo de um rio a partir de dados históricos de precipitação e outros fatores climáticos. As demais alternativas ou descrevem incorretamente o método (como a Regressão Linear Simples, que não encontra grupos naturais) ou confundem a finalidade de técnicas como K-means e PCA.

O problema central é de aprendizado supervisionado de regressão: temos variáveis de entrada (precipitação, temperatura, etc.) e uma variável-alvo contínua (fluxo do rio). O modelo deve aprender a relação entre elas para fazer previsões. O Random Forest é um método de ensemble que constrói múltiplas árvores de decisão em subconjuntos aleatórios dos dados e das features, e combina suas previsões (média, no caso de regressão). Essa combinação reduz a variância e o overfitting, permitindo capturar relações complexas e não lineares — ideal para fenômenos ambientais como o fluxo de um rio, que depende de interações entre várias variáveis climáticas.

A banca explora a confusão entre diferentes famílias de algoritmos: regressão linear (relação linear simples), redes neurais (modelos não lineares, mas a alternativa erra ao dizer que modelam relação linear), K-means (clusterização não supervisionada), PCA (redução de dimensionalidade) e Random Forest (ensemble de árvores). A pegadinha está em associar cada técnica à sua verdadeira finalidade e capacidade.

Machine Learning
  • 1Supervisionado (prever)
    • Regressão Linear
      • relação linear simples
      • 1 variável dependente × 1 independente
    • Random Forest
      • ensemble de árvores
      • captura relações complexas
      • reduz overfitting
    • Redes Neurais
      • relações não lineares
  • 2Não supervisionado (descobrir)
    • K-means
      • agrupamento (clusters)
    • PCA
      • redução de dimensionalidade
LEVEL · soulevel.com.br

Alternativa A — ❌ Incorreta

A Regressão Linear Simples modela a relação entre uma variável dependente e uma variável independente, assumindo linearidade. Ela não é eficaz para "encontrar grupos naturais dentro dos dados" — isso é função de técnicas de clusterização (como K-means). Além disso, o problema envolve múltiplas variáveis, o que exigiria, no mínimo, uma regressão múltipla. O erro está em atribuir à regressão linear uma capacidade que ela não possui (agrupamento) e em ignorar a necessidade de capturar relações complexas.

Alternativa B — ❌ Incorreta

As Redes Neurais Artificiais são, de fato, capazes de modelar relações não lineares e complexas entre múltiplas variáveis — seriam uma opção válida para o problema. No entanto, a alternativa afirma que elas modelam a relação linear entre uma variável dependente e uma independente, o que é exatamente o oposto de sua principal vantagem. Essa descrição corresponde à regressão linear simples, não às redes neurais. Portanto, a justificativa apresentada é incorreta.

Alternativa C — ✅ Correta ⟵ GABARITO

O Random Forest é um algoritmo de ensemble que combina múltiplas árvores de decisão, cada uma treinada em uma amostra aleatória dos dados e considerando um subconjunto aleatório das variáveis. A previsão final é a média (regressão) ou a moda (classificação) das árvores. Essa combinação melhora a precisão, reduz o overfitting e permite capturar relações complexas e não lineares entre múltiplas variáveis — exatamente o que o enunciado pede: prever o fluxo de um rio com base em precipitação e outros fatores climáticos. É uma técnica supervisionada de regressão, adequada para esse tipo de problema.

Alternativa D — ❌ Incorreta

O K-means Clustering é um algoritmo de aprendizado não supervisionado usado para agrupar dados em clusters com base em similaridade. Ele não é usado para previsão de valores contínuos (como fluxo de rio) e não reduz a dimensionalidade — essa é a função da Análise de Componentes Principais (PCA). A alternativa confunde a finalidade do K-means (agrupamento) com a de redução de dimensionalidade.

Alternativa E — ❌ Incorreta

A Análise de Componentes Principais (PCA) é uma técnica de redução de dimensionalidade que transforma um conjunto de variáveis correlacionadas em um novo conjunto de variáveis não correlacionadas (componentes principais), mantendo a maior parte da variabilidade dos dados. Ela não é uma técnica de agrupamento e não identifica grupos naturais — isso é função de algoritmos de clusterização como K-means. A alternativa inverte as funções de PCA e K-means.

NÃO CAIA NESSA!

A banca mistura as finalidades de cada algoritmo: regressão linear (relação linear), K-means (agrupamento), PCA (redução de dimensionalidade) e Random Forest (ensemble). O candidato que decora apenas os nomes, sem entender o que cada um faz, cai na armadilha de aceitar a descrição errada da alternativa B (redes neurais como lineares) ou da D (K-means como redutor de dimensionalidade). Lembre-se: Random Forest = muitas árvores = precisão e relações complexas.

PEGA ESSA DICA!

Para questões de machine learning, monte um mapa mental rápido: supervisionado (regressão/classificação) vs. não supervisionado (clusterização/redução). Regressão Linear e Random Forest são supervisionados; K-means e PCA são não supervisionados. E lembre-se: PCA reduz dimensionalidade, K-means agrupa, Random Forest combina árvores. Com esse esquema, você elimina as alternativas erradas rapidamente.

Gabarito: letra C

Link permanente: /questoes/fg085006