Pular para o conteúdo principal

Questão de Estatística — Modelos lineares — CESPE / CEBRASPE 2025

EstatísticaModelos lineares
Código
ce214858
Banca
CESPE / CEBRASPE
Órgão
SEFAZ-SE
Ano
2025
Nível
Superior
Cargo
Auditor Fiscal Tributário - Tecnologia da Informação
Assinale a opção que apresenta corretamente a tarefa de mineração de dados adequada a ser utilizada caso um banco deseje prever, a partir de variáveis como renda, idade e histórico de pagamentos, o valor do limite de crédito que deve conceder a um cliente.
  1. Aclusterização
  2. Bregras de associação
  3. Cdetecção de anomalias
  4. Dregressão
  5. Eclassificação
Revelar gabarito e comentário

GabaritoD — regressão

Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.

Mineração de dados: regressão para previsão de valor contínuo

Gabarito: letra D. O banco deseja prever o valor do limite de crédito, uma variável contínua (quantitativa), a partir de variáveis como renda, idade e histórico de pagamentos. Essa é a tarefa típica de regressão, que modela a relação entre uma variável dependente contínua e uma ou mais variáveis independentes, produzindo valores contínuos como saída. As demais opções — clusterização, regras de associação, detecção de anomalias e classificação — não se adequam ao objetivo de prever um valor numérico.

A questão cobra a distinção fundamental entre as tarefas de mineração de dados, especialmente entre regressão e classificação. Ambas são formas de aprendizado supervisionado, mas diferem na natureza da variável de saída: a regressão prevê valores contínuos (ex.: preço, salário, limite de crédito), enquanto a classificação prevê categorias discretas (ex.: bom/mau pagador, aprovado/reprovado). O contexto de apoio reforça essa distinção ao afirmar que "a regressão é um tipo de aprendizado supervisionado... Seu objetivo é modelar e prever valores contínuos da variável dependente com base nas variáveis explicativas" e que "a regressão logística... é uma técnica de classificação" quando a variável dependente é categórica.

A pegadinha da banca está em confundir o candidato com a classificação (alternativa E), que também é usada para prever algo a partir de variáveis. No entanto, o enunciado pede o valor do limite de crédito — um número contínuo — e não uma categoria como "alto", "médio" ou "baixo". Se o banco quisesse apenas classificar o cliente em faixas de risco, a classificação seria adequada; mas como o objetivo é estimar o valor exato do limite, a regressão é a técnica correta.

Tarefas de mineração de dados
  • 1Supervisionado
    • Regressão
      • prevê valor contínuo
      • ex.: limite de crédito
    • Classificação
      • prevê categoria discreta
      • ex.: bom/mau pagador
  • 2Não supervisionado
    • Clusterização
      • agrupa sem variável alvo
    • Regras de associação
      • co-ocorrência entre itens
    • Detecção de anomalias
      • identifica desvios
LEVEL · soulevel.com.br

Critério

Regressão (D)

Classificação (E)

Natureza da variável prevista

Contínua (ex.: valor exato do limite de crédito em R$)

Categórica/discreta (ex.: “alto”, “médio”, “baixo”; “bom/mau pagador”)

Tipo de aprendizado

Supervisionado

Supervisionado

Exemplo no contexto

Prever o valor do limite de crédito a partir de renda, idade e histórico

Classificar o cliente em faixas de risco ou categorias de crédito

Adequação ao enunciado

✅ Correta — o banco quer prever um valor numérico

❌ Incorreta — o enunciado pede valor contínuo, não categoria

Alternativa A — ❌ Incorreta

A clusterização (ou análise de cluster) é uma técnica de aprendizado não supervisionado que agrupa observações semelhantes em grupos (clusters), sem uma variável alvo pré-definida. No caso, o banco tem uma variável alvo clara (o limite de crédito) e deseja prever seu valor, o que caracteriza aprendizado supervisionado. A clusterização não prevê valores; ela apenas descobre estruturas de agrupamento nos dados.

Alternativa B — ❌ Incorreta

As regras de associação são usadas para descobrir relações de co-ocorrência entre itens em transações (ex.: "clientes que compram pão também compram manteiga"). Não se aplicam à previsão de um valor numérico como o limite de crédito. Essa técnica é típica de análise de cesta de compras, não de modelagem preditiva de variável contínua.

Alternativa C — ❌ Incorreta

A detecção de anomalias (outliers) identifica observações que se desviam significativamente do padrão esperado. Embora possa ser útil para identificar clientes de risco, não é a tarefa de prever o valor do limite de crédito. O objetivo do banco é estimar um valor para cada cliente, não identificar quais são anômalos.

Alternativa D — ✅ Correta ⟵ GABARITO

A regressão é a técnica de aprendizado supervisionado que modela a relação entre uma variável dependente contínua e uma ou mais variáveis independentes, produzindo valores contínuos como saída. O limite de crédito é uma variável contínua (ex.: R$ 5.000,00), e as variáveis renda, idade e histórico de pagamentos são as preditoras. O contexto de apoio define: "Regressão Linear: técnica usada para modelar a relação entre uma variável dependente contínua e uma ou mais variáveis independentes, resultando em valores contínuos". Portanto, é exatamente a tarefa adequada.

Alternativa E — ❌ Incorreta

A classificação é uma técnica de aprendizado supervisionado que prevê uma variável dependente categórica (discreta), como "bom pagador" ou "mau pagador". O enunciado pede o valor do limite de crédito, que é contínuo, e não uma categoria. Se o banco quisesse apenas classificar o cliente em faixas de crédito (ex.: baixo, médio, alto), a classificação seria adequada; mas como o objetivo é prever o valor exato, a regressão é a correta.

NÃO CAIA NESSA!

A banca tenta fazer o candidato confundir regressão com classificação, pois ambas são aprendizado supervisionado. A chave é observar a natureza da variável a ser prevista: se é contínua (valor numérico), usa-se regressão; se é categórica (classe), usa-se classificação. Aqui, "valor do limite de crédito" é contínuo → regressão. Fique atento a essa distinção, que é clássica em provas de mineração de dados!

PEGA ESSA DICA!

Para resolver questões desse tipo, pergunte-se: "O que quero prever é um número ou uma categoria?" Se for número (preço, salário, limite), é regressão. Se for categoria (sim/não, alto/médio/baixo), é classificação. Essa pergunta simples resolve a maioria das questões sobre tarefas de mineração de dados.

Gabarito: letra D

Link permanente: /questoes/ce214858