Pular para o conteúdo principal

Questão de Estatística — Conhecimentos de estatística — FCC 2026

EstatísticaConhecimentos de estatística
Código
fc077426
Banca
FCC
Órgão
SEFAZ-SP
Ano
2026
Nível
Superior
Cargo
Auditor Fiscal da Receita Estadual - AFRE - Gestão Tributária - Conhecimentos Gerais (P1)
Na modelagem estatística utilizando aprendizado de máquina, a principal razão para separar os dados em conjuntos de treinamento, validação e teste é
  1. Agarantir normalidade dos resíduos.
  2. Breduzir o viés do estimador dos coeficientes.
  3. Cavaliar desempenho generalizável e evitar overfitting.
  4. Dreduzira dimensionalidade dos preditores.
  5. Eaumentar a variância do modelo.
Revelar gabarito e comentário

GabaritoC — avaliar desempenho generalizável e evitar overfitting.

Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.

Aprendizado de máquina: separação treino, validação e teste

Gabarito: letra C. A principal razão para separar os dados em conjuntos de treinamento, validação e teste é avaliar o desempenho generalizável do modelo e evitar overfitting — ou seja, garantir que o modelo aprenda padrões reais dos dados e não apenas memorize o conjunto de treino, permitindo estimar como ele se comportará com dados novos.

A separação dos dados é uma prática fundamental em aprendizado de máquina. O conjunto de treinamento é usado para ajustar os parâmetros do modelo; o de validação serve para ajustar hiperparâmetros e tomar decisões de modelagem (como escolher entre algoritmos); e o de teste é usado uma única vez, ao final, para estimar o desempenho do modelo em dados nunca vistos. Essa divisão existe justamente para medir a capacidade de generalização — o objetivo final de qualquer modelo preditivo.

O overfitting ocorre quando o modelo se ajusta excessivamente aos dados de treinamento, capturando ruído e particularidades que não se repetem em novos dados. Isso faz com que o desempenho no treino seja excelente, mas o desempenho em dados novos seja ruim. Ao avaliar o modelo em um conjunto separado (validação/teste), conseguimos detectar esse problema e evitá-lo, pois o modelo não "viu" esses dados durante o treinamento.

A banca explora aqui a confusão entre conceitos de estatística clássica (normalidade, viés, dimensionalidade, variância) e o objetivo específico da divisão de dados em aprendizado de máquina. Cada alternativa incorreta traz um termo estatístico que parece plausível, mas não é a razão da separação.

TreinamentoValidaçãoTesteajustehiperparâmetrosavaliação finalLEVELsoulevel.com.br
Divisão de dados em aprendizado de máquina — só Treinamento: ajuste; só Validação: hiperparâmetros; só Teste: avaliação final; Treinamento∩Validação: —; Treinamento∩Teste: —; Validação∩Teste: —; Treinamento∩Validação∩Teste: —

Alternativa A — ❌ Incorreta

Garantir normalidade dos resíduos é um pressuposto de modelos de regressão linear clássica (para inferência e testes de hipóteses), mas não tem relação com a divisão treino/validação/teste. A normalidade é verificada nos resíduos do modelo ajustado, não é um objetivo da separação dos dados.

Alternativa B — ❌ Incorreta

Reduzir o viés do estimador dos coeficientes é uma propriedade desejável de estimadores (não viés), mas a separação dos dados não tem como objetivo reduzir o viés. O viés é uma propriedade do estimador em relação ao parâmetro populacional, e a divisão dos dados não altera essa propriedade.

Alternativa C — ✅ Correta ⟵ GABARITO

A separação em treino, validação e teste tem como objetivo avaliar o desempenho generalizável do modelo e evitar overfitting. O conjunto de teste (e também o de validação) permite estimar o erro de generalização, ou seja, o desempenho do modelo em dados não utilizados no treinamento. Isso é essencial para detectar e evitar o overfitting, que é o ajuste excessivo aos dados de treino.

Alternativa D — ❌ Incorreta

Reduzir a dimensionalidade dos preditores é uma técnica de pré-processamento (como PCA ou seleção de variáveis), mas não é a razão da separação dos dados. A redução de dimensionalidade pode ser feita antes da modelagem, mas não está relacionada à divisão em treino/validação/teste.

Alternativa E — ❌ Incorreta

Aumentar a variância do modelo é o oposto do que se deseja. A separação dos dados busca controlar a variância (evitar overfitting), não aumentá-la. Aumentar a variância levaria a um modelo instável e com pior generalização.

NÃO CAIA NESSA!

A banca mistura conceitos de estatística clássica (normalidade, viés, variância) com o contexto de aprendizado de máquina. O candidato pode ser tentado a escolher "reduzir o viés" ou "garantir normalidade", mas a separação dos dados tem um propósito específico: avaliar a generalização e evitar overfitting. Lembre-se: o conjunto de teste é a "prova final" do modelo — ele nunca participa do treinamento.

PEGA ESSA DICA!

Para questões sobre divisão de dados, foque no objetivo central: generalização. Pergunte-se: "essa alternativa fala sobre o modelo aprender com dados novos?" Se sim, é a correta. As outras alternativas tratam de outros aspectos da modelagem (pressupostos, estimação, pré-processamento), que não são o motivo da separação.

Gabarito: letra C — avaliar desempenho generalizável e evitar overfitting.

Link permanente: /questoes/fc077426