Pular para o conteúdo principal

Questão de Estatística — Conhecimentos de estatística — FCC 2026

EstatísticaConhecimentos de estatística
Código
fc077679
Banca
FCC
Órgão
SEFAZ-SP
Ano
2026
Nível
Superior
Cargo
Auditor Fiscal da Receita Estadual - AFRE - Tecnologia da Informação e Comunicação - Conhecimentos Gerais (P1)
Na modelagem estatística utilizando aprendizado de máquina, a principal razão para separar os dados em conjuntos de treinamento, validação e teste é
  1. Aavaliar desempenho generalizável e evitar overfitting.
  2. Breduzir a dimensionalidade dos preditores.
  3. Caumentar a variância do modelo.
  4. Dgarantir normalidade dos resíduos.
  5. Ereduzir o viés do estimador dos coeficientes.
Revelar gabarito e comentário

GabaritoA — avaliar desempenho generalizável e evitar overfitting.

Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.

Aprendizado de Máquina: Divisão Treino, Validação e Teste

Gabarito: letra A. A separação dos dados em conjuntos de treinamento, validação e teste tem como principal objetivo avaliar o desempenho generalizável do modelo e evitar o overfitting — ou seja, garantir que o modelo aprenda padrões reais dos dados e não apenas memorize o conjunto de treino, permitindo estimar como ele se comportará com dados novos.

A divisão dos dados é uma prática fundamental em aprendizado de máquina. O conjunto de treinamento é usado para ajustar os parâmetros do modelo; o conjunto de validação serve para ajustar hiperparâmetros e tomar decisões de modelagem (como seleção de features ou critérios de parada), funcionando como um "ensaio" para o teste; e o conjunto de teste é utilizado apenas uma vez, ao final, para avaliar o desempenho final do modelo em dados que ele nunca viu. Essa separação é o que permite estimar o erro de generalização — o quão bem o modelo se comporta em dados não vistos — e é a principal defesa contra o overfitting, que ocorre quando o modelo se ajusta excessivamente aos dados de treinamento, capturando ruído em vez de padrões, e perde capacidade de generalização.

A banca explora aqui um conceito central de machine learning: a diferença entre erro de treinamento e erro de generalização. Um modelo pode ter desempenho excelente nos dados de treino (até 100% de acurácia) e péssimo em dados novos — isso é overfitting. A divisão em conjuntos permite detectar esse problema: se o modelo vai muito bem no treino, mas mal na validação/teste, há overfitting. As demais alternativas confundem a finalidade da divisão com outros objetivos estatísticos (redução de dimensionalidade, normalidade dos resíduos, viés do estimador) que não têm relação direta com essa prática.

TreinamentoValidaçãoTesteajustehiperparâmetrosavaliação finalLEVELsoulevel.com.br
Divisão de Dados em ML — só Treinamento: ajuste; só Validação: hiperparâmetros; só Teste: avaliação final; Treinamento∩Validação: —; Treinamento∩Teste: —; Validação∩Teste: —; Treinamento∩Validação∩Teste: —

Alternativa A — ✅ Correta ⟵ GABARITO

Esta é a definição clássica e correta. A separação em treino, validação e teste existe para avaliar o desempenho generalizável — ou seja, medir como o modelo se comporta em dados não vistos — e evitar overfitting, pois permite identificar quando o modelo está memorizando o treino em vez de aprender padrões. O conjunto de teste, em particular, é a "prova final" que estima o erro de generalização.

Alternativa B — ❌ Incorreta

Reduzir a dimensionalidade dos preditores é um objetivo de técnicas como Análise de Componentes Principais (PCA) ou seleção de features, não da divisão dos dados. A divisão não altera o número de variáveis; ela apenas particiona as observações em subconjuntos.

Alternativa C — ❌ Incorreta

Aumentar a variância do modelo é justamente o oposto do que se deseja. A divisão em treino/validação/teste busca controlar a variância e evitar overfitting, que está associado a alta variância. Aumentar a variância seria prejudicial à generalização.

Alternativa D — ❌ Incorreta

Garantir normalidade dos resíduos é um pressuposto de modelos estatísticos clássicos (como regressão linear) e é verificado por testes de diagnóstico, não pela divisão dos dados. A divisão não tem relação com a distribuição dos erros.

Alternativa E — ❌ Incorreta

Reduzir o viés do estimador dos coeficientes é um objetivo da inferência estatística (por exemplo, usar estimadores não viciados como o de máxima verossimilhança). A divisão dos dados não atua diretamente sobre o viés; ela trata da avaliação da capacidade preditiva do modelo.

NÃO CAIA NESSA!

A banca mistura conceitos de áreas diferentes da estatística. O candidato que confunde "avaliar generalização" com "reduzir viés" ou "garantir normalidade" cai nas alternativas D e E. Lembre-se: a divisão treino/validação/teste é uma técnica de avaliação de modelos preditivos, não de inferência clássica. Foque no objetivo central: medir o desempenho em dados novos e evitar overfitting.

PEGA ESSA DICA!

Para questões sobre machine learning, tenha em mente o fluxo: treino ajusta parâmetros → validação ajusta hiperparâmetros → teste avalia o modelo final. Se a alternativa falar em "generalização" ou "overfitting", é quase sempre a correta. Se falar em "normalidade", "viés" ou "dimensionalidade", desconfie — são temas de outros tópicos.

Gabarito: letra A

Link permanente: /questoes/fc077679