Pular para o conteúdo principal

Questão de Banco de Dados — Data Mining — FGV 2025

Banco de DadosData Mining
Código
fg125588
Banca
FGV
Órgão
TCE-PE
Ano
2025
Nível
Superior
A Mineração de Dados é a etapa do processo de KDD (Knowledge Discovery in Databases) responsável por extrair modelos de conhecimento a partir dos dados disponíveis. Após a construção desses modelos, é fundamental avaliar sua qualidade, o que exige compará-los com dados específicos para mensurar métricas que reflitam seu desempenho. Para garantir uma avaliação imparcial, os dados utilizados na criação do modelo não devem ser os mesmos empregados em sua validação. Assim, o processo de KDD deve utilizar, no mínimo, dois conjuntos distintos de dados: um conjunto de treinamento, para gerar o modelo, e um conjunto de testes, para avaliá-lo.Selecione a opção que identifica o método de particionamento de dados em que o “conjunto de treinamento” é gerado por N sorteios aleatórios com reposição a partir do conjunto de dados original (que contém N registros). Já o “conjunto de testes” é composto pelos registros não selecionados para o “conjunto de treinamento”.
  1. AHoldout.
  2. BBootstrap.
  3. CLeave-One-Out.
  4. DK-Fold CrossValidation.
  5. EStratifield K-Fold CrossValidation.
Revelar gabarito e comentário

GabaritoB — Bootstrap.

Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.

Métodos de particionamento de dados em aprendizado de máquina

Gabarito: letra B. O método descrito é o Bootstrap, que consiste em gerar o conjunto de treinamento por amostragem com reposição de N elementos (mesmo tamanho do original) e usar os registros não sorteados como conjunto de teste (conhecido como out-of-bag). As demais alternativas correspondem a técnicas que não utilizam amostragem com reposição.

A questão cobra a distinção entre os principais métodos de particionamento de dados para validação de modelos. Conhecer a definição de cada um é essencial:

  • Holdout: divisão única e aleatória em treino e teste, sem reposição.

  • Bootstrap: amostragem com reposição do mesmo tamanho do dataset; os não amostrados formam o teste.

  • Leave-One-Out (LOO): caso especial de validação cruzada onde k = N (cada registro é teste uma vez).

  • K-Fold CrossValidation: divisão em k partes iguais, treina-se em k-1 partes e testa-se na restante, sem reposição.

  • Stratified K-Fold: variação do K-Fold que mantém a proporção das classes em cada fold.

Método

Descrição

Amostragem com reposição?

Conjunto de treinamento

Conjunto de teste

Holdout

Divisão única e aleatória em treino e teste

Não

Parte fixa dos dados (ex.: 70%)

Parte fixa restante (ex.: 30%)

Bootstrap

N sorteios aleatórios com reposição a partir do dataset original (N registros)

Sim

Amostra de N elementos com reposição

Registros não sorteados (out-of-bag)

Leave-One-Out (LOO)

Validação cruzada com k = N

Não

N-1 registros

1 registro restante

K-Fold CrossValidation

Divisão em k partes iguais, treino em k-1 partes

Não

k-1 partes

1 parte restante

Stratified K-Fold

Variação do K-Fold que mantém proporção das classes

Não

k-1 partes (com proporção preservada)

1 parte (com proporção preservada)

Alternativa A — ❌ Incorreta

O Holdout particiona os dados uma única vez, geralmente em proporções fixas (ex.: 70% treino, 30% teste), sem reposição. Não envolve sorteios com reposição como descrito no enunciado.

Alternativa B — ✅ Correta ⟵ GABARITO

O Bootstrap é exatamente o método que realiza N sorteios com reposição a partir do conjunto original de N registros para formar o treinamento. Os registros não sorteados (cerca de 36,8% do total, em média) constituem o conjunto de teste (out-of-bag). Essa técnica é amplamente usada em ensembles como Random Forest.

Alternativa C — ❌ Incorreta

Leave-One-Out (LOO) é uma forma de validação cruzada onde cada iteração usa N-1 registros para treino e 1 para teste, sem amostragem com reposição. O treinamento não é gerado por sorteios com reposição.

Alternativa D — ❌ Incorreta

O K-Fold CrossValidation divide o dataset em k partes (folds) de forma aleatória, mas sem reposição. A cada iteração, um fold é reservado para teste e os demais para treino. Não há sorteio com reposição.

Alternativa E — ❌ Incorreta

Stratified K-Fold CrossValidation é uma variação do K-Fold que preserva a proporção das classes em cada fold, mas também não utiliza amostragem com reposição. A descrição do enunciado não se aplica.

PEGA ESSA DICA!

Associe "sorteios com reposição" diretamente ao Bootstrap. Lembre-se de que o Bootstrap gera conjuntos de treino do mesmo tamanho do original, permitindo que um mesmo registro apareça várias vezes. Esse é o traço distintivo diante de outras técnicas de validação.

Gabarito: letra B.

Link permanente: /questoes/fg125588