Questão de Estatística — Análise Multivariada — FGV 2026
Estatística›Análise Multivariada
Código
fg133965
Banca
FGV
Órgão
TJ-RJ
Ano
2026
Nível
Superior
Cargo
Analista Judiciário - Tecnologia da Informação - Cientista de Dados
Uma equipe de ciência de dados está desenvolvendo um modelo de classificação de inadimplência em um conjunto de dados tabular com informações numéricas e categóricas de clientes (renda, idade, histórico de crédito, limite etc.).O conjunto está fortemente desbalanceado: apenas 3% dos registros pertencem à classe denominada inadimplente. O time deseja aumentar a quantidade de exemplos da classe minoritária sem simplesmente duplicar registros existentes, gerando novas amostras sintéticas entre os pontos reais da classe positiva, para reduzir o risco de overfitting associado ao oversampling ingênuo.A técnica de balanceamento de classes adequada para esse cenário é:
ASMOTE;
Boversampling aleatório da classe minoritária;
Cundersampling aleatório da classe majoritária;
Ddata augmentation baseada em ruído gaussiano na classe minoritária;
Eajuste de pesos de classe (class weights) no algoritmo de aprendizado.
Revelar gabarito e comentário▾
GabaritoA — SMOTE;
Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.
Técnicas de balanceamento de classes em problemas desbalanceados
Gabarito: letra A. A técnica adequada é o SMOTE (Synthetic Minority Over-sampling Technique), pois gera amostras sintéticas da classe minoritária interpolando entre pontos reais dessa classe, exatamente o que o enunciado descreve: "gerar novas amostras sintéticas entre os pontos reais da classe positiva". As demais alternativas ou apenas duplicam registros (oversampling aleatório), ou descartam dados (undersampling), ou não geram dados sintéticos (class weights).
O problema de classificação com classes desbalanceadas é um dos mais frequentes em ciência de dados aplicada — pense em detecção de fraude, diagnóstico de doenças raras ou, como aqui, inadimplência bancária. Quando apenas 3% dos registros são da classe de interesse (a positiva, inadimplente), o modelo tende a aprender a "chutar" a classe majoritária e obter alta acurácia sem nunca acertar um inadimplente. Para corrigir isso, existem três grandes famílias de abordagens: re-amostragem dos dados (oversampling, undersampling, SMOTE), ajuste do algoritmo (class weights) e métricas/limiares adequados (precision, recall, F1, AUC).
A questão pede especificamente uma técnica que aumente a quantidade de exemplos da classe minoritária sem simplesmente duplicar registros existentes, gerando novas amostras sintéticas entre os pontos reais. Isso é a definição literal do SMOTE. Vamos entender cada alternativa e por que apenas a letra A atende ao pedido.
Técnicas de balanceamento de classes — só Técnicas de re-amostragem: Oversampling, undersampling; só Técnicas de geração de dados sintéticos: Data augmentation com ruído; Técnicas de re-amostragem∩Técnicas de geração de dados sintéticos: SMOTE
Alternativa A — ✅ Correta ⟵ GABARITO
O SMOTE (Synthetic Minority Over-sampling Technique) é um método de oversampling sintético. Ele funciona assim: para cada exemplo da classe minoritária, escolhe-se um de seus k-vizinhos mais próximos (também da classe minoritária) e cria-se um novo ponto ao longo do segmento de reta que liga os dois. Matematicamente, se é um ponto real e é um vizinho, o novo ponto sintético é , com sorteado uniformemente em . Isso gera exemplos plausíveis dentro da região de densidade da classe, reduzindo o overfitting que ocorre quando simplesmente copiamos os mesmos registros. É exatamente o que o enunciado descreve: "gerar novas amostras sintéticas entre os pontos reais da classe positiva".
Alternativa B — ❌ Incorreta
O oversampling aleatório da classe minoritária consiste em duplicar aleatoriamente exemplos existentes da classe minoritária até equilibrar as proporções. O enunciado é explícito: "sem simplesmente duplicar registros existentes". Essa alternativa é o oposto do que se pede — é o oversampling ingênuo que o SMOTE veio melhorar. A duplicação não adiciona informação nova e aumenta o risco de overfitting, pois o modelo passa a ver os mesmos exemplos repetidos.
Alternativa C — ❌ Incorreta
O undersampling aleatório da classe majoritária descarta aleatoriamente exemplos da classe majoritária (os 97% não inadimplentes) para equilibrar as classes. O enunciado pede para aumentar a quantidade de exemplos da classe minoritária, não para diminuir a classe majoritária. Além disso, descartar dados pode jogar fora informação valiosa — em um conjunto com apenas 3% de positivos, descartar negativos reduz drasticamente o volume de treino e pode piorar o desempenho.
Alternativa D — ❌ Incorreta
A data augmentation baseada em ruído gaussiano adiciona perturbações aleatórias (ruído) aos exemplos da classe minoritária, gerando variações. Embora crie amostras sintéticas, ela não é a técnica descrita no enunciado, que fala em "gerar novas amostras sintéticas entre os pontos reais" — ou seja, interpolação entre pontos, não adição de ruído. Além disso, para dados tabulares com variáveis categóricas (como histórico de crédito), adicionar ruído gaussiano pode gerar valores impossíveis (ex.: renda negativa, categoria inexistente). O SMOTE, por sua vez, opera no espaço das features e é a técnica clássica para esse fim.
Alternativa E — ❌ Incorreta
O ajuste de pesos de classe (class weights) é uma abordagem ao nível do algoritmo, não de geração de dados. Ele atribui um peso maior aos erros na classe minoritária durante o treinamento, fazendo o modelo "prestar mais atenção" nela. Não aumenta a quantidade de exemplos nem gera amostras sintéticas — apenas altera a função de custo. É uma técnica válida e complementar, mas não atende ao requisito do enunciado de "aumentar a quantidade de exemplos da classe minoritária".
NÃO CAIA NESSA!
A banca explora a confusão entre as três estratégias de lidar com desbalanceamento: re-amostragem (oversampling/undersampling/SMOTE), ajuste de pesos e métricas. O candidato que sabe que "SMOTE gera dados sintéticos" acerta; o que apenas sabe que "precisa equilibrar as classes" pode cair na letra B (oversampling aleatório) ou na letra E (class weights). A palavra-chave do enunciado é "sem simplesmente duplicar" — isso elimina a B — e "entre os pontos reais" — isso elimina a D (ruído) e aponta para o SMOTE. Fique atento a esses termos na prova: eles são o filtro que separa a resposta certa das demais.
PEGA ESSA DICA!
Para memorizar as técnicas de balanceamento, pense em três verbos: duplicar (oversampling aleatório), descartar (undersampling) e interpolar (SMOTE). O SMOTE é o único que cria dados novos por interpolação entre vizinhos da classe minoritária. Quando a questão falar em "amostras sintéticas", "entre os pontos", "sem duplicar", a resposta quase sempre é SMOTE. E lembre: class weights não mexe nos dados, só no algoritmo.