Pular para o conteúdo principal

Questão de Banco de Dados — Banco de Dados — FGV 2024

Banco de DadosBanco de Dados
Código
fg077300
Banca
FGV
Órgão
CVM
Ano
2024
Nível
Superior
Cargo
Analista - Perfil 7 - Ciência de Dados - Tarde
Uma equipe de analistas de dados preparou um modelo preditivo cuja entrada consiste em planilhas contendo uma matriz de valores reais entre 1 e 10. Tais planilhas são obtidas de um sistema externo à equipe. O modelo foi treinado com um conjunto de planilhas que foi coletado pelos analistas, de forma a obter uma amostra representativa dos dados a serem utilizados. A média e o desvio padrão de duas colunas importantes foram calculados do conjunto de treinamento, como uma forma simples de verificar a consistência da distribuição dos dados, sendo seus valores 4,89 e 3,08, respectivamente. O modelo obteve bons resultados durante sua etapa de testes, com uma precisão de 94%.Ao iniciar a operação do modelo com planilhas atuais, entretanto, os analistas observaram que o modelo teve um desempenho muito inferior, com precisão de apenas 72%. Investigando as planilhas recebidas, obtiveram a média e o desvio padrão para as duas colunas importantes com valores 5,34 e 3,68, respectivamente.A explicação mais adequada à situação descrita é:
  1. Aas planilhas atuais contêm ruído: valores ausentes nas colunas importantes;
  2. Ba distribuição dos valores nas planilhas atuais não corresponde mais aos dados usados no treinamento, pois foram coletadas em momentos diferentes (drifting);
  3. Ca distribuição dos valores nas planilhas atuais não corresponde mais aos dados usados no treinamento devido a uma mudança na posição das colunas;
  4. Da distribuição dos valores nas planilhas de treinamento não corresponde aos dados atuais, pois a amostra obtida pelos analistas não foi representativa;
  5. Eas planilhas atuais contêm ruído: valores fora do intervalo definido para o modelo.
Revelar gabarito e comentário

GabaritoE — as planilhas atuais contêm ruído: valores fora do intervalo definido para o modelo.

Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.

Degradação de desempenho em modelo preditivo

Gabarito: letra E. A queda drástica na precisão (de 94% para 72%) decorre de ruído nas planilhas atuais: valores fora do intervalo definido para o modelo (1 a 10). Embora a média e o desvio padrão tenham mudado, indicando uma mudança na distribuição, a explicação mais adequada é a presença de ruído (outliers), visto que o intervalo dos dados é uma restrição fixa e a violação dele compromete o modelo. As demais alternativas não se sustentam plenamente.

A banca testa a capacidade de distinguir entre drift (mudança sistemática da distribuição) e ruído (valores espúrios). O enunciado fornece as estatísticas antes e depois, mas o foco é que os dados originais têm um intervalo definido de 1 a 10. O novo conjunto, com média 5,34 e desvio 3,68, tem maior probabilidade de conter valores abaixo de 1 ou acima de 10, o que é considerado ruído.

Alternativa A — ❌ Incorreta

Valores ausentes (ruído de falta) não explicam a mudança nas estatísticas de média e desvio padrão. A ausência de dados não altera diretamente a distribuição dos valores presentes; ela apenas reduz o tamanho da amostra. Além disso, o texto não menciona tratamento de missing values.

Alternativa B — ❌ Incorreta

Embora a distribuição tenha mudado (o que caracteriza data drift), a alternativa afirma que isso se deve exclusivamente à coleta em momentos diferentes. A mudança de momento pode ser uma causa, mas o principal problema apontado pela banca é a presença de ruído (valores fora do intervalo). Em contextos de aprendizado de máquina, drift é uma degradação natural ao longo do tempo, porém o enunciado sugere que o intervalo de entrada é estrito – logo, a causa mais específica é o ruído.

Alternativa C — ❌ Incorreta

Mudança na posição das colunas não é mencionada nem inferida. Se as colunas fossem trocadas, os valores lidos pelo modelo estariam em ordem errada, mas as estatísticas calculadas seriam diferentes (provavelmente). O fato de as estatísticas terem sido calculadas nas duas colunas importantes indica que elas são as mesmas colunas; a posição não foi alterada.

Alternativa D — ❌ Incorreta

A amostra de treinamento foi considerada representativa, pois o modelo obteve 94% de precisão na etapa de testes (que usa dados da mesma distribuição). Se a amostra não fosse representativa, o desempenho no teste já seria ruim. O problema aparece apenas com os dados atuais, o que indica que a amostra era adequada, mas a distribuição dos novos dados mudou.

Alternativa E — ✅ Correta ⟵ GABARITO

A alternativa descreve ruído na forma de valores fora do intervalo definido para o modelo (1 a 10). A média e o desvio padrão do novo conjunto (5,34 e 3,68) sugerem que uma parcela significativa dos dados pode estar fora desse intervalo – por exemplo, valores abaixo de 1 ou acima de 10. Esse tipo de ruído causa degradação severa no modelo, que foi treinado para trabalhar apenas com valores dentro do intervalo. A queda de 22 pontos percentuais na precisão é coerente com a introdução de outliers.

PEGA ESSA DICA!

Leia atentamente os limites impostos pelo modelo. Quando o enunciado diz que a entrada é uma matriz de valores entre 1 e 10, qualquer desvio grande na média ou no desvio padrão pode indicar que dados fora desse intervalo estão contaminando a amostra. Lembre-se que drift é uma mudança na distribuição dentro dos mesmos limites; já ruído é a violação dos limites esperados.

Gabarito: letra E.

Link permanente: /questoes/fg077300