Tratamento de Dados Faltantes em Aprendizado de Máquina
Gabarito: letra A. A interpolação por vizinhos mais próximos, o valor médio e o valor modal são técnicas clássicas de imputação de dados faltantes, enquanto as demais alternativas misturam métodos de validação e otimização, inadequados para esse fim.
A questão cobra o conhecimento de métodos de imputação, uma etapa essencial do pré-processamento. Dados faltantes podem ser tratados por técnicas como:
Interpolação (ex.: vizinhos mais próximos)
Substituição por média, mediana ou moda
Modelos preditivos (ex.: regressão)
Técnicas de validação cruzada (k-fold, leave-one-out) servem para avaliar modelos, não para imputar valores. O gradiente descendente é um algoritmo de otimização, não um método de imputação.
Alternativa A — ✅ Correta ⟵ GABARITO
Lista três métodos genuínos de tratamento de dados faltantes: interpolação por vizinhos mais próximos (k-NN imputation), valor médio (mean imputation) e valor modal (mode imputation). Todos são amplamente utilizados.
Alternativa B — ❌ Incorreta
Apresenta validação estratificada e k-fold (técnicas de validação cruzada) e divisão do conjunto de dados (separação treino-teste), que não são métodos de imputação.
Alternativa C — ❌ Incorreta
Inclui validação cruzada e leave-one-out (técnicas de validação). Embora o valor mediano seja uma imputação válida, a presença de métodos de validação torna a alternativa incorreta no contexto da pergunta.
Alternativa D — ❌ Incorreta
Menciona divisão do conjunto de dados e gradiente descendente (otimização), além do valor médio. Apenas o valor médio é um método de imputação; os outros não se aplicam.
Gabarito: letra A