Questão de Algoritmos e Estrutura de Dados — Algoritmos — IF-SP 2022
Algoritmos e Estrutura de Dados›Algoritmos
Código
qq760128
Banca
IF-SP
Órgão
IF-SP
Ano
2022
Nível
Superior
Cargo
Analista de Tecnologia da Informação - Ciência de Dados
O algoritmo K-NN (K Nearest Neighbor) é um dos algoritmos mais utilizados em Machine Learning, além de ser simples se comparado aos demais. Esse algoritmo é muito utilizado em problemas de classificação, mas pode ser aplicado para regressão. Selecione a opção que NÃO representa uma prática eficiente para preparação dos dados com a aplicação desse algoritmo.
ANormalização dos dados.
BRemoção de dados ausentes (sem valor).
CDivisão dos dados em 80% para treinamento e 20% para testes.
DTrabalhar com poucas entradas (dimensionalidade).
Revelar gabarito e comentário▾
GabaritoC — Divisão dos dados em 80% para treinamento e 20% para testes.
Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.
K-NN e preparação de dados
Gabarito: letra C. A alternativa C (divisão dos dados em 80% para treinamento e 20% para testes) não é uma prática de preparação de dados, mas sim de avaliação/validação do modelo. As demais alternativas (normalização, remoção de dados ausentes e redução de dimensionalidade) são etapas de pré-processamento comuns e eficientes para o K-NN.
A banca testa o conhecimento sobre as etapas corretas de preparação dos dados para o algoritmo K-NN. É essencial diferenciar o que é pré-processamento (preparação) do que é divisão para treino/teste (avaliação).
Prática
Categoria
Eficiência para K-NN
Observação
Normalização dos dados
Pré-processamento
Alta
Essencial para evitar dominância de escalas
Remoção de dados ausentes
Pré-processamento
Média a alta
Necessária para viabilizar cálculos de distância
Divisão 80/20 treino-teste
Avaliação do modelo
Não se aplica
É etapa de validação, não de preparação
Redução de dimensionalidade
Pré-processamento
Alta
Combate a maldição da dimensionalidade
Alternativa A — ✅ Correta
Normalização dos dados é uma prática eficiente e frequentemente necessária para o K-NN, pois o algoritmo utiliza cálculos de distância (ex.: distância euclidiana). Se as features estiverem em escalas muito diferentes, aquelas com maior magnitude dominarão a métrica, comprometendo o resultado. A normalização (min-max, z-score) garante que todas as features contribuam de forma equilibrada.
Alternativa B — ✅ Correta
Remoção de dados ausentes (linhas com valores faltantes) é uma prática comum na preparação. Embora existam técnicas de imputação, a remoção é simples e eficaz quando a quantidade de dados ausentes é pequena. Para o K-NN, que depende de distâncias, a presença de NaNs inviabiliza o cálculo, então é preciso tratá-los (removendo ou imputando).
Alternativa C — ❌ Incorreta ⟵ GABARITO
A divisão dos dados em 80% para treinamento e 20% para testes é uma etapa de avaliação do modelo, não de preparação. A preparação dos dados envolve limpeza, normalização, transformação e redução de dimensionalidade. A divisão treino-teste é realizada após a preparação, com o objetivo de medir o desempenho do modelo. Portanto, não se enquadra como prática de preparação, e por isso a questão a considera ineficiente para esse propósito específico.
Alternativa D — ✅ Correta
Trabalhar com poucas entradas (dimensionalidade reduzida) é uma prática eficiente para o K-NN. O algoritmo sofre com a 'maldição da dimensionalidade': à medida que o número de features cresce, os dados se tornam esparsos e as distâncias perdem significado. Reduzir a dimensionalidade (via seleção de features, PCA, etc.) melhora o desempenho e a generalização. A alternativa está correta.
NÃO CAIA NESSA!
A banca confunde a etapa de preparação (pré-processamento) com a etapa de validação. O candidato pode considerar a divisão 80-20 como parte da preparação, mas ela é posterior. Fique atento ao escopo: a questão pergunta especificamente sobre 'preparação dos dados'.