Pular para o conteúdo principal

Questão de Engenharia de Software — Inteligencia Artificial — FGV 2024

Engenharia de SoftwareInteligencia Artificial
Código
fg096775
Banca
FGV
Órgão
TCE-PA
Ano
2024
Nível
Superior
Cargo
Auditor de Controle Externo - Área Administrativa - Ciência de Dados
Ao se utilizar bancos de dados reais no treinamento de métodos de aprendizado de máquina é normal se deparar com entradas que possuem um ou mais parâmetros (campos) ausentes.Com relação às estratégias para lidar com dados ausentes, analise as afirmativas a seguir.I. Só é possível realizar imputation quando o atributo (feature) ausente é numérico.II. Ao utilizar o k-nearest neighbors (KNN) para fazer o imputation é uma boa estratégia primeiro fazer a normalização ou padronização dos dados.III. Ao se trabalhar com bancos de dados com poucas amostras (itens), uma estratégia usualmente utilizada para lidar com as amostras) que possuem valores ausentes é a remoção.Está correto o que se afirma em
  1. AI, apenas.
  2. BII, apenas.
  3. CIII, apenas.
  4. DI e II apenas.
  5. EI, II e III.
Revelar gabarito e comentário

GabaritoB — II, apenas.

Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.

Tratamento de Dados Ausentes – Imputation e Remoção

Gabarito: letra B (apenas a afirmativa II está correta). A afirmativa I é falsa porque imputation é possível também para atributos categóricos (ex.: moda). A afirmativa II é verdadeira: no KNN imputation, a normalização/padronização evita que variáveis com escalas maiores dominem as distâncias. A afirmativa III é falsa: em bases com poucas amostras, remover linhas com valores ausentes reduz ainda mais o conjunto, sendo preferível imputar.

Afirmativa I — ❌ Incorreto

Afirma que imputation só é possível para atributos numéricos. Isso é falso. Para atributos categóricos, pode-se usar imputation pela moda, por exemplo. A imputação não está restrita a atributos numéricos.

Afirmativa II — ✅ Correto ⟵ GABARITO

O KNN imputation usa a distância entre amostras para estimar o valor ausente. Sem normalização/padronização, atributos com escalas muito diferentes (ex.: idade 0-100 vs. renda 0-100.000) distorcem o cálculo da distância. Portanto, é uma boa prática normalizar ou padronizar os dados antes.

Afirmativa III — ❌ Incorreto

Em bases com poucas amostras, remover linhas com valores ausentes é prejudicial, pois reduz o tamanho do conjunto de treinamento, podendo levar a overfitting ou perda de informação relevante. A estratégia usual é imputar os valores (média, mediana, moda, KNN, etc.). A remoção é mais adequada quando o conjunto é grande e a quantidade de missing é pequena.

Gabarito: letra B.

Link permanente: /questoes/fg096775