Pular para o conteúdo principal

Questão de Banco de Dados — Banco de Dados — FGV 2023

Banco de DadosBanco de Dados
Código
fg060692
Banca
FGV
Órgão
CGE-SC
Ano
2023
Nível
Superior
Cargo
Auditor do Estado - Ciências da Computação - Tarde (Conhecimentos Específicos)
Sobre a divisão e tratamento de dados, assinale a afirmativa correta.
  1. AOs dados coletados podem ser de três tipos: numéricos, texto e imagem; assim, os algoritmos de aprendizagem de máquina são capazes de lidar com todos os tipos de dados, bastando que os dados sejam transformados para dados contínuos utilizando técnicas como interpolação.
  2. BMédia da coluna, interpolação de vizinhos mais próximos, moda da coluna, vizinhos mais próximos (KNN) e valor aleatório são métodos para tratamento de dados faltantes, ou seja, atributos não preenchidos na base de dados.
  3. CValidação cruzada é um método de divisão dos dados em que os dados são divididos por k partes em que, a cada rodada, uma das partes é o conjunto de teste e o restante é utilizado para treino; a divisão dos conjuntos estratificada para validação cruzada não é aconselhada caso o valor de k seja igual a 10.
  4. DO método de divisão de dados leave-one-out (deixando um de fora) aproveita o máximo dos dados, pois todos os dados, com exceção de um item, são utilizados para treinar a cada execução; essa configuração é a mais utilizada para algoritmos custosos de aprendizado de máquina como as redes neurais profundas.
  5. EA divisão dos dados em 3 conjuntos (treino, validação e teste) é bastante comum para avaliação de algoritmos com muitos parâmetros, como as redes neurais; o conjunto de validação funciona como um conjunto de avaliação de parâmetros e é utilizado para confirmar se o algoritmo encontrou o máximo global.
Revelar gabarito e comentário

GabaritoB — Média da coluna, interpolação de vizinhos mais próximos, moda da coluna, vizinhos mais próximos (KNN) e valor aleatório são métodos para tratamento de dados faltantes, ou seja, atributos não preenchidos na base de dados.

Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.

Divisão e tratamento de dados em aprendizado de máquina

Gabarito: letra B. A questão cobra conceitos de pré-processamento de dados e divisão de conjuntos. A alternativa B lista corretamente métodos de imputação de dados faltantes; as demais contêm erros conceituais ou afirmações falsas sobre os temas.

Tratamento de dados faltantes
  • 1Métodos de imputação
    • Média da coluna
    • Moda da coluna
    • Interpolação (vizinhos)
    • KNN imputation
    • Valor aleatório
LEVEL · soulevel.com.br

Alternativa A — ❌ Incorreta

Afirma que dados podem ser apenas de três tipos (numéricos, texto e imagem) e que bastaria transformá-los em contínuos por interpolação. Na realidade, existem outros tipos (categoricos, ordinais, etc.) e o tratamento varia: texto requer técnicas de NLP, imagens requerem extração de características, e a interpolação não se aplica a todos os casos.

Alternativa B — ✅ Correta ⟵ GABARITO

Lista métodos clássicos de imputação de dados faltantes: média da coluna (mean imputation), interpolação de vizinhos mais próximos, moda da coluna (mode imputation), KNN imputation e valor aleatório (random imputation). Todos são abordagens válidas para tratar atributos não preenchidos.

Alternativa C — ❌ Incorreta

Descreve corretamente a validação cruzada k-fold, mas a segunda parte é falsa: a divisão estratificada é recomendada para preservar a proporção das classes em cada fold, independentemente do valor de k (inclusive k=10). Não há regra que a desaconselhe para k=10.

Alternativa D — ❌ Incorreta

Leave-one-out (LOO) realmente usa todos os dados menos um para treino a cada iteração, mas é computacionalmente caro (treina N modelos). Por isso, não é o mais utilizado para algoritmos custosos como redes neurais profundas; preferem-se k-fold ou holdout.

Alternativa E — ❌ Incorreta

A divisão em treino/validação/teste é comum, mas o conjunto de validação serve para ajustar hiperparâmetros e evitar overfitting, não para confirmar se o algoritmo encontrou o máximo global. O máximo global é um conceito de otimização que não é verificado diretamente pelo conjunto de validação.

Gabarito: letra B.

Link permanente: /questoes/fg060692