Pular para o conteúdo principal

Questão de Engenharia de Software — Inteligencia Artificial — FGV 2024

Engenharia de SoftwareInteligencia Artificial
Código
fg084648
Banca
FGV
Órgão
EPE
Ano
2024
Nível
Superior
Cargo
Analista de Gestão Corporativa - Tecnologia da Informação (Ciência de Dados)
As técnicas de aprendizado supervisionado estão baseadas na determinação de modelos capazes de otimizar o mapeamento entre entradas e saídas de um conjunto de dados. Por vezes, o processo de treinamento pode gerar modelos muito complexos que “aprendem” o ruído existente nos conjuntos de dados, caracterizando o fenômeno de sobreajuste ou overfitting.Um método que pode ajudar a mitigar a ocorrência do overfitting consiste emI. dividir o conjunto de dados em k partes;II. utilizar uma das partes para teste e as outras k-1 para treinamento;III. repetir o processo para cada uma das k partes do conjunto de dados; eIV. avaliar a média das métricas de performance para o modelo.O método acima é chamado de
  1. Ak vizinhos mais próximos (k nearest neighbors ou k-NN).
  2. Bretropropagação (backpropagation).
  3. Cvalidação cruzada (cross-validation).
  4. Dregularização Lasso (Lasso regularization).
  5. Ecomitê de modelos (model ensembling).
Revelar gabarito e comentário

GabaritoC — validação cruzada (cross-validation).

Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.

Validação Cruzada

Gabarito: letra C. O método descrito no enunciado — dividir o conjunto em k partes, treinar com k-1 partes e testar com a parte restante, repetir para cada parte e calcular a média das métricas — é a definição clássica de validação cruzada (cross-validation), uma técnica para mitigar o overfitting avaliando a capacidade de generalização do modelo.

A questão cobra a identificação da técnica a partir de sua descrição passo a passo. Confira cada alternativa:

Alternativa A — ❌ Incorreta

k vizinhos mais próximos (k-NN) é um algoritmo de classificação/regressão, não um método de validação. A letra k em ambos pode confundir, mas o propósito é totalmente diferente: o k-NN classifica um ponto com base nos k vizinhos mais próximos.

Alternativa B — ❌ Incorreta

Retropropagação (backpropagation) é o algoritmo usado para treinar redes neurais, ajustando os pesos por gradiente descendente. Não é um método de validação ou de divisão de dados.

Alternativa C — ✅ Correta ⟵ GABARITO

Validação cruzada (cross-validation), mais especificamente a validação cruzada k-fold, segue exatamente os passos: (1) dividir em k subconjuntos; (2) usar k-1 para treino e 1 para teste; (3) repetir para cada subconjunto; (4) avaliar a média das métricas. Isso evita que o modelo se sobreajuste a uma única divisão treino-teste.

Alternativa D — ❌ Incorreta

Regularização Lasso (Lasso regularization) é uma técnica de regularização que adiciona penalidade L1 aos coeficientes do modelo para evitar overfitting, mas não envolve divisão de dados ou repetição de treinamento.

Alternativa E — ❌ Incorreta

Comitê de modelos (model ensembling) combina múltiplos modelos (ex.: florestas aleatórias, boosting), mas não é o método descrito, que foca na validação cruzada para avaliação.

NÃO CAIA NESSA!

A presença da letra k pode levar o candidato a associar erroneamente ao algoritmo k-NN. Lembre-se: k-fold é validação cruzada; k-NN é classificação.

O diagrama abaixo resume o fluxo da validação cruzada k-fold:

Gabarito: letra C.

Link permanente: /questoes/fg084648