Algoritmo de Otimização Adam
Gabarito: letra E. O algoritmo Adam (Adaptive Moment Estimation) é um método de otimização que combina vantagens do Momentum (média móvel dos gradientes) e do RMSProp (média móvel quadrática dos gradientes) para atualizar pesos de forma adaptativa. A alternativa correta descreve exatamente esse mecanismo: "utiliza a média móvel quadrática dos gradientes para normalizá-los para atualização dos pesos".
O Adam mantém duas estimativas: a média móvel do gradiente (primeiro momento) e a média móvel do quadrado do gradiente (segundo momento). Essa segunda média é usada para normalizar a taxa de aprendizado para cada parâmetro, o que permite lidar com gradientes esparsos e variáveis.
Alternativa A — ❌ Incorreta
Afirma que o Adam "não utiliza taxa de aprendizado adaptativa". Na realidade, o Adam é um dos otimizadores adaptativos mais conhecidos — ele ajusta a taxa de aprendizado para cada parâmetro com base nas estimativas dos momentos. Exatamente o contrário do que a alternativa propõe.
Alternativa B — ❌ Incorreta
Diz que o Adam "converge facilmente para a solução ótima, em qualquer condição". Nenhum otimizador garante convergência global em qualquer condição; o Adam pode falhar ou convergir para pontos subótimos em certos cenários (por exemplo, em problemas não convexos com ruído). A afirmação é uma generalização indevida.
Alternativa C — ❌ Incorreta
Alega que o Adam "é ineficiente por requerer muita memória". O Adam armazena dois vetores de momentos (primeiro e segundo), ou seja, ocupa o dobro de memória do SGD básico, mas isso é uma quantidade modesta (O(n) parâmetros) e não é considerado ineficiente. Otimizadores como o Adadelta ou Adagrad também armazenam estados similares.
Alternativa D — ❌ Incorreta
Declara que o Adam "não é capaz de lidar com gradientes esparsos". Pelo contrário, o Adam foi projetado para funcionar bem com gradientes esparsos, pois as médias móveis permitem que parâmetros com atualizações esporádicas recebam taxas de aprendizado adequadas.
Alternativa E — ✅ Correta ⟵ GABARITO
Afirma que o Adam "utiliza a média móvel quadrática dos gradientes para normalizá-los para atualização dos pesos". Isso está correto: o Adam calcula a média móvel dos quadrados dos gradientes (segundo momento) e a usa para normalizar a taxa de aprendizado, reduzindo-a para parâmetros com gradientes grandes e aumentando-a para gradientes pequenos.
Gabarito: letra E.