Questão de TI - Ciência de Dados e Inteligência Artificial — Conceitos Gerais de Machine Learning — CESPE / CEBRASPE 2024
TI - Ciência de Dados e Inteligência Artificial›Conceitos Gerais de Machine Learning
Código
ce403701
Banca
CESPE / CEBRASPE
Órgão
LNA
Ano
2024
Cargo
Tecno ( )
O algoritmo de otimização Adam (adaptive moment estimation) é um dos mais utilizados atualmente na área de aprendizado de máquina. A respeito das características e da utilização desse algoritmo, é correto afirmar que ele
Anão utiliza taxa de aprendizado adaptativa.
Bconverge facilmente para a solução ótima, em qualquer condição.
Cé ineficiente por requerer muita memória.
Dnão é capaz de lidar com gradientes esparsos.
Eutiliza a média móvel quadrática dos gradientes para normalizá-los para atualização dos pesos.
Revelar gabarito e comentário▾
GabaritoE — utiliza a média móvel quadrática dos gradientes para normalizá-los para atualização dos pesos.
Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.
Algoritmo de otimização Adam (adaptive moment estimation)
Gabarito: letra E. O Adam é um otimizador que combina o momento de primeira ordem (média móvel dos gradientes, como no Momentum) com o momento de segunda ordem (média móvel quadrática dos gradientes, como no RMSProp), usando este último para normalizar as atualizações dos pesos. A alternativa E descreve exatamente esse mecanismo: "utiliza a média móvel quadrática dos gradientes para normalizá-los para atualização dos pesos". As demais alternativas contêm afirmações falsas sobre o algoritmo.
O Adam (Adaptive Moment Estimation) foi proposto por Kingma e Ba em 2015 e se tornou um dos otimizadores mais populares em aprendizado profundo. Ele é chamado de "adaptativo" porque ajusta a taxa de aprendizado para cada parâmetro individualmente, com base nas estimativas dos momentos dos gradientes. Para entender o Adam, é preciso primeiro entender dois conceitos: o momento de primeira ordem e o momento de segunda ordem.
O momento de primeira ordem é uma média móvel exponencial dos gradientes, que suaviza as oscilações e acelera a convergência na direção consistente — é a ideia do algoritmo Momentum. O momento de segunda ordem é uma média móvel exponencial dos quadrados dos gradientes, que captura a magnitude recente dos gradientes — é a ideia do RMSProp. O Adam combina os dois: ele usa o momento de primeira ordem para dar "inércia" à atualização e o momento de segunda ordem para normalizar a atualização, dividindo o gradiente pela raiz quadrada da média móvel dos quadrados. Isso faz com que parâmetros com gradientes grandes tenham passos menores e parâmetros com gradientes pequenos tenham passos maiores, adaptando a taxa de aprendizado por parâmetro.
Na prática, a atualização do Adam é aproximadamente:
onde é a estimativa corrigida do primeiro momento (média dos gradientes), é a estimativa corrigida do segundo momento (média dos quadrados dos gradientes), é a taxa de aprendizado e é uma constante pequena para evitar divisão por zero. A divisão por é exatamente a "normalização" mencionada na alternativa E.
Uma característica importante do Adam é que ele lida bem com gradientes esparsos (por isso a alternativa D está errada) e é eficiente em termos de memória (por isso a alternativa C está errada), pois mantém apenas duas variáveis por parâmetro (os momentos), em vez de armazenar o histórico completo dos gradientes. Além disso, o Adam não converge facilmente em qualquer condição (alternativa B errada): ele pode falhar em alguns problemas, como funções com curvaturas muito desiguais, e a convergência depende de hiperparâmetros bem ajustados. E, obviamente, o Adam utiliza taxa de aprendizado adaptativa (alternativa A errada) — é justamente essa a sua principal característica.
A pegadinha desta questão é que o candidato pode confundir o Adam com o SGD (Stochastic Gradient Descent) puro, que não tem taxa adaptativa, ou com o Momentum, que só usa o primeiro momento. O Adam é a combinação dos dois, e a alternativa E captura a essência do segundo momento.
Critério
Adam (Adaptive Moment Estimation)
SGD (Stochastic Gradient Descent)
Momentum
Taxa de aprendizado
Adaptativa por parâmetro
Fixa (ou com schedule)
Fixa (ou com schedule)
Momento de 1ª ordem (média dos gradientes)
Sim (média móvel exponencial)
Não
Sim (média móvel exponencial)
Momento de 2ª ordem (média dos quadrados dos gradientes)
Sim (média móvel exponencial)
Não
Não
Normalização dos gradientes
Sim (divide pela raiz quadrada do 2º momento)
Não
Não
Memória adicional por parâmetro
2 variáveis (1º e 2º momentos)
0
1 variável (momento)
Lidar com gradientes esparsos
Sim (bom desempenho)
Limitado
Limitado
Alternativa A — ❌ Incorreta
Afirma que o Adam "não utiliza taxa de aprendizado adaptativa". Isso é exatamente o oposto da verdade: o Adam é um otimizador adaptativo por definição — ele ajusta a taxa de aprendizado para cada parâmetro com base nos momentos dos gradientes. O nome "adaptive moment estimation" já indica isso. O SGD clássico usa uma taxa fixa, mas o Adam não.
Alternativa B — ❌ Incorreta
Afirma que o Adam "converge facilmente para a solução ótima, em qualquer condição". Isso é uma generalização indevida. O Adam é robusto em muitos casos, mas não converge em qualquer condição: há funções (como as que têm curvaturas extremamente desiguais) em que o Adam pode divergir ou estagnar. A convergência depende de hiperparâmetros (taxa de aprendizado, betas, epsilon) e da natureza do problema. Nenhum otimizador garante convergência "em qualquer condição".
Alternativa C — ❌ Incorreta
Afirma que o Adam é "ineficiente por requerer muita memória". Na verdade, o Adam é eficiente em memória: ele mantém apenas duas estimativas de momento por parâmetro (primeiro e segundo momentos), o que é um custo de memória O(n) — igual ao do SGD com momentum. Não armazena o histórico de gradientes. Algoritmos que exigem "muita memória" seriam, por exemplo, os de segunda ordem pura (como Newton), que precisam da matriz Hessiana.
Alternativa D — ❌ Incorreta
Afirma que o Adam "não é capaz de lidar com gradientes esparsos". Isso é falso: o Adam foi projetado justamente para lidar bem com gradientes esparsos, que são comuns em problemas com grandes vocabulários (como processamento de linguagem natural). A normalização pelo segundo momento faz com que parâmetros com gradientes raros recebam atualizações maiores quando finalmente aparecem. O Adam é amplamente usado em embeddings e redes neurais com entradas esparsas.
Alternativa E — ✅ Correta ⟵ GABARITO
Afirma que o Adam "utiliza a média móvel quadrática dos gradientes para normalizá-los para atualização dos pesos". Isso descreve com precisão o mecanismo do Adam: ele mantém uma média móvel exponencial dos quadrados dos gradientes (segundo momento, ) e usa sua raiz quadrada para normalizar o gradiente (ou o momento de primeira ordem) antes de atualizar os pesos. Essa normalização adapta a taxa de aprendizado por parâmetro, dando passos menores para parâmetros com gradientes grandes e passos maiores para parâmetros com gradientes pequenos. É exatamente essa a essência do algoritmo.