Aprendizado por Reforço: TD3 para Controle Robótico
Gabarito: letra D. O Twin Delayed Deep Deterministic Policy Gradient (TD3) é um algoritmo de aprendizado por reforço profundo (deep reinforcement learning) projetado para ambientes de ação contínua, como o controle de um braço robótico. Ele atualiza dinamicamente sua política (actor) e valor (critic) com base nas recompensas recebidas, exatamente o que Pedro precisa para se adaptar aos resultados de ações anteriores. As demais alternativas são técnicas de aprendizado supervisionado ou não supervisionado, não de reforço.
A questão testa a capacidade de distinguir entre diferentes paradigmas de aprendizado de máquina. O enunciado enfatiza "aprendizado por reforço", "adaptação dinâmica" e "ajuste com base em ações anteriores" – características marcantes dos algoritmos de reinforcement learning.
Alternativa A — ❌ Incorreta
Máquina de Vetores de Suporte (SVM) é um método de aprendizado supervisionado para classificação ou regressão. Não envolve interação com ambiente nem aprendizado por tentativa e erro. Não é um algoritmo de reforço.
Alternativa B — ❌ Incorreta
Rede Neural Convolucional (CNN) é uma arquitetura de rede neural usada principalmente para processamento de dados com topologia em grade, como imagens. Pode ser componente de um sistema de reforço, mas não é, por si só, um algoritmo de aprendizado por reforço.
Alternativa C — ❌ Incorreta
Long Short-Term Memory (LSTM) é um tipo de rede neural recorrente (RNN) capaz de modelar dependências temporais. Embora possa ser usado como aproximador de funções em reinforcement learning, não é um algoritmo completo de aprendizado por reforço. O enunciado pede um algoritmo capaz de se adaptar dinamicamente – o LSTM é uma arquitetura, não um algoritmo de treino.
Alternativa D — ✅ Correta ⟵ GABARITO
Twin Delayed Deep Deterministic Policy Gradient (TD3) é um algoritmo de reinforcement learning off-policy, baseado em Actor-Critic, que lida com espaços de ação contínuos. Ele emprega dois critics para reduzir o viés de estimação e atualiza a política de forma defasada, resultando em aprendizado estável. É amplamente utilizado em robótica e controle, exatamente o cenário descrito.
Alternativa E — ❌ Incorreta
K-Vizinhos Mais Próximos (KNN) é um método de aprendizado baseado em instâncias, usado para classificação ou regressão. Não há interação com ambiente nem adaptação a ações passadas. Totalmente fora do escopo de aprendizado por reforço.
Gabarito: letra D.