Pular para o conteúdo principal

Questão de Algoritmos e Estrutura de Dados — Algoritmos — FGV 2024

Algoritmos e Estrutura de DadosAlgoritmos
Código
fg077309
Banca
FGV
Órgão
CVM
Ano
2024
Nível
Superior
Cargo
Analista - Perfil 7 - Ciência de Dados - Tarde
O cientista de dados Pedro trabalha em um projeto que envolve a previsão dos movimentos de um braço robótico em um ambiente complexo. Pedro tem um fluxograma de um algoritmo de aprendizado por reforço que é capaz de se adaptar dinamicamente ao ambiente e ajustar suas ações com base nos resultados de ações anteriores.O algoritmo representado pelo referido fluxograma que deve ser empregado para a realização da tarefa de Pedro é o:
  1. AMáquina de Vetores de Suporte (SVM);
  2. BRede Neural Convolucional (CNN);
  3. CLong Short-Term Memory (LSTM);
  4. DTwin Delayed Deep Deterministic Policy Gradient (TD3);
  5. EK-Vizinhos Mais Próximos (KNN).
Revelar gabarito e comentário

GabaritoD — Twin Delayed Deep Deterministic Policy Gradient (TD3);

Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.

Aprendizado por Reforço: TD3 para Controle Robótico

Gabarito: letra D. O Twin Delayed Deep Deterministic Policy Gradient (TD3) é um algoritmo de aprendizado por reforço profundo (deep reinforcement learning) projetado para ambientes de ação contínua, como o controle de um braço robótico. Ele atualiza dinamicamente sua política (actor) e valor (critic) com base nas recompensas recebidas, exatamente o que Pedro precisa para se adaptar aos resultados de ações anteriores. As demais alternativas são técnicas de aprendizado supervisionado ou não supervisionado, não de reforço.

A questão testa a capacidade de distinguir entre diferentes paradigmas de aprendizado de máquina. O enunciado enfatiza "aprendizado por reforço", "adaptação dinâmica" e "ajuste com base em ações anteriores" – características marcantes dos algoritmos de reinforcement learning.

Alternativa A — ❌ Incorreta

Máquina de Vetores de Suporte (SVM) é um método de aprendizado supervisionado para classificação ou regressão. Não envolve interação com ambiente nem aprendizado por tentativa e erro. Não é um algoritmo de reforço.

Alternativa B — ❌ Incorreta

Rede Neural Convolucional (CNN) é uma arquitetura de rede neural usada principalmente para processamento de dados com topologia em grade, como imagens. Pode ser componente de um sistema de reforço, mas não é, por si só, um algoritmo de aprendizado por reforço.

Alternativa C — ❌ Incorreta

Long Short-Term Memory (LSTM) é um tipo de rede neural recorrente (RNN) capaz de modelar dependências temporais. Embora possa ser usado como aproximador de funções em reinforcement learning, não é um algoritmo completo de aprendizado por reforço. O enunciado pede um algoritmo capaz de se adaptar dinamicamente – o LSTM é uma arquitetura, não um algoritmo de treino.

Alternativa D — ✅ Correta ⟵ GABARITO

Twin Delayed Deep Deterministic Policy Gradient (TD3) é um algoritmo de reinforcement learning off-policy, baseado em Actor-Critic, que lida com espaços de ação contínuos. Ele emprega dois critics para reduzir o viés de estimação e atualiza a política de forma defasada, resultando em aprendizado estável. É amplamente utilizado em robótica e controle, exatamente o cenário descrito.

Alternativa E — ❌ Incorreta

K-Vizinhos Mais Próximos (KNN) é um método de aprendizado baseado em instâncias, usado para classificação ou regressão. Não há interação com ambiente nem adaptação a ações passadas. Totalmente fora do escopo de aprendizado por reforço.


Gabarito: letra D.

Link permanente: /questoes/fg077309