← Flash Papers
Trust Region Policy Optimization (TRPO)
Share
Share this Flash Paper
Trust Region Policy Optimization (TRPO)
https://flashpapers.ai/p/rkqya83aap
Copy link
Post to X
Post to Bluesky
Share on LinkedIn
Submit to Hacker News
Submit to Reddit
Email a link
Source PDF ↗
Open standalone ↗
Make your own
Make your own paper
John Schulman, Sergey Levine +3 more
cs.LG
2015
arXiv:1502.05477
Details ▸
Details ▴
Swimmer Performance:
Monotonic improvement up to ~360 parameters
· MuJoCo Swimmer-v1
Hopper Performance:
Successful gait learning from scratch
· MuJoCo Hopper-v1
Atari Performance:
Competitive scores across 7 games
· Arcade Learning Environment
Swimmer Performance:
Monotonic improvement up to ~360 parameters
· MuJoCo Swimmer-v1
Hopper Performance:
Successful gait learning from scratch
· MuJoCo Hopper-v1
Atari Performance:
Competitive scores across 7 games
· Arcade Learning Environment