“Learning continuous control policies by stochastic value gradients”
Nicolas Heess, Gregory Wayne, David Silver, Tim Lillicrap, Tom Erez and Yuval Tassa · 2015
Cited alongside, same era.
“Human-level control through deep reinforcement learning”
Volodymyr Mnih, Koray Kavukcuoglu, David Silver, Andrei Rusu, Joel Veness, Marc Bellemare, Alex Graves, Martin Riedmiller, Andreas Fidjeland and Georg Ostrovski · 2015
Cited alongside, same era.
“Ensemble-CIO: Full-body dynamic motion planning that transfers to physical humanoids”
Igor Mordatch, Kendall Lowrey and Emanuel Todorov · 2015
Cited alongside, same era.
“Trust Region Policy Optimization”
John Schulman, Sergey Levine, Philipp Moritz, Michael Jordan and Pieter Abbeel · 2015
Cited alongside, same era.
“OpenAI Gym”
Original
Greg Brockman, Vicki Cheung, Ludwig Pettersson, Jonas Schneider, John Schulman, Jie Tang and Wojciech Zaremba · 2016
Cited alongside, same era.
“Transfer from Simulation to Real World through Learning Deep Inverse Dynamics Model”
Original
Paul Christiano, Zain Shah, Igor Mordatch, Jonas Schneider, Trevor Blackwell, Joshua Tobin, Pieter Abbeel and Wojciech Zaremba · 2016
Cited alongside, same era.
“Learning Modular Neural Network Policies for Multi-Task and Multi-Robot Transfer”
Original
Coline Devin, Abhishek Gupta, Trevor Darrell, Pieter Abbeel and Sergey Levine · 2016
Cited alongside, same era.
“Sequential linear quadratic optimal control for nonlinear switched systems”
Original
Farbod Farshidian, Diego Pardo and Jonas Buchli · 2016
Cited alongside, same era.
“Continuous deep q-learning with model-based acceleration”
Shixiang Gu, Timothy Lillicrap, Ilya Sutskever and Sergey Levine · 2016
Cited alongside, same era.
“PLATO: Policy Learning using Adaptive Trajectory Optimization”
Original
Gregory Kahn, Tianhao Zhang, Sergey Levine and Pieter Abbeel · 2016
Cited alongside, same era.
“End-to-end training of deep visuomotor policies”
Sergey Levine, Chelsea Finn, Trevor Darrell and Pieter Abbeel · 2016
Cited alongside, same era.