Continuous control with deep reinforcement learning
Original
T. P. Lillicrap, J. J. Hunt, A. Pritzel, N. Heess, T. Erez, Y. Tassa, D. Silver, and D. Wierstra · 2015
Cited alongside, same era.
Trust region policy optimization
J. Schulman, S. Levine, P. Abbeel, M. I. Jordan, and P. Moritz · 2015
Cited alongside, same era.
OpenAI Gym
Original
G. Brockman, V. Cheung, L. Pettersson, J. Schneider, J. Schulman, J. Tang, and W. Zaremba · 2016
Cited alongside, same era.
Bayesian optimization for learning gaits under uncertainty
R. Calandra, A. Seyfarth, J. Peters, and M. P. Deisenroth · 2016
Cited alongside, same era.
Practice makes perfect: An optimization-based approach to controlling agile motions for a quadruped robot
C. Gehring, M. Coros, S. Hutler, C. D. Bellicoso, H. Heijnen, R. Diethelm, M. Bloesch, P. Fankhauser, J. Hwangbo, M. Hoepflinger, et al · 2016
Cited alongside, same era.
Anymal-a highly mobile and dynamic quadrupedal robot
M. Hutter, C. Gehring, D. Jud, A. Lauber, C. D. Bellicoso, V. Tsounis, J. Hwangbo, K. Bodie, P. Fankhauser, M. Bloesch, et al · 2016
Cited alongside, same era.
Design principles for a family of direct-drive legged robots
Gavin D Kenneally, Avik De, and Daniel E Koditschek · 2016
Cited alongside, same era.
Pgq: Combining policy gradient and q
Original
Brendan O’Donoghue, Rémi Munos, Koray Kavukcuoglu, and Volodymyr Mnih · 2016
Cited alongside, same era.
Terrain-adaptive locomotion skills using deep reinforcement learning
X. B. Peng, G. Berseth, and M. Van de Panne · 2016
Cited alongside, same era.
Constrained policy optimization
J. Achiam, D. Held, A. Tamar, and P. Abbeel · 2017
Cited alongside, same era.
Reinforcement learning with deep energy-based policies
T. Haarnoja, H. Tang, P. Abbeel, and S. Levine · 2017
Cited alongside, same era.
Emergence of locomotion behaviours in rich environments
Original
N. Heess, S. Sriram, J. Lemmon, J. Merel, G. Wayne, Y. Tassa, T. Erez, Z. Wang, A. Eslami, M. Riedmiller, et al · 2017
Cited alongside, same era.