Adam: A method for stochastic optimization
Original
Diederik P Kingma and Jimmy Ba · 2014
Cited alongside, same era.
Boosted and reward-regularized classification for apprenticeship learning
Bilal Piot, Matthieu Geist, and Olivier Pietquin · 2014
Cited alongside, same era.
Human-level control through deep reinforcement learning
Volodymyr Mnih, Koray Kavukcuoglu, David Silver, Andrei A Rusu, Joel Veness, Marc G Bellemare, Alex Graves, Martin Riedmiller, Andreas K Fidjeland, Georg Ostrovski, et al · 2015
Cited alongside, same era.
Maximum entropy deep inverse reinforcement learning
Original
Markus Wulfmeier, Peter Ondruska, and Ingmar Posner · 2015
Cited alongside, same era.
Openai gym, 2016
Greg Brockman, Vicki Cheung, Ludwig Pettersson, Jonas Schneider, John Schulman, Jie Tang, and Wojciech Zaremba · 2016
Cited alongside, same era.
Generative adversarial imitation learning
Jonathan Ho and Stefano Ermon · 2016
Cited alongside, same era.
Openai baselines
Prafulla Dhariwal, Christopher Hesse, Oleg Klimov, Alex Nichol, Matthias Plappert, Alec Radford, John Schulman, Szymon Sidor, Yuhuai Wu, and Peter Zhokhov · 2017
Cited alongside, same era.
Learning robust rewards with adversarial inverse reinforcement learning
Original
Justin Fu, Katie Luo, and Sergey Levine · 2017
Cited alongside, same era.
Reinforcement learning with deep energy-based policies
Original
Tuomas Haarnoja, Haoran Tang, Pieter Abbeel, and Sergey Levine · 2017
Cited alongside, same era.
Deep q-learning from demonstrations
Original
Todd Hester, Matej Vecerik, Olivier Pietquin, Marc Lanctot, Tom Schaul, Bilal Piot, Dan Horgan, John Quan, Andrew Sendonaris, Gabriel Dulac-Arnold, et al · 2017
Cited alongside, same era.
A connection between generative adversarial networks, inverse reinforcement learning, and energy-based models
Original
Chelsea Finn, Paul Christiano, Pieter Abbeel, and Sergey Levine
Cited in the paper.
Guided cost learning: Deep inverse optimal control via policy optimization
Chelsea Finn, Sergey Levine, and Pieter Abbeel
Cited in the paper.