Playing atari games with deep reinforcement learning and human checkpoint replay
Original
Ionel-Alexandru Hosu and Traian Rebedea · 2016
Cited alongside, same era.
Asynchronous methods for deep reinforcement learning
Volodymyr Mnih, Adria Puigdomenech Badia, Mehdi Mirza, Alex Graves, Timothy P Lillicrap, Tim Harley, David Silver, and Koray Kavukcuoglu · 2016
Cited alongside, same era.
Pgq: Combining policy gradient and q-learning
Original
Brendan O’Donoghue, Remi Munos, Koray Kavukcuoglu, and Volodymyr Mnih · 2016
Cited alongside, same era.
Wavenet: A generative model for raw audio
Aäron Van Den Oord, Sander Dieleman, Heiga Zen, Karen Simonyan, Oriol Vinyals, Alex Graves, Nal Kalchbrenner, Andrew W Senior, and Koray Kavukcuoglu · 2016
Cited alongside, same era.
UCB exploration via Q-ensembles
Original
Richard Y Chen, John Schulman, Pieter Abbeel, and Szymon Sidor · 2017
Cited alongside, same era.
Reverse curriculum generation for reinforcement learning
Original
Carlos Florensa, David Held, Markus Wulfmeier, and Pieter Abbeel · 2017
Cited alongside, same era.
Reinforcement learning with deep energy-based policies
Original
Tuomas Haarnoja, Haoran Tang, Pieter Abbeel, and Sergey Levine · 2017
Cited alongside, same era.
Deep q-learning from demonstrations
Original
Todd Hester, Matej Vecerik, Olivier Pietquin, Marc Lanctot, Tom Schaul, Bilal Piot, Dan Horgan, John Quan, Andrew Sendonaris, Gabriel Dulac-Arnold, et al · 2017
Cited alongside, same era.
Revisiting the arcade learning environment: Evaluation protocols and open problems for general agents
Original
Marlos C Machado, Marc G Bellemare, Erik Talvitie, Joel Veness, Matthew Hausknecht, and Michael Bowling · 2017
Cited alongside, same era.
Bridging the gap between value and policy based reinforcement learning
Ofir Nachum, Mohammad Norouzi, Kelvin Xu, and Dale Schuurmans · 2017
Cited alongside, same era.
Count-based exploration with neural density models
Original
Georg Ostrovski, Marc G Bellemare, Aaron van den Oord, and Rémi Munos · 2017
Cited alongside, same era.
Equivalence between policy gradients and soft q-learning
Original
John Schulman, Pieter Abbeel, and Xi Chen
Cited in the paper.