Foundations of Modern Probability
Olav Kallenberg · 2002
Cited alongside, same era.
Online sparse bandit for card games
David Lupien St-Pierre, Quentin Louveaux, and Olivier Teytaud · 2011
Cited alongside, same era.
Regret bounds for restless markov bandits
Original
Ronald Ortner, Daniil Ryabko, Peter Auer, and Rémi Munos · 2012
Cited alongside, same era.
Online learning of rested and restless bandits
C. Tekin and M. Liu · 2012
Cited alongside, same era.
Multi-armed recommendation bandits for selecting state machine policies for robotic systems
Pyry Matikainen, P. Michael Furlong, Rahul Sukthankar, and Martial Hebert · 2013
Cited alongside, same era.
Playing Atari with deep reinforcement learning
Original
Volodymyr Mnih, Koray Kavukcuoglu, David Silver, Alex Graves, Ioannis Antonoglou, Daan Wierstra, and Martin A. Riedmiller · 2013
Cited alongside, same era.
Global optimality in tensor factorization, deep learning, and beyond
Benjamin D. Haeffele and Rene Vidal · 2015
Cited alongside, same era.
Trust region policy optimization
Original
John Schulman, Sergey Levine, Philipp Moritz, Michael I. Jordan, and Pieter Abbeel
Cited in the paper.
High-dimensional continuous control using generalized advantage estimation
Original
John Schulman, Philipp Moritz, Sergey Levine, Michael I. Jordan, and Pieter Abbeel
Cited in the paper.