Learning rates for Q-learning
Eyal Even-Dar and Yishay Mansour · 2003
Cited alongside, same era.
Linear stochastic approximation driven by slowly varying markov chains
Vijay R Konda and John N Tsitsiklis · 2003
Cited alongside, same era.
PAC model-free reinforcement learning
Alexander L Strehl, Lihong Li, Eric Wiewiora, John Langford, and Michael L Littman · 2006
Cited alongside, same era.
An analysis of reinforcement learning with function approximation
Francisco S Melo, Sean P Meyn, and M Isabel Ribeiro · 2008
Cited alongside, same era.
Stochastic approximation: a dynamical systems viewpoint , volume 48
Vivek S Borkar · 2009
Cited alongside, same era.
Double Q-learning
Hado V Hasselt · 2010
Cited alongside, same era.
Speedy Q-learning
Mohammad Gheshlaghi Azar, Rémi Munos, Mohammad Ghavamzadeh, and Hilbert Kappen · 2011
Cited alongside, same era.
Error bounds for constant step-size Q-learning
Carolyn L Beck and Rayadurgam Srikant · 2012
Cited alongside, same era.
Adaptive algorithms and stochastic approximations , volume 22
Albert Benveniste, Michel Métivier, and Pierre Priouret · 2012
Cited alongside, same era.
Minimax PAC bounds on the sample complexity of reinforcement learning with a generative model
Mohammad Gheshlaghi Azar, Rémi Munos, and Hilbert J Kappen · 2013
Cited alongside, same era.
Zap Q-learning
Adithya M Devraj and Sean Meyn · 2017
Cited alongside, same era.
Near-optimal time and sample complexities for solving markov decision processes with a generative model
Aaron Sidford, Mengdi Wang, Xian Wu, Lin Yang, and Yinyu Ye
Cited in the paper.