Conservative exploration using interleaving
Sumeet Katariya, Branislav Kveton, Zheng Wen, and Vamsi K. Potluru · 2019
Cited alongside, same era.
Tighter problem-dependent regret bounds in reinforcement learning without domain knowledge using value function bounds
Andrea Zanette and Emma Brunskill · 2019
Cited alongside, same era.
Contextual combinatorial conservative bandits
Original
Xiaojin Zhang, Shuai Li, and Weiwen Liu · 2019
Cited alongside, same era.
Efficient reinforcement learning in factored mdps with application to constrained rl
Xiaoyu Chen, Jiachen Hu, Lihong Li, and Liwei Wang · 2020
Cited alongside, same era.
Natural policy gradient primal-dual method for constrained markov decision processes
Dongsheng Ding, Kaiqing Zhang, Tamer Basar, and Mihailo R. Jovanovic · 2020
Cited alongside, same era.
A one-size-fits-all solution to conservative bandit problems
Original
Yihan Du, Siwei Wang, and Longbo Huang · 2020
Cited alongside, same era.
Exploration-exploitation in constrained mdps
Original
Yonathan Efroni, Shie Mannor, and Matteo Pirotta · 2020
Cited alongside, same era.
Provably efficient reinforcement learning with linear function approximation
Chi Jin, Zhuoran Yang, Zhaoran Wang, and Michael I Jordan · 2020
Cited alongside, same era.
Bandit algorithms
Tor Lattimore and Csaba Szepesvári · 2020
Cited alongside, same era.
Conservative exploration in reinforcement learning
Evrard Garcelon, Mohammad Ghavamzadeh, Alessandro Lazaric, and Matteo Pirotta
Cited in the paper.
Improved algorithms for conservative exploration in bandits
Evrard Garcelon, Mohammad Ghavamzadeh, Alessandro Lazaric, and Matteo Pirotta
Cited in the paper.
Almost optimal model-free reinforcement learningvia reference-advantage decomposition
Zihan Zhang, Yuan Zhou, and Xiangyang Ji
Cited in the paper.