Fetching the paper…
Reading the bibliography…
The problem of constrained Markov decision process (CMDP) is investigated, where an agent aims to maximize the expected accumulated discounted reward subject to multiple constraints on its utilities/costs.
Lyapunov-based safe policy optimization for continuous control
Chow, Yinlam, Nachum, Ofir, Faust, Aleksandra, Duenez-Guzman, Edgar, & Ghavamzadeh, Mohammad. 2019 · 1901
Earlier work this paper cites.
Global optimality guarantees for policy gradient methods
Bhandari, Jalaj, & Russo, Daniel. 2019 · 1906
Earlier work this paper cites.
Optimality and approximation with policy gradient methods in Markov decision processes
Agarwal, Alekh, Kakade, Sham M, Lee, Jason D, & Mahajan, Gaurav. 2019 · 1908
Earlier work this paper cites.
Stochastic first-order methods for convex and nonconvex functional constrained optimization
Boob, Digvijay, Deng, Qi, & Lan, Guanghui. 2019 · 1908
Earlier work this paper cites.
Neural policy gradient methods: Global optimality and rates of convergence
Wang, Lingxiao, Cai, Qi, Yang, Zhuoran, & Wang, Zhaoran. 2019 · 1909
Earlier work this paper cites.
IPO: interior-point policy optimization under constraints
Liu, Yongshuai, Ding, Jiaxin, & Liu, Xin. 2019b · 1910
Earlier work this paper cites.
Safe policies for reinforcement learning via primal-dual methods
Paternain, Santiago, Calvo-Fullana, Miguel, Chamon, Luiz FO, & Ribeiro, Alejandro. 2019b · 1911
Earlier work this paper cites.
Asynchronous methods for deep reinforcement learning
Mnih, Volodymyr, Badia, Adria Puigdomenech, Mirza, Mehdi, Graves, Alex, Lillicrap, Timothy, Harley, Tim, Silver, David, & Kavukcuoglu, Koray. 2016 · 1937
Earlier work this paper cites.
Function optimization using connectionist reinforcement learning algorithms
Williams, Ronald J, & Peng, Jing. 1991 · 1991
Earlier work this paper cites.
Information-based complexity of linear operator equations
Nemirovsky, Arkadi S. 1992 · 1992
Earlier work this paper cites.
Constrained Markov Decision Processes
Altman, Eitan. 1999 · 1999
Earlier work this paper cites.
A natural policy gradient
Kakade, Sham M. 2001 · 2001
Earlier work this paper cites.
Provably efficient safe exploration via primal-dual policy optimization
Ding, Dongsheng, Wei, Xiaohan, Yang, Zhuoran, Wang, Zhaoran, & Jovanović, Mihailo R. 2020b · 2003
Earlier work this paper cites.
Improving sample complexity bounds for actor-critic algorithms
Xu, Tengyu, Wang, Zhe, & Liang, Yingbin. 2020a · 2004
Earlier work this paper cites.
On the global convergence rates of softmax policy gradient methods
Mei, J., Xiao, C., Szepesvari, C., & Schuurmans, D. 2020a · 2005
Earlier work this paper cites.
On the Global Convergence Rates of Softmax Policy Gradient Methods
Mei, Jincheng, Xiao, Chenjun, Szepesvari, Csaba, & Schuurmans, Dale. 2020b · 2005
Earlier work this paper cites.
Sensitivity and convergence of uniformly ergodic Markov chains
Mitrophanov, A. Y. 2005 · 2005
Earlier work this paper cites.
A note on the linear convergence of policy gradient methods
Bhandari, Jalaj, & Russo, Daniel. 2020 · 2007
Cited alongside, same era.
Fast global convergence of natural policy gradient methods with entropy regularization
Cen, Shicong, Cheng, Chen, Chen, Yuxin, Wei, Yuting, & Chi, Yuejie. 2020 · 2007
Cited alongside, same era.
Relative entropy policy search
Peters, Jan, Mulling, Katharina, & Altun, Yasemin. 2010 · 2010
Cited alongside, same era.
A Primal Approach to Constrained Policy Optimization: Global Optimality and Finite-Time Analysis
Xu, Tengyu, Liang, Yingbin, & Lan, Guanghui. 2020b · 2011
Cited alongside, same era.
A comprehensive survey on safe reinforcement learning
Garcıa, Javier, & Fernández, Fernando. 2015 · 2015
Cited alongside, same era.
Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor
Haarnoja, Tuomas, Zhou, Aurick, Abbeel, Pieter, & Levine, Sergey. 2018 · 2018
Later among the works it cites.
Reinforcement Learning: An Introduction, Second Edition
Sutton, Richard S., & Barto, Andrew G. 2018 · 2018
Later among the works it cites.
Reward constrained policy optimization
Tessler, Chen, Mankowitz, Daniel J, & Mannor, Shie. 2018 · 2018
Later among the works it cites.
Provably efficient maximum entropy exploration
Hazan, Elad, Kakade, Sham, Singh, Karan, & Van Soest, Abby. 2019 · 2019
Later among the works it cites.
Lower complexity bounds of first-order methods for convex-concave bilinear saddle-point problems
Ouyang, Yuyuan, & Xu, Yangyang. 2019 · 2019
Later among the works it cites.
Maximum Entropy Monte-Carlo Planning
Xiao, Chenjun, Huang, Ruitong, Mei, Jincheng, Schuurmans, Dale, & Müller, Martin. 2019 · 2019
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…
Chance-constrained dynamic programming with application to risk-aware robotic space exploration
Ono, Masahiro, Pavone, Marco, Kuwata, Yoshiaki, & Balaram, J. 2015 · 2015
Cited alongside, same era.
Trust region policy optimization
Schulman, John, Levine, Sergey, Abbeel, Pieter, Jordan, Michael, & Moritz, Philipp. 2015 · 2015
Cited alongside, same era.
Benchmarking deep reinforcement learning for continuous control
Duan, Yan, Chen, Xi, Houthooft, Rein, Schulman, John, & Abbeel, Pieter. 2016 · 2016
Cited alongside, same era.
Constrained policy optimization
Achiam, Joshua, Held, David, Tamar, Aviv, & Abbeel, Pieter. 2017 · 2017
Cited alongside, same era.
Risk-constrained reinforcement learning with percentile risk criteria
Chow, Yinlam, Ghavamzadeh, Mohammad, Janson, Lucas, & Pavone, Marco. 2017 · 2017
Cited alongside, same era.
Markov Chains and Mixing Times
Levin, David A, & Peres, Yuval. 2017 · 2017
Cited alongside, same era.
Bridging the gap between value and policy based reinforcement learning
Nachum, Ofir, Norouzi, Mohammad, Xu, Kelvin, & Schuurmans, Dale. 2017 · 2017
Cited alongside, same era.
Later among the works it cites.
Projection-based constrained policy optimization
Yang, Tsung-Yen, Rosca, Justinian, Narasimhan, Karthik, & Ramadge, Peter J. 2019 · 2019
Later among the works it cites.
Convergent policy optimization for safe reinforcement learning
Yu, Ming, Yang, Zhuoran, Kolar, Mladen, & Wang, Zhaoran. 2019 · 2019
Later among the works it cites.
Finite-sample analysis for SARSA with linear function approximation
Zou, Shaofeng, Xu, Tengyu, & Liang, Yingbin. 2019 · 2019
Later among the works it cites.
Optimality and Approximation with Policy Gradient Methods in Markov Decision Processes
Agarwal, Alekh, Kakade, Sham M, Lee, Jason D, & Mahajan, Gaurav. 2020 · 2020
Later among the works it cites.
First-order and Stochastic Optimization Methods for Machine Learning
Lan, Guanghui. 2020 · 2020
Later among the works it cites.
Adaptive trust region policy optimization: Global convergence and faster rates for regularized MDPs
Shani, Lior, Efroni, Yonathan, & Mannor, Shie. 2020 · 2020
Later among the works it cites.
Responsive safety in reinforcement learning by PID Lagrangian methods
Stooke, Adam, Achiam, Joshua, & Abbeel, Pieter. 2020 · 2020
Later among the works it cites.
Ghost penalties in nonconvex constrained optimization: Diminishing stepsizes and iteration complexity
Facchinei, Francisco, Kungurtsev, Vyacheslav, Lampariello, Lorenzo, & Scutari, Gesualdo. 2021 · 2021
Closest in time.
Lan, G. 2021 · 2021
Closest in time.
Constrained MDPs and the reward hypothesis
Szepesvári, Csaba. 2020 · 2021
Closest in time.