The theory of market economy
H. Van Stackelberg · 1952
Earlier work this paper cites.
Mathematical programs with optimization problems in the constraints
Jerome Bracken and James T. McGill · 1973
Earlier work this paper cites.
Technical note—the equivalence of two mathematical programs with optimization problems in the constraints
Jerome Bracken, James E. Falk, and James T. McGill · 1974
Earlier work this paper cites.
Learning to predict by the methods of temporal differences
Richard S Sutton · 1988
Earlier work this paper cites.
Double penalty method for bilevel optimization problems
Y. Ishizuka and E. Aiyoshi · 1992
Earlier work this paper cites.
A penalty function approach for solving bi-level linear programs
D. J. White and G. Anandalingam · 1993
Earlier work this paper cites.
Descent approaches for quadratic bilevel programming
L. Vicente, G. Savard, and J. Judice · 1994
Earlier work this paper cites.
On bilevel programming, part I: General nonlinear cases
James E. Falk and Jiming Liu · 1995
Earlier work this paper cites.
Mathematical Programs with Equilibrium Constraints
Zhi-Quan Luo, Jong-Shi Pang, and Daniel Ralph · 1996
Earlier work this paper cites.
Stochastic approximation with two time scales
Vivek S Borkar · 1997
Earlier work this paper cites.
Actor-critic algorithms
Vijay R Konda and John N Tsitsiklis · 2000
Earlier work this paper cites.
Approximately optimal approximate reinforcement learning
Sham Kakade and John Langford · 2002
Earlier work this paper cites.
A natural policy gradient
Sham M Kakade · 2002
Earlier work this paper cites.
Convergence rate of linear two-time-scale stochastic approximation
Vijay R Konda, John N Tsitsiklis, et al · 2004
Earlier work this paper cites.
Convergence rate and averaging of nonlinear two-time-scale stochastic approximation algorithms
Abdelkader Mokkadem, Mariane Pelletier, et al · 2006
Earlier work this paper cites.
An overview of bilevel optimization
Benoît Colson, Patrice Marcotte, and Gilles Savard · 2007
Earlier work this paper cites.
Learning near-optimal policies with bellman-residual minimization based fitted policy iteration and a single sample path
András Antos, Csaba Szepesvári, and Rémi Munos · 2008
Earlier work this paper cites.
Incremental natural actor-critic algorithms
Shalabh Bhatnagar, Mohammad Ghavamzadeh, Mark Lee, and Richard S Sutton · 2008
Earlier work this paper cites.
Finite-time bounds for fitted value iteration
Rémi Munos and Csaba Szepesvári · 2008
Earlier work this paper cites.
Natural actor-critic
Jan Peters and Stefan Schaal · 2008
Earlier work this paper cites.
Convergent temporal-difference learning with arbitrary smooth function approximation
Shalabh Bhatnagar, Doina Precup, David Silver, Richard S Sutton, Hamid R Maei, and Csaba Szepesvári · 2009
Earlier work this paper cites.