Modeling interaction via the principle of maximum causal entropy
B. D. Ziebart, J. A. Bagnell, and A. K. Dey · 2010
Cited alongside, same era.
Nonlinear inverse reinforcement learning with gaussian processes
S. Levine, Z. Popovic, and V. Koltun · 2011
Cited alongside, same era.
On the empirical estimation of integral probability metrics
B. K. Sriperumbudur, K. Fukumizu, A. Gretton, B. Schölkopf, G. R. Lanckriet, et al · 2012
Cited alongside, same era.
Sinkhorn distances: Lightspeed computation of optimal transport
M. Cuturi · 2013
Cited alongside, same era.
Teaching mobile robots to cooperatively navigate in populated environments
M. Kuderer, H. Kretzschmar, and W. Burgard · 2013
Cited alongside, same era.
Generative adversarial nets
I. J. Goodfellow, J. Pouget-Abadie, M. Mirza, B. Xu, D. Warde-Farley, S. Ozair, A. Courville, and Y. Bengio · 2014
Cited alongside, same era.
Adam: A method for stochastic optimization
D. Kingma and J. Ba · 2014
Cited alongside, same era.
Trust region policy optimization
J. Schulman, S. Levine, P. Abbeel, M. Jordan, and P. Moritz · 2015
Cited alongside, same era.
Openai gym, 2016
Original
G. Brockman, V. Cheung, L. Pettersson, J. Schneider, J. Schulman, J. Tang, and W. Zaremba · 2016
Cited alongside, same era.
Guided cost learning: Deep inverse optimal control via policy optimization
C. Finn, S. Levine, and P. Abbeel · 2016
Cited alongside, same era.
Stochastic optimization for large-scale optimal transport
A. Genevay, M. Cuturi, G. Peyré, and F. Bach · 2016
Cited alongside, same era.
Generative adversarial imitation learning
J. Ho and S. Ermon · 2016
Cited alongside, same era.