RL 2 : Fast Reinforcement Learning via Slow Reinforcement Learning
Original
Y. Duan, J. Schulman, X. Chen, P. L. Bartlett, I. Sutskever, and P. Abbeel · 2016
Cited alongside, same era.
Hindsight Experience Replay
M. Andrychowicz, F. Wolski, A. Ray, J. Schneider, R. Fong, P. Welinder, B. McGrew, J. Tobin, O. Pieter Abbeel, and W. Zaremba · 2017
Cited alongside, same era.
Third-person Imitation Learning
B. C. Stadie, P. Abbeel, and I. Sutskever · 2017
Cited alongside, same era.
Attention Is All You Need
A. Vaswani, N. Shazeer, N. Parmar, J. Uszkoreit, L. Jones, A. N. Gomez, Ł. Kaiser, and I. Polosukhin · 2017
Cited alongside, same era.
Learning to Reinforcement Learn
J. X. Wang, Z. Kurth-Nelson, H. Soyer, J. Z. Leibo, D. Tirumala, R. Munos, C. Blundell, D. Kumaran, and M. M. Botvinick · 2017
Cited alongside, same era.
Learning to Generalize: Meta-learning for Domain Generalization
D. Li, Y. Yang, Y.-Z. Song, and T. M. Hospedales · 2018
Cited alongside, same era.
Causal Confusion in Imitation Learning
P. De Haan, D. Jayaraman, and S. Levine · 2019
Cited alongside, same era.
Language as an Abstraction for Hierarchical Deep Reinforcement Learning
Y. Jiang, S. S. Gu, K. P. Murphy, and C. Finn · 2019
Cited alongside, same era.
Reward-conditioned Policies
Original
A. Kumar, X. B. Peng, and S. Levine · 2019
Cited alongside, same era.
Reinforcement Learning Upside Down: Don’t Predict Rewards–Just Map Them to Actions
Original
J. Schmidhuber · 2019
Cited alongside, same era.
Training Agents Using Upside-down Reinforcement Learning
R. K. Srivastava, P. Shyam, F. Mutz, W. Jaśkowski, and J. Schmidhuber · 2019
Cited alongside, same era.
Self-Supervised Representation Learning
L. Weng · 2019
Cited alongside, same era.