Continuous action reinforcement learning for control-affine systems with unknown dynamics
Faust, A., Ruymgaart, P., Salman, M., Fierro, R., and Tapia, L · 2014
Cited alongside, same era.
Continuous control with deep reinforcement learning
Original
Lillicrap, T., Hunt, J., Pritzel, A., Heess, N., Erez, T., Tassa, Y., Silver, D., and Wierstra, D · 2015
Cited alongside, same era.
Human-level control through deep reinforcement learning
Mnih, V., Kavukcuoglu, K., Silver, D., Rusu, A., Veness, J., Bellemare, M., Graves, A., Riedmiller, M., Fidjeland, A., Ostrovski, G., Petersen, S., Beattie, C., Sadik, A., Antonoglou, I., King, H., Kumaran, D., Wierstra, D., Legg, S., and Hassabis, D · 2015
Cited alongside, same era.
Prioritized experience replay
Original
Schaul, T., Quan, J., Antonoglou, I., and Silver, D · 2015
Cited alongside, same era.
End-to-end training of deep visuo-motor policies
Levine, S., Finn, C., Darrell, T., and Abbeel, P · 2016
Cited alongside, same era.
Continuous control with deep reinforcement learning
Lillicrap, T., Hunt, J., Pritzel, A., Heess, N., Erez, T., Tassa, Y., Silver, D., and Wierstra, D · 2016
Cited alongside, same era.
Fetch & freight: Standard platforms for service robot applications
Melonee Wise, Michael Ferguson, D. K. E. D. and Dymesich, D · 2016
Cited alongside, same era.
Mastering the game of Go with deep neural networks and tree search
Silver, D., Huang, A., Maddison, C., Guez, A., Sifre, L., van den Driessche, G., Schrittwieser, J., Antonoglou, I., Panneershelvam, V., Lanctot, M., Dieleman, S., Grewe, D., Nham, J., Kalchbrenner, N., Sutskever, I., Lillicrap, T., Leach, M., Kavukcuoglu, K., Graepel, T., and Hassabis, D · 2016
Cited alongside, same era.
Constrained policy optimization
Original
Achiam, J., Held, D., Tamar, A., and Abbeel, P · 2017
Cited alongside, same era.
Optnet: Differentiable optimization as a layer in neural networks
Original
Amos, B. and Kolter, Z · 2017
Cited alongside, same era.
Trust region policy optimization
Schulman, J., Levine, S., Moritz, P., Jordan, M., and Abbeel, P
Cited in the paper.
High-dimensional continuous control using generalized advantage estimation
Original
Schulman, J., Moritz, P., Levine, S., Jordan, M., and Abbeel, P
Cited in the paper.