Estimating or propagating gradients through stochastic neurons for conditional computation
Original
Bengio, Yoshua, Léonard, Nicholas, and Courville, Aaron · 2013
Cited alongside, same era.
Adam: A method for stochastic optimization
Original
Kingma, Diederik and Ba, Jimmy · 2014
Cited alongside, same era.
Deterministic policy gradient algorithms
Silver, David, Lever, Guy, Heess, Nicolas, Degris, Thomas, Wierstra, Daan, and Riedmiller, Martin · 2014
Cited alongside, same era.
Batch normalization: Accelerating deep network training by reducing internal covariate shift
Ioffe, Sergey and Szegedy, Christian · 2015
Cited alongside, same era.
Continuous control with deep reinforcement learning
Original
Lillicrap, Timothy P, Hunt, Jonathan J, Pritzel, Alexander, Heess, Nicolas, Erez, Tom, Tassa, Yuval, Silver, David, and Wierstra, Daan · 2015
Cited alongside, same era.
Human-level control through deep reinforcement learning
Mnih, Volodymyr, Kavukcuoglu, Koray, Silver, David, Rusu, Andrei A, Veness, Joel, Bellemare, Marc G, Graves, Alex, Riedmiller, Martin, Fidjeland, Andreas K, Ostrovski, Georg, et al · 2015
Cited alongside, same era.
Prioritized experience replay
Original
Schaul, Tom, Quan, John, Antonoglou, Ioannis, and Silver, David · 2015
Cited alongside, same era.
Discriminative embeddings of latent variable models for structured data
Dai, Hanjun, Dai, Bo, and Song, Le · 2016
Cited alongside, same era.
Categorical reparameterization with gumbel-softmax
Original
Jang, Eric, Gu, Shixiang, and Poole, Ben · 2016
Cited alongside, same era.
Optimization by GRASP
Resende, Mauricio G.C. and Ribeiro, Celso C · 2016
Cited alongside, same era.
Neural combinatorial optimization with reinforcement learning
Bello, Irwan, Pham, Hieu, Le, Quoc V, Norouzi, Mohammad, and Bengio, Samy · 2017
Cited alongside, same era.
Online multi-target tracking using recurrent neural networks
Milan, Anton, Rezatofighi, Seyed Hamid, Dick, Anthony R, Reid, Ian D, and Schindler, Konrad
Cited in the paper.