Fetching the paper…
Reading the bibliography…
Deep reinforcement learning repeatedly succeeds in closed, well-defined domains such as games (Chess, Go, StarCraft).
An algebraic approach to abstraction in reinforcement learning
Balaraman Ravindran · 2004
Earlier work this paper cites.
Approximate homomorphisms: A framework for non-exact minimization in Markov decision processes
Balaraman Ravindran and Andrew G Barto · 2004
Earlier work this paper cites.
Planning chemical syntheses with deep neural networks and symbolic AI
Marwin H S Segler, Mike Preuss, and Mark P Waller · 2018
Earlier work this paper cites.
An investigation of model-free planning
Arthur Guez, Mehdi Mirza, Karol Gregor, Rishabh Kabra, Sébastien Racanière, Théophane Weber, David Raposo, Adam Santoro, Laurent Orseau, Tom Eccles, Greg Wayne, David Silver, and Timothy Lillicrap · 2019
Earlier work this paper cites.
Grandmaster level in StarCraft II using multi-agent reinforcement learning
Oriol Vinyals, Igor Babuschkin, Wojciech M Czarnecki, Michaël Mathieu, Andrew Dudzik, Junyoung Chung, David H Choi, Richard Powell, Timo Ewalds, Petko Georgiev, et al · 2019
Earlier work this paper cites.
Leveraging procedural generation to benchmark reinforcement learning
Karl Cobbe, Chris Hesse, Jacob Hilton, and John Schulman · 2020
Earlier work this paper cites.
On the role of planning in model-based deep reinforcement learning
Jessica B Hamrick, Abram L Friesen, Feryal Behbahani, Arthur Guez, Fabio Viola, Sims Witherspoon, Thomas Anthony, Lars Buesing, Petar Veličković, and Théophane Weber · 2020
Earlier work this paper cites.
Mastering Atari, Go, chess and shogi by planning with a learned model
Julian Schrittwieser, Ioannis Antonoglou, Thomas Hubert, Karen Simonyan, Laurent Sifre, Simon Schmitt, Arthur Guez, Edward Lockhart, Demis Hassabis, Thore Graepel, Timothy Lillicrap, and David Silver · 2020
Cited alongside, same era.
MDP homomorphic networks: Group symmetries in reinforcement learning
Elise van der Pol, Daniel Worrall, Herke van Hoof, Frans Oliehoek, and Max Welling · 2020
Cited alongside, same era.
Planning in stochastic environments with a learned model
Ioannis Antonoglou, Julian Schrittwieser, Sherjil Ozair, Thomas K Hubert, and David Silver · 2021
Cited alongside, same era.
Geometric deep learning: Grids, groups, graphs, geodesics, and gauges
Michael M Bronstein, Joan Bruna, Taco Cohen, and Petar Veličković · 2021
Cited alongside, same era.
How to train your robot with deep reinforcement learning: lessons we have learned
Julian Ibarz, Jie Tan, Chelsea Finn, Mrinal Kalakrishnan, Peter Pastor, and Sergey Levine · 2021
Cited alongside, same era.
Discovering faster matrix multiplication algorithms with reinforcement learning
Alhussein Fawzi, Matej Balog, Aja Huang, Thomas Hubert, Bernardino Romera-Paredes, Mohammadamin Barekatain, Alexander Novikov, Francisco J R Ruiz, Julian Schrittwieser, Grzegorz Swirszcz, David Silver, Demis Hassabis, and Pushmeet Kohli · 2022
Later among the works it cites.
MuZero with self-competition for rate control in VP9 video compression
Amol Mandhane, Anton Zhernov, Maribeth Rauh, Chenjie Gu, Miaosen Wang, Flora Xue, Wendy Shang, Derek Pang, Rene Claus, Ching-Han Chiang, et al · 2022
Later among the works it cites.
EqR: Equivariant representations for data-efficient reinforcement learning
Arnab Kumar Mondal, Vineet Jain, Kaleem Siddiqi, and Siamak Ravanbakhsh · 2022
Later among the works it cites.
Equivariant networks for zero-shot coordination
Darius Muglich, Christian Schroeder de Witt, Elise van der Pol, Shimon Whiteson, and Jakob Foerster · 2022
Later among the works it cites.
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…
Physics-inspired structural representations for molecules and materials
Felix Musil, Andrea Grisafi, Albert P Bartók, Christoph Ortner, Gábor Csányi, and Michele Ceriotti · 2021
Cited alongside, same era.
Multi-agent MDP homomorphic networks
Elise van der Pol, Herke van Hoof, Frans A Oliehoek, and Max Welling · 2021
Cited alongside, same era.
Jung Yeon Park, Ondrej Biza, Linfeng Zhao, Jan Willem van de Meent, and Robin Walters · 2022
Later among the works it cites.
Continuous MDP homomorphisms and homomorphic policy gradient
Sahand Rezaei-Shoshtari, Rosie Zhao, Prakash Panangaden, David Meger, and Doina Precup · 2022
Later among the works it cites.
SO ( 2 ) \mathrm{SO}(2) -equivariant reinforcement learning
Dian Wang, Robin Walters, and Robert Platt · 2022
Later among the works it cites.