Fetching the paper…
Reading the bibliography…
Deep Reinforcement Learning (RL) is successful in solving many complex Markov Decision Processes (MDPs) problems.
Christopher JCH Watkins and Peter Dayan · 1992
Earlier work this paper cites.
Learning to achieve goals
Leslie Pack Kaelbling · 1993
Earlier work this paper cites.
Reinforcement learning with augmented data
Michael Laskin, Kimin Lee, Adam Stooke, Lerrel Pinto, Pieter Abbeel, and Aravind Srinivas · 2004
Earlier work this paper cites.
Learning invariant representations for reinforcement learning without reconstruction
Amy Zhang, Rowan McAllister, Roberto Calandra, Yarin Gal, and Sergey Levine · 2006
Earlier work this paper cites.
A kernel method for the two-sample problem
Arthur Gretton, Karsten M Borgwardt, Malte J Rasch, Bernhard Schölkopf, and Alexander Smola · 2008
Earlier work this paper cites.
A theory of learning from different domains
Shai Ben-David, John Blitzer, Koby Crammer, Alex Kulesza, Fernando Pereira, and Jennifer Wortman Vaughan · 2010
Earlier work this paper cites.
Bisimulation metrics for continuous markov decision processes
Norm Ferns, Prakash Panangaden, and Doina Precup · 2011
Earlier work this paper cites.
World model as a graph: Learning latent landmarks for planning
Lunjun Zhang, Ge Yang, and Bradly C Stadie · 2011
Earlier work this paper cites.
Human-level control through deep reinforcement learning
Volodymyr Mnih, Koray Kavukcuoglu, David Silver, Andrei A Rusu, Joel Veness, Marc Bellemare, Alex Graves, Martin Riedmiller, Andreas Fidjeland, Georg strovski, Stig Petersen, Charles Beattie, Amir Sadik, Ioannis Antonoglou, Helen King, Dharshan umaran, Daan Wierstra, Shane Legg, and Demis Hassabis · 2015
Earlier work this paper cites.
Universal value function approximators
Tom Schaul, Daniel Horgan, Karol Gregor, and David Silver · 2015
Earlier work this paper cites.
Fastmmd: Ensemble of circular discrepancy for efficient two-sample test
Ji Zhao and Deyu Meng · 2015
Earlier work this paper cites.
Trust region policy optimization
John Schulman, Sergey Levine, Pieter Abbeel, Michael Jordan, and Philipp Moritz · 2015
Earlier work this paper cites.
Openai gym, 2016
Brockman Greg, Cheung Vicki, Pettersson Ludwig, Schneider Jonas, Schulman John, Tang Jie, and Zaremba Wojciech · 2016
Earlier work this paper cites.
The variational fair autoencoder
Christos Louizos, Kevin Swersky, Yujia Li, Max Welling, and Richard S Zemel · 2016
Earlier work this paper cites.
Mastering the game of go without human knowledge
David Silver, Julian Schrittwieser, Karen Simonyan, Aj Antonoglou, Ioannis abd Huang, Arthur Guez, Thomas Hubert, Lucas Baker, Matthew Lai, Adrian Bolton, Yutian Chen, Timothy Lillicrap, Fan Hui, Laurent Sifre, George van den Driessche, Thore Graepel, and Demis Hassabis · 2017
Earlier work this paper cites.
Hindsight experience replay
Andrychowicz Marcin, Wolski Filip, Ray Alex, Schneider Jonas, Fong Rachel, Welinder Peter, McGrew Bob, Tobin Josh, Abbeel Pieter, and Zaremba Wojciech · 2017
Earlier work this paper cites.
Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor
Tuomas Haarnoja, Aurick Zhou, Pieter Abbeel, and Sergey Levine · 2018
Earlier work this paper cites.
Assessing generalization in deep reinforcement learning
Charles Packer, Katelyn Gao, Jernej Kos, Philipp Krähenbühl, Vladlen Koltun, and Dawn Song · 2018
Earlier work this paper cites.
Unsupervised learning of goal spaces for intrinsically motivated goal exploration
Alexandre Péré, Sébastien Forestier, Olivier Sigaud, and Pierre-Yves Oudeyer · 2018
Cited alongside, same era.
multiworld
Vitchyr Pong, Murtaza Dalal, Steven Lin, and Ashvin Nair · 2018
Cited alongside, same era.
Deep domain generalization via conditional invariant adversarial networks
Ya Li, Xinmei Tian, Mingming Gong, Yajing Liu, Tongliang Liu, Kun Zhang, and Dacheng Tao · 2018
Cited alongside, same era.
Addressing function approximation error in actor-critic methods
Scott Fujimoto, Herke Hoof, and David Meger · 2018
Cited alongside, same era.
Visual reinforcement learning with imagined goals
Ashvin Nair, Vitchyr Pong, Murtaza Dalal, Shikhar Bahl, Steven Lin, and Sergey Levine · 2018
Cited alongside, same era.
Automatic goal generation for reinforcement learning agents
Carlos Florensa, David Held, Xinyang Geng, and Pieter Abbeel · 2018
Planning from pixels using inverse dynamics models
Keiran Paster, Sheila A McIlraith, and Jimmy Ba · 2020
Later among the works it cites.
Skew-fit: State-covering self-supervised reinforcement learning
Vitchyr Pong, Murtaza Dalal, Steven Lin, Ashvin Nair, Shikhar Bahl, and Sergey Levine · 2020
Later among the works it cites.
Wilds: A benchmark of in-the-wild distribution shifts
Pang Wei Koh, Shiori Sagawa, Henrik Marklund, Sang Michael Xie, Marvin Zhang, Akshay Balsubramani, Weihua Hu, Michihiro Yasunaga, Richard Lanas Phillips, Sara Beery, et al · 2020
Later among the works it cites.
Feature alignment and restoration for domain generalization and adaptation
Xin Jin, Cuiling Lan, Wenjun Zeng, and Zhibo Chen · 2020
Later among the works it cites.
A simple framework for contrastive learning of visual representations
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…
Cited alongside, same era.
Near-optimal representation learning for hierarchical reinforcement learning
Ofir Nachum, Shixiang Gu, Honglak Lee, and Sergey Levine · 2018
Cited alongside, same era.
Provably efficient RL with rich observations via latent state decoding
Simon Du, Akshay Krishnamurthy, Nan Jiang, Alekh Agarwal, Miroslav Dudik, and John Langford · 2019
Cited alongside, same era.
Martin Arjovsky, Léon Bottou, Ishaan Gulrajani, and David Lopez-Paz · 2019
Cited alongside, same era.
Generalizing to unseen domains via distribution matching
Isabela Albuquerque, João Monteiro, Mohammad Darvishi, Tiago H Falk, and Ioannis Mitliagkas · 2019
Cited alongside, same era.
Transferable adversarial training: A general approach to adapting deep classifiers
Hong Liu, Mingsheng Long, Jianmin Wang, and Michael Jordan · 2019
Cited alongside, same era.
Adversarial invariant feature learning with accuracy constraint for domain generalization
Kei Akuzawa, Yusuke Iwasawa, and Yutaka Matsuo · 2019
Cited alongside, same era.
Ting Chen, Simon Kornblith, Mohammad Norouzi, and Geoffrey Hinton · 2020
Later among the works it cites.
Roll: Visual self-supervised reinforcement learning with object reasoning
Yufei Wang, Gautham Narayan Narasimhan, Xingyu Lin, Brian Okorn, and David Held · 2020
Later among the works it cites.
Weakly-supervised reinforcement learning for controllable behavior
Lisa Lee, Benjamin Eysenbach, Ruslan Salakhutdinov, Chelsea Finn, et al · 2020
Later among the works it cites.
Maximum entropy gain exploration for long horizon multi-goal reinforcement learning
Silviu Pitis, Harris Chan, Stephen Zhao, Bradly Stadie, and Jimmy Ba · 2020
Later among the works it cites.
Goal-aware prediction: Learning to model what matters
Suraj Nair, Silvio Savarese, and Chelsea Finn · 2020
Later among the works it cites.
Data-efficient hierarchical reinforcement learning for robotic assembly control applications
Zhimin Hou, Jiajun Fei, Yuelin Deng, and Jing Xu · 2020
Later among the works it cites.
Image augmentation is all you need: Regularizing deep reinforcement learning from pixels
Ilya Kostrikov, Denis Yarats, and Rob Fergus · 2020
Later among the works it cites.
Self-supervised policy adaptation during deployment
Nicklas Hansen, Yu Sun, Pieter Abbeel, Alexei A Efros, Lerrel Pinto, and Xiaolong Wang · 2020
Later among the works it cites.
A geometric perspective on self-supervised policy adaptation
Cristian Bodnar, Karol Hausman, Gabriel Dulac-Arnold, and Rico Jonschkowski · 2020
Later among the works it cites.
Domain adversarial neural networks for domain generalization: When it works and how to improve
Anthony Sicilia, Xingchen Zhao, and Seong Jae Hwang · 2021
Closest in time.
Total variation distance of probability measures — Wikipedia, the free encyclopedia
Wikipedia · 2021
Closest in time.
The distracting control suite–a challenging benchmark for reinforcement learning from pixels
Austin Stone, Oscar Ramirez, Kurt Konolige, and Rico Jonschkowski · 2021
Closest in time.
Contrastive behavioral similarity embeddings for generalization in reinforcement learning
Rishabh Agarwal, Marlos C Machado, Pablo Samuel Castro, and Marc G Bellemare · 2021
Closest in time.