Fetching the paper…
Reading the bibliography…
Measuring and promoting policy diversity is critical for solving games with strong non-transitive dynamics where strategic cycles exist, and there is no consistent winner (e.g., Rock-Paper-Scissors).
Markov games as a framework for multi-agent reinforcement learning
Michael L Littman · 1994
Earlier work this paper cites.
Behavioral diversity in learning robot teams
Tucker Balch · 1998
Earlier work this paper cites.
Crafting papers on machine learning
P. Langley · 2000
Earlier work this paper cites.
Planning in the presence of cost functions controlled by an adversary
H Brendan McMahan, Geoffrey J Gordon, and Avrim Blum · 2003
Earlier work this paper cites.
Apprenticeship learning using linear programming
Umar Syed, Michael Bowling, and Robert E Schapire · 2008
Earlier work this paper cites.
Bisimulation metrics for continuous markov decision processes
Norm Ferns, Prakash Panangaden, and Doina Precup · 2011
Earlier work this paper cites.
Determinantal point processes for machine learning
Alex Kulesza and Ben Taskar · 2012
Earlier work this paper cites.
Generative adversarial imitation learning
Jonathan Ho and Stefano Ermon · 2016
Earlier work this paper cites.
Diversity-promoting bayesian learning of latent variable models
Pengtao Xie, Jun Zhu, and Eric Xing · 2016
Earlier work this paper cites.
Learning robust rewards with adversarial inverse reinforcement learning
Justin Fu, Katie Luo, and Sergey Levine · 2017
Earlier work this paper cites.
A unified game-theoretic approach to multiagent reinforcement learning
Marc Lanctot, Vinicius Zambaldi, Audrunas Gruslys, Angeliki Lazaridou, Karl Tuyls, Julien Pérolat, David Silver, and Thore Graepel · 2017
Earlier work this paper cites.
Multiagent bidirectionally-coordinated nets for learning to play starcraft combat games
Peng Peng, Ying Wen, Quan Yuan, Yaodong Yang, Zhenkun Tang, Haitao Long, and Jun Wang · 2017
Earlier work this paper cites.
Diversity is all you need: Learning skills without a reward function
Benjamin Eysenbach, Abhishek Gupta, Julian Ibarz, and Sergey Levine · 2018
Cited alongside, same era.
Openai five
OpenAI · 2018
Cited alongside, same era.
Open-ended learning in symmetric zero-sum games
David Balduzzi, Marta Garnelo, Yoram Bachrach, Wojciech Czarnecki, Julien Perolat, Max Jaderberg, and Thore Graepel · 2019
Cited alongside, same era.
Disagreement-regularized imitation learning
Kiante Brantley, Wen Sun, and Mikael Henaff · 2019
Cited alongside, same era.
Gdpp: Learning diverse generations using determinantal point processes
Mohamed Elfeki, Camille Couprie, Morgane Riviere, and Mohamed Elhoseiny · 2019
Cited alongside, same era.
A generalized framework for self-play training
Daniel Hernandez, Kevin Denamganaï, Yuan Gao, Peter York, Sam Devlin, Spyridon Samothrakis, and James Alfred Walker · 2019
Energy-based imitation learning
Minghuan Liu, Tairan He, Minkai Xu, and Weinan Zhang · 2020
Later among the works it cites.
Pipeline psro: A scalable approach for finding approximate nash equilibria in large games
Stephen McAleer, John Lanier, Roy Fox, and Pierre Baldi · 2020
Later among the works it cites.
Effective diversity in population-based reinforcement learning
Aldo Pacchiano, Jack Parker-Holder, Krzysztof Marcin Choromanski, and Stephen Roberts · 2020
Later among the works it cites.
Effective diversity in population-based reinforcement learning
Jack Parker-Holder, Aldo Pacchiano, Krzysztof Choromanski, and Stephen Roberts · 2020
Later among the works it cites.
An overview of multi-agent reinforcement learning from game theoretical perspective
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…
Cited alongside, same era.
Diversity-inducing policy gradient: Using maximum mean discrepancy to find a set of diverse policies
Muhammad A Masood and Finale Doshi-Velez · 2019
Cited alongside, same era.
Grandmaster level in starcraft ii using multi-agent reinforcement learning
Oriol Vinyals, Igor Babuschkin, Wojciech M Czarnecki, Michaël Mathieu, Andrew Dudzik, Junyoung Chung, David H Choi, Richard Powell, Timo Ewalds, Petko Georgiev, et al · 2019
Cited alongside, same era.
Random expert distillation: Imitation learning via expert policy support estimation
Ruohan Wang, Carlo Ciliberto, Pierluigi Vito Amadori, and Yiannis Demiris · 2019
Cited alongside, same era.
Real world games look like spinning tops
Wojciech Marian Czarnecki, Gauthier Gidel, Brendan Tracey, Karl Tuyls, Shayegan Omidshafiei, David Balduzzi, and Max Jaderberg · 2020
Cited alongside, same era.
A divergence minimization perspective on imitation learning methods
Seyed Kamyar Seyed Ghasemipour, Richard Zemel, and Shixiang Gu · 2020
Cited alongside, same era.
Google research football: A novel reinforcement learning environment
Karol Kurach, Anton Raichuk, Piotr Stańczyk, Michał Zając, Olivier Bachem, Lasse Espeholt, Carlos Riquelme, Damien Vincent, Marcin Michalski, Olivier Bousquet, et al · 2020
Cited alongside, same era.
Yaodong Yang and Jun Wang · 2020
Later among the works it cites.
Multi-agent determinantal q-learning
Yaodong Yang, Ying Wen, Jun Wang, Liheng Chen, Kun Shao, David Mguni, and Weinan Zhang · 2020
Later among the works it cites.
Towards playing full moba games with deep reinforcement learning
Deheng Ye, Guibin Chen, Wen Zhang, Sheng Chen, Bo Yuan, Bo Liu, Jia Chen, Zhao Liu, Fuhao Qiu, Hongsheng Yu, et al · 2020
Later among the works it cites.
Le Cong Dinh, Yaodong Yang, Zheng Tian, Nicolas Perez Nieves, Oliver Slumbers, David Henry Mguni, Haitham Bou Ammar, and Jun Wang · 2021
Closest in time.
Quantifying environment and population diversity in multi-agent reinforcement learning
Kevin R McKee, Joel Z Leibo, Charlie Beattie, and Richard Everett · 2021
Closest in time.
Modelling behavioural diversity for learning in open-ended games
Nicolas Perez Nieves, Yaodong Yang, Oliver Slumbers, David Henry Mguni, and Jun Wang · 2021
Closest in time.
L2e: Learning to exploit your opponent
Zhe Wu, Kai Li, Enmin Zhao, Hang Xu, Meng Zhang, Haobo Fu, Bo An, and Junliang Xing · 2021
Closest in time.
Diverse auto-curriculum is critical for successful real-world multiagent learning systems
Yaodong Yang, Jun Luo, Ying Wen, Oliver Slumbers, Daniel Graves, Haitham Bou Ammar, Jun Wang, and Matthew E. Taylor · 2021
Closest in time.