Libratus: The Superhuman AI for No-Limit Poker
Noam Brown, Tuomas Sandholm, and Strategic Machine · 2017
Cited alongside, same era.
Feature-based q-learning for two-player stochastic games
Original
Zeyu Jia, Lin F Yang, and Mengdi Wang · 2019
Cited alongside, same era.
Alphastar: Mastering the real-time strategy game starcraft ii
Oriol Vinyals, Igor Babuschkin, Junyoung Chung, Michael Mathieu, Max Jaderberg, Wojciech M Czarnecki, Andrew Dudzik, Aja Huang, Petko Georgiev, Richard Powell, and others · 2019
Cited alongside, same era.
Off-policy exploitability-evaluation in two-player zero-sum markov games
Original
Kenshi Abe and Yusuke Kaneko · 2020
Cited alongside, same era.
Provable self-play algorithms for competitive reinforcement learning
Yu Bai and Chi Jin · 2020
Cited alongside, same era.
Near-optimal reinforcement learning with self-play
Original
Yu Bai, Chi Jin, and Tiancheng Yu · 2020
Cited alongside, same era.
Minimax sample complexity for turn-based stochastic game
Original
Qiwen Cui and Lin F Yang · 2020
Cited alongside, same era.
Solving discounted stochastic two-player games with near-optimal time and sample complexity
Aaron Sidford, Mengdi Wang, Lin Yang, and Yinyu Ye · 2020
Cited alongside, same era.
Model-based multi-agent rl in zero-sum markov games with near-optimal sample complexity
Original
Kaiqing Zhang, Sham M Kakade, Tamer Başar, and Lin F Yang · 2020
Cited alongside, same era.
Offline decentralized multi-agent reinforcement learning
Original
Jiechuan Jiang and Zongqing Lu · 2021
Cited alongside, same era.
Breaking the sample complexity barrier to regret-optimal model-free reinforcement learning
Gen Li, Laixi Shi, Yuxin Chen, Yuantao Gu, and Yuejie Chi · 2021
Cited alongside, same era.
V-learning–a simple, efficient, decentralized algorithm for multiagent rl
Original
Chi Jin, Qinghua Liu, Yuanhao Wang, and Tiancheng Yu
Cited in the paper.