Fetching the paper…
Reading the bibliography…
In cooperative multi-agent reinforcement learning (MARL), how to design a suitable reward signal to accelerate learning and stabilize convergence is a critical problem.
Learning multi-agent communication under limited-bandwidth restriction for internet packet routing
Hangyu Mao, Zhibo Gong, Zhengchao Zhang, Zhen Xiao, and Yan Ni · 1903
Earlier work this paper cites.
Self-improving reactive agents based on reinforcement learning, planning and teaching
Long-H Lin · 1992
Earlier work this paper cites.
Packet routing in dynamically changing networks: A reinforcement learning approach
Justin A Boyan and Michael L Littman · 1994
Earlier work this paper cites.
Learning to behave socially
Maja J Mataric · 1994
Earlier work this paper cites.
Predictive q-routing: A memory-based reinforcement learning approach to adaptive traffic control
Samuel PM Choi and Dit-Yan Yeung · 1996
Earlier work this paper cites.
Average reward reinforcement learning: foundations, algorithms, and empirical results
Sridhar Mahadevan · 1996
Earlier work this paper cites.
Ants and reinforcement learning: A case study in routing in dynamic networks
Devika Subramanian, Peter Druschel, and Johnny Chen · 1997
Earlier work this paper cites.
Reinforcement learning: An introduction , volume 1
Richard S Sutton and Andrew G Barto · 1998
Earlier work this paper cites.
Using collective intelligence to route internet traffic
David Wolpert, Kagan Tumer, and Jeremy Frank · 1999
Earlier work this paper cites.
Call admission control and routing in integrated services networks using neuro-dynamic programming
Peter Marbach, Oliver Mihatsch, and John N Tsitsiklis · 2000
Earlier work this paper cites.
Algorithms for inverse reinforcement learning
Andrew Y. Ng and Stuart J. Russell · 2000
Earlier work this paper cites.
Multi-agent learning in mobilized ad-hoc networks
Yu-Han Chang, Tracey Ho, and L Kaelbling · 2004
Earlier work this paper cites.
Multi-agent learning for routing control within an internet environment
PRJ Tillotson, QH Wu, and PM Hughes · 2004
Earlier work this paper cites.
Multi-agent reward analysis for learning in noisy domains
Adrian Agogino and Kagan Turner · 2005
Cited alongside, same era.
Intrinsically motivated reinforcement learning
Nuttapong Chentanez, Andrew G Barto, and Satinder P Singh · 2005
Cited alongside, same era.
Walking the tightrope: Responsive yet stable traffic engineering
Srikanth Kandula, Dina Katabi, Bruce Davie, and Anna Charny · 2005
Cited alongside, same era.
Cooperative multi-agent learning: The state of the art
Liviu Panait and Sean Luke · 2005
Cited alongside, same era.
Distributed agent-based air traffic flow management
Kagan Tumer and Adrian Agogino · 2007
Cited alongside, same era.
Artificial Intelligence: A Modern Approach, 3rd Edition
S. Russell and P. Norvig · 2010
Cited alongside, same era.
Deep reinforcement learning for dialogue generation
Jiwei Li, Will Monroe, Alan Ritter, Michel Galley, Jianfeng Gao, and Dan Jurafsky · 2016
Later among the works it cites.
Intrinsically motivated reinforcement learning: A promising framework for procedural content generation
Noor Shaker · 2016
Later among the works it cites.
Mastering the game of go with deep neural networks and tree search
David Silver, Aja Huang, Chris J. Maddison, Arthur Guez, Laurent Sifre, George Van Den Driessche, Julian Schrittwieser, Ioannis Antonoglou, Veda Panneershelvam, and Marc Lanctot · 2016
Later among the works it cites.
Training agent for first-person shooter game with actor-critic curriculum learning
Yuxin Wu and Yuandong Tian · 2016
Later among the works it cites.
A distributional perspective on reinforcement learning
Marc G Bellemare, Will Dabney, and Rémi Munos · 2017
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…
Tcp ex machina: Computer-generated congestion control
Keith Winstein and Hari Balakrishnan · 2013
Cited alongside, same era.
An overview of evolutionary algorithms in multiobjective optimization
Carlos M. Fonseca and Peter J. Fleming · 2014
Cited alongside, same era.
Pcc: Re-architecting congestion control for consistent high performance
Mo Dong, Qingxi Li, Doron Zarchy, Philip Brighten Godfrey, and Michael Schapira · 2015
Cited alongside, same era.
Deep reinforcement learning in parameterized action space
Matthew Hausknecht and Peter Stone · 2015
Cited alongside, same era.
Multiagent cooperation and competition with deep reinforcement learning
Ardi Tampuu, Tambet Matiisen, Dorian Kodelja, Ilya Kuzovkin, Kristjan Korjus, Juhan Aru, Jaan Aru, and Raul Vicente · 2015
Cited alongside, same era.
Vime: Variational information maximizing exploration
Rein Houthooft, Xi Chen, Xi Chen, Yan Duan, John Schulman, Filip De Turck, and Pieter Abbeel · 2016
Cited alongside, same era.
Later among the works it cites.
Reinforcement mechanism design for e-commerce
Qingpeng Cai, Aris Filos-Ratsikas, Pingzhong Tang, and Yiwei Zhang · 2017
Later among the works it cites.
Multi-agent q-learning for minimizing demand-supply power deficit in microgrids
Raghuram Bharadwaj Diddigi, D Reddy, and Shalabh Bhatnagar · 2017
Later among the works it cites.
Counterfactual multi-agent policy gradients
Jakob Foerster, Gregory Farquhar, Triantafyllos Afouras, Nantas Nardelli, and Shimon Whiteson · 2017
Later among the works it cites.
A policy search method for temporal logic specified reinforcement learning tasks
Xiao Li, Yao Ma, and Calin Belta · 2017
Later among the works it cites.
Hangyu Mao, Yan Ni, Zhibo Gong, and Zhen Xiao · 2017
Later among the works it cites.
Analysing congestion problems in multi-agent reinforcement learning
Roxana Rădulescu, Peter Vrancx, and Ann Nowé · 2017
Later among the works it cites.
Value-decomposition networks for cooperative multi-agent learning
Peter Sunehag, Guy Lever, Audrunas Gruslys, Wojciech Marian Czarnecki, Vinicius Zambaldi, Max Jaderberg, Marc Lanctot, Nicolas Sonnerat, Joel Z Leibo, Karl Tuyls, et al · 2017
Later among the works it cites.
Hybrid reward architecture for reinforcement learning
Harm van Seijen, Mehdi Fatemi, Joshua Romoff, Romain Laroche, Tavian Barnes, and Jeffrey Tsang · 2017
Later among the works it cites.