A comprehensive survey on safe reinforcement learning
Javier García and Fernando Fernández · 2015
Cited alongside, same era.
Variational information maximisation for intrinsically motivated reinforcement learning
Shakir Mohamed and Danilo J. Rezende · 2015
Cited alongside, same era.
Concrete problems in AI safety
Original
Dario Amodei, Chris Olah, Jacob Steinhardt, Paul Christiano, John Schulman, and Dan Mané · 2016
Cited alongside, same era.
Cooperative inverse reinforcement learning
Dylan Hadfield-Menell, Anca Dragan, Pieter Abbeel, and Stuart Russell · 2016
Cited alongside, same era.
Combating reinforcement learning’s sisyphean curse with intrinsic fear
Original
Zachary C. Lipton, Jianfeng Gao, Lihong Li, Jianshu Chen, and Li Deng · 2016
Cited alongside, same era.
Safely interruptible agents
Laurent Orseau and Stuart Armstrong · 2016
Cited alongside, same era.
Quantilizers: A safer alternative to maximizers for limited optimization
Jessica Taylor · 2016
Cited alongside, same era.
Alignment for advanced machine learning systems
Jessica Taylor, Eliezer Yudkowsky, Patrick LaVictoire, and Andrew Critch · 2016
Cited alongside, same era.
Safe exploration in finite Markov decision processes with Gaussian processes
Matteo Turchetta, Felix Berkenkamp, and Andreas Krause · 2016
Cited alongside, same era.
Low impact artificial intelligences
Original
Stuart Armstrong and Benjamin Levinstein · 2017
Cited alongside, same era.
Deep reinforcement learning from human preferences
Paul Christiano, Jan Leike, Tom B Brown, Miljan Martic, Shane Legg, and Dario Amodei · 2017
Cited alongside, same era.
Leave no Trace: Learning to reset for safe and autonomous reinforcement learning
Original
Benjamin Eysenbach, Shixiang Gu, Julian Ibarz, and Sergey Levine · 2017
Cited alongside, same era.