Fetching the paper…
Reading the bibliography…
Reward learning techniques enable machine learning systems to learn objectives from human feedback.
Some aspects of the sequential design of experiments
Herbert Robbins · 1952
Earlier work this paper cites.
Maximum likelihood estimation of observer error-rates using the em algorithm
Alexander Philip Dawid and Allan M Skene · 1979
Earlier work this paper cites.
Learning policies for partially observable environments: Scaling up
Michael L Littman, Anthony R Cassandra, and Leslie Pack Kaelbling · 1995
Earlier work this paper cites.
Algorithms for inverse reinforcement learning
Andrew Y Ng and Stuart Russell · 2000
Earlier work this paper cites.
Modeling Purposeful Adaptive Behavior with the Principle of Maximum Causal Entropy
B D Ziebart · 2000
Earlier work this paper cites.
The complexity of decentralized control of Markov decision processes
Daniel S Bernstein, Robert Givan, Neil Immerman, and Shlomo Zilberstein · 2002
Earlier work this paper cites.
Apprenticeship learning via inverse reinforcement learning
Pieter Abbeel and Andrew Y Ng · 2004
Earlier work this paper cites.
Learning from crowds
Vikas C Raykar, Shipeng Yu, Linda H Zhao, Gerardo Hermosillo Valadez, Charles Florin, Luca Bogoni, and Linda Moy · 2010
Earlier work this paper cites.
Monte-Carlo planning in large POMDPs
David Silver and Joel Veness · 2010
Earlier work this paper cites.
Gaussian process classification and active learning with multiple annotators
Filipe Rodrigues, Francisco Pereira, and Bernardete Ribeiro · 2014
Earlier work this paper cites.
Cooperative inverse reinforcement learning
Dylan Hadfield-Menell, Stuart J Russell, Pieter Abbeel, and Anca Dragan · 2016
Earlier work this paper cites.
Deep reinforcement learning from human preferences
Paul Christiano, Jan Leike, Tom B Brown, Miljan Martic, Shane Legg, and Dario Amodei · 2017
Earlier work this paper cites.
An efficient, generalized bellman update for cooperative inverse reinforcement learning
Dhruv Malik, Malayandi Palaniappan, Jaime Fisac, Dylan Hadfield-Menell, Stuart Russell, and Anca Dragan · 2018
Earlier work this paper cites.
Online algorithms for POMDPs with continuous state, action, and observation spaces
Zachary Sunberg and Mykel Kochenderfer · 2018
Earlier work this paper cites.
Introduction to multi-armed bandits
Aleksandrs Slivkins · 2019
Cited alongside, same era.
Specification gaming: the flip side of AI ingenuity
Victoria Krakovna, Jonathan Uesato, Vladimir Mikulik, Matthew Rahtz, Tom Everitt, Ramana Kumar, Zac Kenton, Jan Leike, and Shane Legg · 2020
Cited alongside, same era.
Understanding learned reward functions
Eric J Michaud, Adam Gleave, and Stuart Russell · 2020
Cited alongside, same era.
Literal or pedagogic human? Analyzing human model misspecification in objective learning
Smitha Milli and Anca Dragan · 2020
Cited alongside, same era.
Benefits of assistance over reward learning
Rohin Shah, Pedro Freire, Neel Alex, Rachel Freedman, Dmitrii Krasheninnikov, Lawrence Chan, Michael D Dennis, Pieter Abbeel, Anca Dragan, and Stuart Russell · 2020
Cited alongside, same era.
Learning to summarize with human feedback
Training language models to follow instructions with human feedback
Long Ouyang, Jeffrey Wu, Xu Jiang, Diogo Almeida, Carroll Wainwright, Pamela Mishkin, Chong Zhang, Sandhini Agarwal, Katarina Slama, Alex Ray, et al · 2022
Later among the works it cites.
The effects of reward misspecification: Mapping and mitigating misaligned models
Alexander Pan, Kush Bhatia, and Jacob Steinhardt · 2022
Later among the works it cites.
Misspecification in inverse reinforcement learning
Joar Skalse and Alessandro Abate · 2022
Later among the works it cites.
Defining and characterizing reward hacking
Joar Skalse, Nikolaus HR Howe, Dmitrii Krasheninnikov, and David Krueger · 2022
Later among the works it cites.
Introducing Claude, 2023
Anthropic · 2023
Closest in time.
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…
Nisan Stiennon, Long Ouyang, Jeffrey Wu, Daniel Ziegler, Ryan Lowe, Chelsea Voss, Alec Radford, Dario Amodei, and Paul F Christiano · 2020
Cited alongside, same era.
The problem with metrics is a fundamental problem for AI
Rachel Thomas and David Uminsky · 2020
Cited alongside, same era.
Consequences of misaligned AI
Simon Zhuang and Dylan Hadfield-Menell · 2020
Cited alongside, same era.
Choice set misspecification in reward inference
Rachel Freedman, Rohin Shah, and Anca Dragan · 2021
Cited alongside, same era.
Validation of an at-home direct antigen rapid test for COVID-19
Alexander Harmon, Celina Chang, Nol Salcedo, Brena Sena, Bobby Brooke Herrera, Irene Bosch, and Laura E Holberger · 2021
Cited alongside, same era.
Kimin Lee, Laura Smith, and Pieter Abbeel · 2021
Cited alongside, same era.
Training a helpful and harmless assistant with reinforcement learning from human feedback
Yuntao Bai, Andy Jones, Kamal Ndousse, Amanda Askell, Anna Chen, Nova DasSarma, Dawn Drain, Stanislav Fort, Deep Ganguli, Tom Henighan, et al · 2022
Cited alongside, same era.
Active reward learning from multiple teachers
Peter Barnett, Rachel Freedman, Justin Svegliato, and Stuart Russell · 2023
Closest in time.
Sensitivity of reverse transcription polymerase chain reaction tests for severe acute respiratory syndrome coronavirus 2 through time
Rachelle N Binny, Patricia Priest, Nigel P French, Matthew Parry, Audrey Lustig, Shaun C Hendy, Oliver J Maclaren, Kannan M Ridings, Nicholas Steyn, Giorgia Vattiato, et al · 2023
Closest in time.
Open problems and fundamental limitations of reinforcement learning from human feedback
Stephen Casper, Xander Davies, Claudia Shi, Thomas Krendl Gilbert, Jérémy Scheurer, Javier Rando, Rachel Freedman, Tomasz Korbak, David Lindner, Pedro Freire, Tony Wang, Samuel Marks, Charbel-Raphael Segerie, Micah Carroll, Andi Peng, Phillip Christoffersen, Mehul Damani, Stewart Slocum, Usman Anwar, Anand Siththaranjan, Max Nadeau, Eric J. Michaud, Jacob Pfau, Dmitrii Krasheninnikov, Xin Chen, Lauro Langosco, Peter Hase, Erdem Biyik, Anca Dragan, David Krueger, Dorsa Sadigh, and Dylan Hadfield-Menell · 2023
Closest in time.
Bard, 2023
Google · 2023
Closest in time.
Prices for COVID-19 testing, May 2023
Justin Lo, Krutika Amin, Imani Telesford, Lindsey Dawson, and Jennifer Kates · 2023
Closest in time.
GPT-4 technical report, 2023
OpenAI · 2023
Closest in time.
Using survey data to estimate the impact of the omicron variant on vaccine efficacy against COVID-19 infection
Jesús Rufino, Carlos Baquero, Davide Frey, Christin A Glorioso, Antonio Ortega, Nina Reščič, Julian Charles Roberts, Rosa E Lillo, Raquel Menezes, Jaya Prakash Champati, et al · 2023
Closest in time.
Llama 2: Open foundation and fine-tuned chat models, 2023
Hugo Touvron, Louis Martin, Kevin Stone, Peter Albert, Amjad Almahairi, Yasmine Babaei, Nikolay Bashlykov, Soumya Batra, Prajjwal Bhargava, Shruti Bhosale, Dan Bikel, Lukas Blecher, Cristian Canton Ferrer, Moya Chen, Guillem Cucurull, David Esiobu, Jude Fernandes, Jeremy Fu, Wenyin Fu, Brian Fuller, Cynthia Gao, Vedanuj Goswami, Naman Goyal, Anthony Hartshorn, Saghar Hosseini, Rui Hou, Hakan Inan, Marcin Kardas, Viktor Kerkez, Madian Khabsa, Isabel Kloumann, Artem Korenev, Punit Singh Koura, Marie-Anne Lachaux, Thibaut Lavril, Jenya Lee, Diana Liskovich, Yinghai Lu, Yuning Mao, Xavier Martinet, Todor Mihaylov, Pushkar Mishra, Igor Molybog, Yixin Nie, Andrew Poulton, Jeremy Reizenstein, Rashi Rungta, Kalyan Saladi, Alan Schelten, Ruan Silva, Eric Michael Smith, Ranjan Subramanian, Xiaoqing Ellen Tan, Binh Tang, Ross Taylor, Adina Williams, Jian Xiang Kuan, Puxin Xu, Zheng Yan, Iliyan Zarov, Yuchen Zhang, Angela Fan, Melanie Kambadur, Sharan Narang, Aurelien Rodriguez, Robert Stojnic, Sergey Edunov, and Thomas Scialom · 2023
Closest in time.
Social choice for ai alignment: Dealing with diverse human feedback
Vincent Conitzer, Rachel Freedman, Jobst Heitzig, Wesley H Holliday, Bob M Jacobs, Nathan Lambert, Milan Mossé, Eric Pacuit, Stuart Russell, Hailey Schoelkopf, et al · 2024
Closest in time.