Deep reinforcement learning from human preferences
P. F. Christiano, J. Leike, T. Brown, M. Martic, S. Legg, and D. Amodei · 2017
Earlier work this paper cites.
Reinforcement learning with a corrupted reward channel
Original
T. Everitt, V. Krakovna, L. Orseau, M. Hutter, and S. Legg · 2017
Earlier work this paper cites.
On faithfulness and factuality in abstractive summarization
Original
J. Maynez, S. Narayan, B. Bohnet, and R. McDonald · 2020
Earlier work this paper cites.
Collaborative storytelling with large-scale neural language models
E. Nichols, L. Gao, and R. Gomez · 2020
Earlier work this paper cites.
Learning to summarize with human feedback
N. Stiennon, L. Ouyang, J. Wu, D. Ziegler, R. Lowe, C. Voss, A. Radford, D. Amodei, and P. F. Christiano · 2020
Earlier work this paper cites.
A general language assistant as a laboratory for alignment
Original
A. Askell, Y. Bai, A. Chen, D. Drain, D. Ganguli, T. Henighan, A. Jones, N. Joseph, B. Mann, N. DasSarma, et al · 2021
Earlier work this paper cites.
Training verifiers to solve math word problems
Original
K. Cobbe, V. Kosaraju, M. Bavarian, M. Chen, H. Jun, L. Kaiser, M. Plappert, J. Tworek, J. Hilton, R. Nakano, et al · 2021
Earlier work this paper cites.
Measuring mathematical problem solving with the math dataset
Original
D. Hendrycks, C. Burns, S. Kadavath, A. Arora, S. Basart, E. Tang, D. Song, and J. Steinhardt · 2021
Earlier work this paper cites.
Webgpt: Browser-assisted question-answering with human feedback
Original
R. Nakano, J. Hilton, S. Balaji, J. Wu, L. Ouyang, C. Kim, C. Hesse, S. Jain, V. Kosaraju, W. Saunders, et al · 2021
Earlier work this paper cites.