Benefits of Assistance over Reward Learning, 2021
R. Shah, P. Freire, N. Alex, R. Freedman, D. Krasheninnikov, L. Chan, M. D. Dennis, P. Abbeel, A. Dragan, and S. Russell · 2021
Cited alongside, same era.
Constitutional AI: Harmlessness from AI Feedback
Original
Y. Bai, S. Kadavath, S. Kundu, A. Askell, J. Kernion, A. Jones, A. Chen, A. Goldie, A. Mirhoseini, C. McKinnon, C. Chen, C. Olsson, C. Olah, D. Hernandez, D. Drain, D. Ganguli, D. Li, E. Tran-Johnson, E. Perez, J. Kerr, J. Mueller, J. Ladish, J. Landau, K. Ndousse, K. Lukosuite, L. Lovitt, M. Sellitto, N. Elhage, N. Schiefer, N. Mercado, N. DasSarma, R. Lasenby, R. Larson, S. Ringer, S. Johnston, S. Kravec, S. El Showk, S. Fort, T. Lanham, T. Telleen-Lawton, T. Conerly, T. Henighan, T. Hume, S. R. Bowman, Z. Hatfield-Dodds, B. Mann, D. Amodei, N. Joseph, S. McCandlish, T. Brown, and J. Kaplan · 2022
Cited alongside, same era.
Calculus on MDPs: Potential Shaping as a Gradient, 2022
E. Jenner, H. van Hoof, and A. Gleave · 2022
Cited alongside, same era.
TruthfulQA: Measuring How Models Mimic Human Falsehoods
S. Lin, J. Hilton, and O. Evans · 2022
Cited alongside, same era.
Misspecification in Inverse Reinforcement Learning
Original
J. Skalse and A. Abate · 2022
Cited alongside, same era.
Learning from human preferences
D. Amodei, P. Christiano, and A. Ray · 2023
Cited alongside, same era.
Introducing Claude
Anthropic · 2023
Cited alongside, same era.
Claude’s Constitution
Anthropic · 2023
Cited alongside, same era.
Discovering Latent Knowledge in Language Models Without Supervision
C. Burns, H. Ye, D. Klein, and J. Steinhardt · 2023
Cited alongside, same era.
Open Problems and Fundamental Limitations of Reinforcement Learning from Human Feedback
S. Casper, X. Davies, C. Shi, T. K. Gilbert, J. Scheurer, J. Rando, R. Freedman, T. Korbak, D. Lindner, P. Freire, T. Wang, S. Marks, C.-R. Segerie, M. Carroll, A. Peng, P. Christoffersen, M. Damani, S. Slocum, U. Anwar, A. Siththaranjan, M. Nadeau, E. J. Michaud, J. Pfau, D. Krasheninnikov, X. Chen, L. Langosco, P. Hase, E. Bıyık, A. Dragan, D. Krueger, D. Sadigh, and D. Hadfield-Menell · 2023
Cited alongside, same era.
Eliciting Latent Knowledge
P. Christiano, A. Cotra, and M. Xu · 2023
Cited alongside, same era.
Gemini: A Family of Highly Capable Multimodal Models
G. Gemini Team · 2023
Cited alongside, same era.