Learning to summarize with human feedback
Stiennon, N., Ouyang, L., Wu, J., Ziegler, D., Lowe, R., Voss, C., Radford, A., Amodei, D., and Christiano, P. F · 2020
Cited alongside, same era.
Trl: Transformer reinforcement learning
von Werra, L., Belkada, Y., Tunstall, L., Beeching, E., Thrush, T., Lambert, N., and Huang, S · 2020
Cited alongside, same era.
What are the statistical limits of offline rl with linear function approximation?
Original
Wang, R., Foster, D. P., and Kakade, S. M · 2020
Cited alongside, same era.
On the theory of policy gradient methods: Optimality, approximation, and distribution shift
Agarwal, A., Kakade, S. M., Lee, J. D., and Mahajan, G · 2021
Cited alongside, same era.
Dueling rl: reinforcement learning with trajectory preferences
Original
Pacchiano, A., Saha, A., and Lee, J · 2021
Cited alongside, same era.
Human-in-the-loop: Provably efficient preference-based reinforcement learning with general function approximation
Chen, X., Zhong, H., Yang, Z., Wang, Z., and Wang, L · 2022
Cited alongside, same era.
Training language models to follow instructions with human feedback
Ouyang, L., Wu, J., Jiang, X., Almeida, D., Wainwright, C., Mishkin, P., Zhang, C., Agarwal, S., Slama, K., Ray, A., et al · 2022
Cited alongside, same era.
Offline reinforcement learning with differential privacy
Original
Qiao, D. and Wang, Y.-X · 2022
Cited alongside, same era.
A general theoretical paradigm to understand learning from human preferences
Original
Azar, M. G., Rowland, M., Piot, B., Guo, D., Calandriello, D., Valko, M., and Munos, R · 2023
Cited alongside, same era.
Differentially private reward estimation with preference feedback
Original
Chowdhury, S. R., Zhou, X., and Natarajan, N · 2023
Cited alongside, same era.
A survey of reinforcement learning from human feedback
Original
Kaufmann, T., Weng, P., Bengs, V., and Hüllermeier, E · 2023
Cited alongside, same era.
The history and risks of reinforcement learning and human feedback
Lambert, N., Krendl Gilbert, T., and Zick, T · 2023
Cited alongside, same era.