Recipes for building an open-domain chatbot
Original
Roller, S., Dinan, E., Goyal, N., Ju, D., Williamson, M., Liu, Y., Xu, J., Ott, M., Shuster, K., Smith, E. M., et al · 2020
Cited alongside, same era.
Learning to summarize with human feedback
Stiennon, N., Ouyang, L., Wu, J., Ziegler, D., Lowe, R., Voss, C., Radford, A., Amodei, D., and Christiano, P. F · 2020
Cited alongside, same era.
Neural text generation with unlikelihood training
Welleck, S., Kulikov, I., Roller, S., Dinan, E., Cho, K., and Weston, J · 2020
Cited alongside, same era.
Base layers: Simplifying training of large, sparse models
Lewis, M., Bhosale, S., Dettmers, T., Goyal, N., and Zettlemoyer, L · 2021
Cited alongside, same era.
The cringe loss: Learning what language not to model
Original
Adolphs, L., Gao, T., Xu, J., Shuster, K., Sukhbaatar, S., and Weston, J · 2022
Cited alongside, same era.
Director: Generator-classifiers for supervised language modeling
Original
Arora, K., Shuster, K., Sukhbaatar, S., and Weston, J · 2022
Cited alongside, same era.
A simple contrastive learning objective for alleviating neural text degeneration, 2022
Original
Jiang, S., Zhang, R., Vakulenko, S., and de Rijke, M · 2022
Cited alongside, same era.
Training language models to follow instructions with human feedback
Ouyang, L., Wu, J., Jiang, X., Almeida, D., Wainwright, C., Mishkin, P., Zhang, C., Agarwal, S., Slama, K., Ray, A., et al · 2022
Cited alongside, same era.
Blenderbot 3: a deployed conversational agent that continually learns to responsibly engage
Original
Shuster, K., Xu, J., Komeili, M., Ju, D., Smith, E. M., Roller, S., Ung, M., Chen, M., Arora, K., Lane, J., et al · 2022
Cited alongside, same era.
Alpacafarm: A simulation framework for methods that learn from human feedback
Original
Dubois, Y., Li, X., Taori, R., Zhang, T., Gulrajani, I., Ba, J., Guestrin, C., Liang, P., and Hashimoto, T. B · 2023
Cited alongside, same era.
Reinforced self-training (rest) for language modeling
Original
Gulcehre, C., Paine, T. L., Srinivasan, S., Konyushkova, K., Weerts, L., Sharma, A., Siddhant, A., Ahern, A., Wang, M., Gu, C., et al · 2023
Cited alongside, same era.
Contrastive post-training large language models on data curriculum
Original
Xu, C., Rosset, C., Del Corro, L., Mahajan, S., McAuley, J., Neville, J., Awadallah, A. H., and Rao, N
Cited in the paper.