TruthfulQA: Measuring how models mimic human falsehoods
Original
Stephanie Lin, Jacob Hilton, and Owain Evans · 2021
Cited alongside, same era.
Finetuned language models are zero-shot learners
Original
Jason Wei, Maarten Bosma, Vincent Y Zhao, Kelvin Guu, Adams Wei Yu, Brian Lester, Nan Du, Andrew M Dai, and Quoc V Le · 2021
Cited alongside, same era.
Constitutional AI: Harmlessness from AI feedback
Original
Yuntao Bai, Saurav Kadavath, Sandipan Kundu, Amanda Askell, Jackson Kernion, Andy Jones, Anna Chen, Anna Goldie, Azalia Mirhoseini, Cameron McKinnon, et al · 2022
Cited alongside, same era.
Scaling instruction-finetuned language models
Original
Hyung Won Chung, Le Hou, Shayne Longpre, Barret Zoph, Yi Tay, William Fedus, Eric Li, Xuezhi Wang, Mostafa Dehghani, Siddhartha Brahma, et al · 2022
Cited alongside, same era.
Language models (mostly) know what they know
Original
Saurav Kadavath, Tom Conerly, Amanda Askell, Tom Henighan, Dawn Drain, Ethan Perez, Nicholas Schiefer, Zac Hatfield-Dodds, Nova DasSarma, Eli Tran-Johnson, et al · 2022
Cited alongside, same era.
Teaching models to express their uncertainty in words
Original
Stephanie Lin, Jacob Hilton, and Owain Evans · 2022
Cited alongside, same era.
Brio: Bringing order to abstractive summarization
Original
Yixin Liu, Pengfei Liu, Dragomir Radev, and Graham Neubig · 2022
Cited alongside, same era.
Training language models to follow instructions with human feedback, 2022
Original
Long Ouyang, Jeff Wu, Xu Jiang, Diogo Almeida, Carroll L Wainwright, Pamela Mishkin, Chong Zhang, Sandhini Agarwal, Katarina Slama, Alex Ray, et al · 2022
Cited alongside, same era.
Leveraging large language models for multiple choice question answering
Original
Joshua Robinson, Christopher Michael Rytting, and David Wingate · 2022
Cited alongside, same era.
Self-consistency improves chain of thought reasoning in language models
Original
Xuezhi Wang, Jason Wei, Dale Schuurmans, Quoc Le, Ed Chi, Sharan Narang, Aakanksha Chowdhery, and Denny Zhou · 2022
Cited alongside, same era.
Can NLP models’ identify’,’distinguish’, and’justify’questions that don’t have a definitive answer?
Original
Ayushi Agarwal, Nisarg Patel, Neeraj Varshney, Mihir Parmar, Pavan Mallina, Aryan Bhavin Shah, Srihari Raju Sangaraju, Tirth Patel, Nihar Thakkar, and Chitta Baral · 2023
Cited alongside, same era.
Robots that ask for help: Uncertainty alignment for large language model planners
Original
Allen Z Ren, Anushri Dixit, Alexandra Bodrova, Sumeet Singh, Stephen Tu, Noah Brown, Peng Xu, Leila Takayama, Fei Xia, Jake Varley, et al
Cited in the paper.