Fetching the paper…
Reading the bibliography…
Rapid improvements in large language models have unveiled a critical challenge in human-AI interaction: sycophancy.
Why ai alignment could be hard with modern deep learning
Ajeya Cotra. 2021 · 2021
Earlier work this paper cites.
Measuring massive multitask language understanding
Dan Hendrycks, Collin Burns, Steven Basart, Andy Zou, Mantas Mazeika, Dawn Song, and Jacob Steinhardt. 2021 · 2021
Earlier work this paper cites.
Truthfulqa: Measuring how models mimic human falsehoods
Stephanie Lin, Jacob Hilton, and Owain Evans. 2022 · 2022
Earlier work this paper cites.
Ux research on conversational human-ai interaction: A literature review of the acm digital library
Qingxiao Zheng, Yiliu Tang, Yiren Liu, Weizi Liu, and Yun Huang. 2022 · 2022
Earlier work this paper cites.
Deep reinforcement learning from human preferences
Paul Christiano, Jan Leike, Tom B. Brown, Miljan Martic, Shane Legg, and Dario Amodei. 2023 · 2023
Earlier work this paper cites.
Towards understanding sycophancy in language models
Mrinank Sharma, Meg Tong, Tomasz Korbak, David Duvenaud, Amanda Askell, Samuel R. Bowman, Newton Cheng, Esin Durmus, Zac Hatfield-Dodds, Scott R. Johnston, Shauna Kravec, Timothy Maxwell, Sam McCandlish, Kamal Ndousse, Oliver Rausch, Nicholas Schiefer, Da Yan, Miranda Zhang, and Ethan Perez. 2023 · 2023
Earlier work this paper cites.
The claude 3 model family: Opus, sonnet, haiku
Anthropic. 2024 · 2024
Cited alongside, same era.
Are you sure? challenging llms leads to performance drops in the flipflop experiment
Philippe Laban, Lidiya Murakhovs’ka, Caiming Xiong, and Chien-Sheng Wu. 2024 · 2024
Cited alongside, same era.
Anchoring bias in large language models: An experimental study
Jiaxu Lou and Yifan Sun. 2024 · 2024
Cited alongside, same era.
Sycophancy in large language models: Causes and mitigations
Lars Malmqvist. 2024 · 2024
Cited alongside, same era.
Meta. 2024 · 2024
Cited alongside, same era.
Fool me, fool me: User attitudes toward llm falsehoods
Diana Bar-Or Nirman, Ariel Weizman, and Amos Azaria. 2024 · 2024
Later among the works it cites.
Dialogbench: Evaluating llms as human-like dialogue systems
Jiao Ou, Junda Lu, Che Liu, Yihong Tang, Fuzheng Zhang, Di Zhang, and Kun Gai. 2024 · 2024
Later among the works it cites.
Aswin RRV, Nemika Tyagi, Md Nayem Uddin, Neeraj Varshney, and Chitta Baral. 2024 · 2024
Later among the works it cites.
Cbeval: A framework for evaluating and interpreting cognitive biases in llms
Ammar Shaikh, Raj Abhijit Dandekar, Sreedath Panat, and Rajat Dandekar. 2024 · 2024
Later among the works it cites.
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…
Language models in dialogue: Conversational maxims for human-ai interactions
Erik Miehling, Manish Nagireddy, Prasanna Sattigeri, Elizabeth M. Daly, David Piorkowski, and John T. Richards. 2024 · 2024
Cited alongside, same era.
OpenAI. 2024a
Cited in the paper.
Gpt-4o mini: advancing cost-efficient intelligence
OpenAI. 2024b
Cited in the paper.
Mint: Evaluating llms in multi-turn interaction with tools and language feedback
Xingyao Wang, Zihan Wang, Jiateng Liu, Yangyi Chen, Lifan Yuan, Hao Peng, and Heng Ji. 2024a
Cited in the paper.
Mmlu-pro: A more robust and challenging multi-task language understanding benchmark
Yubo Wang, Xueguang Ma, Ge Zhang, Yuansheng Ni, Abhranil Chandra, Shiguang Guo, Weiming Ren, Aaran Arulraj, Xuan He, Ziyan Jiang, et al. 2024b
Cited in the paper.
Chengrun Yang, Xuezhi Wang, Yifeng Lu, Hanxiao Liu, Quoc V. Le, Denny Zhou, and Xinyun Chen. 2024 · 2024
Later among the works it cites.
Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning
DeepSeek-AI. 2025 · 2025
Closest in time.