Hellobench: Evaluating long text generation capabilities of large language models
Original
Haoran Que, Feiyu Duan, Liqun He, Yutao Mou, Wangchunshu Zhou, Jiaheng Liu, Wenge Rong, Zekun Moore Wang, Jian Yang, Ge Zhang, et al · 2024
Later among the works it cites.
Constructing domain-specific evaluation sets for llm-as-a-judge
Original
Ravi Raju, Swayambhoo Jain, Bo Li, Jonathan Li, and Urmish Thakker · 2024
Later among the works it cites.
Gemma 2: Improving open language models at a practical size
Original
Morgane Riviere, Shreya Pathak, Pier Giuseppe Sessa, Cassidy Hardin, Surya Bhupatiraju, Léonard Hussenot, Thomas Mesnard, Bobak Shahriari, Alexandre Ramé, et al · 2024
Later among the works it cites.
FineSurE: Fine-grained summarization evaluation using LLMs
Hwanjun Song, Hang Su, Igor Shalyminov, Jason Cai, and Saab Mansour · 2024
Later among the works it cites.
Judgebench: A benchmark for evaluating llm-based judges
Original
Sijun Tan, Siyuan Zhuang, Kyle Montgomery, William Y Tang, Alejandro Cuadron, Chenguang Wang, Raluca Ada Popa, and Ion Stoica · 2024
Later among the works it cites.
Judging the judges: Evaluating alignment and vulnerabilities in llms-as-judges
Original
Aman Singh Thakur, Kartik Choudhary, Venkat Srinik Ramayapally, Sankaran Vaidyanathan, and Dieuwke Hupkes · 2024
Later among the works it cites.
Self-rationalization improves llm as a fine-grained judge
Original
Prapti Trivedi, Aditya Gulati, Oliver Molenschot, Meghana Arakkal Rajeev, Rajkumar Ramamurthy, Keith Stevens, Tanveesh Singh Chaudhery, Jahnavi Jambholkar, James Zou, and Nazneen Rajani · 2024
Later among the works it cites.
Autosurvey: Large language models can automatically write surveys
Yidong Wang, Qi Guo, Wenjin Yao, Hongbo Zhang, Xin Zhang, Zhen Wu, Meishan Zhang, Xinyu Dai, Qingsong Wen, Wei Ye, et al · 2024
Later among the works it cites.
Meta-rewarding language models: Self-improving alignment with llm-as-a-meta-judge
Original
Tianhao Wu, Weizhe Yuan, Olga Golovneva, Jing Xu, Yuandong Tian, Jiantao Jiao, Jason Weston, and Sainbayar Sukhbaatar · 2024
Later among the works it cites.
Qwen2.5 technical report
An Yang, Baosong Yang, Zhang, et al · 2024
Later among the works it cites.
Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning
Original
Daya Guo, Dejian Yang, Haowei Zhang, Junxiao Song, Ruoyu Zhang, Runxin Xu, Qihao Zhu, Shirong Ma, Peiyi Wang, Xiao Bi, et al · 2025
Closest in time.
Preference leakage: A contamination problem in llm-as-a-judge
Original
Dawei Li, Renliang Sun, Yue Huang, Ming Zhong, Bohan Jiang, Jiawei Han, Xiangliang Zhang, Wei Wang, and Huan Liu · 2025
Closest in time.
Limitations of the llm-as-a-judge approach for evaluating llm outputs in expert knowledge tasks
Annalisa Szymanski, Noah Ziems, Heather A Eicher-Miller, Toby Jia-Jun Li, Meng Jiang, and Ronald A Metoyer · 2025
Closest in time.
Beyond bradley-terry models: A general preference model for language model alignment
Yifan Zhang, Ge Zhang, Yue Wu, Kangping Xu, and Quanquan Gu · 2025
Closest in time.