Fetching the paper…
Reading the bibliography…
We present AMO-Bench, an Advanced Mathematical reasoning benchmark with Olympiad level or even higher difficulty, comprising 50 human-crafted problems.
Training verifiers to solve math word problems
Karl Cobbe, Vineet Kosaraju, Mohammad Bavarian, Mark Chen, Heewoo Jun, Lukasz Kaiser, Matthias Plappert, Jerry Tworek, Jacob Hilton, Reiichiro Nakano, et al · 2021
Earlier work this paper cites.
Measuring mathematical problem solving with the math dataset
Dan Hendrycks, Collin Burns, Saurav Kadavath, Akul Arora, Steven Basart, Eric Tang, Dawn Song, and Jacob Steinhardt · 2021
Earlier work this paper cites.
OpenAI · 2024
Earlier work this paper cites.
Olympiadbench: A challenging benchmark for promoting agi with olympiad-level bilingual multimodal scientific problems
Chaoqun He, Renjie Luo, Yuzhuo Bai, Shengding Hu, Zhen Thai, Junhao Shen, Jinyi Hu, Xu Han, Yujie Huang, Yuxiang Zhang, et al · 2024
Earlier work this paper cites.
Omni-math: A universal olympiad level mathematic benchmark for large language models
Bofei Gao, Feifan Song, Zhe Yang, Zefan Cai, Yibo Miao, Qingxiu Dong, Lei Li, Chenghao Ma, Liang Chen, Runxin Xu, et al · 2024
Earlier work this paper cites.
Frontiermath: A benchmark for evaluating advanced mathematical reasoning in ai
Elliot Glazer, Ege Erdil, Tamay Besiroglu, Diego Chicharro, Evan Chen, Alex Gunning, Caroline Falkman Olsson, Jean-Stanislas Denain, Anson Ho, Emily de Oliveira Santos, et al · 2024
Earlier work this paper cites.
Gemini Team · 2025
Earlier work this paper cites.
Gpt-5 system card, 2025
OpenAI · 2025
Earlier work this paper cites.
System card: Claude opus 4 and claude sonnet 4, 2025
Anthropic · 2025
Earlier work this paper cites.
Grok 4 model card, 2025
xAI · 2025
Cited alongside, same era.
An Yang, Anfeng Li, Baosong Yang, Beichen Zhang, Binyuan Hui, Bo Zheng, Bowen Yu, Chang Gao, Chengen Huang, Chenxu Lv, Chujie Zheng, Dayiheng Liu, Fan Zhou, Fei Huang, Feng Hu, Hao Ge, Haoran Wei, Huan Lin, Jialong Tang, Jian Yang, Jianhong Tu, Jianwei Zhang, Jianxin Yang, Jiaxi Yang, Jing Zhou, Jingren Zhou, Junyang Lin, Kai Dang, Keqin Bao, Kexin Yang, Le Yu, Lianghao Deng, Mei Li, Mingfeng Xue, Mingze Li, Pei Zhang, Peng Wang, Qin Zhu, Rui Men, Ruize Gao, Shixuan Liu, Shuang Luo, Tianhao Li, Tianyi Tang, Wenbiao Yin, Xingzhang Ren, Xinyu Wang, Xinyu Zhang, Xuancheng Ren, Yang Fan, Yang Su, Yichang Zhang, Yinger Zhang, Yu Wan, Yuqiong Liu, Zekun Wang, Zeyu Cui, Zhenru Zhang, Zhipeng Zhou, and Zihan Qiu · 2025
Cited alongside, same era.
Deepseek-r1 incentivizes reasoning in llms through reinforcement learning
Daya Guo, Dejian Yang, Haowei Zhang, Junxiao Song, Peiyi Wang, Qihao Zhu, Runxin Xu, Ruoyu Zhang, Shirong Ma, Xiao Bi, et al · 2025
Cited alongside, same era.
Deepseek-v3 technical report, 2025
DeepSeek-AI · 2025
Cited alongside, same era.
Mathodyssey: Benchmarking mathematical problem-solving skills in large language models using odyssey math data
Meng Fang, Xiangpeng Wan, Fei Lu, Fei Xing, and Kai Zou · 2025
Closest in time.
Challenging the boundaries of reasoning: An olympiad-level math benchmark for large language models
Haoxiang Sun, Yingqian Min, Zhipeng Chen, Wayne Xin Zhao, Lei Fang, Zheng Liu, Zhongyuan Wang, and Ji-Rong Wen · 2025
Closest in time.
Proof or bluff? evaluating llms on 2025 usa math olympiad, 2025
Ivo Petrov, Jasper Dekoninck, Lyuben Baltadzhiev, Maria Drencheva, Kristian Minchev, Mislav Balunović, Nikola Jovanović, and Martin Vechev · 2025
Closest in time.
s1: Simple test-time scaling
Niklas Muennighoff, Zitong Yang, Weijia Shi, Xiang Lisa Li, Li Fei-Fei, Hannaneh Hajishirzi, Luke Zettlemoyer, Percy Liang, Emmanuel Candes, and Tatsunori Hashimoto · 2025
Closest in time.
Beyondaime: Advancing math reasoning evaluation beyond high school olympiads, 2025
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…
GLM-4.5 Team · 2025
Cited alongside, same era.
Seed1.5-thinking: Advancing superb reasoning models with reinforcement learning, 2025
ByteDance Seed · 2025
Cited alongside, same era.
Tencent Hunyuan Team · 2025
Cited alongside, same era.
Kimi k2: Open agentic intelligence, 2025
Kimi Team · 2025
Cited alongside, same era.
Matharena: Evaluating llms on uncontaminated math competitions
Mislav Balunović, Jasper Dekoninck, Ivo Petrov, Nikola Jovanović, and Martin Vechev · 2025
Cited alongside, same era.
Longcat-flash-thinking technical report, 2025a
Meituan LongCat Team
Cited in the paper.
Longcat-flash technical report, 2025b
Meituan LongCat Team
Cited in the paper.
ByteDance-Seed · 2025
Closest in time.
Realmath: A continuous benchmark for evaluating language models on research-level mathematics
Jie Zhang, Cezara Petrui, Kristina Nikolić, and Florian Tramèr · 2025
Closest in time.
Hardmath2: A benchmark for applied mathematics built by students as part of a graduate class
James V Roggeveen, Erik Y Wang, Will Flintoft, Peter Donets, Lucy S Nathwani, Nickholas Gutierrez, David Ettel, Anton Marius Graf, Siddharth Dandavate, Arjun Nageswaran, et al · 2025
Closest in time.
Long Phan, Alice Gatti, Ziwen Han, Nathaniel Li, Josephina Hu, Hugh Zhang, Chen Bo Calvin Zhang, Mohamed Shaaban, John Ling, Sean Shi, et al · 2025
Closest in time.