Fetching the paper…
Reading the bibliography…
As language models master existing reasoning benchmarks, we need new challenges to evaluate their cognitive frontiers.
https://web.archive.org/web/20210725192741/https://www.maths.usyd.edu.au/ub/sums/puzzlehunt/2018/index
Sydney University Mathematics Society · 2018
Earlier work this paper cites.
On the measure of intelligence, 2019
François Chollet · 2019
Earlier work this paper cites.
Measuring mathematical problem solving with the math dataset, 2021
Dan Hendrycks, Collin Burns, Saurav Kadavath, Akul Arora, Steven Basart, Eric Tang, Dawn Song, and Jacob Steinhardt · 2021
Earlier work this paper cites.
Measuring massive multitask language understanding, 2021
Dan Hendrycks, Collin Burns, Steven Basart, Andy Zou, Mantas Mazeika, Dawn Song, and Jacob Steinhardt · 2021
Earlier work this paper cites.
Riddlesense: Answering riddle questions as commonsense reasoning
Bill Yuchen Lin, Ziyi Wu, Yichi Yang, Dong-Ho Lee, and Xiang Ren · 2021
Earlier work this paper cites.
GPQA: A graduate-level google-proof q&a benchmark
David Rein, Betty Li Hou, Asa Cooper Stickland, Jackson Petty, Richard Yuanzhe Pang, Julien Dirani, Julian Michael, and Samuel R. Bowman · 2024
Earlier work this paper cites.
Frontiermath: A benchmark for evaluating advanced mathematical reasoning in ai, 2024
Elliot Glazer, Ege Erdil, Tamay Besiroglu, Diego Chicharro, Evan Chen, Alex Gunning, Caroline Falkman Olsson, Jean-Stanislas Denain, Anson Ho, Emily de Oliveira Santos, Olli Järviniemi, Matthew Barnett, Robert Sandler, Matej Vrzala, Jaime Sevilla, Qiuyu Ren, Elizabeth Pratt, Lionel Levine, Grant Barkley, Natalie Stewart, Bogdan Grechuk, Tetiana Grechuk, Shreepranav Varma Enugandla, and Mark Wildon · 2024
Cited alongside, same era.
Olympiadbench: A challenging benchmark for promoting agi with olympiad-level bilingual multimodal scientific problems, 2024
Chaoqun He, Renjie Luo, Yuzhuo Bai, Shengding Hu, Zhen Leng Thai, Junhao Shen, Jinyi Hu, Xu Han, Yujie Huang, Yuxiang Zhang, Jie Liu, Lei Qi, Zhiyuan Liu, and Maosong Sun · 2024
Cited alongside, same era.
Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi
Xiang Yue, Yuansheng Ni, Kai Zhang, Tianyu Zheng, Ruoqi Liu, Ge Zhang, Samuel Stevens, Dongfu Jiang, Weiming Ren, Yuxuan Sun, Cong Wei, Botao Yu, Ruibin Yuan, Renliang Sun, Ming Yin, Boyuan Zheng, Zhenzhu Yang, Yibo Liu, Wenhao Huang, Huan Sun, Yu Su, and Wenhu Chen · 2024
Cited alongside, same era.
Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts
Pan Lu, Hritik Bansal, Tony Xia, Jiacheng Liu, Chunyuan Li, Hannaneh Hajishirzi, Hao Cheng, Kai-Wei Chang, Michel Galley, and Jianfeng Gao · 2024
PuzzleBench: Can LLMs Solve Challenging First-Order Combinatorial Reasoning Problems?
Chinmay Mittal, Krishna Kartik, Parag Singla, et al · 2024
Later among the works it cites.
Step-by-Step Reasoning to Solve Grid Puzzles: Where do LLMs Falter?
Nemika Tyagi, Mihir Parmar, Mohith Kulkarni, Aswin Rrv, Nisarg Patel, Mutsumi Nakamura, Arindam Mitra, and Chitta Baral · 2024
Later among the works it cites.
https://2024.galacticpuzzlehunt.com/
Galactic Puzzle Hunt · 2024
Later among the works it cites.
CS50x Puzzle Day
David J. Malan · 2025
Closest in time.
Humanity’s Last Exam, 2025
Long Phan, Alice Gatti, Ziwen Han, Nathaniel Li, Josephina Hu, Hugh Zhang, Mohamed Shaaban, John Ling, Sean Shi, Michael Choi, Anish Agrawal, Arnav Chopra, Adam Khoja, Ryan Kim, Richard Ren, Jason Hausenloy, Oliver Zhang, Mantas Mazeika, Summer Yue, Alexandr Wang, and Dan Hendrycks · 2025
Closest in time.
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…
Cited alongside, same era.
Vista: A rubric-based visual task assessment
Cristina Menghini, Diego Mares, Ernesto Hernandez, Dean Lee, Mike Lunati, and Summer Yue · 2024
Cited alongside, same era.
PUZZLES: A Benchmark for Neural Algorithmic Reasoning, 2024
Benjamin Estermann, Luca A. Lanzendörfer, Yannick Niedermayr, and Roger Wattenhofer · 2024
Cited alongside, same era.
https://puzzledpint.org/
Puzzled Pint
Cited in the paper.
Puzzle Potluck
Bradley Wu, Curtis Liu, Darren Yin, Julz Huang, Lindsey Shi, Rajeev Nayak, and Stephanie Chang
Cited in the paper.
SOME PUZZLES by Mark Halpin
Mark Halpin
Cited in the paper.
https://puzzles.mit.edu/
MIT Mystery Hunt
Cited in the paper.
Grandmaster Puzzles
Thomas Snyder
Cited in the paper.
https://www.melbunimathsstats.org/puzzlehunt
Melburne Uni Maths and Stats Society
Cited in the paper.
PuzzlePlex: A Benchmark to Evaluate the Reasoning and Planning of Large Language Models on Puzzles, 2025
Anonymous · 2025
Closest in time.