Fetching the paper…
Reading the bibliography…
We study why Tool-Integrated Reasoning (TIR) makes Large Language Models (LLMs) more capable.
Reinforcement learning: An introduction , volume 1
Richard S Sutton, Andrew G Barto, et al · 1998
Earlier work this paper cites.
Proximal policy optimization algorithms
John Schulman, Filip Wolski, Prafulla Dhariwal, Alec Radford, and Oleg Klimov · 2017
Earlier work this paper cites.
Evaluating large language models trained on code
Mark Chen, Jerry Tworek, Heewoo Jun, Qiming Yuan, Henrique Ponde De Oliveira Pinto, Jared Kaplan, Harri Edwards, Yuri Burda, Nicholas Joseph, Greg Brockman, et al · 2021
Earlier work this paper cites.
Omni-math: A universal olympiad level mathematic benchmark for large language models
Bofei Gao, Feifan Song, Zhe Yang, Zefan Cai, Yibo Miao, Qingxiu Dong, Lei Li, Chenghao Ma, Liang Chen, Runxin Xu, et al · 2024
Earlier work this paper cites.
Tülu 3: Pushing frontiers in open language model post-training
Nathan Lambert, Jacob Morrison, Valentina Pyatkin, Shengyi Huang, Hamish Ivison, Faeze Brahman, Lester James V Miranda, Alisa Liu, Nouha Dziri, Shane Lyu, et al · 2024
Earlier work this paper cites.
DeepSeekMath: Pushing the limits of mathematical reasoning in open language models
Zhihong Shao, Peiyi Wang, Qihao Zhu, Runxin Xu, Junxiao Song, Xiao Bi, Haowei Zhang, Mingchuan Zhang, YK Li, Yang Wu, et al · 2024
Earlier work this paper cites.
Towards effective code-integrated reasoning
Fei Bai, Yingqian Min, Beichen Zhang, Zhipeng Chen, Wayne Xin Zhao, Lei Fang, Zheng Liu, Zhongyuan Wang, and Ji-Rong Wen · 2025
Cited alongside, same era.
ReTool: Reinforcement learning for strategic tool use in LLMs
Jiazhan Feng, Shijue Huang, Xingwei Qu, Ge Zhang, Yujia Qin, Baoquan Zhong, Chengquan Jiang, Jinxin Chi, and Wanjun Zhong · 2025
Cited alongside, same era.
Search-R1: Training LLMs to reason and leverage search engines with reinforcement learning
Bowen Jin, Hansi Zeng, Zhenrui Yue, Jinsung Yoon, Sercan Arik, Dong Wang, Hamed Zamani, and Jiawei Han · 2025
Cited alongside, same era.
Introducing GPT-5
OpenAI · 2025
Cited alongside, same era.
Introducing o3 and o4-mini
OpenAI · 2025
Cited alongside, same era.
The invisible leash: Why RLVR may not escape its origin
Fang Wu, Weihao Xuan, Ximing Lu, Zaid Harchaoui, and Yejin Choi · 2025
Closest in time.
Agents play thousands of 3D video games
Zhongwen Xu, Xianliang Wang, Siyi Li, Tao Yu, Liang Wang, Qiang Fu, and Wei Yang · 2025
Closest in time.
SimpleTIR: End-to-end reinforcement learning for multi-turn tool-integrated reasoning
Zhenghai Xue, Longtao Zheng, Qian Liu, Yingru Li, Zejun Ma, and Bo An · 2025
Closest in time.
DAPO: An open-source LLM reinforcement learning system at scale
Qiying Yu, Zheng Zhang, Ruofei Zhu, Yufeng Yuan, et al · 2025
Closest in time.
Does reinforcement learning really incentivize reasoning capacity in LLMs beyond the base model?
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…
WebSailor: Navigating super-human reasoning for web agent
Kuan Li, Zhongwang Zhang, Huifeng Yin, Liwen Zhang, Litu Ou, Jialong Wu, Wenbiao Yin, Baixuan Li, Zhengwei Tao, Xinyu Wang, et al
Cited in the paper.
ToRL: Scaling tool-integrated RL
Xuefeng Li, Haoyang Zou, and Pengfei Liu
Cited in the paper.
DeepSeek-R1: Incentivizing reasoning capability in LLMs via reinforcement learning
DeepSeek Team
Cited in the paper.
Gemini Team
Cited in the paper.
Qwen Team
Cited in the paper.
Yang Yue, Zhiqi Chen, Rui Lu, Andrew Zhao, Zhaokai Wang, Shiji Song, and Gao Huang · 2025
Closest in time.