Fetching the paper…
Reading the bibliography…
Large language models (LLMs) increasingly rely on multi-turn tool-integrated planning for knowledge-intensive and complex reasoning tasks.
MuSiQue: Multihop Questions via Single-hop Question Composition
Trivedi, H.; Balasubramanian, N.; Khot, T.; and Sabharwal, A. 2022 · 2022
Earlier work this paper cites.
GAIA: a benchmark for General AI Assistants
Mialon, G.; Fourrier, C.; Swift, C.; Wolf, T.; LeCun, Y.; and Scialom, T. 2023 · 2023
Earlier work this paper cites.
ReAct: Synergizing Reasoning and Acting in Language Models
Yao, S.; Zhao, J.; Yu, D.; Du, N.; Shafran, I.; Narasimhan, K.; and Cao, Y. 2023 · 2023
Earlier work this paper cites.
Verify-and-Edit: A Knowledge-Enhanced Chain-of-Thought Framework
Zhao, R.; Li, X.; Joty, S.; Qin, C.; and Bing, L. 2023 · 2023
Earlier work this paper cites.
Chain-of-Knowledge: Grounding Large Language Models via Dynamic Knowledge Adapting over Heterogeneous Sources
Li, X.; Zhao, R.; Chia, Y. K.; Ding, B.; Joty, S.; Poria, S.; and Bing, L. 2024 · 2024
Earlier work this paper cites.
Direct Preference Optimization: Your Language Model is Secretly a Reward Model
Rafailov, R.; Sharma, A.; Mitchell, E.; Ermon, S.; Manning, C. D.; and Finn, C. 2024 · 2024
Earlier work this paper cites.
DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
Shao, Z.; Wang, P.; Zhu, Q.; Xu, R.; Song, J.; Bi, X.; Zhang, H.; Zhang, M.; Li, Y. K.; Wu, Y.; and Guo, D. 2024 · 2024
Earlier work this paper cites.
Can Language Models Perform Robust Reasoning in Chain-of-thought Prompting with Noisy Rationales?
Zhou, Z.; Tao, R.; Zhu, J.; Luo, Y.; Wang, Z.; and Han, B. 2024 · 2024
Earlier work this paper cites.
ReTool: Reinforcement Learning for Strategic Tool Use in LLMs
Feng, J.; Huang, S.; Qu, X.; Zhang, G.; Qin, Y.; Zhong, B.; Jiang, C.; Chi, J.; and Zhong, W. 2025 · 2025
Earlier work this paper cites.
OWL: Optimized Workforce Learning for General Multi-Agent Assistance in Real-World Task Automation
Hu, M.; Zhou, Y.; Fan, W.; Nie, Y.; Xia, B.; Sun, T.; Ye, Z.; Jin, Z.; Li, Y.; Chen, Q.; Zhang, Z.; Wang, Y.; Ye, Q.; Ghanem, B.; Luo, P.; and Li, G. 2025 · 2025
Cited alongside, same era.
Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning
Jin, B.; Zeng, H.; Yue, Z.; Yoon, J.; Arik, S.; Wang, D.; Zamani, H.; and Han, J. 2025 · 2025
Cited alongside, same era.
Fact, Fetch, and Reason: A Unified Evaluation of Retrieval-Augmented Generation
Krishna, S.; Krishna, K.; Mohananey, A.; Schwarcz, S.; Stambler, A.; Upadhyay, S.; and Faruqui, M. 2025 · 2025
Cited alongside, same era.
ToRL: Scaling Tool-Integrated RL
Li, X.; Zou, H.; and Liu, P. 2025 · 2025
Cited alongside, same era.
WebShaper: Agentically Data Synthesizing via Information-Seeking Formalization
Tao, Z.; Wu, J.; Yin, W.; Zhang, J.; Li, B.; Shen, H.; Li, K.; Zhang, L.; Wang, X.; Jiang, Y.; Xie, P.; Huang, F.; and Zhou, J. 2025 · 2025
Closest in time.
Kimi K2: Open Agentic Intelligence
Team, K.; Bai, Y.; Bao, Y.; Chen, G.; Chen, J.; Chen, N.; Chen, R.; Chen, Y.; Chen, Y.; Chen, Y.; and et al. 2025 · 2025
Closest in time.
WebAgent-R1: Training Web Agents via End-to-End Multi-Turn Reinforcement Learning
Wei, Z.; Yao, W.; Liu, Y.; Zhang, W.; Lu, Q.; Qiu, L.; Yu, C.; Xu, P.; Zhang, C.; Yin, B.; Yun, H.; and Li, L. 2025 · 2025
Closest in time.
WebWalker: Benchmarking LLMs in Web Traversal
Wu, J.; Yin, W.; Jiang, Y.; Wang, Z.; Xi, Z.; Fang, R.; Zhang, L.; He, Y.; Zhou, D.; Xie, P.; and Huang, F. 2025 · 2025
Closest in time.
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…
Liu, B.; Guertler, L.; Yu, S.; Liu, Z.; Qi, P.; Balcells, D.; Liu, M.; Tan, C.; Shi, W.; Lin, M.; Lee, W. S.; and Jaques, N. 2025 · 2025
Cited alongside, same era.
Deep Research System Card
OpenAI. 2025 · 2025
Cited alongside, same era.
Training Powerful LLM Agents with End-to-End Reinforcement Learning
Ouyang, J.; Yan, R.; Luo, Y.; Cheng, M.; Liu, Q.; Liu, Z.; Yu, S.; and Wang, D. 2025 · 2025
Cited alongside, same era.
ToolRL: Reward is All Tool Learning Needs
Qian, C.; Acikgoz, E. C.; He, Q.; Wang, H.; Chen, X.; Hakkani-Tür, D.; Tur, G.; and Ji, H. 2025 · 2025
Cited alongside, same era.
Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning
Dong, G.; Chen, Y.; Li, X.; Jin, J.; Qian, H.; Zhu, Y.; Mao, H.; Zhou, G.; Dou, Z.; and Wen, J.-R. 2025a
Cited in the paper.
Agentic Reinforced Policy Optimization
Dong, G.; Mao, H.; Ma, K.; Bao, L.; Chen, Y.; Wang, Z.; Chen, Z.; Du, J.; Wang, H.; Zhang, F.; Zhou, G.; Zhu, Y.; Wen, J.-R.; and Dou, Z. 2025b
Cited in the paper.
WebSailor: Navigating Super-human Reasoning for Web Agent
Li, K.; Zhang, Z.; Yin, H.; Zhang, L.; Ou, L.; Wu, J.; Yin, W.; Li, B.; Tao, Z.; Wang, X.; Shen, W.; Zhang, J.; Zhang, D.; Wu, X.; Jiang, Y.; Yan, M.; Xie, P.; Huang, F.; and Zhou, J. 2025a
Cited in the paper.
WebThinker: Empowering Large Reasoning Models with Deep Research Capability
Li, X.; Jin, J.; Dong, G.; Qian, H.; Zhu, Y.; Wu, Y.; Wen, J.-R.; and Dou, Z. 2025b
Cited in the paper.
Xu, R.; and Peng, J. 2025 · 2025
Closest in time.
SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning
Xue, Z.; Zheng, L.; Liu, Q.; Li, Y.; Zheng, X.; Ma, Z.; and An, B. 2025 · 2025
Closest in time.
Yang, A.; Li, A.; Yang, B.; Zhang, B.; Hui, B.; Zheng, B.; Yu, B.; Gao, C.; Huang, C.; Lv, C.; and et al. 2025 · 2025
Closest in time.
LightThinker: Thinking Step-by-Step Compression
Zhang, J.; Zhu, Y.; Sun, M.; Luo, Y.; Qiao, S.; Du, L.; Zheng, D.; Chen, H.; and Zhang, N. 2025 · 2025
Closest in time.