Fetching the paper…
Reading the bibliography…
Large Language Models (LLMs) have emerged as one of the most significant technological advancements in artificial intelligence in recent years.
Hotpotqa: A dataset for diverse, explainable multi-hop question answering
Z. Yang, P. Qi, S. Zhang, Y. Bengio, W. W. Cohen, R. Salakhutdinov, and C. D. Manning · 2018
Earlier work this paper cites.
Language models are few-shot learners
T. Brown, B. Mann, N. Ryder, M. Subbiah, J. D. Kaplan, P. Dhariwal, A. Neelakantan, P. Shyam, G. Sastry, A. Askell, et al · 2020
Earlier work this paper cites.
Constructing a multi-hop qa dataset for comprehensive evaluation of reasoning steps
X. Ho, A.-K. D. Nguyen, S. Sugawara, and A. Aizawa · 2020
Earlier work this paper cites.
Trl: Transformer reinforcement learning
L. von Werra, Y. Belkada, L. Tunstall, E. Beeching, T. Thrush, N. Lambert, S. Huang, K. Rasul, and Q. Gallouédec · 2020
Earlier work this paper cites.
Musique: Multihop questions via single-hop question composition, 2022
H. Trivedi, N. Balasubramanian, T. Khot, and A. Sabharwal · 2022
Earlier work this paper cites.
Metagpt: Meta programming for multi-agent collaborative framework
S. Hong, X. Zheng, J. Chen, Y. Cheng, J. Wang, C. Zhang, Z. Wang, S. K. S. Yau, Z. Lin, L. Zhou, et al · 2023
Earlier work this paper cites.
Measuring and narrowing the compositionality gap in language models, 2023
O. Press, M. Zhang, S. Min, L. Schmidt, N. A. Smith, and M. Lewis · 2023
Earlier work this paper cites.
React: Synergizing reasoning and acting in language models, 2023
S. Yao, J. Zhao, D. Yu, N. Du, I. Shafran, K. Narasimhan, and Y. Cao · 2023
Cited alongside, same era.
A. Hurst, A. Lerer, A. P. Goucher, A. Perelman, A. Ramesh, A. Clark, A. Ostrow, A. Welihinda, A. Hayes, A. Radford, et al · 2024
Cited alongside, same era.
Deepseekmath: Pushing the limits of mathematical reasoning in open language models
Z. Shao, P. Wang, Q. Zhu, R. Xu, J. Song, X. Bi, H. Zhang, M. Zhang, Y. Li, Y. Wu, et al · 2024
Cited alongside, same era.
Aflow: Automating agentic workflow generation
J. Zhang, J. Xiang, Z. Yu, F. Teng, X. Chen, J. Chen, M. Zhuge, X. Cheng, S. Hong, J. Wang, et al · 2024
Cited alongside, same era.
Search-r1: Training llms to reason and leverage search engines with reinforcement learning, 2025
B. Jin, H. Zeng, Z. Yue, J. Yoon, S. Arik, D. Wang, H. Zamani, and J. Han · 2025
Closest in time.
Openmanus: An open-source framework for building general ai agents, 2025
X. Liang, J. Xiang, Z. Yu, J. Zhang, S. Hong, S. Fan, and X. Tang · 2025
Closest in time.
B. Liu, X. Li, J. Zhang, J. Wang, T. He, S. Hong, H. Liu, S. Zhang, K. Song, K. Zhu, et al · 2025
Closest in time.
Toolrl: Reward is all tool learning needs
C. Qian, E. C. Acikgoz, Q. He, H. Wang, X. Chen, D. Hakkani-Tür, G. Tur, and H. Ji · 2025
Closest in time.
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…
Y. Zheng, S. Sun, L. Qiu, D. Ru, C. Jiayang, X. Li, J. Lin, B. Wang, Y. Luo, R. Pan, et al · 2024
Cited alongside, same era.
Synthetic data generation and multi-step rl for reasoning and tool use, 2025
A. Goldie, A. Mirhoseini, H. Zhou, I. Cai, and C. D. Manning · 2025
Cited alongside, same era.
Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning
D. Guo, D. Yang, H. Zhang, J. Song, R. Zhang, R. Xu, Q. Zhu, S. Ma, P. Wang, X. Bi, et al · 2025
Cited alongside, same era.
Camel: Communicative agents for” mind” exploration of large language model society
G. Li, H. Hammoud, H. Itani, D. Khizbullin, and B. Ghanem
Cited in the paper.
Api-bank: A comprehensive benchmark for tool-augmented llms, 2023b
M. Li, Y. Zhao, B. Yu, F. Song, H. Li, H. Yu, Z. Li, F. Huang, and Y. Li
Cited in the paper.
Search-o1: Agentic search-enhanced large reasoning models, 2025a
X. Li, G. Dong, J. Jin, Y. Zhang, Y. Zhou, Y. Zhu, P. Zhang, and Z. Dou
Cited in the paper.
Torl: Scaling tool-integrated rl
X. Li, H. Zou, and P. Liu
Cited in the paper.
Qwen, :, A. Yang, B. Yang, B. Zhang, B. Hui, B. Zheng, B. Yu, C. Li, D. Liu, F. Huang, H. Wei, H. Lin, J. Yang, J. Tu, J. Zhang, J. Yang, J. Yang, J. Zhou, J. Lin, K. Dang, K. Lu, K. Bao, K. Yang, L. Yu, M. Li, M. Xue, P. Zhang, Q. Zhu, R. Men, R. Lin, T. Li, T. Tang, T. Xia, X. Ren, X. Ren, Y. Fan, Y. Su, Y. Zhang, Y. Wan, Y. Liu, Z. Cui, Z. Zhang, and Z. Qiu · 2025
Closest in time.
R1-searcher: Incentivizing the search capability in llms via reinforcement learning
H. Song, J. Jiang, Y. Min, J. Chen, Z. Chen, W. X. Zhao, L. Fang, and J.-R. Wen · 2025
Closest in time.
Deepresearcher: Scaling deep research via reinforcement learning in real-world environments
Y. Zheng, D. Fu, X. Hu, X. Cai, L. Ye, P. Lu, and P. Liu · 2025
Closest in time.