Fetching the paper…
Reading the bibliography…
Training effective AI agents for multi-turn interactions requires high-quality data that captures realistic human-agent dynamics, yet such data is scarce and expensive to collect manually.
Decoupled weight decay regularization
I. Loshchilov and F. Hutter · 2017
Earlier work this paper cites.
Deepspeed: System optimizations enable training deep learning models with over 100 billion parameters
J. Rasley, S. Rajbhandari, O. Ruwase, and Y. He · 2020
Earlier work this paper cites.
Large language models as tool makers
T. Cai, X. Wang, T. Ma, X. Chen, and D. Zhou · 2023
Earlier work this paper cites.
Flashattention-2: Faster attention with better parallelism and work partitioning, 2023
T. Dao · 2023
Earlier work this paper cites.
Camel: Communicative agents for "mind" exploration of large language model society
G. Li, H. A. A. K. Hammoud, H. Itani, D. Khizbullin, and B. Ghanem · 2023
Earlier work this paper cites.
Tail: Task-specific adapters for imitation learning with large pretrained models
Z. Liu, J. Zhang, K. Asadi, Y. Liu, D. Zhao, S. Sabach, and R. Fakoor · 2023
Earlier work this paper cites.
Generative agents: Interactive simulacra of human behavior
J. S. Park, J. O’Brien, C. J. Cai, M. R. Morris, P. Liang, and M. S. Bernstein · 2023
Earlier work this paper cites.
Toolformer: Language models can teach themselves to use tools
T. Schick, J. Dwivedi-Yu, R. Dessì, R. Raileanu, M. Lomeli, E. Hambro, L. Zettlemoyer, N. Cancedda, and T. Scialom · 2023
Earlier work this paper cites.
Reflexion: language agents with verbal reinforcement learning
N. Shinn, F. Cassano, A. Gopinath, K. R. Narasimhan, and S. Yao · 2023
Earlier work this paper cites.
Language agents as hackers: Evaluating cybersecurity skills with capture the flag
J. Yang, A. Prabhakar, S. Yao, K. Pei, and K. R. Narasimhan · 2023
Earlier work this paper cites.
Agent s: An open agentic framework that uses computers like a human
S. Agashe, J. Han, S. Gan, J. Yang, A. Li, and X. E. Wang · 2024
Earlier work this paper cites.
Claude 3.5 sonnet, 2024
Anthropic · 2024
Earlier work this paper cites.
Swe-search: Enhancing software agents with monte carlo tree search and iterative refinement
A. Antoniades, A. Örwall, K. Zhang, Y. Xie, A. Goyal, and W. Wang · 2024
Earlier work this paper cites.
Automated test generation to evaluate tool-augmented llms as conversational ai agents
S. Arcadinho, D. Aparício, and M. Almeida · 2024
Earlier work this paper cites.
Tapeagents: a holistic framework for agent development and optimization
D. Bahdanau, N. Gontier, G. Huang, E. Kamalloo, R. Pardinas, A. Piché, T. Scholak, O. Shliazhko, J. P. Tremblay, K. Ghanem, et al · 2024
Earlier work this paper cites.
Forest-of-thought: Scaling test-time compute for enhancing llm reasoning
Z. Bi, K. Han, C. Liu, Y. Tang, and Y. Wang · 2024
Earlier work this paper cites.
Agent-flan: Designing data and methods of effective agent tuning for large language models
Z. Chen, K. Liu, Q. Wang, W. Zhang, J. Liu, D. Lin, K. Chen, and F. Zhao · 2024
Cited alongside, same era.
A. Dubey, A. Jauhri, A. Pandey, A. Kadian, A. Al-Dahle, A. Letman, A. Mathur, A. Schelten, A. Yang, A. Fan, et al · 2024
Cited alongside, same era.
Scaling synthetic data creation with 1,000,000,000 personas, 2024
T. Ge, X. Chan, X. Wang, D. Yu, H. Mi, and D. Yu · 2024
Cited alongside, same era.
Chain-of-instructions: Compositional instruction tuning on large language models
S. A. Hayati, T. Jung, T. Bodding-Long, S. Kar, A. Sethy, J.-K. Kim, and D. Kang · 2024
Cited alongside, same era.
Llamafactory: Unified efficient fine-tuning of 100+ language models
Y. Zheng, R. Zhang, J. Zhang, Y. Ye, Z. Luo, Z. Feng, and Y. Ma · 2024
Later among the works it cites.
Owl: Optimized workforce learning for general multi-agent assistance in real-world task automation
CAMEL-AI.org · 2025
Closest in time.
Apt-1 blog, 2025
S. Cognition · 2025
Closest in time.
K.-H. Huang, A. Prabhakar, S. Dhawan, Y. Mao, H. Wang, S. Savarese, C. Xiong, P. Laban, and C.-S. Wu · 2025
Closest in time.
Intellagent: A multi-agent framework for evaluating conversational ai systems
E. Levi and I. Kadar · 2025
Closest in time.
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…
Y. Li, Y. Li, X. Wang, Y. Jiang, Z. Zhang, X. Zheng, H. Wang, H.-T. Zheng, P. Xie, P. S. Yu, et al · 2024
Cited alongside, same era.
J. Lu, T. Holleis, Y. Zhang, B. Aumayer, F. Nan, F. Bai, S. Ma, S. Ma, M. Li, G. Yin, et al · 2024
Cited alongside, same era.
Agentinstruct: An agentic framework for generating high-quality synthetic instruction data
A. Mitra, S. Patel, T. Chakrabarty, and C. Baral · 2024
Cited alongside, same era.
Training software engineering agents and verifiers with swe-gym
J. Pan, X. Wang, G. Neubig, N. Jaitly, H. Ji, A. Suhr, and Y. Zhang · 2024
Cited alongside, same era.
Tool learning with foundation models
Y. Qin, S. Hu, Y. Lin, W. Chen, N. Ding, G. Cui, Z. Zeng, X. Zhou, Y. Huang, C. Xiao, et al · 2024
Cited alongside, same era.
Mag-v: A multi-agent framework for synthetic data generation and verification
S. Sengupta, K. Curtis, A. Mallipeddi, A. Mathur, J. Ross, and L. Gou · 2024
Cited alongside, same era.
Synthesizing post-training data for llms through multi-agent simulation
S. Tang, X. Pang, Z. Liu, B. Tang, R. Ye, X. Dong, Y. Wang, and S. Chen · 2024
Cited alongside, same era.
Hammerbench: Fine-grained function-calling evaluation in real mobile device scenarios
J. Wang, J. Zhou, M. Wen, X. Mo, H. Zhang, Q. Lin, C. Jin, X. Wang, W. Zhang, and Q. Peng · 2024
Cited alongside, same era.
Torl: Scaling tool-integrated rl, 2025
X. Li, H. Zou, and P. Liu · 2025
Closest in time.
When benchmarks talk: Re-evaluating code llms with interactive feedback, 2025
J. Pan, R. Shar, J. Pfau, A. Talwalkar, H. He, and V. Chen · 2025
Closest in time.
Qwen2.5 technical report, 2025
Qwen, :, A. Yang, B. Yang, B. Zhang, B. Hui, B. Zheng, B. Yu, C. Li, D. Liu, F. Huang, H. Wei, H. Lin, J. Yang, J. Tu, J. Zhang, J. Yang, J. Yang, J. Zhou, J. Lin, K. Dang, K. Lu, K. Bao, K. Yang, L. Yu, M. Li, M. Xue, P. Zhang, Q. Zhu, R. Men, R. Lin, T. Li, T. Tang, T. Xia, X. Ren, X. Ren, Y. Fan, Y. Su, Y. Zhang, Y. Wan, Y. Liu, Z. Cui, Z. Zhang, and Z. Qiu · 2025
Closest in time.
Tooldial: Multi-turn dialogue generation method for tool-augmented language models
J. Shim, G. Seo, C. Lim, and Y. Jo · 2025
Closest in time.
V. Sirdeshmukh, K. Deshpande, J. Mols, L. Jin, E.-Y. Cardona, D. Lee, J. Kritz, W. Primack, S. Yue, and C. Xing · 2025
Closest in time.
Learn-by-interact: A data-centric framework for self-adaptive agents in realistic environments
H. Su, R. Sun, J. Yoon, P. Yin, T. Yu, and S. Ö. Arık · 2025
Closest in time.
G. Wölflein, D. Ferber, D. Truhn, O. Arandjelović, and J. N. Kather · 2025
Closest in time.
The lighthouse of language: Enhancing llm agents via critique-guided improvement
R. Yang, F. Ye, J. Li, S. Yuan, Y. Zhang, Z. Tu, X. Li, and D. Yang · 2025
Closest in time.
Magnet: Multi-turn tool-use data synthesis and distillation via graph translation, 2025
F. Yin, Z. Wang, I.-H. Hsu, J. Yan, K. Jiang, Y. Chen, J. Gu, L. T. Le, K.-W. Chang, C.-Y. Lee, H. Palangi, and T. Pfister · 2025
Closest in time.
Boosting tool use of large language models via iterative reinforced fine-tuning
Y. Zeng, X. Ding, Y. Wang, W. Liu, W. Ning, Y. Hou, X. Huang, B. Qin, and T. Liu · 2025
Closest in time.
Actionstudio: A lightweight framework for data and training of action models
J. Zhang, T. Hoang, M. Zhu, Z. Liu, S. Wang, T. Awalgaonkar, A. Prabhakar, H. Chen, W. Yao, Z. Liu, et al · 2025
Closest in time.