Fetching the paper…
Reading the bibliography…
Scaling up executable code data is significant for improving language models' software engineering capability.
When code completion fails: a case study on real-world completions
Vincent J. Hellendoorn, Sebastian Proksch, Harald C. Gall, and Alberto Bacchelli · 2019
Earlier work this paper cites.
Dockerizeme: Automatic inference of environment dependencies for python code snippets
Eric Horton and Chris Parnin · 2019
Earlier work this paper cites.
Using devcontainers to standardize student development environments: An experience report
Sander Valstar, William G Griswold, and Leo Porter · 2020
Earlier work this paper cites.
Humpback: Code completion system for dockerfiles based on language models
K Hanayama, S Matsumoto, and S Kusumoto · 2020
Earlier work this paper cites.
Transformer feed-forward layers are key-value memories
Mor Geva, Roei Schuster, Jonathan Berant, and Omer Levy · 2021
Earlier work this paper cites.
Dockergen: A knowledge graph based approach for software containerization
Hongjie Ye, Jiahong Zhou, Wei Chen, Jiaxin Zhu, Guoquan Wu, and Jun Wei · 2021
Earlier work this paper cites.
React: Synergizing reasoning and acting in language models
Shunyu Yao, Jeffrey Zhao, Dian Yu, Nan Du, Izhak Shafran, Karthik R. Narasimhan, and Yuan Cao · 2023
Earlier work this paper cites.
The rise and potential of large language model based agents: A survey
Zhiheng Xi, Wenxiang Chen, Xin Guo, Wei He, Yiwen Ding, Boyang Hong, Ming Zhang, Junzhe Wang, Senjie Jin, Enyu Zhou, Rui Zheng, Xiaoran Fan, Xiao Wang, Limao Xiong, Yuhao Zhou, Weiran Wang, Changhao Jiang, Yicheng Zou, Xiangyang Liu, Zhangyue Yin, Shihan Dou, Rongxiang Weng, Wensen Cheng, Qi Zhang, Wenjuan Qin, Yongyan Zheng, Xipeng Qiu, Xuanjing Huang, and Tao Gui · 2023
Earlier work this paper cites.
Flows: Building blocks of reasoning and collaborating AI
Martin Josifoski, Lars Henning Klein, Maxime Peyrard, Yifei Li, Saibo Geng, Julian Paul Schnitzler, Yuxing Yao, Jiheng Wei, Debjit Paul, and Robert West · 2023
Earlier work this paper cites.
Parsel: Algorithmic reasoning with language models by composing decompositions
Eric Zelikman, Qian Huang, Gabriel Poesia, Noah D. Goodman, and Nick Haber · 2023
Earlier work this paper cites.
Autonomous large language model agents enabling intent-driven mobile GUI testing
Juyeon Yoon, Robert Feldt, and Shin Yoo · 2023
Earlier work this paper cites.
Toolcoder: Teach code generation models to use API search tools
Kechi Zhang, Ge Li, Jia Li, Zhuo Li, and Zhi Jin · 2023
Earlier work this paper cites.
Agentcoder: Multi-agent-based code generation with iterative testing and optimisation
Dong Huang, Qingwen Bu, Jie M. Zhang, Michael Luck, and Heming Cui · 2023
Earlier work this paper cites.
Gang Fan, Xiaoheng Xie, Xunjin Zheng, Yinan Liang, and Peng Di · 2023
Earlier work this paper cites.
Automatically generating dockerfiles via deep learning: Challenges and promises
Giovanni Rosa, Antonio Mastropaolo, Simone Scalabrino, Gabriele Bavota, and Rocco Oliveto · 2023
Cited alongside, same era.
Swe-bench: Can language models resolve real-world github issues?
Carlos E Jimenez, John Yang, Alexander Wettig, Shunyu Yao, Kexin Pei, Ofir Press, and Karthik R Narasimhan · 2024
Cited alongside, same era.
Swe-agent: Agent-computer interfaces enable automated software engineering
John Yang, Carlos E Jimenez, Alexander Wettig, Kilian Lieret, Shunyu Yao, Karthik Narasimhan, and Ofir Press · 2024
Cited alongside, same era.
Training software engineering agents and verifiers with swe-gym
Jiayi Pan, Xingyao Wang, Graham Neubig, Navdeep Jaitly, Heng Ji, Alane Suhr, and Yizhe Zhang · 2024
Cited alongside, same era.
Octoverse-2024
github · 2024
Cited alongside, same era.
Repairagent: An autonomous, llm-based agent for program repair
Islem Bouzenia, Premkumar T. Devanbu, and Michael Pradel · 2024
Later among the works it cites.
Aligning the objective of llm-based program repair
Junjielong Xu, Ying Fu, Shin Hwei Tan, and Pinjia He · 2024
Later among the works it cites.
Reposvul: A repository-level high-quality vulnerability dataset
Xinchen Wang, Ruida Hu, Cuiyun Gao, Xin-Cheng Wen, Yujia Chen, and Qing Liao · 2024
Later among the works it cites.
Repomastereval: Evaluating code completion via real-world repositories
Qinyun Wu, Chao Peng, Pengfei Gao, Ruida Hu, Haoyu Gan, Bo Jiang, Jinhe Tang, Zhiwen Deng, Zhanming Guan, Cuiyun Gao, et al · 2024
Later among the works it cites.
Vuleval: Towards repository-level evaluation of software vulnerability detection
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…
Self-collaboration code generation via chatgpt
Yihong Dong, Xue Jiang, Zhi Jin, and Ge Li · 2024
Cited alongside, same era.
Language agent tree search unifies reasoning, acting, and planning in language models
Andy Zhou, Kai Yan, Michal Shlapentokh-Rothman, Haohan Wang, and Yu-Xiong Wang · 2024
Cited alongside, same era.
CONLINE: complex code generation and refinement with online searching and correctness testing
Xinyi He, Jiaru Zou, Yun Lin, Mengyu Zhou, Shi Han, Zejian Yuan, and Dongmei Zhang · 2024
Cited alongside, same era.
Codeagent: Enhancing code generation with tool-integrated agent systems for real-world repo-level coding challenges
Kechi Zhang, Jia Li, Ge Li, Xianjie Shi, and Zhi Jin · 2024
Cited alongside, same era.
Chatdev: Communicative agents for software development
Chen Qian, Wei Liu, Hongzhang Liu, Nuo Chen, Yufan Dang, Jiahao Li, Cheng Yang, Weize Chen, Yusheng Su, Xin Cong, Juyuan Xu, Dahai Li, Zhiyuan Liu, and Maosong Sun · 2024
Cited alongside, same era.
Metagpt: Meta programming for A multi-agent collaborative framework
Sirui Hong, Mingchen Zhuge, Jonathan Chen, Xiawu Zheng, Yuheng Cheng, Jinlin Wang, Ceyao Zhang, Zili Wang, Steven Ka Shing Yau, Zijuan Lin, Liyang Zhou, Chenyu Ran, Lingfeng Xiao, Chenglin Wu, and Jürgen Schmidhuber · 2024
Cited alongside, same era.
Coverup: Coverage-guided llm-based test generation
Juan Altmayer Pizzorno and Emery D. Berger · 2024
Cited alongside, same era.
Xin-Cheng Wen, Xinchen Wang, Yujia Chen, Ruida Hu, David Lo, and Cuiyun Gao · 2024
Later among the works it cites.
Less is more? an empirical study on configuration issues in python pypi ecosystem
Yun Peng, Ruida Hu, Ruoke Wang, Cuiyun Gao, Shuqing Li, and Michael R Lyu · 2024
Later among the works it cites.
Swe-fixer: Training open-source llms for effective and efficient github issue resolution
Chengxing Xie, Bowen Li, Chang Gao, He Du, Wai Lam, Difan Zou, and Kai Chen · 2025
Closest in time.
Swe-rl: Advancing llm reasoning via reinforcement learning on open software evolution
Yuxiang Wei, Olivier Duchenne, Jade Copet, Quentin Carbonneaux, Lingming Zhang, Daniel Fried, Gabriel Synnaeve, Rishabh Singh, and Sida I Wang · 2025
Closest in time.
Swe-smith: Scaling data for software engineering agents
John Yang, Kilian Leret, Carlos E Jimenez, Alexander Wettig, Kabir Khandpur, Yanzhe Zhang, Binyuan Hui, Ofir Press, Ludwig Schmidt, and Diyi Yang · 2025
Closest in time.
Trae agent: An llm-based agent for software engineering with test-time scaling
Pengfei Gao, Zhao Tian, Xiangxin Meng, Xinchen Wang, Ruida Hu, Yuanan Xiao, Yizhou Liu, Zhao Zhang, Junjie Chen, Cuiyun Gao, et al · 2025
Closest in time.
Openrca: Can large language models locate the root cause of software failures?
Junjielong Xu, Qinan Zhang, Zhiqing Zhong, Shilin He, Chaoyun Zhang, Qingwei Lin, Dan Pei, Pinjia He, Dongmei Zhang, and Qi Zhang · 2025
Closest in time.
Ziyi Ni, Huacan Wang, Shuo Zhang, Shuo Lu, Ziyang He, Wang You, Zhenheng Tang, Yuntao Du, Bill Sun, Hongzhang Liu, et al · 2025
Closest in time.
Boosting vulnerability detection of llms via curriculum preference optimization with synthetic reasoning data
Xin-Cheng Wen, Yijun Yang, Cuiyun Gao, Yang Xiao, and Deheng Ye · 2025
Closest in time.