Fetching the paper…
Reading the bibliography…
Detecting tricky bugs in plausible programs, those that pass existing test suites yet still contain bugs, remains a significant challenge in software testing.
Search-based software test data generation: A survey
Phil McMinn. 2004 · 2004
Earlier work this paper cites.
KLEE: unassisted and automatic generation of high-coverage tests for complex systems programs
Cristian Cadar, Daniel Dunbar, and Dawson R. Engler. 2008 · 2008
Earlier work this paper cites.
Evosuite: Automatic test suite generation for object-oriented software
Gordon Fraser and Andrea Arcuri. 2011 · 2011
Earlier work this paper cites.
Search-based software testing: Past, present and future
Phil McMinn. 2011 · 2011
Earlier work this paper cites.
A survey of symbolic execution techniques
Roberto Baldoni, Emilio Coppa, Daniele Cono D’elia, Camil Demetrescu, and Irene Finocchi. 2018 · 2018
Earlier work this paper cites.
Evaluating large language models trained on code
Mark Chen, Jerry Tworek, Heewoo Jun, Qiming Yuan, Henrique Ponde de Oliveira Pinto, Jared Kaplan, Harri Edwards, Yuri Burda, Nicholas Joseph, Greg Brockman, et al. 2021 · 2021
Cited alongside, same era.
Pynguin: Automated unit test generation for python
Stephan Lukasczyk and Gordon Fraser. 2022 · 2022
Cited alongside, same era.
Nuances are the key: Unlocking ChatGPT to find failure-inducing tests with differential prompting
Tsz-On Li, Wenxi Zong, Yibo Wang, Haoye Tian, Ying Wang, Shing-Chi Cheung, and Jeff Kramer. 2023 · 2023
Cited alongside, same era.
The counterfeit conundrum: Can code language models grasp the nuances of their incorrect generations?
Alex Gu, Wen-Ding Li, Naman Jain, Theo Olausson, Celine Lee, Koushik Sen, and Armando Solar-Lezama. 2024 · 2024
Cited alongside, same era.
B4: Towards optimal assessment of plausible code solutions with plausible tests
Mouxiang Chen, Zhongxin Liu, He Tao, Yusu Hong, David Lo, Xin Xia, and Jianling Sun. 2024a
Cited in the paper.
Chatunitest: A framework for llm-based test generation
Yinghao Chen, Zehao Hu, Chen Zhi, Junxiao Han, Shuiguang Deng, and Jianwei Yin. 2024b
Cited in the paper.
Is your code generated by ChatGPT really correct? Rigorous evaluation of large language models for code generation
Jiawei Liu, Chunqiu Steven Xia, Yuyao Wang, and Lingming Zhang. 2023a
Cited in the paper.
Large language model-based agents for software engineering: A survey
Junwei Liu, Kaixin Wang, Yixuan Chen, Xin Peng, Zhenpeng Chen, Lingming Zhang, and Yiling Lou. 2024a
Cited in the paper.
TrickyBugs: A dataset of corner-case bugs in plausible programs
Kaibo Liu, Yudong Han, , Yiyang Liu, Jie M. Zhang, Zhenpeng Chen, Federica Sarro, Gang Huang, and Yun Ma. 2024b
Cited in the paper.
Who judges the judge: An empirical study on online judge tests
Kaibo Liu, Yudong Han, Jie M. Zhang, Zhenpeng Chen, Federica Sarro, Mark Harman, Gang Huang, and Yun Ma. 2023b
Cited in the paper.
Towards more realistic evaluation for neural test oracle generation
Zhongxin Liu, Kui Liu, Xin Xia, and Xiaohu Yang. 2023c
Cited in the paper.
Code-aware prompting: A study of coverage-guided test generation in regression setting using LLM
Gabriel Ryan, Siddhartha Jain, Mingyue Shang, Shiqi Wang, Xiaofei Ma, Murali Krishna Ramanathan, and Baishakhi Ray. 2024 · 2024
Closest in time.
An empirical evaluation of using large language models for automated unit test generation
Max Schäfer, Sarah Nadi, Aryaz Eghbali, and Frank Tip. 2024 · 2024
Closest in time.
Silent bugs in deep learning frameworks: An empirical study of Keras and TensorFlow
Florian Tambon, Amin Nikanjam, Le An, Foutse Khomh, and Giuliano Antoniol. 2024 · 2024
Closest in time.
Evaluating and improving ChatGPT for unit test generation
Zhiqiang Yuan, Mingwei Liu, Shiji Ding, Kaixin Wang, Yixuan Chen, Xin Peng, and Yiling Lou. 2024 · 2024
Closest in time.
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…