Fetching the paper…
Reading the bibliography…
Code benchmarks such as HumanEval are widely adopted to evaluate the capabilities of Large Language Models (LLMs), providing insights into their strengths and weaknesses.
Language models are few-shot learners
Brown, T.; Mann, B.; Ryder, N.; Subbiah, M.; Kaplan, J. D.; Dhariwal, P.; Neelakantan, A.; Shyam, P.; Sastry, G.; Askell, A.; et al. 2020 · 1901
Earlier work this paper cites.
Program Synthesis with Large Language Models
Austin, J.; Odena, A.; Nye, M.; Bosma, M.; and Michalewski, H. 2021 · 2021
Earlier work this paper cites.
Evaluating Large Language Models Trained on Code
Chen, M.; Tworek, J.; Jun, H.; Yuan, Q.; and Pinto, H. P. d. O. 2021 · 2021
Earlier work this paper cites.
Measuring Coding Challenge Competence With APPS
Hendrycks, D.; Basart, S.; Kadavath, S.; Mazeika, M.; and Arora, A. 2021 · 2021
Earlier work this paper cites.
MultiPL-E: A Scalable and Extensible Approach to Benchmarking Neural Code Generation
Cassano, F.; Gouwar, J.; Nguyen, D.; Nguyen, S.; Phipps-Costin, L.; Pinckney, D.; Yee, M.-H.; Zi, Y.; Anderson, C. J.; Feldman, M. Q.; Guha, A.; Greenberg, M.; and Jangda, A. 2022 · 2022
Earlier work this paper cites.
Competition-level code generation with alphacode
Li, Y.; Choi, D.; Chung, J.; Kushman, N.; Schrittwieser, J.; Leblond, R.; Eccles, T.; Keeling, J.; Gimeno, F.; Dal Lago, A.; et al. 2022 · 2022
Earlier work this paper cites.
SecurityEval dataset: mining vulnerability examples to evaluate machine learning-based code generation techniques
Siddiq, M. L.; and Santos, J. C. 2022 · 2022
Earlier work this paper cites.
CERT: Continual Pre-Training on Sketches for Library-Oriented Code Generation
Zan, D.; Chen, B.; Yang, D.; Lin, Z.; and Kim, M. 2022 · 2022
Earlier work this paper cites.
Achiam, J.; Adler, S.; Agarwal, S.; Ahmad, L.; Akkaya, I.; Aleman, F. L.; Almeida, D.; Altenschmidt, J.; Altman, S.; Anadkat, S.; et al. 2023 · 2023
Earlier work this paper cites.
Bai, J.; Bai, S.; Chu, Y.; Cui, Z.; Dang, K.; Deng, X.; Fan, Y.; Ge, W.; Han, Y.; Huang, F.; et al. 2023 · 2023
Earlier work this paper cites.
ClassEval: A Manually-Crafted Benchmark for Evaluating LLMs on Class-level Code Generation
Du, X.; Liu, M.; Wang, K.; Wang, H.; and Liu, J. 2023 · 2023
Cited alongside, same era.
MathPrompter: Mathematical Reasoning using Large Language Models
Imani, S.; Du, L.; and Shrivastava, H. 2023 · 2023
Cited alongside, same era.
QA Dataset Explosion: A Taxonomy of NLP Resources for Question Answering and Reading Comprehension
Rogers, A.; Gardner, M.; and Augenstein, I. 2023 · 2023
Cited alongside, same era.
Code llama: Open foundation models for code
Roziere, B.; Gehring, J.; Gloeckle, F.; Sootla, S.; Gat, I.; Tan, X. E.; Adi, Y.; Liu, J.; Remez, T.; Rapin, J.; et al. 2023 · 2023
Cited alongside, same era.
Llama 2: Open foundation and fine-tuned chat models
Touvron, H.; Martin, L.; Stone, K.; Albert, P.; Almahairi, A.; Babaei, Y.; Bashlykov, N.; Batra, S.; Bhargava, P.; Bhosale, S.; et al. 2023 · 2023
DeepSeek-Coder: When the Large Language Model Meets Programming–The Rise of Code Intelligence
Guo, D.; Zhu, Q.; Yang, D.; Xie, Z.; Dong, K.; Zhang, W.; Chen, G.; Bi, X.; Wu, Y.; Li, Y.; et al. 2024 · 2024
Closest in time.
DevEval: A Manually-Annotated Code Generation Benchmark Aligned with Real-World Code Repositories
Li, J.; Li, G.; Zhao, Y.; Li, Y.; and Liu, H. 2024 · 2024
Closest in time.
StarCoder 2 and The Stack v2: The Next Generation
Lozhkov, A.; Li, R.; Allal, L. B.; Cassano, F.; and Lamy-Poirier, J. 2024 · 2024
Closest in time.
Exploring Multi-Lingual Bias of Large Code Models in Code Generation
Wang, C.; Li, Z.; Gao, C.; Wang, W.; Peng, T.; Huang, H.; Deng, Y.; Wang, S.; and Lyu, M. R. 2024 · 2024
Closest in time.
CodeBenchGen: Creating Scalable Execution-based Code Generation Benchmarks
Xie, Y.; Xie, A.; Sheth, D.; Liu, P.; and Fried, D. 2024 · 2024
Closest in time.
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…
Cited alongside, same era.
Execution-Based Evaluation for Open-Domain Code Generation
Wang, Z.; Zhou, S.; Fried, D.; and Neubig, G. 2023 · 2023
Cited alongside, same era.
Large Language Models Meet NL2Code: A Survey
Zan, D.; Chen, B.; Zhang, F.; Lu, D.; and Wu, B. 2023 · 2023
Cited alongside, same era.
RepoCoder: Repository-Level Code Completion Through Iterative Retrieval and Generation
Zhang, F.; Chen, B.; Zhang, Y.; Keung, J.; and Liu, J. 2023 · 2023
Cited alongside, same era.
Phi-3 technical report: A highly capable language model locally on your phone
Abdin, M.; Jacobs, S. A.; Awan, A. A.; Aneja, J.; Awadallah, A.; Awadalla, H.; Bach, N.; Bahree, A.; Bakhtiari, A.; Behl, H.; et al. 2024 · 2024
Cited alongside, same era.
McEval: Massively Multilingual Code Evaluation
Chai, L.; Liu, S.; Yang, J.; Yin, Y.; Jin, K.; Liu, J.; Sun, T.; Zhang, G.; Ren, C.; Guo, H.; et al. 2024 · 2024
Cited alongside, same era.
Cao, J.; Chen, Z.; Wu, J.; chi Cheung, S.; and Xu, C. 2024a
Cited in the paper.
Concerned with Data Contamination? Assessing Countermeasures in Code Language Model
Cao, J.; Zhang, W.; Cheung, S.-C.; and on, S. 2024b
Cited in the paper.
Yang, A.; Yang, B.; Hui, B.; Zheng, B.; Yu, B.; Zhou, C.; Li, C.; Li, C.; Liu, D.; Huang, F.; et al. 2024 · 2024
Closest in time.
CoderEval: A Benchmark of Pragmatic Code Generation with Generative Pre-trained Models
Yu, H.; Shen, B.; Ran, D.; Zhang, J.; and Liang, G. 2024 · 2024
Closest in time.
DeepSeek-Coder-V2: Breaking the Barrier of Closed-Source Models in Code Intelligence
Zhu, Q.; Guo, D.; Shao, Z.; Yang, D.; Wang, P.; Xu, R.; Wu, Y.; Li, Y.; Gao, H.; Ma, S.; et al. 2024 · 2024
Closest in time.
BigCodeBench: Benchmarking Code Generation with Diverse Function Calls and Complex Instructions
Zhuo, T. Y.; Vu, M. C.; Chim, J.; Hu, H.; and Yu, W. 2024 · 2024
Closest in time.