arXiv cs.SE· Bowen Yang, Jiajun Jiang, Luxue Yu, Yihao Wang, Fengjie Li, Dong Wang·· 4 小时前AI 评分36
PolyCodeEval:从函数到仓库的多语言代码生成基准
PolyCodeEval: Benchmarking Multilingual Code Generation from Functions to Repositories
AI 导读
研究者发布 PolyCodeEval,一个覆盖函数到仓库粒度的多语言代码生成基准,包含来自 5 种编程语言、58 个真实可执行开源仓库的 2,590 个任务,并采用统一执行协议评测。评测显示现有方法生成正确函数、文件、仓库的比例最高仅为 71.7%、76.7% 和 31.0%,且性能随语言差异明显。配对实验还表明,同文件相关函数的实现上下文能提升函数生成的可执行正确率。
来源:arXiv cs.SE · arxiv.org