跳到正文
arXiv cs.SE· Han Li, Lingxiang Hu, Jiacheng Huang, Ziqian Jiang, Jingkai Luo, Wei Gao, Yunfan Tan, Zun Wang, Jiaheng Liu·· 4 小时前AI 评分38

TestPrism:重新思考超越单一参考实现的测试评估

TestPrism: Rethinking Test Evaluation Beyond a Single Reference

AI 导读

针对 LLM 编码智能体测试评估仅依赖单一参考解的问题,研究者推出 TestPrism,包含来自 17 个来源的 300 个测试任务和 3000 个候选实现,有效与无效解各占一半。

来源:arXiv cs.SE · arxiv.org