arXiv cs.SE· Han Li, Lingxiang Hu, Jiacheng Huang, Ziqian Jiang, Jingkai Luo, Wei Gao, Yunfan Tan, Zun Wang, Jiaheng Liu·· 4 小时前AI 评分38
TestPrism:重新思考超越单一参考实现的测试评估
TestPrism: Rethinking Test Evaluation Beyond a Single Reference
AI 导读
针对 LLM 编码智能体测试评估仅依赖单一参考解的问题,研究者推出 TestPrism,包含来自 17 个来源的 300 个测试任务和 3000 个候选实现,有效与无效解各占一半。
来源:arXiv cs.SE · arxiv.org