TestPrism 提出多参考实现测试评测基准
热点事件持续更新
TestPrism 提出多参考实现测试评测基准
2 篇报道2 个报道来源4 小时前更新
先了解这件事
AI 综述
Han Li 等作者发布 TestPrism 基准,用于评测 LLM 编码智能体生成的测试。该基准包含来自 17 个来源的 300 个测试任务和 3000 个候选实现,有效与无效解各占一半,并配套提出 TestHelix 方法。 研究者称,现有评测通常只对照单一参考解,会高估测试质量。TestPrism 的 Joint Success Function 指标要求测试在初始程序状态失败、接受所有有效实现并拒绝所有无效实现;在 14 种基线配置下该指标仅达 28.00%,而单一参考成功率高达 59.67%。
AI 根据报道生成 · 1 小时前更新
最新进展10月9日 12:00
TestPrism:重新思考超越单一参考实现的测试评估报道时间线
沿着报道,了解事件的不同侧面。
10月9日
- arXiv cs.SETestPrism:重新思考超越单一参考实现的测试评估
针对 LLM 编码智能体测试评估仅依赖单一参考解的问题,研究者推出 TestPrism,包含来自 17 个来源的 300 个测试任务和 3000 个候选实现,有效与无效解各占一半。
10月8日
- Hugging Face Daily PapersTestPrism:重新思考超越单一参考实现的测试评估
LLM 编码智能体生成的测试通常只对照单一参考解评估,会高估测试质量。TestPrism 包含来自 17 个来源的 300 个测试任务和 3000 个候选实现,其 Joint Success Function 指标要求测试在初始程序状态失败、接受所有有效实现并拒绝所有无效实现,14 种基线配置下仅达 28.00%,而单一参考成功率高达 59.67%。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。