跳到正文
热点事件持续更新

TestPrism 提出多参考实现测试评测基准

2 篇报道2 个报道来源4 小时前更新

先了解这件事

AI 综述

Han Li 等作者发布 TestPrism 基准,用于评测 LLM 编码智能体生成的测试。该基准包含来自 17 个来源的 300 个测试任务和 3000 个候选实现,有效与无效解各占一半,并配套提出 TestHelix 方法。 研究者称,现有评测通常只对照单一参考解,会高估测试质量。TestPrism 的 Joint Success Function 指标要求测试在初始程序状态失败、接受所有有效实现并拒绝所有无效实现;在 14 种基线配置下该指标仅达 28.00%,而单一参考成功率高达 59.67%。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. arXiv cs.SE
    TestPrism:重新思考超越单一参考实现的测试评估

    针对 LLM 编码智能体测试评估仅依赖单一参考解的问题,研究者推出 TestPrism,包含来自 17 个来源的 300 个测试任务和 3000 个候选实现,有效与无效解各占一半。

10月8日
  1. Hugging Face Daily Papers
    TestPrism:重新思考超越单一参考实现的测试评估

    LLM 编码智能体生成的测试通常只对照单一参考解评估,会高估测试质量。TestPrism 包含来自 17 个来源的 300 个测试任务和 3000 个候选实现,其 Joint Success Function 指标要求测试在初始程序状态失败、接受所有有效实现并拒绝所有无效实现,14 种基线配置下仅达 28.00%,而单一参考成功率高达 59.67%。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。