跳到正文
今天10月9日周五1 条
  1. Hugging Face Daily Papers36

    TestPrism:重新思考超越单一参考实现的测试评估

    LLM 编码智能体生成的测试通常只对照单一参考解评估,会高估测试质量。TestPrism 包含来自 17 个来源的 300 个测试任务和 3000 个候选实现,其 Joint Success Function 指标要求测试在初始程序状态失败、接受所有有效实现并拒绝所有无效实现,14 种基线配置下仅达 28.00%,而单一参考成功率高达 59.67%。

9月9日周三
  1. Google Developers Blog62

    Google 详解 Harness Engineering:如何评估、迭代与守护 AI 编码智能体

    Google Developers Blog 发文介绍智能体编码系统的 harness engineering,主张用行为评估补充 Terminal-Bench、DeepSWE 等端到端基准,断言智能体的中间执行步骤而非最终输出。

    推荐理由:Google 团队给出行为评估的写法与三步测试循环,可作为智能体编码系统迭代时的可迁移方法。