跳到正文
今天10月9日周五26 条
  1. Hugging Face Daily Papers36

    TestPrism:重新思考超越单一参考实现的测试评估

    LLM 编码智能体生成的测试通常只对照单一参考解评估,会高估测试质量。TestPrism 包含来自 17 个来源的 300 个测试任务和 3000 个候选实现,其 Joint Success Function 指标要求测试在初始程序状态失败、接受所有有效实现并拒绝所有无效实现,14 种基线配置下仅达 28.00%,而单一参考成功率高达 59.67%。

  2. arXiv cs.SE44

    ParanoiaEval:首个评测编程智能体不必要防御行为的基准

    ParanoiaEval 是首个统一评测编程智能体风险处理能力的基准,基于软件工程风险管理的 Avoidance-Transfer-Mitigation-Acceptance 框架,包含 200 个证据受控的仓库级任务对。在 8 个代表性模型上的实验显示,即便有明确证据,仍有 11.2%-58.7% 的运行出现不必要的风险处理,且更强的任务能力并不保证更恰当的风险处理。

  3. arXiv cs.SE23

    PropGen:用 LLM 自动生成属性,为移动应用属性测试提效

    PropGen 利用 LLM 从 GUI 状态推断应用功能假设,执行验证后合成属性并根据测试反馈修正不精确属性,实现移动应用属性测试的自动化。在 12 款真实 Android 应用上,它推断出 1,210 个有效功能并正确执行 977 个,生成 985 条属性(912 条有效),修正了 127 条不精确属性中的 118 条,发现 25 个此前未知的功能性 bug。

  4. arXiv cs.SE22

    SAIL:面向 UI 测试复用技能自适应模仿学习框架

    针对 UI 测试迁移中 LLM 高精度事件映射仍无法弥合源应用与目标应用实现差异的问题,研究者提出技能自适应模仿学习框架 SAIL。SAIL 以源测试用例为示范,对测试用例底层技能做多级抽象构建知识库,并通过上下文与历史感知的技能自适应选择性复用技能来指导目标应用测试生成。评估显示其成功率比 SOTA 方法高 149%。

  5. arXiv cs.SE43

    SWE-Journey:面向长周期多轮交互的编程助手更真实评测基准

    研究者推出 SWE-Journey 基准,用于更真实地评测 Claude Code、Codex 等编程助手。该基准通过弱到强合成流程自动构建长周期编程任务,并从真实交互数据中挖掘四类用户画像、构建用户模拟智能体来复现多轮交互。结果显示,面对软件架构师角色模型平均通过超 75% 的功能测试,而面对非程序员角色时通过率不足 25%。

  6. arXiv cs.SE32

    研究:LLM 生成的无代码修复能否真正解决 bug?基于浏览器执行的自动化验证

    一项研究提出基于执行的自动化流水线,在真实浏览器环境中评估 LLM 生成无代码修复的能力,测试了 12 种配置生成的 322 个修复。结果显示,不同执行器下仅 14.6% 至 49.7% 的修复解决了 bug,最强配置 Claude Opus 4.6 在 Claude Sonnet 5 执行下最高解决 74.1%。

  7. arXiv cs.SE38

    面向嵌入式软件开发的 LLM 智能体闭环评测基准

    研究者提出一套面向嵌入式编码智能体的闭环评测基准,包含五个嵌入式控制任务和四种反馈场景(一次性生成、真实自验证、CI 式红绿反馈、oracle 式详细反馈),实现目标为可复现的模拟 ESP32 固件。团队评测了 GPT 系列与 Qwen 系列的七种配置,共 420 次运行,gpt-5.4 通过率最高但未饱和基准,qwen3.5-27B 是表现最强的本地模型,较小的本地模型通过率与搜索效率明显下降。

  8. arXiv cs.SE31

    谁承担评审成本?AI 生成 Pull Request 的分诊、公平与问责

    一项覆盖 31 个国家 239 名代码评审者的问卷调查研究了 AI 生成 Pull Request(AIPR)如何被评审者治理。受访者表示 AI 署名并非一刀切的拒绝信号,评审投入取决于该贡献是否具备可问责性:范围有界、有项目依据的说明、CI 之外的验证、贡献者响应性以及可识别的合并后归属。

  9. arXiv cs.SE22

    跨供应商审查作为编码智能体的运行时契约:一项受控试点与故障注入研究

    研究提出一种跨供应商审查契约,要求编码智能体使用独立资源池、受限审查能力与逐次尝试的持久证据。在20轮配对开发试点中,8轮出现实质性审查发现(95%精确区间19.1-63.9%);边界扫描复现了部分输入下的假成功,并修复了进程回收期间的取消问题。CLI探测显示Claude无写入工具,Codex在5次只读试验中均尝试写入但均失败,未改动任何仓库。

  10. 量子位78

    谷歌发布办公 Agent Gemini Agent,支持调用 Claude

    Google Cloud 发布长文介绍 Gemini 在企业 Agent 领域的更新,核心是全新发布的 Gemini Agent,可查资料、写邮件、做 PPT、分析数据、编写运行代码并跨应用调用工具。

    推荐理由:谷歌把办公 Agent 的模型选择、企业身份与四类记忆机制一并公开,可对照 Meta、OpenAI 的路线差异。

  11. Claude Code Releases12

    Claude Code v2.1.295 发布

    Claude Code v2.1.295 为 command 和 HTTP hooks 新增 onFailure: "block",使无法启动、超时或异常退出的 hook 直接阻断操作;同时加入 Program Status Protocol(OSC 7501)支持,终端可显示 Claude Code 正在工作、等待用户还是已完成。

10月8日周四
  1. 爱范儿78

    微软发布 Surface Laptop Ultra 与混合智能 Windows 更新

    微软在特别发布会上推出 Surface Laptop Ultra,搭载 NVIDIA RTX Spark Superchip,最高 128GB 统一内存,可在本地运行超过 1200 亿参数模型,起价 2599 美元,10 月 7 日开放预订、10 月 16 日发货。

    推荐理由:微软把 Windows 的 AI 能力从 Copilot 入口扩展到本地模型、Agent 容器与算力调度,读者可据此判断 AI PC 的硬件与系统路线变化。

  2. Claude Code Releases18

    Claude Code v2.1.294 发布

    Claude Code 发布 v2.1.294,修复了以指令形式编写的 prompt 与 agent hooks(如"阻止某类命令")此前会放行本应拦截内容的问题。同时改进了 Stop 和 SubagentStop 上以指令形式编写的 prompt hooks(如"构建失败就继续")的判定方式,Claude 更不容易提前停止。

  3. 极客公园62

    极客早知道:ChatGPT 推出智能用户界面,谷歌上线 AI 游戏平台 Playground

    OpenAI 将 GPT-6 推向更广泛的 ChatGPT 用户,并推出 Intelligent UI 智能用户界面,可根据问题自动组合文字、图表、按钮、表单,生成可直接操作的计算器、账单分摊工具或小游戏,10 月 7 日起向 Plus、Pro、Business、Enterprise 用户逐步开放,Free 和 Go 用户 10 月 8 日起陆续获得支持。

  4. Google Developers Blog71

    Google 发布 AQuA 环境质量智能体,诊断生产环境智能体故障

    Google 发布 AQuA(Ambient Quality Agent),一个在 Google Cloud 项目内旁路运行的质量智能体,按计划、部署后或按需扫描 Cloud Trace、Cloud Logging 或 BigQuery 中的生产轨迹,经采样、评审、聚类、验证、跟踪五阶段流水线输出可验证的故障洞察。

    推荐理由:原文给出 AQuA 的五阶段流水线、成本数据和一次真实多智能体排查案例,可据此判断生产环境智能体质量监控的可行做法。

  5. NVIDIA Blog76

    NVIDIA 与 Microsoft 发布 RTX Spark 笔记本和 Windows 智能体基础设施

    在旧金山举行的 Windows AI and Surface 活动上,NVIDIA 与 Microsoft 宣布为 Windows PC 上的 AI 智能体共同设计软硬件,并公布 RTX Spark 笔记本即日开启预售、10 月 16 日开售,紧凑型台式机 11 月上市。

    推荐理由:英伟达与微软把智能体运行所需的系统级容器和本地算力硬件一起端出,读者可据此判断本地智能体落地的软硬件门槛。

  6. Microsoft Research71

    微软开源 Agent Lightning v1.0:3500 行代码的轻量智能体 RL 框架

    微软研究院开源 Agent Lightning v1.0,一个约 3500 行代码的轻量智能体强化学习框架,提出 Harnessed Agentic RL 范式,让部署时使用的同一套 agent harness 直接参与训练,无需在训练框架内重新实现智能体。

    推荐理由:微软开源 Agent Lightning v1.0,用约 3500 行代码把真实 harness 直接接入 RL 训练,并给出 6000 样本的编码智能体训练结果。