跳到正文
今天10月9日周五6 条
  1. arXiv cs.SE32

    可见推理并非通用优化器:分析代码生成中的人设与思考依赖效应

    一项基于 SQL-pandas 匹配查询基准的研究发现,可见 CoT 并不带来普遍准确率优势,让推理表示匹配目标语言(如"用 SQL 思考")也无一致收益。效果取决于人设、目标语言、模型配置与内部推理设置,控制消融实验进一步区分了推理内容与提示词格式的影响。研究认为推理策略应针对模型、人设、目标和内部推理配置联合选择,而非作为通用默认。

  2. arXiv cs.SE32

    研究:LLM 生成的无代码修复能否真正解决 bug?基于浏览器执行的自动化验证

    一项研究提出基于执行的自动化流水线,在真实浏览器环境中评估 LLM 生成无代码修复的能力,测试了 12 种配置生成的 322 个修复。结果显示,不同执行器下仅 14.6% 至 49.7% 的修复解决了 bug,最强配置 Claude Opus 4.6 在 Claude Sonnet 5 执行下最高解决 74.1%。

  3. arXiv cs.SE22

    跨供应商审查作为编码智能体的运行时契约:一项受控试点与故障注入研究

    研究提出一种跨供应商审查契约,要求编码智能体使用独立资源池、受限审查能力与逐次尝试的持久证据。在20轮配对开发试点中,8轮出现实质性审查发现(95%精确区间19.1-63.9%);边界扫描复现了部分输入下的假成功,并修复了进程回收期间的取消问题。CLI探测显示Claude无写入工具,Codex在5次只读试验中均尝试写入但均失败,未改动任何仓库。

8月20日周四
  1. Mistral AI71

    Mistral 发布 Agentic Search 检索层,FinanceBench 准确率提升至 86%

    Mistral 发布 Agentic Search,一个让模型在多步检索循环中查找、检查和验证信息的检索层,通过 Mistral Search Toolkit 提供,并内置于 Studio 和 Vibe 的 Libraries。

    推荐理由:原文给出多步检索循环在 FinanceBench 与 OfficeQA Pro 上的准确率、token 与延迟变化,可据此判断传统 one-shot RAG 的边界。

7月23日周四
  1. Sourcegraph Blog40

    Sourcegraph 推出 Code Finder:为编程智能体提供快速高效的代码搜索

    Sourcegraph 在 MCP server 中上线智能体搜索工具 Code Finder,它自行运行搜索循环,直接返回匹配的文件路径、行范围和用途说明。基准测试显示,Code Finder 比使用本地搜索工具的编程智能体快 2 倍以上,比调用其 MCP 工具的智能体成本低最多 40%,结果质量相当。该工具已通过 MCP 正式可用,并为 Deep Search 提供文件发现能力。