可见推理并非通用优化器:分析代码生成中的人设与思考依赖效应
一项基于 SQL-pandas 匹配查询基准的研究发现,可见 CoT 并不带来普遍准确率优势,让推理表示匹配目标语言(如"用 SQL 思考")也无一致收益。效果取决于人设、目标语言、模型配置与内部推理设置,控制消融实验进一步区分了推理内容与提示词格式的影响。研究认为推理策略应针对模型、人设、目标和内部推理配置联合选择,而非作为通用默认。
一项基于 SQL-pandas 匹配查询基准的研究发现,可见 CoT 并不带来普遍准确率优势,让推理表示匹配目标语言(如"用 SQL 思考")也无一致收益。效果取决于人设、目标语言、模型配置与内部推理设置,控制消融实验进一步区分了推理内容与提示词格式的影响。研究认为推理策略应针对模型、人设、目标和内部推理配置联合选择,而非作为通用默认。
针对 LLM 生成 Three.js 体素世界缺乏可靠自动评分的问题,研究者提出 WorldBench 基准与评判器,它同时探索运行中的世界并读取代码,且不单独信任任一通道。
针对 LLM 编码智能体测试评估仅依赖单一参考解的问题,研究者推出 TestPrism,包含来自 17 个来源的 300 个测试任务和 3000 个候选实现,有效与无效解各占一半。
一项研究提出基于执行的自动化流水线,在真实浏览器环境中评估 LLM 生成无代码修复的能力,测试了 12 种配置生成的 322 个修复。结果显示,不同执行器下仅 14.6% 至 49.7% 的修复解决了 bug,最强配置 Claude Opus 4.6 在 Claude Sonnet 5 执行下最高解决 74.1%。
IRONPROOF 将 COBOL 解析为中间表示并生成 Python,再用 Z3 编码为共享输入上的公式,输出可机器校验的等价性证书(UNSAT)或反例(SAT)。
研究提出一种跨供应商审查契约,要求编码智能体使用独立资源池、受限审查能力与逐次尝试的持久证据。在20轮配对开发试点中,8轮出现实质性审查发现(95%精确区间19.1-63.9%);边界扫描复现了部分输入下的假成功,并修复了进程回收期间的取消问题。CLI探测显示Claude无写入工具,Codex在5次只读试验中均尝试写入但均失败,未改动任何仓库。
Mistral 发布 Agentic Search,一个让模型在多步检索循环中查找、检查和验证信息的检索层,通过 Mistral Search Toolkit 提供,并内置于 Studio 和 Vibe 的 Libraries。
推荐理由:原文给出多步检索循环在 FinanceBench 与 OfficeQA Pro 上的准确率、token 与延迟变化,可据此判断传统 one-shot RAG 的边界。
Sourcegraph 在 MCP server 中上线智能体搜索工具 Code Finder,它自行运行搜索循环,直接返回匹配的文件路径、行范围和用途说明。基准测试显示,Code Finder 比使用本地搜索工具的编程智能体快 2 倍以上,比调用其 MCP 工具的智能体成本低最多 40%,结果质量相当。该工具已通过 MCP 正式可用,并为 Deep Search 提供文件发现能力。