ReCodeAgent:面向大规模代码仓库的语言无关翻译与验证多智能体工作流
ReCodeAgent 是一种自主多智能体方法,用户只需提供源语言项目和目标语言,即可自动完成整个仓库的代码翻译与验证。在覆盖 6 种编程语言、4 种语言对的 118 个真实项目上,其测试通过率较此前方法提升 60.8%,平均成本 15.3 美元。改用单智能体架构后,通过率平均下降 40.4%,轨迹变长 28%。
ReCodeAgent 是一种自主多智能体方法,用户只需提供源语言项目和目标语言,即可自动完成整个仓库的代码翻译与验证。在覆盖 6 种编程语言、4 种语言对的 118 个真实项目上,其测试通过率较此前方法提升 60.8%,平均成本 15.3 美元。改用单智能体架构后,通过率平均下降 40.4%,轨迹变长 28%。
Arbiter 框架结合形式化评估规则与多模型 LLM 扫描,用于检测 LLM 编程智能体系统提示词中的干扰模式。该框架应用于 Claude Code、Codex CLI 和 Gemini CLI 三大编程智能体系统提示词,在无向扫描阶段发现 152 项问题,并在针对单一厂商的有向分析中人工标注出 21 种干扰模式。
一项基于 200 条 CyberGym 轨迹的研究诊断了 LLM 智能体在漏洞挖掘中的成本与失败原因:代码定位与理解、漏洞推理与触发设计占 token 消耗的 60.4%,且仅 24.4% 的对比在降低总成本的同时保持成功率。
SkillMorph 通过轨迹引导的故障定位来演化 Agent 技能,先对比重复运行与不同任务中失败和成功的抽象轨迹,定位可疑动作并找到技能中的编辑位置,再生成修订。
Spec Growth Engine 通过两层设计支撑 AI 辅助软件开发:第一层是不调用模型的确定性引擎,校验规格图、比对代码 import graph、依据测试证据授予节点验证状态并分类变更影响,防止 spec-code 偏离;第二层由 intent author、planner、coder 三个模型智能体分轮扩展规格图,每轮后由确定性规则决定是否继续。
论文对编码智能体中共装技能冲突做了首次实证研究,从 20,947 个仓库快照中挖掘出 822,109 对候选相似技能,经 LLM 判定后选取 312 对在三个模型上运行 6,368 次、169,294 次工具调用。