AgentGarten:用代码世界构建可演化的智能体训练环境
AgentGarten 是一个将模拟器与游戏引擎同共享神经渲染器耦合的框架,用于构建实时交互环境,其仿真后端维护持久世界状态并执行程序定义的交互规则,渲染器则从统一接口导出的结构化条件生成视觉观测。
AgentGarten 是一个将模拟器与游戏引擎同共享神经渲染器耦合的框架,用于构建实时交互环境,其仿真后端维护持久世界状态并执行程序定义的交互规则,渲染器则从统一接口导出的结构化条件生成视觉观测。
SuperNav 是一个无需对 MLLM 做导航专项微调的智能体导航系统,通过 Navigation Skills、面向智能体的物理交互工具和任务进度与上下文管理,让预训练 MLLM 专注理解请求、感知场景与决策,把运动执行交给导航工具。
研究者推出 Learn2Play Bench,用规则新颖或反直觉的文本游戏评测 LLM 智能体的经验学习能力,游戏提供可复现反馈与自动评分,并变换实例测试知识迁移。评测 backbone 模型、自进化方法和 agent harness 后发现:保留完整动作与反馈记录比总结成规则更利于学习;顶尖人类玩家峰值分数高于受测智能体;固定 backbone 时更换 harness 可提升表现并降低推理成本。
ViSkill 是一个视觉原生技能学习框架,将成功交互编码为 VLM 智能体可直接调用的复合视觉技能卡,检索到的技能同时引导推理与奖励塑形,成功轨迹再蒸馏回技能库形成闭环。在 Sokoban、FrozenLake 和 PrimitiveSkill 上,ViSkill 总体成功率达 0.89,加入冷启动初始化后升至 0.91,优于所有对比的闭源与开源基线,且收敛快于标准 PPO。
OneSearch-VL 是一个以视觉锚定证据图(VGEG)为核心的多模态深度研究智能体,统一处理单图、多图和视频研究任务。其 8B 版本在新建的 OneSearch-MI-Bench 和 OneSearch-Video-Bench 上分别比带工具访问的 Qwen3-VL-8B 提升 20.2 和 17.6 个百分点,并在 7 个图像基准和 VideoDR 上取得显著增益。
研究者提出多智能体第一视角世界模型 ME-World,将多智能体第一视角建模定义为多个智能体在共享世界中通过细粒度动作交互的同步自我流生成。该方法在共享 token 序列中联合去噪多条自我流,以所有智能体的目标视角位姿为条件,并用共享环境记忆约束生成,同时提出环境、更新与身份一致性指标。实验显示其在共享世界一致性、动作控制、身份保持和视频质量上优于现有方法。
MARGIN 是一种运行时校准方法,通过置信度分带内近期准确率与自报置信度的比值,学习各模型专属的置信度修正,无需重训模型或预留校准集。在 18 模型池的代码生成、问答与数学评测中,其偏移后期望校准误差在两项代码生成迁移上优于全部五个在线校准基线,问答迁移上优于四个;代码生成协调实验中,答案选择准确率相比未校准的置信度加权提升 4.3 和 14.0 个百分点。
一项系统映射研究综合 262 篇论文,指出 Agentic AI 系统的验证需从组件测试转向对多步轨迹的上下文验证。研究提出覆盖行为、安全、时序、监管与多智能体五个维度的分类体系,发现文献集中于行为评估(105 篇),时序有效性最薄弱(仅 14 篇)。论文结合医疗、工业运营与智能出行三个案例,提出以有限自主规范、对抗性轨迹生成、运行时监控和可审计证据结构为核心的研究议程。
研究者发布 MCPacific,跨 17 个市场收集 368,754 条 MCP 服务器清单(对应 124,267 个唯一服务器),静态提取 1,328,233 条工具规格,并组织为含 58,915 项能力的分层功能分类体系。
ReCodeAgent 是一种自主多智能体方法,用户只需提供源语言项目和目标语言,即可自动完成整个仓库的代码翻译与验证。在覆盖 6 种编程语言、4 种语言对的 118 个真实项目上,其测试通过率较此前方法提升 60.8%,平均成本 15.3 美元。改用单智能体架构后,通过率平均下降 40.4%,轨迹变长 28%。
Arbiter 框架结合形式化评估规则与多模型 LLM 扫描,用于检测 LLM 编程智能体系统提示词中的干扰模式。该框架应用于 Claude Code、Codex CLI 和 Gemini CLI 三大编程智能体系统提示词,在无向扫描阶段发现 152 项问题,并在针对单一厂商的有向分析中人工标注出 21 种干扰模式。
研究者提出 Traceable World State(TWS),一种面向机器人世界状态的溯源感知语义表示与参考运行时,通过不可变快照、有序更新和 SHA-256 哈希链实现确定性重放与防篡改日志。
一项综述系统梳理了 LLM 集成应用的七种反复出现的形态:LLM 聊天、自定义智能体、RAG、AI 增强工作流、copilot、编码智能体以及部分 agentic RAG,并以统一的智能体与工具词汇加以描述。
一项基于 200 条 CyberGym 轨迹的研究诊断了 LLM 智能体在漏洞挖掘中的成本与失败原因:代码定位与理解、漏洞推理与触发设计占 token 消耗的 60.4%,且仅 24.4% 的对比在降低总成本的同时保持成功率。
针对 Pickle 格式预训练模型的安全审计工具 DITTO 发布,它通过追踪 Pickle 虚拟机状态转移并进行上下文感知语义分析来推断模型意图。对超 1 万个 Hugging Face 仓库的分析显示 9.3% 仍依赖 Pickle;DITTO 实现 100% 扫描覆盖率、0% 漏报率和 0.7% 误报率,F1 达 0.966。
研究者提出 PyCache Trap 攻击,利用 Python 加载器接受的替换字节码缓存,将良性源码与隐藏行为配对,在 100 个技能和 7 款扫描器上实现 94-100% 攻击成功率,且扫描器无法语义识别缓存中的行为。
一篇综述系统梳理了 LLM 在硬件功能验证中的应用,覆盖 SystemVerilog 断言生成、激励与 testbench 生成、缺陷定位与设计修复、模型检测与等价性检查、SAT/SMT 优化及新兴的智能体验证工作流。
SkillMorph 通过轨迹引导的故障定位来演化 Agent 技能,先对比重复运行与不同任务中失败和成功的抽象轨迹,定位可疑动作并找到技能中的编辑位置,再生成修订。
Spec Growth Engine 通过两层设计支撑 AI 辅助软件开发:第一层是不调用模型的确定性引擎,校验规格图、比对代码 import graph、依据测试证据授予节点验证状态并分类变更影响,防止 spec-code 偏离;第二层由 intent author、planner、coder 三个模型智能体分轮扩展规格图,每轮后由确定性规则决定是否继续。
论文对编码智能体中共装技能冲突做了首次实证研究,从 20,947 个仓库快照中挖掘出 822,109 对候选相似技能,经 LLM 判定后选取 312 对在三个模型上运行 6,368 次、169,294 次工具调用。
针对工具调用型 LLM 智能体的故障注入评测,研究者提出测量协议并构建 SSCBench,在 2 个 τ-bench 环境中对 4 种故障算子和 5 种智能体配置完成 1,191 次故障执行。
一项针对本地开源 LLM 智能体的实证研究提出包含 15 项移动性工作流任务的基准,用确定性检查器评估生成脚本、表格、图表与报告等完整工件。
研究构建了首个带时间戳的 Agent 技能复制网络,基于 GitSkills 中每个仓库的 git 历史,覆盖 GitHub 上 2,193,119 次技能采用。
研究提出一种治理合约机制:模型仅以带分数的观察记录形式输出感知结果,准入策略在预设假阳性上限下将分数映射为 true、false 或 unknown,unknown 即拒绝,再由确定性且经充分性校验的合约做最终裁决。