AgentGarten:用代码世界构建可演化的智能体训练环境
AgentGarten 是一个将模拟器与游戏引擎同共享神经渲染器耦合的框架,用于构建实时交互环境,其仿真后端维护持久世界状态并执行程序定义的交互规则,渲染器则从统一接口导出的结构化条件生成视觉观测。
AgentGarten 是一个将模拟器与游戏引擎同共享神经渲染器耦合的框架,用于构建实时交互环境,其仿真后端维护持久世界状态并执行程序定义的交互规则,渲染器则从统一接口导出的结构化条件生成视觉观测。
SuperNav 是一个无需对 MLLM 做导航专项微调的智能体导航系统,通过 Navigation Skills、面向智能体的物理交互工具和任务进度与上下文管理,让预训练 MLLM 专注理解请求、感知场景与决策,把运动执行交给导航工具。
研究者提出 Spatial Canvas Interface,让用户通过语义、身份、文本、像素四类绑定在空间中直接编排海报生成意图,并据此开发了海报生成模型 Compo。Compo 由预训练图像编辑模型适配而来,支持用户手动构建画布的直接推理和自动规划画布的 agentic 模式,无需从零训练专用海报生成器。实验显示其构图可控性强于通用图像生成模型和专用海报生成系统,同时保持高视觉质量。
研究者推出 RISEBench++,一个面向推理驱动视觉编辑(RISE)的基准,涵盖 Temporal、Causal、Spatial、Logical、Counterfactual 与 Hybrid 六类推理维度,细分为 12 个子类和 65 种任务类型,含 1000 条中英双语人工标注测试用例。
SpatialOPSD 是一个 on-policy 自蒸馏框架,将空间编码智能体已验证的执行轨迹作为特权信息,把空间推理能力内化进独立 MLLM,使其无需外部工具即可运行。
OneSearch-VL 是一个以视觉锚定证据图(VGEG)为核心的多模态深度研究智能体,统一处理单图、多图和视频研究任务。其 8B 版本在新建的 OneSearch-MI-Bench 和 OneSearch-Video-Bench 上分别比带工具访问的 Qwen3-VL-8B 提升 20.2 和 17.6 个百分点,并在 7 个图像基准和 VideoDR 上取得显著增益。
研究者提出多智能体第一视角世界模型 ME-World,将多智能体第一视角建模定义为多个智能体在共享世界中通过细粒度动作交互的同步自我流生成。该方法在共享 token 序列中联合去噪多条自我流,以所有智能体的目标视角位姿为条件,并用共享环境记忆约束生成,同时提出环境、更新与身份一致性指标。实验显示其在共享世界一致性、动作控制、身份保持和视频质量上优于现有方法。
MARGIN 是一种运行时校准方法,通过置信度分带内近期准确率与自报置信度的比值,学习各模型专属的置信度修正,无需重训模型或预留校准集。在 18 模型池的代码生成、问答与数学评测中,其偏移后期望校准误差在两项代码生成迁移上优于全部五个在线校准基线,问答迁移上优于四个;代码生成协调实验中,答案选择准确率相比未校准的置信度加权提升 4.3 和 14.0 个百分点。
Google for Startups AI Agents Challenge 评审发现,排名靠前的参赛作品反复出现四种工程模式:双向 MCP(智能体既是自身工具的客户端,也是其他智能体可调用的服务端)、事件驱动并发(智能体通过事件总线并行响应同一信号而非串行调用)、同标准回退(小模型顶替过载模型时仍走同一验证函数)、分层路由(先用正则和廉价模型分类,再交给完整推理模型)。
推荐理由:从真实参赛代码中提炼四种智能体工程模式,可迁移到自己的构建中。