跳到正文
今天10月9日周五25 条
  1. Hugging Face Daily Papers41

    Learn2Play Bench:LLM 智能体在陌生环境中从经验学习的效果如何?

    研究者推出 Learn2Play Bench,用规则新颖或反直觉的文本游戏评测 LLM 智能体的经验学习能力,游戏提供可复现反馈与自动评分,并变换实例测试知识迁移。评测 backbone 模型、自进化方法和 agent harness 后发现:保留完整动作与反馈记录比总结成规则更利于学习;顶尖人类玩家峰值分数高于受测智能体;固定 backbone 时更换 harness 可提升表现并降低推理成本。

  2. Hugging Face Daily Papers42

    ViSkill:用可演进的视觉原生技能强化 VLM 智能体

    ViSkill 是一个视觉原生技能学习框架,将成功交互编码为 VLM 智能体可直接调用的复合视觉技能卡,检索到的技能同时引导推理与奖励塑形,成功轨迹再蒸馏回技能库形成闭环。在 Sokoban、FrozenLake 和 PrimitiveSkill 上,ViSkill 总体成功率达 0.89,加入冷启动初始化后升至 0.91,优于所有对比的闭源与开源基线,且收敛快于标准 PPO。

  3. Hugging Face Daily Papers40

    OneSearch-VL:面向图像与视频的统一多模态深度研究智能体

    OneSearch-VL 是一个以视觉锚定证据图(VGEG)为核心的多模态深度研究智能体,统一处理单图、多图和视频研究任务。其 8B 版本在新建的 OneSearch-MI-Bench 和 OneSearch-Video-Bench 上分别比带工具访问的 Qwen3-VL-8B 提升 20.2 和 17.6 个百分点,并在 7 个图像基准和 VideoDR 上取得显著增益。

  4. Hugging Face Daily Papers22

    ME-World:面向细粒度具身交互的多智能体第一视角世界模型

    研究者提出多智能体第一视角世界模型 ME-World,将多智能体第一视角建模定义为多个智能体在共享世界中通过细粒度动作交互的同步自我流生成。该方法在共享 token 序列中联合去噪多条自我流,以所有智能体的目标视角位姿为条件,并用共享环境记忆约束生成,同时提出环境、更新与身份一致性指标。实验显示其在共享世界一致性、动作控制、身份保持和视频质量上优于现有方法。

  5. Hugging Face Daily Papers34

    MARGIN:面向多智能体基础模型协调的运行时置信度校准

    MARGIN 是一种运行时校准方法,通过置信度分带内近期准确率与自报置信度的比值,学习各模型专属的置信度修正,无需重训模型或预留校准集。在 18 模型池的代码生成、问答与数学评测中,其偏移后期望校准误差在两项代码生成迁移上优于全部五个在线校准基线,问答迁移上优于四个;代码生成协调实验中,答案选择准确率相比未校准的置信度加权提升 4.3 和 14.0 个百分点。

  6. arXiv cs.SE30

    超越组件测试:Agentic AI 系统的验证研究综述

    一项系统映射研究综合 262 篇论文,指出 Agentic AI 系统的验证需从组件测试转向对多步轨迹的上下文验证。研究提出覆盖行为、安全、时序、监管与多智能体五个维度的分类体系,发现文献集中于行为评估(105 篇),时序有效性最薄弱(仅 14 篇)。论文结合医疗、工业运营与智能出行三个案例,提出以有限自主规范、对抗性轨迹生成、运行时监控和可审计证据结构为核心的研究议程。

  7. arXiv cs.SE47

    ReCodeAgent:面向大规模代码仓库的语言无关翻译与验证多智能体工作流

    ReCodeAgent 是一种自主多智能体方法,用户只需提供源语言项目和目标语言,即可自动完成整个仓库的代码翻译与验证。在覆盖 6 种编程语言、4 种语言对的 118 个真实项目上,其测试通过率较此前方法提升 60.8%,平均成本 15.3 美元。改用单智能体架构后,通过率平均下降 40.4%,轨迹变长 28%。

  8. arXiv cs.SE26

    DITTO:面向 Pickle 格式预训练模型的安全审计上下文感知扫描器

    针对 Pickle 格式预训练模型的安全审计工具 DITTO 发布,它通过追踪 Pickle 虚拟机状态转移并进行上下文感知语义分析来推断模型意图。对超 1 万个 Hugging Face 仓库的分析显示 9.3% 仍依赖 Pickle;DITTO 实现 100% 扫描覆盖率、0% 漏报率和 0.7% 误报率,F1 达 0.966。

  9. arXiv cs.SE40

    Spec Growth Engine 实现:用确定性引擎防止 spec-code 偏离,用智能体扩展规格图

    Spec Growth Engine 通过两层设计支撑 AI 辅助软件开发:第一层是不调用模型的确定性引擎,校验规格图、比对代码 import graph、依据测试证据授予节点验证状态并分类变更影响,防止 spec-code 偏离;第二层由 intent author、planner、coder 三个模型智能体分轮扩展规格图,每轮后由确定性规则决定是否继续。

  10. 量子位62

    Sharpa 在 IROS 发布人形机器人 D01、灵巧手 W02 与外骨骼数据手套 AE01

    Sharpa 在 IROS 发布首款全自研通用人形机器人 D01、新一代灵巧手 W02 和外骨骼触感数据手套 AE01。D01 电子皮肤覆盖全身、触觉覆盖上半身,触觉采样率 100Hz,力感知范围 0.1—20N,重复定位精度 0.2mm;W02 主动自由度从 W01 的 22 个减到 21 个,整手尺寸缩小约 30%,指尖力感知范围 5mN—30N。

10月7日周三
  1. Cline Releases17

    Cline SDK v0.0.91 发布

    Cline SDK v0.0.91 发布,将缺失或无法识别的 finish reason 不再视为成功完成,新增 AgentModelFinishReason 的 unknown 状态,无工具活动时保留部分响应并以隐藏用户消息续跑一次,第二次 unknown 则判定失败。

9月23日周三
  1. Google Developers Blog71

    Antigravity SDK 支持本地 AI 模型,首发适配 Gemma 4 26B A4B

    Google 宣布 Antigravity SDK 支持本地模型与多种执行方式,首发通过 Google AI Edge 的 LiteRT 支持 Gemma 4 26B A4B,可在完全离线状态下提供智能体辅助。

    推荐理由:官方给出本地模型接入 Antigravity SDK 的完整配置与混合编排示例,可据此评估离线智能体工作流的成本与隐私取舍。

9月17日周四
9月16日周三
  1. Google Developers Blog60

    Gemini Enterprise Agent Platform 上线 Agent Anomaly Detection 私测

    Google 在 Gemini Enterprise Agent Platform 上为 Agent Anomaly Detection 开启 Private Preview,用推理层审计智能体的推理轨迹、工具调用和执行流程,标记行为异常、可疑意图与策略违规。

    推荐理由:原文给出分层检测流程与一个抓取型异常实例,可据此判断智能体行为审计在生产中的落地方式。

9月15日周二
9月9日周三
9月4日周五
9月2日周三
  1. Google Developers Blog62

    Google 从 AI Agents Challenge 参赛作品中总结四种智能体工程模式

    Google for Startups AI Agents Challenge 评审发现,排名靠前的参赛作品反复出现四种工程模式:双向 MCP(智能体既是自身工具的客户端,也是其他智能体可调用的服务端)、事件驱动并发(智能体通过事件总线并行响应同一信号而非串行调用)、同标准回退(小模型顶替过载模型时仍走同一验证函数)、分层路由(先用正则和廉价模型分类,再交给完整推理模型)。

    推荐理由:从真实参赛代码中提炼四种智能体工程模式,可迁移到自己的构建中。