Learn2Play Bench:LLM 智能体在陌生环境中从经验学习的效果如何?
研究者推出 Learn2Play Bench,用规则新颖或反直觉的文本游戏评测 LLM 智能体的经验学习能力,游戏提供可复现反馈与自动评分,并变换实例测试知识迁移。评测 backbone 模型、自进化方法和 agent harness 后发现:保留完整动作与反馈记录比总结成规则更利于学习;顶尖人类玩家峰值分数高于受测智能体;固定 backbone 时更换 harness 可提升表现并降低推理成本。
研究者推出 Learn2Play Bench,用规则新颖或反直觉的文本游戏评测 LLM 智能体的经验学习能力,游戏提供可复现反馈与自动评分,并变换实例测试知识迁移。评测 backbone 模型、自进化方法和 agent harness 后发现:保留完整动作与反馈记录比总结成规则更利于学习;顶尖人类玩家峰值分数高于受测智能体;固定 backbone 时更换 harness 可提升表现并降低推理成本。
ViSkill 是一个视觉原生技能学习框架,将成功交互编码为 VLM 智能体可直接调用的复合视觉技能卡,检索到的技能同时引导推理与奖励塑形,成功轨迹再蒸馏回技能库形成闭环。在 Sokoban、FrozenLake 和 PrimitiveSkill 上,ViSkill 总体成功率达 0.89,加入冷启动初始化后升至 0.91,优于所有对比的闭源与开源基线,且收敛快于标准 PPO。
OneSearch-VL 是一个以视觉锚定证据图(VGEG)为核心的多模态深度研究智能体,统一处理单图、多图和视频研究任务。其 8B 版本在新建的 OneSearch-MI-Bench 和 OneSearch-Video-Bench 上分别比带工具访问的 Qwen3-VL-8B 提升 20.2 和 17.6 个百分点,并在 7 个图像基准和 VideoDR 上取得显著增益。
研究者提出 Traceable World State(TWS),一种面向机器人世界状态的溯源感知语义表示与参考运行时,通过不可变快照、有序更新和 SHA-256 哈希链实现确定性重放与防篡改日志。
一项综述系统梳理了 LLM 集成应用的七种反复出现的形态:LLM 聊天、自定义智能体、RAG、AI 增强工作流、copilot、编码智能体以及部分 agentic RAG,并以统一的智能体与工具词汇加以描述。
一项基于 200 条 CyberGym 轨迹的研究诊断了 LLM 智能体在漏洞挖掘中的成本与失败原因:代码定位与理解、漏洞推理与触发设计占 token 消耗的 60.4%,且仅 24.4% 的对比在降低总成本的同时保持成功率。
Sharpa 在 IROS 发布首款全自研通用人形机器人 D01、新一代灵巧手 W02 和外骨骼触感数据手套 AE01。D01 电子皮肤覆盖全身、触觉覆盖上半身,触觉采样率 100Hz,力感知范围 0.1—20N,重复定位精度 0.2mm;W02 主动自由度从 W01 的 22 个减到 21 个,整手尺寸缩小约 30%,指尖力感知范围 5mN—30N。
Google 发布 Agent Development Kit(ADK)for Kotlin 1.0 正式版,与 ADK 1.0 Core 功能对齐,并加入 Android 优先的端侧扩展。
推荐理由:官方给出 1.0 的功能清单与 Android 端侧扩展,可据此判断 Kotlin 智能体开发的可用边界。