Learn2Play Bench:LLM 智能体在陌生环境中从经验学习的效果如何?
研究者推出 Learn2Play Bench,用规则新颖或反直觉的文本游戏评测 LLM 智能体的经验学习能力,游戏提供可复现反馈与自动评分,并变换实例测试知识迁移。评测 backbone 模型、自进化方法和 agent harness 后发现:保留完整动作与反馈记录比总结成规则更利于学习;顶尖人类玩家峰值分数高于受测智能体;固定 backbone 时更换 harness 可提升表现并降低推理成本。
研究者推出 Learn2Play Bench,用规则新颖或反直觉的文本游戏评测 LLM 智能体的经验学习能力,游戏提供可复现反馈与自动评分,并变换实例测试知识迁移。评测 backbone 模型、自进化方法和 agent harness 后发现:保留完整动作与反馈记录比总结成规则更利于学习;顶尖人类玩家峰值分数高于受测智能体;固定 backbone 时更换 harness 可提升表现并降低推理成本。
OneSearch-VL 是一个以视觉锚定证据图(VGEG)为核心的多模态深度研究智能体,统一处理单图、多图和视频研究任务。其 8B 版本在新建的 OneSearch-MI-Bench 和 OneSearch-Video-Bench 上分别比带工具访问的 Qwen3-VL-8B 提升 20.2 和 17.6 个百分点,并在 7 个图像基准和 VideoDR 上取得显著增益。
MARGIN 是一种运行时校准方法,通过置信度分带内近期准确率与自报置信度的比值,学习各模型专属的置信度修正,无需重训模型或预留校准集。在 18 模型池的代码生成、问答与数学评测中,其偏移后期望校准误差在两项代码生成迁移上优于全部五个在线校准基线,问答迁移上优于四个;代码生成协调实验中,答案选择准确率相比未校准的置信度加权提升 4.3 和 14.0 个百分点。
一项系统映射研究综合 262 篇论文,指出 Agentic AI 系统的验证需从组件测试转向对多步轨迹的上下文验证。研究提出覆盖行为、安全、时序、监管与多智能体五个维度的分类体系,发现文献集中于行为评估(105 篇),时序有效性最薄弱(仅 14 篇)。论文结合医疗、工业运营与智能出行三个案例,提出以有限自主规范、对抗性轨迹生成、运行时监控和可审计证据结构为核心的研究议程。
研究者发布 MCPacific,跨 17 个市场收集 368,754 条 MCP 服务器清单(对应 124,267 个唯一服务器),静态提取 1,328,233 条工具规格,并组织为含 58,915 项能力的分层功能分类体系。
一篇综述系统梳理了 LLM 在硬件功能验证中的应用,覆盖 SystemVerilog 断言生成、激励与 testbench 生成、缺陷定位与设计修复、模型检测与等价性检查、SAT/SMT 优化及新兴的智能体验证工作流。
论文对编码智能体中共装技能冲突做了首次实证研究,从 20,947 个仓库快照中挖掘出 822,109 对候选相似技能,经 LLM 判定后选取 312 对在三个模型上运行 6,368 次、169,294 次工具调用。
针对工具调用型 LLM 智能体的故障注入评测,研究者提出测量协议并构建 SSCBench,在 2 个 τ-bench 环境中对 4 种故障算子和 5 种智能体配置完成 1,191 次故障执行。
一项针对本地开源 LLM 智能体的实证研究提出包含 15 项移动性工作流任务的基准,用确定性检查器评估生成脚本、表格、图表与报告等完整工件。