跳到正文
今天10月9日周五5 条
  1. Hugging Face Daily Papers62

    MiMo-V2.6:通过扩展强化学习走向自我改进

    MiMo-V2.6 系列是一套全模态模型家族,通过扩展强化学习算力推进模型智能。其 RL 扩展沿三个方向进行:每步消耗 1,568 个样本、2.7-3.7B tokens,上下文长度最高 1M;环境覆盖代码、通用、视觉与网络领域;并采用分组式智能体评分提供更准确的奖励信号。团队冻结 MoE 路由器并建立多层防御以抑制奖励攻击,同时开源训练动态、RL 环境与 RL 框架。

    推荐理由:报告公开了 MiMo-V2.6 的 RL 训练动态、环境与框架,可供研究大规模强化学习与自我改进的读者参考复现。

10月8日周四
  1. Google Research62

    Google Research 研究:AI 辅助提升专利撰写产出,但未必加速初级律师成长

    Google Research 在 NBER 发布一项为期三个月的专利撰写实地实验,将当时未发布的 Google Labs AI 专利写作助手(现属 Gemini Notebook)随机开放给 11 家知识产权律所的 133 名律师,其中三分之二获得早期访问权。

    推荐理由:三个月专利撰写实验区分了 AI 带来的即时产出提升与无辅助判断力的变化,为理解 AI 对专业能力的影响提供了实证。

10月7日周三
10月6日周二
10月5日周一
10月2日周五
  1. Hugging Face Blog62

    Ai2 开源科学报告生成模型 AstaBrief 8B

    Ai2 开源 AstaBrief 8B,一个把研究问题和检索到的文献片段转成带引用报告的小模型,基于 Qwen3-8B 训练,现已作为 Asta 的 Fast 模式上线,并同步开放模型权重和训练数据。

    推荐理由:原文给出了从 Qwen3-8B 出发的 SFT 加 DPO 训练配方与数据过滤经验,可迁移到其他垂直领域小模型。

  2. Hugging Face Blog36

    ServiceNow CoreAI 推出 AutoSynthData:为企业智能体生成训练数据

    ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败案例与更强教师的成功示范,自动生成并验证新的可执行训练任务,并随模型进步动态调整课程。该流程以 EnterpriseOps Gym 数据集为例演示,生成的任务需满足可行性、真实性与难度三项要求,验证器则需保证一致性、可靠性与完整性。

10月1日周四
9月29日周二
  1. Microsoft Research62

    微软研究院发布 Quine:面向生物学复杂性的 AI 研究系统

    微软研究院发布 Quine,一个面向生物学复杂性的 AI 研究系统,由跨序列、结构、功能、细胞状态和成像等多模态数据训练的生物世界模型,以及连接模型、科学工具、文献与科研人员的交互式 harness 组成。

    推荐理由:微软研究院公开 Quine 的多模态生物世界模型与实验闭环,并给出胰腺癌化合物筛选的湿实验验证结果。

9月28日周一
  1. Hugging Face Daily Papers22

    ReSPO:重塑序列策略优化,解决离策略学习中的梯度饥饿问题

    针对 RLVR 中复用 rollout 导致的梯度饥饿问题,研究者提出 ReSPO(Reshaped Sequence Policy Optimization),用基于 α-散度变分目标与指数方差控制倾斜的平滑双分支序列级核函数替代 clipping:正分支为欠生成的正面回复保留非零梯度权重,负分支抑制严重过度生成的负面回复。

9月21日周一
9月19日周六
9月1日周二
7月26日周日
  1. Berkeley AI Research32

    Berkeley AI Research 提出 ABBEL:用信念状态监督 LLM 长程交互中的摘要更新

    Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要内容以自然语言"信念状态"形式隔离并监督,通过受自编码器启发的信念评分机制提升长程交互效率。在协作编程基准 CollabBench 上,采用重建式信念评分的 ABBEL-rec-BG 将全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 数也显著低于全上下文设置。

4月20日周一
  1. Berkeley AI Research40

    GRASP:面向世界模型的基于梯度的长时程规划器

    伯克利 AI 研究团队提出 GRASP,一种面向学习型世界模型的基于梯度的规划器,通过将轨迹提升到虚拟状态实现跨时间并行优化、在状态迭代上直接注入随机性以探索、并重塑梯度让动作获得清晰信号,从而让长时程规划变得可行。该方法针对长时程规划中梯度爆炸/消失、非贪心结构导致的局部极小值以及高维视觉模型带来的脆弱"状态-输入"梯度问题。

1月10日周六
  1. Berkeley AI Research30

    伯克利提出信息驱动成像系统设计框架,登 NeurIPS 2025

    伯克利 AI Research 提出一套基于互信息的成像系统评估与优化框架,可直接从含噪测量中估计信息量,并在 NeurIPS 2025 论文中验证。该指标在彩色摄影、射电天文、无镜头成像和显微成像四个领域均能预测解码器性能,优化后设计可媲美端到端方法,且内存与算力需求更低、无需任务专用解码器。