跳到正文
Hugging Face Daily Papers·· 2 天前精选AI 评分62

MiMo-V2.6:通过扩展强化学习走向自我改进

MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement

AI 导读

MiMo-V2.6 系列是一套全模态模型家族,通过扩展强化学习算力推进模型智能。其 RL 扩展沿三个方向进行:每步消耗 1,568 个样本、2.7-3.7B tokens,上下文长度最高 1M;环境覆盖代码、通用、视觉与网络领域;并采用分组式智能体评分提供更准确的奖励信号。团队冻结 MoE 路由器并建立多层防御以抑制奖励攻击,同时开源训练动态、RL 环境与 RL 框架。

推荐理由

报告公开了 MiMo-V2.6 的 RL 训练动态、环境与框架,可供研究大规模强化学习与自我改进的读者参考复现。

来源:Hugging Face Daily Papers · huggingface.co