MiMo-V2.6:通过扩展强化学习走向自我改进
MiMo-V2.6 系列是一套全模态模型家族,通过扩展强化学习算力推进模型智能。其 RL 扩展沿三个方向进行:每步消耗 1,568 个样本、2.7-3.7B tokens,上下文长度最高 1M;环境覆盖代码、通用、视觉与网络领域;并采用分组式智能体评分提供更准确的奖励信号。团队冻结 MoE 路由器并建立多层防御以抑制奖励攻击,同时开源训练动态、RL 环境与 RL 框架。
推荐理由:报告公开了 MiMo-V2.6 的 RL 训练动态、环境与框架,可供研究大规模强化学习与自我改进的读者参考复现。