沉寂了将近半年,MiMo团队把这段时间花在了一个问题上:强化学习到底能扩展到什么程度。他们没有先给答案,而是先给了一组正在跑的数字。
MiMo-V2.6还在RL训练中
![]()
据披露,MiMo-V2.6目前正处于强化学习训练阶段,尚未结束。团队把这次训练中"被放大"的东西归纳为三块,其中第一块就是算力。
具体到量级:每一步约消耗20亿token,由1568条prompt乘以16次rollout构成,并且采用完全异步的方式推进。这组数字是这次曝光里最硬的部分,也是理解"扩展"二字的入口。
不只是堆算力
第二块被放大的是环境与工具链。团队提到的是多任务方向的环境和harness——也就是说,RL训练要跑起来,光有算力不够,还得有配套的任务环境和执行框架。
第三块则指向训练本身的组织方式。三块内容放在一起看,逻辑是清楚的:算力、环境、harness,缺一块,规模就上不去。
半年沉默换来的问题
值得注意的是时间线。团队用"近半年的沉默"来描述这段空窗期,并明确说这段时间只研究了一个问题——RL能扩展到多远。
这个提问方式本身就有信息量。它不是在问某个具体任务能不能做好,而是在问规模这条曲线还能不能继续往上走。MiMo-V2.6的这次训练,就是对这个问题的实测。
目前能确认的是训练仍在进行中,最终结果尚未公布。至于这次扩展会把模型带到什么水平,还要等训练跑完才有答案。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.