沉寂一段时间的罗福莉,突然凌晨在社交平台上发了一条消息,很短,但信息很重:我们用这段时间研究一个问题:强化学习(RL)能扩展到多远。
![]()
罗福莉称,MiMo-V2.6目前正处于其 RL 运行的中途。我们扩展了三件事:计算资源(每步约 20 亿 token,1568 个提示 × 16 次 rollout,完全异步)、环境和测试框架(多任务代理式 RL,在一次运行中混合多个测试框架),以及评估计算(代理式组内信用分配,带有测试用例和基于量规的奖励)。我们将在未来几周逐步开源细节。
![]()
消息一发布,评论区炸了:“太酷了”、“太优秀了”、“真是令人兴奋,迫不及待的想看到MiMo V2.6”、“incredible to share”……
![]()
![]()
翻译一下罗福莉的那短短100多字内容:
首先,虽然团队近半年没发消息,但不是摸鱼,而是在憋大招,在研究“强化学习”的极限在哪里。
其次,MiMo-V2.6 是他们的新一代模型。现在训练进行到一半,正在用强化学习调优。
另外,团队在三个核心维度上进行了史无前例的扩展:
1、计算资源的极致压榨。训练每步处理约20亿token,采用1568个提示词与16次Rollout(生成尝试)的庞大配置,这些训练任务不是排队等,而是同时并行跑,效率极高。
2、以前训练 AI 通常只针对单一任务(比如只学数学或只学编程)。这次他们让 AI 在同一个训练过程中同时处理多种任务,模拟一个“代理”(Agent)在真实环境中解决各种问题。
3、评估计算的精细化,引入了代理式组内信用分配与基于量规的奖励机制,让AI的每一步探索都能得到精准、多维度的反馈。
罗福莉还补充道:“我们相信,强化学习是自我提升中最具可扩展性和效率的路径之一。”
![]()
团队计划在未来几周逐步开源更多技术细节,包括训练配置、奖励设计、环境混合策略等。
届时,外界将能更完整地评估这套 RL的价值。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.