网易首页 > 网易号 > 正文 申请入驻

深度拆解 MiMo-V2.6:1M 上下文只是表面,2.5 万条轨迹才是底牌

0
分享至


代码、视觉、安全共用一套 RL,奖励机制也被重新设计。

作者丨郑佳美

编辑丨岑 峰

刚刚,小米正式发布并开源 MiMo-V2.6。Pro 拥有 1.02T 总参数、42B 激活参数,Flash 为 309B 总参数、15B 激活参数,两款模型支持 1M token 上下文,并覆盖文本、图像、视频和音频输入。

如果只看这些数字,第一反应或许会觉得这又是一次模型规模升级。但这次小米投入更多篇幅讨论的,其实是模型完成预训练之后,能力还能怎样继续往上推。


这也是为什么后训练成了 MiMo-V2.6 的核心部分。小米把代码、通用 Agent、视觉和网络安全任务放进同一套强化学习系统,单次 RL 更新使用 1568 个 prompt,每个 prompt 生成 16 条 rollout。

和普通问答不同,Agent 在这些任务里不是生成一段文本就结束,而是要不断读取环境、搜索信息、调用工具、执行操作,再根据返回结果调整下一步行动。训练对象因此不再只是最终答案,而是一整条包含状态、决策和反馈的行为轨迹。


当强化学习开始围绕这种长轨迹展开,问题自然也变了。模型不仅要承担更长上下文和持续生成带来的计算开销,还要同时处理大量执行时间完全不同的任务,等轨迹数量真正上来以后,单纯依靠成功或失败这样的奖励,又很难判断两条都完成任务的路径,哪一条更值得模型学习。

所以 MiMo-V2.6 后面的架构、异步训练和奖励设计,基本都是从这些实际问题里一步步长出来的。

01


1M 上下文背后

Agent 一旦开始长期停留在环境里,模型面对的计算形态就发生了变化。

以软件工程任务为例,模型可能先读取大量代码,随后搜索文件、修改函数、运行测试,再根据 terminal 返回继续行动。早期读取的内容需要留在上下文里,但当前一次决策真正频繁使用的,往往只是正在处理的代码、最近几轮工具结果以及局部状态。

MiMo-V2.6-Pro 的注意力结构正好利用了这种特征。70 层 Transformer 中,60 层采用 Sliding Window Attention,窗口只有 128 token,另外 10 层使用 Global Attention。也就是说,绝大多数层只处理附近信息,隔一段距离再由全局层完成长距离通信。


这样设计之后,1M 上下文并不意味着每一层、每一个 token 都要重新和完整上下文进行交互。当前操作需要的局部信息可以高频流动,远处的信息则通过少量全局层重新汇合。对于长时间运行的 Agent,这比把完整注意力铺满整个网络更符合实际工作负载。

参数侧采用了类似思路。Pro 虽然拥有 1.02T 总参数,每个 token 实际只激活约 42B 参数,每个 MoE 层有 384 个 routed expert,其中只调用 8 个。模型因此可以维持较大的专家容量,又不需要让每个 token 穿过全部参数。

这里的意义放到 RL 阶段会更明显。一次回答多算几个 token,成本差异有限,一次训练里同时生成数万条 rollout,每条轨迹又持续几十轮,任何单 token 计算量的增加都会被迅速放大。


MiMo-V2.6 还加入了 5 层 MTP speculative decoder,drafter 一次前向可以尝试给出后续多个 token,再交给主模型并行验证。官方模型卡给出的设计是一次前向预测后续 7 个 token。

SWA、Sparse MoE 和 MTP 放在一起看,就能看出 MiMo-V2.6 架构上的取舍:大容量负责装下能力,稀疏计算和局部注意力控制每一步的代价,推测解码则继续提高生成速度。

当单条轨迹能够以更低成本持续生成,RL 才有空间把 rollout 的数量推上去。而到了 MiMo-V2.6 这种一次更新就产生两万多条轨迹的规模,计算压力开始从模型内部蔓延到整个训练系统。


02


RL 开始像分布式生产系统

1568 个 prompt,每个采样 16 条 rollout,一次更新对应 25088 条 trajectory。困难之处在于,这 25088 条轨迹不会按照统一节奏结束。

有的代码任务几轮操作就找到问题,有的会不断运行测试、读取报错再重新修改;网络安全任务可能经历多次环境验证,视觉 Agent 又有不同的执行链路。轨迹长度、工具延迟和环境响应混在一起以后,一个 batch 内部很容易出现明显的长尾。

如果继续采用严格同步方式,已经完成任务的计算资源需要等待少数仍在运行的轨迹。规模越大,这种等待造成的资源浪费越明显。

MiMo-V2.6 用 fully asynchronous GRPO,把 rollout、环境执行、grader 和模型更新拆开运行。生成侧完成一条轨迹后可以继续领取任务,环境执行与评分各自推进,训练侧消费已经准备好的数据,不再要求一整个 batch 同时跨过每个阶段。

这种变化看起来属于工程优化,却直接影响了小米怎样组织 RL 数据。

MiMo-V2.6 没有为代码、通用 Agent、视觉和网络安全分别训练一套独立策略,而是把多领域任务以及不同 Agent harness 混入同一次 RL,小米将其称为 You Only RL Once。


原因在于这些任务虽然环境不同,内部却共享大量决策结构。模型需要判断当前状态缺什么信息、该调用哪个工具、执行结果是否符合预期、失败以后应该继续搜索还是修改方案。多个领域一起训练,这些行为策略可以直接在同一个 policy 中发生迁移。

多个 harness 的作用则更隐蔽。不同框架会改变 system prompt、工具定义和上下文组织方式,模型反复面对不同交互外壳后,就更难把某一种固定接口当成解题捷径。训练压力逐渐落到状态理解、工具选择和环境反馈这些更底层的能力上。


走到这里,Agent RL 的瓶颈已经发生了一次变化。模型能够比较高效地产生长轨迹,异步系统也能够持续吞吐不同环境,真正稀缺的东西开始变成轨迹里的有效反馈。

因为 25088 条 trajectory 并不天然等于 25088 份高质量训练信号。

03


从 GRS、GAR 到 MOPD2

传统可验证 RL 很依赖 binary reward。代码通过测试得到正向奖励,失败则没有。对于短任务,这种反馈已经足够清晰,但放进几十步甚至更长的 Agent 轨迹以后,大量过程差异会被压成同一个数字。

假设同一道任务生成 16 条 rollout,其中 5 条通过测试。一条可能快速定位根因,只修改必要代码。另一条经历大量无效搜索,还有一条虽然通过测试,却引入许多额外修改。只看 pass / fail,这几条成功轨迹很难拉开差距。

MiMo-V2.6 因此把 grader 从结果检查器进一步变成组内比较器。

GRS,也就是 Groupwise Reward Synthesis,会同时观察同一道任务产生的多条 rollout,从它们之间已经出现的差异中构造 task-specific rubric,再把过程质量与测试结果结合起来。评价标准因此会随着当前 policy 实际暴露出来的问题发生变化。

GAR(Groupwise Advantage Redistribution)则进一步影响策略更新。即使几条 trajectory 全部完成任务,grader 仍会继续比较它们,再把更多 advantage 分配给质量较高的方案。

官方也明确提到,这套过程会结合环境加固、异常筛查和 verifier cross-check 来处理 reward hacking。这里带来的变化很直接:RL 的计算投入不再只用来制造更多样本,还开始投入到理解样本。


当 rollout 数量已经很大时,再增加一批只有 0 和 1 的轨迹,信息增量可能有限,grader 如果能够继续拆出成功方案之间的质量差异,同样一轮环境交互便能产生更丰富的梯度信号。

可验证任务能够依赖这一套机制,开放式 Agent 却还有另一类困难。很多任务缺少稳定的自动 verifier,即使模型完成了一段复杂操作,也很难仅靠环境给出可靠评分。

MiMo-V2.6 在混合 RL 之后又加入 MOPD2,也就是 Multi-Prefix Multi-Teacher On-Policy Distillation。它会复用 Teacher trajectory 和 SFT demonstration 中已经存在的历史,把轨迹截取到某个中间状态,再让学生从这里继续 rollout。

假设一条 Agent 任务需要 40 步才能到达关键决策位置,训练这个位置时就不必反复生成前面 39 步。历史状态可以直接作为 prefix,训练资源集中到后续决策,同时一条教师轨迹还能提供多个可复用的训练起点。

GRS 和 GAR 解决的是可验证任务中反馈过粗的问题,MOPD2 则把高质量教师轨迹中的决策信息带进难以自动评分的区域。

MiMo-V2.6 也因此把 RL 的扩张从 rollout 数量继续推进到了反馈密度和轨迹复用。

04


Agent RL 正在从算法变成系统工程

MiMo-V2.6 给出的信号,其实已经超出了某一种 RL 算法本身。

Agent 进入真实环境以后,训练数据不再只有静态 token,还多出了状态、工具调用、执行结果、错误反馈和连续决策。模型需要亲自走过这些过程,才能产生一条能够用于强化学习的 trajectory。

这也让后训练的竞争维度发生了扩展。模型架构要能够承受长时间生成,分布式系统要持续运行大量异步环境,grader 要从成功轨迹中进一步拆出质量差异,教师轨迹还要被复用到难以自动验证的任务里。

MiMo-V2.6 依然运行在人设计的任务、环境、评分机制和训练框架内,但它展示出一种很清晰的方向:Agent 能力提升越来越依赖整个训练闭环的吞吐和反馈质量。

参数继续扩大当然还有价值,只是到了 Agent 阶段,另一个变量已经越来越难忽略 —— 一套训练系统能够生产多少有价值的行为轨迹,又能从这些轨迹里转化出多少有效的学习信号。

MiMo-V2.6 的技术意义,更多就落在这里。

参考链接: https://mimo.xiaomi.com/zh/mimo-v2-6

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!

公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
冷空气来了!广州今天还有大雨!中秋假期天气→

冷空气来了!广州今天还有大雨!中秋假期天气→

广州交通电台
2026-09-23 13:19:25
经济学家刘元春:居民消费上不去,根子不在老百姓,在分配!

经济学家刘元春:居民消费上不去,根子不在老百姓,在分配!

罗sir财话
2026-09-23 12:25:29
“苹果跳号小米跟不跟”上热搜 网友锐评:雷总别跳了!

“苹果跳号小米跟不跟”上热搜 网友锐评:雷总别跳了!

小柱解说游戏
2026-09-22 12:54:23
亚运战报:再爆大冷世界第2两连败!国羽2-0,韩国1-1

亚运战报:再爆大冷世界第2两连败!国羽2-0,韩国1-1

求球不落谛
2026-09-23 11:27:19
独家揭秘!郭士强为何拒用周琦?媒体人曝出真实原因,球迷炸锅

独家揭秘!郭士强为何拒用周琦?媒体人曝出真实原因,球迷炸锅

桃叶渡春
2026-09-23 15:13:55
全国公安机关视频会议召开,中共中央书记处书记、公安部部长王小洪出席并讲话

全国公安机关视频会议召开,中共中央书记处书记、公安部部长王小洪出席并讲话

政知新媒体
2026-09-23 00:29:59
为何 KFC 要几乎强制手机点单?看网友的吐槽:引起万千共鸣

为何 KFC 要几乎强制手机点单?看网友的吐槽:引起万千共鸣

另子维爱读史
2026-09-17 20:41:04
错换人生再起波澜!郭希宽墓碑刻“长子郭威、次子姚策”,杜新枝证实:全系郭威安排

错换人生再起波澜!郭希宽墓碑刻“长子郭威、次子姚策”,杜新枝证实:全系郭威安排

老猫观点
2026-09-23 07:05:55
62岁阿里董事长蔡崇信回湖州祖宅,乡亲夹道欢迎,风光无限!

62岁阿里董事长蔡崇信回湖州祖宅,乡亲夹道欢迎,风光无限!

大厂财经社
2026-09-23 01:23:03
iPhone 18 Pro Max被曝拍照出现绿斑 苹果客服回应

iPhone 18 Pro Max被曝拍照出现绿斑 苹果客服回应

TechWeb
2026-09-23 15:18:06
13冠!中国队夺得亚运会体操男子团体金牌

13冠!中国队夺得亚运会体操男子团体金牌

界面新闻
2026-09-23 15:05:39
美方在台湾问题上有了新说辞:若中国和平统一,美国不会反对

美方在台湾问题上有了新说辞:若中国和平统一,美国不会反对

吕醿极限手工
2026-08-27 14:18:48
央视+爱奇艺首播!40集民国谍战剧首发预告,圆滑秘书VS市侩记者,乱世兄妹演绎信仰觉醒之路!

央视+爱奇艺首播!40集民国谍战剧首发预告,圆滑秘书VS市侩记者,乱世兄妹演绎信仰觉醒之路!

影视快通车
2026-09-23 15:02:52
拆开21个月后,支付宝又合回去了

拆开21个月后,支付宝又合回去了

钛媒体APP
2026-09-23 11:31:34
十二点共识曝光,岛内震动!武器交中央、解放军驻台、台岛裁军?

十二点共识曝光,岛内震动!武器交中央、解放军驻台、台岛裁军?

冰语历史
2026-09-22 13:07:50
俄方:泽连斯基的声明自相矛盾

俄方:泽连斯基的声明自相矛盾

参考消息
2026-09-23 13:29:26
为啥很多娱乐公司不太待见谭松韵?不是演技不行,也不是长相问题,是她太清醒了,清醒到公司算完账发现,那套变现路子在她身上走不通

为啥很多娱乐公司不太待见谭松韵?不是演技不行,也不是长相问题,是她太清醒了,清醒到公司算完账发现,那套变现路子在她身上走不通

黎兜兜
2026-09-22 17:43:12
中国区独享!苹果出手限制“摇一摇”广告,豆瓣知乎QQ音乐百度网盘或受影响

中国区独享!苹果出手限制“摇一摇”广告,豆瓣知乎QQ音乐百度网盘或受影响

界面新闻
2026-09-23 15:09:23
平均年龄仅20.5岁!2场比赛进9球丢0球,成U23国足淘汰赛潜在对手

平均年龄仅20.5岁!2场比赛进9球丢0球,成U23国足淘汰赛潜在对手

大卫的篮球故事
2026-09-22 19:49:11
当众拒唱国歌不认中国籍,把两个孩子全送出国,如今报应终于来了

当众拒唱国歌不认中国籍,把两个孩子全送出国,如今报应终于来了

鹤羽说个事
2026-09-02 16:51:59
2026-09-23 17:11:00
AI科技评论 incentive-icons
AI科技评论
点评学术,服务AI
7667文章数 20785关注度
往期回顾 全部

科技要闻

2026网易未来大会下午:AI走进现实

头条要闻

33岁黄梅戏女演员确诊癌症 家人公开求助:她想活下去

头条要闻

33岁黄梅戏女演员确诊癌症 家人公开求助:她想活下去

体育要闻

300万英镑,他们买下了一位队史传奇

娱乐要闻

王玉雯杨玏被曝结婚又离 荒唐一幕出现

财经要闻

全市场都在卷自营

汽车要闻

5.1米的启境GX7,底盘凭什么又稳又舒服?

态度原创

游戏
本地
房产
家居
公开课

M站91分!银河城新作外媒满分:永恒经典 没有缺点

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

房产要闻

楼市变天!三亚第一个"接住"新政的楼盘出现了

家居要闻

2026建博会(广州) 公装联探展交流活动

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版