网易首页 > 网易号 > 正文 申请入驻

深度拆解 MiMo-V2.6:1M 上下文只是表面,2.5 万条轨迹才是底牌

0
分享至


代码、视觉、安全共用一套 RL,奖励机制也被重新设计。

作者丨郑佳美

编辑丨岑 峰

刚刚,小米正式发布并开源 MiMo-V2.6。Pro 拥有 1.02T 总参数、42B 激活参数,Flash 为 309B 总参数、15B 激活参数,两款模型支持 1M token 上下文,并覆盖文本、图像、视频和音频输入。

如果只看这些数字,第一反应或许会觉得这又是一次模型规模升级。但这次小米投入更多篇幅讨论的,其实是模型完成预训练之后,能力还能怎样继续往上推。


这也是为什么后训练成了 MiMo-V2.6 的核心部分。小米把代码、通用 Agent、视觉和网络安全任务放进同一套强化学习系统,单次 RL 更新使用 1568 个 prompt,每个 prompt 生成 16 条 rollout。

和普通问答不同,Agent 在这些任务里不是生成一段文本就结束,而是要不断读取环境、搜索信息、调用工具、执行操作,再根据返回结果调整下一步行动。训练对象因此不再只是最终答案,而是一整条包含状态、决策和反馈的行为轨迹。


当强化学习开始围绕这种长轨迹展开,问题自然也变了。模型不仅要承担更长上下文和持续生成带来的计算开销,还要同时处理大量执行时间完全不同的任务,等轨迹数量真正上来以后,单纯依靠成功或失败这样的奖励,又很难判断两条都完成任务的路径,哪一条更值得模型学习。

所以 MiMo-V2.6 后面的架构、异步训练和奖励设计,基本都是从这些实际问题里一步步长出来的。

01


1M 上下文背后

Agent 一旦开始长期停留在环境里,模型面对的计算形态就发生了变化。

以软件工程任务为例,模型可能先读取大量代码,随后搜索文件、修改函数、运行测试,再根据 terminal 返回继续行动。早期读取的内容需要留在上下文里,但当前一次决策真正频繁使用的,往往只是正在处理的代码、最近几轮工具结果以及局部状态。

MiMo-V2.6-Pro 的注意力结构正好利用了这种特征。70 层 Transformer 中,60 层采用 Sliding Window Attention,窗口只有 128 token,另外 10 层使用 Global Attention。也就是说,绝大多数层只处理附近信息,隔一段距离再由全局层完成长距离通信。


这样设计之后,1M 上下文并不意味着每一层、每一个 token 都要重新和完整上下文进行交互。当前操作需要的局部信息可以高频流动,远处的信息则通过少量全局层重新汇合。对于长时间运行的 Agent,这比把完整注意力铺满整个网络更符合实际工作负载。

参数侧采用了类似思路。Pro 虽然拥有 1.02T 总参数,每个 token 实际只激活约 42B 参数,每个 MoE 层有 384 个 routed expert,其中只调用 8 个。模型因此可以维持较大的专家容量,又不需要让每个 token 穿过全部参数。

这里的意义放到 RL 阶段会更明显。一次回答多算几个 token,成本差异有限,一次训练里同时生成数万条 rollout,每条轨迹又持续几十轮,任何单 token 计算量的增加都会被迅速放大。


MiMo-V2.6 还加入了 5 层 MTP speculative decoder,drafter 一次前向可以尝试给出后续多个 token,再交给主模型并行验证。官方模型卡给出的设计是一次前向预测后续 7 个 token。

SWA、Sparse MoE 和 MTP 放在一起看,就能看出 MiMo-V2.6 架构上的取舍:大容量负责装下能力,稀疏计算和局部注意力控制每一步的代价,推测解码则继续提高生成速度。

当单条轨迹能够以更低成本持续生成,RL 才有空间把 rollout 的数量推上去。而到了 MiMo-V2.6 这种一次更新就产生两万多条轨迹的规模,计算压力开始从模型内部蔓延到整个训练系统。


02


RL 开始像分布式生产系统

1568 个 prompt,每个采样 16 条 rollout,一次更新对应 25088 条 trajectory。困难之处在于,这 25088 条轨迹不会按照统一节奏结束。

有的代码任务几轮操作就找到问题,有的会不断运行测试、读取报错再重新修改;网络安全任务可能经历多次环境验证,视觉 Agent 又有不同的执行链路。轨迹长度、工具延迟和环境响应混在一起以后,一个 batch 内部很容易出现明显的长尾。

如果继续采用严格同步方式,已经完成任务的计算资源需要等待少数仍在运行的轨迹。规模越大,这种等待造成的资源浪费越明显。

MiMo-V2.6 用 fully asynchronous GRPO,把 rollout、环境执行、grader 和模型更新拆开运行。生成侧完成一条轨迹后可以继续领取任务,环境执行与评分各自推进,训练侧消费已经准备好的数据,不再要求一整个 batch 同时跨过每个阶段。

这种变化看起来属于工程优化,却直接影响了小米怎样组织 RL 数据。

MiMo-V2.6 没有为代码、通用 Agent、视觉和网络安全分别训练一套独立策略,而是把多领域任务以及不同 Agent harness 混入同一次 RL,小米将其称为 You Only RL Once。


原因在于这些任务虽然环境不同,内部却共享大量决策结构。模型需要判断当前状态缺什么信息、该调用哪个工具、执行结果是否符合预期、失败以后应该继续搜索还是修改方案。多个领域一起训练,这些行为策略可以直接在同一个 policy 中发生迁移。

多个 harness 的作用则更隐蔽。不同框架会改变 system prompt、工具定义和上下文组织方式,模型反复面对不同交互外壳后,就更难把某一种固定接口当成解题捷径。训练压力逐渐落到状态理解、工具选择和环境反馈这些更底层的能力上。


走到这里,Agent RL 的瓶颈已经发生了一次变化。模型能够比较高效地产生长轨迹,异步系统也能够持续吞吐不同环境,真正稀缺的东西开始变成轨迹里的有效反馈。

因为 25088 条 trajectory 并不天然等于 25088 份高质量训练信号。

03


从 GRS、GAR 到 MOPD2

传统可验证 RL 很依赖 binary reward。代码通过测试得到正向奖励,失败则没有。对于短任务,这种反馈已经足够清晰,但放进几十步甚至更长的 Agent 轨迹以后,大量过程差异会被压成同一个数字。

假设同一道任务生成 16 条 rollout,其中 5 条通过测试。一条可能快速定位根因,只修改必要代码。另一条经历大量无效搜索,还有一条虽然通过测试,却引入许多额外修改。只看 pass / fail,这几条成功轨迹很难拉开差距。

MiMo-V2.6 因此把 grader 从结果检查器进一步变成组内比较器。

GRS,也就是 Groupwise Reward Synthesis,会同时观察同一道任务产生的多条 rollout,从它们之间已经出现的差异中构造 task-specific rubric,再把过程质量与测试结果结合起来。评价标准因此会随着当前 policy 实际暴露出来的问题发生变化。

GAR(Groupwise Advantage Redistribution)则进一步影响策略更新。即使几条 trajectory 全部完成任务,grader 仍会继续比较它们,再把更多 advantage 分配给质量较高的方案。

官方也明确提到,这套过程会结合环境加固、异常筛查和 verifier cross-check 来处理 reward hacking。这里带来的变化很直接:RL 的计算投入不再只用来制造更多样本,还开始投入到理解样本。


当 rollout 数量已经很大时,再增加一批只有 0 和 1 的轨迹,信息增量可能有限,grader 如果能够继续拆出成功方案之间的质量差异,同样一轮环境交互便能产生更丰富的梯度信号。

可验证任务能够依赖这一套机制,开放式 Agent 却还有另一类困难。很多任务缺少稳定的自动 verifier,即使模型完成了一段复杂操作,也很难仅靠环境给出可靠评分。

MiMo-V2.6 在混合 RL 之后又加入 MOPD2,也就是 Multi-Prefix Multi-Teacher On-Policy Distillation。它会复用 Teacher trajectory 和 SFT demonstration 中已经存在的历史,把轨迹截取到某个中间状态,再让学生从这里继续 rollout。

假设一条 Agent 任务需要 40 步才能到达关键决策位置,训练这个位置时就不必反复生成前面 39 步。历史状态可以直接作为 prefix,训练资源集中到后续决策,同时一条教师轨迹还能提供多个可复用的训练起点。

GRS 和 GAR 解决的是可验证任务中反馈过粗的问题,MOPD2 则把高质量教师轨迹中的决策信息带进难以自动评分的区域。

MiMo-V2.6 也因此把 RL 的扩张从 rollout 数量继续推进到了反馈密度和轨迹复用。

04


Agent RL 正在从算法变成系统工程

MiMo-V2.6 给出的信号,其实已经超出了某一种 RL 算法本身。

Agent 进入真实环境以后,训练数据不再只有静态 token,还多出了状态、工具调用、执行结果、错误反馈和连续决策。模型需要亲自走过这些过程,才能产生一条能够用于强化学习的 trajectory。

这也让后训练的竞争维度发生了扩展。模型架构要能够承受长时间生成,分布式系统要持续运行大量异步环境,grader 要从成功轨迹中进一步拆出质量差异,教师轨迹还要被复用到难以自动验证的任务里。

MiMo-V2.6 依然运行在人设计的任务、环境、评分机制和训练框架内,但它展示出一种很清晰的方向:Agent 能力提升越来越依赖整个训练闭环的吞吐和反馈质量。

参数继续扩大当然还有价值,只是到了 Agent 阶段,另一个变量已经越来越难忽略 —— 一套训练系统能够生产多少有价值的行为轨迹,又能从这些轨迹里转化出多少有效的学习信号。

MiMo-V2.6 的技术意义,更多就落在这里。

参考链接: https://mimo.xiaomi.com/zh/mimo-v2-6

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!

公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
亚运会乒乓球:日本2大世界冠军被淘汰!伊藤0:3,林诗栋蒯曼晋级

亚运会乒乓球:日本2大世界冠军被淘汰!伊藤0:3,林诗栋蒯曼晋级

国乒二三事
2026-09-23 13:29:19
专访|吴心伯:中美元首再会晤“承上启下”,推动两国关系稳中有进

专访|吴心伯:中美元首再会晤“承上启下”,推动两国关系稳中有进

澎湃新闻
2026-09-23 07:22:28
如今的中国底层,正出现一个超大规模的赌场?

如今的中国底层,正出现一个超大规模的赌场?

游文刀
2026-09-22 21:37:08
随着伊朗1-4、中国0-0,亚运男足八强已全部诞生:6大劲旅在列

随着伊朗1-4、中国0-0,亚运男足八强已全部诞生:6大劲旅在列

侧身凌空斩
2026-09-23 15:26:24
问界运营模式“调整”后,首位车企高层公开拜访华为任正非

问界运营模式“调整”后,首位车企高层公开拜访华为任正非

每日经济新闻
2026-09-23 17:21:03
太讽刺了!自己支持率跌到32%,却平均每天点名拜登3次,特朗普的"甩锅账本"被扒光

太讽刺了!自己支持率跌到32%,却平均每天点名拜登3次,特朗普的"甩锅账本"被扒光

可达鸭面面观
2026-09-22 20:05:12
演员黄渤发生意外

演员黄渤发生意外

品读时刻
2026-09-23 09:07:48
第4金!亚运会男子200自决赛:张展硕1分43秒49破亚洲纪录夺冠

第4金!亚运会男子200自决赛:张展硕1分43秒49破亚洲纪录夺冠

全景体育V
2026-09-23 16:35:38
日本爱知·名古屋亚运会的办赛方式正是大部分国人梦寐以求的......

日本爱知·名古屋亚运会的办赛方式正是大部分国人梦寐以求的......

细雨中的呼喊
2026-09-23 15:23:55
杨利伟含泪宣布!首批14名航天员停训停航,5人一辈子没等来火箭

杨利伟含泪宣布!首批14名航天员停训停航,5人一辈子没等来火箭

李博世财经
2026-09-23 09:54:37
不愿回国!两名朝鲜亚运代表团成员,希望留在日本寻求庇护

不愿回国!两名朝鲜亚运代表团成员,希望留在日本寻求庇护

全景体育V
2026-09-22 19:39:04
涉黑头目黄大发案二审维持原判:判处死刑立即执行;其控制近十个乡村,违法揽地从中渔利,侵占农民私有土地,霸占民宅,或涉暴力强拆事件

涉黑头目黄大发案二审维持原判:判处死刑立即执行;其控制近十个乡村,违法揽地从中渔利,侵占农民私有土地,霸占民宅,或涉暴力强拆事件

台州交通广播
2026-09-23 13:17:39
亚运女子游泳金牌全被中国选手拿下,仅剩一个项目日本选手能争金

亚运女子游泳金牌全被中国选手拿下,仅剩一个项目日本选手能争金

体娱一家亲
2026-09-23 17:53:27
补时连续废人动作!央视名嘴怒斥阿联酋队:想格斗别报错亚运项目

补时连续废人动作!央视名嘴怒斥阿联酋队:想格斗别报错亚运项目

我爱英超
2026-09-23 16:16:17
西贝餐厅风波再升级!官媒下场锐评,字字严厉,戳进罗永浩心窝

西贝餐厅风波再升级!官媒下场锐评,字字严厉,戳进罗永浩心窝

知法而形
2026-09-23 11:54:37
时隔60年再入亚运决赛!日乒男团3-0韩国 松岛张本户上都在进步

时隔60年再入亚运决赛!日乒男团3-0韩国 松岛张本户上都在进步

颜小白的篮球梦
2026-09-23 18:09:32
已击毙!伊朗军方宣布重大战果!

已击毙!伊朗军方宣布重大战果!

故事终将光明磊落
2026-09-21 19:03:25
台湾网红“馆长”在直播中表示,未来将不再组织赴大陆的活动,因为来一次亏一次,高昂的成本实在烧不起

台湾网红“馆长”在直播中表示,未来将不再组织赴大陆的活动,因为来一次亏一次,高昂的成本实在烧不起

人生录
2026-09-21 16:43:29
维尼修斯状态断崖下滑!皇马高层一头雾水,找不到维尼修斯低迷根源,迪奥曼德成左路替代人选

维尼修斯状态断崖下滑!皇马高层一头雾水,找不到维尼修斯低迷根源,迪奥曼德成左路替代人选

福酱的小时光
2026-09-23 17:20:33
17000名员工失业的饭碗谁来担?罗永浩回应了:你老板让人看得,顺便回应了“罗太君”的外号

17000名员工失业的饭碗谁来担?罗永浩回应了:你老板让人看得,顺便回应了“罗太君”的外号

王老师你还好吗
2026-09-23 06:36:55
2026-09-23 20:47:00
AI科技评论 incentive-icons
AI科技评论
点评学术,服务AI
7669文章数 20785关注度
往期回顾 全部

科技要闻

一夜三款新模型,AI价格战再升级

头条要闻

网友发帖称上海一家餐厅点9瓶矿泉水收621元 店员回应

头条要闻

网友发帖称上海一家餐厅点9瓶矿泉水收621元 店员回应

体育要闻

300万英镑,他们买下了一位队史传奇

娱乐要闻

王玉雯杨玏被曝结婚又离 荒唐一幕出现

财经要闻

全市场都在卷自营

汽车要闻

性能与实用兼得 全新奥迪S5 Avant上市 57.18万元

态度原创

亲子
游戏
健康
公开课
军事航空

亲子要闻

离职举报“炒菜锅洗拖把”,良心老师不该没有前程 |新京报快评

六年了,《原神》怎么还在最佳赏味期?

痘痘没成熟,千万别硬挤!

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

韩国最新型潜艇首次披露

无障碍浏览 进入关怀版