网易首页 > 网易号 > 正文 申请入驻

MiMo-V2.6刚发,小米罗福莉扔出MiMo-V3新架构!引用DeepSeek多项成果

0
分享至


智东西
作者 江宇
编辑 李水青

智东西9月24日报道,昨晚,小米MiMo大模型负责人罗福莉发文,提前披露了MiMo-V3的新架构,其核心组件HySparse2率先登场,相关技术论文同步公布。


▲罗福莉发文

简单来说,这套新架构主要解决Agent越做越多轮之后出现的三个问题:长输入算得太多缓存占得太大,以及如何从越来越长的上下文里准确找到需要的信息

罗福莉直接给出了一组数据:与MiMo-V2.6采用的Hybrid SWA架构相比,在100万Token上下文下,HySparse2处理长输入时所需的预填充(Prefill)计算量降至约1/5,KV Cache占用降至约1/4.5;与此同时,其长上下文检索表现进一步提升,AgentPPL和LongPPL也有所下降。


▲HySparse2在长上下文表现、Prefill计算量和KV Cache占用上的对比

HySparse2论文由小米LLM-Core团队完成,共有15位作者,罗福莉为通讯作者并标注为Team Lead。论文参考文献里还出现了不少业内熟悉的成果。

其中,DeepSeek相关成果共有4项,包括DeepSeek-V2、DeepSeek-V3.2、DeepSeek-V4和DeepSeek-V4.1-Flash;此外,OpenAI的gpt-oss模型卡以及GPT-4.1相关评测工作也在引用之列。


▲HySparse2论文引用的4项DeepSeek相关成果

值得注意的是,距离小米上一轮模型更新,才过去两天

9月22日,小米大模型团队刚刚发布并开源新一代Xiaomi MiMo-V2.6系列,并预告后续将逐步开放MiMo-V2.6-Pro-UltraSpeed。相比MiMo-V2.6-Pro,后者在同等智力水平下输出速度提高20倍。

小米还同步开源了用于新模型训练的RL环境、框架以及模型技术报告。罗福莉当时称,MiMo-V2.6押注大规模RL扩展,进行了开源模型迄今最大规模的单次RL训练,团队将其视为探索RSI(递归自我改进)、通往AGI的新一步。

MiMo-V2.6刚刚把大规模RL摆到台前,这一次,小米把刀落到了模型底层架构上。

一、Agent多轮任务,带来更高的长输入成本

HySparse2解决的问题,与Agent越来越典型的一种工作模式有关:模型生成的动作很短,工具返回的内容却可能很长。

例如,Agent可能只生成一句搜索指令或一次工具调用,随后搜索引擎返回一篇长文档,代码工具返回大量运行日志。模型进行下一轮推理之前,需要先把这些新增内容处理一遍。

这个过程就是Prefill,也就是预填充

当Agent连续调用搜索、代码执行、文件读取等工具,文档、网页和运行记录会不断进入上下文。模型既要反复处理这些新增输入,还要保存越来越大的KV Cache,并在几十万甚至上百万Token的历史信息中找出当前真正需要的内容。

论文因此把长周期Agent推理面临的问题归纳为三个方面:降低Prefill计算量、减少KV Cache占用,以及提高长上下文检索准确率。

上一代HySparse已经做过一轮优化。它把全注意力层和稀疏注意力层交替排列,后面的稀疏层可以复用前一个全注意力层生成的KV Cache和选择索引,从而减少注意力计算和缓存占用。不过,在Prefill阶段,HySparse仍需要依次执行全部网络层。

到了HySparse2,小米进一步把Prefill的执行路径缩短:处理长输入时,模型跑完前半部分,就可以完成后续推理所需KV Cache的构建。

二、两级KV共享,让模型少跑一半

实现这一点的核心,是HySparse2采用的两级KV共享

第一层叫KV Bridging

HySparse2把模型主体分成Self-Decoder和Cross-Decoder两部分。前者由全注意力和滑动窗口注意力组成,后者则由全注意力和稀疏注意力组成。

在Cross-Decoder中,全注意力层生成K和V时,可以直接使用Self-Decoder对应全注意力层产生的隐藏状态。这样,后半部分无需再完整处理一次此前输入的全部Token。

第二层是KV Reuse

进入Cross-Decoder后,一个全注意力层生成的KV Cache和Token选择结果,还会继续提供给后续多个稀疏注意力层复用。两级共享叠加后,Cross-Decoder所需的KV Cache都可以根据Self-Decoder的隐藏状态构建。


▲HySparse2的两级KV共享架构

Prefill执行完Self-Decoder即可退出,无需再让后半部分完整跑过一次长输入。

HySparse2还调整了寻找长上下文信息的方式

上一代HySparse采用Block级选择,即一次选取一整块连续Token。HySparse2则改成了Token级选择,可以直接从上下文不同位置寻找相关Token。

这种变化更适合多轮Agent任务。比如一条真正有用的信息可能藏在很早之前的一次工具返回中,Block级方案为了取出其中一个Token,还需要一并处理周围的一整块内容;Token级方案则可以直接选择需要的位置。

论文消融实验显示,在相同注意力预算下,Token级方案在RULER-v2、MRCR-v2和GraphWalks等长上下文检索与图推理测试上均取得了更高得分。


▲Token级与Block级稀疏选择效果对比

HySparse2同时取消了Cross-Decoder中单独的SWA分支,改为强制保留最近一段上下文

论文实验中,每次固定保留最近128个Token,再从更早的上下文中选择1024个Token。近期信息和远距离信息因此能够共用同一份KV Cache,也减少了额外缓存。

以论文展示的49层模型为例,在Prefill与Decode分离部署时,Prefill节点只需要部署前25层,所需模型权重接近减半;这一阶段只需要执行一个全注意力层。

三、长上下文和Agent任务,效果提升更明显

为了验证HySparse2,小米团队训练了一组80B-A3B MoE模型,并与上一代HySparse以及MiMo-V2系列采用的Hybrid SWA进行比较。

三组模型采用相同的数据和训练计划,仅注意力架构不同。模型首先使用约5000亿Token进行预训练,上下文长度为32K;随后又使用约1000亿Token进行轻量后训练,并将上下文长度扩展至256K。

测试结果显示,HySparse2较明显的提升集中在长上下文检索和Agent任务

经过后训练后,相比HySparse,HySparse2在MRCR-v2和RULER-v2上的平均得分分别提高11.30和19.81个百分点;相比Hybrid SWA,则分别提高6.44和18.65个百分点。

在256K上下文下,HySparse2的RULER-v2得分达到58.45,HySparse为32.61,Hybrid SWA为35.74。

与此同时,HySparse2在论文测试的各个上下文长度下,AgentPPL和LongPPL均低于另外两种架构。


▲HySparse2在长上下文及Agent任务上的表现

计算和缓存方面的差距更加直接

在100万Token上下文下,HySparse2的Prefill FLOPs相比HySparse降至约34%,相比MiMo-V2系列采用的Hybrid SWA降至约20%

同一条件下,HySparse2的KV Cache占用为2.69GB,HySparse为6.72GB,Hybrid SWA达到12.09GB。换算下来,相比Hybrid SWA,HySparse2的缓存占用降至约1/4.5。


▲不同架构在长上下文下的Prefill计算量和KV Cache占用对比

在通用能力部分,小米团队给出的结论相对克制:三种架构在知识、推理和代码等能力上的整体表现大致相当,不同测试项目各有高低。

例如,HySparse2在BBH和MMLU-Pro上的成绩更高,HySparse则在DROP等项目上表现更好。


▲HySparse2与HySparse、Hybrid SWA在知识、推理、代码及长上下文任务上的表现对比

相比这些常规测试,HySparse2在RULER、NoLiMa等长上下文任务上的提升更加突出

论文还通过消融实验验证了不同设计带来的影响。

例如,取消独立SWA分支、采用强制局部窗口后,部分数学推理和MRCR-v2成绩有所变化,但这一设计省去了额外投影参数和局部KV Cache,同时让Prefill可以在模型中途直接退出。小米团队将其视为效率和模型能力之间的一项架构取舍

结语:MiMo-V3箭在弦上,罗福莉抢先亮剑

MiMo-V2.6刚刚发布两天,罗福莉已经提前透露了MiMo-V3的一项关键架构变化。

按照论文中的设计,HySparse2通过两级KV共享,让Prefill阶段只需运行大约一半模型,同时进一步减少长上下文计算量和KV Cache占用,并在多项长上下文、Agent任务上取得更高得分。

这也让MiMo-V3的一个技术方向提前变得清晰:面对越来越长、越来越多轮的Agent任务,小米正在继续压缩模型处理长输入的计算与存储成本。

从MiMo-V2.6押注大规模RL,到MiMo-V3提前亮出新的底层架构,小米MiMo团队的模型迭代节奏还在继续加快。

接下来,HySparse2会如何落到完整的MiMo-V3上,以及这套架构最终能带来怎样的实际表现,也值得继续关注。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
“双冠王”张博恒因伤放弃单项:团体永远高于个人

“双冠王”张博恒因伤放弃单项:团体永远高于个人

看看新闻Knews
2026-09-24 18:05:27
高中签率!半导体龙头今日申购

高中签率!半导体龙头今日申购

21世纪经济报道
2026-09-24 07:30:06
专访|北卡大学教授:中美朝着正确方向迈出一步,缓和局面会持续下去

专访|北卡大学教授:中美朝着正确方向迈出一步,缓和局面会持续下去

澎湃新闻
2026-09-24 07:24:27
北理工裴轶事件舆论升级!一句“巧克力属性”出圈,牵出论文时间线重大疑点,学历被贴上“水硕”标签

北理工裴轶事件舆论升级!一句“巧克力属性”出圈,牵出论文时间线重大疑点,学历被贴上“水硕”标签

火山詩话
2026-09-24 15:38:39
彻底翻盘!委内瑞拉公开认怂致谢特朗普,承诺大选重启外交新局面

彻底翻盘!委内瑞拉公开认怂致谢特朗普,承诺大选重启外交新局面

老马拉车莫少装
2026-09-24 21:36:20
孙颖莎:我们是放低姿态去拼对手

孙颖莎:我们是放低姿态去拼对手

中国青年报
2026-09-24 22:18:08
99年朱总理访美,被问中国给克林顿30万献金,总理:怎么才30万?

99年朱总理访美,被问中国给克林顿30万献金,总理:怎么才30万?

WarOH协虎
2024-12-01 22:10:02
在家约会被偷拍,一个比一个放荡?

在家约会被偷拍,一个比一个放荡?

文刀万
2026-09-21 17:05:10
乌媒:中国“神龙”航天飞机第四次入轨,三个月内两次回收和释放同一颗卫星

乌媒:中国“神龙”航天飞机第四次入轨,三个月内两次回收和释放同一颗卫星

零度Military
2026-09-24 17:29:06
收视破3,只是开始!郭麒麟、欧豪、张若昀要掀起一波谍战新高潮

收视破3,只是开始!郭麒麟、欧豪、张若昀要掀起一波谍战新高潮

时光琉影8
2026-09-24 10:49:59
金价大局已定?若无意外,从2027年起黄金价格可能迎来3大转变?

金价大局已定?若无意外,从2027年起黄金价格可能迎来3大转变?

谁将笑到最后
2026-09-24 06:43:26
从300元一斤到10元3斤,日本后悔不已:就不该把阳光玫瑰引进中国

从300元一斤到10元3斤,日本后悔不已:就不该把阳光玫瑰引进中国

铭记历史呀
2026-09-11 11:18:58
狂揽上亿!深圳老板干倒海外巨头,小众产品爆卖20万台,闷声发财

狂揽上亿!深圳老板干倒海外巨头,小众产品爆卖20万台,闷声发财

全球风情大揭秘
2026-09-24 05:42:09
中国队的金牌数量断层第一,日本媒体心有不甘,自己给自己找台阶

中国队的金牌数量断层第一,日本媒体心有不甘,自己给自己找台阶

娱圈办事处
2026-09-24 15:41:35
41岁C罗:我肯定会打进1000球才退役 有媒体想杀我但根本没法做到

41岁C罗:我肯定会打进1000球才退役 有媒体想杀我但根本没法做到

风过乡
2026-09-24 05:54:42
14.933分!兰星宇吊环亚运两连冠,邹敬园摘铜

14.933分!兰星宇吊环亚运两连冠,邹敬园摘铜

甜份超标的我
2026-09-24 22:12:26
9.78万!吉利新车正式上市!

9.78万!吉利新车正式上市!

科技堡垒
2026-09-24 09:38:59
父女在商场遭人堵截辱骂,4岁女儿被吓哭躲到桌子底下“我让爸爸给你道歉,你放过我们好吗”,外卖小哥热心解围,男子:愿拿1000元感谢

父女在商场遭人堵截辱骂,4岁女儿被吓哭躲到桌子底下“我让爸爸给你道歉,你放过我们好吗”,外卖小哥热心解围,男子:愿拿1000元感谢

背包旅行
2026-09-23 14:42:17
我75岁,存款300多万,血的教训告诫我:再亲的亲人也要留个心眼

我75岁,存款300多万,血的教训告诫我:再亲的亲人也要留个心眼

千秋文化
2026-06-12 20:21:36
94岁默多克天价遗产核心受益人曝光,竟是邓文迪当年“死缠烂打”抱紧默多克生下的两个女儿

94岁默多克天价遗产核心受益人曝光,竟是邓文迪当年“死缠烂打”抱紧默多克生下的两个女儿

户外钓鱼哥阿旱
2026-09-22 14:41:33
2026-09-24 23:20:49
智东西 incentive-icons
智东西
智东西,AI产业新媒体,专注报道人工智能的前沿技术发展,和技术应用带来的千行百业产业变革。
12663文章数 117170关注度
往期回顾 全部

科技要闻

Claude在DNA里挖出新发现!大佬张锋点赞

头条要闻

高市飞十几小时只见特朗普35分钟 回国未见美官员送机

头条要闻

高市飞十几小时只见特朗普35分钟 回国未见美官员送机

体育要闻

巴图姆,以父之名

娱乐要闻

93岁游本昌去世 最后一句话惹人泪目

财经要闻

跌光1400亿,“女王”亏麻了

汽车要闻

全新第四代博越L 上市限时价9.29万元起

态度原创

本地
数码
时尚
教育
公开课

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

数码要闻

铭凡推出UM780L Slim迷你主机:0.77L体积,板载LPDDR5X-7500

奶茶色穿出秋日味道,高级

教育要闻

开车导航出成题,能写出高分作文?导航绝不批评你,只是重新为你规划路线

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版