网易首页 > 网易号 > 正文 申请入驻

硅谷扔出“巨内核”,中国团队祭出“超级算子”,万亿参数模型效率战打响!

0
分享至


智东西
作者 李水青
编辑 漠影

2.8万亿参数的大模型,究竟要怎么跑快?

近日,海内外团队盯上了全球最大参数量的开源模型——Kimi K3。K3凭借2.8万亿总参数、104B激活参数,刷新了开源模型的性能上限。但普通的AI服务器难以承载这么大参数量的模型,Kimi官方推荐64卡甚至更大规模的AI服务器才能装得下。有业内人士表示,一般未经优化的超节点跑Kimi K3,初始性能可能仅在10 tokens/s左右。


面对如何让2.8万亿参数的Kimi K3跑得更快这一难题,国内外团队几乎同时交出了答卷。

9月21日,浪潮信息在AICC 2026发布元脑SD200 Ultra超节点AI服务器,通过紧耦合128芯本土AI芯片,单机承载2.8万亿参数Kimi K3,Token生成时延首破5.85毫秒。


9月23日,海外TPU推理优化团队Inferact开源tpu-megakernels,用16颗谷歌TPU v7芯片把整个K3装进一个kernel(内核),配合DSpark投机解码,低并发Decode(解码)吞吐达到709 tokens/s。


一个用本土芯片做商业化超节点,一个用Google TPU做开源推理项目,指向了同一个技术思路:打破算子边界,把大模型推理的计算过程融合到极致。

大模型推理的竞争,正从模型算法层,深入到系统软件、芯片互联和内存管理层。

一、万亿MoE太难跑,海内外团队同时盯上算子融合

万亿参数大模型推理为什么慢?

很多人以为是算力不够,而实际瓶颈更在于数据搬运和内存带宽。

据知名半导体行研机构SemiAnalysis分析,K3一次前向计算的HBM带宽需求约1.5TB,896个专家需要分布到多张芯片上,每次前向还会触发超过120次All-to-All通信。即便芯片具备强大算力,数据传输跟不上节奏,大量计算能力也会被白白闲置。

对于Decode(解码)阶段而言,问题尤其明显。每生成一个Token,模型都需要持续读取大量权重。vLLM、TensorRT-LLM等传统推理框架往往需要启动大量Kernel,每个Kernel完成自己的加载、计算和写回,然后再启动下一个Kernel。

于是,计算之间出现了大量细小的“空泡”。这些碎片化空泡累积起来,就是实际速度与理论峰值之间的鸿沟。

既然kernel边界是浪费来源,那是否可以尝试消灭边界?

Inferact的思路是整个模型就是“一个kernel”。其megakernel方案使用Google Pallas,把K3的92个MoE层放进一个Pallas调用,在一个Kernel内部完成整个解码过程。当前层计算时,下一层权重就可以通过异步DMA提前从HBM搬运到片上VMEM。

这套打法成立的关键是TPU v7的架构特性。每个TensorCore自带64 MiB VMEM,数据进入VMEM后,其生命周期可以由程序显式控制。于是,Kernel作者可以主动安排哪些权重提前搬运,哪些激活继续驻留,哪些数据在使用结束后立即释放。换句话说,Inferact做的是把整个模型看成一个连续的数据流。


浪潮信息没有把整个模型彻底压成一个Kernel。

团队把众多基础算子融合成超级算子,用系统级紧耦合架构榨取整体效率。针对K3推理特点,他们把KDA、Gated MLA、MoE中众多基础算子融合为计算与通信协同执行的大算子,算子数量降低10倍,模型推理性能提升3倍以上。


具体来看,第一步是把小算子“焊成”大算子,减少中间停靠。按片上存储容量划分数据块,让前一步的结果直接留在寄存器或片上缓存中供后一步使用,减少kernel launch次数,也避免中间结果反复写入和读取HBM。

第二步,把通信和计算融合,让数据传输和计算同步进行。超级算子按照Tile(数据块)组织流水线,通过异步搬运和多缓冲机制,让下一块数据预取、当前数据计算和上一块结果写回同时进行。跨芯片通信也按照Tile推进,把通信延迟尽可能藏到计算过程里。

可以看到,前者把整个Decode过程放进一个megakernel,后者把大量细粒度算子融合成超级算子。

它们共同指向的,是传统“一个Op(算子)对应一个Kernel”的计算方式正在松动。

二、用K3优化K3:让AI参与超级算子优化

超级算子能够减少推理过程中的数据搬运与等待,但其设计和优化本身也是一项复杂的工程。数据如何复用、计算与通信如何衔接、不同阶段如何形成流水,都需要结合具体模型和硬件条件进行设计与验证。

这些工作需要大量人工投入。能否让AI参与其中,提高超级算子的生成与优化效率?

为此,浪潮信息在元脑SD200 Ultra适配Kimi K3的过程中引入“超级算子智能体”,让Kimi K3参与自身的推理优化。针对K3的推理特点,智能体生成通算融合、Tile级流水的超级算子,推动计算、通信与数据搬运协同执行。


浪潮信息首席AI战略官刘军在采访中打了个比方:过去大模型推理由数百个算子串联执行,如同绿皮火车途经数百个小站,反复启停装卸数据,整体效率低下;而超级算子就像一站直达的高铁,省去中间停靠开销。

刘军谈道,以往行业清楚这套模式的短板,但人工算子优化调度的工作量巨大。如今Agent带来解法,浪潮信息采用“用K3优化K3”的思路,依托超节点系统架构,由AI智能体自动生成超级算子,再经由模型校验迭代,性能较此前再度提升50%,形成循环加速。

可以看到,模型已经不只是被优化的对象,也开始成为优化基础设施的工具。这可能会成为下一代推理优化的重要范式。

三、芯片一张牌,系统一张牌:超节点打的是系统战

Agent时代,Token消耗增长数百万倍。据Gartner 2026年3月报告,一个Agent工作流每任务消耗的Token量是标准聊天机器人的5到30倍;高盛预测,到2030年全球Token消耗量将较2026年增长24倍,达到每月约120000万亿Token。


需求侧爆发,算力供给如何接住?

这里可以看到两个典型困境。

第一个是Kimi K3代表的“向上”。模型越来越大,推理能力越来越强,长上下文、复杂推理、多Agent协同越来越多,单机越来越难承载,算力系统需要不断突破模型能力上限。

第二个是DeepSeek代表的“向广”。当越来越多用户开始调用低成本模型,Token需求会迅速扩张。模型本身可能已经足够便宜,但如果算力供给跟不上,低价Token就很难持续。

浪潮信息的回答是Capability AI Compute(能力型智算)加Capacity AI Compute(容量型智算),两条线齐头并进。

向上,SD200 Ultra用5.85ms/token、单用户170 tokens/s,让前沿模型跑得起、跑得快。向广,HC2000多元算力机组用DirectCom 2.0极速架构,Prefill、Decode、FFN按负载匹配多元芯片,同等投资Token产能提升10倍。


中国玩家的护城河在哪里?

单看芯片,其与NVIDIA仍有差距,单卡算力、生态、工具链都有明显短板。但到了超节点层面,靠系统级创新可以追平甚至超越单卡更强但系统松散的方案。

以浪潮信息SD200 Ultra为例,其用3D Hyper Mesh架构紧耦合128芯本土AI芯片,提供8TB统一编址显存和64TB内存,通信时延低至0.69微秒。通过对称内存技术,首次在基于本土AI芯片的超节点上实现GPU显存直连,AllReduce通信时间降低3.5倍。

刘军谈道,超节点最基本的特征是显存要统一寻址,这一点做到了,才能把这么大的模型放进去,否则就只能叫节点集群,还是需要把模型拆分成若干段。

总的来说,芯片是一张牌,系统工程则是另一张牌。

当芯片之间能够形成更紧密的连接,内存能够形成统一空间,通信可以藏进计算过程,算子又可以由AI持续优化,单芯片性能之外的系统红利就开始释放。对于本土算力而言,这条路径尤其重要。

结语:万亿模型推理需求爆发,效率革命才刚刚开始

AI算力竞争,正从造出更快的芯片变为把现有芯片组织到极致。Inferact用16颗TPU证明一个kernel可以装下2.8万亿参数;浪潮信息用128颗本土芯片证明系统级紧耦合加超级算子,可以让本土算力跑进第一梯队。

两条路线,一个方向。大模型推理的效率革命,才刚刚开始。对中国AI产业,这个方向的特殊意义在于,在芯片工艺受限的约束下,系统级创新是确定性最高的追赶路径。浪潮信息迈出的这一步,值得被更多人看见。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
光绪为啥不敢真的杀了慈禧?溥仪晚年坦言:他敢杀,但是杀不起

光绪为啥不敢真的杀了慈禧?溥仪晚年坦言:他敢杀,但是杀不起

阿器谈史
2026-09-30 16:20:38
美国国务卿鲁比奥称卖武器给台湾“意味着我们就没有了”,国台办回应

美国国务卿鲁比奥称卖武器给台湾“意味着我们就没有了”,国台办回应

环球网资讯
2026-09-30 10:49:06
中日会谈气氛紧张,王毅外长当面警告日高官:敢翻案,中日没未来

中日会谈气氛紧张,王毅外长当面警告日高官:敢翻案,中日没未来

影孖看世界
2026-09-29 22:16:10
浏览器里塞进eSIM:47国通用,3GB免费3天

浏览器里塞进eSIM:47国通用,3GB免费3天

算力游侠
2026-09-29 00:12:19
民进党,极有可能在下一届台湾地区选举后,成为长期一家独大政党

民进党,极有可能在下一届台湾地区选举后,成为长期一家独大政党

趣文说娱
2026-09-06 14:26:45
俄总统新闻秘书:莫斯科很清楚中国在参与军控谈判问题上立场

俄总统新闻秘书:莫斯科很清楚中国在参与军控谈判问题上立场

俄罗斯卫星通讯社
2026-09-29 15:30:40
英刊公布最新世界大学排名,中国内地8所高校进前100名

英刊公布最新世界大学排名,中国内地8所高校进前100名

参考消息
2026-09-30 16:00:10
邮报:阿根廷新星们因见同胞受攻击,从而对登陆英超产生疑虑

邮报:阿根廷新星们因见同胞受攻击,从而对登陆英超产生疑虑

懂球帝
2026-09-29 22:57:07
胡歌上海街头被拍,1米8大个子缩着腿带娃,他骑的这车挺贵

胡歌上海街头被拍,1米8大个子缩着腿带娃,他骑的这车挺贵

小椰的奶奶
2026-09-30 05:37:30
为什么玻璃是透明的?你以为你知道,其实你根本不知道

为什么玻璃是透明的?你以为你知道,其实你根本不知道

心中的麦田
2026-09-29 20:53:31
突发! 只因一句话, 华人被赶下澳洲航班! 同机乘客曝光真相…

突发! 只因一句话, 华人被赶下澳洲航班! 同机乘客曝光真相…

澳微Daily
2026-09-30 10:10:02
冲CBA头号热门!曝香港金牛引进前NBA首轮10号秀索恩·梅克

冲CBA头号热门!曝香港金牛引进前NBA首轮10号秀索恩·梅克

狼叔评论
2026-09-30 15:44:09
乌情报头子说出实话:没有俄乌开战,俄罗斯绝不会对中国服软!

乌情报头子说出实话:没有俄乌开战,俄罗斯绝不会对中国服软!

莹莹的历史说
2026-09-26 01:43:47
贫穷能让一个人有多卑微?网友:给05年小富婆妹当过狗,还给130斤小富婆做了俩月男朋友

贫穷能让一个人有多卑微?网友:给05年小富婆妹当过狗,还给130斤小富婆做了俩月男朋友

带你感受人间冷暖
2026-09-15 00:05:19
我不看财报,隆基绿能跌成那样我没卖,就信太阳天天在

我不看财报,隆基绿能跌成那样我没卖,就信太阳天天在

真实人物采访
2026-09-29 21:00:11
伊朗:已收到美国对伊方有关结束战事提议的回应

伊朗:已收到美国对伊方有关结束战事提议的回应

新京报
2026-09-30 17:03:14
9月起,出租房屋要缴这些税!

9月起,出租房屋要缴这些税!

法律内参
2026-09-25 01:42:09
终于等来这一天!国家体育总局正式出手,全红婵的苦日子熬到头了

终于等来这一天!国家体育总局正式出手,全红婵的苦日子熬到头了

江启
2026-08-04 09:37:11
东方甄选回应网红“溜溜凳”风波:2倍退款不退货

东方甄选回应网红“溜溜凳”风波:2倍退款不退货

界面新闻
2026-09-30 13:50:37
中国外交部发表严正声明

中国外交部发表严正声明

果妈聊娱乐
2026-09-30 10:52:08
2026-09-30 21:35:00
智东西 incentive-icons
智东西
智东西,AI产业新媒体,专注报道人工智能的前沿技术发展,和技术应用带来的千行百业产业变革。
12688文章数 117176关注度
往期回顾 全部

科技要闻

OpenAI凌晨大上新!新助手dots迎战Muse

头条要闻

7旬兄弟抢母亲20万遗产 哥哥把弟弟打进ICU终身瘫痪

头条要闻

7旬兄弟抢母亲20万遗产 哥哥把弟弟打进ICU终身瘫痪

体育要闻

30天30队·火箭:乌度卡的控制欲

娱乐要闻

胡歌现身游本昌遗体告别仪式

财经要闻

“杭州六小龙”迎来价值重估

汽车要闻

燃油车的最佳平替 长城大狗HEV简单好开更经济

态度原创

时尚
本地
数码
房产
公开课

网红超长蛋挞,炸出一堆“人上人”

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

数码要闻

Marshall发布Bromley 150派对音箱:售价3999元

房产要闻

自贸启新境,安居在海口!2026 海口好房子金秋购房节盛大启幕

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版