网易首页 > 网易号 > 正文 申请入驻

彻底对标DeepSeek!Kimi把K3的Infra底牌竟然也开源了

0
分享至

7月27号,月之暗面把Kimi K3的模型权重开源了。

这次它还顺手把支撑K3训练和推理的三套基础设施MoonEP、FlashKDA、AgentEnv一起放了出来。

不只是把模型给你,连怎么造出来、怎么让它跑起来的整套东西都摊开了。



在此之前月之暗面已有多次开源动作,但将万亿级大模型配套核心训练框架和权重一并对外,在国内开源圈子里十分少见,等于完整公开了Kimi K3从训练到落地的整套技术实现路径。

如果你对万亿参数已经麻木了,那换个说法可能更直观。

K3的参数规模是前代K2.5的3倍,但规模化效率提升了2.5倍用同样的算力,榨出了2.5倍的智能。



当被问到不怕技术被学走吗,他们的回答大致是:技术可以被复制,但构建技术体系的组织能力和迭代速度才是真正的护城河。
开源的是K3,真正拉开差距的是做出K4、K5的能力。



  • 技术报告PDF:https://github.com/MoonshotAI/Kimi-K3/blob/main/k3_tech_report.pdf
  • Hugging Face链接:https://huggingface.co/moonshotai/Kimi-K3
01 为什么Infra是K3的隐藏王牌?

在媒体沟通会上,月之暗面副总裁黄震昕说了一段话,可以作为理解这份报告的钥匙:

  • 传统大模型遵循算力、数据、参数的缩放定律,但一味堆砌算力早已遇到瓶颈。团队自研的底层技术,能让同等训练数据发挥翻倍效果,把模型训练功耗降低一半。

这种不堆卡、改架构的思路,直接体现在K3的三项开源Infra技术上。

(一)MoonEP

MoE模型的核心挑战之一,是专家并行带来的通信开销。K3拥有896个路由专家,每个Token激活16个。在如此细粒度的MoE架构下,专家之间的通信极易成为训练效率的瓶颈。

MoonEP正是为此而生


MoonEP计算、通信与卸载重叠调度

它是一套面向大规模MoE模型的高性能专家并行通信库,核心价值在于即使在不均衡的通信场景下,仍能实现极致效率

这意味着在万亿参数分布式训练中,跨卡通信的延迟被降到最低,GPU的算力得以充分释放。

月之暗面建议Kimi K3部署在64张以上加速卡组成的超节点环境中,这一要求本身就说明了高速互联和专家并行调度的关键性。

(二)FlashKDA

K3支持100万Token上下文窗口,这背后依赖的是Kimi Delta Attention(KDA)这一架构级创新。

KDA将传统Transformer的O(n²)复杂度降至O(n),使得长文本推理在成本上变得可行。


KDA Lower-bounded Decay对计算的影响

FlashKDA是KDA对应的高性能计算算子(Kernel)。官方数据显示,在英伟达H20上,FlashKDA的Prefill速度相比flash-linear-attention基线提升1.72至2.22倍

简单来说,FlashKDA让KDA的线性复杂度优势在硬件层面真正落地。它可以直接作为flash-linear-attention的替换后端,开发者可以零成本接入这一性能红利。

FlashKDA此前已开源,此次随技术报告一起,其设计思路和实现细节更加透明。

(三)AgentEnv

K3的能力不止于生成文本,更在于执行长时程Agent任务

官方案例显示,K3在生成一份覆盖推理芯片行业42年历史的研究报告时,完成了2800多次网页搜索、1100多次终端数据调用,处理了超过1.1万页资料。


RL FLOPs扩展与各领域能力的关系

这种级别的Agent任务需要一个高保真、强隔离的沙箱环境。传统容器沙箱有个致命问题,Agent探索得太激进,会导致内核崩溃甚至死锁。K3后训练阶段要跑成千上万个Agent并行探索,环境稳定性是刚需。

AgentEnv用Firecracker微虚机提供硬件级隔离

(1)Pause/Resume,暂停时零资源消耗,推理占沙箱98%的寿命,推理期间沙箱可以暂停。

(2)Fork,从当前状态复制新沙箱,做奖励评估时不污染原环境。

(3)Snapshot,定期保存快照,出错后快速回滚。

在K3的整个训练和评估过程中,累计创建了51,219,741个沙箱,跨越1,505,678个镜像。单个沙箱的暂停和恢复延迟分别低至133ms和49ms。

02 Infra之外的组合拳

Infra层保证了训练能跑起来,但真正决定模型能力上限的,是K3的架构设计。


Kimi K3整体架构概览

(一)混合注意力与信息流动

技术报告显示,K3采用了KDA + Gated MLA的混合结构,比例约为3:1。KDA负责高效处理长上下文,而Gated MLA能动态筛选重要信息。

同时,Attention Residuals技术以不到2%的额外成本,提升约25%的训练效率,在2.8万亿参数的训练中保障了稳定性。


GLU、SwiGLU和SiTU-GLU的标量响应对比

(二)稀疏MoE与稳定路由

K3采用Stable LatentMoE框架,896个路由专家中每个Token仅激活16个(激活比例约1.8%)。

为在高稀疏度下保持训练稳定,引入了Quantile Balancing等负载均衡机制,根据路由分数量化分位数直接分配专家,减少启发式更新及敏感超参数。


Quantile Balancing负载均衡示意图

(三)MoonViT-V2视觉编码器

K3具备原生视觉理解能力,为此专门训练了MoonViT-V2视觉编码器,采用Next-Token Prediction的自监督方式从头训练,摆脱了对对比学习预训练的依赖。


视觉编码器梯度范数对比

在训练效率上,规模化效率提升2.5倍,是架构创新、训练方法和数据配方优化共同作用的结果。

03 K3跻身全球第一梯队

K3在近20个内部评测集及多个公开基准上进行了全面评估,对比基线包括Claude Fable 5、GPT-5.6 Sol、Claude Opus 4.8、GLM-5.2等顶级闭源模型。整体定位是略逊于最强的Claude Fable 5与GPT-5.6 Sol,但稳定优于Claude Opus 4.8、GPT-5.5和GLM-5.2。




Kimi K3主要评测结果一览

真实场景下,K3连续48小时自主运行,基于开源EDA工具完成一颗nano推理芯片设计,4mm²内集成1.46M标准单元,仿真吞吐超8,700 tokens/s

它还独立开发了类Triton编译器MiniTriton,从DSL前端到PTX代码生成的完整工具链。


MiniTriton编译器性能

在GPU内核优化任务上,K3同样展现出惊人的工程能力。 K3在AttnRes算子上的优化轨迹59.7%的加速比,远超Claude Fable 5的57.1%和GPT-5.5的30.8%。


GPU kernel 优化(AttnRes)案例研究

另一个值得关注的案例是Camera Repair Management System,一个黑盒系统复制任务。

K3以1.000 的归一化完成率,率先达到终点,Claude Opus 4.8和GPT-5.5分别只能达到0.918 和0.893。


Camera Repair Management System 完成曲线

API输出定价100元/百万Token(约$15),约为Claude Fable 5($50)的三分之一。不过实际单任务成本差距缩小,AA-Briefcase上K3平均83轮调用,耗时56分钟(约Fable 5的2.5倍)。


Score vs. 单任务推理成本对比

04 开源Infra比开源权重更有信号

本次Kimi K3开放万亿级模型权重只是表层看点,三套配套自研基础设施同步开源,才是更关键的行业信号。

算力扩张的边际效益不断衰减,月之暗面选择以架构与工程优化突破性能瓶颈KDA优化长文本计算、Quantile Balancing平衡MoE负载,再由MoonEP、FlashKDA、AgentEnv完成全链路工程落地。

市面上多数开源项目仅放出模型文件,完整训练推理底座极少对外公开。这套可完整复现万亿模型训练的工具链,降低了行业自研大模型的工程门槛。

算法与模型总有被追上的一天,可源源不断迭代底层技术、持续推出新一代模型的完整组织能力,才是难以复制的长期壁垒。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
被扣5分仍稳居第3!15场不败,蒙哥马利重塑国安风骨

被扣5分仍稳居第3!15场不败,蒙哥马利重塑国安风骨

铿锵格斗
2026-09-07 00:17:06
记者:西甲已被玷污,如果我是皇马我就退出西甲

记者:西甲已被玷污,如果我是皇马我就退出西甲

懂球帝
2026-09-06 19:00:12
7nm打赢3nm?最值得期待的国产手机芯片,来了

7nm打赢3nm?最值得期待的国产手机芯片,来了

互联网.乱侃秀
2026-09-06 09:48:08
一位印度姐姐发帖感慨:来中国,我才知道正常国家晚上可以出门!

一位印度姐姐发帖感慨:来中国,我才知道正常国家晚上可以出门!

触摸史迹
2026-09-07 01:34:46
慷慨的挪威:自己才38万平方公里,却将216万平方公里给了丹麦

慷慨的挪威:自己才38万平方公里,却将216万平方公里给了丹麦

抽象派大师
2026-06-23 13:41:25
研究发现:每天饭后午睡的人,用不了多久,这4个变化或找上门!

研究发现:每天饭后午睡的人,用不了多久,这4个变化或找上门!

芹姐说生活
2026-09-06 22:45:10
公婆怂恿丈夫离婚,除夕夜小叔子来电:我哥瘫痪了,快拿50万救他

公婆怂恿丈夫离婚,除夕夜小叔子来电:我哥瘫痪了,快拿50万救他

麦子情感故事
2026-09-06 21:20:12
中国满大街都是的小电驴,可为什么在国外几乎没人骑?原因太现实

中国满大街都是的小电驴,可为什么在国外几乎没人骑?原因太现实

史之铭
2026-08-30 18:07:15
重大利好?8家中央金融企业将补充资本,利好什么?历史行情复盘来了

重大利好?8家中央金融企业将补充资本,利好什么?历史行情复盘来了

看财经show
2026-09-06 21:53:01
深圳富豪报案送90后女友入狱,判14年!律师怒斥:审判事故

深圳富豪报案送90后女友入狱,判14年!律师怒斥:审判事故

自愈小日子
2026-09-06 23:42:31
走路出现这4种迹象,寿命可能长不了!第二个危险,别不当回事

走路出现这4种迹象,寿命可能长不了!第二个危险,别不当回事

医学原创故事会
2026-07-29 23:42:13
苹果iPhone18售价曝光,全新产品阵容 你期待吗?

苹果iPhone18售价曝光,全新产品阵容 你期待吗?

科技美学
2026-09-05 20:11:15
心理学:“好事占尽,家败人亡”:为什么不管你多落魄,都要学会拒绝他人频繁帮助,守住人生底线与尊严

心理学:“好事占尽,家败人亡”:为什么不管你多落魄,都要学会拒绝他人频繁帮助,守住人生底线与尊严

心理观察局
2026-08-29 07:05:03
一夜3场大败!首个8强出炉!女篮世界杯爆大冷:日本27中3,韩国被打花,中国女篮输不起了

一夜3场大败!首个8强出炉!女篮世界杯爆大冷:日本27中3,韩国被打花,中国女篮输不起了

小七说篮球
2026-09-06 09:18:40
中央公布养老金调整文件,两类人影响大

中央公布养老金调整文件,两类人影响大

大海呀大海
2026-03-17 12:13:17
炸锅!爱沙尼亚新总统对华态度一片空白:全程一个字不提中国!

炸锅!爱沙尼亚新总统对华态度一片空白:全程一个字不提中国!

史行途
2026-09-06 17:47:31
张馨予太丰满了,穿挖洞衣凹凸感藏不住,我感慨军人老公眼光真好

张馨予太丰满了,穿挖洞衣凹凸感藏不住,我感慨军人老公眼光真好

蓓小西
2026-09-05 09:00:14
原来这些行为都是上了年纪的症状,我以为我变健康了,原来是老了

原来这些行为都是上了年纪的症状,我以为我变健康了,原来是老了

另子维爱读史
2026-09-05 21:24:19
小升初刚开学3天,我彻底破防了:原来初中的卷,从第一天就开始

小升初刚开学3天,我彻底破防了:原来初中的卷,从第一天就开始

起喜电影
2026-09-06 08:10:51
郭晓东携子登杂志封面,米色西装下藏不住的父子情深

郭晓东携子登杂志封面,米色西装下藏不住的父子情深

大眼妹妹
2026-09-06 23:01:11
2026-09-07 04:31:00
智猩猩
智猩猩
AI 技术内容与服务平台
69文章数 3关注度
往期回顾 全部

科技要闻

DeepSeek被曝将采购16万颗华为昇腾950DT

头条要闻

中尼两国遇难失联人数为何相差如此大 专家解读

头条要闻

中尼两国遇难失联人数为何相差如此大 专家解读

体育要闻

3.9秒绝平!杨舒予18+5成女篮救世主

娱乐要闻

杨紫获白玉兰影后!爸爸:累了就回家

财经要闻

亏损高达200亿,昔日彩电霸主走下巅峰!

汽车要闻

带升降立标MPV 岚图梦想家9预售价42.99万起

态度原创

本地
游戏
亲子
数码
公开课

本地新闻

扒完小作文,富豪们私藏的度假胜地有多绝

一台PS5的结局:败给家人拔电源 暑假工心血付诸东流

亲子要闻

冲上热搜!这种鞋子不要给孩子天天穿

数码要闻

科沃斯IFA放大招!家用机器人矩阵刷屏欧洲

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版