网易首页 > 网易号 > 正文 申请入驻

彻底对标DeepSeek!Kimi把K3的Infra底牌竟然也开源了

0
分享至

7月27号,月之暗面把Kimi K3的模型权重开源了。

这次它还顺手把支撑K3训练和推理的三套基础设施MoonEP、FlashKDA、AgentEnv一起放了出来。

不只是把模型给你,连怎么造出来、怎么让它跑起来的整套东西都摊开了。



在此之前月之暗面已有多次开源动作,但将万亿级大模型配套核心训练框架和权重一并对外,在国内开源圈子里十分少见,等于完整公开了Kimi K3从训练到落地的整套技术实现路径。

如果你对万亿参数已经麻木了,那换个说法可能更直观。

K3的参数规模是前代K2.5的3倍,但规模化效率提升了2.5倍用同样的算力,榨出了2.5倍的智能。



当被问到不怕技术被学走吗,他们的回答大致是:技术可以被复制,但构建技术体系的组织能力和迭代速度才是真正的护城河。
开源的是K3,真正拉开差距的是做出K4、K5的能力。



  • 技术报告PDF:https://github.com/MoonshotAI/Kimi-K3/blob/main/k3_tech_report.pdf
  • Hugging Face链接:https://huggingface.co/moonshotai/Kimi-K3
01 为什么Infra是K3的隐藏王牌?

在媒体沟通会上,月之暗面副总裁黄震昕说了一段话,可以作为理解这份报告的钥匙:

  • 传统大模型遵循算力、数据、参数的缩放定律,但一味堆砌算力早已遇到瓶颈。团队自研的底层技术,能让同等训练数据发挥翻倍效果,把模型训练功耗降低一半。

这种不堆卡、改架构的思路,直接体现在K3的三项开源Infra技术上。

(一)MoonEP

MoE模型的核心挑战之一,是专家并行带来的通信开销。K3拥有896个路由专家,每个Token激活16个。在如此细粒度的MoE架构下,专家之间的通信极易成为训练效率的瓶颈。

MoonEP正是为此而生


MoonEP计算、通信与卸载重叠调度

它是一套面向大规模MoE模型的高性能专家并行通信库,核心价值在于即使在不均衡的通信场景下,仍能实现极致效率

这意味着在万亿参数分布式训练中,跨卡通信的延迟被降到最低,GPU的算力得以充分释放。

月之暗面建议Kimi K3部署在64张以上加速卡组成的超节点环境中,这一要求本身就说明了高速互联和专家并行调度的关键性。

(二)FlashKDA

K3支持100万Token上下文窗口,这背后依赖的是Kimi Delta Attention(KDA)这一架构级创新。

KDA将传统Transformer的O(n²)复杂度降至O(n),使得长文本推理在成本上变得可行。


KDA Lower-bounded Decay对计算的影响

FlashKDA是KDA对应的高性能计算算子(Kernel)。官方数据显示,在英伟达H20上,FlashKDA的Prefill速度相比flash-linear-attention基线提升1.72至2.22倍

简单来说,FlashKDA让KDA的线性复杂度优势在硬件层面真正落地。它可以直接作为flash-linear-attention的替换后端,开发者可以零成本接入这一性能红利。

FlashKDA此前已开源,此次随技术报告一起,其设计思路和实现细节更加透明。

(三)AgentEnv

K3的能力不止于生成文本,更在于执行长时程Agent任务

官方案例显示,K3在生成一份覆盖推理芯片行业42年历史的研究报告时,完成了2800多次网页搜索、1100多次终端数据调用,处理了超过1.1万页资料。


RL FLOPs扩展与各领域能力的关系

这种级别的Agent任务需要一个高保真、强隔离的沙箱环境。传统容器沙箱有个致命问题,Agent探索得太激进,会导致内核崩溃甚至死锁。K3后训练阶段要跑成千上万个Agent并行探索,环境稳定性是刚需。

AgentEnv用Firecracker微虚机提供硬件级隔离

(1)Pause/Resume,暂停时零资源消耗,推理占沙箱98%的寿命,推理期间沙箱可以暂停。

(2)Fork,从当前状态复制新沙箱,做奖励评估时不污染原环境。

(3)Snapshot,定期保存快照,出错后快速回滚。

在K3的整个训练和评估过程中,累计创建了51,219,741个沙箱,跨越1,505,678个镜像。单个沙箱的暂停和恢复延迟分别低至133ms和49ms。

02 Infra之外的组合拳

Infra层保证了训练能跑起来,但真正决定模型能力上限的,是K3的架构设计。


Kimi K3整体架构概览

(一)混合注意力与信息流动

技术报告显示,K3采用了KDA + Gated MLA的混合结构,比例约为3:1。KDA负责高效处理长上下文,而Gated MLA能动态筛选重要信息。

同时,Attention Residuals技术以不到2%的额外成本,提升约25%的训练效率,在2.8万亿参数的训练中保障了稳定性。


GLU、SwiGLU和SiTU-GLU的标量响应对比

(二)稀疏MoE与稳定路由

K3采用Stable LatentMoE框架,896个路由专家中每个Token仅激活16个(激活比例约1.8%)。

为在高稀疏度下保持训练稳定,引入了Quantile Balancing等负载均衡机制,根据路由分数量化分位数直接分配专家,减少启发式更新及敏感超参数。


Quantile Balancing负载均衡示意图

(三)MoonViT-V2视觉编码器

K3具备原生视觉理解能力,为此专门训练了MoonViT-V2视觉编码器,采用Next-Token Prediction的自监督方式从头训练,摆脱了对对比学习预训练的依赖。


视觉编码器梯度范数对比

在训练效率上,规模化效率提升2.5倍,是架构创新、训练方法和数据配方优化共同作用的结果。

03 K3跻身全球第一梯队

K3在近20个内部评测集及多个公开基准上进行了全面评估,对比基线包括Claude Fable 5、GPT-5.6 Sol、Claude Opus 4.8、GLM-5.2等顶级闭源模型。整体定位是略逊于最强的Claude Fable 5与GPT-5.6 Sol,但稳定优于Claude Opus 4.8、GPT-5.5和GLM-5.2。




Kimi K3主要评测结果一览

真实场景下,K3连续48小时自主运行,基于开源EDA工具完成一颗nano推理芯片设计,4mm²内集成1.46M标准单元,仿真吞吐超8,700 tokens/s

它还独立开发了类Triton编译器MiniTriton,从DSL前端到PTX代码生成的完整工具链。


MiniTriton编译器性能

在GPU内核优化任务上,K3同样展现出惊人的工程能力。 K3在AttnRes算子上的优化轨迹59.7%的加速比,远超Claude Fable 5的57.1%和GPT-5.5的30.8%。


GPU kernel 优化(AttnRes)案例研究

另一个值得关注的案例是Camera Repair Management System,一个黑盒系统复制任务。

K3以1.000 的归一化完成率,率先达到终点,Claude Opus 4.8和GPT-5.5分别只能达到0.918 和0.893。


Camera Repair Management System 完成曲线

API输出定价100元/百万Token(约$15),约为Claude Fable 5($50)的三分之一。不过实际单任务成本差距缩小,AA-Briefcase上K3平均83轮调用,耗时56分钟(约Fable 5的2.5倍)。


Score vs. 单任务推理成本对比

04 开源Infra比开源权重更有信号

本次Kimi K3开放万亿级模型权重只是表层看点,三套配套自研基础设施同步开源,才是更关键的行业信号。

算力扩张的边际效益不断衰减,月之暗面选择以架构与工程优化突破性能瓶颈KDA优化长文本计算、Quantile Balancing平衡MoE负载,再由MoonEP、FlashKDA、AgentEnv完成全链路工程落地。

市面上多数开源项目仅放出模型文件,完整训练推理底座极少对外公开。这套可完整复现万亿模型训练的工具链,降低了行业自研大模型的工程门槛。

算法与模型总有被追上的一天,可源源不断迭代底层技术、持续推出新一代模型的完整组织能力,才是难以复制的长期壁垒。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
没想到,陪法国总统马克龙访华仅3年,巩俐竟再让所有人刮目相看

没想到,陪法国总统马克龙访华仅3年,巩俐竟再让所有人刮目相看

吴锎旅行ing
2026-09-04 16:48:28
欧拉弄发布34岁生日预热海报,海报暗藏心机,给泰王下最后通牒?

欧拉弄发布34岁生日预热海报,海报暗藏心机,给泰王下最后通牒?

阿废冷眼观察所
2026-09-07 00:28:18
韩国慌了!高层紧急发声,宁得罪自己人,也不敢重蹈日本覆辙

韩国慌了!高层紧急发声,宁得罪自己人,也不敢重蹈日本覆辙

易昂杨
2026-09-07 01:42:54
6-3逆转!塞尔比送走147先生,夺冠将比肩传奇,世界排名紧追赵心童!

6-3逆转!塞尔比送走147先生,夺冠将比肩传奇,世界排名紧追赵心童!

刘姚尧的文字城堡
2026-09-06 09:08:33
随着法兰克福1-4,美因茨5-0,德甲最新积分榜出炉:榜首易主

随着法兰克福1-4,美因茨5-0,德甲最新积分榜出炉:榜首易主

侧身凌空斩
2026-09-07 05:19:19
奔驰那封回执,把星宇的国内公关干沉默了

奔驰那封回执,把星宇的国内公关干沉默了

娱乐圈的笔娱君
2026-08-31 01:19:35
已确认!上海,踩刹车了!

已确认!上海,踩刹车了!

财经要参
2026-09-06 16:00:04
阿森纳球迷玩“恩佐梗”嘲讽罗杰斯:你应该签约一家大俱乐部

阿森纳球迷玩“恩佐梗”嘲讽罗杰斯:你应该签约一家大俱乐部

懂球帝
2026-09-07 01:44:32
一天花5.3万!郑钦文美网开销曝光,26天烧掉138万,打网球太烧钱

一天花5.3万!郑钦文美网开销曝光,26天烧掉138万,打网球太烧钱

观鱼听雨
2026-09-06 21:32:19
新能源汽车动力电池将迎“退役潮”,废旧电池何去何从

新能源汽车动力电池将迎“退役潮”,废旧电池何去何从

澎湃新闻
2026-09-06 08:26:39
同样是带鱼,“黑眼”和“黄眼”的区别很大!知道后别再乱买

同样是带鱼,“黑眼”和“黄眼”的区别很大!知道后别再乱买

阿龙美食记
2026-09-05 08:56:03
默茨无力回天,德国选择党取得压倒性优势,72岁前总理再度出山

默茨无力回天,德国选择党取得压倒性优势,72岁前总理再度出山

青青衫书生
2026-09-06 23:15:53
中超最新积分榜:成都蓉城无缘提前4轮夺冠,5队争亚军,津门虎甩开三镇

中超最新积分榜:成都蓉城无缘提前4轮夺冠,5队争亚军,津门虎甩开三镇

中超伪球迷
2026-09-06 22:05:01
弗里克:进球多不会改变我们的想法,我们通常需要一名9号

弗里克:进球多不会改变我们的想法,我们通常需要一名9号

懂球帝
2026-09-07 02:36:16
心理学:判断一个女人有没有气质,看这两点就够了,尤其是最后一点

心理学:判断一个女人有没有气质,看这两点就够了,尤其是最后一点

心理观察局
2026-09-07 06:33:05
胡尔克:裁判用胸口顶了卡诺比奥,我在全世界都没见过这种事

胡尔克:裁判用胸口顶了卡诺比奥,我在全世界都没见过这种事

懂球帝
2026-09-07 00:51:42
落袋为安!90岁老人套现10个亿跑了,能卖的全卖,不能卖的全质押

落袋为安!90岁老人套现10个亿跑了,能卖的全卖,不能卖的全质押

云景侃记
2026-08-29 10:04:00
扎哈罗娃犀利回应高市早苗:“无异于要求太阳停止照耀”

扎哈罗娃犀利回应高市早苗:“无异于要求太阳停止照耀”

扬子晚报
2026-09-06 22:37:59
银行催你换三代社保卡?内部员工坦白 3 个真话,别再被套路了

银行催你换三代社保卡?内部员工坦白 3 个真话,别再被套路了

娱乐圈见解说
2026-09-05 03:26:57
曹德旺当年反对女儿嫁给厦大高材生,理由只有一句:他太优秀了!14年后,这个女婿拿到的不是聘书,而是福耀的一份重任

曹德旺当年反对女儿嫁给厦大高材生,理由只有一句:他太优秀了!14年后,这个女婿拿到的不是聘书,而是福耀的一份重任

背包旅行
2026-09-03 15:48:21
2026-09-07 07:40:49
智猩猩
智猩猩
AI 技术内容与服务平台
69文章数 3关注度
往期回顾 全部

科技要闻

DeepSeek被曝将采购16万颗华为昇腾950DT

头条要闻

男子1.38万捡漏二手大众CC 懂车帝称操作失误未发货

头条要闻

男子1.38万捡漏二手大众CC 懂车帝称操作失误未发货

体育要闻

3.9秒绝平!杨舒予18+5成女篮救世主

娱乐要闻

杨紫获白玉兰影后!爸爸:累了就回家

财经要闻

亏损高达200亿,昔日彩电霸主走下巅峰!

汽车要闻

带升降立标MPV 岚图梦想家9预售价42.99万起

态度原创

游戏
教育
房产
数码
健康

《GTA6》新情报:随机任务送果体NPC回家 奖励丰富

教育要闻

知名教授与2名女学生发生不当关系、还辱骂学生,他刚离职、就被另一大学聘为“杰出教授”!太荒唐了…

房产要闻

突发重磅!海口出台楼市新政!

数码要闻

海外收入过半、福布斯官宣第一,科沃斯的「技术复利」迎来爆发期

脑梗取栓成功≠活下来,还有这三关

无障碍浏览 进入关怀版