网易首页 > 网易号 > 正文 申请入驻

Kimi K3 深度解读,国产开源 AI 逼近国际巨头

0
分享至

热点分析 · Kimi K3

Kimi K3深度分析2.8万亿参数登顶编程榜,国产开源追到门口了

全球最大开源模型 · 前端编程Arena全球第一
实测3D惊艳但速度拉胯 · 月之暗面的IPO前哨战

喜欢文章,想了解更多相关知识的朋友欢迎关注我

AI前沿模型分析



先说结论:能力上限高,但体验还没跟上

7月16日深夜,月之暗面在WAIC开幕前夜扔出了一颗炸弹——Kimi K3,2.8万亿参数,全球最大开源模型,前端编程盲测世界第一。

消息一出,智谱市值当天蒸发了2053亿港币,跌了28%。Minimax也跟着跌了15.6%。信号很明确:基础大模型的竞争远没到终局,落后和领先都可能是暂时的。

但别急着吹。我把官方技术博客、第三方评测、各路开发者实测全看了一遍,结论比较克制:K3确实是月之暗面迄今最强的模型,最有说服力的进步不是"聊天更聪明",而是把代码、研究、文档和工具调用串成了一条更长、更稳定的任务链。它有资格进入全球第一梯队,但速度、输出长度、成本和事实可靠性,决定了它并不适合所有场景。

这篇文章就来拆解K3到底强在哪、弱在哪、值不值得用。

一、2.8万亿参数:全球最大开源模型的分量

先看基本参数。

总参数:2.8万亿(2.8T)

架构:MoE混合专家,896个专家,每次激活16个

上下文窗口:100万Token(约75万字)

模态:原生支持文本+图像输入,文本输出

思考模式:始终开启,默认max档

权重开放:2026年7月27日前发布完整权重

2.8万亿参数是什么概念?目前全球开源模型里最大的。此前Kimi自己的K2是1万亿级别,DeepSeek V3是6710亿。K3直接把开源模型的天花板拉到了近3万亿。

但参数大不等于一切。月之暗面自己也说了,K3的研发重点不是简单堆参数,而是通过架构、训练方法和数据配方的协同优化,把规模优势转化为能力提升。这话不是吹——他们确实在架构上做了真东西,后面细说。

有个细节值得一提:K3发布时的官方宣传视频,是K3自己剪辑的。它在56段原始素材里完成了选片、卡点、动作匹配和音频处理。月之暗面用这种方式传递了一个信号——它能做出完整的、让人满意的复杂作品。



K3与主流模型参数规模对比,全球首个3T级开源模型

二、架构创新:KDA+AttnRes,不是只靠堆参数

K3能处理100万Token上下文还能保持质量,靠的不是暴力堆算力,而是两个自研的架构创新。

第一个叫KDA(Kimi Delta Attention)。传统Transformer的注意力计算复杂度是O(n²)——上下文越长,计算量呈平方级增长。这就是为什么很多模型号称支持长上下文,实际用起来要么慢得要死,要么后半段就"失忆"了。KDA的核心思路是把注意力计算线性化,通过细粒度逐通道门控机制,选择性地聚焦关键信息,不再对所有位置做全量计算。

实测效果:在100万Token全量加载场景下,解码速度最高提升6.3倍。这意味着百万Token上下文不再只是纸面参数——它是真的能用的。

第二个叫AttnRes(Attention Residuals)。传统残差连接以固定权重累加各层输出,每层贡献固定。AttnRes用学习到的、依赖输入的注意力机制取代固定权重——模型自己决定从前面各层提取多少信息,像一个"动态记忆管理器"。

关键数据:额外训练成本不到2%,训练效率提升约25%。在大规模MoE模型中,训练成本是限制规模发展的核心瓶颈,能在几乎不增加预算的情况下提升训练效率,意味着同样算力可以训练出更强的模型。

再加上Stable LatentMoE框架——896个专家里只激活16个,激活比例不到2%,在超大参数量和推理成本之间实现了平衡。整体扩展效率比K2提升约2.5倍。



KDA线性注意力+AttnRes注意力残差+MoE稀疏激活

说人话:K3不是靠蛮力堆参数,而是在"怎么让信息在超长文本和超深网络里高效流动"这个问题上做了真正的架构创新。这是它和很多"只堆参数"的模型本质区别。

三、前端编程Arena登顶:1679分力压Claude和GPT

这是K3发布后传播最广的一个数据。

Frontend Code Arena是加州大学伯克利分校研究人员创建的第三方盲测平台。规则很简单:同一道前端编程任务交给两个匿名模型,用户体验两个结果后投票,投票完成才公布模型身份。累计约48万次投票。

Kimi K3以1679分排名全球第一,超过了Claude Fable 5的1631分和GPT-5.6 Sol的1618分。在7个前端编程细分领域中,K3拿下6个第一——品牌与营销、基于参考的设计、数据与分析、消费产品、模拟、内容创建工具,全部榜首。

从上一代K2.6的第18名直接跃升到第1名,这个飞跃幅度确实惊人。

但得说清楚一个事:Frontend Code Arena考察的是前端编程能力,不是综合智能。K3的综合智能指数(Artificial Analysis)是57分,整体表现仍落后于Claude Fable 5和GPT-5.6 Sol这两个最强闭源模型。月之暗面在官方博客里也坦诚写了这一点。

更准确的说法是:K3在前端编程这个垂直赛道上做到了全球第一,综合能力进入第一梯队但还不是最强。这已经是非常大的突破了——一年前国产开源模型在这个榜单上连前20都进不去。



K3以1679分登顶前端编程Arena,7个细分领域6个第一

四、实测表现:3D生成惊艳,速度是最大短板

K3正式上线不到24小时,各路开发者的实测就密集到可以按场景分类了。出现频率最高的三个测试方向:3D交互生成、前端编程、视觉设计。

3D生成本是最突出的亮点。有人让它用Three.js生成一个可探索的微型城市,要求高低错落的建筑、街道、树木、河流和昼夜循环系统。K3的画面配色和谐,设计有心思,但细节不够到位——会出现树和路灯挡在路中间的情况。

科技博主Chris在发布前就拿到了匿名测试版,让K3和GPT-5.6 Sol分别做体素死星壕沟飞行。他的评价是GPT-5.6光照和特效更好,但K3画面更流畅。正式发布后,他又用K3构建了一个CS:GO×Portal克隆游戏,三轮对话、约60万Token,按API定价算只花了3.24美元。他配文:"免费独立游戏开发的时代比你想象的还要近。"

有人用樱花盆景测试SVG视觉生成,发现K3在树干扭曲、分层树冠等细节上甚至比Fable 5更贴合要求。水流效果也能模拟出逼真的水波纹,保持物理连贯性。

但速度是绕不过去的硬伤。同一场景生成时间约为GPT-5.6 Sol的两到三倍。瀑布场景近半小时,视频剪辑近两小时。Artificial Analysis测得K3输出约62 tokens/秒,低于同类模型约70 tokens/秒的中位水平。

关于速度慢的原因,官方未作说明。可能的因素包括:2.8万亿参数推理计算量大、max档位默认开启深度思考、推理基础设施尚未充分扩容。后续开放low和high档位后可能会有所改善。



3D交互生成能力突出,但生成时间是竞品的2-3倍

五、K3 vs GPT-5.6 Sol:Sol赢在可靠,K3赢在审美

被用来和海外最强旗舰对比,K3实际表现到底怎么样?有媒体做了三个场景的正面PK,同一套提示词分别喂给两个模型。

场景一:3D迷宫游戏。要求第一人称视角、WASD控制、小地图、火炬照明、60秒倒计时。GPT-5.6 Sol干活非常快,K3还在加载时Sol已经能开始玩了。但K3交付的成果整体视觉带有像素风,火炬和墙面纹理更有设计感,光线更暗,可玩性更高。Sol快且稳,K3慢但有辨识度。

场景二:杯子倒水物理仿真。这道题考察数学建模、物理直觉和图形学处理。GPT-5.6 Sol交了合格答案——水粒子老老实实待在杯子里,倒水从杯口流出,符合物理规律。K3在这道题上"翻车"了:装水时水粒子穿透杯壁漏出去了,倒水时水从杯底流出。经提醒后K3做出了改正,但改得也很慢。这个场景Sol完胜。

场景三:尼亚加拉大瀑布全景。GPT-5.6 Sol功能完整但有点"敷衍"——提示词要的玻璃质感绿水和透光白色水幕,拿到手的是一大片白色粒子糊在悬崖面上,提示词里提到的彩虹也没出现。K3更用心:画面更精美,彩虹没落下,水的渲染更接近真实瀑布水汽氤氲的视觉体验。当然,K3花了近半小时。这个场景K3胜在审美。

三轮测试的结论:要又快又稳的成品选Sol,要视觉上有辨识度的成品选K3,但得付出两到三倍的时间成本。



三轮PK:Sol赢在速度和可靠性,K3赢在视觉审美

六、定价策略:不便宜,但复杂任务可能值

K3的API定价比上一代涨了不少,先看数字。

国内API:输入2元/百万Token(缓存命中),20元/百万Token(未命中),输出100元/百万Token

国际API:输入3美元/百万Token,输出15美元/百万Token,缓存命中0.3美元

对比GPT-5.6 Sol:输入5美元,输出30美元

对比Claude Fable 5:输入10美元,输出50美元

跟海外旗舰比,K3确实便宜——输出单价折合不到14美元,比GPT-5.6 Sol便宜一半,比Fable 5便宜三分之二。

但跟自家上一代比,K3的API输入价格涨了3倍多,输出价格涨了近4倍。这个涨幅相当激进。

关键问题不是单价贵不贵,而是完成一次可靠交付需要多少总成本。如果任务只是摘要和改写,这个价格缺乏优势。但如果一次调用能完成过去需要多轮模型切换、人工检索和反复修改的复杂任务——比如让K3先查50份材料,列出矛盾证据,生成数据表和图表,再写成不同平台版本——单位"成功任务"的成本反而可能合理。

还有个隐形成本:K3"话多"。完成Artificial Analysis整套评测用了约1.3亿输出Token,接近同类中位数6300万的两倍。相比K2.6,Token效率已有提升(完成同样九项任务,K3约消耗132M输出Token,K2.6约消耗166M,减少约21%),但和市场横向比较仍然偏冗长。这会同时影响阅读体验、延迟和账单。



K3 API定价:比海外旗舰便宜,但比自家上代涨了3-4倍

七、局限短板:官方自己都承认的三个问题

月之暗面在官方博客里坦诚地写了三个局限,这点值得点赞——很多模型发布时只报喜不报忧。

第一,对历史思考内容敏感。如果Agent框架没有完整回传历史,或在一个进行中的会话里从其他模型切换到K3,生成质量可能明显波动。换句话说,100万窗口提供了容量,但真正决定体验的仍是上下文管理和Agent框架是否适配。别指望随便接个框架就能跑出最佳效果。

第二,训练偏向长程高难任务,简单问题容易"过度主动"。面对小问题或模糊意图时,K3会替用户做出意外决定。对于自动发邮件、改数据库、部署代码等高风险动作,这不是性格问题,而是权限控制问题。使用K3做Agent时,必须明确写出可执行范围、必须确认的动作、禁止访问的资源和失败后的停止条件。

第三,与Fable 5和GPT-5.6 Sol相比,在用户体验上仍有差距。

除了官方承认的,第三方评测还暴露了更多问题:

速度慢——前面说了,62 tokens/秒,低于行业中位数

幻觉率高——准确率从K2.6的33%提升到46%,但幻觉率也从39%上升到51%。模型回答了更多问题,但也更愿意在不知道时给出答案。用于新闻、法律、医疗、金融时,来源核验仍是硬要求

物理仿真不够可靠——杯子倒水测试翻车说明,K3在物理直觉方面还不是一次到位,需要多轮提醒修正

本地部署门槛极高——2.8万亿参数的完整权重,全精度约1.7TB,2-bit量化约950GB-1TB,最激进的1.8-bit压缩也要650-700GB。512GB的Mac Studio都不够。月之暗面自己建议用64+加速器的超节点配置,这只有企业数据中心才有



速度慢、话多、幻觉率高、部署门槛极高

八、市场影响:估值飙升,开源改写格局

K3不只是一次产品更新,它的发布节点和背后的商业故事同样值得关注。

融资和估值方面,月之暗面近半年动作频频。2025年12月完成C轮5亿美元融资,投后估值43亿美元。今年5月完成约20亿美元融资,投后估值突破200亿美元。6月底又启动新一轮,投前估值升至315亿美元——年内第6轮融资。

收入增速方面,3月Kimi的ARR(年度经常性收入)突破1亿美元,6月中旬达到3亿美元,三个月增至3倍。API贡献了Kimi总收入的七成以上,海外API收入已超过国内。个人订阅用户1月支付订单数环比增长8280%,2月再涨123.8%,进入Stripe全球榜单前十,成为首个闯入前十的中国AGI产品。

竞争格局方面,K3发布当天智谱市值蒸发28%,这不是巧合。月之暗面试图构建的路径是:用开源模型吸引全球开发者,通过开发者工具进入真实工作流,再将对稳定性、速度和服务要求更高的用户转化为API客户。理论上可以形成飞轮效应——模型能力带来开源影响力,开源带来开发者,开发者转化为API收入,收入再支持训练和推理投入。

开源意义方面,K3计划7月27日前发布完整权重。即使大多数人没有能力本地部署,开放权重的意义依然重大——它消除了"模型被下架"的依赖风险,允许研究者检视、微调和改进,让高校和小公司也能在先进模型基础上构建应用。这是开源生态第一次在长程代码和知识工作上逼近最强闭源产品。

还有一个不能忽视的背景:月之暗面正在筹备港股IPO。K3的发布不只是一轮产品更新,也像一次上市前的能力宣示。但IPO最终检验的不会是榜单成绩,还有3亿美元ARR能否持续、客户是否留存、推理成本能否控制,以及技术优势能保持多久。



估值315亿美元,ARR三个月增至3倍,IPO前哨战

K3到底适合谁用

说了这么多,落到实际——K3适合什么场景,不适合什么场景?

适合的场景:

大型代码仓库理解和修改——K3的长程编程能力是核心卖点,能读懂大型仓库、操作终端、修改代码、运行测试、根据结果继续修正

复杂研究任务——先查大量材料,列出矛盾证据,生成数据表和图表,写成不同版本交付物

前端开发与视觉迭代——上传设计截图,让K3根据视觉反馈持续优化页面,形成"视觉在环路"的开发闭环

3D交互内容生成——Three.js微型城市、3D游戏、物理仿真(但需要多轮提醒修正)

图文混合交付——生成包含表格、图表、幻灯片和交互式网站的综合成果

不适合的场景:

日常问答和短文润色——K3偏冗长,简单问题也容易"过度主动",用K2.6或专用小模型更划算

低延迟客服——速度是硬伤,62 tokens/秒的输出速度不适合实时对话场景

大规模便宜调用——价格涨了3-4倍,大规模调用成本不低

事实可靠性要求极高的场景——幻觉率51%,新闻、法律、医疗、金融必须配合来源核验

一句话建议

不要立刻把所有工作迁移到K3。挑选三个真实任务进行测试:一个大型代码修改、一个多来源研究、一个图文混合交付。记录成功率、人工接管次数、总耗时和总成本,再决定是否替换现有模型。

K3已经进入第一梯队。接下来真正决定它位置的,不是下一张榜单,而是能否在真实工作里更稳定地把任务做完。

几个值得关注的后续节点

7月27日——完整模型权重发布。届时开发者可以下载、研究、微调。社区能否以可接受成本部署,才是"开放"价值的真正检验。

low和high思考档位——目前K3默认max档,后续会增加低档和高档模式。速度问题可能会随之改善。

港股IPO进程——K3是上市前的能力宣示,但IPO检验的是持续收入和成本控制,不是榜单成绩。

智谱和Minimax的反扑——K3发布当天智谱跌了28%,但智谱的ARR已达10亿美元,半年增长15倍。竞争远没到终局。

社区独立评测——目前很多数据来自月之暗面自己的评测,完整权重发布后,研究社区的独立验证会给出更客观的画像。

总结

把时间轴拉到18个月前,当时国产大模型的话题还是"能不能追上GPT-4"。现在K3在前端编程盲测上力压Claude Fable 5和GPT-5.6 Sol登顶全球第一,综合能力稳定超越GPT-5.5和Opus 4.8。

国产开源与海外旗舰的差距,至少已经大幅压缩了。

但K3给人的整体感觉是:能力上限高,但体验还没完全跟上。3D和视觉生成能力最突出,前端UI设计水准接近Fable 5,编码能力强但还没超过最强闭源模型,速度是最大短板。它不是"所有任务的新默认",而是复杂任务的新候选。

月之暗面用K3证明了:中国开源大模型正在从"单点亮相"走向"群体突破"。接下来真正重要的不是下一个参数纪录,而是开源模型能否在真实工作流中持续创造价值——从榜单第一走向日常可靠。

这一点,K3开了个好头,但路还很长。

AI前沿模型分析 · Kimi K3专题

2026年7月

喜欢文章,想了解更多相关知识的朋友欢迎关注我

声明:内容由AI生成

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
女子与情夫深夜草丛偷欢,遭四名路人强行加入,最终酿成血案

女子与情夫深夜草丛偷欢,遭四名路人强行加入,最终酿成血案

易玄
2026-09-15 10:42:37
李在明甩出一张表格,向全韩国通告:敢敌视中国,代价付不起

李在明甩出一张表格,向全韩国通告:敢敌视中国,代价付不起

最美的巧合
2026-10-02 00:04:55
票房盘点!国庆第2天《什么意思夫妇》8800万,第一名意料之中!

票房盘点!国庆第2天《什么意思夫妇》8800万,第一名意料之中!

仙味少女心
2026-10-02 23:34:09
三四名决赛还没开打,U23国足先迎来致命坏消息,亚运会季军悬了

三四名决赛还没开打,U23国足先迎来致命坏消息,亚运会季军悬了

零度眼看球
2026-10-02 07:08:06
外媒:中国六代机“歼-36”即将重磅亮相,珠海航展会再次上演惊喜吗?

外媒:中国六代机“歼-36”即将重磅亮相,珠海航展会再次上演惊喜吗?

零度Military
2026-10-03 00:25:07
被老将当众打脸?郑丽文高格局化解危机!放弃柯志恩或是明智之举

被老将当众打脸?郑丽文高格局化解危机!放弃柯志恩或是明智之举

真的好爱你
2026-10-03 01:06:03
为啥突破性技术总是最先发生在西方?网友:看看历史,中国也就落后了那100多年

为啥突破性技术总是最先发生在西方?网友:看看历史,中国也就落后了那100多年

带你感受人间冷暖
2026-09-30 00:17:02
殡葬师提醒:亲人刚咽气的10分钟内,必须做对的4件事

殡葬师提醒:亲人刚咽气的10分钟内,必须做对的4件事

宝哥精彩赛事
2026-10-01 21:27:18
他是抗日英雄,83岁与世长辞,一生娶40个老婆,44年后才下葬!

他是抗日英雄,83岁与世长辞,一生娶40个老婆,44年后才下葬!

历史龙元阁
2026-10-01 08:10:41
痛定思痛!篮协提6点要求,中国男篮和女篮或柳暗花明

痛定思痛!篮协提6点要求,中国男篮和女篮或柳暗花明

帮主砍球
2026-10-02 22:16:35
演员杜淳妻子“王灿被骗灌肠”冲上热搜,其自曝遭养生骗局,店家诱导她购买千元排毒套餐,竟被工作人员灌错位置,事后店家敷衍道歉

演员杜淳妻子“王灿被骗灌肠”冲上热搜,其自曝遭养生骗局,店家诱导她购买千元排毒套餐,竟被工作人员灌错位置,事后店家敷衍道歉

扬子晚报
2026-09-28 19:36:19
韩方提议韩朝就军事分界线分歧见面沟通

韩方提议韩朝就军事分界线分歧见面沟通

新华社
2026-10-02 22:06:05
邵佳一2.5分!国足评分:韦世豪6.7分最高!颜骏凌最低,全队仅6将及格

邵佳一2.5分!国足评分:韦世豪6.7分最高!颜骏凌最低,全队仅6将及格

刀锋体育
2026-10-02 23:26:30
红衫配深灰瑜伽裤,丰腴体态被面料完整勾勒

红衫配深灰瑜伽裤,丰腴体态被面料完整勾勒

只要高兴就好
2026-09-13 16:27:16
“分手”15天后,华为与赛力斯签约新五年

“分手”15天后,华为与赛力斯签约新五年

21世纪经济报道
2026-10-01 23:13:19
买台RTX 5090整机,先签保证不出境的文件

买台RTX 5090整机,先签保证不出境的文件

像素与芯片
2026-10-02 22:08:27
太可怕了!江苏女生哭诉侍候父亲的至暗时刻,字里行间恐惧与绝望

太可怕了!江苏女生哭诉侍候父亲的至暗时刻,字里行间恐惧与绝望

火山詩话
2026-05-30 17:59:42
他是国家一级演员,拍戏赚的钱都上交老婆,帅气儿子是他唯一心病

他是国家一级演员,拍戏赚的钱都上交老婆,帅气儿子是他唯一心病

娱圈办事处
2026-10-01 16:01:25
文班亚马又拒绝合同!真够正义的!

文班亚马又拒绝合同!真够正义的!

柚子说球
2026-10-02 09:10:49
国足崩了…

国足崩了…

五星体育
2026-10-02 21:45:02
2026-10-03 04:48:49
欧阳让你懂AI
欧阳让你懂AI
每天分享一些AI的实用小知识
274文章数 330关注度
往期回顾 全部

科技要闻

“分手”15天后,华为与赛力斯签约新五年

头条要闻

李在明:若乌克兰拒不道歉 将采取进一步措施

头条要闻

李在明:若乌克兰拒不道歉 将采取进一步措施

体育要闻

30天30队·快船:被莱纳德挂在半空的未来?

娱乐要闻

潘玮柏老婆被猜怀二胎 中秋vlog露馅

财经要闻

珠宝黑马爆雷,老板全家跑路泰国!

汽车要闻

方程豹9月热销破4万 首款皮卡鲨鱼将于四季度上市

态度原创

本地
亲子
房产
时尚
公开课

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

亲子要闻

网传多地幼儿园男女比例失衡,男孩比女孩多3倍,网友说:以后性资源会出现巨大缺口!

房产要闻

三亚楼市炸了!首个空中泳池平层+CBD独一份洋房同时爆出!

伊姐十一热推:电视剧《无可替代》;电视剧《雷霆令》......

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版