网易首页 > 网易号 > 正文 申请入驻

保鲜期才是中国模型的新战场

0
分享至

研究员|卢杨

过去一个月,大模型行业最让人印象深刻的,是变化本身的速度。一款模型发布,数小时内登顶榜单,话题霸屏,但留给它在榜首的时间,变得前所未有的短暂。新的版本很快出现,新的价格表很快出现,新的能力边界很快被重新定义。

在这个节奏里,一个模型从“前沿”到“被超越”,中间隔的时间越来越短。但在这股浪潮中,出现一个例外。7月中旬发布的Kimi K3,在历经一个多月、十余款重磅模型的轮番冲击之后,依然没有掉出全球前沿模型的讨论范围。

发布数小时后,K3登顶Frontend Code Arena榜首——1679分,超越Claude Fable 5的1631分和GPT-5.6 Sol的1618分。这是中国大模型第一次站上那个位置。

但接下来的事情,更像是一场刻意安排的极限压力测试。此后的35天里,AI模型进入了近乎疯狂的发布期,Opus 5、DeepSeek V4 Pro、Qwen 3.8max、GLM5.3等几波冲击接连到来,各大榜单榜首几度易主。

但几轮过后,Kimi K3倒还在原位。在Artificial Analysis Intelligence Index上,K3(max版本)最新评分为60分,与刚刚发布的GLM-5.3同居全球第五,在AA-Briefcase(模拟真实企业知识工作的长程测试,涉及25000多条Slack消息、3500多封邮件、会议纪要和财务报表)中,K3以Elo 1543排名第二,仅次于Claude Fable 5的1574,超过了GPT-5.6 Sol的1501。

在Agent Arena上, K3(max版本)以+10.5%的净提升位列第四,是能力前十中唯一的中国模型。而它的单任务中位成本为0.62美元,仅为Claude Opus 5(3.37美元)的五分之一,是前八名中最低的。截至8月20日,在Code Arena的前端专项榜单及覆盖任务更全的WebDev总榜上,K3仅次于Opus 5位列第二,而这两个位置,都是在Qwen3.8、Grok4.6、GLM-5.3等更晚发布的模型冲击之下保持的。





相比上一代K2,官方称K3整体扩展效率提升了约2.5倍。这个数字不是说“智商提高了2.5倍”,它说明的是,当模型继续扩大时,每增加一单位算力投入,能换来多少真实的能力增量。

这也是K3想解决的核心问题。我们把它的解法简单归纳为三个维度上。这可能也恰恰是大模型继续扩大以后,无法绕开的三座山。

01 长上下文,不只是“装得多”

100万token上下文,听起来只是一个规格数字,在参数表里和“2.8T”并排列着。但当模型面对的是一整个代码仓库(包含数十个文件的依赖关系)、几百页企业尽调材料(含财务附注和法律条款)、或者一套需要连续执行数百步的Agent任务时,“能装下多少信息”和“能不能有效使用这些信息”,已经是两个截然不同的问题。

不同于简单的问答,模型开始被要求“接手一段完整的工作流”:读材料、理解背景、写代码、查资料、执行工具、检查结果、修正错误,再继续往下做。任务越复杂,模型需要维持的有效上下文就越长。

K3使用的是Kimi Delta Attention(KDA)。这不是新概念。月之暗面此前已将KDA定义为一种线性注意力模块,核心是在长序列场景下颠覆传统Attention机制的平方级复杂度:传统Transformer处理长度L的序列需要O(L²)的计算量,当L达到100万时,这个数字将变得不可承受。KDA通过线性复杂度的注意力设计,将计算量降至O(L)。

到了K3,KDA被正式放入百万token的完整架构里,与2.8T参数协同工作。

它的本质是让模型在超长上下文中依然保持“注意力聚焦”。在普通Transformer里,上下文越长,模型越容易“忘记”开头的关键信息,学术界称之为“注意力稀释”。KDA通过线性复杂度的注意力重计算与稀疏注意力模式,让模型在处理第90万个token时,依然能精准调用第1万个token里埋下的隐藏指令。

可以通俗理解为,K3在处理需要连续执行上百步的Agent任务时,不会因为“记忆衰减”而在任务中途跑偏。技术报告也将KDA与长上下文和长程Agent任务直接联系起来,这是AI从“聊天工具”走向“工作伙伴”的关键一步。

模型的“大”不只体现在宽度(专家数量),还体现在深度(层数)。网络越深,理论上能进行的抽象推理越复杂。每一层都可以在前一层的基础上构建更高级的表征:从词汇到短语到语义到逻辑结构。但层数增加后,一个经典难题出现了,梯度消失与信息遗忘。

底层的原始信息,经过数十上百层的传递后,传到顶层时往往已经被“稀释”得面目全非。传统残差连接(Residual Connection)通过“跳跃连接”的方式让信息可以绕过某些层直接向后传递,在一定程度上缓解了这个问题。但当网络深度继续增加时,这种简单粗暴的“整体传递”方式就变得不再高效。

K3使用了Attention Residuals。它的设计思路比传统残差连接更精细,让模型在向更深处计算时,每一层都能“回头看”,有选择地利用此前不同深度产生的信息。

月之暗面相关研究显示,在某些设置下,Block Attention Residuals可以达到相当于额外增加大量训练计算量的效果。

硅谷的投资人也在公开讨论这件事。a16z在社交媒体上写道,“America debates Chinese AI while the rest of the world buys it”(美国人还在争论,世界其他地方已经在下单);知名投资人Jason Calacanis则在一档节目中称,Anthropic的大客户正在认真评估转向Kimi——原因不是性能超越,而是“当性能可以用零头买到时,没有人愿意继续支付溢价”。这些说法带着明显的立场和渲染成分,但K3被列入这种讨论本身,说明它已进入海外机构的投资与采购框架,而不仅是技术圈的话题。

K3在处理极其复杂的逻辑推理,比如数学证明的多步推导、长链条的法律条款比对、或者需要多轮反思的代码调试时不容易在推理的“半路”丢掉关键线索,每一层都在贡献新的信息。

8月初美国白宫闭门会议敲定的“自愿AI安全审查框架”中,只有闭源前沿模型需在发布前送政府审查30天,开源与开放权重模型被排除在外;同期,179家美国中小企业联署反对对中国模型的全面封禁。开放权重正在获得更大的政策与市场空间,而K3恰好站在这个空间的入口处。

02 更宽的模型,2.8万亿参数

K3最容易被注意到的数字还是2.8万亿。它拥有896个路由专家,每个token实际只激活16个专家,激活参数量约1040亿。也就是说,它拥有巨大的“知识容量”,多达2.8万亿参数所代表的记忆和表征空间,每一次计算只调动其中一小部分。这是MoE架构的性感之处,也是它的梦魇。性感在于效率,一个模型可以有2.8万亿的知识储备,却只需要为每次计算支付1040亿的算力成本。

噩梦在于路由。专家越多,路由越难。如何把代码生成任务精准送到“代码专家”手里,把数学推理送到“数学专家”手里,把多语言任务送到对应的语言专家手里?如何避免某些热门专家过载瘫痪,而另一些冷门专家长期闲置“摸鱼”?如何在数万亿参数的分布式训练中保持数值稳定,不出现梯度爆炸或收敛失败?

K3使用Stable LatentMoE,并引入Quantile Balancing等方法处理专家负载。Quantile Balancing的核心思路是监控每个专家的负载分布,当某些专家的负载超过设定分位数时,系统会自动调整路由策略,将部分流量导向负载较低的专家。这套机制确保了896个专家不会出现“少数累死、多数闲死”的局面。

这背后是一套精密的基础设施工程它解决的是万亿参数集群的可操作性问题。没有这套路由稳定机制,2.8万亿参数将只是一堆无法有效调用的数字。所以,2.8万亿所代表的是模型拥有如此巨大的容量后,依然能够精准、稳定、稀疏地调用它。

架构只是容器。K3的性能释放,同样依赖于数据配方与后训练对齐,高质量语料的配比、多阶段预训练的数据调度、基于人类反馈的强化学习(RLHF),这些“看不见的工程”对最终模型质量的影响,丝毫不亚于架构创新。月之暗面技术报告花了大量篇幅描述其数据清洗与对齐策略,这正是K3能稳定输出高质量代码和复杂分析,而非仅仅在静态测试中刷分的关键暗线。

简单来说,KDA负责“长”,Attention Residuals负责“深”,Stable LatentMoE负责“宽”,数据与后训练负责“点燃”。四者同时作用,让K3在规模急剧膨胀时,没有变成一头笨重的巨兽,反而是保持了敏捷与高效。

03 代价:能力越强,瓶颈越深

如果把K3写成无短板的神器,这显然不现实。它最明显的短板是速度。Artificial Analysis数据显示,K3输出速度约为39 token/秒,在统计的101个模型中排名靠后。在AA-Briefcase长程测试中,它完成一个复杂任务平均需要近一个小时,平均83轮交互,单任务成本约10.57美元。

价格则是K3另一个常被开发者提及的痛点。输入每百万token 3美元,输出15美元——在中国同行里不算低价(DeepSeek V4 pro在涨价之后的高峰时段输出也仅需3.98美元)。这注定了K3不是“万金油”模型。对于简单的日常问答,它既慢又贵;它的主战场是那些任务足够复杂、上下文足够长、容错率极低的高价值场景。不过把坐标换到海外,账是另一种算法:Claude Fable 5的输出价格约为每百万token 50美元,K3约为其三分之一。同一价格,放在国内市场是“偏贵”,放进全球前沿模型的定价光谱里,则处于明显的低位。

04 考验在之后

这些技术选择带来的影响,很快溢出评测榜单,蔓延至产业层面。彭博社在7月17日的报道中指出,月之暗面将Kimi K3定价在Anthropic Sonnet的水平,“显示出公司相信凭借其能力可以向其他中国模型收取溢价”。一个月后,又在一篇题为《China’s Kimi K3 Is Closing In on America’s Best AI》的报道中,援引Artificial Analysis等多家测评,在其制作的性能-成本散点图上,K3落在Pareto前沿上——性能逼近Claude Fable 5,完成同等能力基准任务的加权平均成本约为其五分之一。这些信号连起来看:中国AI公司正在从“低价换市场”转向“性能定价格”。

研究机构也在重新评估。美国企业研究所研究员Ryan Fedasiuk在一份题为《中国已追上前沿AI》的报告中指出,过去“中方最强模型落后美国6至8个月”的普遍认知正在被打破,双方差距已“接近按周计算”。布鲁金斯学会研究员Kyle Chan则认为,Kimi K3已经超过了Opus 4.8和GPT-5.5等“理论上可被用作蒸馏来源”的美国模型,这表明中国AI能力并非只是对美国模型的衍生。

所以伴随着k3开源,且其能力逼近闭源模型的时候,一个不得不回答的问题摆在闭源模型面前:用户为什么还要选择你?

硬币的另一面也是商业化的自我博弈。权重完全开放后,具备技术能力的企业完全可以选择本地部署并自行微调,而不必调用月之暗面的官方API。这需要月之暗面在获得生态影响力的同时,也在一定程度上让渡了对商业化通道的独家控制权。

路透社8月报道称,月之暗面已对利用Kimi K3等模型建立大型商业服务的用户设置了相应商业条款;阿里也计划对Qwen新模型的大型商业用户探索新的商业化方式。这说明开放权重并不等于没有商业模式,但如何平衡生态扩张与商业变现、在“开放”与“收费”之间找到可持续的平衡点,是K3开源策略面临的真正考验。这个问题目前还没有答案,整个行业都在看着。

至少在这个月的模型混战中,没有哪个模型能永远SOTA。技术突破的窗口期从几个月缩短到几周,甚至几天。真正的考验是,当下一轮浪潮打来时,是被冲走,还是依然站在决定方向的牌桌上?

K3并不完美,速度慢、成本高,整体性能仍落后于最强的闭源模型,月之暗面在技术报告里也承认这一点。

但K3的上一代K2.6在Frontend Code Arena仅排第18名。从第18名到第1名,隔着的不是渐进改进,而是一次架构层面的重构。更重要的是,经历十多款重磅模型轮番冲击后,K3至今依然留在第一梯队。

这靠的是KDA、Attention Residuals、Stable LatentMoE,以及背后看不见的数据工程与强化学习对齐。

Kimi K3的35天证明了两件事。一是能力没有被时间快速折旧:在经历Opus 5、Qwen、DeepSeek、GLM等多轮冲击后,中国模型首次站上了参与定义“下一阶段前沿标准”的起跑线。二是当能力进入同一区间,竞争的天平开始向成本、部署方式与采购逻辑倾斜——榜单决定话题,账单决定选择。比登顶更难的,是留在牌桌上。K3暂时做到了,但艰难的道路还在后面。

(文中内容和观点仅供参考,不构成投资建议。投资有风险,入市需谨慎。)

编辑|邱慧

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
凌晨1点战报:再爆大冷郑钦文横扫8号种子,晋级8强豪取560万奖金

凌晨1点战报:再爆大冷郑钦文横扫8号种子,晋级8强豪取560万奖金

求球不落谛
2026-09-08 02:21:31
郭德纲篡改红歌事件通报来了:相关单位合计被罚没近65万,郭德纲的处罚一句带过

郭德纲篡改红歌事件通报来了:相关单位合计被罚没近65万,郭德纲的处罚一句带过

Mr王的饭后茶
2026-09-07 19:13:17
华为时隔六年再次发布高性能芯片

华为时隔六年再次发布高性能芯片

新华社
2026-09-07 15:08:32
2-0,2-1!美网8强已出2席,萨巴伦卡17连胜,郑钦文比赛时间出炉

2-0,2-1!美网8强已出2席,萨巴伦卡17连胜,郑钦文比赛时间出炉

侃球熊弟
2026-09-07 03:59:13
“一晚上拉了十几次,人都休克了”,就因为吃了这盘炒饭,孩子被下了病危通知,品牌深夜道歉:涉事门店暂停营业

“一晚上拉了十几次,人都休克了”,就因为吃了这盘炒饭,孩子被下了病危通知,品牌深夜道歉:涉事门店暂停营业

芒果都市
2026-09-07 10:00:31
美网官方把郑钦文连续0-5翻盘,比成乔丹G6和伍兹周日

美网官方把郑钦文连续0-5翻盘,比成乔丹G6和伍兹周日

懂球帝
2026-09-08 01:17:40
于东来力挺仅6天,官媒高调宣布韩红的新身份,打了多少黑粉的脸

于东来力挺仅6天,官媒高调宣布韩红的新身份,打了多少黑粉的脸

乐天闲聊
2026-09-07 10:55:22
“女孩赴港看演唱会全家低保被取消”引热议,制度底线不能被“热爱”冲垮

“女孩赴港看演唱会全家低保被取消”引热议,制度底线不能被“热爱”冲垮

新民周刊
2026-09-07 16:55:42
2-0!郑钦文横扫前世界第一 第3次进美网8强 7连胜获523万

2-0!郑钦文横扫前世界第一 第3次进美网8强 7连胜获523万

念洲
2026-09-08 01:43:45
女生赴港看演唱会全家低保被取消?当地民政局工作人员:正核查

女生赴港看演唱会全家低保被取消?当地民政局工作人员:正核查

澎湃新闻
2026-09-07 09:58:03
女篮世界杯淘汰赛对手确定!波多黎各逆袭杀出重围:宫鲁鸣太幸运了?

女篮世界杯淘汰赛对手确定!波多黎各逆袭杀出重围:宫鲁鸣太幸运了?

篮球快餐车
2026-09-07 21:04:04
重磅:俄罗斯正式开通图们江大桥!德国将向乌克兰提供情报

重磅:俄罗斯正式开通图们江大桥!德国将向乌克兰提供情报

项鹏飞
2026-09-07 20:55:21
简直就是奇迹:美国林肯号航母5000多大兵在芭堤雅疯狂玩了5天,竟然仅有2个打架的!

简直就是奇迹:美国林肯号航母5000多大兵在芭堤雅疯狂玩了5天,竟然仅有2个打架的!

步论天下事
2026-09-07 09:40:52
7个葫芦娃剪掉后第一个清晨:葫芦娃爷爷趴在阳台上打水,葫芦娃没了,流量点没了,现场几乎没人拍了

7个葫芦娃剪掉后第一个清晨:葫芦娃爷爷趴在阳台上打水,葫芦娃没了,流量点没了,现场几乎没人拍了

火山詩话
2026-09-07 05:57:18
中专女生去香港看演唱会全家被取消低保,表姐发帖大呼可怜

中专女生去香港看演唱会全家被取消低保,表姐发帖大呼可怜

新动察
2026-09-07 09:46:22
炸了!最新研究实锤:不吃肉一个月,你的基因正在“逆天改命”!抗炎、抗癌、延缓衰老,全齐了!

炸了!最新研究实锤:不吃肉一个月,你的基因正在“逆天改命”!抗炎、抗癌、延缓衰老,全齐了!

爱医斯坦
2026-09-06 17:00:52
以牙还牙,中国稀土正式断供!2026年9月4日,路透社透露,在中国把RBA纳入反制清单后,不少中国稀土供应商叫停了对美发货

以牙还牙,中国稀土正式断供!2026年9月4日,路透社透露,在中国把RBA纳入反制清单后,不少中国稀土供应商叫停了对美发货

扶苏聊历史
2026-09-07 17:32:06
9月7日,人社部与财政部正式出炉关于2026年调整退休人员基本养老金的通知文件了吗?

9月7日,人社部与财政部正式出炉关于2026年调整退休人员基本养老金的通知文件了吗?

扶苏聊历史
2026-09-07 14:06:15
郭德纲唱红歌事件后续:处罚通报公布,罚款数额巨大,以后真要管住嘴了

郭德纲唱红歌事件后续:处罚通报公布,罚款数额巨大,以后真要管住嘴了

李晚书
2026-09-07 19:10:28
“我们怎么落到与朝鲜伊朗为伍的地步?”这个问题问得好!

“我们怎么落到与朝鲜伊朗为伍的地步?”这个问题问得好!

廖保平
2026-09-07 08:38:06
2026-09-08 04:27:00
第四波
第四波
深度科技资讯,产业一线报告
103文章数 3关注度
往期回顾 全部

艺术要闻

太罕见!苏轼这幅字流落民间900年,险些被当废纸卖掉……

头条要闻

伊朗试验特殊武器爆炸场面如同地狱 美军舰直接跑了

头条要闻

伊朗试验特殊武器爆炸场面如同地狱 美军舰直接跑了

体育要闻

压哨避开CBA选秀规则?NBL香港金牛队已为男篮国手王俊杰报备合同

娱乐要闻

热搜第一,演员李沐宸致歉

财经要闻

证监会原副主席王建军一审被判无期徒刑

科技要闻

小米澎程N90 Max定价26.99万元

汽车要闻

智能可变大空间SUV 小米澎程系列车型上市 20.99万起

态度原创

艺术
手机
本地
公开课
军事航空

艺术要闻

太罕见!苏轼这幅字流落民间900年,险些被当废纸卖掉……

手机要闻

九月机圈大战!小米发布18 Fold、华为全新三折叠亮相,苹果紧随其后

本地新闻

扒完小作文,富豪们私藏的度假胜地有多绝

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

媒体:中美战区司令会晤释放的信号 台湾要听懂

无障碍浏览 进入关怀版