Kimi K3,可能是开源大模型今年最大的变量。
Kimi K2 时代,大家更多把它看成 DeepSeek、GLM 的竞争者;但到了 K3,它真正开始和 GPT、Claude 坐到了一张桌子上。
从 Artificial Analysis 最新评测来看 图二 ,Kimi K3 的 Intelligence Index 达到 57 分,已经进入 GPT-5.5、Claude Opus 4.8 同一梯队,仅落后于 Claude Fable 5 和 GPT-5.6 Sol。
这意味着,中国模型第一次在综合智能维度真正进入全球第一梯队。
更值得关注的是 Agent 能力。
GDPval v2 上,Kimi K3 的 Elo 达到 1668,超过 GPT-5.5、GLM-5.2 和 Opus 4.8,仅次于 Fable 5;AutomationBench-AA 更是直接拿下第一;长任务知识工作评测 AA-Briefcase 也排名全球第二,仅落后于 Fable 5。
如果说去年大家比的是「谁更会聊天」,今年开始,比的已经是谁更能干活。
当然,K3 并不是没有代价。
2.8T 参数规模意味着它几乎是目前最大的开源模型之一,API 价格相比 K2 也明显上涨,已经接近 GPT-5.6 Sol,失去了过去「便宜大碗」的优势。
不过,Moonshot 的真正杀手锏可能不是价格,而是开放权重。
官方表示将在 7 月 27 日开放完整权重。
如果兑现,Kimi K3 很可能直接成为当前综合能力最强的开源模型,超过 GLM、DeepSeek 等所有开源竞争者。
对于整个开源 AI 生态来说,这可能比模型本身的性能提升更重要。
另一个容易被忽略的数据,是它的效率。
K3 比 K2.6 少用了约 21% 的输出 Token,却拿到了更高的智能评分。这意味着它不是简单堆参数,而是在推理效率和训练方法上也有明显进步。
此外,在 Frontend Code Arena 中,(图一)Kimi K3 也直接冲到了全球第一,甚至超过了 Claude Fable 5。
从 K2.6 的第 18 名一路跃升到第 1 名,这个跨度相当夸张,也说明它在代码生成、前端开发等 Agent 场景上的提升非常明显。
整体来看,Kimi K3 不一定已经是世界最强模型,但它很可能已经是世界最强开源模型候选者。
更重要的是,它代表了国内大模型竞争正在发生变化:过去大家追求的是榜单分数,现在开始真正围绕 Agent、长上下文、工作流和开放生态展开竞争。
接下来最大的悬念,只剩下一个:7 月 27 日,Moonshot 能否按时放出完整权重。
如果兑现,今年的开源大模型格局,可能又要重新洗牌了。
![]()
![]()
![]()
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.