即将推出的月之暗面 K3 已在社交媒体上刷屏。
各方面信息显示,Kimi K3 将是中国迄今为止最大的人工智能模型,参数规模达 2.8 万亿。
与之相比, Anthropic Opus 4.8 参数规模为 1.5 万亿至 2 万亿。
![]()
![]()
同时,K3 将采用 Open Weight(开放权重) 的方式发布,允许开发者下载、部署和修改模型权重,而不是仅提供 API 服务。
这意味着,K3 不仅将在模型规模上超过目前已知的大多数中国模型,也将成为全球最大的开放权重基础模型之一。
![]()
根据月之暗面官方Kimi K3技术文档,在 GDPval-AA v2 排行榜上,K3 获得1687 分。该榜单用于评估 AI 模型在覆盖 9 大行业、44 种职业的真实世界知识工作任务中的表现。
Kimi K3 的成绩仅次于 Claude Fable 5 Max 和 GPT-5.6 Sol Max,并超过了 Claude Opus 4.8 Max 的 1600 分。
在 AA-Briefcase 基准测试中,Kimi K3 获得了 1527 分,在所有模型中排名第二,仅次于 Claude Fable 5 Max,同时超过了 GPT-5.6 Sol Max(1495 分)。
AA-Briefcase 是由 Artificial Analysis 开发的一项专有 Agent 知识工作评测基准,用于衡量当前最先进 AI 模型在长期知识工作场景中的 Agent 能力。
K3 最令人关注的另一项能力来自长上下文。
月之暗面表示,依托 100 万 Token(1M)上下文窗口,Kimi K3 在 BrowseComp 上取得 91.2 分,达到新的 SOTA(State of the Art),击败 GPT 5.6 Sol Max 和 Fable 5 Max。
![]()
官方特别强调,这一成绩是在单 Agent 设置下完成的,不需要上下文压缩,也不需要额外的上下文管理系统,体现了模型在超长知识检索、复杂资料分析以及长期任务执行上的能力。
对于越来越强调 Agent 的行业来说,这比传统数学或编程基准更有现实意义,因为真实企业场景往往需要模型连续阅读数百页文档、跨多个来源检索信息,并持续完成长时间任务。
性能达到高端旗舰水平的同时,月之暗面在定价上的策略更值得关注。
图表可见,其相比 k2.6 涨幅明显,且价格直接对标Sonnet 5 。
![]()
![]()
看来月之暗面开始抛弃”极致性价比”路线,而是进入高端旗舰定价水平,开了中国大模型的新风气。
最新消息是, BridgeMind 在 X 上披露称,Kimi K3 刚刚在 BridgeBench Horror House 游戏测试中击败了 Fable 5,“完全没有料到这一点”。
尤其 Kimi K3 在游戏开发和 UI 设计方面优于 Fable 5,而“这两项原本是 Fable 5 的专长”。
所以,K3 的“价格上涨突然变得合理了”。
![]()
有网友发帖惊呼,尽管稍逊色,但 K3 基本上与 Fable5 相当,超过 GPT- 5.6,“是又一个 DeepSeek r1”时刻!
![]()
更多网友则在亲测后表示,K3 已经超过 Fable 5,尤其前端设计方面。
![]()
![]()
英国《金融时报》认为,K3 的推出可能挑战过去业内长期存在的一种共识——中国前沿 AI 模型整体落后美国 8 至 12 个月。
报道指出,虽然美国模型在最复杂任务上仍保持领先,但越来越多美国科技投资人与企业高管开始认为,这一差距正在迅速缩小。
Andreessen Horowitz 联合创始人 Marc Andreessen 上个月就在 X 上评价中国模型时写道,“GLM-5.2 是第一个与美国大型实验室公开 AI 模型不相上下,甚至经常更胜一筹、没有任何妥协的中国 AI 模型。”
《金融时报》认为,K3 的出现将进一步强化这一趋势。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.