7月16日,月之暗面(MoonshotAI)发布了他们的新旗舰模型 Kimi-K3,这是一个拥有2.8万亿参数的开源权重模型。
Kimi-K3 是目前最大的开源权重模型,规模几乎是 DeepSeek-V4 的两倍,也是第一个超过最初引发AI热潮的1.8万亿参数 GPT-4 的开源权重模型。
这款新模型的规模和性能再次引发了关于中国模型与美国前沿模型之间,实际差距有多大的争论。
![]()
在深入探讨中美差距之前,我首先想为你描绘一下 Kimi-K3 在发布1天后的基准测试表现。
在月之暗面自己发布的基准测试中,Kimi-K3 在35项测试中的30项上超过了 Opus 4.8,在19项上超过了 GPT-5.6-Sol,在12项上超过了 Claude Fable 5。
在第三方评估如 Artificial Analysis 的智能指数中,它是继 Fable 5 和 GPT-5.6-Sol 之后排名第三的模型,并且相比之前的中国旗舰模型如 GLM-5.2、Kimi-K2.6、Qwen3.7-Max 和 DeepSeek-V4-Pro 有明显提升。
![]()
其他基准测试如 WebDev Arena(模型需要创建吸引人的网页)显示 Kimi-K3 在所有其他模型中占据主导地位,包括 Fable。
![]()
还有一个我想强调的 Kimi-K3 处于前沿的领域。
一个例子是 GPU 内核优化,以 KernelBench 衡量。要快速高效地运行模型,你需要尽可能好地利用硬件,因为你浪费的每一个时钟周期都意味着每秒更少的token和更高的延迟,这总体上转化为更低的 GPU 吞吐量和因此更低的收入。
这是一个高影响力的领域,不仅与生产环境相关,也与早期的研究阶段相关。每个新的架构想法都必须通过运行一系列实验来验证。在普通 PyTorch 中运行它们无法有效利用硬件,这就是优化内核发挥作用以加速的地方。
一个能够帮助研究人员为这些实验编写内核的模型是很有价值的,因为它节省时间和金钱,而 Kimi-K3 与 Fable 5 一起处于这一领域的前沿。
![]()
作为参考:
GPT-5.6-Sol 比 Kimi-K3 早7天发布
Fable 5 比 Kimi-K3 早37天发布
Opus 4.8 比 Kimi-K3 早49天发布
从表面上看,这些基准测试结果似乎表明 Kimi-K3 已经赶上了美国的前沿水平。
那么,事情就定论了,对吗?并不完全如此。
为此,我们必须更深入地审视基准测试,并定义我们实际上想要测量什么,以及我们为什么在意。
为什么中美AI差距很重要
已经有很多人就此撰写了许多优秀的文章和场景分析。
但简而言之,AI 在软件工程领域正呈指数级进步,我们在这一领域对效果进行了最广泛的测量,但这很可能也适用于其他领域,例如数学。
具体而言,在软件工程方面,AI 模型大约每4个月将其时间跨度翻倍。时间跨度衡量的是人类完成一项任务所需的时间,而该模型有50%的概率能够解决这项任务。可以将其视为任务难度的代理指标。人类花费更多时间的任务更难。
除了按难度对编程任务进行排名本身就很困难这一明显原因外(因为代码行数或其他表面指标并不是好的代理指标),使用时间跨度还有一个好处,就是具有经济可解释性。
如果我们预测 AI 在未来2到3年内保持这一趋势,我们最终将得到能够完成人类需要数月到数年才能完成的工作的 AI。
![]()
AI未来模型
即使这一趋势仅限于编程,拥有超人编程能力的 AI 对于控制它们的人来说显然是一个巨大的战略优势。
所以我们关心这个差距,即一个国家开发出与另一个国家相同能力所需的时间,因为它改变了谁控制未来。
我们关注中国和美国,因为经验表明,最好的模型来自这两个国家,大多数 AI 研究在这两个国家进行,大多数 AI 算力也位于这两个国家。
欧洲理论上可以参与这场辩论,因为它们确实有钱和人才,但到目前为止没有表现出任何认真竞争的有意义的兴趣。
到目前为止,美国一直领先于中国这一点非常明确。
但正如我们从 Kimi-K3 的基准测试中看到的,这一点不再像以前那样明确了。
我们如何测量差距?
差距描述的是一个实验室达到另一个实验室相同能力所需的时间。
这个差距的定义是危险的,因为它隐藏了几个需要区分的重要方面:
能力是领域依赖的。一个模型可以在编码能力上赶上另一个模型,同时在特定其他领域或总体上仍然更差。
存在前瞻性差距和回顾性差距。前瞻性差距问的是:"落后者需要多长时间才能达到当前的最先进水平?"
回顾性差距问的是:"前沿实验室在多久以前达到了落后者目前拥有的相同性能?"
通常差距指的是回顾性差距,因为前瞻性差距是一种预测练习,具有更高的不确定性,因为它取决于你对算力、人才、新 AI 带来的加速以及许多其他事物及其增长率的假设。
在尝试估计这些差距时出现的问题之一是,可观察的进展是离散的,因为模型每隔几周到几个月才会发布一次,取决于实验室。
![]()
进展并不沿着平滑曲线发生,如上图示例所示,而且模型不太可能有完全相同的分数,让你可以简单地测量它们之间的时间。
你有三种通过差距定义来解决这个问题的方法。你要么通过取前沿上最接近落后者能力的上方或下方的下一个模型来高估或低估时间,要么你对数据拟合平滑回归线并进行比较。
就我个人而言,我认为最后一个选项最好,因为它是对称的,更好地反映了更大的潜在趋势,还允许你测量差距缩小或增长的速度。
这种方法的缺点在于它取决于回归模型的选择,并且会掩盖任一方向上的趋势中断。所以这可能会对 Kimi-K3 不利。
但到目前为止,我们在过去约5年中只看到了一次,也许两次趋势变化。
第一次发生在2024年第三季度推理模型出现时,与模型规模无关。
第二次更有争议的变化发生在2025年11月 Opus 4.5 发布时,当时智能体模型开始起飞。这也与模型规模无关,所以如果 Kimi-K3 比 DeepSeek-V4-Pro 大了将近2倍,就会突然打破任何现有趋势,我会感到惊讶。
所以为了公平起见,我将报告两个数字:一个测量当前即时差距的区间,包括低估和高估,以及一个基于拟合回归线的更普遍的趋势估计。
现在我们将简要地深入了解基准测试,然后看看一些趋势和差距。
为什么基准测试的选择会改变答案
月之暗面报告了35个基准测试,其中包括8个编码基准测试、12个智能体基准测试、3个"推理"和知识基准测试,以及12个视觉基准测试。
当我查看这些基准测试及其构成时,我注意到:
没有长上下文基准测试
没有网络、生物、化学或任何安全相关基准测试
没有严肃的数学基准测试,只有 MathVision、GPQA-D 和 HLE
没有纯推理基准测试。他们只把 GPQA-D 和 HLE 放在"推理"和知识类别下,而这实际上只是一个带有一些数学的知识类别
视觉和智能体基准测试占主导地位,在35个基准测试中占了24个
编码基准测试确实包含一些我认为高信号的基准测试,因为它们的范围和更长的时间跨度,如 ProgramBench 和 SWE-Marathon
没有量化推理/token效率的基准测试
因此,这些结果无法支持"Kimi-K3 总体上比 Opus 4.8 和 GPT-5.6-Sol 更好"的结论。
在任何情况下,你都不能论证 Kimi-K3 比 Fable 5 更好,因为它在大多数测试中都输给了 Fable。
然而,我们可以说 Kimi-K3 的编码能力与当前美国前沿模型相当。
现在让我们看看我分享的其他结果,比如 Artificial Analysis 指数(以下简称 AAI)。
如今它是最受欢迎的指数之一,但它有类似的问题,我认为它不应该被用于评估一般模型强度。这有几个原因:
首先,基准测试的构成严重偏向智能体和短时间跨度的编码问题,占该指数权重的58%。
(我们不应该手动选择权重或基准测试)
![]()
智能基准测试 | Artificial Analysis
其次,每个基准测试的难度和信息增益完全被忽视了。
这并不意味着 AAI 毫无用处。它仍然产生与用户体验相关性良好的排名,因为它专注于经济上有用的任务。
所以,我不会将其描述为一般能力或智能的基准测试,而是日常实用性。
这也是我称其为"Artificial Analysis 指数"而非其官方名称"Artificial Analysis 智能指数"的原因。
这就是 EpochAI 的能力指数(简称 ECI)的用武之地。
它解决了这些问题,并尝试使用项目反应理论(Item Response Theory)测量整体的潜在一般能力,并将其统一到一个尺度上。
在项目反应理论中,正确回答问题的概率取决于应试者的能力和问题的难度。
ECI 将此应用于基准测试。它假设我们只需要知道模型的潜在能力和基准测试的难度及斜率,就能预测模型的得分。
对于每个基准测试,估计两个参数:
一个难度参数,告诉你达到50%分数所需的能力
一个斜率参数,告诉你基准测试分数对能力变化的敏感度,或该基准测试对相似能力模型的区分度
最后,将所有这些基准测试拟合到一个单一的统计模型中,并优化模型的潜在能力,使得潜在能力最准确地预测所有观察到的分数。
与 AAI 不同,ECI 减少了对手动选择基准测试权重的依赖,不需要所有基准测试都出现在所有模型中,最重要的是,它考虑了每个基准测试的难度和区分能力。
Anthropic 最近也采用了这种测量模型强度的方法。
他们的图表还很好地展示了不同基准测试的难度,如 GPQA Diamond、SWE-Bench-Verified 等。
例如,最左边 GPQA-Diamond 的条形告诉我们,Anthropic ECI 略低于130的模型将在 GPQA-Diamond 上获得50%的分数。
因此,给定这个尺度和 Claude 3 Opus 的这个单一潜在能力(Anthropic ECI 分数),我们可以预测它在 GPQA-D 上的得分应该略低于50%。
这也大致是我们观察到的。Opus 3 的得分略高于预期(50.4%)。
![]()
来自 Mythos Preview 系统卡的 AEC
这就是 ECI 的美妙之处。它让我们能够在单一的共享尺度上推断潜在能力,同时比手动选择和加权的指数更少偏见。
Artificial Analysis 的差距
在澄清了讨论这些问题时的常见陷阱之后,让我们进入测量差距的有趣部分。
我们的起点是 Artificial Analysis 指数,因为它确实为我们提供了 Kimi-K3 的分数以及其他分数的详细历史。
我使用 sigmoid 函数,因为该指数被限制在0到100之间。
![]()
我们相邻模型滞后区间的回顾性差距为1.22-1.61个月,线性插值中间估计为1.48个月。
更大的趋势表明差距约为2.89个月。未来的中国模型发布将告诉我们 Kimi-K3 是真正的趋势突破还是异常值。
基于这些预测,如果动态保持不变,中国模型应该会在2027年末在这个指数上超过美国模型。
但仅看两国的当前前沿隐藏了个别实验室的趋势。
以下是美国(Anthropic、Google、OpenAI)和中国(阿里巴巴、DeepSeek、月之暗面、Z AI)个别实验室的趋势:
OpenAI 和 Anthropic 的轨迹基本相同
Google 已经落后于中国模型,而且它们的趋势看起来也不太好
在中国前沿实验室中,月之暗面的轨迹最陡峭,如果趋势保持,应该在2027年2月超过 Anthropic
![]()
我已经阐述了为什么我们不应该看 AAI,以及为什么 ECI 更好。
然而,我们没有 Kimi-K3 的 ECI 分数。
Kimi-K3 的 ECI 预估
对 Kimi-K3 的 ECI 有几个估计:
我的社区认为它会在158-159之间
![]()
社区调查
就我个人而言,我会猜156-157。
Teortaxes 猜的是157-158
但我们不必依赖直觉,我也不想依赖我的估计来预先阻止人们说我偏见。
幸运的是,Artificial Analysis 指数和 ECI 高度相关,这让我们可以做出更有根据的猜测。
但有一个问题。正如你所见,线性模型首先非常弱地高估了 Claude-2/3 模型,然后从 x=[10-30] 左右开始低估,然后再一次高估更强的模型。
![]()
线性模型不太合理。这是因为 Artificial Analysis 指数分数被限制在0到100之间,更适合用 sigmoid 建模。然而,ECI 是线性的且无界的。
为了匹配这两个模型,我们对 AAI 分数应用 logit 变换(sigmoid 运算的逆运算)来解压。
新拟合的模型具有以下形式,我们现在可以用它将 AAI 分数转换为 ECI 分数。
![]()
它看起来干净多了,我们的误差证实了这一点。logit-线性模型将平均绝对误差降低了37.2%。
![]()
这个模型给出的 Kimi-K3 估计 ECI 分数为158.33,bootstrap 80%置信区间为[154.49, 162.02]。
在撰写本文时,我们实际上得到了 EpochAI 关于 Kimi-K3 的一些初步结果。
Kimi-K3 在 FrontierMath 上不具备竞争力,仍然落后于 GPT-5.2-Pro,一个7个月前的模型。
![]()
EpochAI 的 FrontierMath T4 (V2)
有了 Epoch 的这些新结果,我们整个估计有点毫无意义了,因为我们可以直接使用 EpochAI 和月之暗面提供的基准测试,即:AIME 2024-2025、GPQA-D、FrontierMath 1-3/4、SimpleQA Verified、Chess Puzzles、PostTrainBench、APEX-Agents 和 HLE 来直接计算 ECI。
不过,这个推导出的 AAI 和 ECI 转换公式在未来会派上用场。
计算初步 ECI 得出的分数为155.53,90%置信区间为[153.87, 158.21]。对于进一步的分析,我们将使用这些分数。
这在我们基于相关性的置信区间内,尽管比预期略低。请注意,随着更多基准测试的进入,这些分数仍可能变化,但这个估计应该比基于相关性的更准确。
Mythos Preview 的 ECI 预估
首先,我们需要解决房间里的大象。
我们没有 Mythos Preview 的 ECI 值,它于2026年4月7日作为 Glasswing 项目的一部分发布。
![]()
Mythos Preview 的确切完成日期不清楚,但我们从系统卡中知道,自2026年2月24日起它已向 Anthropic 员工开放。
然而,不确定这是否与系统卡中的 Mythos Preview 相同,我们也不知道其他所有模型何时在内部可用,所以我们将采用4月7日作为该模型的官方发布日期。
Anthropic 也只提供了他们自己的 ECI 版本,即 AECI。
但你可以转换它,例如:
Mythos 有多好?——使用 ECI 方法论的估计值为161.5
Ramez Naam 在 X 上:使用 OLS 为161
我们推导出的 Mythos Preview 的 ECI 为161,90%置信区间为158到166。
这与实际的 Fable 5 ECI 160(158-165)非常接近。
我认为这是公平的,考虑到 Fable 5 很可能是 Mythos Preview 的一个更小的蒸馏模型,并带有额外的安全训练。这两者都会略微降低其分数。
根据 ECI 的中美差距
首先,让我们看看中国和美国 AI 模型之间的总体前沿趋势。
基于我们的"差距方法论",Mythos Preview 不影响经验回顾性差距估计,因为 Kimi-K3 根本远远不及它。
Kimi-K3 目前介于 GPT-5.3-Codex 和 GPT-5.4-Pro 之间,这产生的相邻模型滞后区间为4.37-5.29个月,线性插值中心估计为5.27个月,因为 Kimi-K3 更接近 GPT-5.3-Codex 而非 GPT-5.4。
![]()
基于我们为前沿模型拟合的趋势线,回顾性差距目前为6.08个月,不存在中国模型的交叉或追赶情景。
此外,趋势线预测中国模型将在2027年3月7日达到 Mythos Preview 的161分,这意味着前瞻性差距为11个月。
在假设 Mythos 分数和发布日期固定的情况下,中国趋势的点wise 90%置信带在2026年12月28日至2027年6月18日之间达到 ECI 161,或表示为滞后时为8.72至14.38个月。
仅按国家看前沿趋势线忽略了个别实验室可能更陡峭的趋势,所以我们也看看这些。
![]()
Anthropic 目前处于最陡峭的趋势线上,每年增加25个 ECI 点,其次是 Z-AI 为16.2,OpenAI 为14.3,月之暗面为13.8。
即使没有 Mythos Preview,Anthropic 的改进速度仍然是最快的,为每年18.1个 ECI。
值得注意的是,在这种情况下,中国模型也不会赶上美国模型。
以下是月之暗面和 Z-AI 达到 Mythos Preview 的 ECI 分数的前瞻性差距:
月之暗面:2026年12月23日;中心差距8.57个月。
90%交叉区间:2026年11月7日至2027年2月22日
或 Mythos Preview 之后7.05-10.57个月。
Z AI:2026年12月31日;中心差距8.83个月。
90%交叉区间:2026年10月24日至2027年4月21日
或 Mythos Preview 之后6.60-12.48个月。
结论
总结一下,基于 ECI,Kimi-K3(当前中国前沿)与美国前沿之间的回顾性差距似乎为4.37-5.29个月。
前瞻性差距,即估计中国模型何时首次达到 Mythos-Preview 等效模型,如果陡峭但不确定的 Z-AI 趋势保持,估计在6.6个月到12.48个月之间。然而,前瞻性差距的中心估计分别为8.57和8.83个月。
简而言之,中国模型尚未赶上美国前沿模型,也不被预测会赶上。
关于蒸馏以及差距和明显追赶的一些额外思考
Kimi-K3 是一个2.8万亿参数的模型,确实在一些高度特定的基准测试中击败了 Opus 4.8 和 GPT-5.6-Sol。
然而,这些基准测试没有考虑模型规模和推理/token效率。
从 Cursor CEO Michael Truell 那里我们知道,Opus 和 GPT 模型的大小与 Cursor 新宣布的1.5万亿参数模型相似。这个说法很可能指的是 Opus 4.8 和 GPT-5.4。GPT-5.5 和 GPT-5.6 似乎是更大的模型,估计接近3万亿参数。
这意味着 Kimi-K3 在一些基准测试中击败 Opus 4.8 从架构角度来看并不令人印象深刻。
一般来说,它的推理效率仍然比美国模型差。
这是我认为前瞻性和回顾性 ECI 差距都被低估的众多原因之一,因为模型规模、推理效率、真实模型服务成本和总体算力没有被纳入考虑(因为这些数字大多不公开)。
想象一下,如果美国和中国实际上在竞赛或全面战争中。那么,你拥有100万个最新的 Blackwell GPU 还是只有吞吐量较低的旧 Hopper GPU 是有区别的,因为内存/算力关系到你能够部署的实例数量以及服务它们的速度。
另一个原因是美国实验室比中国实验室进行了更彻底的安全测试,这可能额外增加一个月。
我想提到的最后一个差距可能被低估的原因是,大多数基准测试不能代表真实世界的任务,也不试图激发最大可能的性能,因为受成本和时间限制。
Mythos 据传是一个10万亿参数的模型。我们还从多个美国实验室得知,他们正在开发自己的巨型10万亿参数模型,如 SpaceX AI、OpenAI 和 Meta。
中国模型现在可能已经赶上了上一代模型,这是完全合理的,然而美国实验室已经转向下一代模型。
我认为我们在 Kimi-K3 明显追赶中所看到的,很可能是前沿实验室如 OpenAI 和 Anthropic 正在保留他们最有能力的模型,因为前沿模型发布的不确定法律状况,由于它们的网络和 CBRN(化学、生物、放射性和核)能力。
此外,在 Anthropic 和 OpenAI 发布了他们新的前沿模型 Fable 5.1 和 GPT-6 的反事实世界中,这些模型据推测已经完成训练,我们不会谈论任何类型的追赶,因为这些新的10万亿参数模型完全是不同的野兽。
我们没有看中国模型为何在近几个月取得如此快速进步的原因,尤其是在 Artificial Analysis 指数上,中国模型据称将在2027年初超过美国前沿模型。
快速追赶的一个可能原因是蒸馏。从技术上讲,你需要访问模型才能进行真正的蒸馏,但使用更强的模型作为较弱模型输出的评判者已经可以算作蒸馏。
Anthropic 多次报告他们能够追踪到来自中国实验室的蒸馏攻击。所以蒸馏是真实存在的,但我们不知道其确切程度以及它对中国实验室改进模型的帮助有多大。
中国模型获得的能力中至少有一部分非零比例可归因于蒸馏。
我试图想出一个近似值,看看这些蒸馏攻击何时开始大规模发生。我不确定我们如何甚至测量这个。但一种间接方法可以查看某些指数如 Artificial Analysis 对时间的导数,看看进展何时不自然地加速。
自2025年8月至10月以来,中国实验室的测量进展速度比美国实验室更快,尽管美国实验室拥有更多的算力、数据、人才和更好的模型,这些应该能加速新模型的开发。
![]()
我不认为这是一个特别好的估计,但它仍然是一个有趣的观察。那么为什么会发生这种情况?中国实验室的曲线不应该只是在时间上平移吗?为什么它们达到更高的峰值速度?
一种解释可能仅仅是基准测试有界,而美国实验室从更高的分数开始,在那里进步更难。
所以我尝试应用 logit 变换来消除一些使进展看起来更慢的压缩。但 logit 变换并没有改变故事。月之暗面和 Z-AI 仍然有更高的峰值速度。
所以其他可能的追赶解释包括:
追赶本身就比开发新的前沿能力更容易,因为改进的总体方向由前沿提供
AAI 测试的能力在公开领域非常可见,适合 RL 爬坡,因此成为爬坡的目标
来自前沿模型的蒸馏
一些选择偏差,因为我们只看两个增长最快的中国实验室,它们的风险押注成功了
也许只是观察的幸运窗口,因为我们没有包含很多模型
追赶故事似乎也仅适用于 AAI,而不适用于 ECI。
就我个人而言,这是所有这些因素的组合。
我认为只是特定领域和任务显示出任何类型的追赶。
追赶发生的原因仍然很有趣,因为它会告诉我们更多关于未来能力轨迹的信息。
虽然不证明蒸馏是原因,但最近的英国 AISI 结果和 ECI 结果至少指向了蒸馏和狭窄任务爬坡的方向。
![]()
具体而言,当查看英国 AISI 的网络范围时,GLM-5.2 仅与 Opus 4.5 持平,尽管在许多自我报告的编码基准测试中接近 Opus 4.8。
英国 AISI 的网络范围也可能是我们拥有的最好的基准测试,因为这些是非常困难的任务,模型使用1亿个 token 并被推至极限。
MirrorCode 以更极端的方式做到这一点,每个模型使用多达10亿个 token。
还有一个奇怪的事情是,我们还没有看到中国模型的任何科学突破。如果它们真的和美国前沿模型一样好,它们不也会解决以前未解决的数学、物理和其他问题吗?
我们应该在网络和 CBRN 任务上评估中国模型,因为这些正是前沿实验室故意保留实力和采用安全过滤器的领域,意味着如果没有通用越狱,你无法蒸馏这些能力。
中国模型实际上没有进行安全测试和训练,至少没有达到美国模型的程度。
![]()
来自 CAIS 仪表板的风险指数
如果中国模型在大规模蒸馏,那么我们应该观察到这些模型在网络和 CBRN 任务上也更弱,鉴于它们没有进行那么多安全测试和训练。
至少 GLM-5.2 在英国 AISI 网络范围上的最新结果似乎确实表明了这一点,ExploitBench 和 ExploitGym 的一些较弱证据也支持这一点。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.