★ 设为星标 | 只讲人话,带你玩转AIGC。
GLM-5.3 的第三方测评出来了。
在 Artificial Analysis Intelligence Index 上,它拿到 60 分,和 Kimi K3 并列,距离榜首只有 3 分。
上一代 GLM-5.2 是 53 分。
底座没换,架构没换,参数没增加,只靠一个月的后训练,涨了整整 7 分,直接飙到总榜第四。
![]()
当然,一个榜单不能代表全部能力。但这套测试同时覆盖真实工作、工具调用、终端编程、科学推理、知识和长上下文,不是只刷几套数学题。
所以,60 分至少说明:GLM-5.3 的增长不是完全靠发布会滤镜。
今天智谱联合创始人、首席科学家唐杰老师在 X 上写了一篇《Thoughts About Scaling Law》,专门解释这件事。
![]()
他的核心观点不是“参数已经不重要了”。
而是:Scaling 没有固定配方,模型发展到不同阶段,最值得扩大的东西也会变化。
Scaling 一直在换答案
大模型早期遇到的第一个问题很直接:如果训练算力增加了,到底应该拿来扩大参数,还是增加训练数据?
2020 年,OpenAI 的 Kaplan 团队给出了一套答案。
按照他们拟合出的规律,算力增加 10 倍,最优模型的参数量大约扩大 5.4 倍,训练数据只扩大约 1.9 倍。
参数和数据的增长指数分别是 0.73 和 0.27,前者约为后者的 2.7 倍。
这里特别容易看错。
2.7:1 不是参数数量与 token 数量的比例,而是两者随算力增长的速度之比。
Kaplan 的结论可以理解为:有了更多算力,优先把模型做大。
于是,大模型进入了疯狂长身体的阶段。
GPT-3 做到 1750 亿参数,Gopher 做到 2800 亿,MT-NLG 做到 5300 亿。
模型发布越来越像健身房称重,数字先报出来,体脂率以后再聊。
很快,问题出现了。
模型虽然越来越大,却没有获得足够的数据训练。参数很多,见过的世面不够,多少有点五大三粗。
2022 年,DeepMind 训练了 400 多个不同规模的模型,重新计算参数、数据与算力之间的关系。
Chinchilla 给出的答案是:当训练算力固定时,模型应该做得小一点,同时多喂数据。
他们得到的经验值更加直观:对于稠密模型,训练 token 数大约是参数量的 20 倍。
一个 700 亿参数的模型,大约需要 1.4 万亿个训练 token。
这里的 20:1 和前面的 2.7:1 不是同一种东西。
2.7:1 描述参数和数据各自增长的速度;20:1 则是训练 token 数与参数量的直接比例。
Chinchilla 自身只有 700 亿参数,却在很多任务上超过了 2800 亿参数的 Gopher。
行业终于发现,与其造一个巨大的模型然后匆匆停训,不如把模型做小一点,让它多读点书。
但 Chinchilla 解决的仍然只是训练阶段的问题:给定一笔训练算力,怎样获得最好的模型?
模型投入使用之后,新问题又来了。
一个模型只训练一次,却可能被调用几十亿次。模型越大,每次调用的成本越高。
调用量足够大时,训练阶段省下来的钱,很快又会在推理阶段加倍交回去。
于是,新的思路出现了:选择一个更小的模型,花更多算力把它训练得更充分,从而降低此后每一次调用的成本。
Llama 2 7B 使用了约 2 万亿个训练 token,平均每个参数对应约 290 个 token。
Gemma 2 9B 使用了约 8 万亿个训练 token,平均每个参数对应约 889 个 token。不过,Gemma 2 还使用了知识蒸馏,不能只凭这个比例与 Chinchilla 直接比较。
从 20 到 290,再到 889,确实是训练数据相对参数规模的大幅增加。
但它不是同一个最优比例被不断刷新,而是优化目标变了。
Chinchilla 追求的是训练一次时最划算;Llama 2 7B 和 Gemma 2 9B 还要考虑模型上线后的长期调用成本。
模型小一点,训练狠一点,以后每次运行都便宜一点。只要练不死,就往死里练。
接下来,MoE 又让原来的计算方法不够用了。
稠密模型每次运行都会使用全部参数,因此“一个参数对应多少 token”比较容易计算。
MoE 不一样。
一个 MoE 模型可能拥有 7000 亿总参数,但处理一个 token 时,只激活其中几百亿参数。
此时,“参数量”已经分成两个数字:
总参数决定模型大约能装下多少知识,激活参数决定每次运行实际使用多少计算。
总参数像图书馆的藏书量,激活参数像处理当前问题时真正搬到桌上的书。
藏书多,有利于覆盖冷门知识;每次能调用的专家更多、计算路径更深,则更有利于处理复杂推理。
所以,稠密模型的每参数 20 个 token,不能直接套在 MoE 身上。究竟该除以总参数,还是激活参数,答案会差几十倍。
唐杰老师引用的研究还指出,不同任务需要的 Scaling 配方也不同。
记忆事实更依赖总参数和模型容量;代码与推理则更依赖训练数据、激活计算和有效深度。
即使保持相同的 token 参数比,盲目增加总参数,也不一定能改善推理能力。
到这里,Scaling 已经从一道算术题,变成了一张控制台。
参数、数据、架构和激活计算,每一个都是单独的旋钮。
智谱这次转了后训练
沿着这条线,唐杰老师把话题带回 GLM-5.3。
GLM-5.3 和 GLM-5.2 使用相同的底座、架构、总参数和激活参数。智谱没有扩大模型,而是用一个月时间,增加长程任务环境和强化学习训练。
结果是,Artificial Analysis 的得分从 53 分提高到 60 分。
这相当于一次受控实验:其他条件不变,只转动后训练这个旋钮。
唐杰老师特别提到漏洞发现。
它不是从记忆里检索几个 CVE,而是要把一条可能长达 20 步的推理链走完,中间不能丢掉线索。这类能力不只取决于模型记住了多少知识,也与每次计算的有效深度和后训练有关。
GLM-5.3 这次扩大的不是参数,而是模型完成长程任务的能力。
不过,这次升级并不能证明后训练已经取代预训练。
唐杰老师强调,模型规模、预训练数据和每次前向计算量仍然有扩展空间。
智谱这次选择后训练,只是因为在 GLM-5.2 当前这个阶段,它剩下的余量最大。
Scaling 还有很多旋钮。上一次最值得转动的那个,未必还是下一次的答案。
同一张控制台,不同旋钮
这个让我最近爆火的另一个国产模型: Qwen3.8-27B。
它只有 270 亿参数,而且是一个稠密模型。每次推理时,全部参数都会参与计算,不存在 MoE 模型的总参数与激活参数之分。
但它的成绩一点也不像小模型。
在 Artificial Analysis Intelligence Index 上,Qwen3.8-27B 拿到 52 分,与 GPT-5.6 Luna 并列,只比 GLM-5.2 和 DeepSeek V4 低 1 分。
![]()
更夸张的是 Agent 能力。
在 Artificial Analysis Agentic Index 上,它拿到 51 分,排在榜单第 8 个位置,超过了 GPT-5.6 Terra、DeepSeek V4、Muse Spark 和 GLM-5.2。
剔除并列的,排行总榜第 5!
![]()
作为对比,Qwen3.8-Max 拥有 2.4 万亿总参数,每次激活 950 亿参数,在两个榜单上的成绩分别是 58 分和 58 分。
Qwen3.8-27B 的总参数只有它的约九十分之一,综合能力只差 6 分,Agent 能力只差 7 分。
一个 270 亿参数的稠密模型,已经挤进了顶级 Agent 模型所在的区间。
这才是 Qwen3.8-27B 最值得讨论的地方:它不只是模型小,而是在很小的参数规模里,压进了远超体量预期的能力。
如果把它放回前面的 Scaling 演进里,Qwen3.8-27B 对应的不是 MoE,而是 Chinchilla 之后“小模型充分训练”的路线。
模型不一定要无限做大。通过数据、训练方法和后训练,同样可以提高单位参数承载的能力,并降低部署门槛与推理成本。
不过,这里需要只是一个推测。
如果 Qwen 没有公布 Qwen3.8-27B 的训练 token 数,就不能直接把它写成每参数 290 个或 889 个 token 的延续,更不能仅凭榜单成绩断定它只是“喂得更多”。
榜单能够证明的是,参数量已经无法单独解释模型能力。
GLM-5.3 保持底座和参数不变,继续扩大后训练;Qwen3.8-27B 则控制模型规模,在一个较小的稠密底座里追求更高的能力密度。
一个在原来的模型上继续深挖,一个努力把旗舰能力塞进更小的身体。
它们转动的不是同一个旋钮,却共同指向唐杰老师的判断:
今天的 Scaling,已经不只是把模型做得更大,而是找到当前最值得投入算力的地方。
下一轮 Scaling,你更看好继续堆参数,还是把小模型练到极致?
评论区聊聊。
参考: https://x.com/jietang/status/2089941544581403107
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.