“缩放,但不仅仅是参数的缩放。”智谱创始人唐杰刚刚发文谈 Scaling Law,并解释了一个值得关注的问题:为什么这一次 GLM-5.3 没有重新训练一个更大的基座模型。
![]()
在过去几年里,谈论大模型能力,最容易想到的就是参数量。
2020 年 Kaplan 等人的研究曾推动行业相信,参数增长应该明显快于数据增长,GPT-3、Gopher 等模型也沿着这条路线一路做大。
2022 年,Hoffmann 等人通过约 400 个模型重新研究计算最优分配,提出 Chinchilla Scaling Law。
即,在给定计算预算下,参数和训练数据应该以更接近的速度增长,经典的经验值约为每个参数 20 个 Token。
换句话说,行业曾经一度把“模型做大”当成 Scaling 的核心。
后来发现,部分超大模型其实把算力花在了并不理想的地方。
进入 MoE 时代,事情又变得更加复杂。
总参数更接近于模型能够“装下多少东西”,而激活参数、有效计算深度以及后训练,则更影响模型“能想多远”。
对于记忆型任务,更多参数可能有价值;对于复杂推理,更多数据、更深的计算和更充分的强化学习可能更加关键。
这正是 GLM-5.3 的意义所在。
唐杰透露,GLM-5.3 与 GLM-5.2 使用相同基模型、相同架构,以及相同的总参数和激活参数,区别主要在于,进行了一个月的长时域环境和强化学习 Scaling。
按照他公布的结果,GLM-5.3 在相关评测上的成绩从 53 分提升到 60 分。
因此,这次实验真正想回答的,并不是“为什么智谱没有继续堆参数”,而是另一个问题:当模型规模已经达到一定水平后,下一点能力究竟应该从哪里获得?
唐杰给出的答案是,Scaling 从来不只有一个旋钮。
参数、数据、训练计算、推理计算和后训练,都可能成为下一个增长点。
由此,大模型竞争也正在从“谁的模型更大”,转向“谁更知道下一步该缩放什么”。
以下为唐杰帖文——
《关于缩放定律的思考》
缩放,但不仅仅是参数的缩放。
现在每个模型发布都以同一个问题结束:有多少参数?这不是一个可以单独回答的问题。
参数数量只有与另外三个因素结合才有意义——你有多少数据,你打算在哪里花费你的计算资源,以及谁将在什么条件下运行模型。
这个领域是吃了苦头才学到这一课的。
Kaplan 等人(2020)拟合了一个指数,告诉大家参数增长要快于数据——大约 2.7:1——行业也照做了:GPT-3、Gopher、MT-NLG。
Hoffmann 等人(2022)在四百个模型上重做了实验,发现计算最优的分配更接近每个参数 20 个 token,而且在足够的计算资源下,二者应该以相同速率增长,而不是渐行渐远。
先前拟合中的误差随着计算量每增加一个数量级而累积,这也是为什么那一代最大的模型是最误配的。
万亿参数的轮次,事后看来,是整个领域共同走了一段弯路,然后又一起折返。
Chinchilla 也不是终点。它针对那些训练一次并进行评估的模型优化了训练计算。
今天,一个模型每天被调用数十亿次,推理主导了生命周期成本。
将推理纳入目标函数,最优点就会向更小的模型移动,这些模型训练时间更长——刻意的过度训练,这就是 Llama-2-7B 和 Gemma-2-9B 大约每个参数 290 和 889 个 token 时所做的。
稀疏性再次移动了目标。在 MoE 模型中,有两个量必须分开:总参数大致决定了模型能容纳多少——知识、事实、长尾分布——而激活参数和有效深度大致决定了它能思考多远,能承载因果链多少步而不崩解。
密集的 20:1 比率无法直接转移。而且这个比率根本不是一个单一数字:Roberts 等人(2025)发现,最优的每个参数 token 数取决于任务,记忆偏好更多参数,而推理偏好更多数据。
后续关于 MoE 的工作观察到,在固定的 TPP 下,推动总参数更高实际上会降低推理能力,而激活更多专家则可靠地帮助它。
这对我们正在构建的方向很重要。发现漏洞不是检索问题。它不是来自记忆了更多 CVE;它来自将二十步推理链承载到尽头而不丢失线索。这种能力并不存在于总参数数量中。
这就引出了本次发布。
总参数似乎有一个阈值——足够容纳世界——在此之后,额外能力来自其他地方的缩放:每次前向传播的有效深度,尤其是后训练。
GLM-5.3 是我们对这一主张的控制实验。相同的基模型、相同的架构、与 GLM-5.2 相同的总参数和激活参数。
一个月的长时域环境和 RL 缩放。收益并非微小。
好吧,缩放不止一个旋钮。这次我们转动了后训练的旋钮,因为它剩下的松弛最多——而不是因为其他旋钮已经转完。
基模型大小、预训练数据、每次前向传播的计算支出:所有这些都还在桌上,我们会逐一返回。
这次实验告诉我们的是,这些旋钮不必一起转,下一个值得转的旋钮很少是上一个值得转的。
我们还没有完成缩放。下一次,也许是中训练、预训练,甚至更多。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.