网易首页 > 网易号 > 正文 申请入驻

唐杰的新判断:Scaling 不止是把模型做大

0
分享至

★ 设为星标 | 只讲人话,带你玩转AIGC。

GLM-5.3 的第三方测评出来了。

在 Artificial Analysis Intelligence Index 上,它拿到 60 分,和 Kimi K3 并列,距离榜首只有 3 分。

上一代 GLM-5.2 是 53 分。

底座没换,架构没换,参数没增加,只靠一个月的后训练,涨了整整 7 分,直接飙到总榜第四。


当然,一个榜单不能代表全部能力。但这套测试同时覆盖真实工作、工具调用、终端编程、科学推理、知识和长上下文,不是只刷几套数学题。

所以,60 分至少说明:GLM-5.3 的增长不是完全靠发布会滤镜。

今天智谱联合创始人、首席科学家唐杰老师在 X 上写了一篇《Thoughts About Scaling Law》,专门解释这件事。


他的核心观点不是“参数已经不重要了”。

而是:Scaling 没有固定配方,模型发展到不同阶段,最值得扩大的东西也会变化。

Scaling 一直在换答案

大模型早期遇到的第一个问题很直接:如果训练算力增加了,到底应该拿来扩大参数,还是增加训练数据?

2020 年,OpenAI 的 Kaplan 团队给出了一套答案。

按照他们拟合出的规律,算力增加 10 倍,最优模型的参数量大约扩大 5.4 倍,训练数据只扩大约 1.9 倍。

参数和数据的增长指数分别是 0.73 和 0.27,前者约为后者的 2.7 倍。

这里特别容易看错。

2.7:1 不是参数数量与 token 数量的比例,而是两者随算力增长的速度之比。

Kaplan 的结论可以理解为:有了更多算力,优先把模型做大。

于是,大模型进入了疯狂长身体的阶段。

GPT-3 做到 1750 亿参数,Gopher 做到 2800 亿,MT-NLG 做到 5300 亿。

模型发布越来越像健身房称重,数字先报出来,体脂率以后再聊。

很快,问题出现了。

模型虽然越来越大,却没有获得足够的数据训练。参数很多,见过的世面不够,多少有点五大三粗。

2022 年,DeepMind 训练了 400 多个不同规模的模型,重新计算参数、数据与算力之间的关系。

Chinchilla 给出的答案是:当训练算力固定时,模型应该做得小一点,同时多喂数据。

他们得到的经验值更加直观:对于稠密模型,训练 token 数大约是参数量的 20 倍。

一个 700 亿参数的模型,大约需要 1.4 万亿个训练 token。

这里的 20:1 和前面的 2.7:1 不是同一种东西。

2.7:1 描述参数和数据各自增长的速度;20:1 则是训练 token 数与参数量的直接比例。

Chinchilla 自身只有 700 亿参数,却在很多任务上超过了 2800 亿参数的 Gopher。

行业终于发现,与其造一个巨大的模型然后匆匆停训,不如把模型做小一点,让它多读点书。

但 Chinchilla 解决的仍然只是训练阶段的问题:给定一笔训练算力,怎样获得最好的模型?

模型投入使用之后,新问题又来了。

一个模型只训练一次,却可能被调用几十亿次。模型越大,每次调用的成本越高。

调用量足够大时,训练阶段省下来的钱,很快又会在推理阶段加倍交回去。

于是,新的思路出现了:选择一个更小的模型,花更多算力把它训练得更充分,从而降低此后每一次调用的成本。

Llama 2 7B 使用了约 2 万亿个训练 token,平均每个参数对应约 290 个 token。

Gemma 2 9B 使用了约 8 万亿个训练 token,平均每个参数对应约 889 个 token。不过,Gemma 2 还使用了知识蒸馏,不能只凭这个比例与 Chinchilla 直接比较。

从 20 到 290,再到 889,确实是训练数据相对参数规模的大幅增加。

但它不是同一个最优比例被不断刷新,而是优化目标变了。

Chinchilla 追求的是训练一次时最划算;Llama 2 7B 和 Gemma 2 9B 还要考虑模型上线后的长期调用成本。

模型小一点,训练狠一点,以后每次运行都便宜一点。只要练不死,就往死里练。

接下来,MoE 又让原来的计算方法不够用了。

稠密模型每次运行都会使用全部参数,因此“一个参数对应多少 token”比较容易计算。

MoE 不一样。

一个 MoE 模型可能拥有 7000 亿总参数,但处理一个 token 时,只激活其中几百亿参数。

此时,“参数量”已经分成两个数字:

总参数决定模型大约能装下多少知识,激活参数决定每次运行实际使用多少计算。

总参数像图书馆的藏书量,激活参数像处理当前问题时真正搬到桌上的书。

藏书多,有利于覆盖冷门知识;每次能调用的专家更多、计算路径更深,则更有利于处理复杂推理。

所以,稠密模型的每参数 20 个 token,不能直接套在 MoE 身上。究竟该除以总参数,还是激活参数,答案会差几十倍。

唐杰老师引用的研究还指出,不同任务需要的 Scaling 配方也不同。

记忆事实更依赖总参数和模型容量;代码与推理则更依赖训练数据、激活计算和有效深度。

即使保持相同的 token 参数比,盲目增加总参数,也不一定能改善推理能力。

到这里,Scaling 已经从一道算术题,变成了一张控制台。

参数、数据、架构和激活计算,每一个都是单独的旋钮。

智谱这次转了后训练

沿着这条线,唐杰老师把话题带回 GLM-5.3。

GLM-5.3 和 GLM-5.2 使用相同的底座、架构、总参数和激活参数。智谱没有扩大模型,而是用一个月时间,增加长程任务环境和强化学习训练。

结果是,Artificial Analysis 的得分从 53 分提高到 60 分。

这相当于一次受控实验:其他条件不变,只转动后训练这个旋钮。

唐杰老师特别提到漏洞发现。

它不是从记忆里检索几个 CVE,而是要把一条可能长达 20 步的推理链走完,中间不能丢掉线索。这类能力不只取决于模型记住了多少知识,也与每次计算的有效深度和后训练有关。

GLM-5.3 这次扩大的不是参数,而是模型完成长程任务的能力。

不过,这次升级并不能证明后训练已经取代预训练。

唐杰老师强调,模型规模、预训练数据和每次前向计算量仍然有扩展空间。

智谱这次选择后训练,只是因为在 GLM-5.2 当前这个阶段,它剩下的余量最大。

Scaling 还有很多旋钮。上一次最值得转动的那个,未必还是下一次的答案。

同一张控制台,不同旋钮

这个让我最近爆火的另一个国产模型: Qwen3.8-27B。

它只有 270 亿参数,而且是一个稠密模型。每次推理时,全部参数都会参与计算,不存在 MoE 模型的总参数与激活参数之分。

但它的成绩一点也不像小模型。

在 Artificial Analysis Intelligence Index 上,Qwen3.8-27B 拿到 52 分,与 GPT-5.6 Luna 并列,只比 GLM-5.2 和 DeepSeek V4 低 1 分。


更夸张的是 Agent 能力。

在 Artificial Analysis Agentic Index 上,它拿到 51 分,排在榜单第 8 个位置,超过了 GPT-5.6 Terra、DeepSeek V4、Muse Spark 和 GLM-5.2。

剔除并列的,排行总榜第 5!


作为对比,Qwen3.8-Max 拥有 2.4 万亿总参数,每次激活 950 亿参数,在两个榜单上的成绩分别是 58 分和 58 分。

Qwen3.8-27B 的总参数只有它的约九十分之一,综合能力只差 6 分,Agent 能力只差 7 分。

一个 270 亿参数的稠密模型,已经挤进了顶级 Agent 模型所在的区间。

这才是 Qwen3.8-27B 最值得讨论的地方:它不只是模型小,而是在很小的参数规模里,压进了远超体量预期的能力。

如果把它放回前面的 Scaling 演进里,Qwen3.8-27B 对应的不是 MoE,而是 Chinchilla 之后“小模型充分训练”的路线。

模型不一定要无限做大。通过数据、训练方法和后训练,同样可以提高单位参数承载的能力,并降低部署门槛与推理成本。

不过,这里需要只是一个推测。

如果 Qwen 没有公布 Qwen3.8-27B 的训练 token 数,就不能直接把它写成每参数 290 个或 889 个 token 的延续,更不能仅凭榜单成绩断定它只是“喂得更多”。

榜单能够证明的是,参数量已经无法单独解释模型能力。

GLM-5.3 保持底座和参数不变,继续扩大后训练;Qwen3.8-27B 则控制模型规模,在一个较小的稠密底座里追求更高的能力密度。

一个在原来的模型上继续深挖,一个努力把旗舰能力塞进更小的身体。

它们转动的不是同一个旋钮,却共同指向唐杰老师的判断:

今天的 Scaling,已经不只是把模型做得更大,而是找到当前最值得投入算力的地方。

下一轮 Scaling,你更看好继续堆参数,还是把小模型练到极致?

评论区聊聊。

参考: https://x.com/jietang/status/2089941544581403107

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
不给钱就曝光你!资助5年捐款人中断被甘肃女生威胁:因女生用苹果17promax,爱打扮、凹凸有致,细节曝光

不给钱就曝光你!资助5年捐款人中断被甘肃女生威胁:因女生用苹果17promax,爱打扮、凹凸有致,细节曝光

李晚书
2026-09-09 08:36:32
真正大麻烦来了!熊某叫嚣别眼红,封号仅开胃菜,大学受举报围攻

真正大麻烦来了!熊某叫嚣别眼红,封号仅开胃菜,大学受举报围攻

陈博世财经
2026-09-09 10:33:48
贾斯汀·比伯与海莉·比伯床上亲密大片曝光

贾斯汀·比伯与海莉·比伯床上亲密大片曝光

追星雷达站
2026-09-08 05:03:31
朝鲜当初没料到,派了上万士兵去俄罗斯参战,如今平壤街头巷尾,啤酒、香烟、菜籽油和猪肉正源源不断跨过边境涌入

朝鲜当初没料到,派了上万士兵去俄罗斯参战,如今平壤街头巷尾,啤酒、香烟、菜籽油和猪肉正源源不断跨过边境涌入

人生录
2026-09-09 00:05:15
侵吞上亿善款?官方发文,宣布54岁韩红新身份,这次终于扬眉吐气

侵吞上亿善款?官方发文,宣布54岁韩红新身份,这次终于扬眉吐气

冰语历史
2026-09-08 09:48:06
德国选择党获胜,俄罗斯人庆祝

德国选择党获胜,俄罗斯人庆祝

参考消息
2026-09-08 21:47:08
美国国防部更新数据:又有30名美军士兵在与伊朗战争中受伤

美国国防部更新数据:又有30名美军士兵在与伊朗战争中受伤

环球网资讯
2026-09-09 09:24:06
星宇股份“人力资源总监”曝光,炸出大瓜!

星宇股份“人力资源总监”曝光,炸出大瓜!

互联网品牌官
2026-09-08 16:33:26
公安部172号令生效提醒,六十岁以上持证老车主,将一份重大利好

公安部172号令生效提醒,六十岁以上持证老车主,将一份重大利好

音乐时光的娱乐
2026-09-09 06:57:23
对岸爆发“统一”交锋,两大力量开始划线,岛内学者已对大陆交底

对岸爆发“统一”交锋,两大力量开始划线,岛内学者已对大陆交底

近史博览
2026-09-08 12:00:53
山西省原省长金湘军一审被判死缓:受贿1.48亿,已认罪悔罪

山西省原省长金湘军一审被判死缓:受贿1.48亿,已认罪悔罪

界面新闻
2026-09-08 17:28:38
WTT澳门冠军赛:国乒冷门预警!王艺迪7-11再败,0-2落后或1轮游

WTT澳门冠军赛:国乒冷门预警!王艺迪7-11再败,0-2落后或1轮游

刘姚尧的文字城堡
2026-09-09 11:26:23
一个国家能蠢到什么程度?看看法国就明白了:法国黑人接近800万,巴黎新生儿里70%是黑人

一个国家能蠢到什么程度?看看法国就明白了:法国黑人接近800万,巴黎新生儿里70%是黑人

怪味历史连连看
2026-09-08 01:55:32
4岁男童碰到女生被指摸臀,调解3次谈崩女方要起诉:所有的小题大做,本质都是情绪上头

4岁男童碰到女生被指摸臀,调解3次谈崩女方要起诉:所有的小题大做,本质都是情绪上头

教育人看世界
2026-09-08 16:27:41
草台班子!上海的这场国际赛车比赛,办得还不如农村赶大集

草台班子!上海的这场国际赛车比赛,办得还不如农村赶大集

News脑洞
2026-09-08 18:25:03
9月9日美军F-35基地爆炸,40枚伊朗导弹打穿拦截,全是集束子母弹

9月9日美军F-35基地爆炸,40枚伊朗导弹打穿拦截,全是集束子母弹

丁丁鲤史纪
2026-09-09 09:54:32
济南一女子举报酒醉遭交警副队长强奸,为坐实证据生下孩子!

济南一女子举报酒醉遭交警副队长强奸,为坐实证据生下孩子!

兵叔评说
2026-09-09 10:57:27
金球奖最新赔率出炉!凯恩断崖领跑 19岁亚马尔第2 姆巴佩几乎没戏

金球奖最新赔率出炉!凯恩断崖领跑 19岁亚马尔第2 姆巴佩几乎没戏

风过乡
2026-09-09 09:08:40
凌晨两点的足疗店有多乱?内行老板揭露真相:很多人稀里糊涂吃亏

凌晨两点的足疗店有多乱?内行老板揭露真相:很多人稀里糊涂吃亏

智慧生活笔记
2026-09-09 05:57:11
长沙被摸臀女子社会性死亡!底裤被扒,正脸照曝光,黑历史流出

长沙被摸臀女子社会性死亡!底裤被扒,正脸照曝光,黑历史流出

米果说识
2026-09-08 19:28:54
2026-09-09 14:40:50
AI范儿 incentive-icons
AI范儿
AI范儿是一个专注于人工智能领域的资讯和学习平台,提供最新的人工智能资讯
833文章数 684关注度
往期回顾 全部

科技要闻

AI重大突破!OpenAI称解开近百年数学难题

头条要闻

反制美国 加拿大总理发表全国动员应战讲话

头条要闻

反制美国 加拿大总理发表全国动员应战讲话

体育要闻

16年后再破门,被皇马放弃的少年没认输

娱乐要闻

郭麒麟最便宜贵公子争议,本人未回应

财经要闻

8月CPI同比涨0.8% PPI环比由降转涨

汽车要闻

魏牌全新蓝山申报信息曝光 方盒子造型 5/6座可选

态度原创

健康
教育
家居
时尚
本地

中风康复为何像“抽丝剥茧”?

教育要闻

2026年成都少儿英语启蒙机构对比评测:兼顾兴趣培养与打基础

家居要闻

2026建博会(广州) 公装联探展交流活动

我要是这样翻盘一次,能吹一辈子

本地新闻

宁波,中国制造的隐藏大佬

无障碍浏览 进入关怀版