网易首页 > 网易号 > 正文 申请入驻

唐杰的新判断:Scaling 不止是把模型做大

0
分享至

★ 设为星标 | 只讲人话,带你玩转AIGC。

GLM-5.3 的第三方测评出来了。

在 Artificial Analysis Intelligence Index 上,它拿到 60 分,和 Kimi K3 并列,距离榜首只有 3 分。

上一代 GLM-5.2 是 53 分。

底座没换,架构没换,参数没增加,只靠一个月的后训练,涨了整整 7 分,直接飙到总榜第四。


当然,一个榜单不能代表全部能力。但这套测试同时覆盖真实工作、工具调用、终端编程、科学推理、知识和长上下文,不是只刷几套数学题。

所以,60 分至少说明:GLM-5.3 的增长不是完全靠发布会滤镜。

今天智谱联合创始人、首席科学家唐杰老师在 X 上写了一篇《Thoughts About Scaling Law》,专门解释这件事。


他的核心观点不是“参数已经不重要了”。

而是:Scaling 没有固定配方,模型发展到不同阶段,最值得扩大的东西也会变化。

Scaling 一直在换答案

大模型早期遇到的第一个问题很直接:如果训练算力增加了,到底应该拿来扩大参数,还是增加训练数据?

2020 年,OpenAI 的 Kaplan 团队给出了一套答案。

按照他们拟合出的规律,算力增加 10 倍,最优模型的参数量大约扩大 5.4 倍,训练数据只扩大约 1.9 倍。

参数和数据的增长指数分别是 0.73 和 0.27,前者约为后者的 2.7 倍。

这里特别容易看错。

2.7:1 不是参数数量与 token 数量的比例,而是两者随算力增长的速度之比。

Kaplan 的结论可以理解为:有了更多算力,优先把模型做大。

于是,大模型进入了疯狂长身体的阶段。

GPT-3 做到 1750 亿参数,Gopher 做到 2800 亿,MT-NLG 做到 5300 亿。

模型发布越来越像健身房称重,数字先报出来,体脂率以后再聊。

很快,问题出现了。

模型虽然越来越大,却没有获得足够的数据训练。参数很多,见过的世面不够,多少有点五大三粗。

2022 年,DeepMind 训练了 400 多个不同规模的模型,重新计算参数、数据与算力之间的关系。

Chinchilla 给出的答案是:当训练算力固定时,模型应该做得小一点,同时多喂数据。

他们得到的经验值更加直观:对于稠密模型,训练 token 数大约是参数量的 20 倍。

一个 700 亿参数的模型,大约需要 1.4 万亿个训练 token。

这里的 20:1 和前面的 2.7:1 不是同一种东西。

2.7:1 描述参数和数据各自增长的速度;20:1 则是训练 token 数与参数量的直接比例。

Chinchilla 自身只有 700 亿参数,却在很多任务上超过了 2800 亿参数的 Gopher。

行业终于发现,与其造一个巨大的模型然后匆匆停训,不如把模型做小一点,让它多读点书。

但 Chinchilla 解决的仍然只是训练阶段的问题:给定一笔训练算力,怎样获得最好的模型?

模型投入使用之后,新问题又来了。

一个模型只训练一次,却可能被调用几十亿次。模型越大,每次调用的成本越高。

调用量足够大时,训练阶段省下来的钱,很快又会在推理阶段加倍交回去。

于是,新的思路出现了:选择一个更小的模型,花更多算力把它训练得更充分,从而降低此后每一次调用的成本。

Llama 2 7B 使用了约 2 万亿个训练 token,平均每个参数对应约 290 个 token。

Gemma 2 9B 使用了约 8 万亿个训练 token,平均每个参数对应约 889 个 token。不过,Gemma 2 还使用了知识蒸馏,不能只凭这个比例与 Chinchilla 直接比较。

从 20 到 290,再到 889,确实是训练数据相对参数规模的大幅增加。

但它不是同一个最优比例被不断刷新,而是优化目标变了。

Chinchilla 追求的是训练一次时最划算;Llama 2 7B 和 Gemma 2 9B 还要考虑模型上线后的长期调用成本。

模型小一点,训练狠一点,以后每次运行都便宜一点。只要练不死,就往死里练。

接下来,MoE 又让原来的计算方法不够用了。

稠密模型每次运行都会使用全部参数,因此“一个参数对应多少 token”比较容易计算。

MoE 不一样。

一个 MoE 模型可能拥有 7000 亿总参数,但处理一个 token 时,只激活其中几百亿参数。

此时,“参数量”已经分成两个数字:

总参数决定模型大约能装下多少知识,激活参数决定每次运行实际使用多少计算。

总参数像图书馆的藏书量,激活参数像处理当前问题时真正搬到桌上的书。

藏书多,有利于覆盖冷门知识;每次能调用的专家更多、计算路径更深,则更有利于处理复杂推理。

所以,稠密模型的每参数 20 个 token,不能直接套在 MoE 身上。究竟该除以总参数,还是激活参数,答案会差几十倍。

唐杰老师引用的研究还指出,不同任务需要的 Scaling 配方也不同。

记忆事实更依赖总参数和模型容量;代码与推理则更依赖训练数据、激活计算和有效深度。

即使保持相同的 token 参数比,盲目增加总参数,也不一定能改善推理能力。

到这里,Scaling 已经从一道算术题,变成了一张控制台。

参数、数据、架构和激活计算,每一个都是单独的旋钮。

智谱这次转了后训练

沿着这条线,唐杰老师把话题带回 GLM-5.3。

GLM-5.3 和 GLM-5.2 使用相同的底座、架构、总参数和激活参数。智谱没有扩大模型,而是用一个月时间,增加长程任务环境和强化学习训练。

结果是,Artificial Analysis 的得分从 53 分提高到 60 分。

这相当于一次受控实验:其他条件不变,只转动后训练这个旋钮。

唐杰老师特别提到漏洞发现。

它不是从记忆里检索几个 CVE,而是要把一条可能长达 20 步的推理链走完,中间不能丢掉线索。这类能力不只取决于模型记住了多少知识,也与每次计算的有效深度和后训练有关。

GLM-5.3 这次扩大的不是参数,而是模型完成长程任务的能力。

不过,这次升级并不能证明后训练已经取代预训练。

唐杰老师强调,模型规模、预训练数据和每次前向计算量仍然有扩展空间。

智谱这次选择后训练,只是因为在 GLM-5.2 当前这个阶段,它剩下的余量最大。

Scaling 还有很多旋钮。上一次最值得转动的那个,未必还是下一次的答案。

同一张控制台,不同旋钮

这个让我最近爆火的另一个国产模型: Qwen3.8-27B。

它只有 270 亿参数,而且是一个稠密模型。每次推理时,全部参数都会参与计算,不存在 MoE 模型的总参数与激活参数之分。

但它的成绩一点也不像小模型。

在 Artificial Analysis Intelligence Index 上,Qwen3.8-27B 拿到 52 分,与 GPT-5.6 Luna 并列,只比 GLM-5.2 和 DeepSeek V4 低 1 分。


更夸张的是 Agent 能力。

在 Artificial Analysis Agentic Index 上,它拿到 51 分,排在榜单第 8 个位置,超过了 GPT-5.6 Terra、DeepSeek V4、Muse Spark 和 GLM-5.2。

剔除并列的,排行总榜第 5!


作为对比,Qwen3.8-Max 拥有 2.4 万亿总参数,每次激活 950 亿参数,在两个榜单上的成绩分别是 58 分和 58 分。

Qwen3.8-27B 的总参数只有它的约九十分之一,综合能力只差 6 分,Agent 能力只差 7 分。

一个 270 亿参数的稠密模型,已经挤进了顶级 Agent 模型所在的区间。

这才是 Qwen3.8-27B 最值得讨论的地方:它不只是模型小,而是在很小的参数规模里,压进了远超体量预期的能力。

如果把它放回前面的 Scaling 演进里,Qwen3.8-27B 对应的不是 MoE,而是 Chinchilla 之后“小模型充分训练”的路线。

模型不一定要无限做大。通过数据、训练方法和后训练,同样可以提高单位参数承载的能力,并降低部署门槛与推理成本。

不过,这里需要只是一个推测。

如果 Qwen 没有公布 Qwen3.8-27B 的训练 token 数,就不能直接把它写成每参数 290 个或 889 个 token 的延续,更不能仅凭榜单成绩断定它只是“喂得更多”。

榜单能够证明的是,参数量已经无法单独解释模型能力。

GLM-5.3 保持底座和参数不变,继续扩大后训练;Qwen3.8-27B 则控制模型规模,在一个较小的稠密底座里追求更高的能力密度。

一个在原来的模型上继续深挖,一个努力把旗舰能力塞进更小的身体。

它们转动的不是同一个旋钮,却共同指向唐杰老师的判断:

今天的 Scaling,已经不只是把模型做得更大,而是找到当前最值得投入算力的地方。

下一轮 Scaling,你更看好继续堆参数,还是把小模型练到极致?

评论区聊聊。

参考: https://x.com/jietang/status/2089941544581403107

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
上海一公交车为避让非机动车,连撞路边奔驰宝马奥迪等四车!附近居民:路段狭窄,隐患由来已久

上海一公交车为避让非机动车,连撞路边奔驰宝马奥迪等四车!附近居民:路段狭窄,隐患由来已久

新民晚报
2026-09-08 19:16:54
中国国防部9月4日突然证实,东部战区司令员在加拿大参加会议期间,与美军印太司令部司令帕帕罗完成了首次面对面会谈。

中国国防部9月4日突然证实,东部战区司令员在加拿大参加会议期间,与美军印太司令部司令帕帕罗完成了首次面对面会谈。

回京历史梦
2026-09-09 10:08:59
社区免费体检没人去?真相不是老人糊涂,是怕得明明白白

社区免费体检没人去?真相不是老人糊涂,是怕得明明白白

偷喝一口奶
2026-08-31 08:26:56
皇马2‑1国米,皇马球员评分:库尔图瓦 8.5分,邓弗里斯 5.5分,楚梅阿尼6分;

皇马2‑1国米,皇马球员评分:库尔图瓦 8.5分,邓弗里斯 5.5分,楚梅阿尼6分;

福酱的小时光
2026-09-09 12:47:43
关于开展灵活就业人员、农民工、新就业形态人员参加基本医疗保险提质专项行动的通知

关于开展灵活就业人员、农民工、新就业形态人员参加基本医疗保险提质专项行动的通知

健康报
2026-09-08 16:21:22
华人正在逃离马来西亚!40%变22%,马来至上把华人全逼走了!

华人正在逃离马来西亚!40%变22%,马来至上把华人全逼走了!

一路荒凉如歌a
2026-09-09 05:28:44
A股:今天,9月9日,股市情况不太对劲,行情或开始加速了!

A股:今天,9月9日,股市情况不太对劲,行情或开始加速了!

明心
2026-09-09 11:37:46
她若不牺牲,元帅名单中或许就会出现女性了,贺龙:她的军事成就比我高

她若不牺牲,元帅名单中或许就会出现女性了,贺龙:她的军事成就比我高

磊子讲史
2026-09-08 15:35:32
宋丹丹的幸福又升级了!本以为两个孙子随宋姓已圆满,没想到巴图直播翻身买大平层,儿媳比闺女还贴心

宋丹丹的幸福又升级了!本以为两个孙子随宋姓已圆满,没想到巴图直播翻身买大平层,儿媳比闺女还贴心

背包旅行
2026-09-06 14:09:53
在中国,你的存款高于“这个数”,恭喜!已经超过中国大多数家庭

在中国,你的存款高于“这个数”,恭喜!已经超过中国大多数家庭

别人都叫我阿腈
2026-09-08 11:03:16
向太太卑微!曝婚姻幸福秘诀:支持向华强一夜情,但绝不能碰女明星

向太太卑微!曝婚姻幸福秘诀:支持向华强一夜情,但绝不能碰女明星

八卦王者
2026-09-09 14:27:02
大连公安交管部门曝光重点违法行为

大连公安交管部门曝光重点违法行为

半岛晨报
2026-09-08 16:44:01
86页PDF事件男主付某再迎噩耗!两女儿提八项诉求,字字戳他心窝

86页PDF事件男主付某再迎噩耗!两女儿提八项诉求,字字戳他心窝

暖心萌阿菇凉
2026-09-09 12:45:41
乔治王子伊顿公学官方肖像照曝光,校服造型获赞

乔治王子伊顿公学官方肖像照曝光,校服造型获赞

追星雷达站
2026-09-09 08:43:08
陈乔恩现身重庆洪崖洞,宝蓝短T搭白阔腿裤秀细腰,状态回春似少女

陈乔恩现身重庆洪崖洞,宝蓝短T搭白阔腿裤秀细腰,状态回春似少女

流云随风去远方
2026-09-09 11:58:23
苏州一对情侣,谈了7年,女子提了18次分手,分手后在街头痛哭!

苏州一对情侣,谈了7年,女子提了18次分手,分手后在街头痛哭!

川渝视觉
2026-04-17 22:13:14
破镜重圆复婚在即 张柏芝亲自证实 三个儿子都已经被谢霆锋接走

破镜重圆复婚在即 张柏芝亲自证实 三个儿子都已经被谢霆锋接走

星辰生肖馆
2025-03-22 05:10:03
这条无耻新闻,终于引起公愤了!

这条无耻新闻,终于引起公愤了!

胖胖说他不胖
2026-09-07 11:50:18
42岁前阿里高管命丧美国:他不是被收割,是被自己的美国梦坑死

42岁前阿里高管命丧美国:他不是被收割,是被自己的美国梦坑死

说故事的阿袭
2026-09-08 13:33:23
印度裔首次当选日本议员,外来移民正在改写日本社会

印度裔首次当选日本议员,外来移民正在改写日本社会

南文视界
2026-09-08 10:35:07
2026-09-09 15:24:49
AI范儿 incentive-icons
AI范儿
AI范儿是一个专注于人工智能领域的资讯和学习平台,提供最新的人工智能资讯
833文章数 684关注度
往期回顾 全部

科技要闻

AI重大突破!OpenAI称解开近百年数学难题

头条要闻

反制美国 加拿大总理发表全国动员应战讲话

头条要闻

反制美国 加拿大总理发表全国动员应战讲话

体育要闻

16年后再破门,被皇马放弃的少年没认输

娱乐要闻

郭麒麟最便宜贵公子争议,本人未回应

财经要闻

8月CPI同比涨0.8% PPI环比由降转涨

汽车要闻

魏牌全新蓝山申报信息曝光 方盒子造型 5/6座可选

态度原创

数码
本地
时尚
教育
公开课

数码要闻

拿铁熊猫发布x86计算模块Mu Ultra,基于英特尔"Lunar Lake"

本地新闻

宁波,中国制造的隐藏大佬

我要是这样翻盘一次,能吹一辈子

教育要闻

2026年成都少儿英语启蒙机构对比评测:兼顾兴趣培养与打基础

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版