网易首页 > 网易号 > 正文 申请入驻

实测提升50%的“国模一哥”,不用去上海也能畅游陆家嘴了

0
分享至



作者|周末

原创首发|蓝字计划

“国产模型一哥”,又杀回战场了。

两个月前,唐杰还在马斯克面前放话:国产模型超越Claude Fable 5,不会太久。现在两个月过去,智谱立马就把对标把Fable 5的GLM-5.3端了上来。



图源:智谱官方账号

来得虽快,GLM-5.3出手却一点都不含糊。

根据智谱自建的Z.ai Code Bench,GLM-5.3编程能力较GLM-5.2提升了50%,官方也将其称为目前最强的开源权重编程模型

在漏洞挖掘上,GLM-5.3同样不弱。据智谱披露,它一口气找出2436个漏洞,其中1097个属于中高危漏洞,白盒代码审查和漏洞发现能力已经可以对标Mythos 5。

智谱把这轮能力提升的主要功劳,归给了后训练。

一般来说,大模型想变得更强,最直接的办法是扩大参数、增加数据,再做一轮大规模预训练,要付出的代价是更多的GPU、更长训练周期,以及大笔算力、电力和资金支出。

但后训练显然不是这么一回事。简单来说,后训练就是模型完成基础训练后,再通过强化学习不断“特训”,针对具体任务进行优化。

也就是说,别人争着给模型补脑,智谱却靠后天补课,把它练成了神童。

后训练真有这么神?

大模型,也成了做题家

要理解GLM-5.3的能力,还得先回到GLM-5.2。

作为智谱上一代旗舰模型,GLM-5.2已经站到了开源模型第一梯队。

今年6月,智谱开源的GLM-5.2采用了混合专家(MoE)架构,总参数规模约7530亿,上下文窗口达到100万Token。在Artificial Analysis综合能力评测中,GLM-5.2拿下51分,成为当时开源模型中的头部选手。



图源:智谱官网(GLM-5.2跑分数据)

而两个月后的GLM-5.3,没有更换底座,也没有继续扩大参数规模。智谱把主要精力放在了后训练上:长程任务环境规模扩大数十倍,任务场景变得更加丰富,后训练的迭代时间也被明显拉长。



图源:智谱官网

这一变化背后,是唐杰对大模型竞争方向的一次判断:Scaling,不只有参数量这一条路子可以走。



图源:智谱AI创始人,唐杰社交账号

过去,模型升级最直观的方式是扩大参数规模。但随着模型能力逐渐接近瓶颈,单纯“堆参数”带来的收益正在下降。

训练过程本身,同样会决定模型的最终能力,这也成了GLM-5.3的重点。

GLM-5.3开始让模型进入更接近真实工作的任务环境。

在一些高难度任务中,GLM-5.3需要面对完整的工程体系,自己分析性能瓶颈、修改方案、运行测试,并根据反馈不断迭代。而这类任务的复杂程度,已经接近一名经验丰富的工程师连续数天的工作量。

这类训练的核心,是让模型不断强化、学习,并学会如何完成一个目标。

为了扩大这种训练规模,GLM-5.3还尝试自动生成更多长周期任务环境,并通过评估系统验证任务是否有效,让模型能够接触更丰富的工作场景。

有没有效果?直接上跑分数据。

在考验真实终端环境复杂操作的Terminal-Bench 3.0里,GLM-5.3的分数提高了一大截,成绩从GLM-5.2的4.6分提升到28.3分,已经逼近Fable 5的33.7。

而在更考验“长期软件代码能力”的DeepSWE v1.1中,GLM-5.3也从46.2分提升到66.9分,距离Fable 5只差不到3分。



图源:智谱官网GLM-5.3跑分数据

更有意思的是,不同类型任务之间出现了反差。

越接近真实工作流、越需要模型长期执行的任务,GLM-5.3提升越明显。比如在Terminal-Bench 3.0中,它的成绩增长了接近6倍。

相比之下,在更偏综合能力和多工具协作的Agents' Last Exam中,GLM-5.3提升幅度相对有限,只涨了4.7分。

这样的成绩变化,其实就可以反映了GLM-5.3这轮训练的重点:让模型学会完成一件复杂的事情:理解目标、拆解任务、调用工具、不断验证,直到交付结果。

而这类任务,正是长周期训练环境最能发挥作用的地方。

不过,跑分终归只是跑分。要看这种训练有没有让模型更会干活,还得给它一项足够复杂的任务。

比如,从零复刻一个能真正开车到处逛的陆家嘴。

疯狂补课,确实有用

在基座参数没变的前提下,GLM-5.3编程能力体感暴涨了50%。那我们就看看,GLM-5.3用代码能写出什么好看好玩有意思的画面。

我们交给GLM-5.3和GLM-5.2的任务是:开发一个上海市陆家嘴和外滩区域的3D驾驶小游戏,需求大致涵盖地理复刻、昼夜灯光、车辆物理、导航存档等等

在实测中,GLM-5.3和GLM-5.2交付出的成品明显不同。

GLM-5.2更倾向于快速完成一个完整Demo。在接收到需求后,它直接围绕功能展开,将场景、车辆、灯光、交互等模块逐步实现。最终生成的代码规模较大,覆盖了大量功能需求。



GLM-5.2实测

实际上,GLM-5.2这种面对复杂任务时能快速过一遍设计方案,然后迅速进入执行阶段的能力,对于快速开发非常重要。例如,在要求加入动态灯光系统时,GLM-5.2能够理解昼夜变化需求,并尝试通过时间系统控制灯光状态;在车辆驾驶部分,也加入了相关控制逻辑。

只是这种追求速度的打法,也带来了明显的问题:模型更关注需求清单里的每个功能有没有跑通,轻视了不同模块之间是否协调,以及项目以后要怎么扩展。

于是,在GLM-5.2交付的这个成品里,城市细节可以说是几乎没有的。所有的建筑、地面和车辆,都是同一套色块,灯光也比较线性。

相比之下,GLM-5.3的表现就有明显进步。

在生成结果中,GLM-5.3采用了更接近真实工程项目的分层方式:配置层、核心层、数据层、世界构建层、系统层、装配层,而很少围绕具体功能。



GLM-5.3

这正是长周期后训练想要强化的能力:先规划整体结构,再分步骤实现,并在更长的任务链中处理好前后的依赖关系。

以后想加入更多城市区域、NPC车辆、天气系统或者AI驾驶,只需要在现有架构上继续增加模块,不用把已有代码推倒重来。

而且干活更细致之后,GLM-5.3确实也能带来更好的效果。

当我们在游戏中驾驶着小车车畅游陆家嘴的时候,随车辆移动所产生的影子变化、写字楼的格子间灯光、色彩较多的城市界面、不同的车辆驾驶视角,GLM-5.3都有在还原。



GLM-5.3

甚至是,车辆刹车时的车尾灯开启、车辆惯性、非路面行驶会限速都有体现;物理反馈、摄像机跟随、状态管理,GLM-5.3都有考虑在内。



GLM-5.3

这可不是单纯多放了几个视觉元素。刹车灯需要车辆状态联动灯光系统,非路面限速也需要地形判断与物理系统配合。能把这些细节串起来,说明GLM-5.3对跨模块关系处理的效果不错。



GLM-5.3

可以说,更细的任务拆解和更完整的工程规划,让GLM-5.3交出的成品更完整,也更接近一个可以继续开发的项目。

不过,GLM-5.3也还是有点愚蠢的地方。除了标志性建筑外,其他建筑几乎一个样。并且,许多建筑直接是在路面上生成,所以能看到很多路面是没法通行的。

这些问题也说明,GLM-5.3虽然能够搭起复杂工程,却还没有把整张地图的空间关系检查好。

总的来说,有这样的提升,其实已经能说明后训练这套的确有两把刷子。但这也留下了一个终极问题:既然后训练效果那么好,为什么其他家不来抄抄?

国模一哥,也有保质期

其实,大家早就在干了。

从OpenAI o1到DeepSeek-R1,强化学习早已被用来提升模型的推理和编程能力。智谱这次的不同,是把长周期任务环境扩大数十倍,专门训练GLM-5.3处理复杂工程。



图源:海外用户发文

这办法听起来一点都不神秘,只是门槛也一点不低。

最先,最容易卡住厂商的就是出题。

一道普通的代码题,提前准备好测试用例就能判断对错。长周期编程任务却要把模型放进真实工程,前面改错一个地方,后面整个项目都有可能出问题。

想大规模生成这类任务,还要保证每道题都能正常运行、反复训练,难度远高于收集一批代码。

光有题还不够,评分也得靠谱。

一旦评分标准存在漏洞,模型就可能学会钻空子。表面上分数越来越高,实际任务却没有完成。这就是强化学习中经常出现的“奖励作弊”。

再加上,后训练其实也没有比预训练便宜多少。

一次长周期任务可能要跑上许多轮。模型不断尝试,失败的过程同样消耗Token和算力。后训练顶多是省下了重做模型基座的钱,但要是真到了算账的时候,能省下多少可能真不好说。



图源:海外用户发文

更别说它还有一个更明显的边界:练什么,就只学什么。

GLM-5.3在Terminal-Bench 3.0中的成绩从4.6分涨到28.3分,接近翻了六倍;在考察综合能力和多工具协作的Agents' Last Exam中,却只提高了4.7分,就是最好的案例。

因此,所谓50%的编程能力提升,主要集中在长周期编程和复杂工程任务上,绝对不能和整个模型的能力提升了50%划等号。

正因如此,后训练更适合把底座已经具备的能力继续补强,要是底座里本来就没有的知识和能力,就没法通过后训练长出来了。

那为什么后训练依然如此受欢迎呢?因为确实高效率啊。

过去,厂商往往要等到下一代基座训练完成,才能迎来一次大升级。现在,同一套基座换一批任务环境、重新训练几个月,也可能推出一个能力明显更强的新版本。

一个模型刚在榜单上冲到前面,对手很快就能用新的训练方法追上来。今天领先的能力,过几个月可能就成了其他模型的基础配置。

智谱在Blog最前面写下“单弦不成音,独木不成林”。这句话听起来很从容,也正好说中了现在的局面:模型厂商各有路线,第一梯队的位置也会反复换人

只是智谱能一直从容吗?这或许是整个大模型行业,都需要自我拷问的问题。

参考资料:

[1]数字生命卡兹克:聊聊唐杰老师对GLM-5.3和Scaling Law的思考

[2]量子位:刚刚,GLM-5.3发布:Coding更接近Fable 5!潜伏40年的bug都被揪出来了

[3]APPSO:实测GLM-5.3:在神仙打架的一周杀回国模顶流,还按下了重置键

[4]钛媒体:GLM-5.3发布,基座没变,能力却涨了

[5]AI科技评论:GLM-5.3来了:底座没换,编程暴涨50%,还顺手揪出潜伏40年的世界级漏洞

声明:个人原创,仅供参考

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
美股三大指数开盘涨跌不一 高通涨超6%

美股三大指数开盘涨跌不一 高通涨超6%

每日经济新闻
2026-09-08 21:33:04
53岁张惠妹破200斤,满身横肉、臀大腰圆,意外撞身“石矶娘娘”

53岁张惠妹破200斤,满身横肉、臀大腰圆,意外撞身“石矶娘娘”

文刀贰
2026-08-19 15:41:46
女孩穿上新鞋,突然高烧39℃不退,送医发现全身感染!这个习惯很多人都有

女孩穿上新鞋,突然高烧39℃不退,送医发现全身感染!这个习惯很多人都有

蓬勃新闻
2026-09-08 06:26:58
福建男子入狱11年无人探望,经常梦见雪中一个女人抱着自己,狱警顺藤摸瓜,竟帮他找到了失散30年的亲人!

福建男子入狱11年无人探望,经常梦见雪中一个女人抱着自己,狱警顺藤摸瓜,竟帮他找到了失散30年的亲人!

品读时刻
2026-09-07 09:02:41
成都“牵手门”事件女主现今状况曝光,太惨了......

成都“牵手门”事件女主现今状况曝光,太惨了......

许三岁
2026-03-17 07:34:05
太恶心了!一女乘客发帖吐槽,足足4小时啊,快被旁边大哥的屁股,熏得想“跳飞机”

太恶心了!一女乘客发帖吐槽,足足4小时啊,快被旁边大哥的屁股,熏得想“跳飞机”

火山詩话
2026-09-03 08:55:21
银行催你换三代社保卡?内部员工坦白 3 个真话,别再被套路了

银行催你换三代社保卡?内部员工坦白 3 个真话,别再被套路了

娱乐圈见解说
2026-09-05 03:26:57
《复联5》试映口碑逆天,评分超《复联4》

《复联5》试映口碑逆天,评分超《复联4》

月光作笺a
2026-09-08 10:40:20
禁区冲刺翻倍,厄德高把阿森纳攻击线盘活了

禁区冲刺翻倍,厄德高把阿森纳攻击线盘活了

Ping值焦虑
2026-09-09 00:39:27
“戴着金耳环,说交不起5000的学费?”六胎宝妈拿着录取通知书哭穷,0人买账

“戴着金耳环,说交不起5000的学费?”六胎宝妈拿着录取通知书哭穷,0人买账

妍妍教育日记
2026-09-01 10:55:14
一天内,传出2位名人离世!如6个月前张雪峰,离世原因刺痛无数人

一天内,传出2位名人离世!如6个月前张雪峰,离世原因刺痛无数人

皮皮电影
2026-09-08 17:55:15
许家印没欠2.4万亿

许家印没欠2.4万亿

子业一说财经
2026-09-07 13:37:58
伦敦足球:里沙利松陷入无人待见的处境,只剩巴甲一条路可走

伦敦足球:里沙利松陷入无人待见的处境,只剩巴甲一条路可走

懂球帝
2026-09-08 20:55:18
无底线了!内塔尼亚胡之子被伊朗特工暗杀,弃行李连夜逃回以色列

无底线了!内塔尼亚胡之子被伊朗特工暗杀,弃行李连夜逃回以色列

梦史
2026-08-29 06:21:20
宇树科技创始人王兴兴机场被偶遇,神情严肃,没带助理

宇树科技创始人王兴兴机场被偶遇,神情严肃,没带助理

未来图灵
2026-09-08 16:52:32
政治地震:德国极右翼历史性大胜,欧洲会否连番变天?

政治地震:德国极右翼历史性大胜,欧洲会否连番变天?

新民周刊
2026-09-08 09:11:55
9月蓄力、10月蜕变、11月爆发,这三大星座好运连连

9月蓄力、10月蜕变、11月爆发,这三大星座好运连连

别人都叫我阿螫
2026-09-08 18:16:31
法学界陈枫曝猛料!不少地方已偷偷取消史地生化中考计分,网上却鸦雀无声

法学界陈枫曝猛料!不少地方已偷偷取消史地生化中考计分,网上却鸦雀无声

小徐讲八卦
2026-09-08 08:32:54
存储龙头,今日回购超4亿元!

存储龙头,今日回购超4亿元!

证券时报
2026-09-08 21:10:03
76人得到杰伦·布朗后,三大核心轮番联系詹姆斯

76人得到杰伦·布朗后,三大核心轮番联系詹姆斯

甜度百分百21
2026-09-09 00:12:10
2026-09-09 01:43:00
蓝字计划 incentive-icons
蓝字计划
记录智能时代的每一次浪潮!前沿科技捕手,AI产品深度洞察。
324文章数 3896关注度
往期回顾 全部

科技要闻

小米再次背水一战

头条要闻

伊朗称捕获美军先进潜航器 现场画面公布

头条要闻

伊朗称捕获美军先进潜航器 现场画面公布

体育要闻

韩旭:我一定会再次走出去

娱乐要闻

郭德纲被处罚,郭麒麟被曝恋情瓜

财经要闻

智谱六连跌失守1000大关,发生了什么?

汽车要闻

领克20 领克的纯电小钢炮这次更运动了

态度原创

本地
数码
房产
时尚
公开课

本地新闻

宁波,中国制造的隐藏大佬

数码要闻

家电巨头IFA强化「无人家务」叙事:设备有了智能体,还长出了手脚

房产要闻

真快啊!海口这个超级城更,又有大动作!

会穿衣的女性,能够借助最合适的单品,"修身上衣"显瘦又大方

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版