网易首页 > 网易号 > 正文 申请入驻

GLM 5.2 开源,技术博客详览

0
分享至

国产模型的高光时刻

GLM-5.2 现已开源,技术博客同步放出:

744B MoE,40B 激活,1M 上下文,MIT 协议

模型已纳入 GLM Coding Plan,API 同步上线,全量可用,价格跟 5.1 保持一致

在大家最为关心的 Coding 领域,GLM-5.2 在 Arena 上以 1595 分拿下第二,也是这个Coding 榜单上最强的【可用模型】

考虑到最近 Gemini 不尽如人意,可以说...GLM 挤掉哈基米,荣登 coding 御三家


Code Arena: Frontend(来源:arena.ai)

还有就是:今晚在有 GLM 开发者见面会,欢迎大家来玩(见文末)

Benchmark 总览


GLM-5.2 Full Benchmark Table

GLM-5.2 专为长程任务能力(Long Horizon Task)而生,全新特色包括:

- Solid 1M 上下文,稳定支撑长程任务

- 更强体感\更实用的 Coding 能力

- 极致 Infra 优化,Day 0 运行在国产算力平台

- MIT 开源协议,允许美国人民使用

长程任务

三个基准均跑在 1M 上下文、Max 档位、128K 最大输出下,GLM-5.2 在所有开源模型中排名第一


Long-Horizon Task Evaluation

FrontierSWE(20 小时级复杂工程)

Opus 4.8:75.1%,GLM-5.2:74.4%,GPT-5.5:72.6%。差 0.7 个百分点

PostTrainBench(给 Agent 一块 H100,10 小时内做 post-training)

Opus 4.8:37.2%,GLM-5.2:34.3%,GPT-5.5:25.0%

SWE-Marathon(编译器、内核优化等超长周期工程)

Opus 4.8:26.0%,Opus 4.7:16.0%,GLM-5.2:13.0%,GPT-5.5:12.0%。差了一倍,排在 Opus 4.7 后面

Coding 评测

8 项 Coding + Agentic 评测中,GLM-5.2 保持开源 SOTA,相比 5.1 跨代提升明显


LLM Performance Evaluation

Terminal-Bench 2.1:GLM-5.2 拿 81.0,Opus 4.8 是 85.0,GPT-5.5 是 84.0(5.1 是 63.5)

MCP-Atlas:77.0 vs 77.8。SWE-bench Pro:62.1 vs 69.2。NL2Repo:48.9 vs 69.7,这项差距最大

值得注意的是 HLE with Tools:GLM-5.2 拿了 54.7,Opus 4.8 是 52.3,GPT-5.5 是 52.2

效率曲线

在 Claude Code 上跑 Terminal-Bench 2.1、DeepSWE、SWE-Atlas 的平均分,GLM-5.2 的 High 档跟 Opus 4.8 的 High 基本重合(约 73%),Max 档 GLM-5.2 约 75%,Opus 4.8 约 78%


Agentic Coding Performance by Effort Level

对比 GLM-5.1:Non-Thinking 到 Max 全程低 15 到 20 个百分点,代际提升很大

1M 上下文架构

为了让 1M 上下文在工程上真正可用,GLM-5.2 在架构和推理引擎上做了系统优化


GLM-5.2 Architecture for 1M Context

IndexShare for DSA

每 4 层 transformer 共享一个轻量 indexer,top-k 索引复用到后续 3 层,省掉 3/4 的 indexer 点积和 top-k 计算。从 mid-training 阶段就用 IndexShare 训练

MTP with IndexShare and KVShare

改进 MTP 层用于投机解码:indexer 只在第一步放置,后续步骤复用 top-k 索引。这样第二步的 KV cache 只包含来自 target model 的隐状态,消除了 GLM-5.1 中的训练和推理不一致


MTP Inference with IndexShare

四步叠加效果:baseline 4.56 > +IndexShare+KVShare 5.10 > +Rejection Sampling 5.29 > +End-to-end TV Loss 5.47(+20%)

Serving 1M

上下文从 200K 扩到 1M 后,推理瓶颈转向 KV-cache 容量、长上下文 kernel 开销和 CPU 侧开销。三个方向优化:基于 LayerSplit 的细粒度内存管理和并行策略,长上下文 kernel 与 cache 传输 pipeline 协同,CPU 侧缓存管理和请求调度


随上下文长度增长,GLM-5.2 的吞吐优势更大

Agentic RL 训练

GLM-5.2 的 agentic RL post-training 涉及更大规模、更多领域、更复杂的执行模式。长程交互、工具调用、子任务拆解、多轮环境反馈都对 rollout 和训练编排提出了更高要求。两个核心改动:一是用 slime 框架统一训练和大规模推理 rollout,二是针对 coding RL 的 reward hacking 问题引入 anti-hack 模块

slime 框架

slime 是从训练到大规模推理 rollout 的一体化基础设施,支持 white-box / black-box rollout、compact trajectory、sub-agent workflow。GLM-5.2 的 post-training 用 slime 做并行 OPD 训练,将 10+ 个专家模型合并为最终模型,整个 OPD 过程约两天完成

长程 RL + Anti-Hack

长程任务的执行轨迹更长,经过 compaction 后子轨迹数量和长度差异很大。GLM-5.2 从 group-wise 优化转向基于 critic 的 PPO,用 token-level advantage 适配不等长子轨迹

Coding RL 容易 reward hacking:读取受保护评测文件、从上游 commit 复制答案、直接 curl 拉取目标代码。GLM-5.2 引入 anti-hack 模块,两阶段检测(rule-based filter + LLM judge),在线拦截 hack 行为并返回 dummy 信息,让 rollout 继续而非中断

开源与使用方式

模型权重遵循 MIT License,GitHub / Hugging Face / ModelScope 均已上线,vLLM、SGLang、transformers 等主流推理框架已支持

- BigModel 开放平台:docs.bigmodel.cn/cn/guide/models/text/glm-5.2

- Z.ai:docs.z.ai/guides/llm/glm-5.2

- 技术博客:z.ai/blog/glm-5.2

今晚 7 点,z.ai 团队讲来到 AGI Bar(上海),带一场「开发者面对面」活动。你能看到 5.1 和 5.2 的对比测试,还能听 Builder 们激情开麦

无需预约,直接 walk-in

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
比诈骗更黑暗的秘密!泰军控制9个月后,柬埔寨奥斯马园区再次曝光:157栋建筑里有一间手术室

比诈骗更黑暗的秘密!泰军控制9个月后,柬埔寨奥斯马园区再次曝光:157栋建筑里有一间手术室

暹罗飞鸟
2026-09-10 02:17:15
“摸臀” 女网红社死,安徽母校评论区被冲烂,留学梦可能有变数

“摸臀” 女网红社死,安徽母校评论区被冲烂,留学梦可能有变数

四斤
2026-09-09 15:22:29
刚刚,宇树科技,首次跌破500元/股!

刚刚,宇树科技,首次跌破500元/股!

数据宝
2026-09-10 10:49:07
人民日报发声!已经不是简单道歉的事,多名律师支持男童一方起诉

人民日报发声!已经不是简单道歉的事,多名律师支持男童一方起诉

放开他让wo来
2026-09-10 10:43:36
张雪公开致歉:由于个人管理能力不足,修养不足,让大家失望了

张雪公开致歉:由于个人管理能力不足,修养不足,让大家失望了

毒sir财经
2026-09-09 18:32:42
德比斯说要是赛事方不限制张雪机车的节气门到85%,而是能调节到100%,那比赛就没有悬念了

德比斯说要是赛事方不限制张雪机车的节气门到85%,而是能调节到100%,那比赛就没有悬念了

刘哥谈体育
2026-09-10 09:16:47
退休人员都在等!今年养老金还涨不涨?财政部正式通知下来了吗

退休人员都在等!今年养老金还涨不涨?财政部正式通知下来了吗

白昼说故事
2026-09-10 11:24:00
网友盼上海体育局公布刘翔代言抽成 49.4万买断一个奥运冠军成笑话

网友盼上海体育局公布刘翔代言抽成 49.4万买断一个奥运冠军成笑话

劲爆体坛
2026-09-10 10:27:10
WTT澳门冠军赛:大捷报!陈幸同3:0大获全胜,国乒单打3胜3负

WTT澳门冠军赛:大捷报!陈幸同3:0大获全胜,国乒单打3胜3负

国乒二三事
2026-09-10 12:05:16
脸都不要了!湖南洞口孩子买了50元学平险,结果真得癌了,谁料保险公司翻出国际疾病分类,说编码不对,不符合“恶性肿瘤-重度”条款

脸都不要了!湖南洞口孩子买了50元学平险,结果真得癌了,谁料保险公司翻出国际疾病分类,说编码不对,不符合“恶性肿瘤-重度”条款

火山詩话
2026-09-10 10:40:36
三星发文讥讽苹果iPhone Duo是“热别人剩下的剩菜”

三星发文讥讽苹果iPhone Duo是“热别人剩下的剩菜”

cnBeta.COM
2026-09-10 06:20:06
波多黎各主帅:中国太强不想再和她们对阵 能否把张子宇送给我们队?

波多黎各主帅:中国太强不想再和她们对阵 能否把张子宇送给我们队?

罗说NBA
2026-09-10 07:03:11
15999,苹果杀死比赛了

15999,苹果杀死比赛了

放毒
2026-09-10 07:10:45
“生物爹”怒了:四川大叔带着叛逆女儿跑货车,一路见遍人间苦,却意外刷爆全网!

“生物爹”怒了:四川大叔带着叛逆女儿跑货车,一路见遍人间苦,却意外刷爆全网!

阅读第一
2026-09-09 08:35:40
中国移动回应iPhoneDuo仅支持eSIM:eSIM服务与具体机型相关,目前也在不断更新,建议携机到营业厅咨询

中国移动回应iPhoneDuo仅支持eSIM:eSIM服务与具体机型相关,目前也在不断更新,建议携机到营业厅咨询

鲁中晨报
2026-09-10 09:51:03
影视飓风连续五年送员工苹果新机:每人一台iPhone Duo(可自选等价的其他型号) ,包括实习生和新人

影视飓风连续五年送员工苹果新机:每人一台iPhone Duo(可自选等价的其他型号) ,包括实习生和新人

大风新闻
2026-09-10 09:04:14
现实版多尔衮悲剧!东莞一男子供养女友3个孩子多年,最终惨遭枕边人杀害分尸,评论区炸锅

现实版多尔衮悲剧!东莞一男子供养女友3个孩子多年,最终惨遭枕边人杀害分尸,评论区炸锅

火山詩话
2026-09-10 06:44:55
天呢!网传大批00后开始坐牢,原因令人震惊...

天呢!网传大批00后开始坐牢,原因令人震惊...

慧翔百科
2026-09-10 08:27:31
10999元!iPhone 18 Pro Max把我看爽了,价格不算炸裂

10999元!iPhone 18 Pro Max把我看爽了,价格不算炸裂

搞机小帝
2026-09-10 03:39:05
付磊的妻子汪海英:我用青春和奉献滋养了一头狼

付磊的妻子汪海英:我用青春和奉献滋养了一头狼

细品名人
2026-09-10 06:44:14
2026-09-10 13:59:00
赛博禅心
赛博禅心
拜AI古佛,修赛博禅心
552文章数 58关注度
往期回顾 全部

科技要闻

一文看懂:iPhone折叠屏顶配2万6,10月才卖

头条要闻

停资助遭女生质问"快打过来不然曝光你" 男子最新回应

头条要闻

停资助遭女生质问"快打过来不然曝光你" 男子最新回应

体育要闻

一年丢掉的积分排名,郑钦文用18天找回来

娱乐要闻

郭德纲被处罚2天,身边人传出好消息

财经要闻

李嘉诚的创新药生意,拿下87亿大订单

汽车要闻

腾势Z9GT易三方闪充尊越型32.98万元上市

态度原创

房产
数码
游戏
本地
公开课

房产要闻

别不服!海南的亿万富豪,只有不到300个!

数码要闻

缺货到2028年!HDD价格连涨6季创纪录:8TB希捷涨到2850元

《无畏契约》惊现超猎奇恐怖外挂 角色被血腥魔改

本地新闻

宁波,中国制造的隐藏大佬

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版