网易首页 > 网易号 > 正文 申请入驻

GLM 5.2 开源,技术博客详览

0
分享至

国产模型的高光时刻

GLM-5.2 现已开源,技术博客同步放出:

744B MoE,40B 激活,1M 上下文,MIT 协议

模型已纳入 GLM Coding Plan,API 同步上线,全量可用,价格跟 5.1 保持一致

在大家最为关心的 Coding 领域,GLM-5.2 在 Arena 上以 1595 分拿下第二,也是这个Coding 榜单上最强的【可用模型】

考虑到最近 Gemini 不尽如人意,可以说...GLM 挤掉哈基米,荣登 coding 御三家


Code Arena: Frontend(来源:arena.ai)

还有就是:今晚在有 GLM 开发者见面会,欢迎大家来玩(见文末)

Benchmark 总览


GLM-5.2 Full Benchmark Table

GLM-5.2 专为长程任务能力(Long Horizon Task)而生,全新特色包括:

- Solid 1M 上下文,稳定支撑长程任务

- 更强体感\更实用的 Coding 能力

- 极致 Infra 优化,Day 0 运行在国产算力平台

- MIT 开源协议,允许美国人民使用

长程任务

三个基准均跑在 1M 上下文、Max 档位、128K 最大输出下,GLM-5.2 在所有开源模型中排名第一


Long-Horizon Task Evaluation

FrontierSWE(20 小时级复杂工程)

Opus 4.8:75.1%,GLM-5.2:74.4%,GPT-5.5:72.6%。差 0.7 个百分点

PostTrainBench(给 Agent 一块 H100,10 小时内做 post-training)

Opus 4.8:37.2%,GLM-5.2:34.3%,GPT-5.5:25.0%

SWE-Marathon(编译器、内核优化等超长周期工程)

Opus 4.8:26.0%,Opus 4.7:16.0%,GLM-5.2:13.0%,GPT-5.5:12.0%。差了一倍,排在 Opus 4.7 后面

Coding 评测

8 项 Coding + Agentic 评测中,GLM-5.2 保持开源 SOTA,相比 5.1 跨代提升明显


LLM Performance Evaluation

Terminal-Bench 2.1:GLM-5.2 拿 81.0,Opus 4.8 是 85.0,GPT-5.5 是 84.0(5.1 是 63.5)

MCP-Atlas:77.0 vs 77.8。SWE-bench Pro:62.1 vs 69.2。NL2Repo:48.9 vs 69.7,这项差距最大

值得注意的是 HLE with Tools:GLM-5.2 拿了 54.7,Opus 4.8 是 52.3,GPT-5.5 是 52.2

效率曲线

在 Claude Code 上跑 Terminal-Bench 2.1、DeepSWE、SWE-Atlas 的平均分,GLM-5.2 的 High 档跟 Opus 4.8 的 High 基本重合(约 73%),Max 档 GLM-5.2 约 75%,Opus 4.8 约 78%


Agentic Coding Performance by Effort Level

对比 GLM-5.1:Non-Thinking 到 Max 全程低 15 到 20 个百分点,代际提升很大

1M 上下文架构

为了让 1M 上下文在工程上真正可用,GLM-5.2 在架构和推理引擎上做了系统优化


GLM-5.2 Architecture for 1M Context

IndexShare for DSA

每 4 层 transformer 共享一个轻量 indexer,top-k 索引复用到后续 3 层,省掉 3/4 的 indexer 点积和 top-k 计算。从 mid-training 阶段就用 IndexShare 训练

MTP with IndexShare and KVShare

改进 MTP 层用于投机解码:indexer 只在第一步放置,后续步骤复用 top-k 索引。这样第二步的 KV cache 只包含来自 target model 的隐状态,消除了 GLM-5.1 中的训练和推理不一致


MTP Inference with IndexShare

四步叠加效果:baseline 4.56 > +IndexShare+KVShare 5.10 > +Rejection Sampling 5.29 > +End-to-end TV Loss 5.47(+20%)

Serving 1M

上下文从 200K 扩到 1M 后,推理瓶颈转向 KV-cache 容量、长上下文 kernel 开销和 CPU 侧开销。三个方向优化:基于 LayerSplit 的细粒度内存管理和并行策略,长上下文 kernel 与 cache 传输 pipeline 协同,CPU 侧缓存管理和请求调度


随上下文长度增长,GLM-5.2 的吞吐优势更大

Agentic RL 训练

GLM-5.2 的 agentic RL post-training 涉及更大规模、更多领域、更复杂的执行模式。长程交互、工具调用、子任务拆解、多轮环境反馈都对 rollout 和训练编排提出了更高要求。两个核心改动:一是用 slime 框架统一训练和大规模推理 rollout,二是针对 coding RL 的 reward hacking 问题引入 anti-hack 模块

slime 框架

slime 是从训练到大规模推理 rollout 的一体化基础设施,支持 white-box / black-box rollout、compact trajectory、sub-agent workflow。GLM-5.2 的 post-training 用 slime 做并行 OPD 训练,将 10+ 个专家模型合并为最终模型,整个 OPD 过程约两天完成

长程 RL + Anti-Hack

长程任务的执行轨迹更长,经过 compaction 后子轨迹数量和长度差异很大。GLM-5.2 从 group-wise 优化转向基于 critic 的 PPO,用 token-level advantage 适配不等长子轨迹

Coding RL 容易 reward hacking:读取受保护评测文件、从上游 commit 复制答案、直接 curl 拉取目标代码。GLM-5.2 引入 anti-hack 模块,两阶段检测(rule-based filter + LLM judge),在线拦截 hack 行为并返回 dummy 信息,让 rollout 继续而非中断

开源与使用方式

模型权重遵循 MIT License,GitHub / Hugging Face / ModelScope 均已上线,vLLM、SGLang、transformers 等主流推理框架已支持

- BigModel 开放平台:docs.bigmodel.cn/cn/guide/models/text/glm-5.2

- Z.ai:docs.z.ai/guides/llm/glm-5.2

- 技术博客:z.ai/blog/glm-5.2

今晚 7 点,z.ai 团队讲来到 AGI Bar(上海),带一场「开发者面对面」活动。你能看到 5.1 和 5.2 的对比测试,还能听 Builder 们激情开麦

无需预约,直接 walk-in

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
河南济源市发生3.6级地震,洛阳、郑州等多地网友:有震感

河南济源市发生3.6级地震,洛阳、郑州等多地网友:有震感

环球网资讯
2026-09-09 19:32:01
手机和宽带还绑在一起的家庭,建议认真看一下

手机和宽带还绑在一起的家庭,建议认真看一下

李博世财经
2026-09-09 10:14:24
伊朗又给美军沉重一击,反舰导弹击穿宙斯盾,命中2艘驱逐舰要害

伊朗又给美军沉重一击,反舰导弹击穿宙斯盾,命中2艘驱逐舰要害

凉湫瑾言
2026-09-10 03:57:06
搜狐创始人张朝阳,62岁未婚未育,弟弟出家,百亿家产谁继来承?

搜狐创始人张朝阳,62岁未婚未育,弟弟出家,百亿家产谁继来承?

哄动一时啊
2026-09-09 10:06:33
刘亦菲发合照把越南女星胡玉荷裁剪掉,只保留了自己与品牌CEO的画面,意外把《三十而已》的顾佳带上热搜

刘亦菲发合照把越南女星胡玉荷裁剪掉,只保留了自己与品牌CEO的画面,意外把《三十而已》的顾佳带上热搜

小椰的奶奶
2026-09-09 22:50:48
江苏“剁鸡”帅哥陈飞去世,年仅22岁爱骑机车,姐姐曝死因太可惜

江苏“剁鸡”帅哥陈飞去世,年仅22岁爱骑机车,姐姐曝死因太可惜

仙味少女心
2026-09-09 22:16:02
深圳一公司员工韦某(男,32 岁 ),抢救无效死亡!官方公布调查报告

深圳一公司员工韦某(男,32 岁 ),抢救无效死亡!官方公布调查报告

南方都市报
2026-09-09 15:02:22
碰瓷4岁幼童的小仙女陈锦婷真容曝光!普通路人一个,和美颜照片差距感拉满

碰瓷4岁幼童的小仙女陈锦婷真容曝光!普通路人一个,和美颜照片差距感拉满

小徐讲八卦
2026-09-10 06:24:52
苹果宣布推出iPhone 18 Pro系列:Pro版起售价1199美元,约合人民币8046元,Pro Max版起售价1299美元,约合人民币8717元

苹果宣布推出iPhone 18 Pro系列:Pro版起售价1199美元,约合人民币8046元,Pro Max版起售价1299美元,约合人民币8717元

台州交通广播
2026-09-10 02:19:52
报仇不隔夜!以色列72名议员联署支持台湾,转头就被狠狠上了一课

报仇不隔夜!以色列72名议员联署支持台湾,转头就被狠狠上了一课

究竟谁主沉浮
2026-09-09 18:24:36
9.10早评|美联储加息突袭全球!A股周四怎么走?

9.10早评|美联储加息突袭全球!A股周四怎么走?

龙行天下虎
2026-09-10 04:33:44
库页岛的真相,远比你想象的更复杂:不属于中国、不像俄罗斯、不承认过去

库页岛的真相,远比你想象的更复杂:不属于中国、不像俄罗斯、不承认过去

怪味历史连连看
2026-09-09 12:13:00
曝武大杰青在美国顶级实验室干这丢人事被开除,此前出轨被亲女儿实名举报

曝武大杰青在美国顶级实验室干这丢人事被开除,此前出轨被亲女儿实名举报

可达鸭面面观
2026-09-06 15:14:05
美国选手淘汰黄友政后,竟然喊话樊振东:你是当今最好的球员!

美国选手淘汰黄友政后,竟然喊话樊振东:你是当今最好的球员!

十点街球体育
2026-09-09 20:18:37
这类“摸臀”事件如果发生在美国?真实司法判例打脸:我们的维权,早已本末倒置

这类“摸臀”事件如果发生在美国?真实司法判例打脸:我们的维权,早已本末倒置

浪子说
2026-09-09 15:23:15
乌克兰击中新罗西斯克多艘俄军舰!摧毁阿纳帕苏33战斗机

乌克兰击中新罗西斯克多艘俄军舰!摧毁阿纳帕苏33战斗机

项鹏飞
2026-09-09 19:47:44
苹果新机代抢连夜涨价!有黄牛将加价3000到5000元!专家:消费者可能“钱货两空”…

苹果新机代抢连夜涨价!有黄牛将加价3000到5000元!专家:消费者可能“钱货两空”…

北京商报
2026-09-09 15:37:33
简直就是奇迹:美国林肯号航母5000多大兵在芭堤雅疯狂玩了5天,竟然仅有2个打架的!

简直就是奇迹:美国林肯号航母5000多大兵在芭堤雅疯狂玩了5天,竟然仅有2个打架的!

步论天下事
2026-09-07 09:40:52
随着41岁C罗破门+利雅得胜利2-1,沙特联最新积分榜出炉

随着41岁C罗破门+利雅得胜利2-1,沙特联最新积分榜出炉

侧身凌空斩
2026-09-10 04:08:38
从胶着到绝杀!中国女篮75:72险胜晋级八强,铁血风骨看哭网友

从胶着到绝杀!中国女篮75:72险胜晋级八强,铁血风骨看哭网友

鲁源侃球
2026-09-10 02:20:32
2026-09-10 07:40:49
赛博禅心
赛博禅心
拜AI古佛,修赛博禅心
552文章数 58关注度
往期回顾 全部

科技要闻

一文看懂:iPhone折叠屏顶配2万6,10月才卖

头条要闻

卖家转让电脑遇"仅退款"直奔1600里外讨说法 3人被抓

头条要闻

卖家转让电脑遇"仅退款"直奔1600里外讨说法 3人被抓

体育要闻

16年后再破门,被皇马放弃的少年没认输

娱乐要闻

郭德纲的商业版图,藏着不知道的真相

财经要闻

知情人士证实DeepSeek备战科创板IPO

汽车要闻

腾势Z9GT易三方闪充尊越型32.98万元上市

态度原创

数码
旅游
亲子
艺术
军事航空

数码要闻

苹果发布AirPods 5耳机 搭载实时翻译与更强续航

旅游要闻

不求繁华喧嚣,只求一隅静谧,这座藏地小村藏着最纯粹的岁月温柔

亲子要闻

我不放弃,也不害怕!#彩虹糖裴曼伊#看看世界有多大#熊出没

艺术要闻

禁止出境国宝!唐代孙位唯一存世真迹,宋徽宗亲笔题名

军事要闻

中东“两线战火”同时升级

无障碍浏览 进入关怀版