网易首页 > 网易号 > 正文 申请入驻

爆料一个新模型,平替 Opus 4.8 的国产之光来了

0
分享至

今天有个重磅消息,智谱正式发布了 GLM-5.2 模型,同时也开源了。

在全球百万用户参与盲测的前端开发评估系统 Code Arena 上,GLM-5.2 取得目前可用模型第一的成绩。


有一说一,国产模型这次真的站在了世界前列,属于我们普通人能用得上用得起的国产之光了。

这次 GML-5.2 有两个关键信息,我觉得应该重点聊聊。

第一,Coding 继续保持国产第一、开源第一。

在 FrontierSWE、SWE-Marathon、PostTrainBench 等多个长程任务基准上,GLM-5.2 的表现介于 Claude Opus 4.8 与 GPT 5.5 之间,是排名最高的开源模型。


我在网上看到一个 AI 博主说,如果你是通过中转服务使用 Opus,那你可能分不出有可能是 GLM-5.2 冒充的。

第二,1M token 上下文。

注意,不是标称 1M,是真正能用的 1M。

现在市面上标称 1M 的模型不少,但大部分到了长上下文后半段效果衰减得厉害。

GLM-5.2 通过注意力结构层面的创新,把 1M 长度下的效果衰减和推理成本同时压了下来。

说人话,就是它在处理超长任务时不会到后面就开始犯糊涂、忘前面说过什么。

这个能力为什么重要?我换个说法你就明白了。

现在用 AI 写代码最大的痛点不是它写不出来,而是任务一长它就忘了。

你让它改一个大项目,改到第 30 步的时候它忘了第 2 步定下的规则。你不得不反复提醒它、反复把上下文喂回去,累的不是 AI,是你。

说白了,就是「能干活,但记性差」。

因此,1M 上下文解决的就是这个问题。

一个持续工作数小时的 AI 要经历几千次工具调用、读写数万行代码、积累大量中间状态。

如果上下文窗口不够长,模型就被迫不断压缩、丢弃、再回忆,每一次压缩都是信息损耗,每一次遗忘都可能让任务在第 N 步偏离第 2 步的约束。

长程任务的失败,很多时候不是模型不够聪明,而是它忘了。

GLM-5.2 做到的是在一次任务中完整持有整个项目的全部代码、全部决策历史、全部约束条件。

这个过程,就像一个不会忘事的工程师,从头推进到尾。

这里说个案例。

之前我自己用其他模型结合 Claude Code 开发了一个小程序,当时光是 PRD 文档就有 5000 多字,因为单个文件太大,还是拆分上传的。


这次我换成 GLM-5.2 试了下,试图让它重构这个项目,还是同一份 PRD 文档。

开启 CC 的 Plan Mode 模式后,我先让模型自己加载分析需求文档并制定开发计划,然后再进入开发阶段。

过程中,我还加了一些需求,并且对一开始的信息做了修改。此时,GLM-5.2 的 1M 上下文优势就出来了,全程无纰漏。


大概用了 25 分钟左右,这个基于 PRD 的项目就全部开发完了,而且自己调起了本地的微信开发者工具。

我让它统计了代码量,总共 16000 行代码,而且能成功预览。

不过有一说一,我觉得 GLM-5.2 在前端页面的设计美观度上还有提升空间,现在属于可用,但还不是绝对好的状态。


如果是用来做一些大型项目的重构或者开发,这种 1M 上下文空间的体验就会明显好很多。

在 Terminal-Bench 2.1 上,这是一个评测 Agent 通过命令行操作一台计算机的数据集,GLM-5.2仅比Opus 4.8低4%,相比GLM-5.1提升了17.5%。

在 MCP-Atlas 上(工具使用tool-use评测的数据集),GLM-5.2仅比Opus 4.8 低 0.8%。


此外,能做的事情也变了。

整个代码库扔进去做跨文件重构,一句话需求直接出完整全栈项目,大型 SaaS 级工程持续推进不跑偏。

这些场景以前只能拆成无数个小任务反复喂上下文,现在可以一次性给完、一次性干完。

我自己也测了一个场景,就是优化我之前用 Agent 开发的个人网站。

先说下,如果你们想用上 GLM-5.2,就得去抢智谱的 Coding Plan,不过这个现在很紧俏,你们可以每天去盯一盯官方放量的时间。

如果抢到了配额,就可以配置到你的 Agent 里直接开始用,我是用 Claude Code 配合 GLM-5.2 用的。

之前开发这个网站我用了几个模型混合完成,包括 GLM-5.1、Claude Opus 4.6 和 4.8。

从前端开发质量来看,Claude 的模型确实做得更好,但是在代码本身的开发质量上,我觉得 GLM 和 Claude 的差距并没有那么大。

这次优化,我完全用 GLM-5.2 来完成,核心就是优化我之前觉得别扭的几个模块。

第一个问题就是我网站上案例墙这部分,现在的问题就是重点不突出、没有数据、视觉不美观。


我跟 GLM-5.2 提的需求并没有那么明确,只是表达了一句话需求。

但是,它的分析和问题拆解却很精准,而且还发现了代码中存在的命名问题。

讲真,它跟我说话真的是毫不客气。


不仅找准了问题,而且还给出了方案。


不仅按照这个新方案做了重新开发,还对我原有的代码结构做了优化,整个网站的代码都有被它 review。

我有一个很直观的感觉,就是一次性成功率更高,而且模型在需求理解、代码执行、完成质量上做得都不错。

优化后的最终效果,明显比之前好太多。


说实话,结果超出预期。

从实际体感来看,我觉得写出来的代码质量和最终呈现的效果跟之前我用的 Claude 模型差异并不是很大。

还是我之前说的,现在 GLM 系列的模型在国产 coding 领域的确是做得非常好的一家。

说实话,对于我们这些每天重度使用 AI 的人来说,智谱的操作是值得点赞的。

之前大家选模型默认选海外的,Claude、GPT,能力确实强。

但稳定性呢?可用性呢?账号说封就封,模型说停就停,上周 Anthropic 的事就是最好的例子。

现在,国产开源模型的价值正在被重新评估。

不是说它今天在所有维度上都比 Claude 好,而是它稳定、可控、不会哪天突然告诉你「因为政策原因,你不能用了」。

还有一点,现在国产 AI 都在不同程度上被限卡,如果这个环节能突破,我觉得不会比国外差。

GLM-5.2 这次的做法也值得一说,Coding Plan 全量用户直接可用,包括免费的 Lite 版。

这种发布方式本身就是一种态度,不搞花活,你自己试,数据说话。

最后,说下我自己的判断。

过去一年,行业衡量模型的标准正在迁移。以前比的是谁完成任务更好,谁的 benchmark 分高谁就牛。

现在比的是「能独立干多久」,谁能持续工作、不跑偏、不忘事,谁才是真正能用的生产力工具。

上下文长度的可用性和长程任务能力,正在成为下一阶段模型竞争的主线。

技术要真正普及成生产力,就一定是开放的。

所有的不开放和限制,本身其实就是对生产力进步的一种束缚。

智谱在他们官宣内容的最后提到两句英文:

A step closer to frontier intelligence for everyone.

The future of AI is open, and it is for the people.

翻译过来就是:

向前沿智能再近一步,为每一个人。

AI的未来是开放的,它属于所有人。

国产模型走到这一步,值得被看见。

················· 唐韧出品 ·················

用AI思维发现下一个机会

安可时刻

如果国产模型能解决被限卡的瓶颈,那速度和质量又会上去一个台阶。

其实对于大多数任务来说,现在国产模型已经表现不错了。从我的日常 coding 场景来看,GLM-5.2 基本也能满足大多数需求。

国外模型是很强,但我们也要给国产模型一些时间让他们成长。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
总投资1.5亿元!花都又一重点总部项目正式动工

总投资1.5亿元!花都又一重点总部项目正式动工

广州花都发布
2026-09-05 18:07:06
姆巴佩补时丢点不算冤!皇马这场输球藏着3个没人敢说的真相!

姆巴佩补时丢点不算冤!皇马这场输球藏着3个没人敢说的真相!

落夜足球
2026-09-05 17:05:15
中国选择荷兰当“典型”,就是告诉全世界:凭什么这么欺负人?

中国选择荷兰当“典型”,就是告诉全世界:凭什么这么欺负人?

李云飞Afey
2026-08-23 21:20:18
31+31!生涯最后一舞!乐福有望重返森林狼

31+31!生涯最后一舞!乐福有望重返森林狼

篮球教学论坛
2026-09-06 00:18:28
福建云水谣600多年古榕树被洪水冲倒,村民回忆:儿时在树下玩耍,古树见证村庄发展

福建云水谣600多年古榕树被洪水冲倒,村民回忆:儿时在树下玩耍,古树见证村庄发展

潇湘晨报
2026-09-05 22:01:44
贪官末日来了!中央反腐新规已落地,无论在职退休一律终身追责

贪官末日来了!中央反腐新规已落地,无论在职退休一律终身追责

职场资深秘书
2026-09-04 17:24:51
抖音主播码字的:郭德纲是我举报的,我是骨干,证据都是我提供的

抖音主播码字的:郭德纲是我举报的,我是骨干,证据都是我提供的

早起的鸟儿有饭吃
2026-09-03 02:08:06
健身网红长相凶狠,却意外撞脸动漫角色,参加漫展被夸100%还原

健身网红长相凶狠,却意外撞脸动漫角色,参加漫展被夸100%还原

新游戏大妹子
2026-08-15 12:53:10
62岁黄贯中发文悼念何勇:朋友再见了,很高兴认识你

62岁黄贯中发文悼念何勇:朋友再见了,很高兴认识你

叨唠
2026-09-05 23:55:08
超8万户股民“踩雷”!600076、002674被立案调查

超8万户股民“踩雷”!600076、002674被立案调查

大众证券报
2026-09-05 17:45:49
大陆虚拟币一姐,华人首富的“畸形伙伴”,为情夫缴纳498亿罚款

大陆虚拟币一姐,华人首富的“畸形伙伴”,为情夫缴纳498亿罚款

阿鄖田间生活
2026-08-26 18:03:42
27岁博主去世引关注,发病到死亡仅1天多!妻子痛悔"全家都被误导了""两个女儿还太年幼"……

27岁博主去世引关注,发病到死亡仅1天多!妻子痛悔"全家都被误导了""两个女儿还太年幼"……

鲁中晨报
2026-09-05 16:50:05
不会组织还浪投!全场9中2仅得4分,这水平还想冲击WNBA?

不会组织还浪投!全场9中2仅得4分,这水平还想冲击WNBA?

弄月公子
2026-09-05 07:59:53
李月汝意外无缘世界杯,巴特尔直言:这不是简单的意外

李月汝意外无缘世界杯,巴特尔直言:这不是简单的意外

观星娱记
2026-09-05 10:14:51
IP社的神秘新秀,会是今年的保底SSR吗?

IP社的神秘新秀,会是今年的保底SSR吗?

吃瓜党二号头目
2026-09-05 12:10:32
特朗普接班人已明朗?美国或出现历史上第1个,被中国制裁的总统

特朗普接班人已明朗?美国或出现历史上第1个,被中国制裁的总统

解锁世界风云
2026-09-05 18:01:03
外交彻底瘫痪?日本大使交底:现在中日关系,再装下去真没救了?

外交彻底瘫痪?日本大使交底:现在中日关系,再装下去真没救了?

究竟谁主沉浮
2026-09-05 07:39:27
美网5日凌晨:7人挺进16强,7号种子爆冷,郑钦文时间定于今晚!

美网5日凌晨:7人挺进16强,7号种子爆冷,郑钦文时间定于今晚!

林子说事
2026-09-06 01:39:37
暴雨,11级大风!台风“科罗旺” 突然大转弯,浙江风雨将升级:这天最猛,请提前做好准备

暴雨,11级大风!台风“科罗旺” 突然大转弯,浙江风雨将升级:这天最猛,请提前做好准备

19楼
2026-09-05 09:07:36
18岁女孩惨遭已婚男友殴打致死:ICU 里面目全非,母亲哭到眼睛反复就医,知情人爆料更多内幕

18岁女孩惨遭已婚男友殴打致死:ICU 里面目全非,母亲哭到眼睛反复就医,知情人爆料更多内幕

笔尖下的人生
2026-09-05 15:39:48
2026-09-06 02:23:00
唐韧 incentive-icons
唐韧
用产品思维解决难题
1536文章数 2045关注度
往期回顾 全部

科技要闻

华为何庭波,再次更新韬定律论文

头条要闻

患者疑将刀藏锦旗中连捅医生多刀 警方:嫌疑人被刑拘

头条要闻

患者疑将刀藏锦旗中连捅医生多刀 警方:嫌疑人被刑拘

体育要闻

本西蒙斯加盟国王,不管怎样,回来就好

娱乐要闻

阿Sa蔡卓妍首度求婚细节,感动落泪

财经要闻

被曝试药后死亡,药企董事竟怒怼记者

汽车要闻

千里浩瀚H5/30英寸大屏 星越L PLUS让你看到油车越级的一面

态度原创

本地
时尚
数码
手机
公开课

本地新闻

扒完小作文,富豪们私藏的度假胜地有多绝

推广中奖名单-更新至2026年8月25日推广

数码要闻

1.28kg塞进12核Zen 5!积核X16 Pro AMD版亮相:32GB LPDDR5X

手机要闻

华为Pura 90系列未加入涨价潮:价格最稳的华为影像旗舰

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版