网易首页 > 网易号 > 正文 申请入驻

GLM-5.3 Flash 来了!比 DeepSeek 更强、更便宜

0
分享至

★ 设为星标 | 只讲人话,带你玩转AIGC。

前几天那个把整个 AI 圈猜了个遍的神秘模型 Ox Alpha(牛来),终于掉马了。

答案是:智谱。

8 月 26 日,智谱正式发布并开源 GLM-5.3-Flash。官方确认,此前突然出现在 OpenCode 和 OpenRouter、没有公布任何背景的 Ox Alpha,其实就是 GLM-5.3-Flash 的匿名预览版。

更有意思的是,智谱表示,匿名测试期间 Ox Alpha 很快成为当周最受欢迎的模型之一,而这些流量全部跑在国产 AI 芯片上


一夜之间,GLM 5.3 Flash 已经成为新的斩杀线。


GLM-5.3-Flash 标准 API 定价(每 100 万 token) :

- 输入:0.15 美元

- 输出:0.50 美元

- 缓存输入:0.03 美元

智谱给出的定位是:GLM-5.3-Flash 正常价格只有 GLM-5.3 的 1/10。

限时折扣期间更低到 1/20;按照官方对比,大约只有 Claude Opus 4.8 的 1/40,是 DeepSeek 的 1/7。


Artificial Analysis 的测试里,它取得 57 分综合智能指数时,每完成一个任务的折扣成本只有约 0.045 美元

换句话说,以前需要大约 10 倍成本才能买到的智能水平,现在被直接打下来了。

这可能才是 GLM-5.3-Flash 真正值得关注的地方。

现在大模型的竞争已经越来越不像单纯的“谁分数最高”,而更像:同样 1 块钱,你到底能买到多少智能。

01 它到底是什么?

GLM-5.3-Flash 可以理解成智谱最新的高性价比主力模型

它有几个非常关键的数据:320B 总参数,但每次只激活 18B。也就是总参数 3200 亿,真正推理时只需要激活 180 亿

相比 GLM-4.5 的 355B 总参数、32B 激活参数,GLM-5.3-Flash 不仅激活参数接近砍半,模型层数也从 92 层降到了 45 层。

但模型变“轻”了,能力反而更强。

官方数据显示,GLM-5.3-Flash 在多项测试和实际工作负载中已经超过 GLM-5.2,在编程和 Agent 能力上则开始逼近 Claude Opus 4.8。

这也是这个模型最值得关注的地方:

不是继续无脑堆参数,而是想办法用更少的计算量,换来更强的能力。

02 能力对标 Opus 4.8

这次比较炸裂的是 Artificial Analysis 的综合智能指数。

GLM-5.3-Flash 拿到了 57 分。按照智谱公布的对比,这已经进入目前全球前沿模型区间,并与 Claude Opus 4.8 处于同一分数水平。


在几个更偏 Coding 和 Agent 的测试里,提升也很明显。

DeepSWE v1.1 从 GLM-5.2 的 46.2 提升到 63.4;AutomationBench 从 26.2 提升到 48.8

智谱自己的 Z.ai Code Bench 上,在最高推理强度下,GLM-5.3-Flash 得分 29.0,Claude Opus 4.8 是 29.5,已经非常接近。

当然,自家 Benchmark 还是要留一点余地看。

但至少从目前公开结果来看,GLM-5.3-Flash 已经不是传统意义上的“小模型换低价”,而是在尝试做到:

旗舰模型的能力,Flash 模型的成本。

03 还是原生多模态

GLM-5.3-Flash 还是 GLM-5 系列第一个原生多模态模型

它不是后面外挂一个视觉模型,而是在预训练阶段就把文本、图片等多模态数据一起训练,整个预训练数据规模达到 30T Token

同时支持最高 100 万 Token 上下文

这意味着它的定位其实已经不只是 Coding。

比如 Agent 可以直接看网页、理解界面,然后点击和操作;也可以处理文档、表格、PPT、Dashboard 等内容,甚至根据视觉反馈检查自己刚刚生成的东西,再继续修改。

这其实非常符合下一阶段 Agent 的方向:

不只是“会写代码”,而是开始真正看得见、点得动、做得完。

04 为什么它能这么便宜?

背后一个很重要的变化,是架构。

GLM-5.3-Flash 首次采用了稀疏注意力 + 线性注意力的混合架构

简单理解:

以前处理超长上下文,有点像每个人都要和房间里所有人说一遍话,人越多,计算量增长越快。

新的方法则是——附近的人重点交流,真正重要的远距离信息再单独建立联系。

这样一来,模型面对几十万甚至上百万 Token 时,就不需要把所有信息都用最昂贵的方式计算一遍。

据公开资料,GLM-5.3-Flash 相比 GLM-5.3 将 Attention 计算量降低到约 1/3,KV Cache 占用降低约 4.4 倍


再加上 320B 总参数只激活 18B,推理成本自然就被大幅压了下来。

所以这次的 Flash,并不是简单把 GLM-5.3 做个“青春版”。

它实际上重新设计了一套更追求效率的模型架构。

05 还有一个容易被忽略的细节

这次 Ox Alpha 的匿名测试,还有一个挺有意思的信息:

所有真实用户流量都是国产 AI 芯片跑出来的。

智谱称,他们基于 SGLang 搭建了一套推理系统,把编码、预填充和解码等阶段拆开优化,并已经运行在数万张国产加速卡组成的基础设施上。

官方资料称,这套系统实现了约 3 倍的端到端服务性能提升

这件事情的意义甚至可能不亚于模型本身。

因为国产 AI 现在真正缺的,从来不只是“能不能训练出一个好模型”。

而是:

模型 + 芯片 + 推理框架 + 大规模真实用户流量,能不能真的跑起来。

Ox Alpha 至少给出了一次非常有意思的实战验证,这已经表明国产芯片能够高效、经济地支持大规模前沿模型推理。

06 而且,它已经开源

和刚刚发布时还要等两周才能开放权重的 GLM-5.3 不同,这次 GLM-5.3-Flash 直接开放了模型权重

目前 Hugging Face 已经上线,模型采用 MIT License,本地部署已经支持 SGLang、vLLM 和 TokenSpeed。

https://huggingface.co/zai-org/GLM-5.3-Flash

前几天我写 Ox Alpha 的时候还在问:“牛来”到底是谁?

现在答案出来了。

但 GLM-5.3-Flash 更值得关注的,可能不是“牛来居然是智谱”。

而是另一个越来越明显的趋势:前沿 AI 的门槛,正在从“谁能做出最强模型”,变成“谁能用最低的成本,把足够强的智能真正跑起来”。

而这一次,中国模型又把价格往下砍了一刀。

参考资料:

https://z.ai/blog/glm-5.3-flash

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
财政部将向中国人寿集团注资350亿元

财政部将向中国人寿集团注资350亿元

新京报
2026-09-06 16:12:10
亚锦赛,又是泰国队爆大冷,中国男排赢了,发球失误多,日本争8强第1难了

亚锦赛,又是泰国队爆大冷,中国男排赢了,发球失误多,日本争8强第1难了

富贵体坛说
2026-09-05 19:46:29
尊界销量暴跌90%登上热搜,但曝S800过去12个月累计销量同档第一

尊界销量暴跌90%登上热搜,但曝S800过去12个月累计销量同档第一

IT之家
2026-09-06 07:40:30
“最强小三”当街露侧乳热吻男友 儿子陪同

“最强小三”当街露侧乳热吻男友 儿子陪同

游民星空
2026-09-04 15:23:46
一语成谶,52岁黄渤确诊入院仅冰山一角,这一病症才是他所恐惧的

一语成谶,52岁黄渤确诊入院仅冰山一角,这一病症才是他所恐惧的

林雁飞
2026-09-04 14:06:23
政治局会议释放新信号:告别大水漫灌,你的钱该往哪放?

政治局会议释放新信号:告别大水漫灌,你的钱该往哪放?

知识TNT
2026-09-06 08:30:36
双赢交易!猛龙2年1.2亿美元迎回伦纳德,快船收获两新星+两首轮

双赢交易!猛龙2年1.2亿美元迎回伦纳德,快船收获两新星+两首轮

钱说体育
2026-09-06 12:43:18
终于破案!李月汝护照为啥非得寄递?隐情披露,宫鲁鸣错失抢救期

终于破案!李月汝护照为啥非得寄递?隐情披露,宫鲁鸣错失抢救期

动物奇奇怪怪
2026-09-06 08:38:20
出局即换帅!女篮危机正式到来,四大接班名帅候选正式出炉

出局即换帅!女篮危机正式到来,四大接班名帅候选正式出炉

体育见习官
2026-09-06 06:34:42
中超最新积分榜:英博升至第2,蓉城欲提前夺冠须取胜,三镇逃离降级区

中超最新积分榜:英博升至第2,蓉城欲提前夺冠须取胜,三镇逃离降级区

中超伪球迷
2026-09-05 22:02:45
死在加州路边的阿里总监:42岁,年薪百万,却买不到一张回程机票

死在加州路边的阿里总监:42岁,年薪百万,却买不到一张回程机票

黑哥讲现代史
2026-09-06 13:43:54
为什么女人出去跟男人约会时,爱穿裙子?看完你就知道了

为什么女人出去跟男人约会时,爱穿裙子?看完你就知道了

皓皓情感说
2026-08-28 08:06:26
乒乓球联赛:张本智和3:0获胜!松岛辉空3:0,日本双子星齐头并进

乒乓球联赛:张本智和3:0获胜!松岛辉空3:0,日本双子星齐头并进

国乒二三事
2026-09-06 06:58:40
儿时发小相会伦敦,阿尔特塔与阿隆索迎来执教生涯首次交锋

儿时发小相会伦敦,阿尔特塔与阿隆索迎来执教生涯首次交锋

懂球帝
2026-09-06 12:07:09
超越中国!越南蝉联美国最大贸易逆差国

超越中国!越南蝉联美国最大贸易逆差国

第一财经资讯
2026-09-05 18:31:32
45岁男子与女友合租一年吃30次他达拉非,一年后房颤,医生:无知

45岁男子与女友合租一年吃30次他达拉非,一年后房颤,医生:无知

健康科普365
2026-09-06 14:35:12
“美国成唯一反对方”与“中国成唯一反对方”有何异同?

“美国成唯一反对方”与“中国成唯一反对方”有何异同?

新民周刊
2026-09-06 09:12:22
美国害怕的,可能不是华为的芯片,而是中国可再生的、低价的电力

美国害怕的,可能不是华为的芯片,而是中国可再生的、低价的电力

蜉蝣说
2026-09-06 11:30:10
假如波兰下场,俄军还能撑几天?这么说吧,波兰若出兵乌克兰,等于往俄乌这锅沸腾的油里泼了盆冰水,炸是肯定炸,但谁先糊真不好说

假如波兰下场,俄军还能撑几天?这么说吧,波兰若出兵乌克兰,等于往俄乌这锅沸腾的油里泼了盆冰水,炸是肯定炸,但谁先糊真不好说

扶苏聊历史
2026-08-24 15:33:30
黄智贤正式变节,邱毅发文确认,馆长也表态了,统派不适合投机者

黄智贤正式变节,邱毅发文确认,馆长也表态了,统派不适合投机者

精彩一网打尽
2026-09-06 15:42:24
2026-09-06 17:00:49
AI范儿 incentive-icons
AI范儿
AI范儿是一个专注于人工智能领域的资讯和学习平台,提供最新的人工智能资讯
830文章数 685关注度
往期回顾 全部

科技要闻

DeepSeek被曝将采购16万颗华为昇腾950DT

头条要闻

辽宁一处长单位门口遭枪击连中两枪 唯一目击证人发声

头条要闻

辽宁一处长单位门口遭枪击连中两枪 唯一目击证人发声

体育要闻

本西蒙斯加盟国王,不管怎样,回来就好

娱乐要闻

低调富养!郭富城两女儿入读香港名校

财经要闻

亏损高达200亿,昔日彩电霸主走下巅峰!

汽车要闻

带升降立标MPV 岚图梦想家9预售价42.99万起

态度原创

本地
亲子
手机
公开课
军事航空

本地新闻

扒完小作文,富豪们私藏的度假胜地有多绝

亲子要闻

睡到半夜孩子突然抽筋,比娃更慌的是我......

手机要闻

9月手机圈进入神仙打架模式!华为三折叠、小米中折叠明天率先登场

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

美伊互袭油轮 伊朗军方称或对美进行更大规模打击

无障碍浏览 进入关怀版