网易首页 > 网易号 > 正文 申请入驻

DeepSeek 的斩杀线一夜被斩杀,便宜大碗才是真旗舰

0
分享至

刷屏快一周的匿名模型「牛来」,正式揭晓了真身。

8 月 26 日晚,智谱正式上线并开源了 GLM-5.3 Flash,确认它就是 8 月 20 日起以 Ox-Alpha 代号,在大模型聚合平台 OpenRouter 和 OpenCode 上匿名测试的那个模型。


说起来,这是智谱第二次用这种匿名模型先免费跑一周赚流量,然后再官宣认领,上次是「马来」。春节前夕的 Pony-Alpha,后来被证明是 GLM-5。

就在同一晚,阿里也发布了一款新模型,且一样是 Flash 款。Qwen3.8-Flash 正式在大模型开源平台 Hugging Face,和阿里的模型开源社区魔搭 ModelScope 开源权重。

特别的是,千问这款新模型,虽然是 Flash,但是却作为 Qwen4 架构的早期预览版,用的是下一代 Qwen4 模型的新架构。


架构之外,两个新模型的 benchmark 数据和具体表现,也一点不像是原本我们对 Flash 的印象,即旗舰/Pro 模型的删减版。

GLM-5.3-Flash 拥有百万上下文,也是 GLM-5 系列的第一个原生多模态模型,图片、视频、文件、Coding,以及 Computer Use 这些功能现在全部靠模型就能做到。

Qwen3.8-Flash 同样保留百万上下文、图像和视频输入,结合千问办公,生成速度提升 100%,Token 消耗减少 75%。


图|GLM-5.3 Flash 在多个 benchmark 上的表现基本在 Opus 4.8 的水平

与此同时,极致性价比和普惠是这两款模型的定位。GLM-5.3-Flash 的定价前所未有,限时折扣内每百万 Token 输入是 0.4 元,输出 1.4 元,缓存命中 0.115 元,是 GLM-5.3 的 1/20。

Qwen3.8-Flash 的价格同样感人,每百万 Tokens 输入仅 1 元、输出 3 元,是 Qwen3.8-Max 的 1/12。

作为对比,现阶段涨价后的 DeepSeek V4 Flash 价格是每百万 Token 输入是 1.5 元,输出 4.5 元,缓存命中 0.05 元,而高峰时段还是空闲时段的两倍。目前高峰时段为北京时间周一至周五 9:00 - 12:00、14:00 - 18:00,其余为空闲时段。

一边要比较模型界的「拼多多」DeepSeek V4 Flash 的价格,一边又要比较智能上限,动不动就对标 Claude Opus 5、Fable 5 等。


图|DeepSeek V4 系列模型价格,从左至右为 V4 Flash、V4 Pro、V4 Flash Vision 实验版

Flash 似乎正在摆脱过去「砍参数、砍多模态、砍上下文」换低价的定位,从一句「够用就好」,变成大模型厂商新的竞争重点。

和 Opus 4.8 得分持平

OpenCode 的界面仍然显示着,ox-alpha 有 50.5 万个独立用户标识,累计消耗 Token 达到了 44T,完成超过 1300 万个会话,输入 Token 的缓存比例达到 93%。

这些数字能证明大量调用发生在 Coding Agent 平台,即便是匿名身份也没有阻挡住开发者对这款新模型的使用热情。


持续的调用,让这个「牛来」模型终结了 DeepSeek 在 OpenCode 上长达 56 天的霸榜。

而来自模型调用的算力压力,智谱后续则提到,这些请求流量全部由国产芯片提供算力支持,他们调用了超过 10 万张国产芯片做推理服务,并在技术文档中表示其集群「硬件效率及单位 token 成本已经达到了与主流英伟达 GPU 相当的水平」。

我们简单测试了一下 GLM-5.3-Flash 的能力,目前它在智谱官方的 Coding Agent 平台 ZCode 上可以直接体验。官方平台的 BigModel、Coding Plan 等 API 接入也已经开启调用。


多模态的视觉能力是 GLM-5.3-Flash 的新增能力,我们上传了 X 上最近比较火的二维码项目视频。平视是一棵树,但是当我们拖拽鼠标切换不同视角,俯视时,这棵像素块组成的树就变成了一个可扫描的二维码。

GLM-5.3-Flash 可以自动读取视频,但工作时间和我们之前的测试一样,ZCode 要花较长的时间进行思考。似乎并没有因为模型是 Flash,而导致任务的执行时间有变短。

最终实现的项目也是可以用的,但是如动图所示,整个网页非常卡顿。


我们要求 GLM-5.3-Flash 分析卡顿原因,它自己也提到,之前的实现每一帧都要重新绘制整个场景。

而整个场景有将近 1300 块地砖,每块最多 5 个面(顶面 + 4 面墙),再加投影计算里每点都算一遍三角函数,鼠标拖拽的每帧,就有约 6000 次路径填充、2 万次三角函数,60fps 下非常吃力。

修复之后的版本要好上不少,动画更加丝滑,拖拽也不卡顿,切换主题样式时渲染都更快。


而整个项目从读取视频,到实现这个 3D 效果的二维码网页,以及二次修改;ZCode 内显示的应用用量消耗是将近 3000 万 Token,个人套餐内的 5h 剩余额度还有 98%,每周额度则是剩余 99%。



我们继续使用 GLM-5.3-Flash 进行测试,模型的多模态能力很好地帮助 ZCode 可以持续截图,通过视觉识别自身生成的内容,以及用「试玩」等方式来找到输出结果中不合理的部分。

同样是之前在 X 上比较热门的中国宝塔案例,模型需要使用 3D 库, 生成一座中国宝塔,朱漆绿釉,顶部饰以鎏金的完整搭建过程。


GLM-5.3-Flash 似乎参考了二维码花园的项目,导致这个中国宝塔也采用了和之前一样的像素风格,整个用时 57 分钟,消耗 Token 大约在 1500 万左右。

可以说,至少在我们的这轮测试里,GLM-5.3-Flash 和 GLM-5.3 的体验差距并没有价格差距 20 倍那么大。

注意力计算量、KV 缓存、激活参数和总参数可能已经发生了很大变化,但落到常规网页开发、研究报告等实际任务上,这些差异并不明显,GLM-5.3-Flash 也可以胜任。

Flash 正在越过斩杀线

同一晚发布的另一款 Flash 模型,也不「Flash」。

Qwen3.8-Flash 主模型 125B 参数,外加 51B 的 N-gram Embedding,每 token 只激活 6B 参数;原生支持 26.2 万 token 上下文,可通过 YaRN(Yet another RoPE extensioN)扩展到 100 万。

更特别的是,它直接采用了下一代 Qwen4 的新架构。相比 Qwen3.7-Plus,通过架构和注意力机制内核的调整,整体训练成本降到约九分之一,编码和办公任务反而更强。


前段时间,我们在《》里给「斩杀线」下过一个定义: 足够高的任务完成率 × 足够低的总任务成本,从而夺走默认调用位 。

当时看这似乎是 DeepSeek 的单点优势,毕竟一直以来的印象,卷价格,没有人能做到比 DeepSeek 低,智能水平,DeepSeek 也并不会让人失望。

随着智谱发布价格更低的 GLM-5.3-Flash,千问也发布未来结构、价格同样便宜的 Qwen3.8 Flash,所谓的斩杀线已经不再是 DeepSeek 这一家模型厂商的叙事,更像是整个做大模型行业的新规则。


根据 Artificial Analysis 的测算结果,GLM-5.3-Flash 单次任务的成本比 DeepSeek V4 Flash 低,且智能水平要比 V4 Flash 和 V4 Pro 都要高。

当百万上下文、原生多模态和 Coding Agent 开始成为标配,模型厂商正在做同一件事: 把过去接近旗舰级的能力,压进 Flash 的价格带。


图|最近一个月发布的 Flash 模型情况

有意思的是,从今年 2 月发布 Gemini 3.1 Pro 之后,Google 就再没发过任何 Pro 模型。他们在五月发布 Gemini 3.5 Flash、七月发布 Gemini 3.6 Flash、八月发布 Gemini 3.7 Flash……

现在看来,原来 Google 一直发布 Flash 是看中了这块斩杀线。


过去的 Flash 依靠削减能力,比如缩减上下文、剥离多模态来换取低价,匹配对应的市场;而现在的 Flash 保持功能全量,仅通过极低的高效激活参数,像是百亿级激活/几百亿总参数,来压缩单 Token 边际成本。

在眼下「无处不消耗 Token」的背景下,让更多的用户可以大胆地在后台运行着一个自己的「全天候 Agent」,或工作中小到转换图片格式、文档格式这样的工作,都能直接丢给 AI。


而更昂贵的旗舰模型,在更多的时候则是退到了非选不可的情况,只有我们在触发到任务困难、Flash 做不好的情况,或者让 Pro 决策,用 Flash 执行等。

另一方面,Flash 带来的变化也在模型迭代路径上体现,过去是「旗舰先发 $\rightarrow$ 蒸馏缩小 $\rightarrow$ 推出 Flash」;现在则演变为「高效架构(如新型 MoE、预测草稿 Token)先在 Flash 验证 $\rightarrow$ 再拓展至旗舰」。

效率工程本身成为了行业的最前沿,Flash 架构的创新密度甚至开始超越旗舰。


所以今天再问什么是 Flash,答案已经变了。以前,它意味着更快、更便宜的轻量模型;现在,它代表的是 足够高的任务完成率,以及足够低的任务成本。

哪怕生成速度只有 50 Token/s,只要它拥有视觉自检与长文本推理能力,能稳妥跑完耗时 10 分钟的复杂 Coding 或办公工作流, 它在商业层面就已经斩断了传统低端模型的生存空间 。

过去,我们总想默认使用「最聪明的模型」。接下来,默认调用位可能属于那个足够聪明、足够便宜,因此可以放心一直开着的模型。

这是 Flash 越过斩杀线之后带来的变化,旗舰模型决定 AI 的上限,而 Flash 决定我们每天到底用哪个 AI。

我们正在招募伙伴

简历投递邮箱hr@ifanr.com

✉️ 邮件标题「姓名+岗位名称」(请随简历附上项目/作品或相关链接)


特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
国产手机失算了,集体涨价几百上千,原以为门庭若市,结果门可罗雀

国产手机失算了,集体涨价几百上千,原以为门庭若市,结果门可罗雀

王新喜
2026-09-04 11:21:22
中国女篮拒绝输球!全力击败捷克队,王思雨复出,央视直播

中国女篮拒绝输球!全力击败捷克队,王思雨复出,央视直播

体坛瞎白话
2026-09-05 08:38:03
儿童患癌越来越多!再三呼吁:这些东西少给孩子吃!危害大

儿童患癌越来越多!再三呼吁:这些东西少给孩子吃!危害大

橘子约定
2026-08-30 14:06:45
开纯电车跑了一趟云南,回来后我默默把车挂上了二手平台

开纯电车跑了一趟云南,回来后我默默把车挂上了二手平台

民间马后炮
2026-09-03 19:49:21
985硕士李雷阳遇难,入职仅5天刚穿上白制服,聊天记录看哭无数人

985硕士李雷阳遇难,入职仅5天刚穿上白制服,聊天记录看哭无数人

小嵩
2026-09-05 14:38:43
绝平被吹!1-2主场惨遭逆转 13.6亿卫冕冠军惨遭爆冷开局3轮不胜

绝平被吹!1-2主场惨遭逆转 13.6亿卫冕冠军惨遭爆冷开局3轮不胜

狍子歪解体坛
2026-09-05 07:20:00
我空降到老婆公司当总裁,开会时坐在她旁边,她男助理竟一脚踹开我的椅子:这是我的位置,你滚开,老婆当场傻眼了

我空降到老婆公司当总裁,开会时坐在她旁边,她男助理竟一脚踹开我的椅子:这是我的位置,你滚开,老婆当场傻眼了

晓艾故事汇
2026-09-04 08:32:39
杨小菁,当选许昌市委书记(附简历)

杨小菁,当选许昌市委书记(附简历)

大风新闻
2026-09-05 16:42:02
网友反映甘肃兰州榆中县存在“染色莴笋”,当地农业农村局工作人员表示:问题莴笋已查封(销毁)

网友反映甘肃兰州榆中县存在“染色莴笋”,当地农业农村局工作人员表示:问题莴笋已查封(销毁)

大风新闻
2026-09-05 14:47:15
女性负债,真的开始“集中爆雷”了。

女性负债,真的开始“集中爆雷”了。

老陆不老
2026-09-04 21:51:34
君子报仇十年不晚!72名以议员直接绕开中国,支持台湾加入国际组织,可他们没想到中国转头支持巴勒斯坦建国

君子报仇十年不晚!72名以议员直接绕开中国,支持台湾加入国际组织,可他们没想到中国转头支持巴勒斯坦建国

扶苏聊历史
2026-09-05 17:13:58
破船永久不走了!国防部这次不再忍,没等菲方闯岛直接给了下马威

破船永久不走了!国防部这次不再忍,没等菲方闯岛直接给了下马威

吕醿极限手工
2026-09-04 17:54:15
大模型蒸馏时代结束!Fable 5.1改写API,彻底切断蒸馏后路

大模型蒸馏时代结束!Fable 5.1改写API,彻底切断蒸馏后路

新智元
2026-09-05 08:01:01
韩媒放狠话!汉字并非中国独有,它是亚洲瑰宝,韩国也将实施全民汉字教育

韩媒放狠话!汉字并非中国独有,它是亚洲瑰宝,韩国也将实施全民汉字教育

小徐讲八卦
2026-09-04 13:48:19
海拔3200米沙漠连夜搜救,1岁裸体走失男童被找到,事件详情披露

海拔3200米沙漠连夜搜救,1岁裸体走失男童被找到,事件详情披露

扬子晚报
2026-09-05 10:55:31
武大学术圈妲己上位后续:女方被曝更多猛料,她从小就是乖乖女!

武大学术圈妲己上位后续:女方被曝更多猛料,她从小就是乖乖女!

小娱乐悠悠
2026-09-05 14:51:35
罗志祥复出登上热搜,《极限挑战》导演发布长文:六人齐聚才是极限挑战,并询问观众是否期待重拍

罗志祥复出登上热搜,《极限挑战》导演发布长文:六人齐聚才是极限挑战,并询问观众是否期待重拍

新浪财经
2026-09-05 12:05:31
一辆中国SUV让《纽约时报》实测10天,并推出整版报道;美消费者破防:我们可能永远买不到

一辆中国SUV让《纽约时报》实测10天,并推出整版报道;美消费者破防:我们可能永远买不到

第一财经资讯
2026-09-05 12:44:09
“韩国考虑向霍尔木兹海峡派遣海军”,韩媒披露原因

“韩国考虑向霍尔木兹海峡派遣海军”,韩媒披露原因

参考消息
2026-09-05 17:29:04
武大举报风波升级!终于查实:付磊教授的原配妻子为汪海英,曾任该校的行政干部

武大举报风波升级!终于查实:付磊教授的原配妻子为汪海英,曾任该校的行政干部

火山詩话
2026-09-05 17:49:34
2026-09-05 19:52:49
AppSo incentive-icons
AppSo
让智能手机更好用的秘密
6771文章数 26904关注度
往期回顾 全部

科技要闻

华为何庭波,再次更新韬定律论文

头条要闻

知名摇滚歌手何勇去世 崔健曾评价"这小子真了不起"

头条要闻

知名摇滚歌手何勇去世 崔健曾评价"这小子真了不起"

体育要闻

小卡来去10首轮,快船7年彩礼一场空

娱乐要闻

她曾被名导抛弃,凭《生逢其时》翻红

财经要闻

被曝试药后死亡,药企董事竟怒怼记者

汽车要闻

全新第四代博越Li‑HEV系列 怎么开都省

态度原创

本地
健康
数码
游戏
公开课

本地新闻

扒完小作文,富豪们私藏的度假胜地有多绝

脑梗取栓成功≠活下来,还有这三关

数码要闻

IFA2026现场直击:绿联双馆齐发,AI全家桶抢占C位

《漫威金刚狼》男主曾演XBOX大作:建模差距引热议

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版