作者:快思慢想研究院院长 田丰,Global Times 张蔚蓝
开篇:一个没人认领的冠军
![]()
八月的第三个星期,全球开发者论坛流传着一个奇怪的名字——Ox Alpha,中文社区叫它"牛来"。它悄悄挂在OpenRouter和OpenCode这两个开发者常用平台上,没有公司logo,没有发布会,价格低到近乎白送。6天内它被调用超过60万亿次token,冲上两平台用量榜首,峰值一度是纪录保持者DeepSeek同类产品的两倍以上,全部流量由国产芯片承接。
社区侦探靠"tokenizer指纹比对"这种笨办法——逐字比较模型切分文本的习惯——反复核对,咬定11项特征条条指向智谱GLM家族。8月26日彭博社找上门,智谱正式确认:Ox Alpha就是即将发布的GLM-5.3-Flash,六天里支撑它跑赢全球开发者的,是十万张中国造的芯片,一张英伟达的卡都没有。
这是一场国产大模型的意外盲测,但却比一次模型发布会意义大得多。"中国芯片扛不扛得住顶级模型"这个问题,过去的答案大多来自国内AI企业测试,这一次答案来自全球开发者——过程中没有一个开发者知道自己在给谁投票。
一、投票的时候,没人知道模型厂商是谁
![]()
把GLM-5.3-Flash的模型卡认真读一遍,会发现有新意的事:GLM系列第一次把线性注意力和稀疏注意力混着用。45层网络里,一部分用KDA(Kimi Delta Attention)线性注意力,一部分用MLA/DSA混合稀疏注意力,独立架构分析者塞巴斯蒂安·拉施卡(Sebastian Raschka)核对后给出的比例是34层对11层,接近3比1,官方给出的效果是注意力计算量降到约三分之一,KV缓存缩小到4.4分之一——这是能让开发者直接获益的实战数字,长文本响应更快,显存占用更低。
6天62万亿token的调用量,是全球开发者用真金白银投出来的票,而这次投票的前提是没人知道候选人是谁。以往贴上"中国开源模型"标签,西方市场会有不同反应,直觉标签先于实测证据;Ox Alpha把这层有色眼镜彻底摘掉了。更值得注意的是揭盲方式:识别者靠的是纯技术手段,比对模型处理文本的底层习惯,像比对指纹一样比对出血统,不是猜测也不是厂商放风。这说明全球开发者社区已经有了不依赖官方公告、单靠行为反推身份的能力,往后每一次隐身发布都必须是真材实料,否则揭盲当天就砸招牌。
二、"这次降价,是架构算出来的,不是钱堆出来的"
![]()
GLM-5.3-Flash的定价是每百万输入token0.15美元、输出0.50美元,是智谱自家GLM-5.3满血版的十分之一到二十分之一,是Anthropic旗舰模型Claude Opus 4.8的四十分之一。在业内公认的独立跑分机构Artificial Analysis的综合智能指数上,它拿到57分,被官方称为"与Claude Opus 4.8相当"。
哈佛商学院教授克莱顿·克里斯坦森的"颠覆式创新"理论说过一个规律:真正有威胁的挑战者,通常先用低成本切入被忽视的角落,站稳脚跟后再一路往上啃,很少一开始就在顶端硬碰硬。GLM-5.3-Flash正是如此——它没有在跑分上正面超越Opus 4.8(Terminal-Bench 2.1上84.3分,仍略低于对方的85.0分),却用四十分之一的价格挤进几乎所有预算敏感的场景。
这价格是不是"烧钱换量",答案藏在架构里:320B总参数只激活18B,激活率5.6%,混合注意力再把计算量砍掉三分之二。米尔顿·弗里德曼那句"天下没有免费的午餐"提醒所有人,便宜背后一定有人省了钱——这一次,省钱的地方是架构,不是财务报表。
三、"十万张芯片扛住了流量,没扛住的是那句'和英伟达一样'"
![]()
智谱提交的技术材料写得很明确:GLM-5.3-Flash的推理服务跑在超过10万张国产芯片组成的集群上,靠自研高带宽互联网络连接,"硬件效率和单token成本已经达到主流英伟达GPU水平",公司还确认这款模型可部署在所有国产AI芯片平台上。SemiAnalysis点评:每一次请求都由国产芯片以接近英伟达的效率扛下来,"CUDA护城河"又一次被摆上台面接受检验,此前OpenAI自研的Jalapeño推理芯片也引发过同样讨论。
"扛住六天数十万亿token真实流量"可被外部观测、已经发生——OpenRouter作为第三方平台记录了全部调用量。但"单token成本接近英伟达",翻遍模型卡、博客和所有可查报道找不到具体数字,本质上仍是智谱单方面表态。一个被多数报道略过的细节:智谱开源到Hugging Face供全球开发者下载的权重,官方标注推理硬件要求是"NVIDIA Hopper及以上",真正跑在国产芯片上的是智谱自己那套闭环生产系统,外部验证不了也复现不了。芯片型号方面,晚点等媒体称可能来自华为、摩尔线程、海光的组合,摩尔线程已官方确认完成"极速适配",智谱本身没点名任何一家。
四、"省下来的算力,是软件替芯片赔的"
![]()
沿着此前GLM-5训练依赖的华为昇腾910B这条线索往下推——FP16算力约320 TFLOPS,与英伟达A100相当,不到H100三分之一,配套的中芯国际7纳米级工艺良率据估算只有30%到50%,对比台积电90%以上——"单token成本接近英伟达"在原始算力上存在明显缺口,缺口靠架构补。
拉施卡的独立拆解显示,GLM-5.3-Flash的mHC(流形约束超连接)残差结构,是DeepSeek V4风格四路并行残差流,同等参数规模下激活参数和层数比上一代GLM-4.5砍近一半。成本降下来的真正原因,是模型主动压低每次推理调用的算力,去适配国产芯片偏弱的原始性能,芯片制程并没追上英伟达——这和梁文锋解释DeepSeek低成本训练的逻辑如出一辙,用算法主动吸收硬件代差。
经济学家罗纳德·科斯的交易成本理论能解释SemiAnalysis为何反复提"CUDA护城河":这道壁垒不是芯片算力本身,是十几年积累的软件生态,转投别的平台要担巨大迁移成本。黄仁勋那句名言"买得越多,省得越多",底气正在于此。GLM-5.3-Flash真正证明的,是中国团队在算法层面找到了压低这道门槛的办法,这是"国产替代"目前最真实的落地方式。
五、"没人怀疑,才是最狠的测试"
![]()
英特尔前CEO安迪·格鲁夫在《只有偏执狂才能生存》里提出"战略转折点"的概念:一个行业真正的拐点,是市场心态第一次不再对旧格局抱有默认信任的那一刻,很少是某个数字第一次反超的瞬间。GLM-5.3-Flash的跑分并没有全面超越对手——Terminal-Bench 2.1上84.3分低于Opus 4.8的85.0分,HLE排名15/183,综合智能指数57分也只是追近而非超越。这类排名每隔几个月就洗牌一次,过去两年GPT系列、DeepSeek系列反复上演过同样的剧情,没有谁的领先能扛过两代。
真正稀缺、不会被下一次跑分覆盖的,是六天里数以万计开发者在完全不知情的情况下把它当顶级模型正常使用,没有因为"国产芯片"这个标签产生预期性能折扣——这相当于无意中做了一次关于硬件替代的盲测,说服力天然高于厂商自己贴出的对比表格,正是卡尼曼所说的系统二在起作用:不靠标签下结论,靠证据下结论。这个信任一旦在数十万亿token的规模上立住,就很难被推翻,它证明的核心事实只有一句:国产芯片撑起来的生产系统,用户分辨不出来,而且这件事已经在真实生产环境里跑通了。
六、一整条产业曲线在同时上扬
![]()
发布当天,智谱港股早盘涨幅超过6.3%。同一周,阿里巴巴发布多模态模型Qwen3.8-Flash,主打更强的编程和办公任务表现并压低训练成本,默认上下文26.2万token,可扩展到100万,能处理大文件、长对话和大批量研究资料。据《证券时报》援引OpenRouter数据,8月10日至16日当周,中国大模型全球调用量达36.84万亿token,连续16周超过美国,稳居全球第一——智谱只是这条产业曲线上最显眼的一个点。
模型能力会被下一代覆盖,跑分名次会被下一次发布刷新,但"十万张国产芯片在无人怀疑的情况下扛住全球级生产流量"这件事,一旦发生就不会被抹去。田丰认为,这标志着中国大模型正从拼参数、拼跑分,走向架构与基础设施同时优化的新阶段:原生多模态、百万级上下文、国产芯片推理三件事同时做成,说明中国团队已经能在模型设计和硬件适配两条线上同步下棋。
七、"效率红利,才是真正的护城河"
![]()
这盘棋最实在的意义,是让其他还在犹豫要不要把训练和推理预算押给国产算力体系的中国AI公司,决策风险小了一截——这比一款模型自己涨了多少分量级更重。效率红利能不能持续释放,决定企业和开发者规模化采用的速度,也决定中国AI产业链长期韧性能垒多高。
系统一喜欢标签,系统二只认证据。这一次,证据先到了。
![]()
参考文章:《Zhipu AI releases GLM-5.3-Flash model, powered by 100,000 domestically made chips》,Global Times 张蔚蓝
畅销书:《AI商业进化论:“人工智能+”赋能新质生产力发展》
出版社:人民邮电出版社
作者:田丰
帮助你定位AI当下发展坐标的指南针
帮助你洞察AI未来演进趋势的航海图
通俗化解读AI的原理、特性和四大发展规律、提供AI赋能商业、引发新质生产力变革的一手案例分析。既有宏观视角的全局观照,又有各行业应用层面的下探记录,聚焦AI的原理与实践、现在与未来,是当下AI应用的全景图、更是身处AI技术浪潮之中的探路
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.