![]()
牛来啦!(哞~)
本来想发MiniMax财报,无奈智谱又发了新模型。
刚刚,8月26日晚,「牛来」模型GLM-5.3-Flash( Ox Alpha) 正式开源。
这个模型此前一直匿名跑分,大约320B参数,仅激活 18B, 原生支持文字、图片和视频,也是 GLM-5 系列首个原生多模态模型,而且价格只有 GLM-5.2 十分之一,模型权重已经上线 Hugging Face。
![]()
官方称,GLM-5.3-Flash 整体性能超过 GLM-5.2,编程和 Agent 评测已经接近 Claude Opus 4.8,但价格只有 GLM-5.2 的十分之一。它还换了一套新的基础模型,首次在 GLM 主系列引入稀疏注意力和线性注意力混合架构,并用 30T Token 多模态数据预训练。
![]()
不止 Coding,新模型进一步支持 Office、金融研究、专业文档等工作场景,可完成 PPTX / PDF / DOCX / XLSX 等完整交付。
此前,社区对Ox Alpha的 DeepSWE 小样本测试一度跑出 80%,但那只有 10 道题。扩大样本后成绩回落到约 63%,测试者也主动纠正了最初的说法。这个成绩依然属于第一梯队,但没有最初 80% 那么夸张。
权重开源后,开发者可以直接用 vLLM、SGLang、KTransformers 等框架自己部署,不需要再走匿名模型的 API。
目前,GLM-5.3-Flash (ox-alpha) 现已面向 GLM Coding Plan 全量用户开放,同档 Coding Plan 可用额度提升至原来的 3 倍,而且已经重置所有套餐用户账号内的体验卡数量。
价格层面,GLM-5.3-Flash“斩杀线”价格堪称“多样化”。
![]()
先说,我们Coding Plan用户已经被重置了。
再捋一捋。
官方算的数据,GLM-5.3-Flash定价为GLM-5.3的1/10,限时折扣内为GLM-5.3的1/20,为Opus 4.8的1/40。同样智力,1/40价格。
甚至定价低于DeepSeek-V4-Flash,限时折扣定价远低于DeepSeek-V4-Flash的谷时价格。
再说实际价格。
国内价格:输入限时0.4元、输出1.4元,之后2.8元,缓存命中0.115元。
![]()
海外:GLM-5.3-Flash 标准 API 定价(每 100 万 token) :- 输入:0.15 美元 - 输出:0.50 美元 - 缓存输入:0.03 美元
限时两周50%折扣,-输入:$0.075,- 输出:$0.25,- 缓存输入:$0.015。
![]()
本周智谱已经发了每天100万亿免费token了。
群里他们算了一笔账,如果按1亿token计算,95%缓存命中0元,1%输出1.4元计算,算下来3块钱消耗1亿token。
![]()
最后说问题,如果按coding plan的538元套餐价格计算,API比套餐便宜,后者才可用70亿token。
相当之神奇,多用API吧。
![]()
值得注意的是一个点:智谱首次披露,新模型全面运行于国产AI芯片。
智谱表示,过去一周,公司已在国产AI芯片的大规模集群上部署了 GLM-5.3-Flash,该集群由高带宽互连和针对底层硬件优化的服务堆栈提供支持。
“为了克服单个芯片相对有限的计算和内存容量,我们基于 SGLang 为该架构构建了一个专用的推理引擎。值得一提的是,我们基于 GLM-5.3 的基础架构代理加速了这项工作,它协助工程师开发和优化内核、诊断性能瓶颈并改进服务栈——从而形成了一个反馈循环,在这个循环中,模型反过来又帮助优化服务于模型自身的系统。这些芯片主要受限于内存容量和带宽,尤其是在支持高达一百万个标记的上下文长度时。这就需要进行积极的内存优化,包括针对底层架构量身定制的计算带宽优化和通信带宽优化技术。我们的技术栈结合了用于线性注意力机制和LM头的节点内张量并行性、ReplaySSM、W8A8量化、混合INT8/FP8/BF16缓存量化以及层分割。”
在集群规模上,智谱用了新架构——生产级的编码-预填充-解码 (EPD) 解耦架构将多模态编码、提示预填充和逐个令牌解码分离到独立调度和可扩展的工作池中,从而能够在数万个国产加速器上实现高效可靠的服务。
与相同硬件上的初始基准相比,智谱在端到端服务性能方面实现了3倍的提升,硬件效率和单令牌成本均达到了与主流英伟达GPU相当的水平。这表明国产芯片能够高效、经济地支持大规模前沿模型推理。
当然,目前还未上线技术报告,不清楚更多的技术细节。
semiAnalysis表示,但是所有流量都运行在中国芯片上,实现了与 Nvidia GPU 相当的硬件效率和每个 token 成本。cuda 护城河在昨天 Jalapeño 宣布后再次受到考验。
模型效果呢。
![]()
![]()
轻松识别图片中的文字,而且还联网,之前不太行。
![]()
做点视频音轨,毫无意外的遇到了429限流。
![]()
识别一下论文,你看行不行——我觉得没识别到它石丁文超,还需要努力。
最后,今晚除了智谱,还有阿里同步开源千问最新模型Qwen3.8-Flash,该模型采用全新下一代架构。
Qwen3.8-Flash训练成本较Qwen3.7-Plus下降近90%,推理成本同样大幅下降,每百万Tokens输入仅1元,输出3元,价格最低至DeepSeek-V4-Flash的1/3。
Qwen3.8-Flash今晚将首发上线“千问办公”,开发者和企业也可通过千问AI平台获取新模型API服务。
截至目前,Qwen3.8已开源发布2.4T参数量的Qwen3.8-Max、Qwen3.8-27B及Qwen3.8-Flash三大尺寸模型,Qwen模型全球下载量突破30亿次,衍生模型数超30万个,全尺寸、全模态的全面开源正在全球掀起新一轮中国模型浪潮。
但看样子,Qwen这价格没“斩杀”住智谱GLM。
尤其是千问AI平台的token Plan,消耗的比隔壁9.9火山引擎要快的多,我基本上用个30分钟就用完了。
堪称“抠门大侠”。
![]()
要不也搞个重置?
而MiniMax,刚才闫俊杰在财报会已经确认称,他们还是会往多模态模型方向做,这个还是AGI方向最大的落地点。
©本文为原创内容
未经授权,禁止转载
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.