网易首页 > 网易号 > 正文 申请入驻

千问智谱连夜开源,都比DeepSeek便宜,国产大模型价格猛卷

0
分享至


智东西
编译 程茜
编辑 云鹏

智东西8月27日报道,昨晚,阿里千问大模型团队开源多模态MoE模型Qwen3.8-Flash-Next,该模型是基于下一代Qwen4架构构建的先导预览版。

Qwen3.8-Flash-Next主模型参数量为125B,额外配备51B的N-gram Embedding,每token激活6B参数,原生支持262144 token上下文,并可通过YaRN扩展至1百万token

相比于Qwen3.7-Plus,Qwen3.8-Flash-Next降低了训练与推理成本,训练开销仅约为前者的1/9,但在编程和办公任务上性能更强,且该模型在千问团队放出的基准测试中绝大多数都超过DeepSeek-V4-Flash正式版

在价格方面,Qwen3.8-Flash即将上线千问AI平台,对外提供API服务,每百万Tokens输入1元,输出3元,相比空闲时段的DeepSeek-V4-Flash输入价格低33.33%,输出价格低33.33%

昨晚,智谱也开源了GLM-5系列首个原生多模态模型GLM-5.3-Flash(320B-A18B),这也是此前在网上爆火的匿名模型Ox-Alpha(“牛来”模型),同样将价格打了下来。其新模型总参数320B,在智谱自研Z.ai Code Bench体感评估中编程表现与Claude Opus 4.8相当,价格更是降到了GLM-5.3的1/10,限时折扣内为GLM-5.3的1/20,为Opus 4.8的1/40。


▲Qwen3.8-Flash-Next与DeepSeek-V4系列模型价格对比(智东西制图)

Qwen3.8-Flash将首发上线“千问办公”,API即将上线。

在千问AI平台上,该模型以qwen3.8-flash的名称提供服务,千问AI平台支持行业标准协议,包括兼容OpenAI的Chat Completions和Responses API,以及兼容Anthropic的接口,同时Qwen API支持Anthropic API、OpenAI Responses协议,可直接配合Claude Code、Codex使用。

其博客提到,千问提前释出结构上的改动,是为了在发布Qwen4完整模型家族之前,先让社区对其进行检验。

在千问的推特评论区下方,不少海外开发者已经迫不及待想要体验下千问的新模型了,还有网友只是一味夸赞称“这太强了”、“我们不需要OpenAI”、“Qwen未来有可能超越Opus”。


目前,Qwen3.8-Flash-Next的模型权重在Hugging Face与ModelScope发布,默认1百万上下文并内置官方工具的生产版本。

技术报告:https://github.com/QwenLM/Qwen3.8-Flash-Next/blob/main/tech_report.pdf

Hugging Face开源地址:https://huggingface.co/Qwen/Qwen3.8-Flash-Next

一、十余项测试超过DeepSeek‑V4‑Flash、Claude‑Opus‑4.6

Qwen3.8-Flash-Next围绕Attention、Residual、Embedding 和 Optimization四个方面对模型进行了系统升级,在提升模型能力的同时,进一步优化了计算效率、模型容量和训练稳定性。


▲Qwen3.8-Flash-Next模型架构

千问大模型团队放出的基准测试结果显示,Qwen3.8-Flash-Next在智能体、编程、通用能力以及多模态等方面绝大多数都超越了Qwen3.8‑27B、Qwen3.7‑Plus、DeepSeek‑V4‑Flash‑0731、Claude‑Opus‑4.6(Max),拿下第一。

具体来看在纯文本能力方面,Qwen3.8-Flash-Next在10项任务拿下第一,超过Qwen3.8‑27B、Qwen3.7‑Plus、DeepSeek‑V4‑Flash‑0731、Claude‑Opus‑4.6(Max)。

其中编程能力上,Qwen3.8-Flash-Next在智能体编程DeepSWE1.1、SWE‑bench Pro多语言软件工程上拿下第一,仅在仓库级代码生成Repo‑level code generation测试中略逊于DeepSeek。

智能体上,千问新模型在长周期办公任务、专业工作任务、前沿智能体任务的加权部分得分、真实工具调用测试机中均拿下第一,在前沿智能体任务的一次性完全通关率上得分低于DeepSeek‑V4‑Flash。

通用能力上,Qwen3.8-Flash-Next在指令遵循、科学推理、竞赛代码上拿下第一,仅在多学科综合推理能力上略弱于Claude‑Opus‑4.6。


多模态能力方面,该模型13项任务均超过其他三个模型拿下第一。

多模态智能体能力中,主要考验模型是否能看懂截图,操作手机、电脑,复现APP、网页开发、多模态工具调用。Qwen3.8-Flash-Next在这一部分中均拿下第一。

通用多模态能力主要考察模型的看图理解、长视频、图表、数学能力,Qwen3.8-Flash-Next在绝大多数测试中均超过其他三个模型,仅在不给特殊推理提示的科研图标分析测试中,分数低于DeepSeek。


千问还放出了Qwen3.8-Flash-Next-Base在6B激活参数的情况下,与Qwen3.8-27B及Qwen3.7-Plus的base模型比较结果,其在14个benchmark中的8个上取得最优结果,其中51B的N-gram embedding参数是确定性寻址的,不进入每token的矩阵乘预算。


当前基础模型所需的参数量不断增加,上下文窗口长度不断增加,核心问题已不再是究竟能把规模做到多大,而是实现规模化的效率有多高。基于此阿里千问大模型团队进行了架构上的创新,其开源的Qwen3.8-Flash-Next,正是阿里朝这一目标迈进的阶段性关键成果。

该模型是其基于Qwen4架构打造的实验预览版模型,核心是重新深度思考现代大语言模型的核心组件在大规模运行场景下如何协同工作。

二、四大架构创新,让新模型更强更稳更划算

Qwen3.8-Flash-Next主要包含四大创新点:

1、GDN与QSA(通义稀疏注意力)结合,实现高效记忆和精准检索

传统全局注意力可以直接访问所有历史token,但上下文越长,计算和KV Cache访存成本越高。

其延续Qwen3.5的架构设计采用GDN+Attention的Hybrid架构:每四层中三层使用Gated DeltaNet(GDN),将历史信息持续压缩到固定大小的状态中;另一层保留全局Attention,负责精确检索全局信息。

研究人员对全局Attention进一步引入Qwen Sparse Attention(QSA),通过只关注重要上下文来减少长序列下的计算。QSA通过压缩式轻量Indexer在micro-block(微块)粒度上筛选重要上下文,降低长序列 Attention 开销。这样不仅减少了实际Attention的计算量,也降低了“寻找重要上下文”本身的上下文索引成本。


可以理解为GDN负责高效“记住”,QSA负责精准“查找”

在1M token上,QSA的Attention Kernel在Prefill和Decode阶段分别实现最高7.6倍4.9倍的加速。在贴近线上高缓存复用场景的实验设定下(Prefix Cache命中率为90%),Qwen3.8-Flash-Next在1M上下文下的Prefill吞吐达到Qwen3.7-Plus的8.6倍


2、引入Gated Residual(GR,门控残差),给信息更多传递路径

传统Transformer架构中,各层持续在同一条Residual Stream上读写信息,随着网络加深,早期特征不断与后续信息混合,重要信息更容易被逐渐稀释。

GR可以看作两种思路的结合:一方面延续Hyper-Connection(超连接)将residual stream(残差流)扩展为多分支的设计,另一方面将GatedNorm的逐元素动态门控融入residual read(残差读)。最终原本单一的residual stream被扩展成4条并行分支,模型可以根据当前内容动态决定从不同分支读取多少信息,以及向不同分支写入多少信息。

这可以把它理解为把一条信息通道扩展成多条车道:有些分支负责局部信息传递,有些则可以把早期信息直接保留到很深的网络层。研究人员实际分析中也观察到,其中一条branch(残差分支)会自然形成连接第一层Attention和大部分中后层的长距离通道。

GR 还进一步简化了Hyper-Connection:当read/write足够灵活后,额外的branch mixing(分支混合)已经没有明显收益,因此可以直接去掉,减少访存开销和不稳定因素。归一化后的Gate同时能够有效抑制activation outlier(激活异常值)、提升训练稳定性;Residual State(残差状态)支持使用FP8存储,进一步降低访存开销。

3、引入N-gram Embedding,低成本扩展模型容量

研究人员受到Gemma 3n中Per-Layer Embedding(逐层嵌入)和DeepSeek Engram等工作的启发,进一步引入N-gram Embedding,从Transformer参数之外的维度扩展模型容量。

普通Embedding根据单个token查表;N-gram Embedding则结合当前token与前几个token组成的局部上下文进行查表,为常见短语和局部模式提供额外表示。其核心优势是可以增加大量参数,同时几乎不增加每个token的计算量。

Qwen3.8-Flash-Next额外引入了51B N-gram Embedding参数。由于查询位置可以提前确定,这些参数可以存放在Host Memory中,通过异步Prefetch与模型计算重叠,无需长期占用GPU显存。最终,模型只在前部使用一层N-gram Embedding,以较低的额外成本增加了一个大规模的“局部模式记忆库”。

4、Optimization:优化Muon在大模型训练中的使用方式

Qwen3.8-Flash-Next使用Muon Optimizer训练,并围绕三个关键问题进一步优化Muon在大模型训练中的使用方式:正交化精度、Muon与AdamW的参数分工,以及融合参数矩阵的拆分。

对于真正作为二维线性映射的参数,例如Attention、GDN和MoE Expert中的主要权重,研究人员使用Muon;Embedding、MoE Router、GR低秩参数等则继续使用AdamW。

对于工程实现中融合存储的QKV、SwiGLU和GDN Projection,先按照实际对应的独立线性变换进行拆分,再分别执行正交化。

针对新的模型结构和Optimizer,研究人员重新拟合了Scaling Law,结果显示模型可以稳定使用更大的Learning Rate(学习率)和Batch Size(批次大小),进一步提升收敛效率和大规模并行训练吞吐。

其实验还发现,过去大模型训练中常见的Batch Size Warmup(批次大小预热)已经不再必要,从小Batch逐渐增加到目标Batch并没有改善最终效果,反而需要额外执行18.8%的优化器步数。因此,在最终训练配置中,研究人员直接从目标Batch Size开始训练。

三、其余架构优化,继承自Qwen3‑Next的成熟架构组件

其余的架构优化沿用Qwen3-Next所确立、并在Qwen3.5–Qwen3.8系列中不断打磨的设计:

极致稀疏MoE:在全局负载均衡下,固定激活专家数量而持续增加专家总参数量,可稳定降低训练loss,因此Qwen3.8-Flash-Next采用较大的专家池,每token只路由少量专家,并配合一个共享专家。

Multi-Token Prediction:MTP模块以多步方式训练,保持训练与推理之间的一致性,从而提升实用场景下speculative decoding(推测解码)的接受率,同时也提升主干本身的性能,其中的全注意力层同样被替换为QSA。

训练稳定性:保留Zero-Centered RMSNorm并对norm weight施加weight decay、注意力输出门控机制,以及MoE路由参数初始化的归一化,这些设计使小规模消融结果更可靠,也有助于大规模训练平稳进行。

结语:率先放出新架构预览模型,千问要依托社区能力完成版本打磨

随着企业侧长文档处理、私有化部署、Agent智能体等高价值场景规模化落地,行业对大模型的评价标准,更看重其冷输入成本、推理带宽开销、硬件适配能力、训练可复现性等工程化指标。

Qwen3.8‑Flash‑Next这套综合架构改进,也证明总参数量已经不再是衡量模型能力的第一指标,激活参数量、冷prefill开销、硬件适配能力的权重持续提升。

此外,千问率先放出下一代架构的预览版本,真实社区的复现、二次预训练、FP8部署、长上下文压测,可以暴露出内部实验难以覆盖的问题,以便在正式版本发布时进行进一步调优。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
洛杉矶奥运女排门票已出5张,中国女排迎利好,日本女排仍是对手

洛杉矶奥运女排门票已出5张,中国女排迎利好,日本女排仍是对手

体育大学僧
2026-09-07 12:10:16
当孩子说“再玩10分钟”时,你的第一句话,决定了他20年后的人生

当孩子说“再玩10分钟”时,你的第一句话,决定了他20年后的人生

户外阿毽
2026-09-05 12:14:10
一个被很多人忽略的史诗时刻:特斯拉可能正在把电池工艺推向爆发

一个被很多人忽略的史诗时刻:特斯拉可能正在把电池工艺推向爆发

旧史新谭
2026-09-07 18:40:37
美网终极对决来袭!胜率仅12%惨遭看衰,硬地苦主横亘身前、教练全力撑腰笃定冲冠,郑钦文仅剩最后一张外卡

美网终极对决来袭!胜率仅12%惨遭看衰,硬地苦主横亘身前、教练全力撑腰笃定冲冠,郑钦文仅剩最后一张外卡

风吹一生v
2026-09-07 21:51:37
心理学上说:你跟伴侣倾诉委屈时,对方的第一反应不是心疼你、理解你,反而不断回避你、指责你、反驳你,你们其实并没有在沟通

心理学上说:你跟伴侣倾诉委屈时,对方的第一反应不是心疼你、理解你,反而不断回避你、指责你、反驳你,你们其实并没有在沟通

心理观察局
2026-09-07 06:23:08
大S闺房曝光!太过诡异像灵堂引人不适,难怪大师预言她活不过50岁

大S闺房曝光!太过诡异像灵堂引人不适,难怪大师预言她活不过50岁

瞎说娱乐
2026-08-27 11:09:48
承认吧,如今很多家庭已经供不起一个大学生本科四年的全部开销了

承认吧,如今很多家庭已经供不起一个大学生本科四年的全部开销了

天天热点见闻
2026-09-07 06:10:14
港姐王菲宣布订婚!

港姐王菲宣布订婚!

浙江之声
2026-09-06 14:32:28
又一个高学历女同胞恋爱脑,死在了异国他乡,她是富家女,才24岁

又一个高学历女同胞恋爱脑,死在了异国他乡,她是富家女,才24岁

皮蛋儿电影
2026-09-07 11:48:42
态度变了?郑钦文逆转赢球后,美媒发文锐评,原来李娜真没说错

态度变了?郑钦文逆转赢球后,美媒发文锐评,原来李娜真没说错

吃青菜长高
2026-09-07 11:48:36
神经科主任:只要血常规没这3个箭头,脑梗风险或不用太焦虑

神经科主任:只要血常规没这3个箭头,脑梗风险或不用太焦虑

医学科普汇
2026-08-25 23:00:08
台湾退役中将帅化民表示:不少人都说中国军事力量已居世界顶尖水平,但在他看来,真正需要思考的不是先打谁,而是大陆为何始终隐忍不出手

台湾退役中将帅化民表示:不少人都说中国军事力量已居世界顶尖水平,但在他看来,真正需要思考的不是先打谁,而是大陆为何始终隐忍不出手

人生录
2026-07-27 00:05:06
魔鬼!郑钦文复制拉杜卡努10连胜夺冠?需连赢4大克星:3胜22负

魔鬼!郑钦文复制拉杜卡努10连胜夺冠?需连赢4大克星:3胜22负

顺静自然
2026-09-07 12:49:23
奔驰那封回执,把星宇的国内公关干沉默了

奔驰那封回执,把星宇的国内公关干沉默了

娱乐圈的笔娱君
2026-08-31 01:19:35
老胡,你也是掏上粪了!

老胡,你也是掏上粪了!

胖胖说他不胖
2026-09-07 09:55:26
1955年全军授衔之前,刘少奇坚持反对给陈毅授元帅军衔,周恩来听闻此事,立马写了封信,为什么陈毅能被授予元帅军衔呢?

1955年全军授衔之前,刘少奇坚持反对给陈毅授元帅军衔,周恩来听闻此事,立马写了封信,为什么陈毅能被授予元帅军衔呢?

纪史行者
2026-08-28 00:30:05
两个女生同名同姓、同年同月同日生还考上同校同专业,家长:希望两人成为姐妹,走得更远

两个女生同名同姓、同年同月同日生还考上同校同专业,家长:希望两人成为姐妹,走得更远

封面新闻
2026-09-06 21:49:06
人社局回应“星宇解约107名应届生”:93人已收到offer,推荐岗位超500个

人社局回应“星宇解约107名应届生”:93人已收到offer,推荐岗位超500个

手工制作阿爱
2026-09-07 17:18:55
连生4胎没领证,被全网嘲了十年"豪门梦碎":如今纪晓波欠债56亿跑路被通缉,全网才看懂,那张她最想要的结婚证,救了她一命

连生4胎没领证,被全网嘲了十年"豪门梦碎":如今纪晓波欠债56亿跑路被通缉,全网才看懂,那张她最想要的结婚证,救了她一命

黎兜兜
2026-09-06 21:12:20
中足联官网确认:申花进铜梁龙的第二球为吴曦打进

中足联官网确认:申花进铜梁龙的第二球为吴曦打进

懂球帝
2026-09-07 13:31:07
2026-09-08 02:08:49
智东西 incentive-icons
智东西
智东西,AI产业新媒体,专注报道人工智能的前沿技术发展,和技术应用带来的千行百业产业变革。
12558文章数 117167关注度
往期回顾 全部

科技要闻

小米澎程N90 Max定价26.99万元

头条要闻

伊朗试验特殊武器爆炸场面如同地狱 美军舰直接跑了

头条要闻

伊朗试验特殊武器爆炸场面如同地狱 美军舰直接跑了

体育要闻

压哨避开CBA选秀规则?NBL香港金牛队已为男篮国手王俊杰报备合同

娱乐要闻

热搜第一,演员李沐宸致歉

财经要闻

证监会原副主席王建军一审被判无期徒刑

汽车要闻

智能可变大空间SUV 小米澎程系列车型上市 20.99万起

态度原创

本地
数码
房产
公开课
军事航空

本地新闻

扒完小作文,富豪们私藏的度假胜地有多绝

数码要闻

存储吃紧!华硕、技嘉计划再次上调显卡售价:最高涨幅500元

房产要闻

10万人吃瓜!三亚这个楼盘,法拍网上卖疯了!

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

媒体:中美战区司令会晤释放的信号 台湾要听懂

无障碍浏览 进入关怀版