网易首页 > 网易号 > 正文 申请入驻

比Opus4.6强,比V4 Flash便宜!Qwen3.8-Flash到底怎么样?

0
分享至

早上在群里刷到个截图,看得我有点乐

这是V2EX上一个帖子,标题叫《我们开始倒班考勤了》。


发帖人说因为几家大模型都开始搞高峰期token翻倍,公司为了省token成本,本周起改考勤:非周末休息一天,周末再休息一天,可自由组合,但要提前排班;工作日午休也推到14点以后。

也真不知道该说他们公司足够AI Native还是特么太抠门呢。不过,现在智能的价格确实还不够便宜,至少DeepSeek的几次价格调整,确实会让很多人有很明显的账单价格变化的体感。然后,还好,国内几家头部大厂和大模型公司够卷的,我们很快等来了更好的模型和更低的价格。

Qwen3.8-Flash来了

昨晚阿里发了Qwen3.8-Flash,我把两家的价目表拉到一起看了一遍。


Qwen3.8-Flash上线千问AI平台的API价格是每百万token输入0.8元、输出2.7元,缓存命中0.1元,一口价,官方原文通篇没有峰谷、没有忙时闲时、没有阶梯。DeepSeek这边V4-Flash的输出是空闲4.5元、高峰9元,V4-Pro空闲13.5元、高峰27元,高峰时段是周一到周五的9点到12点、14点到18点,其余时间价格减半。

顺手换算一下量级——一亿token的输入,走Qwen3.8-Flash是80块;同样的量走Claude Opus 4.6的API,是500美元。3.8-Flash命中缓存只要10块,算是同类模型中的最低价格了。

现在X上很喜欢管这叫「斩杀线」。Qwen3.8-Flash确实把这条线又往下推了一格。


不过便宜归便宜,性能到底行不行?

那性能呢

8月26日晚上发布的是Qwen3.8-Flash,同步开源了权重版Qwen3.8-Flash-Next(同一个模型,Next指的是下一代架构)。官方放了两张对比表,对照组是自家的Qwen3.8-27B、上一代Qwen3.7-Plus,加上DeepSeek-V4-Flash和Claude Opus 4.6。



挑几个我觉得你会关心的:智能体编程的SWE-bench Pro,62.5比53.4,领先Opus 4.6九分;专业工作任务JobBench,55.7比36.6,差了19分;模拟手机操作的AndroidWorld,84.5比62.0,差22.5分;用视觉推理解数学题的MathVision差25.1分;具身智能ERQA差31.5分。长程任务CoWorkBench和真实工具调用Toolathlon这两项比的是DeepSeek-V4-Flash,也都赢了(Toolathlon只领先3.2分,幅度不大)。

不过我觉得更有趣的还不是这些分数,是表头那一行写的参数量:Qwen3.8-Flash-Next是125B总参数、6B激活,DeepSeek-V4-Flash是284B总参数、13B激活,自家上一代Qwen3.7-Plus是397B总参数、17B激活。

总参数不到DeepSeek那个的一半,每次干活只激活60亿参数,大概是它自己总参数的二十分之一。分数、价格、参数量这三件事放一起看,才是这次发布真正想说的那件事。

我拿它跑了一晚上真活

跑分这东西你我大概都知道是怎么回事,所以昨晚23点API一开放(发布文里写的还是「即将上线」),我直接把它接进Claude Code,甩了三个真活过去。


第一个是数据分析。

我让接了Qwen3.8-Flash 的cc调用Huashu-Excel skill去分析一份真实数据,B站「每周必看」榜单,要求评估:什么样的视频能上榜、互动数据有什么规律、该押哪些区。数据里我埋了坑,期数大量缺失、互动极端右偏、官方口径中途变过一次。


它干了一个半小时,190次工具调用,HTML、docx、xlsx、deck四种格式全交付了。但最值得说的是它开工后干的头一件事——它发现任务书和数据文件对不上:任务书写5,324行×32列,实际是7,427行×33列。它没装没看见,把两份数字摆在一起声明以文件为准,又去核了官方接口确认口径。从数据清洗、处理到最后的分析和呈现,基本上完全符合我这个数据分析skill的设定和预期,我甚至很难看出它和我平时用的Opus5的表现有什么差异。

第二个是让它给自己画张架构图。

我的要求很简单:你的新架构今晚要公布,用一张图把GDN+QSA混合注意力、门控残差、N-gram Embedding、Muon优化器这四件事讲清楚,讲给一个懂AI但没空看论文的人听。


15分31秒,32次工具调用,交回来一个29KB的单文件网页,参数构成条能点,四个技术点各一张可折叠卡片。那32次里有7次是它自己截图自检——发现画的SVG有个标签戳出边框,改完再截一张确认干净才说交付。

图里的关键数字我抽查了几个拿去跟技术报告对,全部命中,没有编。

一个半小时和15分钟。从变现来说,这个模型在真实任务里已经非常接近一个靠谱的分析师和研究员了。

第三个活我放到后面讲,它跑出来的东西正好是后面那节的论据。

它凭什么这么便宜


这个价格是从架构上把成本结构整个重算了一遍得来的,改了四个地方。

注意力换成GDN+QSA的混合架构,48层网络里每4层是3个GDN加1个QSA,GDN负责把历史信息持续压缩进一个固定大小的状态,QSA那一层保留全局注意力做精确检索(官方的说法是「GDN负责高效记住,QSA负责精准查找」)。数字是有的:1M token的超长上下文下,注意力计算核心在Prefill和Decode阶段分别提速最高7.6倍和4.9倍;在贴近线上真实场景的90%缓存命中设定下,1M上下文的Prefill吞吐是Qwen3.7-Plus的8.6倍。

残差连接从传统Transformer的一条主通道拆成四条,加了动态门控决定每条通道读写什么。这个我理解起来最费劲,大概意思是模型内部传信息的车道变多了,还能自己挑道走,训练的时候也更稳。

Embedding外挂了51B参数的N-gram Embedding,2000万条bigram和trigram挂在第2层,走的是查表逻辑不参与实际计算,所以可以卸载到主机内存里,不占GPU显存。

优化器换成Muon,纯训练侧的改动,跟你用起来的体感没关系,但决定了训练成本能不能真降下来。技术报告里有个数字我觉得比「降本九成」更能说明问题:全量训练没有出现过一次loss尖峰,也没有梯度范数的异常波动,而且没依赖qk-clip、SwiGLU-clip这类显式裁剪手段。训练这个量级的模型,loss突然飙起来然后回滚checkpoint重来是很常有的事,每一次都是真金白银烧出去,一次都没崩,这本身就是成本控制的一部分。

四件事拼起来的结果,技术报告里算得很清楚:相比397B的上一代旗舰,这次用了1/3的激活参数、1/3的训练token、大约1/9的训练算力。所谓训练成本降九成,指的就是这个1/9。

还有个细节挺有意思,他们测自己模型的编程能力,用的评测框架是Claude Code,SWE-bench Pro那几项的脚注写得明明白白,其中一项的裁判还是GPT-5.4。拿对手的工具和对手的模型来给自己判卷,倒是挺敢的。

便宜这件事,正在从算术题变成心智题

到这我们已经知道它便宜、快、够强了。但性价比这道题该换个问法:agent时代一次任务背后是几十上百次调用,上面那个数据分析就调了190次工具,真正该问的是跑完整套流程一共花多少钱、多少时间。

还有一件不太容易被塞进价格表的事——一口价意味着你不用在心里装一张时刻表,不用为了省钱把工作节奏往凌晨挪。当然一口价不是承诺,是一个状态:DeepSeek从一口价改成峰谷只隔了十几天。这份价目表能在墙上贴多久,取决于训练成本降九成、6B激活这些东西撑不撑得住;真涨价了权重是开源的,换门也就是改一行配置。

昨晚发Flash的不止阿里。智谱同一晚也甩出了GLM-5.3-Flash(代号「牛来」),Artificial Analysis智能指数57分、跟Claude Opus 4.8打平,价格也压得很狠。挺能打,测评还没出来,我把参数摆一起就有点数了——GLM-5.3-Flash是320B总参、18B激活,Qwen3.8-Flash是125B/6B,总参数是它的两倍半,每吐一个token要动的参数是它的整整三倍。价钱几乎打平,可它背后烧的算力是阿里的好几倍,这更像是亏本赚吆喝。再想想智谱这次是靠十万张国产卡扛起来的,算力本就不算宽裕。低价能挂出来是一回事,能不能让所有人敞开了、天天用又是另一回事。阿里这边不一样,算力是它的老本行——所以这个价这能让量大管饱用起来。

说到开源,我那第三个活正好就是干这个的。

我让它写一份关于Qwen在开源世界影响力的深度研究报告。注意这个设定:让Qwen自己写一份关于Qwen的报告。用的skill是我最近在攒的huashu-report。


它跑了三个小时,中间自己起了十几个subagent分头调研,交回来一份36页的研报:33张Exhibit连续编号,62条核心数据每条都标了口径、样本量、出处和时点,底下压着258条一手采集记录。写完自己又派了两路独立审校agent核事实和文风。

密度和排版是投行研报那个样子的,看图就知道了。

三个活放一起,我的判断是:这个模型在办公、数据分析、研究报告这类任务上,只要给它一个像样的harness,再配一套趁手的skill,表现已经是顶级的了。

它算出来的数字里有一条正好用在这儿:阿里的闭源旗舰Qwen3.8-Max和开源版Qwen3.8-2.4T-A95B,在Artificial Analysis的智能指数上是一模一样的58分——美国最强闭源和最强开源差21分。还有个小细节:这个模型在HuggingFace上的架构标识符直接就叫qwen4_exp,所谓「Qwen4架构的提前预演」,代码里就是这么写的。

你现在能在哪些地方用上它

写到这该落地了。目前有四个入口,按门槛从低到高排:

一、千问办公。这是绝大多数人真正会接触到这个模型的方式,今早我一打开就弹了这个:


不用申请key,不用配环境,你甚至感觉不到自己在用哪个模型,想做份周报或者一版PPT,它就给你做出来了,而且挺快。前面聊的架构、跑分、每百万token多少钱,落到普通用户这里就剩这一句。

二、千问AI平台的API。生产版Qwen3.8-Flash跑在这上面,默认1M上下文,带官方的内置工具调用。

三、阿里云百炼。模型广场已经上架了Qwen3.8-Flash的卡片。这条路我要多说两句,因为它同时兼容OpenAI和Anthropic两套接口协议,意味着Claude Code、Codex这类agent工具直接就能接,官方描述里就写了这句,不是野路子。我昨晚这篇文章里所有的实测,就是拿Claude Code接上它跑的,190次工具调用、改文件、跑脚本、截图自检,整套工作流跟平时用Claude Code没任何区别,配置里把base URL和model换掉就行。这一点对我这种把agent工具当日常主力的人来说很重要,换模型的成本如果只是改一行配置,那「要不要试试新模型」这个决定就变得很轻,不用先在心里做一轮成本评估。

四、自己部署。Qwen3.8-Flash-Next的开放权重已经发在HuggingFace和魔搭社区,可以下载、微调、量化、二次开发。125B的模型你在自己电脑上大概率是跑不动的,但如果你在企业里做私有化部署,或者想在这个新架构上做点研究,这条路是通的。

最后

再回到那个倒班的帖子。

我不觉得便宜就意味着谁取代谁,真到了最难的那一档任务,该用贵的还是得用贵的,我自己也一样。但一个更现实的问题摆出来了:当大量日常的agent任务已经能被便宜模型高质量地完成,你还会让贵模型去承担所有请求吗?还会为了省这笔钱,去改一整个团队的作息吗?

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
美国媒体确认了:俄罗斯的一颗尖端间谍卫星向伊朗提供了情报,至少协助了伊朗部分对美军基地的精确打击行动

美国媒体确认了:俄罗斯的一颗尖端间谍卫星向伊朗提供了情报,至少协助了伊朗部分对美军基地的精确打击行动

吉刻新闻
2026-09-17 16:22:03
1955年授衔铁规:全军将帅一律剃胡!唯独5人破例,个个不简单

1955年授衔铁规:全军将帅一律剃胡!唯独5人破例,个个不简单

古渡观书
2026-09-18 23:27:57
卯兔人“天意难违”:9月20日,周日,有事即将要发生了

卯兔人“天意难违”:9月20日,周日,有事即将要发生了

匹夫来搞笑
2026-09-20 16:40:08
女性长期使用情趣用品,身体可能出现哪些不适?不少人缺乏认知

女性长期使用情趣用品,身体可能出现哪些不适?不少人缺乏认知

看世界的人
2026-08-07 09:22:50
33.2万!特斯拉新车突然上架,10月2日正式上市

33.2万!特斯拉新车突然上架,10月2日正式上市

芝麻科技讯官方号
2026-09-20 19:04:47
郁亮,出事了!

郁亮,出事了!

大佬灼见
2026-09-17 09:18:35
2026到2032房价预判:100万的房子,5年后还值多少钱

2026到2032房价预判:100万的房子,5年后还值多少钱

爱看剧的阿峰
2026-09-20 08:11:19
泽连斯基是人都傻了,当着整个欧洲的面,普京反手打出王炸

泽连斯基是人都傻了,当着整个欧洲的面,普京反手打出王炸

叶老四
2026-09-19 23:14:24
伤亡151.8万,俄罗斯为什么那么扛揍?

伤亡151.8万,俄罗斯为什么那么扛揍?

李未熟擒话2
2026-09-20 18:14:16
下馆子时,这4道菜千万别点,全是预制菜,老板自己都很少吃!

下馆子时,这4道菜千万别点,全是预制菜,老板自己都很少吃!

思思夜话
2026-09-17 10:06:23
10 月开始迎来转运黄金期,事业上扬财星高照!3 生肖苦日子到头,富贵可期

10 月开始迎来转运黄金期,事业上扬财星高照!3 生肖苦日子到头,富贵可期

情感事聊
2026-09-20 15:51:25
中美俄离婚率:美国2.4‰,俄罗斯高达4.4‰,中国的数据是多少

中美俄离婚率:美国2.4‰,俄罗斯高达4.4‰,中国的数据是多少

影孖看世界
2026-09-17 19:21:58
《炉石》"药丸"?网传傅首尔代言游戏:玩家破防开喷

《炉石》"药丸"?网传傅首尔代言游戏:玩家破防开喷

游民星空
2026-09-20 17:14:54
彩妆品牌Uhue将关闭旗舰店,产品外观设计曾陷“擦边”争议

彩妆品牌Uhue将关闭旗舰店,产品外观设计曾陷“擦边”争议

新京报
2026-09-20 15:03:12
2800枚核弹24小时待命,张召忠曾发出警告:一旦开战,无处可逃

2800枚核弹24小时待命,张召忠曾发出警告:一旦开战,无处可逃

究竟谁主沉浮
2026-09-18 15:58:54
山东省纪委监委最新通报

山东省纪委监委最新通报

山东经济广播
2026-09-20 18:43:18
王菲的姨妈在九华山出家36年!她近些年与王菲断了联系

王菲的姨妈在九华山出家36年!她近些年与王菲断了联系

细品名人
2026-09-20 07:14:29
亚运会尴尬频出!中国射击队因酒店太远放弃开幕式...泰国运动员吐槽吃不饱;韩国运动员发文“救救我们”

亚运会尴尬频出!中国射击队因酒店太远放弃开幕式...泰国运动员吐槽吃不饱;韩国运动员发文“救救我们”

新民周刊
2026-09-19 18:28:23
CBA传来好消息!前NBA后卫有望加盟上海男篮,北京首钢外援阵容全部确定

CBA传来好消息!前NBA后卫有望加盟上海男篮,北京首钢外援阵容全部确定

慢歌轻步谣
2026-09-20 14:51:47
一个逼退位,一个要夺权,郑丽文终于不给内鬼面子了:有惊人发言

一个逼退位,一个要夺权,郑丽文终于不给内鬼面子了:有惊人发言

夏目历史君
2026-09-19 20:52:25
2026-09-20 20:28:49
AI进化论花生 incentive-icons
AI进化论花生
AI博主,AppStore付费榜第一的小猫补光灯app开发者
272文章数 129关注度
往期回顾 全部

科技要闻

谷歌承认:AI模型“黑”进3家公司

头条要闻

"失独"母亲58岁生子60岁再诞一女:希望孩子能有个伴

头条要闻

"失独"母亲58岁生子60岁再诞一女:希望孩子能有个伴

体育要闻

游泳2小时6金!亚运金牌榜:中国11金领跑

娱乐要闻

许嵩刚官宣结婚,冯禧黑历史就被扒

财经要闻

民企土地 被政府"无偿收储"后转手卖7亿

汽车要闻

FREELANDER神行者8开启交付 首批新车正式交付用户

态度原创

时尚
本地
亲子
数码
公开课

关上浴室门,把世界留在门外。

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

亲子要闻

十件事看透孩子的心理!

数码要闻

AMD Venice性能测试公布:碾压至强6980P与英伟达Vera

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版