网易首页 > 网易号 > 正文 申请入驻

比Opus4.6强,比V4 Flash便宜!Qwen3.8-Flash到底怎么样?

0
分享至

早上在群里刷到个截图,看得我有点乐

这是V2EX上一个帖子,标题叫《我们开始倒班考勤了》。


发帖人说因为几家大模型都开始搞高峰期token翻倍,公司为了省token成本,本周起改考勤:非周末休息一天,周末再休息一天,可自由组合,但要提前排班;工作日午休也推到14点以后。

也真不知道该说他们公司足够AI Native还是特么太抠门呢。不过,现在智能的价格确实还不够便宜,至少DeepSeek的几次价格调整,确实会让很多人有很明显的账单价格变化的体感。然后,还好,国内几家头部大厂和大模型公司够卷的,我们很快等来了更好的模型和更低的价格。

Qwen3.8-Flash来了

昨晚阿里发了Qwen3.8-Flash,我把两家的价目表拉到一起看了一遍。


Qwen3.8-Flash上线千问AI平台的API价格是每百万token输入0.8元、输出2.7元,缓存命中0.1元,一口价,官方原文通篇没有峰谷、没有忙时闲时、没有阶梯。DeepSeek这边V4-Flash的输出是空闲4.5元、高峰9元,V4-Pro空闲13.5元、高峰27元,高峰时段是周一到周五的9点到12点、14点到18点,其余时间价格减半。

顺手换算一下量级——一亿token的输入,走Qwen3.8-Flash是80块;同样的量走Claude Opus 4.6的API,是500美元。3.8-Flash命中缓存只要10块,算是同类模型中的最低价格了。

现在X上很喜欢管这叫「斩杀线」。Qwen3.8-Flash确实把这条线又往下推了一格。


不过便宜归便宜,性能到底行不行?

那性能呢

8月26日晚上发布的是Qwen3.8-Flash,同步开源了权重版Qwen3.8-Flash-Next(同一个模型,Next指的是下一代架构)。官方放了两张对比表,对照组是自家的Qwen3.8-27B、上一代Qwen3.7-Plus,加上DeepSeek-V4-Flash和Claude Opus 4.6。



挑几个我觉得你会关心的:智能体编程的SWE-bench Pro,62.5比53.4,领先Opus 4.6九分;专业工作任务JobBench,55.7比36.6,差了19分;模拟手机操作的AndroidWorld,84.5比62.0,差22.5分;用视觉推理解数学题的MathVision差25.1分;具身智能ERQA差31.5分。长程任务CoWorkBench和真实工具调用Toolathlon这两项比的是DeepSeek-V4-Flash,也都赢了(Toolathlon只领先3.2分,幅度不大)。

不过我觉得更有趣的还不是这些分数,是表头那一行写的参数量:Qwen3.8-Flash-Next是125B总参数、6B激活,DeepSeek-V4-Flash是284B总参数、13B激活,自家上一代Qwen3.7-Plus是397B总参数、17B激活。

总参数不到DeepSeek那个的一半,每次干活只激活60亿参数,大概是它自己总参数的二十分之一。分数、价格、参数量这三件事放一起看,才是这次发布真正想说的那件事。

我拿它跑了一晚上真活

跑分这东西你我大概都知道是怎么回事,所以昨晚23点API一开放(发布文里写的还是「即将上线」),我直接把它接进Claude Code,甩了三个真活过去。


第一个是数据分析。

我让接了Qwen3.8-Flash 的cc调用Huashu-Excel skill去分析一份真实数据,B站「每周必看」榜单,要求评估:什么样的视频能上榜、互动数据有什么规律、该押哪些区。数据里我埋了坑,期数大量缺失、互动极端右偏、官方口径中途变过一次。


它干了一个半小时,190次工具调用,HTML、docx、xlsx、deck四种格式全交付了。但最值得说的是它开工后干的头一件事——它发现任务书和数据文件对不上:任务书写5,324行×32列,实际是7,427行×33列。它没装没看见,把两份数字摆在一起声明以文件为准,又去核了官方接口确认口径。从数据清洗、处理到最后的分析和呈现,基本上完全符合我这个数据分析skill的设定和预期,我甚至很难看出它和我平时用的Opus5的表现有什么差异。

第二个是让它给自己画张架构图。

我的要求很简单:你的新架构今晚要公布,用一张图把GDN+QSA混合注意力、门控残差、N-gram Embedding、Muon优化器这四件事讲清楚,讲给一个懂AI但没空看论文的人听。


15分31秒,32次工具调用,交回来一个29KB的单文件网页,参数构成条能点,四个技术点各一张可折叠卡片。那32次里有7次是它自己截图自检——发现画的SVG有个标签戳出边框,改完再截一张确认干净才说交付。

图里的关键数字我抽查了几个拿去跟技术报告对,全部命中,没有编。

一个半小时和15分钟。从变现来说,这个模型在真实任务里已经非常接近一个靠谱的分析师和研究员了。

第三个活我放到后面讲,它跑出来的东西正好是后面那节的论据。

它凭什么这么便宜


这个价格是从架构上把成本结构整个重算了一遍得来的,改了四个地方。

注意力换成GDN+QSA的混合架构,48层网络里每4层是3个GDN加1个QSA,GDN负责把历史信息持续压缩进一个固定大小的状态,QSA那一层保留全局注意力做精确检索(官方的说法是「GDN负责高效记住,QSA负责精准查找」)。数字是有的:1M token的超长上下文下,注意力计算核心在Prefill和Decode阶段分别提速最高7.6倍和4.9倍;在贴近线上真实场景的90%缓存命中设定下,1M上下文的Prefill吞吐是Qwen3.7-Plus的8.6倍。

残差连接从传统Transformer的一条主通道拆成四条,加了动态门控决定每条通道读写什么。这个我理解起来最费劲,大概意思是模型内部传信息的车道变多了,还能自己挑道走,训练的时候也更稳。

Embedding外挂了51B参数的N-gram Embedding,2000万条bigram和trigram挂在第2层,走的是查表逻辑不参与实际计算,所以可以卸载到主机内存里,不占GPU显存。

优化器换成Muon,纯训练侧的改动,跟你用起来的体感没关系,但决定了训练成本能不能真降下来。技术报告里有个数字我觉得比「降本九成」更能说明问题:全量训练没有出现过一次loss尖峰,也没有梯度范数的异常波动,而且没依赖qk-clip、SwiGLU-clip这类显式裁剪手段。训练这个量级的模型,loss突然飙起来然后回滚checkpoint重来是很常有的事,每一次都是真金白银烧出去,一次都没崩,这本身就是成本控制的一部分。

四件事拼起来的结果,技术报告里算得很清楚:相比397B的上一代旗舰,这次用了1/3的激活参数、1/3的训练token、大约1/9的训练算力。所谓训练成本降九成,指的就是这个1/9。

还有个细节挺有意思,他们测自己模型的编程能力,用的评测框架是Claude Code,SWE-bench Pro那几项的脚注写得明明白白,其中一项的裁判还是GPT-5.4。拿对手的工具和对手的模型来给自己判卷,倒是挺敢的。

便宜这件事,正在从算术题变成心智题

到这我们已经知道它便宜、快、够强了。但性价比这道题该换个问法:agent时代一次任务背后是几十上百次调用,上面那个数据分析就调了190次工具,真正该问的是跑完整套流程一共花多少钱、多少时间。

还有一件不太容易被塞进价格表的事——一口价意味着你不用在心里装一张时刻表,不用为了省钱把工作节奏往凌晨挪。当然一口价不是承诺,是一个状态:DeepSeek从一口价改成峰谷只隔了十几天。这份价目表能在墙上贴多久,取决于训练成本降九成、6B激活这些东西撑不撑得住;真涨价了权重是开源的,换门也就是改一行配置。

昨晚发Flash的不止阿里。智谱同一晚也甩出了GLM-5.3-Flash(代号「牛来」),Artificial Analysis智能指数57分、跟Claude Opus 4.8打平,价格也压得很狠。挺能打,测评还没出来,我把参数摆一起就有点数了——GLM-5.3-Flash是320B总参、18B激活,Qwen3.8-Flash是125B/6B,总参数是它的两倍半,每吐一个token要动的参数是它的整整三倍。价钱几乎打平,可它背后烧的算力是阿里的好几倍,这更像是亏本赚吆喝。再想想智谱这次是靠十万张国产卡扛起来的,算力本就不算宽裕。低价能挂出来是一回事,能不能让所有人敞开了、天天用又是另一回事。阿里这边不一样,算力是它的老本行——所以这个价这能让量大管饱用起来。

说到开源,我那第三个活正好就是干这个的。

我让它写一份关于Qwen在开源世界影响力的深度研究报告。注意这个设定:让Qwen自己写一份关于Qwen的报告。用的skill是我最近在攒的huashu-report。


它跑了三个小时,中间自己起了十几个subagent分头调研,交回来一份36页的研报:33张Exhibit连续编号,62条核心数据每条都标了口径、样本量、出处和时点,底下压着258条一手采集记录。写完自己又派了两路独立审校agent核事实和文风。

密度和排版是投行研报那个样子的,看图就知道了。

三个活放一起,我的判断是:这个模型在办公、数据分析、研究报告这类任务上,只要给它一个像样的harness,再配一套趁手的skill,表现已经是顶级的了。

它算出来的数字里有一条正好用在这儿:阿里的闭源旗舰Qwen3.8-Max和开源版Qwen3.8-2.4T-A95B,在Artificial Analysis的智能指数上是一模一样的58分——美国最强闭源和最强开源差21分。还有个小细节:这个模型在HuggingFace上的架构标识符直接就叫qwen4_exp,所谓「Qwen4架构的提前预演」,代码里就是这么写的。

你现在能在哪些地方用上它

写到这该落地了。目前有四个入口,按门槛从低到高排:

一、千问办公。这是绝大多数人真正会接触到这个模型的方式,今早我一打开就弹了这个:


不用申请key,不用配环境,你甚至感觉不到自己在用哪个模型,想做份周报或者一版PPT,它就给你做出来了,而且挺快。前面聊的架构、跑分、每百万token多少钱,落到普通用户这里就剩这一句。

二、千问AI平台的API。生产版Qwen3.8-Flash跑在这上面,默认1M上下文,带官方的内置工具调用。

三、阿里云百炼。模型广场已经上架了Qwen3.8-Flash的卡片。这条路我要多说两句,因为它同时兼容OpenAI和Anthropic两套接口协议,意味着Claude Code、Codex这类agent工具直接就能接,官方描述里就写了这句,不是野路子。我昨晚这篇文章里所有的实测,就是拿Claude Code接上它跑的,190次工具调用、改文件、跑脚本、截图自检,整套工作流跟平时用Claude Code没任何区别,配置里把base URL和model换掉就行。这一点对我这种把agent工具当日常主力的人来说很重要,换模型的成本如果只是改一行配置,那「要不要试试新模型」这个决定就变得很轻,不用先在心里做一轮成本评估。

四、自己部署。Qwen3.8-Flash-Next的开放权重已经发在HuggingFace和魔搭社区,可以下载、微调、量化、二次开发。125B的模型你在自己电脑上大概率是跑不动的,但如果你在企业里做私有化部署,或者想在这个新架构上做点研究,这条路是通的。

最后

再回到那个倒班的帖子。

我不觉得便宜就意味着谁取代谁,真到了最难的那一档任务,该用贵的还是得用贵的,我自己也一样。但一个更现实的问题摆出来了:当大量日常的agent任务已经能被便宜模型高质量地完成,你还会让贵模型去承担所有请求吗?还会为了省这笔钱,去改一整个团队的作息吗?

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
越南榴莲造假闯下大祸,副总理赶到南宁,请中国再给他们一次机会

越南榴莲造假闯下大祸,副总理赶到南宁,请中国再给他们一次机会

清衣渡a
2026-09-19 22:49:18
越南没想到,朝鲜也没想到,如今的中国甘肃省,已成全球焦点

越南没想到,朝鲜也没想到,如今的中国甘肃省,已成全球焦点

离离言几许
2026-09-20 15:59:18
徐彬不成功的留洋,会带给王钰栋什么样的思考

徐彬不成功的留洋,会带给王钰栋什么样的思考

米奇兔
2026-09-20 16:40:24
悲催!考上全县最好高中,多次宿舍吸烟被勒令退学,少年:我没哭,看到父母求人破防了

悲催!考上全县最好高中,多次宿舍吸烟被勒令退学,少年:我没哭,看到父母求人破防了

火山詩话
2026-09-20 12:22:27
卖人赚钱两不误!布莱顿3-0完胜阿森纳,体系足球的极致胜利

卖人赚钱两不误!布莱顿3-0完胜阿森纳,体系足球的极致胜利

星耀国际足坛
2026-09-20 16:14:16
荷兰头号通缉犯没跑没藏,直接“买”下一个国家,谁都带不走他

荷兰头号通缉犯没跑没藏,直接“买”下一个国家,谁都带不走他

英国那些事儿
2026-09-19 23:16:22
如果中国不让步,就驱逐中方外交官!日本话音刚落,空军王炸登场

如果中国不让步,就驱逐中方外交官!日本话音刚落,空军王炸登场

安珈使者啊
2026-09-18 09:57:19
美媒爆猛料!最神秘无人机中队87次侵入侦察,到中国就有来无回!

美媒爆猛料!最神秘无人机中队87次侵入侦察,到中国就有来无回!

影孖看世界
2026-09-19 23:14:11
女子怀疑医生在其子宫装监听器,手机一放歌就异常!两次告上法庭

女子怀疑医生在其子宫装监听器,手机一放歌就异常!两次告上法庭

砚田文化
2026-09-18 08:34:48
广州一栋60年老楼被鉴定为危房,街道挨家挨户协商后,业主决定自筹资金,在原地址重建带电梯的新房

广州一栋60年老楼被鉴定为危房,街道挨家挨户协商后,业主决定自筹资金,在原地址重建带电梯的新房

极目新闻
2026-09-20 14:14:57
60厘米“超长蛋挞”刷屏网络 医生警告:这5类人别凑热闹

60厘米“超长蛋挞”刷屏网络 医生警告:这5类人别凑热闹

闪电新闻
2026-09-20 17:09:45
日本百岁老人数量破10W,长寿原因竟是爱喝冷水?研究:体温降0.5℃,寿命延长20%

日本百岁老人数量破10W,长寿原因竟是爱喝冷水?研究:体温降0.5℃,寿命延长20%

时光派长寿观察
2026-09-17 17:09:48
大批70后已陷入“停滞式生活”:拼不动、退不了,只剩硬熬

大批70后已陷入“停滞式生活”:拼不动、退不了,只剩硬熬

三农老历
2026-09-18 00:10:08
武大诬告事件女主杨某媛西班牙读博被网友扒出,后续发展看爽我了

武大诬告事件女主杨某媛西班牙读博被网友扒出,后续发展看爽我了

浪花妈妈
2026-09-19 22:18:14
伊议长:伊朗条件得到满足前霍尔木兹海峡将保持关闭

伊议长:伊朗条件得到满足前霍尔木兹海峡将保持关闭

新京报
2026-09-20 14:52:13
“定位是假的,储物空间是没有的,刹车打滑”:近3000位车主吐槽他们的上班接娃买菜“搭子”,品牌方最新回应

“定位是假的,储物空间是没有的,刹车打滑”:近3000位车主吐槽他们的上班接娃买菜“搭子”,品牌方最新回应

都市快报橙柿互动
2026-09-19 01:03:32
永别了,娱乐圈的“三聚氰胺”!

永别了,娱乐圈的“三聚氰胺”!

断翼的鸟儿
2026-09-18 14:22:10
莫斯科遭大规模无人机袭击 2人死亡

莫斯科遭大规模无人机袭击 2人死亡

闪电新闻
2026-09-20 13:47:55
施一公动真格!西湖大学教师必须全职在岗,校外兼职一律禁止,学校的科研评价机制值得其他学校学习!

施一公动真格!西湖大学教师必须全职在岗,校外兼职一律禁止,学校的科研评价机制值得其他学校学习!

凯旋学长
2026-09-20 15:22:04
54岁黎姿近况曝光!参加公司董事会议,一副女强人打扮气场很强,脸部有科技既视感

54岁黎姿近况曝光!参加公司董事会议,一副女强人打扮气场很强,脸部有科技既视感

小徐讲八卦
2026-09-20 07:23:16
2026-09-20 19:00:49
AI进化论花生 incentive-icons
AI进化论花生
AI博主,AppStore付费榜第一的小猫补光灯app开发者
272文章数 129关注度
往期回顾 全部

科技要闻

谷歌承认:AI模型“黑”进3家公司

头条要闻

中国男篮铜牌战不敌伊朗男篮 创下12年来最差亚运战绩

头条要闻

中国男篮铜牌战不敌伊朗男篮 创下12年来最差亚运战绩

体育要闻

2026亚运会开幕式 胡明轩吴愉担任旗手

娱乐要闻

许嵩刚官宣结婚,冯禧黑历史就被扒

财经要闻

民企土地 被政府"无偿收储"后转手卖7亿

汽车要闻

FREELANDER神行者8开启交付 首批新车正式交付用户

态度原创

旅游
时尚
游戏
数码
本地

旅游要闻

光影节黄浦重磅新玩法!和夜鹭一起垂钓,还能玩转130米电信大楼!

关上浴室门,把世界留在门外。

《漫威金刚狼》开发者称结局为变种人后续铺路

数码要闻

OPPO Watch S2手表搭载ColorOS Watch 17,支持心率投屏到手机

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

无障碍浏览 进入关怀版