网易首页 > 网易号 > 正文 申请入驻

阿里动真格,大模型新的“斩杀线”出现了

0
分享至

大模型圈有一个心照不宣的潜规则:能力最强的模型,永远是用不起的那个。

GPT-4刚出来那会儿,开发者圈流行一句话:“调用之前先算一下这道题值多少钱”。

一道复杂推理题跑下来,几美元就没了。企业级接入更夸张,一个月API账单能烧掉一个初创团队的季度预算。

不是没人想过办法。量化、蒸馏、小模型微调、MoE架构,各路招数轮番上阵,目标只有一个:把旗舰能力的成本打下来。

但折腾来折腾去,效果总是差那么一口气,要么能力打折,要么稳定性不够,要么长上下文直接崩。

直到DeepSeek横空出世,行业第一次有了“斩杀线”这个说法。

但这条线,在8月26日晚被往上挪了一大截。

阿里千问团队发布Qwen3.8-Flash,同步开源。

千亿总参数,仅激活60亿,性能超越Claude Opus4.6;每百万Tokens输入1元、输出3元,价格最低至DeepSeek-V4-Flash 的三分之一。

这不是又一次常规的参数竞赛,而是大模型效率赛道上,一次真正意义上的“降维打击”。

01

旗舰级的能力,打到了“日常价”区间

先说清楚什么叫“斩杀线”。

它不是单纯的价格低。

真正的斩杀线,是把原本只有高价旗舰模型才能提供的能力,拉进多数开发者和企业都能长期使用的成本区间。

DeepSeek此前被社区公认为“模型斩杀线”,核心也不是便宜,而是它的出现迫使市场面对一个尖锐的问题:大家究竟愿意为相同水平的智能,付多少钱?

Qwen3.8-Flash把这个问题又往前推了一步。

先看性能。

这是一个多模态混合专家(MoE)模型,采用了与此前所有千问大模型完全不同的下一代(Next)架构——Transformer参125B,仅激活6B,整体表现超越Opus4.6、接近Opus4.8。

仅完成预训练的基座模型,在通用能力SuperGPQA、数学推理GSM8K、编程SWEBench-Pretrain等基础评测上,就已经超过了3倍其大小的Qwen3.7-Plus基座。

经后训练后,性能跃迁更为明显。

智能体编 SWE-bench Pro评测领先Opus4.6多达9.1分;长程专业任务CoWorkBench、真实工具调用Toolathlon Verified均超越DeepSeek-V4-Flash;专业工作任务JobBench智能体评测超出Opus4.6近20分。

多模态领域差距拉得更大。移动端智能体AndroidWorld高出22.5分,视觉推理MathVision 超出25.1分,具身智能 ERQA 领先31.5分。

再看价格。

每百万Tokens输入仅1元、输出3元,是Claude Opus4.6价格的3%,是DeepSeek-V4-Flash闲时价格的三分之二、忙时价格的三分之一。训练成本同样骤降近90%,性能与上一代 Qwen3.7-Plus接近,但仅用九分之一的资源便完成了训练。


图源:机器之心

旗舰级的能力,打到了“日常价”区间。

这直接动摇了一个行业默认假设:昂贵的企业级模型,是否还天然拥有企业的“默认调用权”?

大量日常的Agent任务已经能被低价模型高质量完成,企业就得做选择把贵模型留给少数极难任务,还是继续让它承担所有请求?

答案正在变得清晰。默认调用权不会永远属于最贵的那个,而会属于“够用且足够便宜”的那个。

02

Token 单价之外,那本没人算的账

但Qwen3.8-Flash真正的杀伤力,不只是把Token单价打下来了。

它在迫使行业重新定义“斩杀线”本身。

过去这条线怎么划?

很简单,看每百万Tokens多少钱。输入多少钱、输出多少钱,拉个表一比,谁便宜谁就是斩杀线。

DeepSeek就是这么赢的,同等能力档位,价格直接打到对手的零头。

但这个衡量标准,正在失效。

因为一次真实任务的成本,远不止API调用费。

过程中的等待时间是成本,失败后的重复调用是成本,多个Agent之间来回协同的轮次是成本,最后人工接管、逐条修正结果更是成本。

一个模型如果单价便宜但经常出错、需要反复重试,跑下来真实任务成本可能反而更高。

这就像打车,不能只看每公里单价,还得看等车时间、堵不堵车、绕不绕路。

单价最低的那辆车,如果每次都迟到、还得你自己走两公里,总成本未必划算。

所以斩杀线需要被重新定义,不再只是看Token单价,而是升级到任务总成本,即完成一件真实的工作,到底要花多少钱、多少时间、多少人力。

Qwen3.8-Flash的价值,正在于同时压低这几项隐性成本。

架构层面的革新是关键。

注意力方面,引入独特的QSA(Qwen Sparse Attention机制,与GDN高效融合形成混合注意力架构,在高缓存命中的1M Tokens长上下文实际场景中可提速8倍以上。

又准又快,直接压缩等待时间。

模型内部信息传递方面,自研的Gated Residual方法将传统Transforme的1条信息主通道拆分拓展为4条,让模型动态决定读写信息,信息传递更高效,训练也更稳定。

参数扩展方面更具巧思。引入51B的N-gram Embedding参数,为Transformer参数提供更高效的查表寻址,每次token计算时无需参与,以极少的资源消耗“外挂”了一个大规模的“记忆指南手册”。

模型结构和训练优化协同进行,收敛效率和训练吞吐大幅提升。

说人话就是:不仅单次调用便宜,而且完成任务的轮次更少、失败率更低、长上下文处理更快。

Qwen团队和“千问办公”团队还对模型和Harness框架做了协同联合优化,Agentic能力进一步提升。

在真实的智能体工作流里,它不只是“理论上强”,而是在实际调用链路里被调过、被磨过的。

大模型的斩杀线,正在从“每百万token值多少钱”,转向“每块钱最终能完成多少工作”。

上游硬件产业的竞争重点也会跟着变。

未来决定推理效率的,不只是GPU拥有多少FLOPS,还包括HBM的容量与带宽、CPU与GPU之间的互联速度、KV Cache 的管理效率,以及推理框架能否减少数据搬运。

大模型竞争正从单一的算力竞赛,走向模型架构、芯片、内存和推理系统的协同竞争。

03

越便宜,越费卡?

模型效率提高、单次调用成本下降,看起来行业需要的GPU会减少。

但更可能出现的,是类似“杰文斯悖论”的结果:单位使用成本越低,使用总量反而越大。

19世纪经济学家威廉・杰文斯观察到,煤炭使用效率提高后,煤炭的消耗量非但没有下降,反而大幅上升,这是因为效率提升降低了成本,刺激了更多场景的使用。

大模型正在重演这一逻辑。

过去由于成本限制,用户可能只让 I回答一个问题;现在人们已经逐渐习惯让Agent帮自己处理各种工作。

每次任务变得更便宜后,用户不会只节省原来的预算,反而会把AI部署到更多流程中。

单次任务消耗下降,但任务数量、调用轮次和上下文长度可能更快增长。

Qwen3.8-Flash 首发上线“千问办公”,“标准模式”内置该模型,可完成95%的日常办公任务;开发者和企业同时可通过千问AI平台获取新模型API服务。

一个能处理95%日常办公的模型,价格只有旗舰模型的3%,企业的理性选择不是减少AI使用,而是把AI铺进每一个还没被自动化的角落。

Qwen3.8-Flash对产业链的影响,可能不是减少算力需求,而是改变算力需求的结构:从集中于模型训练的大规模算力投入,进一步扩展到海量、持续、高并发的推理负载。

更便宜的模型不是GPU需求的终点,反而可能成为推理需求真正爆发的起点。

Next新架构据透露将是全新一代千问大模型Qwen4的雏形——Qwen3.8-Flash-Next模型权重已在Hugging Face、魔搭社区全面开源。

截至目前,Qwen3.8已开源发布2.4T参数量的Qwen3.8-Max、Qwen3.8-27B及Qwen3.8-Flash三大尺寸模型,Qwen模型全球下载量突破30亿次,衍生模型数超30万个。

斩杀线被一次次刷新的背后,是中国大模型在效率赛道上的集体突进。

大模型的终极竞争,从来不是谁能造出最聪明的模型,而是谁能让聪明变得足够便宜、足够普及。

一旦“又好又便宜”不再是矛盾,真正被改变的,是整个智能经济的成本结构以及所有还在为“智能溢价”买单的人。

智能的溢价,终有一天会被效率抹平。而抹平它的人,正在写下新的规则。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
25岁宝妈网贷38万,硬扛5年不还:不接电话、不回短信,出人意料

25岁宝妈网贷38万,硬扛5年不还:不接电话、不回短信,出人意料

小虎新车推荐员
2026-09-05 04:14:45
金晨游学被偶遇,鼻贴绷带素颜出镜,与孟佳同框状态松弛超接地气

金晨游学被偶遇,鼻贴绷带素颜出镜,与孟佳同框状态松弛超接地气

风月得自难寻
2026-09-04 11:40:03
NBA生涯最后一站?37岁乐福有望重回森林狼:双方有意开季前签约

NBA生涯最后一站?37岁乐福有望重回森林狼:双方有意开季前签约

罗说NBA
2026-09-05 06:05:56
千万千万不要翻长辈手机,网友:这将会颠覆这个人在你心中的形象

千万千万不要翻长辈手机,网友:这将会颠覆这个人在你心中的形象

夜深爱杂谈
2026-08-29 21:36:29
女生吐槽“家被哥嫂换了”,想住主卧遭网友群嘲:谁出钱谁说了算

女生吐槽“家被哥嫂换了”,想住主卧遭网友群嘲:谁出钱谁说了算

夜深爱杂谈
2026-09-04 18:36:10
解放军:赴俄演习,赴美加举办之会!

解放军:赴俄演习,赴美加举办之会!

新民周刊
2026-09-05 09:17:18
护照丢失,无缘世界杯!李月汝再次发声,态度明确,宫鲁鸣回应了

护照丢失,无缘世界杯!李月汝再次发声,态度明确,宫鲁鸣回应了

萌兰聊个球
2026-09-04 07:26:22
周末打虎!陈勇被查(附简历)

周末打虎!陈勇被查(附简历)

第一财经资讯
2026-09-05 10:35:03
局势紧张之际修国防动员法,18到60岁都要被征召?真相到底是什么

局势紧张之际修国防动员法,18到60岁都要被征召?真相到底是什么

琴琴有氧运动
2026-09-04 18:42:25
宁德时代曾毓群怒批:每天近3款新车上市,动力电池故障触目惊心

宁德时代曾毓群怒批:每天近3款新车上市,动力电池故障触目惊心

沙雕小琳琳
2026-09-04 17:52:45
曼联公布英超名单:梅努约罗“落选”真相揭晓,不影响出场

曼联公布英超名单:梅努约罗“落选”真相揭晓,不影响出场

星耀国际足坛
2026-09-04 23:37:59
皇马客场输球后,媒体要求穆帅谈论裁判表现,穆帅保持克制:不赞成黄牌

皇马客场输球后,媒体要求穆帅谈论裁判表现,穆帅保持克制:不赞成黄牌

福酱的小时光
2026-09-05 10:02:46
一些人表示:新闻联播都快看不懂了,里面出现了大量专业的新词汇

一些人表示:新闻联播都快看不懂了,里面出现了大量专业的新词汇

混沌录
2026-09-02 23:50:08
台湾问题即将突破临界点,2大迹象表明,大陆或要准备出手了

台湾问题即将突破临界点,2大迹象表明,大陆或要准备出手了

探索新高度
2026-09-04 07:38:25
燃气公司上门安检,根本不是查漏气!真正目的其实是这三件事

燃气公司上门安检,根本不是查漏气!真正目的其实是这三件事

阿离家居
2026-08-31 03:09:49
千万不要给孩子这种暗示:他会深信不疑的,并用一生时间去验证

千万不要给孩子这种暗示:他会深信不疑的,并用一生时间去验证

户外阿毽
2026-09-03 13:17:36
抖音主播码字的:郭德纲是我举报的,我是骨干,证据都是我提供的

抖音主播码字的:郭德纲是我举报的,我是骨干,证据都是我提供的

早起的鸟儿有饭吃
2026-09-03 02:08:06
“头一回上学是要自己买桌子的?”江苏东海县一小学家长群接龙:349元一套,自愿购买。

“头一回上学是要自己买桌子的?”江苏东海县一小学家长群接龙:349元一套,自愿购买。

听心堂
2026-09-05 07:26:47
元帅林彪的饮食习惯很特别,一年到头只爱吃三样,厨师不敢轻易更换

元帅林彪的饮食习惯很特别,一年到头只爱吃三样,厨师不敢轻易更换

文史季季红
2026-09-03 13:45:03
武大踢到铁板了!男博导被保护起来,小三女教授不止开除那么简单

武大踢到铁板了!男博导被保护起来,小三女教授不止开除那么简单

观史搜寻着
2026-09-05 12:03:44
2026-09-05 13:16:50
凤凰网财经 incentive-icons
凤凰网财经
离用户最近的财经媒体!
7841文章数 10240关注度
往期回顾 全部

科技要闻

华为何庭波,再次更新韬定律论文

头条要闻

牛弹琴:164国赞成只有美国1票反对 世界地图要变了

头条要闻

牛弹琴:164国赞成只有美国1票反对 世界地图要变了

体育要闻

小卡来去10首轮,快船7年彩礼一场空

娱乐要闻

她曾被名导抛弃,凭《生逢其时》翻红

财经要闻

姚洋:刺激消费要守住两个“大西瓜”

汽车要闻

全新第四代博越Li‑HEV系列 怎么开都省

态度原创

艺术
房产
家居
健康
公开课

艺术要闻

2026潮涌宁波—第六届综合材料绘画展 入选作品选(二)

房产要闻

TOP10房企卖了350亿!海南楼市,最新榜单出炉!

家居要闻

2026建博会(广州) 公装联探展交流活动

脑梗取栓成功≠活下来,还有这三关

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版