网易首页 > 网易号 > 正文 申请入驻

Qwen3.8-27B就是新的模型斩杀线

0
分享至

最能动手折腾模型的开源社区开发者,往往也是最会玩梗造概念的一群人。最近半年,他们最爱的一个概念是“斩杀线”。

这个词借自游戏,后来在更广泛的场合里变得更加流行。它原指血量落到某个数字以下,对手下一回合就能把你带走,比赛实际上已经提前结束。

把它套到模型上,过往一段时间人们指代的是 DeepSeek 一直在扮演的角色:一个新模型出来,先和 DeepSeek 比能力,再比价格。如果性能上不去、价格又降不下来,发布当天基本就失去了讨论价值。

从 R1 开始,DeepSeek 一度成为模型世界默认的那条线。

但现在,这条线看起来要换人了。

8月14日,Qwen3.8-27B 发布,开源两天下载量破百万,登顶 Hugging Face 全球趋势榜,编程 Agent 工具 Cline 的开发者里,它只用四天就成了被选择最多的本地模型。Artificial Analysis 的 Intelligence Index 给了它 52 分,已经进入 GPT-5.6 Luna、DeepSeek V4 Flash 这一档模型所在的区间。开发者给它起了一个更直白的外号:

“本地 Opus 4.6”。

当然,这个模型还是一个进化中的模型,一个综合 benchmark 的接近,不能直接等同于真实体验完全追平 Claude Opus 4.6。在 Terminal-Bench、HLE 等高难度任务上,Qwen3.8-27B 仍然存在差距。

另外,在很多评测里,它还有一个很突出的特点:特别能“想”,很多任务会生成远多于同类模型的 reasoning token,用时间换能力——Simon Willison 实测时,默认推理档让它画一只骑自行车的鹈鹕 SVG,它想了 21 分钟。

不过这些都没有改变真正重要的地方:

它只有 270 亿参数。

这意味着,几个月前还需要数百亿、数千亿乃至更大规模模型才能稳定达到的能力区间,现在第一次被压进一个消费级硬件真正有机会容纳的尺寸。

而在4-bit 量化之后,模型权重可以压到 17GB 左右。一张 24GB 级显卡已经进入可以部署它的范围;拥有较大统一内存的 Apple Silicon 设备也能运行。当然,17GB 的权重不等于 17GB 内存就够了。真正运行还要给 KV Cache、上下文、视觉组件和运行时留空间,长上下文尤其吃内存。但事实上,重要的边界已经跨过去了。

过去,本地模型经常面临一个尴尬:跑得动的不够聪明,够聪明的跑不动。Qwen3.8-27B 第一次让这两件事情在一个非常有现实意义的尺寸上碰到了一起。

所以从现在开始,任何新发布的,不只是小尺寸的模型,甚至包括DeepSeek等模型在内,都会被开发者拿来先问一个问题:

比 Qwen3.8-27B 怎么样?

过不了这一关,很难再有讨论的价值。这就是新的斩杀线。



1

由DeepSeek 定义的上一条斩杀线,最重要的武器其实是性价比。

旗舰模型的能力,以 Flash 级的价格卖出来。开发者第一次意识到,顶级智能未必意味着昂贵 API。

但这套性价比仍然建立在云端。模型放在数据中心,开发者按 token 购买使用权。单价可以不断降低,只要 Agent 开始长时间工作,token 消耗仍然会持续累积——一个 Coding Agent 读代码库、改代码、跑测试、再修改,一项任务产生几十万 token 已经越来越常见。国内日均 token 调用量已经站上 140 万亿,比 2024 年初增长超过千倍。

而且单价也未必一直往下走。8月中,DeepSeek 完成了成立以来幅度最大的一轮提价,V4-Pro 高峰时段的输出价格从每百万 token 6 元调到 27 元,同步引入峰谷计费,智谱和 Kimi 此前也已相继调价。如果你的线画在报价单上,那就注定会跟着报价单移动。

也就是说,过去两年模型公司的竞争,基本是在回答:同样的智能,谁的 token 更便宜?但Qwen3.8-27B 把问题推进了一步:同样的智能,究竟需要多大的模型?

这是两种完全不同的效率。一个千亿参数模型便宜 30%,依然要住在数据中心里;一个 27B 模型如果能够完成过去千亿级模型才能完成的大部分工作,它改变的是模型部署的物理边界。

过去半年,行业所谓的“斩杀线”仍然大致锚在千亿级甚至更大的模型上。今天,参数规模缩到了 270 亿,智能水平却进入了上一代千亿级旗舰所在的区间。参数量缩了接近一个数量级,智能没有跟着掉一个数量级。

模型竞争因此出现了一个越来越重要的指标:智能密度。

每十亿参数究竟能装下多少能力?做到同样一件事情,需要多少显存、多少内存带宽、什么级别的机器?这些问题过去是模型评测的配角,现在正在走到前台。

原因也不复杂。对绝大多数真实任务而言,智能正在逐渐从稀缺走向过剩。其实我们今天大部分的真实 AI 任务,真正的瓶颈已经不是模型够不够聪明,而是这么聪明的模型能不能足够便宜、足够快、足够容易地跑起来。

企业知识库不需要解决 IMO,会议纪要用不上世界最强的推理模型,大量代码修改、信息抽取和后台 Agent 同样如此。模型能力达到某个阈值以后,再多五分 benchmark,对大量产品已经没有前五十分那么重要;但如果同样的能力从 200GB 显存降到 24GB,产品形态会直接改变。

Qwen3.8-27B 斩掉了这道硬件门槛。

2

Qwen3.8-27B 能力突破背后的原因,其实也不只是简单的“模型越来越强”能概括的。

过去两年,为了让大模型更便宜,行业最成功的一条技术路线是 MoE,混合专家。它的办法很好理解:模型里养很多“专家”,一次任务只叫其中一部分出来工作。这样可以把模型总容量做得很大,同时控制一次推理实际需要的计算量。DeepSeek 把这条路线推到了很高的位置。

但 MoE 有一个在云端不明显、到了个人设备上却很麻烦的问题,就是专家不工作,不代表专家不存在。模型的总权重仍然需要被存储,驻留在显存和内存里,或者在层级存储之间高效调度。稀疏激活可以大幅降低每个 token 的计算量,却不会让一个数千亿总参数的模型凭空缩成 20GB。

所以 MoE 特别适合数据中心——几十张甚至几百张 GPU 共同承载一个巨大的模型,再用稀疏激活降低推理成本。到了 PC、机器人、汽车和边缘设备,另一件事变得更重要:模型本身能不能放得下。

Qwen3.8-27B 是一个稠密模型。这意味着它没有 MoE 那种依靠大量闲置专家换容量的空间,效率必须从架构本身一点一点抠出来。

Qwen 在这一代继续使用混合注意力结构:64 层里 48 层是线性注意力,其余保留传统全注意力。线性注意力的一项重要价值,是长上下文运行时不需要像纯 Transformer 那样让 KV Cache 随序列长度不断膨胀;保留部分全注意力层,又避免完全牺牲模型回看细节和复杂上下文的能力。这是典型的工程取舍,在能力、显存和长上下文成本之间找平衡。

MTP,也就是 Multi-Token Prediction,解决另一个问题。大模型通常一个 token 一个 token 往外吐,本地推理很容易被串行解码速度卡住。MTP 让模型具备一次预测多个未来 token 的能力,配合 speculative decoding 提高生成吞吐。在云端,这可能只是又一项优化;在本地,它直接影响一个模型究竟是能启动还是真的能用起来。

此外,它还有原生视觉能力,Qwen3.8-27B 可以直接处理图像和视频,很多场景里不必再外挂一套视觉模型。

这几项技术单独拿出来都不是突然出现的新发明。真正困难的是把它们同时塞进一个 27B 稠密模型里,然后仍然维持足够高的智能。

这件事情显然也不是 Qwen 到 3.8 才突然想明白的。

3

回头看 Qwen 过去三年的路线,会发现 Qwen3.8-27B 并不是一次偶然命中。

2023 年 8 月,Qwen 第一批开源模型发布的时候,全世界的聚光灯还在 Llama 身上。几个月后,Qwen 同时放出了 72B 和 1.8B。

这个细节现在回头看很重要。也就是Qwen从第一年开始,小模型就不是旗舰模型旁边顺手附送的缩水版,而是它开源路线的一部分。

到了 Qwen2,参数尺寸进一步从 0.5B 一路铺到 72B;Qwen2.5 延续同样的做法;后来 QwQ-32B 又用 32B 这个尺寸专门挑战当时最热门的 reasoning 模型。这几年 Qwen 的产品线一直有一个非常鲜明的特点:尺寸特别全。大模型、小模型,Dense、MoE,通用、Coding、数学、视觉,不断往同一套模型体系里填。

这条路线在相当长一段时间里并不显眼。模型行业最容易获得关注的永远是那个最大的型号和榜单第一,尤其 DeepSeek R1 爆发以后,开源模型的叙事几乎完全被 DeepSeek 接管。Qwen 做的事情显得没那么性感:继续发模型,继续填尺寸,继续让开发者量化、微调、魔改。

但今天这件事情开始产生复利。

Hugging Face 今年的开源生态报告专门把 Qwen 拿出来讨论:Qwen 已经产生超过 15 万个明确的衍生模型,如果计算所有带有 Qwen 标签的模型仓库,数量超过 20 万;今年 Qwen 系列的下载量超过 30 亿次,超过 Google 和 Meta 的总和。报告同时观察到一个很重要的趋势:小模型的下载和实际部署量远高于超大型模型。原因很简单,绝大多数开发者并没有一个数据中心。



这解释了 Qwen 为什么会走到今天这个位置。

长期做小模型,积累的并不只是“怎么把参数砍掉”。训练数据怎么配,什么能力缩模型后最容易丢,教师模型和学生模型之间,应该保什么,量化之后哪部分最敏感,长上下文怎样降低内存消耗,开发者手里最常见的硬件是什么——这些细节需要一代一代模型实际发布之后,靠大量部署和反馈磨出来。

另一方面,大模型继续负责往上探能力边界。Qwen 的大尺寸 MoE 和小尺寸 Dense 并不是两条互不相关的产品线:这一代的旗舰是 2.4T 参数的 MoE,27B 和它共享同一套混合注意力骨架,更大的模型负责探索能力、生产数据和提供学习来源,经过验证的架构和训练方法,再逐渐向更小尺寸迁移——老师和学生长在同一个架构里。

所以今天回头看,Qwen 过去几年的技术路线其实很清楚:

大模型负责把智能做出来,小模型负责把智能压进去。

Qwen3.8-27B 是这两条路线第一次在一个非常醒目的位置汇合。它证明 Qwen 做了三年的“全尺寸”,并不仅仅是为了 Hugging Face 页面上多摆几个型号。真正的目标,是让同一档智能不断向更小的参数规模下沉。

27B 只是目前最引人注目的那个落点。

4

Qwen3.8-27B打开的是一类过去一直卡在中间的产品。

机器人就是最典型的例子。今天很多具身智能系统,本体真正能够长期运行的仍然是比较小的模型,碰到复杂视觉理解、任务规划或者高难度判断,再把请求送到云端更大的模型。原因并不神秘:本地跑得动的还不够聪明,够聪明的又太大。AI PC、汽车、智能眼镜和大量企业本地 Agent,本质上都面对同一个问题。这里缺的从来就是一样东西:足够强,同时真的塞得进去的模型。

硬件生态的反应最能说明问题。Qwen3.8-27B发布当天,NVIDIA 为它做了从 RTX 显卡、DGX Spark 到 Jetson 边缘平台的全线适配,机器人业务的官方账号专门发帖,说它已经为边缘准备好;官方博客强调的卖点,是开发者可以让敏感代码和专有数据留在自己的设备上。芯片公司为一个模型连夜铺路,赌的是自己的硬件销量。

Qwen3.8-27B 还远远没有小到能直接塞进一副眼镜或者普通手机,24GB 级显存目前也称不上真正的大众设备。但产业里一个重要的边界已经向前移动了。

当上一代旗舰级别的智能先从数据中心下降到一张消费显卡,“小模型”的春天正式到来。

Qwen3.8-27B 会成为新的一条斩杀线,它第一次把这条线明显地往设备侧挪了一步。以后判断一个模型有没有价值,问题不会只是它还能不能再聪明一点,还要看这一档智能,究竟能被压进多小的机器里。

毕竟当智能足够以后,谁能把它装进更多设备,谁才拥有更大的分发能力。这才是AI进入现实世界解决真问题的关键。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
全世界只剩2架,我国有一架,美国出3000万购买被拒

全世界只剩2架,我国有一架,美国出3000万购买被拒

疯狂的小历史
2026-09-05 10:01:05
这下轮到马科斯难受了!莎拉发声明,马科斯政府陷入公众信任危机

这下轮到马科斯难受了!莎拉发声明,马科斯政府陷入公众信任危机

小樾说历史
2026-09-07 02:41:03
澳洲人开始效仿华人, 纷纷在自家阳台做起了这件事! 一年能省下这个数

澳洲人开始效仿华人, 纷纷在自家阳台做起了这件事! 一年能省下这个数

澳微Daily
2026-09-03 15:53:40
降至18℃!长沙降温时间确定,冷空气又要来了

降至18℃!长沙降温时间确定,冷空气又要来了

鲁中晨报
2026-09-07 14:43:09
“大量蛇精,蜈蚣精来了!”浙江真人版“葫芦爷爷”事件,走向了最魔幻的一幕……

“大量蛇精,蜈蚣精来了!”浙江真人版“葫芦爷爷”事件,走向了最魔幻的一幕……

桌子的生活观
2026-09-07 12:34:38
费迪南德:换作是我,我会在防线中使用海文或约罗中的一人

费迪南德:换作是我,我会在防线中使用海文或约罗中的一人

懂球帝
2026-09-08 00:55:10
陈思诚一家三口罕见合体,10岁朵朵黏着爸爸抹眼泪,佟丽娅站一旁刻意避嫌

陈思诚一家三口罕见合体,10岁朵朵黏着爸爸抹眼泪,佟丽娅站一旁刻意避嫌

阿废冷眼观察所
2026-09-06 07:05:54
一路走好!不到72小时,5位名人接连离世,最小37岁,最大97岁

一路走好!不到72小时,5位名人接连离世,最小37岁,最大97岁

往史过眼云烟
2026-09-07 22:06:46
10年内入狱2次,爆火后“包一晚”40万,如今的她过得怎么样?

10年内入狱2次,爆火后“包一晚”40万,如今的她过得怎么样?

混沌录
2025-07-17 22:33:44
才播4集,全国收视率第一!央八这部年代谍战剧《交锋》,王凯周依然欧豪彭昱畅领衔主演,又是2026年度黑马

才播4集,全国收视率第一!央八这部年代谍战剧《交锋》,王凯周依然欧豪彭昱畅领衔主演,又是2026年度黑马

猫飞电影
2026-09-07 23:31:22
知名品牌创办人宣布与结婚逾20年的妻子分道扬镳,价值400多亿元财产待分割

知名品牌创办人宣布与结婚逾20年的妻子分道扬镳,价值400多亿元财产待分割

19楼
2026-09-07 08:16:48
突发!詹姆斯最新决定!又挨骂了...

突发!詹姆斯最新决定!又挨骂了...

左右为篮
2026-09-07 00:10:37
死在加州路边的阿里总监:最残忍的不是没钱,是枕边人不如网友亲

死在加州路边的阿里总监:最残忍的不是没钱,是枕边人不如网友亲

趣味萌宠的日常
2026-09-07 15:12:42
9月7日人民币对美元中间价调贬8个基点

9月7日人民币对美元中间价调贬8个基点

证券时报
2026-09-07 09:38:03
演员黄渤回应“家门口骑车摔成锁骨骨折”:手里抓着手机,捏刹车的时候没整明白

演员黄渤回应“家门口骑车摔成锁骨骨折”:手里抓着手机,捏刹车的时候没整明白

极目新闻
2026-09-07 22:48:26
路边碰到一群精神小妹,我想知道他们的出路在哪

路边碰到一群精神小妹,我想知道他们的出路在哪

皮蛋儿电影
2026-09-05 16:09:44
默茨无力回天,德国选择党取得压倒性优势,72岁前总理再度出山

默茨无力回天,德国选择党取得压倒性优势,72岁前总理再度出山

青青衫书生
2026-09-06 23:15:53
俄罗斯不放行,美国特使只能转乘火车!泽连斯基应付那俩货可真累

俄罗斯不放行,美国特使只能转乘火车!泽连斯基应付那俩货可真累

鹰眼Defence
2026-09-07 15:41:55
上汽新车官宣:9月10日 ,正式预售

上汽新车官宣:9月10日 ,正式预售

科技堡垒
2026-09-05 10:32:59
毛主席为何拒绝给董存瑞题词?得知缘由后,众人钦佩:伟人高明

毛主席为何拒绝给董存瑞题词?得知缘由后,众人钦佩:伟人高明

文史道
2025-07-03 20:21:14
2026-09-08 01:32:49
硅星人 incentive-icons
硅星人
硅(Si)是创造未来的基础,欢迎来到这个星球。
3387文章数 10530关注度
往期回顾 全部

科技要闻

小米澎程N90 Max定价26.99万元

头条要闻

伊朗试验特殊武器爆炸场面如同地狱 美军舰直接跑了

头条要闻

伊朗试验特殊武器爆炸场面如同地狱 美军舰直接跑了

体育要闻

压哨避开CBA选秀规则?NBL香港金牛队已为男篮国手王俊杰报备合同

娱乐要闻

热搜第一,演员李沐宸致歉

财经要闻

证监会原副主席王建军一审被判无期徒刑

汽车要闻

智能可变大空间SUV 小米澎程系列车型上市 20.99万起

态度原创

数码
亲子
本地
教育
健康

数码要闻

Xiaomi 18 Fold发布:10999元起 首发玄戒O3芯片

亲子要闻

低精力的妈妈,务必主动戒掉这个习惯

本地新闻

扒完小作文,富豪们私藏的度假胜地有多绝

教育要闻

最新!清华附、十一学校大动作!

同样是脑梗,为何康复结局大不同?

无障碍浏览 进入关怀版