网易首页 > 网易号 > 正文 申请入驻

Qwen3.8-27B 登顶全球开源榜第一,曾经的「源神」又回来了!

0
分享至


Qwen3.8-27B开始和顶级闭源模型正面叫板,过度思考是最大问题。

作者丨李娜

编辑丨岑峰

8月17日,阿里发布的Qwen3.8-27B 成为 Hugging Face 上排名第一的热门模型。Qwen正在成为全球开源社区的Base Model。

01


一个 27B 的模型,为什么突然让全球 AI 社区兴奋?

如果只看参数,Qwen3.8-27B并不像一个会制造太大声量的模型。27B参数,在今天动辄数千亿甚至万亿参数的旗舰模型面前,甚至显得有些“小”。但2026年8月14日,阿里千问正式开源Qwen3.8-27B之后,海外AI社区的反应却异常热烈。


原因恰恰就在这个“小”字上。


在Qwen官方公布的成绩里,Qwen3.8-27B 已经开始在部分 Coding 和 Agent 测试中,与 Claude Opus 4.6 Max 这样的前沿闭源模型放在同一张表格里比较。与此同时,4bit 量化后约 17.1GB,一张 RTX 4090 或 3090 就能完整装下,进入了个人设备能够尝试本地运行的范围。


这形成了一种过去并不常见的反差:一边是消费级硬件能够承受的模型尺寸,另一边却开始出现过去只有云端旗舰模型才会被期待的Coding和Agent能力。

独立开发者Simon Willison直接评价 Qwen3.8-27B “excellent”,Reddit社区中 LocalLLaMA上有人把它称作 “游戏规则改变者”;另一些实际用它完成 Coding 任务的用户,则开始用“接近Opus”来描述自己的体验。围绕它的讨论,也很快从传统的“这个模型Benchmark多少分”,变成了“我的3090能不能跑”“24GB显存用什么量化”“能不能直接接进Coding Agent”。


过去谈到本地部署模型,默认往往意味着一种交换:用户获得隐私、可控和更低的使用成本,同时接受能力上的明显妥协。真正复杂的Coding、工具调用和长程Agent任务,仍然主要属于Claude、GPT这类运行在云端的前沿闭源模型。Qwen3.8-27B正在挑战的,正是这个默认前提。


02


Qwen3.8-27B

开始达到旗舰模型的上限

Qwen3.8-27B 最值得关注的是,它用 27B 的尺寸同时承载了 Coding、Agent、长上下文、多模态四项能力

27B 并不算一个极小的模型,但它已经进入个人硬件可以真正部署的范围。经过 4bit 量化后,部分版本的模型权重只有 17GB 左右,一张 24GB 显存的 RTX 3090 或 4090 就有机会把完整权重装进显存。相比动辄数百亿、数千亿参数,必须依赖多卡服务器运行的旗舰模型,这已经是完全不同的部署门槛。

Qwen3.8-27B 对长上下文的设计也明显服务于这个目标。它共有 64 层,其中 48 层采用 Gated DeltaNet,16 层保留完整 Attention。传统全注意力需要随着上下文不断增长 KV Cache,而 DeltaNet 使用固定规模的循环状态,因此可以降低长文本带来的显存压力。模型原生支持 262K 上下文,并可以进一步扩展到 100 万 Token。

但这些只是前提。真正让它和 Opus 4.6 Max 放在同一张表格里的,是 Agent 和 Coding。(雷峰网)


在 Qwen 官方公布的数据中,Qwen3.8-27B 在 SWE-bench Pro (真实GitHub issue修复)上达到 61.7,官方列出的 Claude Opus 4.6 Max 成绩为 53.4;OSWorld-Verified (电脑操作)为 84.3 对 72.7,AndroidWorld (手机操作)为 81.9 对 62.0,CoWorkBench(长周期办公任务) 为 70.7 对 68.2。LiveCodeBench v6 (代码生成)上,Qwen3.8-27B 也达到 90.3。

官方榜单之外,一批社区横向测试也在提供更直观的参照。

有开发者用完全相同的 Prompt,让Qwen3.8-27B 和上一代 Qwen3.6-27B分别生成同一个 voxel pagoda。在同一台 DGX Spark、相同量化设置下,3.8 在场景完整度和视觉效果上都明显更成熟。


再往外看,有用户把它和同体量的 Glimmer-30B 放在一起测试 Three.js 场景。此前 Glimmer-30B 已经是 30B 左右本地模型里表现相当强的一档,但换到 Qwen3.8-27B 后,用户最终仍然把优势判给了 Qwen。


更有意思的是,社区已经开始直接拿它和 Claude Opus 做同 Prompt 的前端生成对比。单个 Demo 显然不能证明 Qwen 已经达到 Opus 的整体水平,但这种比较本身已经说明了问题:过去一个本地 27B 模型和顶级闭源模型之间,往往根本没有正面对比的必要;现在至少在部分 Coding 和前端任务上,两者已经可以放在同一个画面里比较。


把这些结果放在一起,Qwen3.8-27B 目前的位置大致已经可以看清:和上一代 27B 相比,它的能力上限明显往前走了一截;放到 30B 左右的本地开源模型里,它已经处在第一梯队;而在部分 Coding 和 Agent 任务上,它甚至开始摸到前沿闭源模型的能力区间。

如果 Qwen3.8-27B 只能通过 API 调用,它最多只是又一个强模型。但经过量化后,它已经能进入个人工作站和企业私有环境,代码、文档和 Agent 工作流都可以留在本地。一个个人硬件能够承受的 27B 模型,开始进入过去主要属于前沿闭源模型的 Coding 和 Agent 能力区间。

过去本地部署往往意味着牺牲能力,Qwen3.8-27B 正在缩小这种能力折扣。


03


过度思考,是它最大的问题

在海外社区,有人已经把 Qwen3.8-27B 称作“Opus at Home”。但榜单之外,围绕它最集中的争议也很明确:模型能力强,但是推理时间太长;而Benchmark上的领先,也还没有完全转化成真实Agent体验。

▎为了一个答案,它能先想21分钟

问题首先出在 reasoning_effort上。Qwen3.8-27B 提供xhigh、medium、low、none四档推理强度,默认使用最高的 xhigh。对于复杂Coding和长程Agent,这可以换来更充分的推理;但放到消费级硬件上,代价也非常直接——慢,而且大量消耗Token。


Django 联合开发者 Simon Willison 做过一个很典型的测试:让模型生成一张“骑自行车的鹈鹕”SVG,Qwen3.8-27B 花了21分钟,产生22,276 个推理Token,最终输出只有3,223 Token;关闭深度思考后,同一个任务缩短到137秒。社区里类似反馈并不少见。有人让它写一个简单游戏,模型先思考了半小时;也有人把它接进Coding Agent,一次任务的思维链跑掉数万Token。


这也暴露了Qwen3.8-27B目前最明显的矛盾:它的能力上限很高,但默认设置并不一定适合本地用户。

对于云端旗舰模型,长时间推理更多表现为价格和等待时间;到了3090、4090这样的个人硬件上,推理强度会直接变成速度、显存和使用体验。一个本来以“本地可跑”为最大优势的模型,如果简单任务也需要长时间思考,这个优势就会被部分抵消。

▎榜单赢了,真实Agent未必赢

另一个需要降温的,是“超Opus”这个说法。

Qwen3.8-27B在SWE-bench Pro、OSWorld-Verified等测试上的确表现亮眼,但这些仍然是标准化、受控环境下的任务。真实Agent面对的变量更多:任务可能持续几个小时,需要反复调用工具、修改代码、处理异常,还要保证过程中不跑偏。


(Qwen3.8-27B 总分 48.0%,排名第 15;该 Benchmark 共 60 项真实 Agent 任务。)

在更复杂的真实任务里,27B的优势并没有那么绝对。例如在WildClawBench的60项Agent任务中,Qwen3.8-27B虽然明显超过前代,但仍落后于一些更大的托管模型。

这也是为什么不能直接把“某几项Benchmark超过Opus”翻译成“真实使用已经可以取代Opus”。实际使用最终看的不是一张榜单,而是几个更难回答的问题:长任务能不能稳定完成,工具调用会不会出错,代码修改能不能收敛,以及为了得到这个结果,需要等待多久、消耗多少计算。

因此,现在给Qwen3.8-27B一个更准确的位置,可能不是“本地Opus”,而是:

它已经证明,27B开源模型有资格进入顶级闭源Agent的比较范围,但还没有证明自己能够全面替代它们。

04


真正的变化:前沿 Agent 正在开始进入个人电脑

回到开头那个问题:一个27B模型,为什么能让全球社区这么兴奋?

过去几年,本地模型一直有一个默认前提:隐私、便宜、可控,但能力要妥协。一个能在消费级硬件上运行的模型,意味着你得接受它在复杂Coding、多步推理、工具调用上的明显短板。真正要干活,还是得切回Claude或GPT。本地运行和前沿能力之间,存在一条清晰的分界线。

Qwen3.8-27B第一次让这条线变得模糊了,“本地运行”和“前沿Agent能力”正在第一次变成可以同时追求的东西。

过去开源模型的叙事是“追上闭源”。Qwen3.8-27B的叙事是“闭源模型的能力,第一次以可部署的尺寸出现在本地硬件上”。前者是追赶,后者是下放。追赶是总是暂时的,你今天追上,明天可能又被拉开;下放则是结构性的,一旦能力被压缩到消费级硬件可承受的尺寸,它就不会再缩回去了。

前沿Agent能力正在从云端下放到个人电脑,这才是Qwen3.8-27B真正值得被记住的原因。它也许不是最终的答案,但它逼出了下一个必须回答的问题:如果未来所有27B级别的模型都具备这种Agent能力,开发者的工作流、企业的部署策略、甚至个人采购GPU的逻辑,是不是都要跟着重写一遍?

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
1955年毛主席审阅元帅名单,看到贺龙名字时笑道:他可是个好配角

1955年毛主席审阅元帅名单,看到贺龙名字时笑道:他可是个好配角

云霄纪史观
2026-09-08 02:02:38
欧美港口:拆掉中国设备!工人拆完,领导:混蛋我让你拆的是 Logo

欧美港口:拆掉中国设备!工人拆完,领导:混蛋我让你拆的是 Logo

原广工业
2026-09-07 02:23:20
替胡锡进对线汤家凤:75%发明来自英语国家,你都不用了?!

替胡锡进对线汤家凤:75%发明来自英语国家,你都不用了?!

小小河
2026-09-08 02:46:43
知名餐饮企业退出合肥市场,早前曾陷全网的“预制菜风波”

知名餐饮企业退出合肥市场,早前曾陷全网的“预制菜风波”

凤凰网安徽
2026-09-07 18:22:11
汪小菲马筱梅带娃游广州!玥儿长发飘飘好像大S,像是来给大S复仇的

汪小菲马筱梅带娃游广州!玥儿长发飘飘好像大S,像是来给大S复仇的

八星人
2026-09-06 13:04:57
韩国产业现状给我国带来提醒,稀土禁令管得越严,俄罗斯倒手韩国赚得越多

韩国产业现状给我国带来提醒,稀土禁令管得越严,俄罗斯倒手韩国赚得越多

磊子讲史
2026-08-28 16:27:42
CHINA GT发生重大撞车起火事故,“救援人员因害怕,放下灭火器后逃离”,对手弃赛冲入火海救人

CHINA GT发生重大撞车起火事故,“救援人员因害怕,放下灭火器后逃离”,对手弃赛冲入火海救人

澎湃新闻
2026-09-06 16:54:03
2026款五羊 S150上市 售价0.598万元起

2026款五羊 S150上市 售价0.598万元起

车质网
2026-09-07 13:50:08
居委会的“权力清单”:2026年新规落地,7件民生大事意味着什么

居委会的“权力清单”:2026年新规落地,7件民生大事意味着什么

你在偷看谁
2026-08-25 20:54:50
朝鲜缺电程度远超越南,我国为什么不向朝鲜出口?说白了,这可能就是个巨额烂账

朝鲜缺电程度远超越南,我国为什么不向朝鲜出口?说白了,这可能就是个巨额烂账

磊子讲史
2026-08-10 21:11:13
杜特尔特家族反攻号角吹响!女儿刚交保获释,儿子立即“开炮”

杜特尔特家族反攻号角吹响!女儿刚交保获释,儿子立即“开炮”

白色得季节
2026-09-07 17:24:47
《交锋》:两位演员堪称败笔,换掉他们,这部剧近乎完美

《交锋》:两位演员堪称败笔,换掉他们,这部剧近乎完美

娱圈办事处
2026-09-07 15:08:53
别再只骂赵勇!女排下滑根本不在教练,傀儡主帅谁上都白搭

别再只骂赵勇!女排下滑根本不在教练,傀儡主帅谁上都白搭

金毛爱女排
2026-09-07 07:34:54
5999元,华为刚推出的6.3英寸小阔屏,估计又要卖爆了

5999元,华为刚推出的6.3英寸小阔屏,估计又要卖爆了

刘奔跑
2026-09-07 20:49:29
张子宇正负值-9韩旭怎么看?韩旭的回答让球迷感动

张子宇正负值-9韩旭怎么看?韩旭的回答让球迷感动

篮球大视野
2026-09-07 10:54:31
首款完整“韬定律”芯片落地,余承东现场称“史上最强”

首款完整“韬定律”芯片落地,余承东现场称“史上最强”

第一财经资讯
2026-09-07 16:13:11
伊朗多枚导弹袭击美航母,美方承认低估了一件事:伊朗已不再忌惮美国

伊朗多枚导弹袭击美航母,美方承认低估了一件事:伊朗已不再忌惮美国

影孖看世界
2026-09-06 21:34:46
随着斯瓦泰克2-0晋级!16强敲定!郑钦文和教练可能做出3大调整

随着斯瓦泰克2-0晋级!16强敲定!郑钦文和教练可能做出3大调整

冷峻视角下的世界
2026-09-07 13:54:36
比尔·盖茨亲口承认:Ctrl+Alt+Delete是个错误

比尔·盖茨亲口承认:Ctrl+Alt+Delete是个错误

我是一个粉刷匠2
2026-09-07 01:06:52
不是校规是法规!2026年9月1日起,学生带手机进校,真的要罚了?

不是校规是法规!2026年9月1日起,学生带手机进校,真的要罚了?

户外阿毽
2026-09-07 14:49:24
2026-09-08 05:04:49
雷峰网 incentive-icons
雷峰网
关注智能与未来!
70847文章数 656228关注度
往期回顾 全部

科技要闻

小米澎程N90 Max定价26.99万元

头条要闻

梅艳芳哥哥申请禁令阻止梅妈火化:母亲死得不明不白

头条要闻

梅艳芳哥哥申请禁令阻止梅妈火化:母亲死得不明不白

体育要闻

世界杯-中国女篮20分大胜意大利锁D组第二 韩旭19+10杨舒予15分

娱乐要闻

热搜第一,演员李沐宸致歉

财经要闻

证监会原副主席王建军一审被判无期徒刑

汽车要闻

智能可变大空间SUV 小米澎程系列车型上市 20.99万起

态度原创

游戏
手机
房产
旅游
亲子

鸣潮费大劲捏出来的清冷师尊,咋就变成了哦齁剑仙?

手机要闻

九月机圈大战!小米发布18 Fold、华为全新三折叠亮相,苹果紧随其后

房产要闻

10万人吃瓜!三亚这个楼盘,法拍网上卖疯了!

旅游要闻

走进合川涞滩古镇 探寻三江之畔的人文底蕴

亲子要闻

小女孩第一次学做蛋糕,就被妈妈无情的嘲讽影视解说

无障碍浏览 进入关怀版