网易首页 > 网易号 > 正文 申请入驻

下载了千问3.8之后,我发现网上都吹错了重点

0
分享至



作者|Hayward

原创首发|蓝字计划

刚刚过去的一周,是让无数AI人夜不能寐的一周。

从8月13日的DeepSeek V4 Pro开始,再到后面的Gemini、智谱GLM 5.3和千问3.8 27B,每个大模型都很重磅,又偏偏挑在北京时间的凌晨时段发布,要出稿的媒体们,想睡都睡不了。

但在这一波新大模型热中,有一个大模型的热度始终贯穿整个8月:千问3.8系列

其实这一轮热度其实从8月初就开始了。千问先发布了旗舰模型千问3.8-Max,随后又把27B版本放上Hugging Face。模型开放两天,下载量便突破100万次,连续几天占着全球模型热榜第一。



国外最大的本地大模型社区LocalLLaMA,很快被千问3.8系列的各种测试、部署和量化帖子淹没。重复话题实在太多,版主干脆专门开了一个集中讨论帖。

有人一本正经地发帖讨论,千问3.8的出现,是不是说明大模型的规模定律已经快走到头了;还有人看完测试结果,当场表示周一开盘就去买阿里股票

别以为反应激烈的只有网友,连一向对中国大模型不太对付的海外媒体,也有点陌生了。

比如,《连线》杂志把千问3.8放进了“中国开源AI正在挑战硅谷玩法”的报道里;欧洲新闻台认为,它已经开始追赶Claude一直对外宣传的复杂工作能力。就连X平台汇总相关讨论时,给出的标题也是“中国AI正在追上美国模型”。

虽然,在大模型社区,每次新模型发布,总少不了几句“改变游戏规则”,但这次热度只空前,讨论之热烈,好像还真不止来至于新模型发布的新鲜感。

特别是当我们亲自上手体验了整个千问3.8系列之后,才发现它真正牛的地方

写文章堪比Opus 4.6?

既然要体验千问3.8系列,那离不开的重头戏,自然是让无数国外友人震惊的千问3.8-Max

它是整个系列的旗舰,总参数达到2.4万亿,每次运行调用其中约950亿参数,最长可以处理100万token的内容。

至于老外为什么吹得这么猛,看着两个跑分其实就明白了。

Terminal-Bench 2.1考察模型能否独立操作命令行,完成安装软件、修改文件和运行程序等任务。千问3.8-Max的平均通过率为86.6%,距离GPT-5.6 Sol只差2.2个百分点。

IFBench考察模型能不能同时遵守多项要求。千问3.8-Max的提示词通过率达到82.8%,超过GPT-5.6 Sol的72.7%和Claude Fable 5的63.5%,在这一项直接完成反杀。



一个证明它能办事,一个证明它听得懂人话。如今千问3.8-Max已经可以直接和最新的GPT、Claude同场较量,而且还有来有回。

而且这两个测试,对我们这些干编辑的来说也有价值,毕竟能乖乖根据提示词来生成内容,就是写出好内容的第一步。只不过相比跑分,其实我更关心它最后写出来的东西到底怎么样。

尤其是海外社区已经有人声称,千问3.8的写作能力可以接近Opus 4.6。后者一直是AI圈自媒体大神卡兹克心里写作最好的大模型。这个评价,可是连目前最牛的GPT和Claude都未曾拥有的。

所以,我准备了一道专门考验短文逻辑、段落组织和文风的题目,把它同时交给了千问3.8-Max和GPT-5.6 Sol。





|可以看到,同样一组材料交给两款模型,最后写出来的东西,风格确实很不一样。

GPT-5.6 Sol这一版,整体更像一篇已经搭好骨架的短文,铺垫、转折和前后承接都比较完整。

不过,GPT的老毛病同样存在。

像“问题也恰恰出在AI太认真了”“这让AI清理相册碰到了一个很典型的边界”,还是过于生硬了,文章的转折就显得很刻意,为了转折而转折。而且它还出现了个致命问题:

说好的500字,实际却生成了超过1000字,完全不听命令。

而千问3.8-Max的处理方式要简单粗暴不少。整个文章都跟着提示词的节奏来,反差转折?没有的。情感铺垫?没有的。甚至它还鼓捣出了个“金句”:

“按画质衡量都是差照片,按记忆衡量却都是绝版。”

但也正是少了技巧、技法,有些地方甚至像是想到哪写到哪,也因此少了几分过度整理的痕迹。

甚至像“那位差点失去父亲背影的用户,事先多半也不知道,最后一张会糊成这样。”这句,严格来说没有提供新的信息,按照大部分AI的标准来看,就是个废话。

不过,大部分人说话、写东西,就是会有一些废话出现。恰到好处的啰嗦,反而更有活人感。

而这点,在当前绝大部分的体验、评测中都没有提到,我甚至觉得那些狂吹的老外们,都没有吹到了重点上。

就在这个对比之前,我还试过让千问3.8 Max写过一段视频脚本的开头。不仅独自构思了一个比较有意思的视频开头,而且还会自己营造“悬疑解谜”的画面,并藏住答案。



|这显然要比GPT那种理工直男思维的线性叙事更有意思。

所以,至少从我自己的体验来看,只论写作,千问3.8-Max想要超过Opus 4.6还不现实。但它写出来的东西有时比GPT更像人,这一点确实出乎我的意料。

如果再迭代几个版本,把逻辑链和段落连接补上,它在日常写作里替代GPT,已经不是什么遥远的事。

不过,在这几天的体验中,其实比起千问3.8 Max的“活人感”,真正让我大受震撼的,是最近刚刚开放权重的千问3.8-27B。

顶级大模型,普通人也可以拥有了

千问3.8-Max确实很强,但它有2.4万亿参数。对普通人来说,这种体量基本只能在线使用。就算把权重下载回来,家里的电脑也跑不动。

千问3.8-27B就不一样了。

它只有270亿参数,能力比Max弱一些,但它最大的价值在于整个模型却可以下载回来,直接装进你家的电脑里。

而且它的性能可不弱。按照千问公布的成绩,千问3.8-27B在Terminal-Bench 2.1拿到73.0分,已经接近Claude Opus 4.6的78.2分。到了考验真实软件修复能力的SWE-bench Pro,它又拿到61.7分,超过Opus 4.6的53.4分。

也就是说,这款可以本地部署到你家里的模型,性能已经在部分测试中摸到了前代顶级闭源模型的边缘。

虽然并不是随便一台电脑都能装,但整体看来只要有一块一万元左右的显卡就能拥有这款旗舰级别的开源大模型,也难怪大家对这个版本的热情高得有点吓人。

就在当天,我也把千问3.8-27b下载到了电脑里。这是一个4-bit量化版本,模型文件占用大约16GB。我的电脑用的是一张16GB显存的RTX 4080,外加48GB内存。



那装在本地的千问3.8 27B效果怎么样呢?实话说,有点超出我的预期。

关闭思考模式以后,千问3.8-27B的生成速度可以达到每秒26个token。屏幕上的字往外冒得比人阅读还快,一篇五百字左右的回答,通常不用等上一分钟。



而且,在速度没问题的基础上,写出来的东西其实也可以。

我把同一道题同时交给了本地运行的千问3.8-27B、线上的千问3.8-Max和GPT-5.6 Sol。题目要求们详细分析RTX 4080相比RTX 3080,在大模型本地推理上的优势,写五百字左右。

三家都用了一句翻案的话开头,先否定只看算力的思路,随后把重点转到显存容量。后面的论证也差不多,显存负责撑起主线,架构、带宽和功耗跟在后面补充,结尾再落到RTX 4080可以运行更大的模型。



虽然结构类似,但风格却不一样。千问3.8-Max选择列清单,GPT-5.6 Sol写得更完整,本地27B则交付了一篇连续的短文。

只不过,其实从易读性来说,如果我想要的是一个“答案”,千问3.8 27B整出来的内容就足够清晰明了了,没有简单粗暴的参数堆叠,给出的答案也有理有据。

它还抓到了这道题最有价值的地方。其实RTX 4080最核心的优势是16GB的显存,它是目前高性能量化大模型能部署到本地的生命线,也是对比只有10GB显存的3080最核心的优势。

然而,正在我打算大夸特夸千问3.8 27B的时候,它又不可避免地翻车了。

它声称RTX 4080的显存带宽大约是1024GB/s,RTX 3080则是936GB/s,但实际上3.8-Max和GPT-5.6 Sol给出的参数:RTX 4080是716.8GB/s,RTX 3080 10GB版是760GB/s,才是对的。

部署在本地的千问3.8 27B,还是吃了没能联网搜索数据的亏。

这也说明了,除去了准确性之外,一个部署在本地的大模型,其实已经有了相当高的可用度。

而且它所组织的语言也还算流畅,特别是体现出了一种比较罕见的特质:回答技术问题时,知道什么该说详细点,什么可以一笔带过,哪怕对参数完全不懂,也能知道个高低好坏。

后续如果打算用它来修改文章、生成提示词,后者接入爱马仕等用来做一些简单的内容生成,已经足够了。

而且这个部署在本地的千问3.8 27B,甚至还支持多模态,你把一张图片丢给它,它还能帮你“看”这张图。

一个家用电脑里的27B,已经有资格和千问旗舰、GPT最新模型放在一起批改作业。哪怕最后输了一点,这件事本身也已经够离谱了。

好用,但也非毫无代价

可惜的是,随着使用的日益深入,我也有了更多的遗憾。

首先,前面提到千问3.8 27B每秒26个token的速度,有个重要前提:得关掉思考模式。

打开以后,速度会跌到每秒5个token左右。模型会先输出很长的思考过程,哪怕是一个很小的问题,也会先思考个一分钟再作答,很折磨人。

这甚至是整个千问3.8系列的弊病。海外社区里也有人吐槽,千问3.8-Max有时会在思考过程中反复绕圈,答案越写越长,和GPT那简单直接、真正的不绕圈子,形成了鲜明对比。

不过更多的遗憾,是来自电脑配置这件事上。

实际上,按照社区的反馈,千问3.8 27B最值得安装的版本,是NVFP4量化的版本。它同样把权重压到4位,NVIDIA还专门为这种格式做了硬件加速,尽量减少模型压缩后的能力损失。

可惜,我的RTX 4080属于上一代Ada架构,吃不到这项原生加速。想把NVFP4的优势用出来,至少要换到采用Blackwell架构的RTX 50系列。

但众所周知,当前的英伟达50系已经涨上天了。之前人厌狗嫌的RTX 5080 ,价格也涨到了12999元,已经比当年首发时的RTX 4090都要贵了,更不要说最适合部署NVFP4的显卡,RTX5090。

也就是说,最适合普通人用的,低成本又低成本的大模型实际上是离我们越来越近了;但又因为硬件涨价,又远离了普通人。

毫无疑问,千问3.8 Max值得吹上一番,3.8-27B更是值得留在硬盘里。只是这类好用开源模型的真正辉煌时刻,可能还是得看硬件价格什么时候肯放过普通人了。

声明:个人原创,仅供参考

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
1米3袖珍美女:嫁给1米48男孩,婚后丈夫奇迹长高,最终不欢而散

1米3袖珍美女:嫁给1米48男孩,婚后丈夫奇迹长高,最终不欢而散

梦醉为红颜一笑
2026-09-05 01:01:29
星宇股份61岁的人力资源总监成背锅侠,撤回处罚通报原因曝光

星宇股份61岁的人力资源总监成背锅侠,撤回处罚通报原因曝光

平老师666
2026-09-07 22:39:36
正式离队,或无缘续约?李梦去向3选1,或将降薪,张隆看懂了

正式离队,或无缘续约?李梦去向3选1,或将降薪,张隆看懂了

凉生枕时e
2026-09-07 10:54:42
武大86页PDF举报、母校切割校友、正颌手术变“鞋拔子脸”:一年三场舆论风暴,百年名校的招牌还能经得起几次折腾?

武大86页PDF举报、母校切割校友、正颌手术变“鞋拔子脸”:一年三场舆论风暴,百年名校的招牌还能经得起几次折腾?

二宝妈妈谈教育
2026-09-04 14:57:04
汤家凤呼吁取消英语,他这个“坏种”,竟然是南京大学博士

汤家凤呼吁取消英语,他这个“坏种”,竟然是南京大学博士

汉史趣闻
2026-09-06 10:13:22
一把火烧光100亿投资!35名顶尖专家全部牺牲,中国预警机血泪史

一把火烧光100亿投资!35名顶尖专家全部牺牲,中国预警机血泪史

董董历史烩
2026-09-08 10:11:00
打赏陪睡案女主播合租室友发声:魏莹每月陪睡一两次,枕头没干过,经常哭到缺氧

打赏陪睡案女主播合租室友发声:魏莹每月陪睡一两次,枕头没干过,经常哭到缺氧

世界圈
2026-08-24 20:54:42
比尔·盖茨亲口承认:Ctrl+Alt+Delete是个错误

比尔·盖茨亲口承认:Ctrl+Alt+Delete是个错误

我是一个粉刷匠2
2026-09-07 01:06:52
泉州市委副书记周小华,拟任新职!戴清泉,拟任正厅长级职务!

泉州市委副书记周小华,拟任新职!戴清泉,拟任正厅长级职务!

坠入二次元的海洋
2026-09-08 08:58:03
地产首富,落幕!

地产首富,落幕!

新浪财经
2026-09-06 11:30:29
家属突发讣告!24岁女网红确认离世,出事三天前还在更新账号

家属突发讣告!24岁女网红确认离世,出事三天前还在更新账号

南方都市报
2026-09-08 08:00:08
小米再次背水一战

小米再次背水一战

全天候科技
2026-09-08 00:47:41
赛力斯新车官宣:9月8日继续开售,22.98万起

赛力斯新车官宣:9月8日继续开售,22.98万起

手机讲坛
2026-09-08 00:52:45
羽协换届竞体司司长张新任主席 夏煊泽被罢免纪委书记李论当副主席

羽协换届竞体司司长张新任主席 夏煊泽被罢免纪委书记李论当副主席

劲爆体坛
2026-09-08 11:43:37
孙千9年前来台嫩照曝!柴智屏揭相中她与宋威龙过程 网赞眼光太强

孙千9年前来台嫩照曝!柴智屏揭相中她与宋威龙过程 网赞眼光太强

ETtoday星光云
2026-09-07 11:03:05
不是!快船你玩吗,交易八村塁?

不是!快船你玩吗,交易八村塁?

体育新角度
2026-09-07 21:33:57
《兰香如故》央八播出:但凡36岁谭松韵演技拉垮一点,都压不住这两位美貌兼实力派女配角

《兰香如故》央八播出:但凡36岁谭松韵演技拉垮一点,都压不住这两位美貌兼实力派女配角

奴染
2026-09-07 00:15:18
谢贤前女友Coco直播被说丑,本人回应:“姐都40岁了,把头发往下一放还是迷倒一大片的”

谢贤前女友Coco直播被说丑,本人回应:“姐都40岁了,把头发往下一放还是迷倒一大片的”

韩小娱
2026-09-04 05:54:22
61岁男演员全家美国享乐!住豪宅开快艇吃龙虾,一句回应点燃舆论

61岁男演员全家美国享乐!住豪宅开快艇吃龙虾,一句回应点燃舆论

娱说瑜悦
2026-09-07 18:32:08
委内瑞拉称将遵守委中之间石油协议,外交部发言人已明确表示:中国和委内瑞拉的合作与第三方无关,中国在委内瑞拉的合法权益必须得到保护

委内瑞拉称将遵守委中之间石油协议,外交部发言人已明确表示:中国和委内瑞拉的合作与第三方无关,中国在委内瑞拉的合法权益必须得到保护

吉刻新闻
2026-09-07 22:07:41
2026-09-08 13:20:49
蓝字计划 incentive-icons
蓝字计划
记录智能时代的每一次浪潮!前沿科技捕手,AI产品深度洞察。
323文章数 3895关注度
往期回顾 全部

科技要闻

小米再次背水一战

头条要闻

女孩遇"完美男友"被骗上百万 连养的狗都是"女友共享"

头条要闻

女孩遇"完美男友"被骗上百万 连养的狗都是"女友共享"

体育要闻

郑钦文,奇迹只发生在相信奇迹的人身上

娱乐要闻

郭德纲乱改抗战歌曲被重罚!

财经要闻

全球黄金“回家”

汽车要闻

领克20 领克的纯电小钢炮这次更运动了

态度原创

艺术
手机
本地
时尚
公开课

艺术要闻

90后高学历情侣,租350m²毛坯45天改完:比买房值

手机要闻

vivo年度创作者盛典回顾,这三个信息最重要

本地新闻

扒完小作文,富豪们私藏的度假胜地有多绝

白露食白——露从今夜白,味从此时鲜

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版