网易首页 > 网易号 > 正文 申请入驻

告别Token焦虑,千问办公定义了 Agent 的斩杀线

0
分享至

用上 AI 这几年,我一直没有看额度的习惯。订阅的服务太多,这个那个摊开来,怎么用都够,压根想不起来去查还剩多少。

这个习惯是最近才被打破的。起因是我把整条工作流搬到了一个 AI 办公工具上——说得直白点,是搬到了一个智能体集群上——从那以后,看一眼今天烧了多少 Token,成了我每天都要干的事,因为那个数字跑得太快了。快到我这么一个仅仅在用它干些自动化程度并不那么高的活儿的人,都得盯着看。

比我焦虑的人多的很。2026年春天,一家三十五人的工程团队算了算当月的 AI 支出,八万七千美元。LeanOps 的调查里,重度使用 Claude Code 或 Cursor 的开发者,月均要在 AI 上花四百到一千五百美元,跑得凶的几天就烧掉四千。国内也一样,有人到处寻找便宜的API,自嘲成了"AI 时代的下沉市场人群"。大家的普遍感觉是,工具的确好用了,但积分烧完会焦虑,续费又心疼。

王坚打过一个比方:早期的 AI 应用像点电灯,耗电有限;以 OpenClaw 为代表的这一代智能体像开空调,耗电指数级地涨。他后面还跟了一句——"电价不降,老百姓用不起空调。"

8月26日晚上,千问办公推出标准模式,做的就是“降电价”。它首发了刚刚发布的 Qwen3.8-Flash,实现Token 消耗减少约 75%,生成速度差不多翻了一倍,同时任务质量还有保障,这也意味着,95% 的日常任务在标准模式下就能跑完。

但如果只把这当成"Agent又上线了一个新模型",就完全失焦了——千问办公想做的更大——给眼下这场 AI 办公大战划一条斩杀线:论性价比我比你高,论功能我比你全,论价格我也比你便宜。用户为什么要走?

——导语

但它凭什么敢这么讲?

先说一件这半年硅谷和国内都在争、大众媒体却没讲透的事:同一个模型,套在不同的"驾驭层"里,效能差距大得离谱。

驾驭层,行业里叫 harness,就是围绕模型搭起来的那套东西:工具怎么调、上下文怎么管、任务怎么拆、出错了怎么兜。这个词不性感,但它常常比换一个更贵的模型更能左右结果。

Cursor 的研究团队做过一组对比:同一个底座模型,换不同的 Agent 框架去跑,得分从 46% 拉到了 80%。模型一个字节没改,只是框架换了,成绩差了将近一倍。

Harness-Bench 的结论也很类似:不动模型、只换框架,同一批任务的分数能差出 23.8 分。在 SWE-bench 上,同一个模型因为 harness 配置不同,解题率从个位数跳到三成以上。

山姆·奥特曼跟 Ben Thompson 聊的时候说过一句话:他已经没法把模型和驾驭层看成两个独立的东西了,当 Codex 表现好的时候,他自己都分不清功劳归谁。他还有一个更干脆的判断:多数 Codex 失败是上下文问题,不是模型能力问题。

国内这边,清华刘知远团队提出的"密度定律"(Densing Law)从另一个角度讲了同样的事:大模型的能力密度大约每一百天翻一倍,换句话说,每过三个多月,你用一半参数就能跑到当前最强模型的水平。



这其实是一个很清醒的判断,就是单纯堆参数的红利在快速收窄,把模型用好的红利才是结构性的。就像手机芯片一样,如果你6个月就更新一次,其实意义不大。如何把芯片调教到性能释放极致,才知真功夫。

这几件事放到一起,说的其实是同一件事:一个好模型如果不跟工具链深度整合,就是法拉利的发动机配了一小面包车的底盘和传动系统,发动机再好也跑不出该有的成绩。这叫暴殄天物。

千问办公这次的更新正是踩在这个判断上。光有好模型不够,模型得长在 Agent 里面。千问办公上线的是和千问大模型团队联合设计的专属版Qwen3.8-Flash,所以在原有模型的基础之上,获得了更高的性能收益。

可有人会说,模型一旦长进 Agent 里,账单就开始不受控制。

前面我已经讲过AI工具带来的token焦虑。但是要从底层理解 Token 焦虑,要先理解 Agent 和普通对话的结构性差异。

一个人跟 AI 聊一个小时,撑死十几二十轮。而一个智能体后台跑一小时,为了完成任务可能来回交互几千轮。一次看上去轻飘飘的"帮我整理一下会议纪要",背后触发的是多轮工具调用、上下文检索、自我纠错、格式重排,实际消耗可以是一次普通问答的十到五十倍。

Anthropic 自己也承认,Agent Teams 模式下消耗大约是标准会话的七倍,“三个 Agent 跑一小时,顶一个 Agent 跑一整天”。IDC 给了一个更长周期的数据:企业智能体的 Token 消耗年均增幅超过 30 倍。

原来按对话设计的那套成本结构,撑不住这种量级。

所以千问办公出手的时机就在于,此刻,正是AI工具的放量期,且Agent工具正在趋同。谁能拿出一款"量大管饱"的模型和Agent组合,谁就在这场仗里握住了“取胜之匙”。千问办公首发 Qwen3.8-Flash 的底层意图在这里。



但光说便宜还不够——因为这场竞争里还横着另一个问题:慢。

很多文章在谈模型质量的时候只说“聪不聪明”,很少说“快不快”。但在真实的办公场景里,快不快才是体感最直接的那个维度。

那些公认更强的模型,因为参数大,往往也更慢。大不是问题,要命的是大带来的慢。

用过 Claude MAX模式或者 Kimi K3极致模式的人都有体会:坐在那里,盯着它一圈一圈地转,进度条好像粘住了,什么都干不了。你以为你在用一个强大的助手,其实你只是在等。对于那种高密度、连续性很强的办公场景来说,这种"坐等"非常致命,它打断的是人的心流。

对 Agent 工具来说,慢的代价还会被放大。它不像人可以边读边等,每一步都要等上一步的完整输出才能继续,延迟一层层累加。

有一组对比可以说明问题:一个三十万 Token 规模的复杂任务,在每秒一百个 Token 的速度下要跑将近五十分钟;拉到每秒四百个,只要十二分钟。省下来的那三十八分钟,就是一个人留在心流里还是切出去刷手机的分界线。

密度定律有一条推论:模型的推理开销会随时间指数级下降。高质量和慢,不需要永远绑在一起。千问办公把速度拉高一倍,解决的就是这个问题。让办公真正流动起来,而不是卡在一个转圈圈的等待里。



可便宜和快,都会被追平。真正的斩杀线,得往别处找。

驾驭层到底是不是护城河?

有一派很有分量的声音说不是。

TechCrunch 最近的报道就援引了 AI 领域那条著名的“苦涩教训”:从长远看,更强的通用模型终究会把外围那些精巧的工程一口吞掉。他们还举了个例子。Databricks 的实测里,一个叫 Pi 的开源极简 harness,用着和 Codex 完全相同的底座模型,成绩反而更好。在这一派看来,harness 是一根"随着模型变强而不断贬值的拐杖"。

这个反问很尖锐。但它恰恰指向了千问办公真正在做的事:斩杀线从来不靠某一个单点。模型会被追平,这是事实。驾驭层会随模型进步而贬值,这也是事实。但如果你能把三样东西同时叠到一起,取一个相对最优解,局面就不一样了。

第一,是模型和 Agent 的双向协同优化。模型在训练阶段就专门为 Agent 场景调过,Agent 框架又反过来围绕这个模型的特性做调度,两边互相优化、互相迁就。这件事情,“通用模型加一层薄封装”的产品做不到。你手里得同时握着自研模型和自研 Agent。

第二,是靠一版一版磨出来的工程沉淀。上下文压缩、会话恢复、长程任务里的目标保持,单拎出来都不性感,但极难复制。

第三样最吃劲:生态和上下文。千问办公把钉钉和 MyContext 接了进来,可以帮助企业构建一个Agent 的专属上下文,让Agent更懂业务工作流。模型可以下载,框架可以模仿,但一家企业沉淀在你这里的上下文,组织的记忆、业务的习惯,换一个产品带不走。业界有个说法叫"替换测试":悄悄把背后的模型换掉,用户还是离不开你,那才叫护城河。



三张牌叠在一起,就是千问办公说的"斩杀线"。它不靠哪一张牌去碾压谁,只是把对手可能进攻的每个方向都堵上了。性价比更高,功能更全,价格也不更贵。那你告诉我,客户凭什么走?

至此,阿里也成了全球第一个把"模型、办公平台、企业 IM、上下文层"打通的公司。这条全栈链路本身,就是壁垒的一部分。

但对我这样的用户来说,判断它有没有走对,还有个更土的标准——等哪天我又变回那个懒得看额度的人,就说明它做成了。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
贝克汉姆长子夫妇亮相法国电影节!一袭白裙惊艳全场,恩爱藏不住

贝克汉姆长子夫妇亮相法国电影节!一袭白裙惊艳全场,恩爱藏不住

点点细语
2026-09-09 16:29:28
失控的屁股

失控的屁股

中产先生
2026-09-09 00:52:15
“豆包手机”将于9月16日上市,目前已开启预约,全系512GB起步,配备长鑫存储硬件

“豆包手机”将于9月16日上市,目前已开启预约,全系512GB起步,配备长鑫存储硬件

台州交通广播
2026-09-08 23:10:31
曹德旺当年反对女儿嫁给厦大高材生,理由只有一句:他太优秀了!14年后,这个女婿拿到的不是聘书,而是福耀的一份重任

曹德旺当年反对女儿嫁给厦大高材生,理由只有一句:他太优秀了!14年后,这个女婿拿到的不是聘书,而是福耀的一份重任

背包旅行
2026-09-03 15:48:21
嫁78岁法国老头水落石出,42岁李宇春私生活曝光,丝毫不感到意外

嫁78岁法国老头水落石出,42岁李宇春私生活曝光,丝毫不感到意外

一盅情怀
2026-09-09 10:53:30
郭德纲处罚结果仅一天!央媒点名,离谱一幕发生,牵出与杨议旧怨

郭德纲处罚结果仅一天!央媒点名,离谱一幕发生,牵出与杨议旧怨

翰飞观事
2026-09-08 16:52:26
中央5台直播乒乓球时间表:9月9日CCTV5直播澳门冠军赛,蒯曼出战

中央5台直播乒乓球时间表:9月9日CCTV5直播澳门冠军赛,蒯曼出战

薇说体育
2026-09-09 15:19:52
一家民企的终极防御:既然我犯法,那把这27家同行全抓了吧

一家民企的终极防御:既然我犯法,那把这27家同行全抓了吧

有戏
2026-09-07 14:49:53
简直就是奇迹:美国林肯号航母5000多大兵在芭堤雅疯狂玩了5天,竟然仅有2个打架的!

简直就是奇迹:美国林肯号航母5000多大兵在芭堤雅疯狂玩了5天,竟然仅有2个打架的!

步论天下事
2026-09-07 09:40:52
风向突变!日媒称政府正全力说服中国,APEC峰会中国将硬核出席?

风向突变!日媒称政府正全力说服中国,APEC峰会中国将硬核出席?

阿纂看事
2026-09-09 14:22:37
消息称苹果iPhone Air 2将作为iPhone 18推出

消息称苹果iPhone Air 2将作为iPhone 18推出

IT之家
2026-09-09 14:21:10
武大风波一周:海外留子发声,爆付某开除内幕,曾某老公身份被扒

武大风波一周:海外留子发声,爆付某开除内幕,曾某老公身份被扒

阿绐聊社会
2026-09-09 13:40:52
U20亚洲杯仅剩三张世青赛门票,东道主中国队能抢到吗?

U20亚洲杯仅剩三张世青赛门票,东道主中国队能抢到吗?

体育全天候
2026-09-09 16:51:33
武汉市卫健委:已查封

武汉市卫健委:已查封

观察者网
2026-09-08 17:40:08
阿卡苦战五盘不敌谢尔顿爆冷出局,萨巴伦卡:不介意莱巴替代自己

阿卡苦战五盘不敌谢尔顿爆冷出局,萨巴伦卡:不介意莱巴替代自己

网球之家
2026-09-09 16:49:07
最近,央国企的“关系户”们,都在瑟瑟发抖

最近,央国企的“关系户”们,都在瑟瑟发抖

细说职场
2026-09-09 15:05:24
车评人一句“腰疼鼻炎”赔了10万,账号还被封

车评人一句“腰疼鼻炎”赔了10万,账号还被封

闪存猎手
2026-09-08 20:51:57
苹果保密工作白做了 手机壳厂提前曝光折叠屏命名:就叫iPhone Duo

苹果保密工作白做了 手机壳厂提前曝光折叠屏命名:就叫iPhone Duo

快科技
2026-09-08 18:47:08
快快帮|专技岗按50周岁“一刀切”退休?扬州宝应小天使幼儿园门诊部:管理疏忽,承诺纠正

快快帮|专技岗按50周岁“一刀切”退休?扬州宝应小天使幼儿园门诊部:管理疏忽,承诺纠正

现代快报
2026-09-08 17:45:08
特斯拉新车官宣:9月18日,国内亮相

特斯拉新车官宣:9月18日,国内亮相

科技堡垒
2026-09-07 11:39:20
2026-09-09 18:44:49
胡说成理 incentive-icons
胡说成理
一个记录胡喆和他的朋友们,关于智能时代和智能时代的生意逻辑的小天地。
245文章数 30关注度
往期回顾 全部

科技要闻

AI重大突破!OpenAI称解开近百年数学难题

头条要闻

美方指责DeepSeek、月之暗面复制美国大模型 中方回应

头条要闻

美方指责DeepSeek、月之暗面复制美国大模型 中方回应

体育要闻

16年后再破门,被皇马放弃的少年没认输

娱乐要闻

郭德纲的商业版图,藏着不知道的真相

财经要闻

知情人士证实DeepSeek备战科创板IPO

汽车要闻

红旗HS7 PHEV申报图曝光 尺寸升级/搭载激光雷达

态度原创

教育
房产
亲子
本地
健康

教育要闻

3分钟学会一个雅思7分句/段(第361期)

房产要闻

砸388亿+首个方案出炉!三亚,又一片区要起飞!

亲子要闻

是的,我怀孕啦!选择在满三个月的时候跟大家一起分享这个喜悦。

本地新闻

宁波,中国制造的隐藏大佬

中风康复为何像“抽丝剥茧”?

无障碍浏览 进入关怀版