网易首页 > 网易号 > 正文 申请入驻

企业AI成本清算:为什么token价格在下跌你的钱还越花越多

0
分享至

Uber 首席技术官 Praveen Neppalli Naga 今年5月坦言,原本为 Claude Code 划拨的预算"早就被花光了"。Box 首席执行官 Aaron Levie 今年3月警告称,随着AI智能体从工程领域扩展到法律、销售和其他知识工作领域,"计算预算只会随着时间一直递增"。


Ramp 的内部数据显示,从2025年1月到2026年初,企业级token支出增长了13倍。

这一切本不该发生。如今token的价格正在直线下跌。有人将这种现象称为 "LLMflation"(大模型通缩) ——即在同等模型性能下,推理成本每年下降10倍,比摩尔定律更快,比宽带更快,也比以往任何技术商品化的速度都更快。

2021年,GPT-3 质量水平的模型每百万token需要60美元;现在只需要0.06美元,三年间下降了1000倍。

经济学规律与账单数字对不上了。而这正是企业IT战略专家在下一个规划周期之前必须面对且理解的命题。

企业AI经济学的核心悖论

当年摩尔定律让软件行业膨胀、宽带普及让网络流量泛滥的同一股力量,如今正在AI领域重演——这是杰文斯悖论(Jevons paradox)的最新例证。

19世纪经济学家 William Stanley Jevons 观察到,当蒸汽机效率提高后,煤炭消耗量非但没有下降,反而激增了——因为效率解锁了全新的用途。当一种资源变得更便宜时,人们不会减少消耗,反而会为它找到十种新的用法。


企业AI就是教科书般的案例。

以前生产环境中只运行一个模型的团队,现在运行五个。过去只发送50个token的 RAG 流水线,现在发送4000个。智能体为了完成一项任务要循环调用数十次。初级开发者可以自由地提示迭代,换作一年前这种用法会因成本过高而不可行。

根据 Gartner 的数据,agentic模型(自主智能体模型)所需的token量是标准聊天机器人的5到30倍

人均成本在下降,但人们对更多token的需求增长得更快。

大多数企业没有追踪的结构性成本驱动因素

Token (词元)是AI基础设施的原子单位,就像CPU周期和带宽之于上一代技术。

  • 输入token:承载你发送给模型的内容
  • 输出token:承载模型生成返回的内容

输出token的成本要高得多,原因是物理层面的:模型在单次计算遍历中就能读完你的全部输入,但生成输出时是一个token接一个token地生成——每生成一个token都要让整个网络跑一遍完整计算。一个1000 token的响应,大约需要1000次独立遍历。

这种不对称性直接体现在定价中,而且差距还在拉大。

  • Claude Sonnet 4.6:输入3美元/百万token,输出15美元/百万token——Anthropic 当前所有型号都保持5倍的稳定差距
  • GPT-5.4:输入2.50美元,输出15美元——6倍差距,明显高于其前身 GPT-4o 在相同输入价位下的4倍比例

随着模型将更多算力投入到更高质量的输出中,生成成本与理解成本之间的距离正在越拉越远。

但token价格只是故事的一部分。真正吃掉预算的是结构性因素。

RAG 流水线是最大的"元凶"

用户输入一个50 token的问题。等到你的系统把检索到的上下文、对话历史和系统提示词全部拼上去,这次调用就变成了4000个token——一个用户永远看不到、财务团队也可能没在追踪的80倍开销。

推理模型增加了又一层

像 GPT-5.4 Thinking 和 Claude 的具备扩展思考模式的模型,在回复之前会生成内部的"思考token"(thinking tokens)。这些token会计入你的账单,尽管你永远看不到它们。一个复杂的推理调用可能在输出第一个字之前,就已经悄无声息地消耗了数千个token。

还有 tokenmaxxing(token滥用)

Tokenmaxxing 是一种趋势:团队把便宜的token当成免费的。提示词越来越臃肿,因为开发者添加了并不需要的上下文;对话越拖越长,因为没人去裁剪历史记录;智能体在循环中打转,而一个结构清晰的单次查询本就能得到答案。Uber 的例子就是典型。

模型选择才是倍数效应的放大器

所有主要提供商都按百万token收费,但价格区间大得惊人:

  • 前沿端:OpenAI 的 GPT-5.5 Pro 为 输入30美元/输出180美元(每百万token)
  • 经济型:GPT-4.1 Nano 为 输入0.10美元/输出0.40美元

也就是说,输入端有150倍的价差,输出端有450倍的价差——而很多时候,这些任务在功能上是等效的。


生产环境中的成本差异很少有这么极端,但也不需要那么极端。在专业机构最近的一次对照实验中,使用同一个智能体编码任务、相同运行时间、相同沙箱环境,两种不同模型产生的token量相近,但成本分别为1.20美元和97美元。唯一的变量就是模型选择。

优化手册:从战术到架构

大多数企业都是在账单到手时才发现自己的token问题。到那时,使用习惯已经形成,架构已经部署,优化就像事后改装一样被动。

但事情不必如此。下面的策略涵盖了从今天就能拨动的开关,到会随时间复利的架构决策。

提示词缓存:重复利用的token

这对大多数团队来说是投资回报率最高的动作。缓存重复的上下文可以节省高达90%的输入token成本,在 Anthropic 和 OpenAI 上,批量处理还能再额外节省50%。如果你的系统提示词超过2000个token,而且每次调用都发送一遍,缓存它肯定划算。

批量处理:打折的token

两家提供商都对非实时工作负载提供固定50%的折扣(有点像淡季折扣)。如果一项任务不需要即时响应,就没有理由按实时价格付费。

模型路由:价格匹配的token

不是每个请求都值得用前沿模型。把简单的调用路由到经济型模型,把前沿模型留给真正需要的任务。持续这样做的团队报告成本降低了40%到60%。

提示词压缩:更少的token

把每个token都当成赚来的。审计系统提示词中那些不再有意义的指令,收紧检索到的上下文(别花钱给模型发送无关材料),指令只说需要说的,一字不多。

零token选项:最好的提示是没有提示

在优化如何提示之前,先问问自己到底该不该用提示。通过 MCP 服务器爬取一个网页要消耗数千个token;直接调用API则一分钱不花。

Anthropic 的工程团队曾记录过,一个由5台服务器组成的MCP配置在对话开始前就消耗了大约55,000个token。

在最近一次针对 Salesforce、Snowflake和 ServiceNow 进行联邦查询的基准测试中,CData的 Amit Naik 在不同架构配置下实现了 97.6%的token支出削减——从每次查询0.596美元降到0.027美元,使用的模型、数据和提示词完全相同。

MCP 作为原型的起点是合理的,但它很少是最优终点。架构决策——比如什么走模型、什么绕开模型——往往比任何提示工程技巧都能节省更多成本。

从工程实践到董事会议题

如果成本每年下降10倍,为什么不干脆等着?

因为消费增长的速度比价格下降的速度更快。因为现在建立成本纪律的企业,正在培养一种工程文化——通过更精简的提示、更智能的路由和更好的可观测性实现长期复利。也因为,粗放式使用token慢慢会被精细化运营代替。

Linux基金会新近宣布的 Tokenomics Foundation(token经济学基金会)得到了 Google、Microsoft、IBM 和 JPMorgan Chase 的支持——这标志着token成本治理正从工程最佳实践,上升为董事会层面的议题。

据德勤(Deloitte)估计,当企业AI支出在某些公司达到IT预算的25%到50%时,CFO就不会再把token当作一个普通行项目,而是将其视为一场战略性投入。

声明:包含AI生成内容

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
25岁中国女留学生遇害案新进展!韩警方确认双方恋人关系,更多细节曝光,疑点彻底失控

25岁中国女留学生遇害案新进展!韩警方确认双方恋人关系,更多细节曝光,疑点彻底失控

老猫观点
2026-09-05 08:05:41
沉默六天,终于瞒不住了!中方拦截秋刀渔船,日本政府罕见失声

沉默六天,终于瞒不住了!中方拦截秋刀渔船,日本政府罕见失声

铁锤侃侃而谈
2026-09-06 09:54:34
消息终于曝光?沉默六天,中方登上秋刀渔船,日本政府罕见失声

消息终于曝光?沉默六天,中方登上秋刀渔船,日本政府罕见失声

凡知
2026-09-06 13:51:13
王晶爆张国荣跳楼内幕!抑郁症只是一方面,受内地金主影响最大

王晶爆张国荣跳楼内幕!抑郁症只是一方面,受内地金主影响最大

可乐谈情感
2026-08-30 07:27:10
54岁张东健波士顿送儿子上学,容貌俊朗没咋老,身形健硕全是肌肉

54岁张东健波士顿送儿子上学,容貌俊朗没咋老,身形健硕全是肌肉

娱圈办事处
2026-09-02 18:29:54
27.98万起!奥迪官宣:降价18.78万!

27.98万起!奥迪官宣:降价18.78万!

DeepAuto车探
2026-09-04 14:07:08
事关千万老师,教师法有新进展,30年教龄待遇待官宣

事关千万老师,教师法有新进展,30年教龄待遇待官宣

鬼菜生活
2026-09-06 06:57:09
萨巴比赛因大麻味太冲一度被迫暂停,赛后:再闻下去我也要上头了

萨巴比赛因大麻味太冲一度被迫暂停,赛后:再闻下去我也要上头了

网球之家
2026-09-05 23:27:33
早读 | 善待自己,精致到老

早读 | 善待自己,精致到老

诗词天地
2026-02-09 05:59:44
《华盛顿邮报》和福山点评特朗普亲俄,说得太准了

《华盛顿邮报》和福山点评特朗普亲俄,说得太准了

鹰眼Defence
2026-09-05 16:06:14
美国没料到,日本也没料到,现在的中国云南省,已成为全球焦点

美国没料到,日本也没料到,现在的中国云南省,已成为全球焦点

阿鄖田间生活
2026-09-06 13:20:09
莎拉没想到,弹劾案关键证人出现后,局势反转,小马科斯或躺赢

莎拉没想到,弹劾案关键证人出现后,局势反转,小马科斯或躺赢

面包夹知识
2026-09-06 13:22:23
宇树科技市值短短几天就蒸发了2200个亿,这些钱到底去哪里了?

宇树科技市值短短几天就蒸发了2200个亿,这些钱到底去哪里了?

流苏晚晴
2026-09-06 13:43:28
舆论升级!苏州一厨师主动辞职、工资结清,转头索要5.4万社保赔偿,网友怒斥:这种过河拆桥的人,最终没有好下场的

舆论升级!苏州一厨师主动辞职、工资结清,转头索要5.4万社保赔偿,网友怒斥:这种过河拆桥的人,最终没有好下场的

火山詩话
2026-09-05 06:06:47
1米3袖珍美女:嫁给1米48男孩,婚后丈夫奇迹长高,最终不欢而散

1米3袖珍美女:嫁给1米48男孩,婚后丈夫奇迹长高,最终不欢而散

梦醉为红颜一笑
2026-09-05 01:01:29
乒乓球联赛:大爆冷!日本名将大藤沙月2:3输球,佐藤瞳3:2险胜

乒乓球联赛:大爆冷!日本名将大藤沙月2:3输球,佐藤瞳3:2险胜

国乒二三事
2026-09-06 07:52:56
21世纪世界最伟大的 10 位数学家(综合影响力参考排名)

21世纪世界最伟大的 10 位数学家(综合影响力参考排名)

林子说事
2026-09-05 02:35:10
49岁中国公民尼泊尔泥石流灾害后失联10天奇迹获救:爬到了隧道最高处,多次看到搜救灯光并大声呼喊

49岁中国公民尼泊尔泥石流灾害后失联10天奇迹获救:爬到了隧道最高处,多次看到搜救灯光并大声呼喊

19楼
2026-09-06 08:54:12
“你就是一普通中年妇女,装什么嫩啊!”女子伪装儿子女友被喷!

“你就是一普通中年妇女,装什么嫩啊!”女子伪装儿子女友被喷!

世界圈
2026-07-13 12:38:30
牺牲114人消灭解放军1000人,班公洛战役,印少校一人改变战局?

牺牲114人消灭解放军1000人,班公洛战役,印少校一人改变战局?

楚风说历史
2026-08-19 09:30:03
2026-09-06 15:00:49
Ai时代前沿
Ai时代前沿
人工智能新闻动态及应用案例。
1850文章数 512关注度
往期回顾 全部

科技要闻

DeepSeek被曝将采购16万颗华为昇腾950DT

头条要闻

男子官网订购特斯拉到外地提车 晚到10分钟未领到补贴

头条要闻

男子官网订购特斯拉到外地提车 晚到10分钟未领到补贴

体育要闻

本西蒙斯加盟国王,不管怎样,回来就好

娱乐要闻

低调富养!郭富城两女儿入读香港名校

财经要闻

亏损高达200亿,昔日彩电霸主走下巅峰!

汽车要闻

带升降立标MPV 岚图梦想家9预售价42.99万起

态度原创

房产
时尚
旅游
本地
军事航空

房产要闻

突发重磅!海口出台楼市新政!

金秋最流行的鞋子,“红色”更时髦!

旅游要闻

永定河休闲森林公园焕新重启,观光小火车同步投入运营

本地新闻

扒完小作文,富豪们私藏的度假胜地有多绝

军事要闻

美伊互袭油轮 伊朗军方称或对美进行更大规模打击

无障碍浏览 进入关怀版