Uber 首席技术官 Praveen Neppalli Naga 今年5月坦言,原本为 Claude Code 划拨的预算"早就被花光了"。Box 首席执行官 Aaron Levie 今年3月警告称,随着AI智能体从工程领域扩展到法律、销售和其他知识工作领域,"计算预算只会随着时间一直递增"。
![]()
Ramp 的内部数据显示,从2025年1月到2026年初,企业级token支出增长了13倍。
这一切本不该发生。如今token的价格正在直线下跌。有人将这种现象称为 "LLMflation"(大模型通缩) ——即在同等模型性能下,推理成本每年下降10倍,比摩尔定律更快,比宽带更快,也比以往任何技术商品化的速度都更快。
2021年,GPT-3 质量水平的模型每百万token需要60美元;现在只需要0.06美元,三年间下降了1000倍。
经济学规律与账单数字对不上了。而这正是企业IT战略专家在下一个规划周期之前必须面对且理解的命题。
企业AI经济学的核心悖论
当年摩尔定律让软件行业膨胀、宽带普及让网络流量泛滥的同一股力量,如今正在AI领域重演——这是杰文斯悖论(Jevons paradox)的最新例证。
19世纪经济学家 William Stanley Jevons 观察到,当蒸汽机效率提高后,煤炭消耗量非但没有下降,反而激增了——因为效率解锁了全新的用途。当一种资源变得更便宜时,人们不会减少消耗,反而会为它找到十种新的用法。
![]()
企业AI就是教科书般的案例。
以前生产环境中只运行一个模型的团队,现在运行五个。过去只发送50个token的 RAG 流水线,现在发送4000个。智能体为了完成一项任务要循环调用数十次。初级开发者可以自由地提示迭代,换作一年前这种用法会因成本过高而不可行。
根据 Gartner 的数据,agentic模型(自主智能体模型)所需的token量是标准聊天机器人的5到30倍。
人均成本在下降,但人们对更多token的需求增长得更快。
大多数企业没有追踪的结构性成本驱动因素
Token (词元)是AI基础设施的原子单位,就像CPU周期和带宽之于上一代技术。
- 输入token:承载你发送给模型的内容
- 输出token:承载模型生成返回的内容
输出token的成本要高得多,原因是物理层面的:模型在单次计算遍历中就能读完你的全部输入,但生成输出时是一个token接一个token地生成——每生成一个token都要让整个网络跑一遍完整计算。一个1000 token的响应,大约需要1000次独立遍历。
这种不对称性直接体现在定价中,而且差距还在拉大。
- Claude Sonnet 4.6:输入3美元/百万token,输出15美元/百万token——Anthropic 当前所有型号都保持5倍的稳定差距
- GPT-5.4:输入2.50美元,输出15美元——6倍差距,明显高于其前身 GPT-4o 在相同输入价位下的4倍比例
随着模型将更多算力投入到更高质量的输出中,生成成本与理解成本之间的距离正在越拉越远。
但token价格只是故事的一部分。真正吃掉预算的是结构性因素。
RAG 流水线是最大的"元凶"
用户输入一个50 token的问题。等到你的系统把检索到的上下文、对话历史和系统提示词全部拼上去,这次调用就变成了4000个token——一个用户永远看不到、财务团队也可能没在追踪的80倍开销。
推理模型增加了又一层
像 GPT-5.4 Thinking 和 Claude 的具备扩展思考模式的模型,在回复之前会生成内部的"思考token"(thinking tokens)。这些token会计入你的账单,尽管你永远看不到它们。一个复杂的推理调用可能在输出第一个字之前,就已经悄无声息地消耗了数千个token。
还有 tokenmaxxing(token滥用)
Tokenmaxxing 是一种趋势:团队把便宜的token当成免费的。提示词越来越臃肿,因为开发者添加了并不需要的上下文;对话越拖越长,因为没人去裁剪历史记录;智能体在循环中打转,而一个结构清晰的单次查询本就能得到答案。Uber 的例子就是典型。
模型选择才是倍数效应的放大器
所有主要提供商都按百万token收费,但价格区间大得惊人:
- 前沿端:OpenAI 的 GPT-5.5 Pro 为 输入30美元/输出180美元(每百万token)
- 经济型:GPT-4.1 Nano 为 输入0.10美元/输出0.40美元
也就是说,输入端有150倍的价差,输出端有450倍的价差——而很多时候,这些任务在功能上是等效的。
![]()
生产环境中的成本差异很少有这么极端,但也不需要那么极端。在专业机构最近的一次对照实验中,使用同一个智能体编码任务、相同运行时间、相同沙箱环境,两种不同模型产生的token量相近,但成本分别为1.20美元和97美元。唯一的变量就是模型选择。
优化手册:从战术到架构
大多数企业都是在账单到手时才发现自己的token问题。到那时,使用习惯已经形成,架构已经部署,优化就像事后改装一样被动。
但事情不必如此。下面的策略涵盖了从今天就能拨动的开关,到会随时间复利的架构决策。
提示词缓存:重复利用的token
这对大多数团队来说是投资回报率最高的动作。缓存重复的上下文可以节省高达90%的输入token成本,在 Anthropic 和 OpenAI 上,批量处理还能再额外节省50%。如果你的系统提示词超过2000个token,而且每次调用都发送一遍,缓存它肯定划算。
批量处理:打折的token
两家提供商都对非实时工作负载提供固定50%的折扣(有点像淡季折扣)。如果一项任务不需要即时响应,就没有理由按实时价格付费。
模型路由:价格匹配的token
不是每个请求都值得用前沿模型。把简单的调用路由到经济型模型,把前沿模型留给真正需要的任务。持续这样做的团队报告成本降低了40%到60%。
提示词压缩:更少的token
把每个token都当成赚来的。审计系统提示词中那些不再有意义的指令,收紧检索到的上下文(别花钱给模型发送无关材料),指令只说需要说的,一字不多。
零token选项:最好的提示是没有提示
在优化如何提示之前,先问问自己到底该不该用提示。通过 MCP 服务器爬取一个网页要消耗数千个token;直接调用API则一分钱不花。
Anthropic 的工程团队曾记录过,一个由5台服务器组成的MCP配置在对话开始前就消耗了大约55,000个token。
在最近一次针对 Salesforce、Snowflake和 ServiceNow 进行联邦查询的基准测试中,CData的 Amit Naik 在不同架构配置下实现了 97.6%的token支出削减——从每次查询0.596美元降到0.027美元,使用的模型、数据和提示词完全相同。
MCP 作为原型的起点是合理的,但它很少是最优终点。架构决策——比如什么走模型、什么绕开模型——往往比任何提示工程技巧都能节省更多成本。
从工程实践到董事会议题
如果成本每年下降10倍,为什么不干脆等着?
因为消费增长的速度比价格下降的速度更快。因为现在建立成本纪律的企业,正在培养一种工程文化——通过更精简的提示、更智能的路由和更好的可观测性实现长期复利。也因为,粗放式使用token慢慢会被精细化运营代替。
Linux基金会新近宣布的 Tokenomics Foundation(token经济学基金会)得到了 Google、Microsoft、IBM 和 JPMorgan Chase 的支持——这标志着token成本治理正从工程最佳实践,上升为董事会层面的议题。
据德勤(Deloitte)估计,当企业AI支出在某些公司达到IT预算的25%到50%时,CFO就不会再把token当作一个普通行项目,而是将其视为一场战略性投入。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.