网易首页 > 网易号 > 正文 申请入驻

企业AI成本清算:为什么token价格在下跌你的钱还越花越多

0
分享至

Uber 首席技术官 Praveen Neppalli Naga 今年5月坦言,原本为 Claude Code 划拨的预算"早就被花光了"。Box 首席执行官 Aaron Levie 今年3月警告称,随着AI智能体从工程领域扩展到法律、销售和其他知识工作领域,"计算预算只会随着时间一直递增"。


Ramp 的内部数据显示,从2025年1月到2026年初,企业级token支出增长了13倍。

这一切本不该发生。如今token的价格正在直线下跌。有人将这种现象称为 "LLMflation"(大模型通缩) ——即在同等模型性能下,推理成本每年下降10倍,比摩尔定律更快,比宽带更快,也比以往任何技术商品化的速度都更快。

2021年,GPT-3 质量水平的模型每百万token需要60美元;现在只需要0.06美元,三年间下降了1000倍。

经济学规律与账单数字对不上了。而这正是企业IT战略专家在下一个规划周期之前必须面对且理解的命题。

企业AI经济学的核心悖论

当年摩尔定律让软件行业膨胀、宽带普及让网络流量泛滥的同一股力量,如今正在AI领域重演——这是杰文斯悖论(Jevons paradox)的最新例证。

19世纪经济学家 William Stanley Jevons 观察到,当蒸汽机效率提高后,煤炭消耗量非但没有下降,反而激增了——因为效率解锁了全新的用途。当一种资源变得更便宜时,人们不会减少消耗,反而会为它找到十种新的用法。


企业AI就是教科书般的案例。

以前生产环境中只运行一个模型的团队,现在运行五个。过去只发送50个token的 RAG 流水线,现在发送4000个。智能体为了完成一项任务要循环调用数十次。初级开发者可以自由地提示迭代,换作一年前这种用法会因成本过高而不可行。

根据 Gartner 的数据,agentic模型(自主智能体模型)所需的token量是标准聊天机器人的5到30倍

人均成本在下降,但人们对更多token的需求增长得更快。

大多数企业没有追踪的结构性成本驱动因素

Token (词元)是AI基础设施的原子单位,就像CPU周期和带宽之于上一代技术。

  • 输入token:承载你发送给模型的内容
  • 输出token:承载模型生成返回的内容

输出token的成本要高得多,原因是物理层面的:模型在单次计算遍历中就能读完你的全部输入,但生成输出时是一个token接一个token地生成——每生成一个token都要让整个网络跑一遍完整计算。一个1000 token的响应,大约需要1000次独立遍历。

这种不对称性直接体现在定价中,而且差距还在拉大。

  • Claude Sonnet 4.6:输入3美元/百万token,输出15美元/百万token——Anthropic 当前所有型号都保持5倍的稳定差距
  • GPT-5.4:输入2.50美元,输出15美元——6倍差距,明显高于其前身 GPT-4o 在相同输入价位下的4倍比例

随着模型将更多算力投入到更高质量的输出中,生成成本与理解成本之间的距离正在越拉越远。

但token价格只是故事的一部分。真正吃掉预算的是结构性因素。

RAG 流水线是最大的"元凶"

用户输入一个50 token的问题。等到你的系统把检索到的上下文、对话历史和系统提示词全部拼上去,这次调用就变成了4000个token——一个用户永远看不到、财务团队也可能没在追踪的80倍开销。

推理模型增加了又一层

像 GPT-5.4 Thinking 和 Claude 的具备扩展思考模式的模型,在回复之前会生成内部的"思考token"(thinking tokens)。这些token会计入你的账单,尽管你永远看不到它们。一个复杂的推理调用可能在输出第一个字之前,就已经悄无声息地消耗了数千个token。

还有 tokenmaxxing(token滥用)

Tokenmaxxing 是一种趋势:团队把便宜的token当成免费的。提示词越来越臃肿,因为开发者添加了并不需要的上下文;对话越拖越长,因为没人去裁剪历史记录;智能体在循环中打转,而一个结构清晰的单次查询本就能得到答案。Uber 的例子就是典型。

模型选择才是倍数效应的放大器

所有主要提供商都按百万token收费,但价格区间大得惊人:

  • 前沿端:OpenAI 的 GPT-5.5 Pro 为 输入30美元/输出180美元(每百万token)
  • 经济型:GPT-4.1 Nano 为 输入0.10美元/输出0.40美元

也就是说,输入端有150倍的价差,输出端有450倍的价差——而很多时候,这些任务在功能上是等效的。


生产环境中的成本差异很少有这么极端,但也不需要那么极端。在专业机构最近的一次对照实验中,使用同一个智能体编码任务、相同运行时间、相同沙箱环境,两种不同模型产生的token量相近,但成本分别为1.20美元和97美元。唯一的变量就是模型选择。

优化手册:从战术到架构

大多数企业都是在账单到手时才发现自己的token问题。到那时,使用习惯已经形成,架构已经部署,优化就像事后改装一样被动。

但事情不必如此。下面的策略涵盖了从今天就能拨动的开关,到会随时间复利的架构决策。

提示词缓存:重复利用的token

这对大多数团队来说是投资回报率最高的动作。缓存重复的上下文可以节省高达90%的输入token成本,在 Anthropic 和 OpenAI 上,批量处理还能再额外节省50%。如果你的系统提示词超过2000个token,而且每次调用都发送一遍,缓存它肯定划算。

批量处理:打折的token

两家提供商都对非实时工作负载提供固定50%的折扣(有点像淡季折扣)。如果一项任务不需要即时响应,就没有理由按实时价格付费。

模型路由:价格匹配的token

不是每个请求都值得用前沿模型。把简单的调用路由到经济型模型,把前沿模型留给真正需要的任务。持续这样做的团队报告成本降低了40%到60%。

提示词压缩:更少的token

把每个token都当成赚来的。审计系统提示词中那些不再有意义的指令,收紧检索到的上下文(别花钱给模型发送无关材料),指令只说需要说的,一字不多。

零token选项:最好的提示是没有提示

在优化如何提示之前,先问问自己到底该不该用提示。通过 MCP 服务器爬取一个网页要消耗数千个token;直接调用API则一分钱不花。

Anthropic 的工程团队曾记录过,一个由5台服务器组成的MCP配置在对话开始前就消耗了大约55,000个token。

在最近一次针对 Salesforce、Snowflake和 ServiceNow 进行联邦查询的基准测试中,CData的 Amit Naik 在不同架构配置下实现了 97.6%的token支出削减——从每次查询0.596美元降到0.027美元,使用的模型、数据和提示词完全相同。

MCP 作为原型的起点是合理的,但它很少是最优终点。架构决策——比如什么走模型、什么绕开模型——往往比任何提示工程技巧都能节省更多成本。

从工程实践到董事会议题

如果成本每年下降10倍,为什么不干脆等着?

因为消费增长的速度比价格下降的速度更快。因为现在建立成本纪律的企业,正在培养一种工程文化——通过更精简的提示、更智能的路由和更好的可观测性实现长期复利。也因为,粗放式使用token慢慢会被精细化运营代替。

Linux基金会新近宣布的 Tokenomics Foundation(token经济学基金会)得到了 Google、Microsoft、IBM 和 JPMorgan Chase 的支持——这标志着token成本治理正从工程最佳实践,上升为董事会层面的议题。

据德勤(Deloitte)估计,当企业AI支出在某些公司达到IT预算的25%到50%时,CFO就不会再把token当作一个普通行项目,而是将其视为一场战略性投入。

声明:包含AI生成内容

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
内斗结局要来?下令逮捕莎拉,复仇之战已然打响,17万菲军成关键

内斗结局要来?下令逮捕莎拉,复仇之战已然打响,17万菲军成关键

安珈使者啊
2026-09-06 09:47:12
盘点用星宇车灯的车企,问界蔚来曾作为卖点!目前仅3家回应劝退风波

盘点用星宇车灯的车企,问界蔚来曾作为卖点!目前仅3家回应劝退风波

财通社
2026-09-05 13:44:10
纷纷下场当网红的“厂二代”们,真帮自家生意起死回生了?

纷纷下场当网红的“厂二代”们,真帮自家生意起死回生了?

秋叶大叔
2026-08-27 07:39:04
电视剧《交锋》今晚开播,王凯 欧豪主演,能成为现象级爆款剧吗?

电视剧《交锋》今晚开播,王凯 欧豪主演,能成为现象级爆款剧吗?

愚与趣
2026-09-06 08:20:17
玄学提醒:如果一个人还在穿着10年前的衣服,只说明几个问题

玄学提醒:如果一个人还在穿着10年前的衣服,只说明几个问题

木言观
2026-08-01 13:58:35
18岁严子怡,拿下钻石联赛年度总冠军!一度落后,第5投掷出68米42,一举反超!北口榛花65米44收获亚军

18岁严子怡,拿下钻石联赛年度总冠军!一度落后,第5投掷出68米42,一举反超!北口榛花65米44收获亚军

开成运动会
2026-09-06 07:16:50
神来之笔!卖掉 1.25 亿恩佐,阿隆索挖掘出世界顶级中场

神来之笔!卖掉 1.25 亿恩佐,阿隆索挖掘出世界顶级中场

一隅非生
2026-09-06 10:33:19
我22岁那年和38岁的女房东之间,发生过一段至今不敢提的往事

我22岁那年和38岁的女房东之间,发生过一段至今不敢提的往事

千秋文化
2026-09-02 19:30:56
54岁曾子墨近况曝光!嫁小2岁金融大佬黎辉,连生两子被宠成公主

54岁曾子墨近况曝光!嫁小2岁金融大佬黎辉,连生两子被宠成公主

代军哥哥谈娱乐
2026-09-05 11:34:32
乌度卡用人遭质疑:天赋新星与冠军老将的错位困局

乌度卡用人遭质疑:天赋新星与冠军老将的错位困局

绿茵狂热者
2026-09-05 09:00:05
中美又一场争夺战,已在全球范围打响,战况已为中国敲响了警钟

中美又一场争夺战,已在全球范围打响,战况已为中国敲响了警钟

潋滟晴方DAY
2026-08-31 11:47:38
羽球爆大冷!决赛诞生,世界第二被淘汰,国羽1胜2负,王祉怡憾负

羽球爆大冷!决赛诞生,世界第二被淘汰,国羽1胜2负,王祉怡憾负

南海浪花
2026-09-05 18:55:51
海航双胞胎姐妹花空姐,同时怀孕了

海航双胞胎姐妹花空姐,同时怀孕了

微微热评
2026-09-03 12:18:33
成都“牵手门”事件女主现今状况曝光,太惨了......

成都“牵手门”事件女主现今状况曝光,太惨了......

许三岁
2026-03-17 07:34:05
宏远速递!杜锋爱将自宣离队,新主帅首次表态,徐杰正式发声

宏远速递!杜锋爱将自宣离队,新主帅首次表态,徐杰正式发声

多特体育说
2026-09-05 22:31:30
当年为什么查办褚时健?

当年为什么查办褚时健?

百晓生谈历史
2025-08-20 21:55:53
冉莹颖主动塞钱给爸爸三婚妻子:“我不是给他的,我是给您拿的”

冉莹颖主动塞钱给爸爸三婚妻子:“我不是给他的,我是给您拿的”

韩小娱
2026-09-06 10:31:51
新能源汽车动力电池将迎“退役潮”,废旧电池何去何从

新能源汽车动力电池将迎“退役潮”,废旧电池何去何从

澎湃新闻
2026-09-06 08:26:39
“我又不是他妈”20岁女儿拒绝抚养姐姐的孩子,被父母告上法庭

“我又不是他妈”20岁女儿拒绝抚养姐姐的孩子,被父母告上法庭

案件记录员
2025-02-28 10:20:03
琼斯:齐沃几句话就能让我们明白他的想法,他完美管理着球队

琼斯:齐沃几句话就能让我们明白他的想法,他完美管理着球队

懂球帝
2026-09-06 03:26:10
2026-09-06 11:08:49
Ai时代前沿
Ai时代前沿
人工智能新闻动态及应用案例。
1850文章数 512关注度
往期回顾 全部

科技要闻

DeepSeek被曝将采购16万颗华为昇腾950DT

头条要闻

牛弹琴:日本急了 高市亲自抗议用日语、俄语各说一遍

头条要闻

牛弹琴:日本急了 高市亲自抗议用日语、俄语各说一遍

体育要闻

本西蒙斯加盟国王,不管怎样,回来就好

娱乐要闻

低调富养!郭富城两女儿入读香港名校

财经要闻

亏损高达200亿,昔日彩电霸主走下巅峰!

汽车要闻

带升降立标MPV 岚图梦想家9预售价42.99万起

态度原创

家居
手机
亲子
游戏
公开课

家居要闻

2026建博会(广州) 公装联探展交流活动

手机要闻

CASETiFY联合漫威推出蜘蛛侠联名iPhone外设,国行259元起

亲子要闻

揪心一幕:幼儿园开学,孩子哭闹、甚至逃跑,家长不舍地扒墙观望

GTA6地图空前庞大!数百个房屋可进 大量信息曝光

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版