网易首页 > 网易号 > 正文 申请入驻

每1美元,中国AI给你115万个token,美国只给3万个

0
分享至

作者:快思慢想研究院 田丰,Global Times 张蔚蓝

引言


今年6月,美国AI创业公司Lindy的CEO做了一个决定:把公司所有流量从Anthropic的Claude切换到DeepSeek。他对外界的解释简洁到近乎粗暴——"接下来几个月,这个决定将为我们节省数百万美元。"

这不是一次情绪化的叛逃,而是一道纯粹的算术题。

用1美元,调用DeepSeek V4-Pro可以生成115万个输出token;同样的钱,在Anthropic Claude Opus 4.8上只能买到4万个token,在OpenAI GPT-5.5上只能买到3.3万个。价差,是28到34倍。


Lindy不是孤例。OpenRouter是全球最大的AI模型聚合路由平台,开发者在这里可以同时接入400余款模型、自由切换。它的流量数据,是目前观察全球开发者真实选择的最直接窗口。数据显示,自今年2月8日起,美国企业通过OpenRouter调用中国AI模型的token占比,每周均超过30%,峰值达到46%。而过去12个月的均值不过11%,2025年上半年更低至4.5%。

18个月,从4.5%到46%。硅谷的开发者正在用每一次API调用投票。

一、架构重塑成本:V4将推理算力需求打到V3.2的27%


经济学中,价格是成本的镜像。要理解中国AI模型为何能定出10倍乃至34倍于对手的价格差距,必须从成本结构的源头读起。

成本结构来自算法架构,这是第一性原理。

2026年4月24日,DeepSeek发布V4系列,分为V4-Pro和V4-Flash两个变体。V4-Pro总参数量1.6万亿,但每次推理仅激活490亿参数;V4-Flash总参数量2840亿,激活130亿。两款模型均以MIT协议开源,原生支持100万token上下文窗口。这个"激活参数"的概念,是理解中国AI成本优势的关键钥匙。

传统稠密模型(Dense Model)的计算方式,好比一家工厂接到每一份订单都要开动全部生产线——无论任务大小,全体员工到岗。MoE(混合专家)架构的革新在于:针对不同任务动态路由、仅激活最相关的"专家子网络"。V4-Pro的1.6万亿参数是全厂总产能,但每次生产只调用490亿参数的精锐小组,计算效率与一款单独训练的490亿参数稠密模型相当,却同时保有万亿级参数带来的深度知识储备。

但V4真正的架构突破,在注意力机制层面的再一次革命。

V3系列使用的MLA(多头潜在注意力)已是业界领先的KV缓存压缩技术。V4在此基础上引入混合注意力架构,融合CSA(压缩稀疏注意力)与HCA(重度压缩注意力):CSA通过可学习稀疏模式处理长程token之间的关联选择,HCA对本地窗口缓存做极端秩压缩。效果直接写进了技术报告:在100万token的上下文场景下,V4-Pro所需的单token推理FLOPs仅为V3.2的27%,KV缓存降至10%;V4-Flash更极端,FLOPs压至10%,KV缓存降至7%。


这是什么概念?同等的推理算力投入,V4-Pro服务的token吞吐量相当于V3.2的近四倍。不是升级了服务器,是把同一台机器的产出效率扩大了四倍。

DeepSeek在V4技术报告中同时披露,V4训练语料超过32万亿token,引入了Manifold-Constrained Hyper-Connections(mHC)替代传统残差连接,强化超大规模训练中的信号传播稳定性;Muon优化器用于加速收敛;MoE专家权重采用FP4量化感知训练,进一步压缩内存与计算开销。

有一点值得坦诚说明:与V3技术报告完整披露训练成本(2.788M H800 GPU小时、约556万美元,对比GPT-4估计超1亿美元)不同,V4技术报告未公开训练总算力消耗与成本数字。DeepSeek仅披露了架构设计与推理效率数据。但逻辑闭环仍然成立:推理侧的算力需求已从技术报告中得到量化验证——百万token上下文的推理成本降至V3.2的约四分之一,这是新一代注意力架构带来的确定性成本坍塌。

这里还有一个不可忽略的背景:美国对华芯片出口管制,限制了中国AI实验室获取最先进GPU的渠道,客观上倒逼中国团队在算法效率上加倍投入。MoE架构、多头潜在注意力、FP8混合精度训练——这些技术路线的持续深耕,从某种意义上是在算力约束下磨砺出来的刀法。限制造就了专注,专注产生了降本的边际效率,而这种效率最终反哺为全球开发者可感知的价格优势。

芯片侧还有一个信号,战略意义甚至超过算法本身。V4是第一款深度适配华为昇腾AI芯片(Ascend 910B与950系列)、使用CANN开源软件栈(算子库、通信库)的前沿级开源模型,训练与推理均可在非NVIDIA硬件上完成。在华为昇腾950DT平台实测数据中,V4-Pro高并发推理吞吐量为每秒388 token,延迟约20毫秒;V4-Flash则达每秒4722 token。英伟达CEO黄仁勋在V4发布前8天接受播客采访时曾表示,"DeepSeek先于英伟达在华为芯片上跑起来"是他不愿看到的结局。8天后,V4发布,他所担心的事情成真了。

斯坦福2026年AI Index报告提供了最直接的宏观坐标:美中两国最强模型之间的能力差距,已从2023年5月的17.5至31.6个百分点收窄至2026年3月的2.7%,而美国的私募AI投资是中国的23倍(2859亿美元对124亿美元)。报告的结论一针见血:美国走的是"以资本换能力"路线,中国走的是"以效率换能力"路线。

快思慢想研究院的判断是,MoE稀疏激活体系每一代迭代(V2→V3→V4)的效率增益呈非线性累积。这是架构红利的复利效应,不是一次性技术突破——每部署一个token,边际成本差距就被复现一次。

二、开源是国家战略,不是慈善:定价目标的根本切换


价格背后是定价目标,定价目标背后是商业逻辑。

Anthropic在2026年5月完成H轮融资,估值攀至9650亿美元;OpenAI最新估值为8520亿美元,均已备案IPO。这两家公司的高API定价,承担着多重不可回避的结构性成本:推理成本占生产AI系统总预算的80%至90%,闭源模型还需叠加安全对齐研发的持续投入、企业服务基础设施的搭建,以及对规模空前的外部投资人的回报承诺。接近万亿美元的估值是一把双刃剑——它代表市场信心,也锁定了高定价的必要性。

中国模型的开源策略,彻底解构了这一套定价方程。

以DeepSeek V4-Flash为例,其API输入定价仅为每百万token $0.14、输出$0.28。V4-Pro更设计了一项专门针对Agent工作流的定价机制:缓存命中时的输入价格降至每百万token $0.003625,相对标准输入价格折扣达120倍。开放权重意味着开发者可自行下载并在本地硬件上运行,发布方无需为每一次调用收取边际利润,收入目标从"单次API的定价权"切换为"通过生态扩散建立分发护城河,再从云服务或企业定制中间接变现"。


这一策略的市场渗透效果已可量化。2026年2月,Alibaba的Qwen单月下载量达1.536亿次,超过Meta、DeepSeek、OpenAI、Mistral等后八名的总和。Qwen在Hugging Face上拥有超过18万个衍生模型,数量超过Google和Meta的总和。斯坦福、UC Berkeley的研究人员以低至30至50美元的成本基于Qwen训练出了表现领先的专用模型。新加坡政府选择了Qwen而非Meta的Llama,作为构建本国主权AI模型的基础底座。

斯坦福2026年AI Index的另一项数据提供了更深层的佐证:全球100篇最高引用AI论文中,中国机构的贡献已从2021年的33篇增长至2024年的41篇。这说明这场成本革命的底层,有一个充沛的技术研究储备在持续供给。

推动美国企业转向的,除了成本,还有另一股力量:美国国内对头部AI模型的监管审查正在收紧。合规压力、数据主权争议与模型使用条款的不确定性,催促部分海外企业主动寻找替代方案。中国开源模型恰好在这一节点提供了在本地部署、自主可控、成本更低的完整选项——这三个属性的组合,在企业级采购决策中具有较强说服力。

Andreessen Horowitz合伙人Martin Casado给出的数据,让硅谷内部感到不安:使用开源技术栈的AI创业公司中,约80%正在运行中国模型。

快思慢想研究院的判断是,中国主流AI实验室没有AppStore式封闭生态需要保护,反而得以用开源换市场份额而无历史包袱。开源是将成本优势转化为分发优势的战略乘数——这一策略已将竞争压力反向传导至OpenAI,促使其发布了自己的开源模型gpt-oss。市场的逻辑一旦成立,就有自我强化的能力。

三、Agent时代改变了一切:价差从"折扣"变成"生死线"


成本差距并非2026年才出现,却在这一年初突然成为市场的决定性变量。触发点是计算范式的切换。

英伟达CEO黄仁勋在多个场合强调,token是AI时代的货币,生产和消费token将驱动AI经济的未来。这句话在2026年初被Agent浪潮赋予了新的分量。

AI的工作方式正在发生根本改变。一次普通对话,模型响应一次;一个Agent任务——让AI自动规划、编写、测试、修正一段代码,或者自主完成一项研究——模型需要被反复调用数十乃至数百次。OpenRouter的实测数据显示,Agentic工作负载每次请求消耗的token量约是普通人机对话的15倍。编程类任务在OpenRouter平台的占比从2025年初的11%跃升至2026年中的50%以上,Agent驱动的输出token已占平台总量的多数——而这一爆发式增长集中在2026年2月之后。

这一转变,让原本可以被品牌溢价覆盖的价格差距,变成了直接穿透月度研发预算的硬约束。


以一项标准化编程工作负载为基准:同等任务在DeepSeek上耗费1071美元,在Claude上耗费4811美元,差距约4.5倍。单次调用的成本差距可能只是财务报表上的一个小数点,但在每日自动化调用数千次的Agent工作流下,这个差距直接决定了一家创业公司的技术路线是否在经济上可持续。这是Lindy做出决定的真实逻辑——他们切换的不是品牌偏好,是生存必选项。

值得关注的是,这种成本压力在不同行业的传导方式并不相同。资深电信产业观察者向锂光指出,AI落地的最后一公里是推理,而推理环节的token消耗才是真正的成本核心。对于很多实际场景——自动驾驶的实时感知决策、医疗问诊的高频辅助、家用机器人的指令响应——业务需要的不是最贵的旗舰模型,而是在足够的精度下以最低成本持续运行的推理能力。DeepSeek、智谱AI、阿里Qwen等中国厂商恰恰在架构优化、token效率与更智能的推理策略上持续投入,在单位算力产出上具备系统性优势,这使其在高频、长尾、对成本极度敏感的企业应用场景中,成为优先入选项而非将就之选。

更值得关注的是机构客户的行为迁移。OpenRouter数据显示,包括AI原生公司和大型组织在内的企业级用户,在2026年6月初向DeepSeek路由的token流量远超年初水平。这说明主动转向中国模型的,不只是预算有限的初创团队,具有真实议价能力的机构客户也在做出同样选择。

智谱AI的GLM 5.2提供了另一个维度的例证:在一项主流Agent基准测试中,GLM 5.2的得分与Anthropic Opus 4.8相差不足1%,但使用成本仅为后者的五分之一。这已经不是"便宜但将就"的逻辑,而是"同等能力、更低成本"的竞争格局——“智价比”正在成为企业级采购的首要筛选条件。

V4-Pro的缓存命中定价印证了这一取向:每百万输入token $0.003625,是标准输入价格的1/120。这一机制专门面向Agent工作流的结构性特征而设计——稳定的系统提示和RAG上下文在多轮调用中被反复使用,缓存折扣在高频Agent场景下的实际节省幅度,远超表面价差所展示的数字。

快思慢想研究院将这一现象归结为两种"token经济"模式的并存:一种以约束下的效率最大化为核心,另一种以稀缺性溢价为定价基础。Agentic范式下,两种路径的市场反馈周期极短:每日数千次的自动化调用让成本差距从"百分比折扣"变成了"技术路线可行性门槛",而非一个可以被品牌溢价从容覆盖的次要因素。

四、三条线索,一个结论


从架构到生态,从代码到商业,这三条线索汇集成一个结论:

中国AI大模型在MoE稀疏激活架构持续迭代、开源扩散战略重构定价逻辑、Agentic工作负载放大成本差距三重叠加下,系统性压低了推理侧边际成本,并在Agent计算范式转移的节点,将价格差距转化为了市场份额的决定性优势。

"AI市场正在从模型最强的可选项,转向更具成本效益、更易部署的必选项。"这是开发者用脚投票、用流量数据写下的事实。


46%——这个在OpenRouter上峰值出现过的数字,可能只是个开始。

参考文章:《US firms’ growing adoption highlights rising competitiveness of Chines AI models: experts》,Global Times,Zhang Weilan.


畅销书:《AI商业进化论:“人工智能+”赋能新质生产力发展》

出版社:人民邮电出版社

作者:田丰

帮助你定位AI当下发展坐标的指南针

帮助你洞察AI未来演进趋势的航海图

通俗化解读AI的原理、特性和四大发展规律、提供AI赋能商业、引发新质生产力变革的一手案例分析。既有宏观视角的全局观照,又有各行业应用层面的下探记录,聚焦AI的原理与实践、现在与未来,是当下AI应用的全景图、更是身处AI技术浪潮之中的探路书。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
泰国高僧贪腐被捕,和女助理在法堂淫乱,一顿饭要十个菜

泰国高僧贪腐被捕,和女助理在法堂淫乱,一顿饭要十个菜

韬闻
2026-09-12 13:17:44
老外看懵了!成都地铁冲破晨雾,2亿人围观现实版千里江山图

老外看懵了!成都地铁冲破晨雾,2亿人围观现实版千里江山图

宝哥精彩赛事
2026-09-12 12:06:03
1975年,他赋闲两年后被安排为大军区副职,领导圈去“副”字改任正职

1975年,他赋闲两年后被安排为大军区副职,领导圈去“副”字改任正职

春秋砚
2026-09-12 16:30:10
焕新版Model Y迎来“顶配”,内外全面升级,售价36.9万!

焕新版Model Y迎来“顶配”,内外全面升级,售价36.9万!

沙雕小琳琳
2026-09-11 18:16:02
1988年,河南村妇跑去北京找知青丈夫,说出名字后首长吓了一跳

1988年,河南村妇跑去北京找知青丈夫,说出名字后首长吓了一跳

红豆讲堂
2025-05-04 08:10:08
新小外援是托马斯?广东队迎来重大利好,保底能进总决赛了!

新小外援是托马斯?广东队迎来重大利好,保底能进总决赛了!

绯雨儿
2026-09-12 12:34:25
日本前首相鸠山由纪夫公开告诫高市,中国当年放弃巨额战争赔款,附带明确的条件,相关内容早已落实在书面文件,不可肆意违背过往承诺

日本前首相鸠山由纪夫公开告诫高市,中国当年放弃巨额战争赔款,附带明确的条件,相关内容早已落实在书面文件,不可肆意违背过往承诺

唠叨说历史
2026-09-02 16:16:45
医生发现:能活到95岁的长寿者,大多在65岁,就不碰这5事了

医生发现:能活到95岁的长寿者,大多在65岁,就不碰这5事了

橘子约定
2026-09-11 20:34:02
3连胜后,农心杯擂台赛杨鼎新迎举手哥卞相壹挑战,不成功便成仁!

3连胜后,农心杯擂台赛杨鼎新迎举手哥卞相壹挑战,不成功便成仁!

L76号
2026-09-12 10:47:59
iPhone Duo 这波太高级:别人拼命消灭折痕,苹果直接让折痕看不见

iPhone Duo 这波太高级:别人拼命消灭折痕,苹果直接让折痕看不见

小蜜情感说
2026-09-11 01:06:18
光模块变天了?ELSFP横空出世,砍掉75%激光器用量!

光模块变天了?ELSFP横空出世,砍掉75%激光器用量!

普陀动物世界
2026-09-11 00:39:46
王自如曝出神言论!在苹果折叠手机面前,国产折叠手机没得打

王自如曝出神言论!在苹果折叠手机面前,国产折叠手机没得打

小徐讲八卦
2026-09-10 14:59:46
医生:胰腺癌最危险信号,不是腹痛,是频繁出现这些异常,别大意

医生:胰腺癌最危险信号,不是腹痛,是频繁出现这些异常,别大意

医学原创故事会
2026-09-12 11:43:04
昨天刚道歉,星宇股份又有低级错误被发现!年报写着外包报酬共“约2.44万亿元”,按此计算,外包工每小时能赚28万元,而当年全年营业收入仅132.5亿元

昨天刚道歉,星宇股份又有低级错误被发现!年报写着外包报酬共“约2.44万亿元”,按此计算,外包工每小时能赚28万元,而当年全年营业收入仅132.5亿元

每日经济新闻
2026-09-12 00:10:34
美联储加息预期大幅升温!大盘下周将走向何方?

美联储加息预期大幅升温!大盘下周将走向何方?

春江财富
2026-09-12 10:16:43
胡塞武装终于见识到了什么叫真正的“收网”。

胡塞武装终于见识到了什么叫真正的“收网”。

回京历史梦
2026-09-10 17:53:27
遭183次水刑、裸体拘押,“9·11”案主犯还没判

遭183次水刑、裸体拘押,“9·11”案主犯还没判

中国新闻周刊
2026-09-11 13:48:59
中午11点!男篮再迎好消息,李凯尔正式官宣,杨瀚森或迎来得力帮手

中午11点!男篮再迎好消息,李凯尔正式官宣,杨瀚森或迎来得力帮手

小秦哥聊体育
2026-09-11 17:25:54
正式退出,梁靖崑官宣离队,独自离京,原因曝光,谁注意王皓的回应

正式退出,梁靖崑官宣离队,独自离京,原因曝光,谁注意王皓的回应

乒乓助手
2026-08-18 02:08:26
小米某外包测试团队被曝改计件工资,测一条几块钱

小米某外包测试团队被曝改计件工资,测一条几块钱

i黑马
2026-09-10 15:13:03
2026-09-12 17:07:00
田丰说 incentive-icons
田丰说
阅读养成远见,超越你所未见
99文章数 7关注度
往期回顾 全部

科技要闻

苹果折叠屏比小米华为贵5000元,该怎么选

头条要闻

五旬夫妻村口遭醉酒公职人员驾车撞击身亡 被认定次责

头条要闻

五旬夫妻村口遭醉酒公职人员驾车撞击身亡 被认定次责

体育要闻

老鹰真正的底气来自于什么?

娱乐要闻

港媒曝钟丽淇疑患渐冻症,本人发文

财经要闻

继房子茅台后 中产的第3个"神话"破灭了

汽车要闻

全新配色和新样式轮毂 乐道L80星光设计套装限时惊喜价10080元

态度原创

游戏
时尚
房产
亲子
健康

索尼PS5世代仅4个新IP还死了俩 PS4世代有20多个

专栏|一位“皮笑肉不笑”初学者的自述

房产要闻

别再等了!广州改善好房,正在进入“卖一套少一套”时代

亲子要闻

看来这就是敲山震虎吧?

手脚发麻口齿不清?也可能是中风!

无障碍浏览 进入关怀版