网易首页 > 网易号 > 正文 申请入驻

每1美元,中国AI给你115万个token,美国只给3万个

0
分享至

作者:快思慢想研究院 田丰,Global Times 张蔚蓝

引言


今年6月,美国AI创业公司Lindy的CEO做了一个决定:把公司所有流量从Anthropic的Claude切换到DeepSeek。他对外界的解释简洁到近乎粗暴——"接下来几个月,这个决定将为我们节省数百万美元。"

这不是一次情绪化的叛逃,而是一道纯粹的算术题。

用1美元,调用DeepSeek V4-Pro可以生成115万个输出token;同样的钱,在Anthropic Claude Opus 4.8上只能买到4万个token,在OpenAI GPT-5.5上只能买到3.3万个。价差,是28到34倍。


Lindy不是孤例。OpenRouter是全球最大的AI模型聚合路由平台,开发者在这里可以同时接入400余款模型、自由切换。它的流量数据,是目前观察全球开发者真实选择的最直接窗口。数据显示,自今年2月8日起,美国企业通过OpenRouter调用中国AI模型的token占比,每周均超过30%,峰值达到46%。而过去12个月的均值不过11%,2025年上半年更低至4.5%。

18个月,从4.5%到46%。硅谷的开发者正在用每一次API调用投票。

一、架构重塑成本:V4将推理算力需求打到V3.2的27%


经济学中,价格是成本的镜像。要理解中国AI模型为何能定出10倍乃至34倍于对手的价格差距,必须从成本结构的源头读起。

成本结构来自算法架构,这是第一性原理。

2026年4月24日,DeepSeek发布V4系列,分为V4-Pro和V4-Flash两个变体。V4-Pro总参数量1.6万亿,但每次推理仅激活490亿参数;V4-Flash总参数量2840亿,激活130亿。两款模型均以MIT协议开源,原生支持100万token上下文窗口。这个"激活参数"的概念,是理解中国AI成本优势的关键钥匙。

传统稠密模型(Dense Model)的计算方式,好比一家工厂接到每一份订单都要开动全部生产线——无论任务大小,全体员工到岗。MoE(混合专家)架构的革新在于:针对不同任务动态路由、仅激活最相关的"专家子网络"。V4-Pro的1.6万亿参数是全厂总产能,但每次生产只调用490亿参数的精锐小组,计算效率与一款单独训练的490亿参数稠密模型相当,却同时保有万亿级参数带来的深度知识储备。

但V4真正的架构突破,在注意力机制层面的再一次革命。

V3系列使用的MLA(多头潜在注意力)已是业界领先的KV缓存压缩技术。V4在此基础上引入混合注意力架构,融合CSA(压缩稀疏注意力)与HCA(重度压缩注意力):CSA通过可学习稀疏模式处理长程token之间的关联选择,HCA对本地窗口缓存做极端秩压缩。效果直接写进了技术报告:在100万token的上下文场景下,V4-Pro所需的单token推理FLOPs仅为V3.2的27%,KV缓存降至10%;V4-Flash更极端,FLOPs压至10%,KV缓存降至7%。


这是什么概念?同等的推理算力投入,V4-Pro服务的token吞吐量相当于V3.2的近四倍。不是升级了服务器,是把同一台机器的产出效率扩大了四倍。

DeepSeek在V4技术报告中同时披露,V4训练语料超过32万亿token,引入了Manifold-Constrained Hyper-Connections(mHC)替代传统残差连接,强化超大规模训练中的信号传播稳定性;Muon优化器用于加速收敛;MoE专家权重采用FP4量化感知训练,进一步压缩内存与计算开销。

有一点值得坦诚说明:与V3技术报告完整披露训练成本(2.788M H800 GPU小时、约556万美元,对比GPT-4估计超1亿美元)不同,V4技术报告未公开训练总算力消耗与成本数字。DeepSeek仅披露了架构设计与推理效率数据。但逻辑闭环仍然成立:推理侧的算力需求已从技术报告中得到量化验证——百万token上下文的推理成本降至V3.2的约四分之一,这是新一代注意力架构带来的确定性成本坍塌。

这里还有一个不可忽略的背景:美国对华芯片出口管制,限制了中国AI实验室获取最先进GPU的渠道,客观上倒逼中国团队在算法效率上加倍投入。MoE架构、多头潜在注意力、FP8混合精度训练——这些技术路线的持续深耕,从某种意义上是在算力约束下磨砺出来的刀法。限制造就了专注,专注产生了降本的边际效率,而这种效率最终反哺为全球开发者可感知的价格优势。

芯片侧还有一个信号,战略意义甚至超过算法本身。V4是第一款深度适配华为昇腾AI芯片(Ascend 910B与950系列)、使用CANN开源软件栈(算子库、通信库)的前沿级开源模型,训练与推理均可在非NVIDIA硬件上完成。在华为昇腾950DT平台实测数据中,V4-Pro高并发推理吞吐量为每秒388 token,延迟约20毫秒;V4-Flash则达每秒4722 token。英伟达CEO黄仁勋在V4发布前8天接受播客采访时曾表示,"DeepSeek先于英伟达在华为芯片上跑起来"是他不愿看到的结局。8天后,V4发布,他所担心的事情成真了。

斯坦福2026年AI Index报告提供了最直接的宏观坐标:美中两国最强模型之间的能力差距,已从2023年5月的17.5至31.6个百分点收窄至2026年3月的2.7%,而美国的私募AI投资是中国的23倍(2859亿美元对124亿美元)。报告的结论一针见血:美国走的是"以资本换能力"路线,中国走的是"以效率换能力"路线。

快思慢想研究院的判断是,MoE稀疏激活体系每一代迭代(V2→V3→V4)的效率增益呈非线性累积。这是架构红利的复利效应,不是一次性技术突破——每部署一个token,边际成本差距就被复现一次。

二、开源是国家战略,不是慈善:定价目标的根本切换


价格背后是定价目标,定价目标背后是商业逻辑。

Anthropic在2026年5月完成H轮融资,估值攀至9650亿美元;OpenAI最新估值为8520亿美元,均已备案IPO。这两家公司的高API定价,承担着多重不可回避的结构性成本:推理成本占生产AI系统总预算的80%至90%,闭源模型还需叠加安全对齐研发的持续投入、企业服务基础设施的搭建,以及对规模空前的外部投资人的回报承诺。接近万亿美元的估值是一把双刃剑——它代表市场信心,也锁定了高定价的必要性。

中国模型的开源策略,彻底解构了这一套定价方程。

以DeepSeek V4-Flash为例,其API输入定价仅为每百万token $0.14、输出$0.28。V4-Pro更设计了一项专门针对Agent工作流的定价机制:缓存命中时的输入价格降至每百万token $0.003625,相对标准输入价格折扣达120倍。开放权重意味着开发者可自行下载并在本地硬件上运行,发布方无需为每一次调用收取边际利润,收入目标从"单次API的定价权"切换为"通过生态扩散建立分发护城河,再从云服务或企业定制中间接变现"。


这一策略的市场渗透效果已可量化。2026年2月,Alibaba的Qwen单月下载量达1.536亿次,超过Meta、DeepSeek、OpenAI、Mistral等后八名的总和。Qwen在Hugging Face上拥有超过18万个衍生模型,数量超过Google和Meta的总和。斯坦福、UC Berkeley的研究人员以低至30至50美元的成本基于Qwen训练出了表现领先的专用模型。新加坡政府选择了Qwen而非Meta的Llama,作为构建本国主权AI模型的基础底座。

斯坦福2026年AI Index的另一项数据提供了更深层的佐证:全球100篇最高引用AI论文中,中国机构的贡献已从2021年的33篇增长至2024年的41篇。这说明这场成本革命的底层,有一个充沛的技术研究储备在持续供给。

推动美国企业转向的,除了成本,还有另一股力量:美国国内对头部AI模型的监管审查正在收紧。合规压力、数据主权争议与模型使用条款的不确定性,催促部分海外企业主动寻找替代方案。中国开源模型恰好在这一节点提供了在本地部署、自主可控、成本更低的完整选项——这三个属性的组合,在企业级采购决策中具有较强说服力。

Andreessen Horowitz合伙人Martin Casado给出的数据,让硅谷内部感到不安:使用开源技术栈的AI创业公司中,约80%正在运行中国模型。

快思慢想研究院的判断是,中国主流AI实验室没有AppStore式封闭生态需要保护,反而得以用开源换市场份额而无历史包袱。开源是将成本优势转化为分发优势的战略乘数——这一策略已将竞争压力反向传导至OpenAI,促使其发布了自己的开源模型gpt-oss。市场的逻辑一旦成立,就有自我强化的能力。

三、Agent时代改变了一切:价差从"折扣"变成"生死线"


成本差距并非2026年才出现,却在这一年初突然成为市场的决定性变量。触发点是计算范式的切换。

英伟达CEO黄仁勋在多个场合强调,token是AI时代的货币,生产和消费token将驱动AI经济的未来。这句话在2026年初被Agent浪潮赋予了新的分量。

AI的工作方式正在发生根本改变。一次普通对话,模型响应一次;一个Agent任务——让AI自动规划、编写、测试、修正一段代码,或者自主完成一项研究——模型需要被反复调用数十乃至数百次。OpenRouter的实测数据显示,Agentic工作负载每次请求消耗的token量约是普通人机对话的15倍。编程类任务在OpenRouter平台的占比从2025年初的11%跃升至2026年中的50%以上,Agent驱动的输出token已占平台总量的多数——而这一爆发式增长集中在2026年2月之后。

这一转变,让原本可以被品牌溢价覆盖的价格差距,变成了直接穿透月度研发预算的硬约束。


以一项标准化编程工作负载为基准:同等任务在DeepSeek上耗费1071美元,在Claude上耗费4811美元,差距约4.5倍。单次调用的成本差距可能只是财务报表上的一个小数点,但在每日自动化调用数千次的Agent工作流下,这个差距直接决定了一家创业公司的技术路线是否在经济上可持续。这是Lindy做出决定的真实逻辑——他们切换的不是品牌偏好,是生存必选项。

值得关注的是,这种成本压力在不同行业的传导方式并不相同。资深电信产业观察者向锂光指出,AI落地的最后一公里是推理,而推理环节的token消耗才是真正的成本核心。对于很多实际场景——自动驾驶的实时感知决策、医疗问诊的高频辅助、家用机器人的指令响应——业务需要的不是最贵的旗舰模型,而是在足够的精度下以最低成本持续运行的推理能力。DeepSeek、智谱AI、阿里Qwen等中国厂商恰恰在架构优化、token效率与更智能的推理策略上持续投入,在单位算力产出上具备系统性优势,这使其在高频、长尾、对成本极度敏感的企业应用场景中,成为优先入选项而非将就之选。

更值得关注的是机构客户的行为迁移。OpenRouter数据显示,包括AI原生公司和大型组织在内的企业级用户,在2026年6月初向DeepSeek路由的token流量远超年初水平。这说明主动转向中国模型的,不只是预算有限的初创团队,具有真实议价能力的机构客户也在做出同样选择。

智谱AI的GLM 5.2提供了另一个维度的例证:在一项主流Agent基准测试中,GLM 5.2的得分与Anthropic Opus 4.8相差不足1%,但使用成本仅为后者的五分之一。这已经不是"便宜但将就"的逻辑,而是"同等能力、更低成本"的竞争格局——“智价比”正在成为企业级采购的首要筛选条件。

V4-Pro的缓存命中定价印证了这一取向:每百万输入token $0.003625,是标准输入价格的1/120。这一机制专门面向Agent工作流的结构性特征而设计——稳定的系统提示和RAG上下文在多轮调用中被反复使用,缓存折扣在高频Agent场景下的实际节省幅度,远超表面价差所展示的数字。

快思慢想研究院将这一现象归结为两种"token经济"模式的并存:一种以约束下的效率最大化为核心,另一种以稀缺性溢价为定价基础。Agentic范式下,两种路径的市场反馈周期极短:每日数千次的自动化调用让成本差距从"百分比折扣"变成了"技术路线可行性门槛",而非一个可以被品牌溢价从容覆盖的次要因素。

四、三条线索,一个结论


从架构到生态,从代码到商业,这三条线索汇集成一个结论:

中国AI大模型在MoE稀疏激活架构持续迭代、开源扩散战略重构定价逻辑、Agentic工作负载放大成本差距三重叠加下,系统性压低了推理侧边际成本,并在Agent计算范式转移的节点,将价格差距转化为了市场份额的决定性优势。

"AI市场正在从模型最强的可选项,转向更具成本效益、更易部署的必选项。"这是开发者用脚投票、用流量数据写下的事实。


46%——这个在OpenRouter上峰值出现过的数字,可能只是个开始。

参考文章:《US firms’ growing adoption highlights rising competitiveness of Chines AI models: experts》,Global Times,Zhang Weilan.


畅销书:《AI商业进化论:“人工智能+”赋能新质生产力发展》

出版社:人民邮电出版社

作者:田丰

帮助你定位AI当下发展坐标的指南针

帮助你洞察AI未来演进趋势的航海图

通俗化解读AI的原理、特性和四大发展规律、提供AI赋能商业、引发新质生产力变革的一手案例分析。既有宏观视角的全局观照,又有各行业应用层面的下探记录,聚焦AI的原理与实践、现在与未来,是当下AI应用的全景图、更是身处AI技术浪潮之中的探路书。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
实在不行,我还可以告你“性骚扰”

实在不行,我还可以告你“性骚扰”

我是历史其实挺有趣
2026-09-11 10:44:32
2026-09-12 20:56:49
田丰说 incentive-icons
田丰说
阅读养成远见,超越你所未见
99文章数 7关注度
往期回顾 全部

科技要闻

苹果折叠屏比小米华为贵5000元,该怎么选

头条要闻

胖东来郑州店招聘尚未启动 网上有中介称花8万"包过"

头条要闻

胖东来郑州店招聘尚未启动 网上有中介称花8万"包过"

体育要闻

老鹰真正的底气来自于什么?

娱乐要闻

钟丽淇疑入ICU?聚会合照早露端倪

财经要闻

继房子茅台后 中产的第3个"神话"破灭了

汽车要闻

全新配色和新样式轮毂 乐道L80星光设计套装限时惊喜价10080元

态度原创

游戏
家居
数码
教育
公开课

你早就见过《GTA6》女主 她2019年还在赌场发牌

家居要闻

2026建博会(广州) 公装联探展交流活动

数码要闻

8针接口也扛不住了!RX 7900 XTX用户遭遇接口熔化:接触不良惹的祸

教育要闻

是题目超纲了,还是出错了呢?

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版