网易首页 > 网易号 > 正文 申请入驻

国产大模型,贵到用不起

0
分享至



唯有在技术、价格、稳定性方面,均形成合力,产品才能撑起用户的续费预期

文/林书

最近这一个月,硅谷AI界可谓大招频出,GPT-5.6、fable5、Grok-4.5接连问世。

一时间,国内开发者、程序员群体纷纷沸腾,各种关于GPT-5.6等前沿模型的讨论、测评此起彼伏。

尽管这个月也有Kimi-K3这样的新锐国产模型问世,但总的来看,国产大模型当前在一线开发者群体中,始终处于一种“叫好不叫座”的状态。



根据最新数据,在使用量方面:OpenRouter 6月22日至28日数据显示,中国模型周调用量达20.39万亿Token,美国模型为4.25万亿,前者已连续九周领先。

但与之形成反差的是,国内AI六小龙在营收方面的表现,却不怎么尽如人意:公开财报显示,智谱2025年营收7.24亿元,亏损却达到了30亿元以上,MiniMax为7900万美元(约5.7亿元);月之暗面等其余四家尚未披露完整年营收。

即使头部企业,收入仍停留在数亿元量级。

相较之下,作为AI头部企业的Anthropic,其ARR已经达到了约 600 亿—700 亿美元,主要驱动力为 B2B API 及 AI Coding 场景 。

这不由得引出了一个尖锐的问题:

为何号称“便宜”、“调用量大”的国产模型,至今仍然叫好不叫座,在AI Coding等高价值的场景上,至今仍难以与国外顶尖模型正面抗衡?

最近,笔者在与多个一线开发者深入探讨此问题后,发现了一个很反直觉的事实:

国产大模型,某种程度上其实非常“贵”。

也正是这样的“贵”,让某些性能上有所突破的国产模型,难以真正展现自己的闪光之处。

01

“低价”的幻觉

提起国产大模型,很多人想到的都是DeepSeek、Kimi、智谱这样的代表,而与之关联最紧密的标签之一,就是低价、便宜;

如果仅从Token单价上来看,国产模型与GPT-5.6、fable5等顶尖模型相比,确实有着不小的优势,拿GLM-5.2与DeepSeek V4举例:GLM-5.2每百万Token输入/输出为1.4/4.4美元,DeepSeek-V4-Pro为0.435/0.87美元;GPT-5.6 Sol为5/30美元,Claude Fable 5则为10/50美元。

但实际上,这种“低价”的印象,是一种圈外人长久的误区。

尤其在高强度的编程场景下,国产大模型的单价不但没有优势,甚至反而还比有套餐的GPT、Claude贵出好几倍。

李光(化名)是AI领域的一位科研工作者,由于工作需要,每天都要在AI Coding的场景下消耗几十亿Token,在这样的消耗量下,如果用国产大模型,例如GLM-5.2,整体的成本就会变得非常恐怖。



李光晒出的Token账单

在交谈当天,李光消耗的Token已经接近40亿,这里可以稍微换算一下,倘若他用的是GLM-5.2,成本大致是:(8639万普通输入×1.4美元+33.80亿缓存输入×0.26美元+1906万输出及推理×4.4美元)约为1084美元,按1美元兑7.2元估算,约合人民币7800元。

而让李光如此放开手脚烧Token的原因,就是因为他开了GPT的CodeX套餐,

这里简单解释一下CodeX套餐的具体形式,简单来说,它是针对编程场景推出的一款套餐:严格说来,它并非真正不限量,而是把Codex纳入ChatGPT订阅:Plus为20美元/月,Pro从100美元/月起,额度约为Plus的5倍或20倍;触顶后可购买Credits继续使用。

同样地,Anthropic的Claude Code也有一套类似的套餐,具体形式是:Claude Pro为20美元/月,Max 5x和Max 20x分别为100、200美元/月;Claude网页端与Claude Code共享每5小时及每周额度,触顶后可按API价格续用。

在这样的套餐兜底下,巨大的Token成本反而被抹平了。

对于国内的开发者来说,在高强度AI Coding场景下,每天消耗几十亿、上百亿Token,是一个很普遍的常态。

小刘也是一个AI Coding的重度开发者,他在Codex上实际一周的花费是 300元人民币,而这还是在没有公司报销的情况下。

但即使是这样的成本,对比国产模型,依然显得“便宜”了很多,因为同样300元,根本买不来GLM 5.2 同等数量的token。



小刘的Token账单

在国内开发者看来,GPT的 codex 套餐,是目前能买到的最便宜的 token,比智谱、kimi 便宜好几倍,这可能反直觉,但是事实就是国产模型在高强度的Coding场景下,性价比完全无法与之对比。

这里需要说明的是:codex并非真正意义的不限量套餐,如果按最高档200美元算,一周大概有20亿额度。

但是,由于部分开发者会通过“中转站”等手段使用模型,某些模型的实际成本,会比官方渠道低很多,这就导致有时能以更低的价格,买到更多Token,于是才有了300块能买120亿Token的现象。

实际上,国产模型在定价方面,不是没有推出过类似的套餐,但如果细究起来,这样的套餐,在限额方面,比起codex而言,存在着很大的限制。

02

国产定价之痛

国产大模型在定价方面的现状,可以用一句话来形容:

“你以为你进的是自助餐的场子,但最后发现,商家还是按斤计费。”

举例来说,在套餐方面,国内的Kimi、GLM-5.2:Kimi Code分为49、99、199、699元四档,额度按周刷新;GLM Coding Plan的Lite、Pro、Max每5小时分别约80、400、1600次Prompt,每周约400、2000、8000次,且GLM-5.2高峰期按3倍扣额。

以阿里的qoder为例,根据笔者一位从事B端客户运维的朋友阿迷(化名)介绍:“qoder曾经是国内最好用的AI IDE,可惜它自己的新定价,把优势搞没了。”

在套餐方面:Qoder CN个人Pro、Pro+分别为59、169元/月,含2000、6000 Credits;Teams与VPC版分别为99、199元/席位·月,均含3000 Credits,后者50席起售。

“今年他们合并灵码调了定价后,就我知道的,至少都有二三十家放弃续费了。”阿迷后来介绍道。

根据阿迷的测试,qoder企业版199的套餐,按他的用法,3天就没了,如果按重度开发者的用法,估计一天就没了。

同样地,在套餐方面,令国内用户感到五味陈杂的,还有GLM-5.2。

按照开发者小薇的说法:“GLM-5.2的套餐约等于没有,就算有套餐高峰期仍然限流,并且还存在‘背刺’用户的现象。”

按照36氪的报道:GLM-5.2的套餐,之前比演唱会门票还难抢,每天早上十点钟准时刷新,能不能买到全凭手速。

2026 年 1 月,智谱发公告说因为算力紧张,把每日可销售量直接砍到原来的 20%,每天早上 10 点放一点额度,几分钟就售罄。

说到底,国产模型在套餐、价格上的“吝啬”,本质上是算力不足造成的窘迫。

根据2025年中国信通院、工信部的数据,中国现存的数据中心是449 个,而美国则是5427 个,在总算力方面,中国为1053 EFLOPS,而美国则是2400。

但这里的关键在于:美国那2,400 EFLOPS 里,高端 GPU 占比极高;中国的算力里,大量是华为昇腾、寒武纪等国产芯片,单卡性能与 H100 仍有代差。

为应对愈发高涨的算力需求,2026 年 3 月开始,智谱、阿里云、腾讯云、百度在Token价格上集体涨价,涨幅从 5% 到 460% 不等。

说白了,国产模型的“低价”、“价格战”早已成为了过去式。

不是国产模型不想搞buffet,是因为算过账:以现在的算力成本和亏损状态,搞包月等于拿固定月费去赌用户不会刷爆,而按照国内开发者、程序员动辄一天烧几十亿、甚至上百亿Token的用法,这样的商业模式,很快会被击穿成本线。

而OpenAI 和 Anthropic 的编程套餐,卖的是高净值企业客户——Cursor、GitHub Copilot 这种大客户一年能给 Anthropic 贡献 14 亿美元收入。

在高算力的加持下,这套商业模式,本质是用"固定月费"换"长期锁客",客户质量高,ARPU 也相对较高,摊得平成本。

而相较之下,国内虽然有阿里这样的云巨头,但问题是:阿里云FY2026 调整后 EBITA Margin 只有 7.5%,云智能集团虽然收入增长快,但利润并不丰厚。

并且,传统云厂商敢卖"不限量云服务器",是因为用户不是 24 小时满负载。一台 ECS,实际 CPU 利用率可能只有 10%,云厂商可以把一台物理机超卖给十个人。

但大模型推理不一样:来一个token,就要实打实烧一次 GPU 算力。用户如果 24 小时不间断刷,云厂商的 HBM 显存、GPU 核心、电费全是刚性支出,没有任何超卖空间。

03

模型的“黄金三角”

除了价格方面的因素外,对国内开发者来说,选择Codex、Calude Code的原因,无疑是其强大的编程性能。

然而,在性能方面,国产模型也并非像某些刻板印象中想的那样。

在与多个开发者交谈后,笔者发现一个较为普遍的观点是:国产大模型,尤其是GLM-5.2等最新的模型,已经可以承接一些辅助性的、次要的任务,例如做测试和修改bug。

但在较为复杂的、长时间的异步任务上,国产模型目前与GPT、Calude等顶尖模型,仍有较大差距。

开发者小张,今年3月份用过一次国产模型编程,用GLM、qwen和GPT对比同样的任务,只有gpt跑完了,且符合页面要求,那是一个多级、多列内容比对和结果生成的项目。

而另一个开发者小薇则表示,根据她的体验,Kimi 2.7 和 豆包 2.1 Pro 性能也尚可,但是它总的来说还是要弱一档(属于第二梯队),但总体而言也超过 Claude Sonnet 4.6 了。

目前,开发者群体中的普遍共识是:GLM-5.2是第一个达到了 Opus 级别的国产模型。

它在执行真实的、复杂的、长时间的异步任务中,它是可用的、占据了一席之地的。

尽管在很多维度,例如世界知识上,其与真正的Opus模型仍有较大差距,但这不妨碍其成为国产模型的新高度。

但现实是:这刚刚崭露头角少数“尖子生”,却被与性能无关的其他因素拖累了。

具体来说,这样的因素包括了缓存效率不高、高峰期仍然会限流等等,让开发者的实际体验很糟糕。

这就引出了当下模型对比中的另一个维度:稳定性。

在一线开发者、程序员的体验中,模型的选择,早已不是简单的性能对比,而是——

性能—价格—稳定性的“黄金三角”。

在这三个维度中,国产模型只勉强拿下了第一维度的部分指标。

近期,国内的Kimi发布了其最新的旗舰模型K3:这是一款拥有2.8万亿参数、原生多模态和100万Token上下文的开放权重旗舰模型,主攻长程编程、知识工作与深度推理。



在众多测评中,其在Artificial Analysis上的智力指数是57分、位列全球第三;Arena前端编程榜以1679分登顶,甚至有传言称,其性能已经能比肩Claude Fable 5。

然而,在耀眼的分数与排名背后,开发者关切最多的,仍然是一个词:性价比。

在K3发布后,很多开发者表示,现在Kimi仍然很贵,与Codex相比没有性价比,且额度不够用,单看API价格,K3也谈不上“白菜价”:每百万Token缓存/输入/输出分别为2/20/100元;GPT-5.6 Sol为0.5/5/30美元,K3虽低于Sol,却明显高于GPT-5.6 Luna的0.1/1/6美元。

且在使用K3的过程中,开发者表示还出现了API断连,甚至断了一上午的情况。

就目前的情况来看,国内开发者不是不愿意为国产模型付费,而是国产模型目前因算力紧、成本高,目前开不起Codex这样具有性价比的套餐,只能开看似自助餐,实则限量的“大众点评套餐”(类似智谱 的Coding Plan)。

而套餐的体验不稳定、性价比模糊,导致用户使用过难以留存。这本质上,是在目前算力底座成本高的情况下,用户的理性选择。

以上这些,并非我们要长他人志气,灭自己威风,只是想提示一种风险。

目前,国产模型在追赶GPT、Claude的路途中,非常喜欢强调性能,但国产大模型从研发到应用,需要攀登的,远不止性能这一座高山。

我们需要的是等待,等到国产算力基座大规模量产了,在技术、价格、稳定性方面,形成合力了,我们的产品就能撑起用户的期待。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
彻底撕破脸!华为与赛力斯分家,根源正是当年上汽的“灵魂说”

彻底撕破脸!华为与赛力斯分家,根源正是当年上汽的“灵魂说”

叮当当科技
2026-09-17 04:29:55
小米外包员工称中秋礼包领取被拒,福利区别对待引发讨论

小米外包员工称中秋礼包领取被拒,福利区别对待引发讨论

i黑马
2026-09-17 16:23:10
香奈儿果然不坑穷人,这鞋根本不是给走路的人穿的,是给专车接送、脚几乎不沾地的人设计的

香奈儿果然不坑穷人,这鞋根本不是给走路的人穿的,是给专车接送、脚几乎不沾地的人设计的

背包旅行
2026-09-03 11:56:50
《一瓯春》首播,周也硬刚谭松韵,宅斗剧还有市场吗?

《一瓯春》首播,周也硬刚谭松韵,宅斗剧还有市场吗?

影视地平线
2026-09-17 15:24:14
随着韩国6-0,中国1-1,中国台北1-0,亚运女足最新积分榜出炉

随着韩国6-0,中国1-1,中国台北1-0,亚运女足最新积分榜出炉

侧身凌空斩
2026-09-17 16:59:15
克洛普:打了50多通电话向一些球员解释落选原因

克洛普:打了50多通电话向一些球员解释落选原因

懂球帝
2026-09-17 20:30:11
“老师”资助孤儿10年 竟是“放长线钓大鱼”间谍!

“老师”资助孤儿10年 竟是“放长线钓大鱼”间谍!

看看新闻Knews
2026-09-17 15:05:12
美国做梦都没料到,中国会投资727亿建一条运河,低估了中国基建

美国做梦都没料到,中国会投资727亿建一条运河,低估了中国基建

铭记历史呀
2026-09-04 00:35:51
手搓动画《牛来》票房6300万 母子二人基本财富自由

手搓动画《牛来》票房6300万 母子二人基本财富自由

3DM游戏
2026-09-17 12:00:04
史上最严厉对俄制裁法案即将生效!1700名乌军在哈尔科夫被围?

史上最严厉对俄制裁法案即将生效!1700名乌军在哈尔科夫被围?

鹰眼Defence
2026-09-17 11:01:13
难怪朱倩老公这次下手这么狠,这女人的聊天记录,实在是太野了

难怪朱倩老公这次下手这么狠,这女人的聊天记录,实在是太野了

皮蛋儿电影
2026-09-02 10:26:48
敬一丹送灵结束,才发现40岁无儿无女的女儿,早被她安排好后路

敬一丹送灵结束,才发现40岁无儿无女的女儿,早被她安排好后路

九号探秘人
2026-09-17 20:26:37
郭有才解散团队回归烧烤店:曾请赵雅芝助阵,开业三天带货2000万

郭有才解散团队回归烧烤店:曾请赵雅芝助阵,开业三天带货2000万

手工制作阿歼
2026-09-17 02:25:30
不会演反派就别尬演!《兰香如故》34 岁李梦顶着一张大女主脸,实力演绎什么叫配角天花板

不会演反派就别尬演!《兰香如故》34 岁李梦顶着一张大女主脸,实力演绎什么叫配角天花板

胖六聊剧
2026-09-15 20:26:51
贺子珍始终认定朱道来便是战乱之中失散的儿子,可朱道来后来坦言:过去他没有道出所有真相

贺子珍始终认定朱道来便是战乱之中失散的儿子,可朱道来后来坦言:过去他没有道出所有真相

唠叨说历史
2026-09-15 14:16:32
泽连斯基喊话普京在中国见一面,克宫秒回

泽连斯基喊话普京在中国见一面,克宫秒回

瞩望云霄
2026-09-17 15:53:47
王志文:社会生存铁律——说好话搞定50%,给东西搞定70%,两样都做搞定90%

王志文:社会生存铁律——说好话搞定50%,给东西搞定70%,两样都做搞定90%

杏花烟雨江南的碧园
2026-09-06 15:15:03
中国足协陷入尴尬境地!当年假球案被终身禁足的申思、祁宏,曝出一番争议操作

中国足协陷入尴尬境地!当年假球案被终身禁足的申思、祁宏,曝出一番争议操作

冷桂零落
2026-09-16 07:17:29
信访新规划红线:越级上访就问责,可如果基层不受理,去哪说理去

信访新规划红线:越级上访就问责,可如果基层不受理,去哪说理去

职场资深秘书
2026-09-17 14:59:20
这是能拍的吗?两大劣迹人复出合作,看完名字,网友都觉片方疯了

这是能拍的吗?两大劣迹人复出合作,看完名字,网友都觉片方疯了

得得电影
2026-09-17 20:03:34
2026-09-18 00:28:49
最话Funtalk
最话Funtalk
不写平庸的故事
654文章数 603关注度
往期回顾 全部

科技要闻

影视飓风Tim反掰iPhoneDuo被质疑

头条要闻

深圳商铺楼板坍塌致1名收废品人员死亡 调查报告公布

头条要闻

深圳商铺楼板坍塌致1名收废品人员死亡 调查报告公布

体育要闻

逆转朝鲜,国足亚运队“啃老”过关

娱乐要闻

rapper赵涛恋情曝光!带甜馨妈妈散步

财经要闻

缺钱的追觅 隐藏的债务?

汽车要闻

猛士X700内饰公布 打造家庭泛越野智能座舱

态度原创

房产
家居
健康
游戏
亲子

房产要闻

突发!三亚安居房出台新政!

家居要闻

2026建博会(广州) 公装联探展交流活动

剧烈头痛伴呕吐,警惕脑动脉瘤破裂

索尼Project Canis掌机参数曝光 目标2027年底推出

亲子要闻

工程车小故事

无障碍浏览 进入关怀版