网易首页 > 网易号 > 正文 申请入驻

融资百亿不赚钱,DeepSeek的10万亿战略

0
分享至

当整个AI行业都在疯狂追赶多模态、视频生成、coding agent的时候,有一家公司对这些「风口」几乎视而不见。

没有coding plan,没有语音模型,没有视频模型,到现在连一个完整的模型部署框架(harness)都还没搭起来。更「离谱」的是,它还坚持把最核心的技术全部开源,毫无保留地分享自己的「秘方」。

这家公司是DeepSeek。

另一边,彭博社刚报道DeepSeek新融资规模已达700亿元(约100亿美元)。梁文锋对投资者放的话也很直接:优先突破技术边界,而不是急着变现。

乍看之下,这种行为简直像个悖论。一家不开源就等于「犯罪」的公司,偏偏锁死了开源。一家不做任何商业化产品的AI公司,偏偏还在大把烧钱。一个估值直奔千亿美元的超级独角兽,偏偏看起来没有任何明确的变现路径。

这是疯狂吗?是钱多烧得慌吗?是投资人在往排水沟里扔钱吗?


X博主@bookwormengr(一位长期追踪中国AI生态的分析师)在他的万字推文里给出了截然相反的判断:

DeepSeek不是在烧钱,它是在下一盘10万亿美元的棋局。
一个「反着来」的英雄旅程

要理解DeepSeek今天的选择,得先看看它一路走来是怎么「反着来」的。

2025年1月,@bookwormengr 发了一条后来成为爆款的推文,他把DeepSeek的选择放在「英雄之旅」的叙事框架里解读。半年多过去,这个故事不但没过时,反而越来越精彩了。

当时所有人都在卷dense model(密集模型),DeepSeek偏偏跑去搞MoE(混合专家模型)。没人否认MoE的理论优势,但它训练难度大、推理效率难优化,「吃力不讨好」。DeepSeek不仅搞了,还搞成了,从V2到V3再到V4,MoE被它玩出了花。

当行业主流在用PPO(近端策略优化)做强化学习时,DeepSeek从第一性原理出发,发明了GRPO(分组相对策略优化)。PPO需要一个独立的「裁判模型」来提供奖励信号,GRPO直接省掉这个环节,更便宜,更高效。

当大家都在追逐更多模态时,DeepSeek把资源全部集中在了一件事上:推理能力。它找到了一个关键杠杆,基于验证奖励的强化学习(RLVR),让模型在数学和逻辑推理上突飞猛进。

从技术路线到产品策略,DeepSeek几乎每一次都在「反着走」。但仔细看,每一次「反着走」都指向同一个方向:把资源效率压榨到极致。

而在「英雄之旅」的叙事结构中,英雄从来不会事先规划自己的旅程。他是一路学习、一路遭遇挑战、一路找到盟友,最终发现自己真正的使命。DeepSeek的使命也越来越清晰了:不是卖coding plan,而是为中国的AI硬件生态铺路。

一张恐怖的KV Cache账单

要理解这个使命,得从一张账单说起。

AI模型处理长文本时,需要缓存一种叫KV Cache(键值缓存)的东西。上下文越长,KV Cache占用的HBM(高带宽显存)就越大。1M上下文?对大多数模型来说,KV Cache会把显存吃到怀疑人生。


@bookwormengr 用了一个刚发布的KV Cache计算器做了对比。输入1M上下文,假设8位KV精度和16位索引精度:

  • DeepSeek V4:只需要5.48GB HBM

  • GLM-5:需要60GB HBM

  • Qwen3-235B-A22B:需要89GB HBM

记住,DeepSeek V4是一个1.6万亿参数的巨型模型,GLM-5约7000亿参数(已经用了DeepSeek的MLA和DSA技术但没用最新的压缩注意力),Qwen3约2350亿参数(用的是GQA注意力机制)。

参数规模是GLM的两倍多、Qwen的近7倍,KV Cache却只有对方的十分之一甚至二十分之一。

用@bookwormengr的话说:「DeepSeek在显存压力上做出了根本性的贡献。」

这解释了为什么DeepSeek敢把长上下文缓存的价格打到Sonnet 4.6 Cache Hit价格的不到3%,还能保持数小时的缓存有效期。KV Cache足够小,可以高效卸载到SSD上再快速加载回来,DeepSeek的Dual Path论文专门讲了这件事。

当然,DeepSeek V4的压缩注意力(CSA/HCA)已经把KV Cache压缩到了连SSD卸载都不一定需要的程度。但这恰恰说明了一件事:DeepSeek所有的技术选择,都指向同一个战略方向:降低对HBM的依赖。

为什么要降低HBM的依赖?因为HBM是中国AI硬件生态中最难啃的骨头。

七项核心技术,全部指向同一个方向

DeepSeek过去两年的创新清单,拆开来看每一项都对应着一个具体的「战略棋子」。

1. MoE和MLA(2024年5月,DeepSeek V2)

这是DeepSeek技术路线的「地基」。MoE让训练同样智能的模型省下40%到50%的算力。MLA(多头潜在注意力)直接把KV Cache砍掉90%。这两项加在一起的效果是:模型的训练和推理成本大幅降低,KV Cache小到可以高效卸载到SSD。

2. DSA(DeepSeek V3.2 Exp)

DSA(动态稀疏注意力)解决的是长上下文的算力问题。传统Transformer面对长文本时,计算量和上下文长度呈线性增长。DSA让这个增长曲线几乎持平。上下文增长到1M,处理时间依然保持平稳。这相当于在不增加算力投入的前提下,把模型的长上下文能力「白送」了出来。

3. mHC(2025年12月论文)

mHC(流形约束超连接)是DeepSeek在宏观架构上的创新。传统的残差连接用的是「x + F(x)」的简单加法,mHC把这条信息高速公路扩展成了多条并行通道,允许信息在层与层之间「学会」混合。更关键的是,它用数学约束(双随机矩阵)保证信号在极深的网络中不会爆炸或消失。

效果是什么呢?在270亿参数规模下,mHC让BIG-Bench Hard推理得分提升7.2分,DROP阅读理解提升3.2分,GSM8K数学提升2.8分,而计算开销只增加了6.7%。用@bookwormengr的话说:「用几乎不增加算力的代价,实现了更高的每参数智能密度。」

4. CSA和HCA(2026年4月,DeepSeek V4)

如果说MLA砍掉了90%的KV Cache,CSA(压缩稀疏注意力)和HCA(分层压缩注意力)在此基础上再砍90%。这是DeepSeek V4能将1.6万亿参数的KV Cache压到5.48GB的核心原因。

5. Engram(2026年1月论文)

Engram是DeepSeek最「反常」的一项创新。MoE已经实现了条件计算,只激活部分参数来节省算力。但DeepSeek发现Transformer缺乏一个「原生知识查询」的机制,不得不用计算来模拟查询。

Engram的解决方案很巧妙:把经典的N-gram模型现代化,变成一个O(1)哈希查找模块。它用内存换计算,查一次LPDDR内存比过一遍Transformer层便宜得多。这种「内存换算力」的取舍,放在西方GPU上可能不值得,但放在中国硬件生态里,意义完全不同。

6. TileLang(编译器生态)

除了技术,DeepSeek更深远的一步是投资了TileLang,一个编译器生态项目。它的作用很简单:让开发者写一次算子代码,就能在多种硬件平台上运行。这对于打破「CUDA护城河」至关重要。

7. Dual Path和计算通信重叠

Dual Path论文表面上是「算力受限下的权宜之计」,但DeepSeek走得更远,在V4论文中直接给出了对硬件厂商ASIC设计的建议,告诉他们「如何不浪费宝贵的硅片面积」。可以想象,面对面给出的建议只会更加具体。

不只是一堆技术论文,而是一张生态图谱

现在把这些技术拼在一起,就能看清DeepSeek的真正布局了。

KV Cache被极度压缩,HBM需求大幅下降。KV Cache可以高效卸载到SSD上,NAND闪存吃香了。

NAND是长江存储(YMTC)的主场,它正在成为3D NAND领域的全球玩家。DeepSeek的技术直接为长江存储创造了一个巨大的NAND和SSD市场。

不止NAND。DeepSeek的Engram模块用LPDDR内存作为查找表来节省算力。而LPDDR正是长鑫存储(CXMT)的主场。CXMT在速度上只落后最新制程半代,在密度上落后一代,差距很小,短时间内可以补齐。

中国GPU在原始FLOPs上永远追不上西方,原因是先进制程(EUV)和先进封装的双重限制。但DeepSeek的策略不是去硬碰硬的拼算力,而是另一条路:用充裕的NAND和LPDDR来弥补GPU算力的不足。

SGLang团队已经发布了一篇很好的博客,演示了如何用LPDDR来存储模型权重,在推理时按需「流式」加载到HBM中。DeepSeek的MoE架构(大量专家组合+4bit量化权重)让这种方案变得非常简单。


所有这些创新的共同效果是:降低了对HBM的依赖,降低了对高端GPU的依赖,让更多「够用但不顶尖」的硬件方案变得可行。

这就是DeepSeek真正的「产品」:一个让中国AI硬件生态变得可行的技术底座。

从OpenAI的AMD deal看DeepSeek的赚钱方式

技术服务于生态,但公司终究要赚钱。DeepSeek怎么变现?

@bookwormengr 在推文中给出了一个很有说服力的参照系。

2025年10月,AMD和OpenAI宣布了一项战略合作:AMD将向OpenAI供应高达6GW的GPU算力,作为条件,AMD向OpenAI授予了高达1.6亿股的认股权证,按里程碑解锁。首期1GW部署完成解锁第一批,后续随采购规模逐步解锁,同时和AMD的股价目标挂钩。

说白了,OpenAI通过「承诺使用你的硬件」来换取「持有你的股票」。这对AMD是巨大的信任背书,对OpenAI则是潜在的巨大财务回报。

@bookwormengr 预测,DeepSeek会走同样的路,和中国多家内存、ASIC、CPU和网络设备厂商签署类似的股权合作协议,深度参与它们硬件生态的打磨,让中国硬件的AI工作负载真正达到可用水准。

看看西方(包括东亚盟友)的AI相关股票的合计市值,远超10万亿美元。DeepSeek完全可以用「合作+股权」的模式,帮助创造一个同样体量的中国AI生态,从中拿到自己的那份,同时实现1万亿美元的自身估值。

用@bookwormengr的话说:「梁文锋,一个吉姆·西蒙斯的忠实粉丝,是个太聪明的资本家了,不可能错过这个。」

DeepSeek今天做的东西,整个行业明天都会用

其实这个路径已经开始了。DeepSeek的MoE、MLA、DSA等创新,已经被全球和中国其他AI实验室广泛采用。

智谱AI(ZAI)的GLM系列用了MLA和DSA,月之暗面(Moonshot)的Kimi也明确表示架构基于DeepSeek。反过来,DeepSeek也用了月之暗面率先在大规模训练中使用的Muon优化器。整个中国AI生态正在形成一种「互相借鉴、共同进化」的默契。

有了更多的硬件选择,以及自身对算力需求的极致压缩,DeepSeek可以承担更宏大的训练项目,特别是大规模强化学习后训练。RL训练需要生成海量的推理轨迹,动辄数万亿token,1M上下文的模型更是需要训练同样长的轨迹。这些对算力的需求是天文数字,但DeepSeek正在把成本降到可以承受的水平。

更进一步,更多的硬件选择意味着DeepSeek可以做自动化研究(RSI),让AI自己设计并执行实验。这条路有很多的试错成本,但它对于探索完整的设计空间来说是必要的。在到达AGI、继而到达ASI之前,RSI能力是必备的。

从今天往回看,DeepSeek一路上的所有选择,不着急做多模态、不卖coding plan、坚持开源、技术优先商业化其次,突然都有了清晰的逻辑。

这不是一家迷茫的公司在瞎折腾,而是一个目标极其清晰的团队在按部就班地执行一个十年计划。它的每一步技术发布,都是这个计划的一块拼图。

DeepSeek的KV Cache压缩技术大幅减少了HBM需求,这让长江存储和长鑫存储的产品在AI推理场景中变得更有价值。它的MoE和TileLang降低了GPU门槛,这让中国境内的GPU厂商有了切入AI市场的机会。它的开源策略确保了这些技术能快速扩散到整个生态,进而加速中国硬件的迭代。

最终,DeepSeek不需要亲自做出一款「爆款应用」来赚钱。它只需要让中国AI硬件生态变得可用,让这个生态里的每一个玩家都离不开它的技术贡献。

一个10万亿美元的行业生态,和它自己1万亿美元的估值,这才是梁文锋瞄着的目标。

从任何一个角度看,这个赌注都够大。

但回头想想DeepSeek一路走来的「反着走」记录,被质疑了,质疑错了,再被质疑,再被质疑错,也许该学会的是:当DeepSeek在做一件看起来「不合理」的事情时,很可能不是因为疯了,而是因为看到了别人还没看到的东西。

本文编译自@bookwormengr的X推文「DeepSeek's 10 trillion USD grand strategy」

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
山西恶警脚踩讨薪农妇致其死亡,获五年有期徒刑,出狱后持续喊冤

山西恶警脚踩讨薪农妇致其死亡,获五年有期徒刑,出狱后持续喊冤

易玄
2026-08-04 12:47:02
美媒称沙特王储连续给特朗普打了两个电话,要求美方打击胡塞武装,结果遭特朗普拒绝

美媒称沙特王储连续给特朗普打了两个电话,要求美方打击胡塞武装,结果遭特朗普拒绝

都市快报橙柿互动
2026-09-11 16:00:39
道歉不到72小时人设崩塌!演员别拿诚意当挡箭牌

道歉不到72小时人设崩塌!演员别拿诚意当挡箭牌

可乐谈情感
2026-09-11 15:39:44
领导干部任职前公示

领导干部任职前公示

锡望
2026-09-11 10:20:04
人寿尽,屋先知!人快要走到尽头的时候,房子会出现三种预兆

人寿尽,屋先知!人快要走到尽头的时候,房子会出现三种预兆

千秋文化
2026-09-09 20:21:53
韦世豪手势是什么意思?如今终于水落石出,球迷:沈寅豪怎么看?

韦世豪手势是什么意思?如今终于水落石出,球迷:沈寅豪怎么看?

我就是一个说球的
2026-09-10 23:03:29
54岁张东健波士顿送儿子上学,容貌俊朗没咋老,身形健硕全是肌肉

54岁张东健波士顿送儿子上学,容貌俊朗没咋老,身形健硕全是肌肉

娱圈办事处
2026-09-02 18:29:54
马克龙玩砸了?法国发言人无视中方警告,不到一周,中方果断出手

马克龙玩砸了?法国发言人无视中方警告,不到一周,中方果断出手

军机Nova
2026-09-11 10:06:57
股价暴跌64%,知名黄金品牌疑“跑路”,网店已下架所有产品

股价暴跌64%,知名黄金品牌疑“跑路”,网店已下架所有产品

21世纪经济报道
2026-09-11 14:55:16
实际上,只有中国人才会这么奢侈用电车!

实际上,只有中国人才会这么奢侈用电车!

米粒说车唯一呀
2026-09-11 13:40:24
真的来了!特斯拉正式发布全新 Model Y

真的来了!特斯拉正式发布全新 Model Y

XCiOS俱乐部
2026-09-11 09:28:37
安踏:获无条件批准

安踏:获无条件批准

中国新闻周刊
2026-09-11 18:56:09
虚构:中国的一部手机,竟救了总统阿萨德的命,助他顺利到达俄罗斯

虚构:中国的一部手机,竟救了总统阿萨德的命,助他顺利到达俄罗斯

红豆讲堂
2025-01-15 10:49:37
苹果折叠iPhone Duo发布首日 三星Z Fold8实现开合透视动画

苹果折叠iPhone Duo发布首日 三星Z Fold8实现开合透视动画

驱动中国
2026-09-11 09:43:03
沙特王储兼首相两次致电特朗普被拒绝,美方称无意对胡塞武装采取直接军事行动,但被指派出超100名军事顾问为沙特提供情报和定位

沙特王储兼首相两次致电特朗普被拒绝,美方称无意对胡塞武装采取直接军事行动,但被指派出超100名军事顾问为沙特提供情报和定位

第一财经资讯
2026-09-11 14:07:38
20:31,奇迹发生了

20:31,奇迹发生了

金融界
2026-09-11 21:18:23
东体:不管亚运成绩如何,国足内部已不考虑征调亚运球员

东体:不管亚运成绩如何,国足内部已不考虑征调亚运球员

懂球帝
2026-09-11 13:55:04
日本慌了,韩国急了?现在的中国乌鲁木齐,先进制造悄然成势

日本慌了,韩国急了?现在的中国乌鲁木齐,先进制造悄然成势

混沌录
2026-09-10 23:48:05
留学花光家里60多万,面试字节、阿里、鹅厂等被拒,不敢告诉爸妈找不到工作

留学花光家里60多万,面试字节、阿里、鹅厂等被拒,不敢告诉爸妈找不到工作

蚂蚁大喇叭
2026-09-05 17:11:29
iPhone 17,突然大降价!

iPhone 17,突然大降价!

台州交通广播
2026-09-12 01:13:52
2026-09-12 02:32:49
大厂观察 incentive-icons
大厂观察
你想了解的大厂的一切~
227文章数 41关注度
往期回顾 全部

财经要闻

女装“玖姿”母公司跨境贸易迷局:安正时尚说谎了吗?

头条要闻

18岁女子加前男友微信被现男友发现 争吵后跳楼身亡

头条要闻

18岁女子加前男友微信被现男友发现 争吵后跳楼身亡

体育要闻

37岁还能场场进球,还能翻跟头!

娱乐要闻

黄晓明直言帮太多白眼狼,杨颖遭殃

科技要闻

苹果折叠屏比小米华为贵5000元,该怎么选

汽车要闻

买菜车也有小乐趣 风云T7不止是台合格家用SUV

态度原创

游戏
教育
家居
数码
公开课

逼老外学中文的魔兽时光服,又要用三件新橙装吊他们胃口了"/> 主站 商城 论坛 自运营 登录 注册 简体中文 简体中文 English 逼老外学...

教育要闻

现场直击!武汉科技大学2026年研究生新生开学典礼!

家居要闻

2026建博会(广州) 公装联探展交流活动

数码要闻

小空间观影优选!哈趣 Q1 Pro 高亮版,云台高亮配哈曼音响

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版