当整个AI行业都在疯狂追赶多模态、视频生成、coding agent的时候,有一家公司对这些「风口」几乎视而不见。
没有coding plan,没有语音模型,没有视频模型,到现在连一个完整的模型部署框架(harness)都还没搭起来。更「离谱」的是,它还坚持把最核心的技术全部开源,毫无保留地分享自己的「秘方」。
这家公司是DeepSeek。
另一边,彭博社刚报道DeepSeek新融资规模已达700亿元(约100亿美元)。梁文锋对投资者放的话也很直接:优先突破技术边界,而不是急着变现。
乍看之下,这种行为简直像个悖论。一家不开源就等于「犯罪」的公司,偏偏锁死了开源。一家不做任何商业化产品的AI公司,偏偏还在大把烧钱。一个估值直奔千亿美元的超级独角兽,偏偏看起来没有任何明确的变现路径。
这是疯狂吗?是钱多烧得慌吗?是投资人在往排水沟里扔钱吗?
![]()
X博主@bookwormengr(一位长期追踪中国AI生态的分析师)在他的万字推文里给出了截然相反的判断:
DeepSeek不是在烧钱,它是在下一盘10万亿美元的棋局。一个「反着来」的英雄旅程
要理解DeepSeek今天的选择,得先看看它一路走来是怎么「反着来」的。
2025年1月,@bookwormengr 发了一条后来成为爆款的推文,他把DeepSeek的选择放在「英雄之旅」的叙事框架里解读。半年多过去,这个故事不但没过时,反而越来越精彩了。
当时所有人都在卷dense model(密集模型),DeepSeek偏偏跑去搞MoE(混合专家模型)。没人否认MoE的理论优势,但它训练难度大、推理效率难优化,「吃力不讨好」。DeepSeek不仅搞了,还搞成了,从V2到V3再到V4,MoE被它玩出了花。
当行业主流在用PPO(近端策略优化)做强化学习时,DeepSeek从第一性原理出发,发明了GRPO(分组相对策略优化)。PPO需要一个独立的「裁判模型」来提供奖励信号,GRPO直接省掉这个环节,更便宜,更高效。
当大家都在追逐更多模态时,DeepSeek把资源全部集中在了一件事上:推理能力。它找到了一个关键杠杆,基于验证奖励的强化学习(RLVR),让模型在数学和逻辑推理上突飞猛进。
从技术路线到产品策略,DeepSeek几乎每一次都在「反着走」。但仔细看,每一次「反着走」都指向同一个方向:把资源效率压榨到极致。
而在「英雄之旅」的叙事结构中,英雄从来不会事先规划自己的旅程。他是一路学习、一路遭遇挑战、一路找到盟友,最终发现自己真正的使命。DeepSeek的使命也越来越清晰了:不是卖coding plan,而是为中国的AI硬件生态铺路。
一张恐怖的KV Cache账单
要理解这个使命,得从一张账单说起。
AI模型处理长文本时,需要缓存一种叫KV Cache(键值缓存)的东西。上下文越长,KV Cache占用的HBM(高带宽显存)就越大。1M上下文?对大多数模型来说,KV Cache会把显存吃到怀疑人生。
![]()
@bookwormengr 用了一个刚发布的KV Cache计算器做了对比。输入1M上下文,假设8位KV精度和16位索引精度:
DeepSeek V4:只需要5.48GB HBM
GLM-5:需要60GB HBM
Qwen3-235B-A22B:需要89GB HBM
记住,DeepSeek V4是一个1.6万亿参数的巨型模型,GLM-5约7000亿参数(已经用了DeepSeek的MLA和DSA技术但没用最新的压缩注意力),Qwen3约2350亿参数(用的是GQA注意力机制)。
参数规模是GLM的两倍多、Qwen的近7倍,KV Cache却只有对方的十分之一甚至二十分之一。
用@bookwormengr的话说:「DeepSeek在显存压力上做出了根本性的贡献。」
这解释了为什么DeepSeek敢把长上下文缓存的价格打到Sonnet 4.6 Cache Hit价格的不到3%,还能保持数小时的缓存有效期。KV Cache足够小,可以高效卸载到SSD上再快速加载回来,DeepSeek的Dual Path论文专门讲了这件事。
当然,DeepSeek V4的压缩注意力(CSA/HCA)已经把KV Cache压缩到了连SSD卸载都不一定需要的程度。但这恰恰说明了一件事:DeepSeek所有的技术选择,都指向同一个战略方向:降低对HBM的依赖。
为什么要降低HBM的依赖?因为HBM是中国AI硬件生态中最难啃的骨头。
七项核心技术,全部指向同一个方向
DeepSeek过去两年的创新清单,拆开来看每一项都对应着一个具体的「战略棋子」。
1. MoE和MLA(2024年5月,DeepSeek V2)
这是DeepSeek技术路线的「地基」。MoE让训练同样智能的模型省下40%到50%的算力。MLA(多头潜在注意力)直接把KV Cache砍掉90%。这两项加在一起的效果是:模型的训练和推理成本大幅降低,KV Cache小到可以高效卸载到SSD。
2. DSA(DeepSeek V3.2 Exp)
DSA(动态稀疏注意力)解决的是长上下文的算力问题。传统Transformer面对长文本时,计算量和上下文长度呈线性增长。DSA让这个增长曲线几乎持平。上下文增长到1M,处理时间依然保持平稳。这相当于在不增加算力投入的前提下,把模型的长上下文能力「白送」了出来。
3. mHC(2025年12月论文)
mHC(流形约束超连接)是DeepSeek在宏观架构上的创新。传统的残差连接用的是「x + F(x)」的简单加法,mHC把这条信息高速公路扩展成了多条并行通道,允许信息在层与层之间「学会」混合。更关键的是,它用数学约束(双随机矩阵)保证信号在极深的网络中不会爆炸或消失。
效果是什么呢?在270亿参数规模下,mHC让BIG-Bench Hard推理得分提升7.2分,DROP阅读理解提升3.2分,GSM8K数学提升2.8分,而计算开销只增加了6.7%。用@bookwormengr的话说:「用几乎不增加算力的代价,实现了更高的每参数智能密度。」
4. CSA和HCA(2026年4月,DeepSeek V4)
如果说MLA砍掉了90%的KV Cache,CSA(压缩稀疏注意力)和HCA(分层压缩注意力)在此基础上再砍90%。这是DeepSeek V4能将1.6万亿参数的KV Cache压到5.48GB的核心原因。
5. Engram(2026年1月论文)
Engram是DeepSeek最「反常」的一项创新。MoE已经实现了条件计算,只激活部分参数来节省算力。但DeepSeek发现Transformer缺乏一个「原生知识查询」的机制,不得不用计算来模拟查询。
Engram的解决方案很巧妙:把经典的N-gram模型现代化,变成一个O(1)哈希查找模块。它用内存换计算,查一次LPDDR内存比过一遍Transformer层便宜得多。这种「内存换算力」的取舍,放在西方GPU上可能不值得,但放在中国硬件生态里,意义完全不同。
6. TileLang(编译器生态)
除了技术,DeepSeek更深远的一步是投资了TileLang,一个编译器生态项目。它的作用很简单:让开发者写一次算子代码,就能在多种硬件平台上运行。这对于打破「CUDA护城河」至关重要。
7. Dual Path和计算通信重叠
Dual Path论文表面上是「算力受限下的权宜之计」,但DeepSeek走得更远,在V4论文中直接给出了对硬件厂商ASIC设计的建议,告诉他们「如何不浪费宝贵的硅片面积」。可以想象,面对面给出的建议只会更加具体。
不只是一堆技术论文,而是一张生态图谱
现在把这些技术拼在一起,就能看清DeepSeek的真正布局了。
KV Cache被极度压缩,HBM需求大幅下降。KV Cache可以高效卸载到SSD上,NAND闪存吃香了。
NAND是长江存储(YMTC)的主场,它正在成为3D NAND领域的全球玩家。DeepSeek的技术直接为长江存储创造了一个巨大的NAND和SSD市场。
不止NAND。DeepSeek的Engram模块用LPDDR内存作为查找表来节省算力。而LPDDR正是长鑫存储(CXMT)的主场。CXMT在速度上只落后最新制程半代,在密度上落后一代,差距很小,短时间内可以补齐。
中国GPU在原始FLOPs上永远追不上西方,原因是先进制程(EUV)和先进封装的双重限制。但DeepSeek的策略不是去硬碰硬的拼算力,而是另一条路:用充裕的NAND和LPDDR来弥补GPU算力的不足。
SGLang团队已经发布了一篇很好的博客,演示了如何用LPDDR来存储模型权重,在推理时按需「流式」加载到HBM中。DeepSeek的MoE架构(大量专家组合+4bit量化权重)让这种方案变得非常简单。
![]()
所有这些创新的共同效果是:降低了对HBM的依赖,降低了对高端GPU的依赖,让更多「够用但不顶尖」的硬件方案变得可行。
这就是DeepSeek真正的「产品」:一个让中国AI硬件生态变得可行的技术底座。
从OpenAI的AMD deal看DeepSeek的赚钱方式
技术服务于生态,但公司终究要赚钱。DeepSeek怎么变现?
@bookwormengr 在推文中给出了一个很有说服力的参照系。
2025年10月,AMD和OpenAI宣布了一项战略合作:AMD将向OpenAI供应高达6GW的GPU算力,作为条件,AMD向OpenAI授予了高达1.6亿股的认股权证,按里程碑解锁。首期1GW部署完成解锁第一批,后续随采购规模逐步解锁,同时和AMD的股价目标挂钩。
说白了,OpenAI通过「承诺使用你的硬件」来换取「持有你的股票」。这对AMD是巨大的信任背书,对OpenAI则是潜在的巨大财务回报。
@bookwormengr 预测,DeepSeek会走同样的路,和中国多家内存、ASIC、CPU和网络设备厂商签署类似的股权合作协议,深度参与它们硬件生态的打磨,让中国硬件的AI工作负载真正达到可用水准。
看看西方(包括东亚盟友)的AI相关股票的合计市值,远超10万亿美元。DeepSeek完全可以用「合作+股权」的模式,帮助创造一个同样体量的中国AI生态,从中拿到自己的那份,同时实现1万亿美元的自身估值。
用@bookwormengr的话说:「梁文锋,一个吉姆·西蒙斯的忠实粉丝,是个太聪明的资本家了,不可能错过这个。」
DeepSeek今天做的东西,整个行业明天都会用
其实这个路径已经开始了。DeepSeek的MoE、MLA、DSA等创新,已经被全球和中国其他AI实验室广泛采用。
智谱AI(ZAI)的GLM系列用了MLA和DSA,月之暗面(Moonshot)的Kimi也明确表示架构基于DeepSeek。反过来,DeepSeek也用了月之暗面率先在大规模训练中使用的Muon优化器。整个中国AI生态正在形成一种「互相借鉴、共同进化」的默契。
有了更多的硬件选择,以及自身对算力需求的极致压缩,DeepSeek可以承担更宏大的训练项目,特别是大规模强化学习后训练。RL训练需要生成海量的推理轨迹,动辄数万亿token,1M上下文的模型更是需要训练同样长的轨迹。这些对算力的需求是天文数字,但DeepSeek正在把成本降到可以承受的水平。
更进一步,更多的硬件选择意味着DeepSeek可以做自动化研究(RSI),让AI自己设计并执行实验。这条路有很多的试错成本,但它对于探索完整的设计空间来说是必要的。在到达AGI、继而到达ASI之前,RSI能力是必备的。
从今天往回看,DeepSeek一路上的所有选择,不着急做多模态、不卖coding plan、坚持开源、技术优先商业化其次,突然都有了清晰的逻辑。
这不是一家迷茫的公司在瞎折腾,而是一个目标极其清晰的团队在按部就班地执行一个十年计划。它的每一步技术发布,都是这个计划的一块拼图。
DeepSeek的KV Cache压缩技术大幅减少了HBM需求,这让长江存储和长鑫存储的产品在AI推理场景中变得更有价值。它的MoE和TileLang降低了GPU门槛,这让中国境内的GPU厂商有了切入AI市场的机会。它的开源策略确保了这些技术能快速扩散到整个生态,进而加速中国硬件的迭代。
最终,DeepSeek不需要亲自做出一款「爆款应用」来赚钱。它只需要让中国AI硬件生态变得可用,让这个生态里的每一个玩家都离不开它的技术贡献。
一个10万亿美元的行业生态,和它自己1万亿美元的估值,这才是梁文锋瞄着的目标。
从任何一个角度看,这个赌注都够大。
但回头想想DeepSeek一路走来的「反着走」记录,被质疑了,质疑错了,再被质疑,再被质疑错,也许该学会的是:当DeepSeek在做一件看起来「不合理」的事情时,很可能不是因为疯了,而是因为看到了别人还没看到的东西。
本文编译自@bookwormengr的X推文「DeepSeek's 10 trillion USD grand strategy」
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.