网易首页 > 网易号 > 正文 申请入驻

融资百亿不赚钱,DeepSeek的10万亿战略

0
分享至

当整个AI行业都在疯狂追赶多模态、视频生成、coding agent的时候,有一家公司对这些「风口」几乎视而不见。

没有coding plan,没有语音模型,没有视频模型,到现在连一个完整的模型部署框架(harness)都还没搭起来。更「离谱」的是,它还坚持把最核心的技术全部开源,毫无保留地分享自己的「秘方」。

这家公司是DeepSeek。

另一边,彭博社刚报道DeepSeek新融资规模已达700亿元(约100亿美元)。梁文锋对投资者放的话也很直接:优先突破技术边界,而不是急着变现。

乍看之下,这种行为简直像个悖论。一家不开源就等于「犯罪」的公司,偏偏锁死了开源。一家不做任何商业化产品的AI公司,偏偏还在大把烧钱。一个估值直奔千亿美元的超级独角兽,偏偏看起来没有任何明确的变现路径。

这是疯狂吗?是钱多烧得慌吗?是投资人在往排水沟里扔钱吗?


X博主@bookwormengr(一位长期追踪中国AI生态的分析师)在他的万字推文里给出了截然相反的判断:

DeepSeek不是在烧钱,它是在下一盘10万亿美元的棋局。
一个「反着来」的英雄旅程

要理解DeepSeek今天的选择,得先看看它一路走来是怎么「反着来」的。

2025年1月,@bookwormengr 发了一条后来成为爆款的推文,他把DeepSeek的选择放在「英雄之旅」的叙事框架里解读。半年多过去,这个故事不但没过时,反而越来越精彩了。

当时所有人都在卷dense model(密集模型),DeepSeek偏偏跑去搞MoE(混合专家模型)。没人否认MoE的理论优势,但它训练难度大、推理效率难优化,「吃力不讨好」。DeepSeek不仅搞了,还搞成了,从V2到V3再到V4,MoE被它玩出了花。

当行业主流在用PPO(近端策略优化)做强化学习时,DeepSeek从第一性原理出发,发明了GRPO(分组相对策略优化)。PPO需要一个独立的「裁判模型」来提供奖励信号,GRPO直接省掉这个环节,更便宜,更高效。

当大家都在追逐更多模态时,DeepSeek把资源全部集中在了一件事上:推理能力。它找到了一个关键杠杆,基于验证奖励的强化学习(RLVR),让模型在数学和逻辑推理上突飞猛进。

从技术路线到产品策略,DeepSeek几乎每一次都在「反着走」。但仔细看,每一次「反着走」都指向同一个方向:把资源效率压榨到极致。

而在「英雄之旅」的叙事结构中,英雄从来不会事先规划自己的旅程。他是一路学习、一路遭遇挑战、一路找到盟友,最终发现自己真正的使命。DeepSeek的使命也越来越清晰了:不是卖coding plan,而是为中国的AI硬件生态铺路。

一张恐怖的KV Cache账单

要理解这个使命,得从一张账单说起。

AI模型处理长文本时,需要缓存一种叫KV Cache(键值缓存)的东西。上下文越长,KV Cache占用的HBM(高带宽显存)就越大。1M上下文?对大多数模型来说,KV Cache会把显存吃到怀疑人生。


@bookwormengr 用了一个刚发布的KV Cache计算器做了对比。输入1M上下文,假设8位KV精度和16位索引精度:

  • DeepSeek V4:只需要5.48GB HBM

  • GLM-5:需要60GB HBM

  • Qwen3-235B-A22B:需要89GB HBM

记住,DeepSeek V4是一个1.6万亿参数的巨型模型,GLM-5约7000亿参数(已经用了DeepSeek的MLA和DSA技术但没用最新的压缩注意力),Qwen3约2350亿参数(用的是GQA注意力机制)。

参数规模是GLM的两倍多、Qwen的近7倍,KV Cache却只有对方的十分之一甚至二十分之一。

用@bookwormengr的话说:「DeepSeek在显存压力上做出了根本性的贡献。」

这解释了为什么DeepSeek敢把长上下文缓存的价格打到Sonnet 4.6 Cache Hit价格的不到3%,还能保持数小时的缓存有效期。KV Cache足够小,可以高效卸载到SSD上再快速加载回来,DeepSeek的Dual Path论文专门讲了这件事。

当然,DeepSeek V4的压缩注意力(CSA/HCA)已经把KV Cache压缩到了连SSD卸载都不一定需要的程度。但这恰恰说明了一件事:DeepSeek所有的技术选择,都指向同一个战略方向:降低对HBM的依赖。

为什么要降低HBM的依赖?因为HBM是中国AI硬件生态中最难啃的骨头。

七项核心技术,全部指向同一个方向

DeepSeek过去两年的创新清单,拆开来看每一项都对应着一个具体的「战略棋子」。

1. MoE和MLA(2024年5月,DeepSeek V2)

这是DeepSeek技术路线的「地基」。MoE让训练同样智能的模型省下40%到50%的算力。MLA(多头潜在注意力)直接把KV Cache砍掉90%。这两项加在一起的效果是:模型的训练和推理成本大幅降低,KV Cache小到可以高效卸载到SSD。

2. DSA(DeepSeek V3.2 Exp)

DSA(动态稀疏注意力)解决的是长上下文的算力问题。传统Transformer面对长文本时,计算量和上下文长度呈线性增长。DSA让这个增长曲线几乎持平。上下文增长到1M,处理时间依然保持平稳。这相当于在不增加算力投入的前提下,把模型的长上下文能力「白送」了出来。

3. mHC(2025年12月论文)

mHC(流形约束超连接)是DeepSeek在宏观架构上的创新。传统的残差连接用的是「x + F(x)」的简单加法,mHC把这条信息高速公路扩展成了多条并行通道,允许信息在层与层之间「学会」混合。更关键的是,它用数学约束(双随机矩阵)保证信号在极深的网络中不会爆炸或消失。

效果是什么呢?在270亿参数规模下,mHC让BIG-Bench Hard推理得分提升7.2分,DROP阅读理解提升3.2分,GSM8K数学提升2.8分,而计算开销只增加了6.7%。用@bookwormengr的话说:「用几乎不增加算力的代价,实现了更高的每参数智能密度。」

4. CSA和HCA(2026年4月,DeepSeek V4)

如果说MLA砍掉了90%的KV Cache,CSA(压缩稀疏注意力)和HCA(分层压缩注意力)在此基础上再砍90%。这是DeepSeek V4能将1.6万亿参数的KV Cache压到5.48GB的核心原因。

5. Engram(2026年1月论文)

Engram是DeepSeek最「反常」的一项创新。MoE已经实现了条件计算,只激活部分参数来节省算力。但DeepSeek发现Transformer缺乏一个「原生知识查询」的机制,不得不用计算来模拟查询。

Engram的解决方案很巧妙:把经典的N-gram模型现代化,变成一个O(1)哈希查找模块。它用内存换计算,查一次LPDDR内存比过一遍Transformer层便宜得多。这种「内存换算力」的取舍,放在西方GPU上可能不值得,但放在中国硬件生态里,意义完全不同。

6. TileLang(编译器生态)

除了技术,DeepSeek更深远的一步是投资了TileLang,一个编译器生态项目。它的作用很简单:让开发者写一次算子代码,就能在多种硬件平台上运行。这对于打破「CUDA护城河」至关重要。

7. Dual Path和计算通信重叠

Dual Path论文表面上是「算力受限下的权宜之计」,但DeepSeek走得更远,在V4论文中直接给出了对硬件厂商ASIC设计的建议,告诉他们「如何不浪费宝贵的硅片面积」。可以想象,面对面给出的建议只会更加具体。

不只是一堆技术论文,而是一张生态图谱

现在把这些技术拼在一起,就能看清DeepSeek的真正布局了。

KV Cache被极度压缩,HBM需求大幅下降。KV Cache可以高效卸载到SSD上,NAND闪存吃香了。

NAND是长江存储(YMTC)的主场,它正在成为3D NAND领域的全球玩家。DeepSeek的技术直接为长江存储创造了一个巨大的NAND和SSD市场。

不止NAND。DeepSeek的Engram模块用LPDDR内存作为查找表来节省算力。而LPDDR正是长鑫存储(CXMT)的主场。CXMT在速度上只落后最新制程半代,在密度上落后一代,差距很小,短时间内可以补齐。

中国GPU在原始FLOPs上永远追不上西方,原因是先进制程(EUV)和先进封装的双重限制。但DeepSeek的策略不是去硬碰硬的拼算力,而是另一条路:用充裕的NAND和LPDDR来弥补GPU算力的不足。

SGLang团队已经发布了一篇很好的博客,演示了如何用LPDDR来存储模型权重,在推理时按需「流式」加载到HBM中。DeepSeek的MoE架构(大量专家组合+4bit量化权重)让这种方案变得非常简单。


所有这些创新的共同效果是:降低了对HBM的依赖,降低了对高端GPU的依赖,让更多「够用但不顶尖」的硬件方案变得可行。

这就是DeepSeek真正的「产品」:一个让中国AI硬件生态变得可行的技术底座。

从OpenAI的AMD deal看DeepSeek的赚钱方式

技术服务于生态,但公司终究要赚钱。DeepSeek怎么变现?

@bookwormengr 在推文中给出了一个很有说服力的参照系。

2025年10月,AMD和OpenAI宣布了一项战略合作:AMD将向OpenAI供应高达6GW的GPU算力,作为条件,AMD向OpenAI授予了高达1.6亿股的认股权证,按里程碑解锁。首期1GW部署完成解锁第一批,后续随采购规模逐步解锁,同时和AMD的股价目标挂钩。

说白了,OpenAI通过「承诺使用你的硬件」来换取「持有你的股票」。这对AMD是巨大的信任背书,对OpenAI则是潜在的巨大财务回报。

@bookwormengr 预测,DeepSeek会走同样的路,和中国多家内存、ASIC、CPU和网络设备厂商签署类似的股权合作协议,深度参与它们硬件生态的打磨,让中国硬件的AI工作负载真正达到可用水准。

看看西方(包括东亚盟友)的AI相关股票的合计市值,远超10万亿美元。DeepSeek完全可以用「合作+股权」的模式,帮助创造一个同样体量的中国AI生态,从中拿到自己的那份,同时实现1万亿美元的自身估值。

用@bookwormengr的话说:「梁文锋,一个吉姆·西蒙斯的忠实粉丝,是个太聪明的资本家了,不可能错过这个。」

DeepSeek今天做的东西,整个行业明天都会用

其实这个路径已经开始了。DeepSeek的MoE、MLA、DSA等创新,已经被全球和中国其他AI实验室广泛采用。

智谱AI(ZAI)的GLM系列用了MLA和DSA,月之暗面(Moonshot)的Kimi也明确表示架构基于DeepSeek。反过来,DeepSeek也用了月之暗面率先在大规模训练中使用的Muon优化器。整个中国AI生态正在形成一种「互相借鉴、共同进化」的默契。

有了更多的硬件选择,以及自身对算力需求的极致压缩,DeepSeek可以承担更宏大的训练项目,特别是大规模强化学习后训练。RL训练需要生成海量的推理轨迹,动辄数万亿token,1M上下文的模型更是需要训练同样长的轨迹。这些对算力的需求是天文数字,但DeepSeek正在把成本降到可以承受的水平。

更进一步,更多的硬件选择意味着DeepSeek可以做自动化研究(RSI),让AI自己设计并执行实验。这条路有很多的试错成本,但它对于探索完整的设计空间来说是必要的。在到达AGI、继而到达ASI之前,RSI能力是必备的。

从今天往回看,DeepSeek一路上的所有选择,不着急做多模态、不卖coding plan、坚持开源、技术优先商业化其次,突然都有了清晰的逻辑。

这不是一家迷茫的公司在瞎折腾,而是一个目标极其清晰的团队在按部就班地执行一个十年计划。它的每一步技术发布,都是这个计划的一块拼图。

DeepSeek的KV Cache压缩技术大幅减少了HBM需求,这让长江存储和长鑫存储的产品在AI推理场景中变得更有价值。它的MoE和TileLang降低了GPU门槛,这让中国境内的GPU厂商有了切入AI市场的机会。它的开源策略确保了这些技术能快速扩散到整个生态,进而加速中国硬件的迭代。

最终,DeepSeek不需要亲自做出一款「爆款应用」来赚钱。它只需要让中国AI硬件生态变得可用,让这个生态里的每一个玩家都离不开它的技术贡献。

一个10万亿美元的行业生态,和它自己1万亿美元的估值,这才是梁文锋瞄着的目标。

从任何一个角度看,这个赌注都够大。

但回头想想DeepSeek一路走来的「反着走」记录,被质疑了,质疑错了,再被质疑,再被质疑错,也许该学会的是:当DeepSeek在做一件看起来「不合理」的事情时,很可能不是因为疯了,而是因为看到了别人还没看到的东西。

本文编译自@bookwormengr的X推文「DeepSeek's 10 trillion USD grand strategy」

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
彻底失控!查尔斯一纸官宣引爆连锁危机,哈里公益事业惨遭重创

彻底失控!查尔斯一纸官宣引爆连锁危机,哈里公益事业惨遭重创

动物奇奇怪怪
2026-09-12 01:10:14
太扎心!巴萨 7000 万新援封神!曼联王牌彻底被碾压

太扎心!巴萨 7000 万新援封神!曼联王牌彻底被碾压

澜归序
2026-09-11 09:41:11
中国网球大捷!2-0、2-1,郑钦文迷妹冲青少冠军,孙心然夺4连胜

中国网球大捷!2-0、2-1,郑钦文迷妹冲青少冠军,孙心然夺4连胜

嘴角上翘
2026-09-12 07:00:59
美网预测男单决赛阵容难掩寒酸尴尬,萨巴谈项链:分散对手注意力

美网预测男单决赛阵容难掩寒酸尴尬,萨巴谈项链:分散对手注意力

网球之家
2026-09-11 23:34:15
23分大胜世界第三!西班牙女篮破八年魔咒 37岁老将吐舌庆祝超开心

23分大胜世界第三!西班牙女篮破八年魔咒 37岁老将吐舌庆祝超开心

颜小白的篮球梦
2026-09-11 09:27:03
管虎破防了,又开始怪审查了

管虎破防了,又开始怪审查了

闲人电影
2026-09-09 17:11:13
像耿彦波这样的官员,为何没能得到进一步提拔?

像耿彦波这样的官员,为何没能得到进一步提拔?

起喜电影
2026-09-12 00:18:06
49岁钟丽淇被曝送入ICU,混血丈夫回应支支吾吾,梁靖琪现身医院

49岁钟丽淇被曝送入ICU,混血丈夫回应支支吾吾,梁靖琪现身医院

情感大头说说
2026-09-11 15:18:40
墨尔本胜利官方:38岁老将马塔不再作为球员出场,将专注于股东工作

墨尔本胜利官方:38岁老将马塔不再作为球员出场,将专注于股东工作

懂球帝
2026-09-11 15:09:12
与何超琼同居14年,至今没领证没生娃没名分,地位早已超越陈百强

与何超琼同居14年,至今没领证没生娃没名分,地位早已超越陈百强

凡知
2026-09-11 13:11:15
郑州市委书记调整

郑州市委书记调整

新京报政事儿
2026-09-11 16:54:03
中东突变,油价跳水

中东突变,油价跳水

上海证券报
2026-09-11 19:34:09
成都最低调的四大隐形富人区!路人以为是普通小区,实则身家千万

成都最低调的四大隐形富人区!路人以为是普通小区,实则身家千万

靓仔情感
2026-09-11 00:08:03
曝台湾演员刘德凯云南定居,出行开奔驰老S,72岁状态好仍很帅气

曝台湾演员刘德凯云南定居,出行开奔驰老S,72岁状态好仍很帅气

一盅情怀
2026-07-19 20:30:52
别急着买电车!2027将迎来大转折,不止是固态电池上车

别急着买电车!2027将迎来大转折,不止是固态电池上车

沙雕小琳琳
2026-09-11 19:48:06
大陆留美学者赵通:手把手地教美国,如何瓦解大陆统一台湾的共识

大陆留美学者赵通:手把手地教美国,如何瓦解大陆统一台湾的共识

非虚构人间
2026-09-11 11:56:59
2026年9月,魏德尔的一句"不派军舰去中国家门口、不军演、不挑衅"的表态,被中文媒体不断转述。

2026年9月,魏德尔的一句"不派军舰去中国家门口、不军演、不挑衅"的表态,被中文媒体不断转述。

回京历史梦
2026-09-11 17:34:55
“AI写的代码「惨不忍睹」!”Linux内核开发者吐槽:Bug找得挺准,23个补丁最高提速90%,但代码都是我重写的

“AI写的代码「惨不忍睹」!”Linux内核开发者吐槽:Bug找得挺准,23个补丁最高提速90%,但代码都是我重写的

CSDN
2026-09-11 19:36:38
前记者刘虎被成都公安解除取保候审

前记者刘虎被成都公安解除取保候审

记录刘杰
2026-09-11 20:30:42
海航双胞胎姐妹花空姐,同时怀孕了

海航双胞胎姐妹花空姐,同时怀孕了

微微热评
2026-09-03 12:18:33
2026-09-12 08:08:49
大厂观察 incentive-icons
大厂观察
你想了解的大厂的一切~
227文章数 41关注度
往期回顾 全部

财经要闻

女装“玖姿”母公司跨境贸易迷局:安正时尚说谎了吗?

头条要闻

"葫芦爷爷"摘下7个葫芦没几天又挂回来了 多方回应

头条要闻

"葫芦爷爷"摘下7个葫芦没几天又挂回来了 多方回应

体育要闻

37岁还能场场进球,还能翻跟头!

娱乐要闻

黄晓明直言帮太多白眼狼,杨颖遭殃

科技要闻

苹果折叠屏比小米华为贵5000元,该怎么选

汽车要闻

买菜车也有小乐趣 风云T7不止是台合格家用SUV

态度原创

教育
房产
旅游
本地
军事航空

教育要闻

大气!教表彰会上,一名老师将自己4.8万元奖金平分给400多名学生,还将另外的4万元还给校长

房产要闻

别再等了!广州改善好房,正在进入“卖一套少一套”时代

旅游要闻

文化中国行·长江文化探访丨川江航运文化园把百年航运记忆“装”进江岸

本地新闻

Onestage x 乐华娱乐暑期巡回选拔2026

军事要闻

涉伊朗核问题 中国和俄罗斯投下反对票

无障碍浏览 进入关怀版