网易首页 > 网易号 > 正文 申请入驻

DeepSeek们狂造芯片,英伟达终于不香了?

0
分享至



不是哥们,DeepSeek要自己搞芯片???

事情是这样,前段时间,路透社报道说浓眉大眼的DeepSeek已经悄摸做了一年的AI芯片了,正在接触芯片设计、晶圆代工和存储厂商。

但这消息出来没几天,OpenAI就把自己和博通搞的Jalapeño芯片集群端了出来。完事儿同样也在这段时间,Anthropic也说要开始组建自己的芯片团队了。。。


不是你们一个个的,一边疯狂买英伟达产能,一边又公开表示也要下场搞芯片。难道老黄卖给他们的GPU不香了吗?

经过一番研究我发现,还真是不香了。。。

而这一切都是因为:推理芯片。


这个所谓的推理芯片,其实也不是啥新词。很多年前谷歌第一代TPU就在研究推理了,前几年各种研究推理芯片的初创公司也不少,像什么Groq、Cerebras、SambaNova,这些可以说是各有绝活。

但是之所以大家现在感到陌生,原因也是显而易见:这个行业在前几年一直都是不温不火,属于大厂们鸟都不鸟的领域。

那么问题来了,前几年大厂对此不甚上心,今年偏说婉婉类卿,为啥突然间大伙都夏侯惇坐飞机,高看一眼了呢?


因为划不来啊。。。这事在当年还没谱。

众所周知,大模型是个发展很快的行业,今天爆火的模型、技术方向,可能过两个月就无人问津了。今年的OpenCLaw小龙虾现在在哪发财咱都不知道,更别说前两年的大模型厂商了。

毕竟那时候旗帜鲜明反对LLM的都大有人在(你小杨哥YannLecun)。。。大模型能走多远都不好说,所以模型厂商们更不可能专门为推理造芯片了。


毕竟英伟达的卡又不是不能用,训练起来也嘎嘎好使,花时间研究推理芯片那不是闲的嘛。唯一搞推理的谷歌TPU,最开始也不是为大模型准备的,因为那时候大模型都还没出生呢。

但事情的转机,发生在两年前的这个时候。

2024 年 8 月,Google DeepMind 团队发表了一篇里程碑式论文,他们发现只要延长思考时间,模型的正确率就会直接暴涨。

9月开始,OpenAI 的o 系列就开始让原子弹爆炸了;翻过年,DeepSeek-R1 等深度思考模型又给了世界一顿中国震撼。

然后从去年到今年,大家逐渐认识到,AI Agent、多 Agent 协作集群、几十万字的超长上下文分析,已经成了大模型落地工作的标配。深度推理和 Agent 这套技术路线,基本得到了整个行业的确认。

随着技术路线的确认和发展,压力最大的除了前端兄弟,还有 GPU。。。。


随便打开一个AI对话框,我们在这里输入文字,AI就会返回文字,这看起来非常自然丝滑。

但从AI的视角看,你告诉AI“扮演一个猫娘”,它需要先理解“这句话到底说了个啥?”这一步就被称为Prefill。而AI读懂以后,开始学猫娘说话输出给你的过程,叫Decode

在Prefill阶段,AI要把一整句话拆成一个个token,然后分别理解这些tokens的含义,这个过程和AI的训练阶段非常相似。

模型怎么才能判断这些token的含义呢,这就涉及到了矩阵

而纵观天下硬件,最适合算矩阵的算中之霸,就是GPU。


然鹅,对GPU来说,发送问题的Prefill阶段,和输出回答的Decode阶段,计算过程却完全不同。。。

在Prefill阶段,我们一次性提供了数据,GPU可以自己切分、所有核心一起并行计算,这就很舒服。

用下面图片中的简化公式感受一下:假设我们输入的token需要一个4096参数的矩阵,那么计算出来每从内存搬运 1 个字节的数据,GPU就可以用这笔数据,执行上千次运算。

但一进入Decode 阶段,形势就出了问题。

众所周知,现在的大模型都是自回归的,说白了就是要知道上一个词才能算出来下一个词。所以原本Prefill阶段4096行的输入矩阵,到了Decode阶段,会暴跌成只有1行。

经过同样的计算,每搬运 1 个字节的数据,GPU就只能算一次。。。


这下就坏菜了。。。

在芯片内部,两个数据相乘的能量消耗非常少。但要把一个数据从显存搬到GPU里,消耗的能量和时间往往是前者的几十倍甚至上百倍。

所以要把一颗芯片的算力拉满,理想的情况一定是,搬一次数据进核心,然后在本地反复算上几万次。最忌讳的就是搬一次算一次,下次要用再临时去搬。

所以在Decode阶段,一个 70B参数140GB 权重的大模型,每向用户输出一个 Token,芯片就必须把这 140GB 从 HBM 显存里完整读入一遍,再吐一个字又重读一遍。

哪怕用上 3 TB/s带宽的顶级显存,输出速度也只有每秒21个token。。。


换句话说,老子花这么多钱买显卡,结果芯片有 80% 的时间在发呆等数据传过来,这nm谁受得了。

更要命的是,除了推理时间变长,为了记住前面几十万字的思考过程,模型必须把所有历史 Token 的特征全部缓存在显存里,每多思考一步,显存里要搬运的数据量(KV Cache)也跟着爆炸。(这就是为啥显存和内存都纷纷涨价)

过去显存还算够用的时候,各大厂商还能靠纯软件手段来轻松绷住。

比如搞连续批处理,把几十个用户的请求攒起来摊薄搬运成本;还有梁圣的潜在多头注意力机制,压缩 KV Cache来减少GPU的搬运量。

但这些都治标不治本。。。GPU在本质上是通用芯片而不是推理芯片,它就不是给来Decode的啊!


实际上,谷歌在很多年前就发现了这个问题。他们当时想到的办法非常简单粗暴,既然通用GPU这么拉,那我为什么不专门造一颗只为推理的芯片?

于是,第一代 TPU就诞生了。它用来解决数据搬运问题的核心技术,叫作脉动阵列(Systolic Array)

把芯片内部比作一个工厂,HBM显存是厂外的中央仓库,SRAM是流水线旁的小筐,计算核心就是打螺丝工位。普通的 GPU 算矩阵,就像一个工人每拧一颗螺丝,就要回显存仓库里拿一个零件,拧完再送回仓库。

而谷歌的脉动阵列,就是把打螺丝的过程变成了流水线,而且是个二维的流水线。


他们把上万个乘法计算单元(PE)焊成一个方阵,矩阵的权重数据一旦进了流水线,就像接力棒一样在工位之间横向传递计算,算出来的结果再依次传到下一层计算。

由于数据在相邻的核心之间直接传递,数据每进一次核心,就会在里面连续传递、复用几十上百次,根本不需要退回外部显存,压根就不需要中途再去搬运数据。

所以TPU的这波杀招也成了谷歌能摆脱英伟达卡脖子,在Gemini2.5时代一秒就能脉动回来的关键之一。(当然现在Gemini又拉了)


以前技术路线没定,TPU这种专用方案在大模型上没显出太大优势,大家也就继续买GPU。

而当现在深度推理让推理负载暴增,TPU的思路开始真正香了起来,包括谷歌都开始把TPU专门分出来训练版和推理版。

于是各大模型厂在这段时间都纷纷觉醒:是时候砸钱做专用的推理芯片了。

当然,吃够了英伟达卡脖子窒息play的大模型厂们,这一次没人愿意再当被动的买家。。。

比起每年把几十上百亿美元ATM给老黄,你还得看人家脸色,有这钱养一个芯片团队开销简直就洒洒水。


不过真要自己做了,大家也没有只按谷歌的 TPU 的路线去抄。毕竟模型都是自家的,怎么也得自己调教开发才能找到最适合的硬件啊!

拿 Anthropic 来说,脉动阵列虽然快,但大量的杂活就不能脉动回来了。所以 Anthropic不仅搞脉动流水线,还选择跟AWS深度合作了Trainium(另一方面A社自己也宣布要自研),拿着 Claude 模型运行的真实工序数据,反向写进底层编译器。

而投奔了英伟达的Groq,他们的思路就是极端流水线派,认为普通芯片把显存的数据搬来搬去完全是浪费。所以直接把HBM 显存给砍了,然后把整颗芯片塞满SRAM,相当于所有货都放在流水线旁边的小筐,随用随取。

相比极端派,国内的阿里就正好反过来。如果底层架构写死,到时候大模型架构变了咋办?所以他们选择拼一刀,让大量灵活通用的标准加工岛,一起拼同一套缓存SRAM。


至于OpenAI嘛,如果说前面几家都还在生产线上下功夫,他们相当于把整个工业园区重建了一遍。OpenAI的Jalapeno推理集群跟博通合作,把芯片、HBM、本地缓存、芯片间网络一起设计,靠让特定用户的 KV Cache 记忆档案和特定的算力集群绑定来减少搬运。

于是这么看下来,模型厂和硬件厂之间就形成了一个类似汽车行业的格局,比方谷歌就像比亚迪,从TPU 到 Gemini 全栈自研;OpenAI + 博通就类似吉利,放出图纸和需求来让能力最强的制造商落地;

而Anthropic + 亚马逊 AWS就有点像鸿蒙智行。

当然英伟达、Groq就还是那个卖铲子的人。无论上层算法风向怎么变,买老黄这套东西永远是最稳妥的选择。


最后再说说DeepSeek。

由于咱们目前能查到的信息只有DeepSeek说要搞推理芯片,但具体怎么个搞法,目前还没有信息出来。

不过,2025年梁圣写过一篇文章,点名下一代AI硬件最需要解决的问题就包括低精度计算、内存容量、计算效率、芯片间互联和低延迟通信。再加上DeepSeek模型的特点,咱们也可以脑补一下。

设计上大概率也是根据模型适配来设计芯片,但因为DeepSeek本身对KV Cache压缩,以及MoE的相关技术,可能会有更大的内存容量但优化算力,或者专门对通信路由做优化,比如降低数据精度来进一步压缩,留出专用数据通路等等。

当然最终还是以DeepSeek自己的技术论文为准,咱就不多bb了。


讲到最后,其实大伙可能会发现,AI厂商其实在这一波过程中和英伟达的关系似乎出现了一些微♂妙的变化。

以前大家都是让AI模型适应芯片,拿到什么卡,就研究怎么切分模型、压缩KV Cache、调教通信,恨不能直接变成H200的形状。

但现在,不是所有环节都必须要GPU了。以后不再是GPU厂商制约AI厂商,而是AI厂商可以主动选择适合自己的软硬件,以及上下游配套。

这样一来,模型公司就不用看硬件厂商的脸色适配了,翻身把歌唱属于是。

那么可想而知,以后在这条时间线上很有可能发生如下画面:

模型公司终于可以对芯片团队说,我的模型很大,你忍一下。

撰文:纳西

编辑:江江 & 面线

美编:素描

图片、资料来源

OpenAI:Jalapeño’s first results show industry-leading speed and efficiency in AI inference

OpenAI:Trading Inference-Time Compute for Adversarial Robustness

Insights into DeepSeek-V3: Scaling Challenges and Reflections on Hardware for AI Architectures

introl:AI Inference vs Training Infrastructure: Why the Economics Diverge

Ironwood: The first Google TPU for the age of inference

Google research:In-Datacenter Performance Analysis of a Tensor Processing Unit

reuters:China's DeepSeek developing its own AI chip, sources say

Dwarkesh:TPU competition, why we should sell chips to China, & Nvidia’s supply chain moat

Groq Inference Tokenomics: Speed, But At What Cost?

DeepSeek、NVIDIA等,部分图源网络


特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
泽连斯基宣布,乌开始封锁俄领空!话音落下,中方指出唯一出路

泽连斯基宣布,乌开始封锁俄领空!话音落下,中方指出唯一出路

影孖看世界
2026-09-03 23:06:10
5年2.08亿!阿门成今夏第2位提前续约新秀

5年2.08亿!阿门成今夏第2位提前续约新秀

绿茵狂热者
2026-09-04 06:32:49
赵心童4 0完胜英国名将,球迷不得不接受这3个事实!

赵心童4 0完胜英国名将,球迷不得不接受这3个事实!

皇甫雨荨k
2026-09-03 23:04:55
郑钦文带病逆转,一发成功率跳升18个百分点,靠怎样的战术克制?

郑钦文带病逆转,一发成功率跳升18个百分点,靠怎样的战术克制?

暗香暗香
2026-09-04 04:19:22
外卖时代快正在终结,另一个全新的行业悄悄出来了。

外卖时代快正在终结,另一个全新的行业悄悄出来了。

老陆不老
2026-09-03 21:10:42
春丽演员再晒美照!丰臀肉腿配火辣曲线 性感十足

春丽演员再晒美照!丰臀肉腿配火辣曲线 性感十足

游民星空
2026-09-03 16:35:24
足协重磅处罚正式出炉!一纸罚单落地,山东泰山迎来足协杯重大利好

足协重磅处罚正式出炉!一纸罚单落地,山东泰山迎来足协杯重大利好

舟望停云
2026-09-04 02:00:16
9月4日美股收盘:三大指数全线上涨,沃勒“鸽派”表态提振市场

9月4日美股收盘:三大指数全线上涨,沃勒“鸽派”表态提振市场

新浪财经
2026-09-04 04:31:34
简氏2026发布复盘:巴基斯坦歼十没有击落阵风战机,打中的全是拖曳诱饵!

简氏2026发布复盘:巴基斯坦歼十没有击落阵风战机,打中的全是拖曳诱饵!

步论天下事
2026-09-01 09:17:26
飞机上随手一拍,成都航空这位空乘小姐姐真的绝了。

飞机上随手一拍,成都航空这位空乘小姐姐真的绝了。

毒舌八卦
2026-09-03 22:32:24
九月二号的西安赛格现状

九月二号的西安赛格现状

童童聊娱乐啊
2026-09-04 00:39:53
最伤身的“饮料”公布,停止饮用,很多人还当成宝,天天喝!

最伤身的“饮料”公布,停止饮用,很多人还当成宝,天天喝!

健康科普365
2026-08-29 20:40:04
斯诺克最新战报 中国2人进八强 龙泽煌范争一晋级 赵心童对手较弱

斯诺克最新战报 中国2人进八强 龙泽煌范争一晋级 赵心童对手较弱

千山暮雪h
2026-09-04 02:18:40
前中超裁判员李英宾因病去世,终年46岁

前中超裁判员李英宾因病去世,终年46岁

懂球帝
2026-09-03 22:24:15
梅西广告暗讽C罗?GOAT之争已终结,葡媒不满,主持人开炮

梅西广告暗讽C罗?GOAT之争已终结,葡媒不满,主持人开炮

奥拜尔
2026-09-03 22:36:34
一步错全盘崩!罗德里选错队伍,皇马巴萨彻底双输

一步错全盘崩!罗德里选错队伍,皇马巴萨彻底双输

观星娱记
2026-09-03 09:01:13
太扎心了!68岁老汉39℃高温挑砖,而两个女儿坐在一旁吃着200多元一个的榴莲,结果引来全网怒骂,了解内情后让人破防了

太扎心了!68岁老汉39℃高温挑砖,而两个女儿坐在一旁吃着200多元一个的榴莲,结果引来全网怒骂,了解内情后让人破防了

史海言事
2026-09-02 16:18:16
从1.35亿到6100万,《牛来》票房断崖式下跌,观众们终于清醒了

从1.35亿到6100万,《牛来》票房断崖式下跌,观众们终于清醒了

影视高原说
2026-09-02 13:46:41
萨拉赫加盟即陷入动荡:特拉布宗体育欧战出局,主帅离职引发混乱

萨拉赫加盟即陷入动荡:特拉布宗体育欧战出局,主帅离职引发混乱

星耀国际足坛
2026-09-03 22:26:34
汉族血统相对纯正的5大姓氏,你的姓在列吗

汉族血统相对纯正的5大姓氏,你的姓在列吗

糖逗在娱乐
2026-09-01 00:21:11
2026-09-04 07:08:49
差评XPIN incentive-icons
差评XPIN
用知识和观点Debug the world!
11417文章数 489815关注度
往期回顾 全部

科技要闻

英伟达129亿美元拿下Hugging Face

头条要闻

男子逛夜市遭按摩摊大妈拉住 被5个大妈服务按到发红

头条要闻

男子逛夜市遭按摩摊大妈拉住 被5个大妈服务按到发红

体育要闻

梅西:巴萨10号与阿根廷10号

娱乐要闻

王宝强携女友回工作室!相恋8年仍未婚

财经要闻

章子怡套现3亿 上美拿什么补韩束的缺?

汽车要闻

限时权益价28.99万起 FREELANDER神行者8正式上市

态度原创

房产
教育
时尚
数码
本地

房产要闻

投资50亿!三亚又一重大配套,方案曝光!

教育要闻

【考试地理】火山与温泉

女人到了60岁衣服少穿大红大绿,试试这些纯色单品,高级又耐看

数码要闻

IFA前夜,云鲸将十周年发布会开到了柏林,还顺手秀了波具身智能

本地新闻

昆明的雨,解锁汪曾祺的浪漫雨季

无障碍浏览 进入关怀版