网易首页 > 网易号 > 正文 申请入驻

为什么下一代AI芯片公司的真正产品,可能不是芯片,而是一整个计算系统?

0
分享至


本文试图从 GPU → Board → Server → Rack → Cluster,看AI芯片竞争单位的迁移。如果一家AI芯片公司今天仍然把自己的产品定义为“一颗GPU”,它可能正在用上一代半导体产业的产品逻辑,参加下一代计算系统的竞争。

原因并不复杂。

客户真正购买的,从来不是TFLOPS。

训练大模型的客户购买的是:多久能把模型训练出来。

做推理的客户购买的是:在给定延迟和SLA下,一美元能生成多少token。

建设数据中心的客户购买的是:在有限的电力、机柜、网络和运维能力下,一个MW究竟能产生多少有效AI计算。

当这些指标成为真正的商业指标之后,决定竞争力的东西就不可能只存在于GPU芯片内部。

于是过去十几年里,我们看到AI计算的产品单位不断向外扩张:

GPU
↓
Board
↓
Server
↓
Rack
↓
Cluster

这并不是简单地“把更多GPU装在一起”。

它背后真正发生的是:

AI计算的主要瓶颈,正在不断从芯片内部迁移到芯片外部。

而谁能够控制新的瓶颈,谁就有可能重新定义AI芯片公司的边界。


大家好,我是虎哥,欢迎订阅我的半导体课程:

一、为什么“更快的GPU”越来越不等于“更快的AI系统”?

理解这个问题,首先要重新看摩尔定律。

过去几十年,半导体公司最习惯的竞争方式是:

制程升级 → 晶体管增加 → 频率或并行度提升 → 单芯片性能提高。

只要一颗处理器更快,系统大概率也会更快。

但AI计算开始打破这种简单关系。

因为AI计算并不是纯粹的算术问题,而是一个巨大的数据移动问题。

矩阵乘法需要数据。

模型权重需要从HBM读取。

Activation需要传输。

训练过程中的梯度需要在GPU之间同步。

推理中的KV Cache需要不断访问。

模型并行以后,一块GPU算完的数据还要交给下一块GPU。

也就是说:

计算能力越强,对内存、互联和供电提出的要求反而越高。

于是一个非常重要的变化出现了:

FLOPS增长速度,可以快于“把数据送到计算单元”的速度。

这时候继续增加Tensor Core,并不一定能够同比例提高真实模型性能。

如果HBM带宽不足,Tensor Core会等待。

如果GPU之间通信不足,GPU会等待。

如果网络拥塞,整个训练集群都会等待。

如果功率密度过高,服务器甚至装不进去。

所以今天分析AI芯片,只看峰值算力已经越来越没有意义。

真正应该看的,是:

有效算力 = 计算能力 × 内存效率 × 通信效率 × 软件效率 × 系统利用率。

这也是为什么AI芯片的竞争自然会从GPU向外扩张。

二、第一步:GPU → Board

很多人讨论AI芯片时,实际上把GPU die和GPU产品混在了一起。

但真正进入数据中心以后,裸芯片几乎没有意义。

GPU首先必须变成一个完整的计算模块。

这一层开始出现:

HBM、先进封装、供电、电源管理、高速SerDes、PCIe、NVLink/Infinity Fabric等高速互联。

从这一刻开始,AI计算已经不再是单颗逻辑芯片的问题。

例如,一颗GPU即使拥有非常强的矩阵计算能力,如果HBM容量不足,一个模型就必须被切到更多GPU上。

GPU数量增加以后,又会产生新的通信需求。

于是:

内存问题变成互联问题。

互联问题进一步又会变成:

功耗问题、封装问题和系统拓扑问题。

这就是AI计算最典型的“瓶颈迁移”。

解决一个瓶颈,经常会制造下一个瓶颈。

所以今天GPU真正的竞争力已经不是:

“我的MAC单元比你多多少?”

而是:

在给定封装、HBM容量、带宽和功耗条件下,我能不能让这些MAC长期保持高利用率?

这是GPU第一次变成“系统问题”。

三、第二步:Board → Server

再往外走一层,就到了服务器。

传统服务器时代,CPU是中心。

GPU更像一个PCIe外挂加速器。

但AI服务器越来越不同。

现在GPU往往才是系统的核心资产。

CPU、NIC、DPU、PCIe Switch、内存和NVMe,反而围绕GPU进行设计。

这意味着服务器架构发生了一次“主次关系倒置”。

一台AI服务器真正需要解决的问题包括:

CPU与GPU如何协同?

八块GPU之间怎么连接?

GPU访问NIC经过什么路径?

PCIe有没有oversubscription?

网络数据能否直接进入GPU?

通信能否与计算overlap?

服务器故障以后如何快速隔离和更换?

BMC如何管理?

软件如何识别整个拓扑?

这些问题,没有任何一个可以单靠GPU芯片解决。

所以从这一代AI开始,真正有竞争力的GPU公司越来越需要提供的不只是芯片,而是:

经过验证的服务器计算拓扑。

HGX这一类产品的意义就在这里。

它卖的并不仅仅是若干颗GPU放到PCB上。

真正重要的是:

GPU之间应该怎样组成一个确定性的高速计算域。

四、第三步:Server → Rack

而今天最值得关注的变化,其实是下一步:

服务器本身,也正在变得太小。

为什么?

因为模型并行规模继续扩大。

八块GPU已经不足以构成理想的Scale-up domain。

如果GPU跨服务器通信,传统网络的延迟和带宽就可能成为瓶颈。

于是产业开始尝试一件事情:

把整个Rack重新设计成一台计算机。

这也是NVIDIA GB200 NVL72真正值得研究的地方。

NVIDIA的官方架构中,一个NVL72机柜包括72颗Blackwell GPU、36颗Grace CPU,并通过NVLink形成72-GPU高速互联域;官方给出的整个NVLink系统聚合带宽达到130TB/s。它已经不再把机柜描述成若干独立服务器,而是强调一个Rack可以形成类似“单个巨大GPU”的计算域。

注意这里最重要的不是“72”这个数字。

而是产品定义发生了变化。

以前:

机柜只是装服务器的铁架子。

现在:

机柜本身成为计算架构的一部分。

里面有:

Compute Tray、

NVLink Switch Tray、

网络交换、

电源Shelf、

Busbar、

液冷Manifold、

管理网络,

所有这些东西共同组成一个计算产品。

这意味着AI芯片公司的工程边界已经碰到了电气工程甚至暖通工程。

以NVIDIA公开的GB300 NVL72参考架构为例,完整机柜功率需求最高可到约142kW。

当一个Rack达到100kW以上以后,问题就不再只是“芯片性能”。

供电架构必须变化。

液冷必须参与系统设计。

铜缆长度会影响互联。

电源转换效率开始影响TCO。

机柜重量、维修空间、快速接头甚至漏液检测,都成为产品问题。

于是出现一个很有意思的现象:

AI芯片公司的竞争,正在第一次系统性进入数据中心物理基础设施。


五、这并不是NVIDIA一家公司的特殊路线

如果这只是NVIDIA自己的封闭体系,我们或许可以把它理解为一家公司的纵向整合战略。

但AMD正在沿着非常类似的方向发展。

2026年AMD正式公布Helios Rackscale方案,把72颗MI455X GPU、EPYC CPU、Pensando网络和ROCm软件放进一个统一的Rack-scale架构。

AMD公开规格中,Helios最多提供约31TB HBM4容量以及约1.67PB/s理论内存带宽。更重要的是,AMD明确把Helios定义成一个Rack-scale reference design,而不是单独销售的一台机器,并试图通过OCP、UALink和UEC等开放标准交给OEM/ODM生态构建。

这说明真正值得注意的不是谁的Rack参数更高。

而是:

两条技术路线正在得出同一个产品结论。

一条路线强调:

专有高速互联 + 强垂直整合 + 软件生态。

另一条路线强调:

开放互联 + 标准化Rack + OEM生态。

但双方都开始认为:

下一代AI计算的基本产品单元,很可能已经不是GPU,而是Rack。


六、为什么Rack之后还要走向Cluster?

Rack仍然没有解决所有问题。

因为一个Rack有72颗GPU也好,144颗GPU也好,对于最前沿模型训练来说仍然远远不够。

于是Scale-up之后一定还有Scale-out。

这时候整个数据中心网络就变成了另一层计算架构。

可以把它简单理解为:

NVLink/UALink解决“近距离GPU通信”。

而InfiniBand或者高性能Ethernet负责:

把不同Rack组成更大的计算机。

这时网络已经不再只是数据中心的基础设施。

它实际上变成了一块巨大的:

分布式背板。

一旦走到Cluster级别,决定系统性能的变量进一步增加:

网络拓扑、

交换芯片、

NIC、

拥塞控制、

Collective Communication Library、

任务调度、

存储、

Checkpoint、

故障恢复、

软件编排。

如果有10000颗GPU,其中几十颗出现异常并不是偶然事件,而会成为日常状态。

此时真正的问题已经变成:

一个拥有10000颗GPU的系统,能够有多少GPU长期参与有效计算?

这就是为什么“买了一万块GPU”和“拥有一万块GPU的有效算力”,完全不是一回事。

七、训练和推理,会进一步推动系统分化

接下来还有一个容易被低估的变化:

训练和推理正在变成两种越来越不同的系统工程。

训练更关心的是:

大规模同步、

AllReduce、

通信带宽、

并行效率、

Checkpoint、

长时间稳定运行。

简单来说:

训练希望几千甚至几万颗GPU像“一颗GPU”一样工作。

而推理开始出现完全不同的问题。

尤其是LLM推理可以进一步拆成:

Prefill和Decode。

Prefill具有更明显的计算密集属性。

Decode则非常依赖:

HBM带宽、KV Cache容量和访问效率。

随着上下文长度扩大,KV Cache本身就可能成为巨大的内存系统。

此时推理系统真正优化的也不再是FLOPS,而是:

TTFT——首Token延迟,

TPOT——每Token生成时间,

吞吐量,

并发量,

以及最终最重要的:

Cost per Token。

因此未来甚至可能出现更明显的异构系统:

Prefill使用一种计算资源,

Decode使用另一种资源,

KV Cache拥有独立的内存层级,

网络负责把它们组合起来。

于是AI芯片真正的架构单位甚至可能继续从Rack扩展到:

整个推理集群。

八、到了这一步,“芯片架构”实际上已经变成“系统架构”

这也是下一代AI芯片公司最大的认知变化。

以前设计GPU时,架构团队的核心问题可能是:

多少计算单元?

多少Cache?

多少Tensor Core?

多少HBM?

多少SerDes?

以后产品定义会议上的问题可能会变成:

一个Rack放多少GPU?

Scale-up domain应该多大?

每颗GPU需要多少HBM?

每个Rack需要多少网络带宽?

供电效率是多少?

液冷怎么布置?

一个Cluster需要多大的Bisection Bandwidth?

模型并行如何映射到物理拓扑?

Compiler能否感知拓扑?

Runtime是否能自动做通信与计算重叠?

KV Cache放在哪里?

发生链路故障以后任务能否继续运行?

这时候所谓“芯片架构师”,实际上已经越来越接近:

计算系统架构师。


九、但做“系统”绝不意味着简单堆更多芯片

这里必须强调一个非常容易出现的误区。

很多人看到Rack-scale计算后,会得出一个简单结论:

单芯片不够强,就多堆一些芯片。

实际上完全不是这样。

假设A芯片单卡性能只有B芯片的80%。

理论上,多放25%的芯片就可以补回来。

但现实中你同时增加了:

HBM成本、

封装成本、

电源成本、

网络成本、

机柜数量、

光模块、

交换机、

冷却系统,

以及软件和故障概率。

更麻烦的是,芯片数量增加以后通信量往往也会增加。

于是可能出现:

芯片差距 → 多芯片补偿
↓
通信量增加
↓
网络升级
↓
功耗增加
↓
机柜数量增加
↓
数据中心基础设施成本上升。

最后你虽然补回了FLOPS,却没有补回:

TCO。

所以评价下一代AI系统,真正应该问的不是:

一块GPU多少钱?

而是:

完成同一个模型训练任务,总共需要多少钱?

推理则应该问:

在同样延迟和服务质量要求下,一个Token到底多少钱?

这才是系统竞争的终点。

十、为什么芯片公司都想扩大自己的“产品边界”?

理解了前面的逻辑,就会发现一个更深的产业问题。

为什么AI芯片公司越来越愿意做系统?

因为谁控制系统,谁就更容易控制自己的芯片实际表现。

如果你只卖GPU:

服务器厂商可能设计不好PCIe拓扑。

网络可能配置不好。

电源可能不足。

散热可能降频。

通信库可能没有优化。

最终客户跑出来的性能很差。

但客户不会说:

“这台服务器架构设计有问题。”

客户通常只会说:

这颗GPU性能不行。

所以对于顶级AI芯片公司而言,系统设计越来越像一种“性能保险”。

通过控制Board、Server和Rack,它可以确保芯片运行在自己预期的环境中。

与此同时,产品边界扩大还有另一个价值:

可以把更多跨层优化变成产品能力。

例如:

芯片知道网络拓扑,

Compiler知道芯片拓扑,

Runtime知道通信状态,

Scheduler知道模型结构,

最终整个系统一起决定任务怎么跑。

这些优化单独看可能只有5%、10%。

但如果十个层次分别获得一些收益,最终系统差距就可能非常大。

真正难复制的东西,也就从“一个芯片架构”变成:

几十个工程层之间长期形成的协同。


十一、真正的护城河可能不是GPU,而是“接口控制权”

这也是AI芯片竞争未来最值得观察的一点。

系统越来越大以后,有两种完全不同的发展路线。

第一种是:

强垂直整合

GPU、CPU、Scale-up互联、NIC、交换机、软件甚至Rack架构由同一体系设计。

优势是:

跨层优化能力强。

代价是:

体系更加封闭,客户切换成本更高。

第二种是:

开放模块化

GPU来自一家,

CPU来自另一家,

网络来自第三家,

通过标准协议组成Rack。

优势是:

供应链灵活,客户选择更多。

代价则是:

跨层优化和系统验证更加困难。

因此未来真正的产业竞争未必只是:

NVIDIA GPU vs AMD GPU vs 各类ASIC。

更深一层可能是:

封闭但高度优化的计算系统,和开放但模块化的计算系统之间的竞争。

最终决定胜负的不会是“开放”或者“封闭”这两个标签。

而是:

性能、

TCO、

供应能力、

软件成熟度、

可靠性,

以及客户是否愿意承担锁定成本。

十二、这对下一代AI芯片创业公司意味着什么?

这里反而有一个残酷现实。

系统竞争并不意味着每一家AI芯片公司都应该自己造服务器、机柜和数据中心。

这样做很可能死得更快。

因为从芯片走向系统意味着组织复杂度爆炸。

你需要的不再只有:

芯片架构、

RTL、

验证、

后端、

Driver和Compiler。

还需要:

SI/PI、

高速PCB、

网络、

机械结构、

液冷、

电源、

Firmware、

BMC、

系统验证、

可靠性、

供应链、

现场支持。

这是完全不同的公司能力。

所以对于创业公司来说,更合理的路径可能不是“什么都自己做”。

而是必须回答一个新的产品问题:

我究竟把产品边界定义在哪里?

可能是GPU。

可能是加速卡。

可能是一块8卡Board。

可能是一台Server。

可能是一整套Rack Reference Design。

甚至可能是一个针对特定模型优化的Inference Appliance。

重点不在于产品做得“大”。

重点在于:

必须把影响客户实际性能的关键瓶颈纳入自己的控制范围。


十三、AI芯片行业正在发生一次“产品单位”的重构

回看计算机产业历史,这其实不是第一次发生类似变化。

CPU时代,核心产品单位长期是一颗Processor。

云计算时代,产品单位变成Virtual Machine。

AI时代,产品单位正在再次变化。

对于芯片公司来说,它可能从:

GPU,

逐渐变成:

GPU Board,

再变成:

AI Server,

最终成为:

AI Rack。

对于云厂商和模型公司来说,真正购买的甚至已经不是Rack。

他们购买的是:

一个拥有确定Token产能的AI Factory。

这也是为什么下一代AI硬件真正重要的指标,很可能越来越不像传统半导体参数。

不是晶体管多少。

不是频率多少。

甚至不是FP4有多少PFLOPS。

而是:

一个Rack能产生多少Token?

一个MW能产生多少Token?

训练一个模型需要多少时间?

完成同一个任务需要多少美元?

整个集群一年能够保持多少有效利用率?

结语

所以,“下一代AI芯片公司的真正产品可能不是芯片”,并不是说芯片不重要。

恰恰相反。

芯片仍然是一切计算能力的物理基础。

但随着摩尔定律带来的单芯片收益越来越难独立转化成系统收益,竞争正在从:

Transistor Scaling

逐渐进入:

System Scaling。

过去半导体公司的核心能力,是把更多晶体管放进一颗芯片。

下一阶段AI计算公司的核心能力,可能变成:

如何让成千上万颗芯片、数十TB的HBM、数万个高速链路、上百MW的电力以及一整套软件系统,最终表现得像一台计算机。

所以GPU → Board → Server → Rack → Cluster,并不是简单的产品扩张。

它真正代表的是:

计算架构的边界正在不断向外移动。

而当竞争单位从Chip变成System之后,下一代AI芯片公司最终要回答的问题,也会发生变化。

过去的问题是:

“我的芯片有多快?”

未来的问题可能只有一个:

“在真实工作负载、真实功耗和真实成本下,我的整个系统究竟能产出多少有效智能?”

欢迎订阅我的博客

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
一个奇怪现象 : 为何网上失业哀鸿遍野 , 现实中大家都按部就班的工作

一个奇怪现象 : 为何网上失业哀鸿遍野 , 现实中大家都按部就班的工作

青史卷中人
2026-10-03 02:55:17
河南房地产女经理,把一幅画变成了年入7亿的景区,爆赚40亿

河南房地产女经理,把一幅画变成了年入7亿的景区,爆赚40亿

林子说事
2026-10-05 17:54:03
原来这3位歌星已经悄然离世,怪不得再也见不到他们唱歌了

原来这3位歌星已经悄然离世,怪不得再也见不到他们唱歌了

揽星河的笔记
2026-10-05 20:38:01
油价调整通知:受国际油价影响,油价预估跌幅为220元/吨,预计汽柴油价格下跌0.17元/升—0.20元/升

油价调整通知:受国际油价影响,油价预估跌幅为220元/吨,预计汽柴油价格下跌0.17元/升—0.20元/升

台州交通广播
2026-10-03 08:56:04
现货白银突破62美元/盎司

现货白银突破62美元/盎司

证券时报
2026-10-05 20:22:06
美军总结:我们最大失误,就是以为志愿军的战斗力相当于韩军水平

美军总结:我们最大失误,就是以为志愿军的战斗力相当于韩军水平

纪史行者
2026-09-10 06:25:03
女子报冰岛外国团发现除了导游全是中国人,当事人:因为外国团便宜一半就报了,北极圈地广人稀的荒原处处是乡音,感到非常亲切

女子报冰岛外国团发现除了导游全是中国人,当事人:因为外国团便宜一半就报了,北极圈地广人稀的荒原处处是乡音,感到非常亲切

都市快报橙柿互动
2026-10-03 23:54:18
讽刺!名古屋亚运闭幕式上座率最高,组委会就是想办最不隆重赛事

讽刺!名古屋亚运闭幕式上座率最高,组委会就是想办最不隆重赛事

杨华评论
2026-10-04 23:51:56
跑高速时,车速120其实最费油,内行人:保持这个速度才最省油

跑高速时,车速120其实最费油,内行人:保持这个速度才最省油

一些小事
2026-10-05 05:47:02
李梦被传已经生娃,当事人至今没出面回应

李梦被传已经生娃,当事人至今没出面回应

凤舞龙腾
2026-10-05 12:05:43
男生4次考公失败,花2.2万旅行6国17座城市,途中看到妈妈朋友圈:“老娘扛你看世界,你替老娘圆梦”,顿时五味杂陈

男生4次考公失败,花2.2万旅行6国17座城市,途中看到妈妈朋友圈:“老娘扛你看世界,你替老娘圆梦”,顿时五味杂陈

背包旅行
2026-09-15 11:30:07
惊掉下巴!唐尚珺与周莹坐百万豪车画面出圈:国庆奔赴陕西直播卖猕猴桃,有人点赞自力更生,有人质疑流量收割

惊掉下巴!唐尚珺与周莹坐百万豪车画面出圈:国庆奔赴陕西直播卖猕猴桃,有人点赞自力更生,有人质疑流量收割

火山詩话
2026-10-04 09:31:20
一球击中观众,梅德韦杰夫被直接判负,德约科维奇进决赛

一球击中观众,梅德韦杰夫被直接判负,德约科维奇进决赛

甜度百分百21
2026-10-05 22:25:16
超100项违规成立,曼城对手不信他们下赛季还在英超

超100项违规成立,曼城对手不信他们下赛季还在英超

晚风知我意21
2026-10-05 22:37:45
哈佛研究发现:3种颜色是“抑郁色”,若孩子喜欢,家长需谨慎

哈佛研究发现:3种颜色是“抑郁色”,若孩子喜欢,家长需谨慎

户外阿毽
2026-09-23 15:23:41
孙晨宇发文“回应枪击”,景甜在评论区沦陷!

孙晨宇发文“回应枪击”,景甜在评论区沦陷!

默默有话说
2026-10-04 12:05:00
我深深感恩那些华人,是他们让我可以不必赧颜面对饱受战火荼毒的乌克兰人民

我深深感恩那些华人,是他们让我可以不必赧颜面对饱受战火荼毒的乌克兰人民

细雨中的呼喊
2026-10-05 22:50:09
《神探之痕迹》路演现场,陈思诚恳请陈飞宇对镜头说一遍:替我转告我老子,我爱他

《神探之痕迹》路演现场,陈思诚恳请陈飞宇对镜头说一遍:替我转告我老子,我爱他

韩小娱
2026-10-05 18:34:34
我刚把火葬场炉子点火,尸体竟坐起喊救命,家属却按住我手:别停!

我刚把火葬场炉子点火,尸体竟坐起喊救命,家属却按住我手:别停!

悬案解密档案
2026-01-06 10:46:34
猛然发现,现今没人提固态电池了?后路都让抄了,大饼画不下去了

猛然发现,现今没人提固态电池了?后路都让抄了,大饼画不下去了

一路荒凉如歌a
2026-09-29 16:03:49
2026-10-05 23:48:49
老虎说芯 incentive-icons
老虎说芯
资深半导体工程师的经验分享
901文章数 31关注度
往期回顾 全部

科技要闻

2026年诺奖:三名科学家因光遗传学获奖

头条要闻

明珍珍被执行死刑前画面披露 接受采访神情淡定露微笑

头条要闻

明珍珍被执行死刑前画面披露 接受采访神情淡定露微笑

体育要闻

30天30队·热:扬尼斯、阿德巴约与克雷

娱乐要闻

蔡康永回应漏洞百出,太平轮旧事被扒

财经要闻

零跑声明切割!蔡康永两面人身份被抵制

汽车要闻

方程豹9月热销破4万 首款皮卡鲨鱼将于四季度上市

态度原创

时尚
艺术
亲子
教育
手机

秋天外套不用买太多,这三件基础款一定要准备好,简约又不挑年纪

艺术要闻

北京出生,现年81岁!建筑大师参选日本市长职位

亲子要闻

工程车小故事:铲石子

教育要闻

孩子的未来,父母根本规划不了一点!

手机要闻

三星Galaxy S27 Ultra基础颜色选项曝光:黑色、蓝色、浅粉色、白色

无障碍浏览 进入关怀版