![]()
01
2023年,如果问AI时代谁最赚钱,答案几乎没有悬念:
英伟达
2024年,答案还是英伟达。
2025年,市场依然紧盯英伟达的GPU出货、Blackwell订单和云厂商的资本开支。
OpenAI训练模型,需要GPU;微软、Google建AI数据中心,需要GPU;Meta要推荐广告、训练大模型、部署AI助手,同样需要GPU。
AI世界每向前跑一步,英伟达都像守在收费站门口。
FY2024时,英伟达总营收同比增长126%,净利润同比暴涨581%;
FY2025,总营收直接突破1300亿美元,同比再增长114%;
FY2026,英伟达又把规模推高一层,全年收入达到2159亿美元,数据中心收入升至1937亿美元。
三年时间,英伟达年度净利润扩大约4倍。
整个AI淘金热里,英伟达成了那个最赚钱的“卖铲人”。
![]()
但问题接踵而至:
当一座AI数据中心塞进几万甚至十几万颗GPU后,下一个不够用的东西是什么?
GPU之间也需要连接、需要海量的搬运数据、需要高速存储、需要散热、需要供电等等。
AI算力越强,对周围基础设施的要求反而越高。
这就是第二梯队出现的原因。
AI的投资逻辑,正从“谁能造出最强GPU”,扩散到“谁能让几十万颗GPU真正跑起来”。
02
一座真正的AI数据中心,不是把几万颗GPU买回来,插上电就能开始训练模型。训练大型模型时,成千上万颗GPU需要持续交换参数、梯度和中间计算结果
GPU越多,GPU之间需要搬运的数据反而越多。
想要“跑起来”,就需要AI网络这个“高速公路”。
所谓AI网络,本质上就是让大量GPU、AI服务器和存储设备能够高速交换数据的一整套网络基本设施,这其中包括了网卡、网络芯片、交换机、光模块、光纤等等。
![]()
AI网络可以让企业买到的昂贵GPU尽可能的一直算,提高GPU的有效算力,而不会因为“颗粒度对不齐”,让GPU们一直互相等。
2024年初,Dell'Oro曾预计,AI后端网络新增需求会让整个数据中心交换机市场机会扩大约50%。到了2024年7月,Dell'Oro进一步预计,未来五年AI后端网络交换机支出将接近800亿美元。
结果到了2025年2月,Dell'Oro又把2025—2029年的预测进一步上调到:超过1000亿美元。
AI网络的发展速度,正在超乎预测的高速。
当广大用户还在讨论“应该大规模从400G升级到800G”的时候,Airsta等AI基础设施厂商已经开始卖1.6T网络设备了。
在AI网络不断提高数据传输能力的同时,光模块的需求自然也在激增。
光模块是负责把“电信号”和“光信号”互相转换的小型通信设备。在AI数据中心里,可以承担起高速运输数据的重要使命。
![]()
TrendForce预计,全球AI光模块市场规模将从2025年的165亿美元增长到2026年的260亿美元,同比增长超过57%。同时,全球光模块整体出货量预计会从2023年的约2650万只,增长到2026年的超过9200万只,三年多时间增长超过两倍。
在资本市场上,俗称“易中天”的三家龙头公司:中际旭创、新易盛、天孚通信,从2025年初到2026年初,短短一年时间,累计分别上涨428%、410%和284%。
光模块一跃成为过去三年A股AI产业链里股价表现最夸张的方向之一。
03
网络显然只是第一个问题。
当科技巨头们一年花掉上千亿美元建设AI基础设施后,它们一定会开始问另一个更加现实的问题:
这些GPU,能不能再便宜一点?
于是,Broadcom和定制ASIC的赚钱之路,开始了。
如果说,GPU的优势是通用、灵活、生态成熟,那ASIC更像是专门为某一种产品打造的自动化生产线,定制计算单位、定制内存、定制数据流、定制互联。
ASIC,GPU的“平替”。
![]()
随着AI的规模越来越大,重复工作负载越多,ASIC降低的几个百分点的单位计算成本越敏感,这笔经济账越容易成立。
Goole其实很早就在做自己的TPU。它本质上就是为机器学习工作负载设计的定制加速器路线。截止2026年,Broadcom已经正式披露,其与Google签订长期协议,将为Google未来几代TPU开发并供应定制TPU;同时还会为Google下一代AI机架提供网络及其他组件,协议延伸至2031年。
Google已经把定制AI芯片变成了一条跨多代产品、延伸到2031年的长期基础设施路线。
Meta也在今年4月份进一步扩大与Broadcom的合作,双方宣布未来三年共同开发下一代AI加速器,并支持Meta的MTIA定制芯片进行下一步升级。
而Broadcom的财报可想而知的夸张。FY2026 Q1,AI半导体收入84亿美元,同比增长106%;FY2026 Q2,同比增长143%;Q3披露AI半导体收入为167亿美元,同比增长221%。
英伟达之外的第二批卖铲人,也已经开始价值数百亿美元了。
04
不管最后负责计算的是英伟达的GPU,还是TPU、MTIA这样的ASIC,随着其性能的不断提高,芯片可以每秒完成的计算越来越多,如果数据不能及时送进去,再强的芯片也只能等。
普通的DRAM难以跟上超强芯片的节奏,HBM,中文名,高宽带内存,像在AI芯片旁边修了一条专供数据运输的多赛道超级公路,可以确保大量数据可以同时、快速地进入AI芯片。
HBM,很难不成为AI潮爆发后,一定会赚钱的第二梯队之一。
![]()
根据Samsung披露,其HBM4产品带宽最高可以达到:3.3TB/s,相较此前世代提高约2.7倍;HBM4的I/O数量也从此前的1,024增加至2,048。
今年,ASIC本身也开始大量使用HBM。据相关预测,2026年HBM需求增长的重要动力之一就是AI ASIC升级;部分AI芯片的HBM容量正在从此前的96GB/192GB提高至216GB/288GB。
这意味着一个非常微妙的产业关系:ASIC可能在部分任务上抢英伟达的蛋糕,但ASIC越成功,HBM厂商反而可能多一个客户。
Micron CEO Sanjay Mehrotra在最新财报中说道:存储在AI时代有战略价值。
AI正在把存储从周期品,推向战略资源。
05
前面,我们已经解决了GPU、AI网络、ASIC和HBM等一系列芯片和数据的问题。
但当这些问题逐渐被解决之后,GPU开始撞上一堵完全不同的墙。
物理世界。
一颗GPU真正高速运转起来,需要的不只是代码和数据。
当成百上千的高功率芯片被塞进同一个机柜后,两个问题就会被同时放大——电怎么送进去?热怎么带出来?
于是,一个很有意思的变化出现了:
AI越先进,周围需要的设备反而越“传统”。
过去的数据中心当然也需要散热。传统服务器运行时产生热量,风扇把冷空气送进服务器,再将热空气带走,最后交给机房空调和冷却系统处理。
在功率密度相对较低的数据中心里,这套模式已经运行很多年了。
但现在,几十颗、上百颗高功率GPU被同时塞进一个机柜,单个AI机柜的功率密度开始从过去的几千瓦、几十千瓦,向100kW甚至更高的水平推进。
每平方米需要搬走的热量,突然变多了。
在这样高GPU密度的场景里,要继续靠空气搬走这些热量,就意味着更大的风量、更强的风扇和更复杂的制冷系统,效率和经济型都开始面临越来越明显的压力。
于是,液冷开始从“可选项”走向了“必选项”。
![]()
TrendForce预计,AI芯片液冷渗透率将从2025年的约33%,提升至2026年的约53%,2027年进一步接近60%。
严格来说,今天所谓的“液冷”已经不是给服务器简单接几根水管,而是一整套冷板、CDU、泵、管路、换热器和制冷设备组成的热管理产业链。
AI数据中心基础设施龙头Vertiv在2026年第二季度实现收入32.74亿美元,同比增长24%;营业利润同比增长44%,调整后营业利润同比增长51%。
资本市场的反应甚至更早。Vertiv股价2023年上涨超过250%,2024年又上涨约137%;进入2026年后,股价一度较年初翻倍。
但液冷解决的只是“热怎么出去”。
当一个AI机柜开始需要100kW甚至更高功率后,还有一个更加麻烦的问题:
这么多电,怎么送进来?
06
充足的电力“马达”,正在成为AI基础设施新的瓶颈。
据预测,2026年全球数据中心已安装电力容量将达到约155GW,同比增长约29%;更有标志性意义的是,AI服务器总用电量预计将在今年首次超过通用服务器。
过去科技公司研究的是怎么把更多晶体管塞进芯片,现在连怎么把更多电送进机柜都成了AI系统设计的一部分。
于是,GPU周围又出现了一批新的“卖铲人”。
![]()
从变压器、开关设备,到UPS、PDU、母线和HVDC,过去听起来和AI毫无关系的电气设备,开始站上AI资本开支的必经之路。
Eaton,一家电力管理和电气设备公司。2026年第二季度,公司销售额达到创纪录的85亿美元,同比增长21%。
但把电送进机柜还不是终点。
当一座AI园区开始需要几百兆瓦甚至吉瓦级电力,问题就会继续从数据中心内部向外扩散:
变压器→配电→储能→电网→发电。
IEA预计,到2030年全球数据中心用电量将达到约945TWh,较当前水平翻倍以上;在美国,数据中心甚至可能贡献到2030年接近一半的新增电力需求。
AI淘金热,正在沿着电线,从芯片厂一路跑向发电厂。
07
所谓“AI真正赚钱的第二梯队”,真正的共同点只有一个:
站在AI继续扩张必须跨过去的瓶颈上。
GPU不够,算力成为瓶颈;GPU越来越多,网络和光模块开始解决带宽问题;芯片越来越快,HBM负责突破内存墙;机柜功率越来越高,液冷开始解决散热;当几十万颗GPU真正同时开机,最后所有问题又汇聚到了电力。
OpenAI赢还是Google赢,GPU赢还是ASIC扩大份额,都没有那么重要。只要AI继续扩张,它所解决的问题就绕不开。
当然,这并不意味着找到瓶颈就可以闭眼赚钱。
![]()
过去三年,很多AI基础设施公司已经经历了巨大的估值重构。今天的问题早已从“AI会不会增长”,逐渐变成了:
未来的增长,能不能跑赢股价已经提前计入的预期?
所以,别只盯着英伟达。
AI淘金热的第一阶段,是所有人寻找最好的GPU。
第二阶段,则是寻找那些让几十万颗GPU真正跑起来的人。
而再往后,真正值得问的问题可能只有一个:
当今天的瓶颈被解决之后,下一个不够用的东西是什么?
这里是冲浪普拉斯,感谢大家的订阅和点赞,我们下期见。
![]()
欢迎点击下方卡片, 关注我们
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.