![]()
【摘要】国产算力的竞争,正在转向系统能力。
过去,行业关注峰值算力、显存带宽和模型适配,今天,大模型训练把瓶颈推向互联、网络、调度、液冷和运维。
从scaleX超节点到scaleFabric无损网络,中科曙光正在提供一条值得关注的产业路径:让系统吸收硬件差异,让工程能力兑现芯片算力。
国产算力下半场,真正的胜负在于能否把国产卡组织成稳定、高效、可持续运行的AI基础设施。
以下为正文:
2012年,AlexNet在ImageNet上一战成名时,很多人记住的不仅是深度学习的胜利,还有那篇论文背后的两张GPU。它像一声枪响,告诉整个计算产业:AI的发动机,不再被框定于传统CPU的旧路线里。
此后十多年,故事一路加速。GPU从个人消费电子部件变成生产力工具,CUDA从开发工具变成生态入口,DGX从一台机器变成一种交付方式。
到OpenAI、微软、英伟达这些公司的故事里,算力已经不再是买几张卡那么简单,而是综合了网络、软件、服务器、存储、调度的庞大机器。
OpenAI早在2018年就提出,顶级AI训练所消耗的计算量曾以约3.4个月翻倍的速度增长,微软2020年披露为OpenAI打造的Azure超算时,提到超过28.5万个CPU核心、1万张GPU以及每台GPU服务器400Gbps网络连接。这些数字今天还在增长。
这也正是国产算力的处境。过去几年,行业一直关注的是国产GPU能不能跑模型、进数据中心,现在则更多开始考虑国产卡如何完成从“能用”向“好用”的更高维度的努力。
这些处境指向一件事:芯片之外,系统性的组织能力提上日程,怎样让千卡、万卡集群持续稳定地运行成为新一轮的关注重心。
01
瓶颈外移
过去十多年,AI算力产业的瓶颈一直在迁移。
AlexNet时代,问题是有没有足够便宜、足够并行的计算发动机,GPU给了答案。之后,问题变成开发者能不能用起来,于是CUDA、cuDNN、NCCL这些软件栈开始变成护城河。但再往后,当模型参数量和数据规模继续膨胀,问题又变了:不是一张卡强不强,而是一群卡能不能像一台机器一样工作。
英伟达的成功本质是“芯片定义系统”。基于这个逻辑,英伟达后来卖的也越来越不是单张GPU,而变成了一整套“AI工厂”。
NVLink、NVSwitch、InfiniBand、DGX、SuperPOD这些技术和平台,实质上是一套系统方法:先让GPU之间高速互联,再让服务器之间低延迟通信,再让软件栈把并行训练、故障恢复和资源调度压到用户感知以下。英伟达本身对NVLink/NVLink Switch的描述就是,面向AI训练、推理和机架级GPU工作负载的高带宽GPU到GPU通信架构。
这条变化,对国产算力同样重要。国产GPU追赶的目标,以前和现在可能是单卡参数,未来一定要加上系统能力。
峰值算力、显存带宽、制程工艺确实重要,但进入大模型训练,真正决定用户体验的,往往是稳定性。
也就是说,AI算力不是一场F1排位赛冲击杆位,而是一整年的F1赛事年度冠军。单卡性能是发动机马力,互联协议是传动系统,网络是底盘,软件栈是驾驶控制,液冷和供电是耐久性,运维系统则是维修站。
所有的这些东西都做到优秀,才能拼出来一台不错的汽车并且去赢得年度冠军。
国产算力从能用到好用的难点,就在这里。
上一阶段,市场证明了国产卡可以进入一部分真实业务,下一阶段,行业要证明国产卡可以被组织成稳定、高效、可运维的系统。
这个转折,意味着国产厂商存在一些深度协同的机会,尽快把发动机们装进一辆能交付的车,在商业模式上足够有前景,也符合真正的国产替代进程。
02
不能再各跑各的
当产业还在解决“有没有国产卡”的时候,多路线并存是一种活力。不同公司从通用GPU、CPU+协处理器、推理芯片等方向切进去,本质上是在用多条路试探同一个市场。那时候,碎片化还不一定是问题,甚至可能是创新的来源。
但当行业走到集群阶段,碎片化会变成另一种成本。
一张卡可以有自己的架构,一家公司可以有自己的软件栈,但千卡、万卡集群不能每个节点都讲一套方言。
接口越不统一,系统厂商要做的适配越多,通信语义越模糊,开发者和运维团队越难判断问题到底出在卡、网络、驱动,还是集合通信库。
这也是AI算力产业从芯片竞争走向系统竞争后,最容易被忽略的一层变化:互联不只是物理连接,还有生态秩序。
大模型训练需要低延迟、可预期、高吞吐、能被软件栈理解的协同关系。GPU之间要有配合,集合通信要尽可能少等待,调度软件要知道哪张卡、哪条链路、哪个节点处在什么状态。
海外市场,英伟达可以依靠相对封闭的软硬件生态建立这种秩序。但国产芯片路线更加多元,很难等待某一家厂商完成从芯片到软件、从互联到集群的全部闭环。
更现实的办法是让系统层成为不同技术路线之间的“公分母”:不要求所有芯片完全相同,而是通过互联架构、节点设计、通信软件和调度体系,尽可能吸收底层硬件的差异。
中科曙光scaleX40做的就是这件事情。公开资料显示,scaleX40将40张AI加速卡组织在同一个高密度计算单元内,采用正交无线缆一级互联架构,使计算节点与交换节点直接对插,减少传统线缆带来的信号损耗、部署复杂度和潜在故障点。
值得注意的是“一级全互联”这个思路:先把几十张卡组织成一个更紧耦合的计算单元,再把这个单元向更大集群扩展。
既能降低生态门槛,又能降低工程门槛,这是国产算力走出碎片化迈向系统化的重要一步。
对于国产GPU公司而言,未来,芯片公司不能只回答“卡有多少算力”,还要回答“卡能不能进入别人的系统”。适配开放互联、配合集合通信库、调度系统和大模型框架做端到端优化,都会变成新的产业门槛。
03
交付才是深水区
解决碎片化是第一步。更难的是,把已经连起来的硬件变成一套用户敢长期使用的系统。
在这个过程中,通信瓶颈会吃掉训练时间,热密度会逼近机房边界,存储吞吐会影响数据供给,任何一处故障都可能被集群规模放大。
网络就是一个典型的分水岭。中科曙光官网文章援引研究称,在大规模分布式训练中,网络通信耗时占比可达30%-50%。
这方面,中科曙光已经布局在前。2026年3月,曙光发布scaleFabric400,称其从112G SerDes IP、硬件设备到管理软件实现全栈自研。
通过scaleFabric400构建起的AI算力的“血管系统”,从底层112G SerDes IP到交换芯片的Crossbar架构实现完全自主可控,交换机单端口带宽达800Gbps、整机双向交换容量高达64Tbps,并集成硬件级遥测功能,以微秒级精度实时上报队列深度,并已在近万卡集群中稳定运行验证。
此外,针对大模型训练的高吞吐需求,ScaleFabric支持多轨通信,将巨额数据内容切片至多物理网口并行传输后重组,既成倍提升单节点带宽,又通过负载均衡机制消除单链路故障对训练任务的影响。
简单来说,就是通过建立一座拥有多条车道的高速公路网,将巨型货物拆分成无数个小包裹,让成百上千辆货车在不同的车道上同时全速狂奔,抵达目的地后再迅速拼装还原。
再往上走,就是超节点。曙光scaleX640公开页面显示,它采用“一拖二”高密架构,实现单机柜640卡超高速总线互连,双scaleX640可组成1280卡计算单元,并配套1.72MW级散热能力。相当于把两座“AI芯片工厂”并联起来,每厂640条生产线高速互联,散热系统如巨型冷却塔保障全速运转。
同时通过软硬协同全局优化,相比传统架构可让MoE大模型训练效率与高通量推理吞吐提升30%-40%,并适配多品牌AI加速卡、兼容主流AI软件生态、适配优化400+主流大模型。
就像整车里,发动机、变速箱、底盘、散热、电子控制不能分开调配,AI集群里的芯片、互联、网络、液冷、存储、调度也必须一起优化。
曙光这套路径的产业意义,是尝试以系统工程吸收不同芯片、不同软件和不同应用场景之间的复杂性,把分散的硬件能力转化为可以衡量、调度并且持续运行的集群效率。
从工程样机走向生产系统,正是国产算力从“能用”迈向“好用”的关键一步。
04
尾声
国产算力不可能简单复制英伟达的封闭闭环,因为国内芯片路线更多元,客户需求更分散,应用场景也更复杂。
更现实的路径,是用开放互联降低生态门槛,用超节点提高系统效率,用无损网络承接大规模训练,最后,用软件栈和运维体系把国产硬件变成用户愿意持续使用的算力产品。
这是中科曙光给行业留下的最大启示。
对国产GPU公司来说,下一阶段的竞争维度会被重写。谁能进入开放互联协议,谁能被超节点架构吸收,谁能和系统一起优化,谁就更可能领先。
国产GPU只有在开放互联和系统工程里协同奔跑,AI基础设施才算真正跃迁至下一个阶段。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.