![]()
今年天津智博会释放了一个再明显不过的信号:AI基础设施的竞争,正在从“低精度训练时代”硬生生地拽进“全精度融合时代”。
过去三年,大模型热潮把整个行业绑在了一条单一赛道上:训练更大的模型。基础设施几乎只做一件事——如何更低精度、更高吞吐地“跑数”。华为384超节点是那个阶段最耀眼的产物。它用芯片、框架、网络的垂直整合,硬生生把国产AI训练能力拽到了超节点级别。
但行业已经变天了。
今年,AI一头扎进了药物研发、蛋白质折叠、材料模拟、量子化学——不再是陪人聊天,而是开始理解世界。这些场景不讲“概率误差”,不认“差不多就行”。分子结构偏一点,仿真结果错一次,整个研究就可以直接报废。
大模型可以用FP16/BF16赌个概率,科学计算不行。中国工程院院士钱德沛早就把话说透了:算网融合、智算融合是必由之路。张云泉也反复建议:走超智融合,建全精度、高互联的智算中心。
于是,一个被搁置太久的能力被重新拽回牌桌:全精度计算。这不是在低精度上修修补补,而是要求系统在高精度科学计算和低精度AI训练之间来回切换、动态协同,支撑“仿真—训练—验证”的全流程闭环。这也解释了为什么今年智博会上“超智融合”突然炸成热词——因为旧逻辑已经跑不通了。
而在这个新逻辑下,不同厂商的处境,残酷得一目了然。
华为不是没看见风向变了。它近期也把“超算+智算”写进了战略。但问题是:它的硬件天生就不是干这个活的。昇腾NPU从设计第一天起,就是为低精度矩阵运算优化的——跑大模型一把好手,但不擅长应对FP64双精度、科学计算需要的数值稳定性。这种ASIC架构在AI训练上确实高效,可一旦任务从“训模型”变成“算科学题”,它就成了最别扭的那一环。
也有分析指出:华为最近考虑从ASIC转向GPGPU、甚至要兼容CUDA生态,不是主动升级,是被现实逼着补课。换句话说,在大模型时代攒起来的领先身位,到了超智融合的牌桌上,不仅不灵,反而成了拖累。
而反观那些本来就扎根超算、做系统集成的厂商,反而像鱼回到水里。这次智博会,中科曙光真机展出了scaleX万卡超集群,成为展会焦点。与前者不同的是,scaleX万卡超集群从设计之初就是为全精度设计的——FP8到FP64全覆盖,算、存、网、电、冷、管、软全链条自研,系统可用性99.99%。拼的不是芯片或或一个环节的长短,而是整个系统的稳定性和协同效率。
结论已经越来越清楚:大模型时代,华为靠垂直整合赢了上半场。但AI进入实体产业后,比赛规则彻底换了——不再是“低精度训练多快”,而是“全精度系统多稳”。后者恰恰是华为当前最明显的短板。它现在的转型动作本身,就是最诚实的自白:原来的路,走不通了。
当然,中国AI不可能只有一种芯片、一条路线。但产业风向已经明牌了——谁能在全精度融合上真正站稳,谁才有资格定义下一个时代。而这背后,是“东数西算”“人工智能+”“AI赋能科学研究”这些国家政策在硬推着产业往前走。当AI变成新的科学工具、新的工业能力,基础设施的淘汰赛,其实已经开始了。
中国AI基础设施,正在从“追赶时代”切换成“定义时代”——但不是所有人都能跟上这班车。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.