![]()
新智元报道
![]()
2022年12月,ChatGPT的横空出世点燃了AI时代的烽火,人们一下发现,机器似乎真的拥有了智能。
「ChatGPT时刻」就成了智能起点的代名词。然而这个算法,漏掉了一台中国的机器。
曙光8000。
![]()
近日,央视大型纪录片《超级工程》再度回归,这一次中国算力基础设施走向台前。
纪录片复盘了首个全国产十万卡AI超集群曙光8000(登峰)从技术路线选择、关键技术攻关到工程交付、科研应用的全过程。
![]()
2021年底,曙光8000立项时,人工智能还处在「小模型时代」。
受限于算力(GPU尚未普及)、数据规模和算法架构,模型参数通常在百万级甚至更低。
它们主要执行的是判别式任务——比如人脸识别、语音唤醒词识别,基本不具备生成和理解复杂语义的能力。
当时几乎没人想到,智能时代很快会需要一台「超级机器」。
中科曙光团队却果断决策,花5年时间,用10万张国产智能计算芯片,建一台既能做高精度科学计算,又能训练AI大模型的AI超集群。
![]()
两年后,大模型引发的智能海啸席卷全球。
在无人区里押中一条路
曙光8000的第一个难题,不是怎么造,而是决定要造一台什么样的机器。
超集群的研制周期很长,方案落定时似乎看的是当下,真正建成时却要赌几年后的技术环境与市场需求。选早了,技术可能还不成熟;选晚了,机器落地就会过时。
![]()
曙光8000正式立项时,主流AI仍以「小模型」为主,传统高性能计算最擅长的是依靠数学模型进行高精度计算,而智能计算则追求更高数据吞吐的低精度算力。两条路原本各有自己的系统,混合计算往往意味着跨平台调度和频繁搬运数据。
时任中科曙光总裁的历军预判,等机器建成时「数学的方法和数据的方法同等重要」,也就是既要算得准,也要算得快。中科曙光因此提出超智融合路线,让高精度科学计算和低精度智能计算运行在同一套系统里,从FP64到INT8覆盖多种计算精度。
![]()
这个决定并不轻松。
因为,方向一旦确定,技术路线很难中途更改。团队用了至少一年,反复与业界专家、科学家和产业伙伴沟通,最终超智融合这条技术路线被确定下来。
但很快,这个需要反复解释的判断,开始显出独特战略价值。
2021年,破解蛋白质折叠难题的重磅论文登上《自然》;紧接着,ChatGPT正式发布,震撼全球。由此,人们第一次看清,支撑这场智能革命的,不再是传统的数学推演,而是由超级算力托举的全新智能计算方法。
![]()
如今,当世界模型、物理AI、多模态、AI for Science等更加复杂的应用场景成为趋势,未来的算力标准恰恰是「算得准」与「算得快」兼得——训练推理需要低精度算力的吞吐,科学验证、模拟物理世界又离不开高精度计算的可靠。
凭借超智融合路线的精准「押注」,曙光8000把从FP64到INT8的全精度计算放进同一套系统,一台机器,既能模拟气候变化、探索生命密码,也能训练大模型。
十万卡背后,每一道坎都要自己过
路线正确只是开始。要把图纸上的超智融合变成一台可以稳定运行的机器,团队面对的是一整套放大后的难题。
从曙光7000的6万卡跨向10万卡,多出来的绝非只是芯片数量。曙光8000工程难度在于,横跨60多个细分学科、800多道工业工序,全流程管控参数数以亿计。
![]()
节点之间的网络传输要达到每秒800G,数据读写时间要压到0.202毫秒,10万张芯片运行一小时产生的热量,约等于12吨标准煤燃烧的放热量。计算、网络、存储、供电、散热,任何一环跟不上,整台机器都会等待。
![]()
更棘手的是,一些关键环节在国内没有现成答案。
为了8颗智算芯片的高速互联,系统需要一枚能够高效汇聚和调度数据的交换芯片。当时国内在这一领域还是空白。不把它做出来,全栈自研就会卡在最核心的数据交换处。
![]()
团队只能继续往下拆。从芯片、计算系统、存储、高速网络到液冷散热,把每个薄弱环节逐个补上。
规模越大,小概率故障越会成为日常。曙光8000的网络团队,在交换芯片里设计了可自主避险的「智能开关」,一旦链路发生故障,信号可以在毫秒级切换到备用路径,不必等待中央调度。存储和散热团队也在同时解决自己的极限问题。
![]()
最终,整套系统覆盖「芯片、计算、存储、网络、散热、应用、服务」全链路,主要核心技术全面实现了国产化。
80多组高密度机柜,10万张智能计算芯片,超过1万个计算节点,但它的真正难度藏在数字背后:
一秒钟的设计运算量,相当于全球80亿人昼夜不停连续计算200年。如此庞大的系统,仍要在漫长运行中保持稳定。这不能寄望于某一项技术的灵光一现,必须让整个系统都没有明显短板。
![]()
三十年憋着的一口气
曙光8000这张张巨大的工程清单背后,站着一支做了三十多年高性能计算的队伍。
20世纪80年代,国内曾因租用超级计算机,不得不在严格监控下完成操作。那段经历让中科曙光创始人李国杰和同行们很难忘记。
![]()
1991年,他带领团队开始研制曙光一号。出发前,几个年轻人在研究中心小楼的黑板上写下七个字:「人生能有几回搏」。
![]()
不到两年,曙光一号研制成功,峰值运算速度达到每秒6.4亿次,改变了当时国内高性能计算受限的局面。
![]()
三十多年后,当年需要曙光一号运行整整一天的计算,一部普通手机不到一秒就能完成。但研发人员的日常没有因此变得轻松。
中科曙光现任董事长历军形容这些年的工作:「每天就追(进度),哪个不行就搞哪个,差不多几年就是一代。」起步稍晚,就试着跑得更快一点。三十年,就这样一代接着一代走了过来。
![]()
到曙光8000,这些积累被一次性调动起来。超智融合路线需要架构研发,十万卡规模需要网络、存储和散热协同,落地运行还需要建筑、供电、装配和联调联试团队接力。数千人、上千个日夜,最后汇聚在一次整机测试上。
当曙光8000达到预期最大峰值,完成的不只是一台新机器,还有三十多年技术、经验和人才的集中验证。
「好钢用在刀口上,用在真正解决国家最急需要解决的一些问题上,曙光,是个好钢。」这一点中科曙光做到了!
![]()
比起超集群本身,中科曙光团队那次提前押下的选择,以及把选择一寸寸落地的三十年积累,才是这个项目最难复制的部分。
所以并没有什么「赌赢了AI时代」,中国科技的每一次飞跃,答案都藏在一代代科技工作者用青春作出的选择与坚持。
关于曙光8000的故事还不止于此。从技术攻关到整机落地,再到它真正服务科研的时刻,更多答案,正在纪录片接下来的篇章里慢慢展开。
编辑:摩西
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.