网易首页 > 网易号 > 正文 申请入驻

英伟达AI工厂性能揭晓:100MW功耗、2ZFLOPS推理算力,单机DeepSeek吞吐量暴增至30倍

0
分享至


芯东西(公众号:aichip001)
编译 崔嫄伟
编辑 陈骏达

芯东西9月1日消息,在2026年全球顶级半导体架构行业研讨会Hot Chips上,英伟达正式揭晓Vera Rubin平台旗下新一代数据中心AI加速器Rubin GPU的完整技术细节。

英伟达首次披露Rubin GPU对应的工厂级满配性能指标。所有数据均针对100MW级AI工厂整体系统,而非单块GPU:NVFP4精度下推理性能达2ZFLOPS,训练性能达1.4ZFLOPS;配套11PB HBM4高带宽内存,内存总带宽达800PB/s,整套AI工厂系统功耗为100MW。


英伟达引用SemiAnalysis测试数据验证,在搭载140K+超长上下文的DeepSeek-v4-PRO模型、AgentX智能体工作负载下,Vera Rubin NVL72在60M总token处理规模后性能全面超越前代GB300 NVL72;且随着Agentic AI多轮推理、工具调用等高交互任务复杂度提升,其每兆瓦token吞吐可实现10倍提升,最高可达30倍。


一、Rubin GPU:面向Agentic AI的全栈重构

Vera Rubin被英伟达定位为全栈AI工厂平台,覆盖7类芯片与5种机架规格。平台不仅整合了Vera CPU、Rubin GPU、BlueField-4数据处理器、Spectrum-6交换芯片,还集成了Groq语言处理单元(LPU),在上层构建了存储、网络、工具调用与沙箱运行的完整支撑体系。对Agentic AI而言,从超长上下文窗口、大容量内存到高速扩展互联架构,每一层硬件资源都是支撑多轮推理的必要基础。

在以“每兆瓦token”为纵轴、交互性为横轴的性能坐标系中,Vera Rubin NVL72机架的表现大幅领先Blackwell NVL72,更远超Hopper架构的NVL8世代(对应HGX H100/H200 8-GPU服务器),尤其在高交互智能体场景下优势显著。


与之对应的是设计优化目标的转向:每瓦token数、首token生成时间(TTFT)、有效使用寿命、平均中断间隔时间四大指标的优先级,已经超过了传统的原始浮点运算速度(FLOPS)。Agent时代,平台的长期收益与持续产出能力,比峰值算力更重要。


二、核心技术:稀疏计算与互联升级

随着AI Agent每轮交互的上下文长度不断增长,注意力计算量呈平方级上升,一轮长时会话的前馈与注意力计算量远超40万token规模。英伟达称,单纯为GPU堆砌数学运算单元已不足以应对这一挑战,因此从计算效率、多卡同步、集群互联三个维度重构了技术栈。

计算效率层面,Rubin GPU采用自适应稀疏技术,搭配硬件管控的混合精度运算,为低精度运算配备专属硅片资源,同时结合结构化稀疏与精度保留压缩技术,覆盖训练与推理场景。

Rubin的自适应稀疏技术以2:4稀疏格式为基础,并实现了更灵活的动态判断能力,稀疏机制贯穿整个Transformer模块:在QKV矩阵、注意力投影层与MLP多层感知机中,硬件自动识别并跳过接近零的无效数值计算,在不改变模型结构的前提下降低运算量。英伟达称,绝大多数预训练模型无需修改或微调,仅需在推理运行时通过参数即可开启该功能。


为验证稀疏模式的精度保留能力,英伟达分别以BF16稠密模式与NVFP4稀疏模式运行Qwen-Image图像生成模型,生成同一场景的电影感肖像,视觉效果几乎一致。


多个硬件基准测试数据同样显示,稀疏模式在各类评测集上的精度表现与稠密模式基本持平。


分布式推理场景下,多GPU间的同步延迟是制约高交互场景吞吐量的核心瓶颈。Rubin GPU重构了多卡同步逻辑,用计数写入(Counted-Write)机制替代传统的内存屏障(MEMBAR)方案。传统Blackwell架构依靠内存屏障保证数据写入完成,再通过更新原子标志位、接收端轮询查询的方式实现同步,轮询过程会持续占用互联带宽与计算资源。


而计数写入机制由发送端附带数据计数信息,接收端依靠片上硬件计数器统计接收进度,计数达标后硬件自动触发后续计算,彻底消除了轮询开销与内存屏障带来的延迟,大幅降低NVLink交互延迟,在高交互智能体场景下显著提升系统吞吐量。

集群互联层面,第六代NVLink是提升token吞吐的另一核心支柱。作为英伟达专属的GPU间高速互联总线,第六代NVLink构建起最多72块GPU的统一扩展域,单卡全互联带宽达3.6TB/s。相比传统以太网扩展方案,NVLink 6实现4倍吞吐量提升、3倍延迟降低、10倍数据包速率提升,同时交换托盘硬件自带130TFLOPS的网内计算能力,可在数据转发途中完成聚合运算,减少数据往返搬运。


NVL72机架依托NVLink 6交换托盘,实现整个扩展域内所有GPU的硬件级缓存一致性,对上层软件而言,72块GPU可等效为一块巨型虚拟GPU,大幅简化分布式训练与推理的部署复杂度。

三、系统级创新:供电、散热与可靠性

在芯片技术之外,英伟达推出第三代MGX开放机架平台,从系统层面进一步释放AI工厂的能效与可靠性潜力。作为英伟达模块化加速计算的开放标准,MGX生态目前已拥有80余家合作伙伴,在全球30个国家、350多个工厂站点具备数百万平方英尺的产能。

NVL72机架采用45℃高温进水液冷、800V直流供电架构,搭配无重定时器设计,支持热插拔、无电缆托盘与铜缆扩展架构,全方位提升首token时间与平均中断间隔指标。其中Vera Rubin计算托盘采用无电缆、无风扇设计,去除了托盘内部的连接线与散热风扇,大幅简化机架级部署与运维流程,同时降低单点故障风险。

散热体系上,英伟达采用温水冷却方案,通过提升进水温度至45℃,拉大冷却液与环境的温差,多数场景下可省去冷水机组与配套水损耗,在保证满负载性能的同时,降低制冷系统的能耗占比,让更多电力预算用于算力输出。

供电系统是英伟达挖掘能效潜力的关键一环。NVL72搭载智能功率平滑技术,通过硬件与算法动态平抑负载的功率波动,削峰填谷降低峰值功耗。官方数据显示,在大语言模型训练场景下,单座Vera Rubin NVL72机架可实现峰值功耗降低13%,同时提升电网合规性;结合其他系统级功耗优化,每瓦供电容量可支撑的GPU数量最多提升40%,相当于在同等供电基础设施下部署更多算力。


可靠性方面,英伟达第二代RAS引擎(RIST,可靠性、可用性与可维护性引擎)支持工作负载运行时的零停机GPU健康检查,搭配进阶版SRAM ECC纠错机制与增强型NVLink热交换服务。不同于第一代RAS需要整个节点离线数小时完成检测,第二代引擎可在业务不中断的情况下完成健康巡检,直接提升系统有效吞吐量,同时为预测性维护提供数据支撑。

结语:算力交付范式转向:从芯片单元到百兆瓦AI工厂

整场发布会中,英伟达将Rubin GPU纳入AI工厂完整体系架构,作为系统核心计算层级。该平台整合计算、网络、供电、散热、运维服务的全链路基础设施能力。

Rubin GPU的落地,折射出英伟达算力产品战略的关键升级。产品价值维度从传统浮点运算峰值性能,延伸至全生命周期运行效率与整体拥有成本。行业传统算力交付单位集中于单GPU、单服务器级别,英伟达则将产品交付尺度升级至100MW级大型AI工厂。

当前行业不少产品宣传依旧以单芯片峰值算力作为主要衡量标尺,而Vera Rubin平台将评估维度拓展至数据中心整体可用性与持续产出能力,依托整套工厂级基础设施体系,实现规模化、高可靠的稳态算力输出。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
媒体曝大量美军士兵受重伤!紧急送往德国,伊朗给约旦基地炸惨了

媒体曝大量美军士兵受重伤!紧急送往德国,伊朗给约旦基地炸惨了

影孖看世界
2026-09-09 22:54:54
出兵即侵略!中方亮明底线:敢派兵台海,本土将成为合法打击目标

出兵即侵略!中方亮明底线:敢派兵台海,本土将成为合法打击目标

伴君终老a
2026-08-20 09:29:37
CBA联赛时隔20余年恢复升降级

CBA联赛时隔20余年恢复升降级

新华社
2026-09-10 22:18:15
“人走好运,一看便知”:走好运的人,身上都有“这两个征兆”

“人走好运,一看便知”:走好运的人,身上都有“这两个征兆”

心理观察局
2026-07-08 06:22:17
12306终于想通了:与其让1亿人抢票,不如让他们先举手

12306终于想通了:与其让1亿人抢票,不如让他们先举手

笑熬浆糊111
2026-08-10 12:02:09
《给阿嬷的情书》卖18亿,《浪花儿》温柔赢了票房,真实输了排片

《给阿嬷的情书》卖18亿,《浪花儿》温柔赢了票房,真实输了排片

日不西沉
2026-09-10 15:25:34
奥斯卡影后全裸出镜!凯特·温斯莱特大尺度戏震惊好莱坞

奥斯卡影后全裸出镜!凯特·温斯莱特大尺度戏震惊好莱坞

手工制作阿歼
2026-08-24 01:57:56
体制内“五人小组”到底是啥?权力有多大?

体制内“五人小组”到底是啥?权力有多大?

叮当当科技
2026-09-08 18:00:30
星宇股份再被曝出被免职的“人力资源总监”或为“背锅侠” 公司年报疑出现数据错误 董事长与其儿子仅相差7岁!

星宇股份再被曝出被免职的“人力资源总监”或为“背锅侠” 公司年报疑出现数据错误 董事长与其儿子仅相差7岁!

每日经济新闻
2026-09-10 18:00:36
张柏芝带着小儿子现身机场,她的一身打扮太亮眼,太贵气了!

张柏芝带着小儿子现身机场,她的一身打扮太亮眼,太贵气了!

大眼妹妹
2026-09-09 12:28:41
50岁大叔同房后突发心梗,医生:性生活前这5件事必须知道

50岁大叔同房后突发心梗,医生:性生活前这5件事必须知道

医学原创故事会
2026-09-10 23:26:16
华尔街日报爆猛料:美国很多癌症患者正飞往上海治病,费用不到美国一半

华尔街日报爆猛料:美国很多癌症患者正飞往上海治病,费用不到美国一半

小徐讲八卦
2026-09-09 07:58:10
“最贵新股”天博智能上市第四天已逼近破发

“最贵新股”天博智能上市第四天已逼近破发

财闻
2026-09-10 17:05:31
曼晚:库尼亚落选巴西队大名单,曼联球迷松口气

曼晚:库尼亚落选巴西队大名单,曼联球迷松口气

懂球帝
2026-09-10 23:15:03
欢迎张丹丹加入“灵活福利”大军

欢迎张丹丹加入“灵活福利”大军

布衣乱弹
2026-09-10 12:14:51
洪水之下60岁母亲被毒蛇咬伤身亡背后:附近无证养蛇场被冲垮大量蛇出逃,老板否认是他的蛇伤人|红星深度

洪水之下60岁母亲被毒蛇咬伤身亡背后:附近无证养蛇场被冲垮大量蛇出逃,老板否认是他的蛇伤人|红星深度

红星新闻
2026-09-10 22:33:46
苹果iPhone 18 Pro系列全球售价对比:美国最低、土耳其最高,港版约为国行九折

苹果iPhone 18 Pro系列全球售价对比:美国最低、土耳其最高,港版约为国行九折

鲁中晨报
2026-09-10 16:47:04
热搜上令人窒息的“母女吃牛肉面一幕”,精神穷人可怕的三观

热搜上令人窒息的“母女吃牛肉面一幕”,精神穷人可怕的三观

蝴蝶花雨话教育
2026-08-18 09:57:05
中国女排必须换帅的三个理由,哪怕亚运会夺冠,赵勇也不能留任了

中国女排必须换帅的三个理由,哪怕亚运会夺冠,赵勇也不能留任了

啊哒体育
2026-09-09 21:24:43
2026年最强反腐来了!中纪委:害群之马将清除到底!

2026年最强反腐来了!中纪委:害群之马将清除到底!

细说职场
2026-09-10 15:44:52
2026-09-11 00:04:49
芯东西 incentive-icons
芯东西
智东西AI媒体矩阵品牌。芯东西,芯片产业新媒体。我们是一群追芯人,专注报道AI芯片和半导体产业创新。
2586文章数 8160关注度
往期回顾 全部

科技要闻

一文看懂:iPhone折叠屏顶配2万6,10月才卖

头条要闻

"弟弟举报哥哥冒名顶替上大学案"进展:哥哥举报湘大

头条要闻

"弟弟举报哥哥冒名顶替上大学案"进展:哥哥举报湘大

体育要闻

16岁的国产小库里,还有多少功课要做

娱乐要闻

参加晚宴,刘亦菲因合照深陷争议

财经要闻

向松祚:年轻人不必过早买房

汽车要闻

标配全线控底盘 全新一代智己LS6预售20.99万起

态度原创

本地
时尚
健康
亲子
公开课

本地新闻

拼假 13 天国内长线路线合集

腿粗女孩的王炸显瘦技巧,它来了

牙疼,也可能跟心梗有关?!

亲子要闻

诺和诺德帕西生长激素注射液三项儿童新适应证在华获批

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版