网易首页 > 网易号 > 正文 申请入驻

英伟达AI工厂性能揭晓:100MW功耗、2ZFLOPS推理算力,单机DeepSeek吞吐量暴增至30倍

0
分享至


芯东西(公众号:aichip001)
编译 崔嫄伟
编辑 陈骏达

芯东西9月1日消息,在2026年全球顶级半导体架构行业研讨会Hot Chips上,英伟达正式揭晓Vera Rubin平台旗下新一代数据中心AI加速器Rubin GPU的完整技术细节。

英伟达首次披露Rubin GPU对应的工厂级满配性能指标。所有数据均针对100MW级AI工厂整体系统,而非单块GPU:NVFP4精度下推理性能达2ZFLOPS,训练性能达1.4ZFLOPS;配套11PB HBM4高带宽内存,内存总带宽达800PB/s,整套AI工厂系统功耗为100MW。


英伟达引用SemiAnalysis测试数据验证,在搭载140K+超长上下文的DeepSeek-v4-PRO模型、AgentX智能体工作负载下,Vera Rubin NVL72在60M总token处理规模后性能全面超越前代GB300 NVL72;且随着Agentic AI多轮推理、工具调用等高交互任务复杂度提升,其每兆瓦token吞吐可实现10倍提升,最高可达30倍。


一、Rubin GPU:面向Agentic AI的全栈重构

Vera Rubin被英伟达定位为全栈AI工厂平台,覆盖7类芯片与5种机架规格。平台不仅整合了Vera CPU、Rubin GPU、BlueField-4数据处理器、Spectrum-6交换芯片,还集成了Groq语言处理单元(LPU),在上层构建了存储、网络、工具调用与沙箱运行的完整支撑体系。对Agentic AI而言,从超长上下文窗口、大容量内存到高速扩展互联架构,每一层硬件资源都是支撑多轮推理的必要基础。

在以“每兆瓦token”为纵轴、交互性为横轴的性能坐标系中,Vera Rubin NVL72机架的表现大幅领先Blackwell NVL72,更远超Hopper架构的NVL8世代(对应HGX H100/H200 8-GPU服务器),尤其在高交互智能体场景下优势显著。


与之对应的是设计优化目标的转向:每瓦token数、首token生成时间(TTFT)、有效使用寿命、平均中断间隔时间四大指标的优先级,已经超过了传统的原始浮点运算速度(FLOPS)。Agent时代,平台的长期收益与持续产出能力,比峰值算力更重要。


二、核心技术:稀疏计算与互联升级

随着AI Agent每轮交互的上下文长度不断增长,注意力计算量呈平方级上升,一轮长时会话的前馈与注意力计算量远超40万token规模。英伟达称,单纯为GPU堆砌数学运算单元已不足以应对这一挑战,因此从计算效率、多卡同步、集群互联三个维度重构了技术栈。

计算效率层面,Rubin GPU采用自适应稀疏技术,搭配硬件管控的混合精度运算,为低精度运算配备专属硅片资源,同时结合结构化稀疏与精度保留压缩技术,覆盖训练与推理场景。

Rubin的自适应稀疏技术以2:4稀疏格式为基础,并实现了更灵活的动态判断能力,稀疏机制贯穿整个Transformer模块:在QKV矩阵、注意力投影层与MLP多层感知机中,硬件自动识别并跳过接近零的无效数值计算,在不改变模型结构的前提下降低运算量。英伟达称,绝大多数预训练模型无需修改或微调,仅需在推理运行时通过参数即可开启该功能。


为验证稀疏模式的精度保留能力,英伟达分别以BF16稠密模式与NVFP4稀疏模式运行Qwen-Image图像生成模型,生成同一场景的电影感肖像,视觉效果几乎一致。


多个硬件基准测试数据同样显示,稀疏模式在各类评测集上的精度表现与稠密模式基本持平。


分布式推理场景下,多GPU间的同步延迟是制约高交互场景吞吐量的核心瓶颈。Rubin GPU重构了多卡同步逻辑,用计数写入(Counted-Write)机制替代传统的内存屏障(MEMBAR)方案。传统Blackwell架构依靠内存屏障保证数据写入完成,再通过更新原子标志位、接收端轮询查询的方式实现同步,轮询过程会持续占用互联带宽与计算资源。


而计数写入机制由发送端附带数据计数信息,接收端依靠片上硬件计数器统计接收进度,计数达标后硬件自动触发后续计算,彻底消除了轮询开销与内存屏障带来的延迟,大幅降低NVLink交互延迟,在高交互智能体场景下显著提升系统吞吐量。

集群互联层面,第六代NVLink是提升token吞吐的另一核心支柱。作为英伟达专属的GPU间高速互联总线,第六代NVLink构建起最多72块GPU的统一扩展域,单卡全互联带宽达3.6TB/s。相比传统以太网扩展方案,NVLink 6实现4倍吞吐量提升、3倍延迟降低、10倍数据包速率提升,同时交换托盘硬件自带130TFLOPS的网内计算能力,可在数据转发途中完成聚合运算,减少数据往返搬运。


NVL72机架依托NVLink 6交换托盘,实现整个扩展域内所有GPU的硬件级缓存一致性,对上层软件而言,72块GPU可等效为一块巨型虚拟GPU,大幅简化分布式训练与推理的部署复杂度。

三、系统级创新:供电、散热与可靠性

在芯片技术之外,英伟达推出第三代MGX开放机架平台,从系统层面进一步释放AI工厂的能效与可靠性潜力。作为英伟达模块化加速计算的开放标准,MGX生态目前已拥有80余家合作伙伴,在全球30个国家、350多个工厂站点具备数百万平方英尺的产能。

NVL72机架采用45℃高温进水液冷、800V直流供电架构,搭配无重定时器设计,支持热插拔、无电缆托盘与铜缆扩展架构,全方位提升首token时间与平均中断间隔指标。其中Vera Rubin计算托盘采用无电缆、无风扇设计,去除了托盘内部的连接线与散热风扇,大幅简化机架级部署与运维流程,同时降低单点故障风险。

散热体系上,英伟达采用温水冷却方案,通过提升进水温度至45℃,拉大冷却液与环境的温差,多数场景下可省去冷水机组与配套水损耗,在保证满负载性能的同时,降低制冷系统的能耗占比,让更多电力预算用于算力输出。

供电系统是英伟达挖掘能效潜力的关键一环。NVL72搭载智能功率平滑技术,通过硬件与算法动态平抑负载的功率波动,削峰填谷降低峰值功耗。官方数据显示,在大语言模型训练场景下,单座Vera Rubin NVL72机架可实现峰值功耗降低13%,同时提升电网合规性;结合其他系统级功耗优化,每瓦供电容量可支撑的GPU数量最多提升40%,相当于在同等供电基础设施下部署更多算力。


可靠性方面,英伟达第二代RAS引擎(RIST,可靠性、可用性与可维护性引擎)支持工作负载运行时的零停机GPU健康检查,搭配进阶版SRAM ECC纠错机制与增强型NVLink热交换服务。不同于第一代RAS需要整个节点离线数小时完成检测,第二代引擎可在业务不中断的情况下完成健康巡检,直接提升系统有效吞吐量,同时为预测性维护提供数据支撑。

结语:算力交付范式转向:从芯片单元到百兆瓦AI工厂

整场发布会中,英伟达将Rubin GPU纳入AI工厂完整体系架构,作为系统核心计算层级。该平台整合计算、网络、供电、散热、运维服务的全链路基础设施能力。

Rubin GPU的落地,折射出英伟达算力产品战略的关键升级。产品价值维度从传统浮点运算峰值性能,延伸至全生命周期运行效率与整体拥有成本。行业传统算力交付单位集中于单GPU、单服务器级别,英伟达则将产品交付尺度升级至100MW级大型AI工厂。

当前行业不少产品宣传依旧以单芯片峰值算力作为主要衡量标尺,而Vera Rubin平台将评估维度拓展至数据中心整体可用性与持续产出能力,依托整套工厂级基础设施体系,实现规模化、高可靠的稳态算力输出。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
证监会明确“十五五”资本市场发展目标

证监会明确“十五五”资本市场发展目标

界面新闻
2026-09-10 15:22:29
埃及知名女主播获判绞刑!锦衣玉食的她当庭崩溃:我连烟都没碰过

埃及知名女主播获判绞刑!锦衣玉食的她当庭崩溃:我连烟都没碰过

冰语历史
2026-09-10 18:33:47
泰王陪34岁妃子欧拉弄庆生,穿情侣装跪拜高僧,苏提达却仍要“母仪天下”

泰王陪34岁妃子欧拉弄庆生,穿情侣装跪拜高僧,苏提达却仍要“母仪天下”

译言
2026-09-10 14:03:39
宇树科技再创新低,今天跌到了498,上市17个交易日大跌55%!

宇树科技再创新低,今天跌到了498,上市17个交易日大跌55%!

财经智多星
2026-09-10 11:09:13
陈思诚公开恋情,与小21岁女友同框,网友:这脸,宛宛类卿...

陈思诚公开恋情,与小21岁女友同框,网友:这脸,宛宛类卿...

人间颂
2026-09-09 15:25:11
翁帆为杨振宁研究院揭牌!穿真丝长袍化淡妆,瘦出尖下巴年轻20岁

翁帆为杨振宁研究院揭牌!穿真丝长袍化淡妆,瘦出尖下巴年轻20岁

猪小艳吖
2026-09-09 20:48:36
最伤身的“饮料”公布,停止饮用,很多人还当成宝,天天喝!

最伤身的“饮料”公布,停止饮用,很多人还当成宝,天天喝!

健康科普365
2026-08-29 20:40:04
“波斯湾爆发最大海战!”央视新闻报道称,当地时间2026年9月9日清晨,伊朗革命卫队发表声明称,重创2艘美国军舰以及8艘

“波斯湾爆发最大海战!”央视新闻报道称,当地时间2026年9月9日清晨,伊朗革命卫队发表声明称,重创2艘美国军舰以及8艘

扶苏聊历史
2026-09-10 15:36:23
中国球迷意难平!不止因为郑钦文1‑2惜败出局,更多在于这五点!

中国球迷意难平!不止因为郑钦文1‑2惜败出局,更多在于这五点!

田先生篮球
2026-09-10 04:26:59
韦世豪手势是什么意思?如今终于水落石出,球迷:沈寅豪怎么看?

韦世豪手势是什么意思?如今终于水落石出,球迷:沈寅豪怎么看?

我就是一个说球的
2026-09-10 23:03:29
炸了炸了!乌克兰最大方便食品厂被炸,6亿盒年产能照样直接归零

炸了炸了!乌克兰最大方便食品厂被炸,6亿盒年产能照样直接归零

碳基生物关怀组织
2026-09-09 14:59:44
乔治王子伊顿公学报道!威廉凯特冒雨相送,哈里梅根又蹭热度作妖?

乔治王子伊顿公学报道!威廉凯特冒雨相送,哈里梅根又蹭热度作妖?

英国报姐
2026-09-09 23:08:35
刘畊宏直播间凉了,“老板娘”的身材戳破了多少人的减肥梦?

刘畊宏直播间凉了,“老板娘”的身材戳破了多少人的减肥梦?

看尽落尘花q
2026-08-23 19:28:46
央行、证监会、国家外汇局,最新发声

央行、证监会、国家外汇局,最新发声

证券时报
2026-09-10 16:28:19
苏州一对情侣,谈了7年,女子提了18次分手,分手后在街头痛哭!

苏州一对情侣,谈了7年,女子提了18次分手,分手后在街头痛哭!

川渝视觉
2026-04-17 22:13:14
CCTV5直播U23中朝大战!毛伟杰杨希两翼齐飞,张玉宁搭档王钰栋冲首胜

CCTV5直播U23中朝大战!毛伟杰杨希两翼齐飞,张玉宁搭档王钰栋冲首胜

刀锋体育
2026-09-10 09:01:05
越扒越癫!被摸臀女生是惯犯,顺风车司机发声,更荒唐的在后面

越扒越癫!被摸臀女生是惯犯,顺风车司机发声,更荒唐的在后面

叶公子
2026-09-10 16:21:34
中国新首富大概是他了!不,是亚洲新首富

中国新首富大概是他了!不,是亚洲新首富

城事堂
2026-09-10 08:55:15
指控4岁男童摸臀事件女生,迎来最大“噩耗”!举报邮件内容全曝光!

指控4岁男童摸臀事件女生,迎来最大“噩耗”!举报邮件内容全曝光!

叨唠
2026-09-11 00:12:54
61 岁演员晒美国优渥日子,祖孙三代享福,声称我努力我尽情享受

61 岁演员晒美国优渥日子,祖孙三代享福,声称我努力我尽情享受

情感大头说说
2026-09-11 00:21:38
2026-09-11 01:11:00
芯东西 incentive-icons
芯东西
智东西AI媒体矩阵品牌。芯东西,芯片产业新媒体。我们是一群追芯人,专注报道AI芯片和半导体产业创新。
2586文章数 8160关注度
往期回顾 全部

科技要闻

一文看懂:iPhone折叠屏顶配2万6,10月才卖

头条要闻

外媒:伊朗捕获美国"大鱼"后发了条消息 令五角大楼受挫

头条要闻

外媒:伊朗捕获美国"大鱼"后发了条消息 令五角大楼受挫

体育要闻

16岁的国产小库里,还有多少功课要做

娱乐要闻

参加晚宴,刘亦菲因合照深陷争议

财经要闻

向松祚:年轻人不必过早买房

汽车要闻

标配全线控底盘 全新一代智己LS6预售20.99万起

态度原创

本地
教育
旅游
数码
手机

本地新闻

拼假 13 天国内长线路线合集

教育要闻

再次学会说话

旅游要闻

大理旅游便民卡“橙意”上线,全年不限次出游!

数码要闻

产品线调整+存储涨价 三星Tab S12系列海外售价抬升

手机要闻

小米18 Pro Max跑分曝光:带5.11GHz超频芯片,安卓性能上限被刷新

无障碍浏览 进入关怀版