![]()
AI行业的节奏,最近已经快到让人跟不上。就在HotChips2026大会上,英伟达直接放出一套刷新行业认知的实测数据,下一代旗舰机柜VeraRubinNVL72正式揭开面纱,并且直接拿DeepSeek‑V4‑Pro做真实智能体编码任务实测,爆出了一组近乎夸张的数字。
每兆瓦吞吐量最高暴涨30倍,Token生成成本直接下降35倍。网上不少从业者调侃,就算写PPT画饼,都不敢报出这样的参数。曾经身价不菲的H200,回头看都只能算作入门版本。
![]()
![]()
这一次,英伟达传递出来的信号十分明确:传统大模型聊天时代已经翻篇,Agent智能体时代正式到来,过去大家习惯的AI跑分标准,已经不再适用。不止GPU,CPU、专用推理加速器一并量产,甚至这套算力方案已经被SpaceX看中,计划部署送上太空,AI算力的战场,已经不再局限在地面的数据中心里。
![]()
一、旧基准失效:智能体和普通聊天根本不是一回事
很多人会疑惑,为什么现有GB300已经足够强,英伟达还要急着推出VeraRubin。OpenRouter统计的真实业务数据,把背后的痛点讲得很直白:跑一次Agent智能体任务,消耗的Token总量,是普通对话聊天的15倍之多。
举个很现实的例子,让AI智能体完整完成一份公司投资调研,它不是简单回答一两句话。它会反复调用工具、读取文档、多次推理、生成子任务,一轮又一轮把输出结果继续当成输入,上下文会越堆越长。智能体交互次数越多,工具调用越频繁,整体算力压力就会成倍放大。
![]()
![]()
过去行业测试大模型,习惯用8K、128K固定长度的文本做跑分。这种测试只适合简单问答,完全复刻不了智能体持续循环工作的真实场景。英伟达直接放弃了传统的测试方式,选用SemiAnalysis推出的AgentX基准,测试素材就是真实的代码编写会话,完整还原工具调用、子智能体生成、上下文持续膨胀的完整流程。
![]()
也正是这套新测试,暴露了老平台的短板。H200面对持续运转的Agent任务,很快就会遇到内存、吞吐、功耗的瓶颈。单纯聊天看不出差距,一旦跑真实业务,新旧设备的鸿沟就彻底拉开。
二、VeraRubin实测:同样电力,干30倍的智能体活
这次测试没有拿老旧的旧显卡凑数,直接拿当下主力机皇GB300NVL72作为对照组,运行1.6万亿参数的DeepSeek‑V4‑Pro模型,在AgentX智能体工作负载下,VeraRubinNVL72交出答卷:每兆瓦吞吐量相比GB300最高提升30倍。
![]()
回顾这两代的迭代路径,从H200升级到GB300,Agent场景吞吐量最高提升30倍,整机柜价格大致翻倍;再从GB300升级到VeraRubin,吞吐量再度冲高30倍,机柜成本再次翻倍。两年时间,硬件价格涨4倍,但是实际业务吞吐量直接跃升900倍。
![]()
对于数据中心来说,电力永远是硬天花板,很多AI工厂不是缺机器,而是没有足够的供电。VeraRubin最大的价值,就是在同样兆瓦级电力预算里面,释放出数十倍的有效算力。配合英伟达DSXMaxLPS电源管理技术,在相同供电条件下,还可以再多部署40%的GPU资源,把电力的价值压榨到极致。
![]()
吞吐量暴涨带来最直接的改变,就是Token成本断崖式下跌。官方给出的数据,VeraRubin生成每百万Token的成本,相比GB300最高直接降低35倍。成本降到这个级别,7×24小时不间断工作的数字员工,大规模面向普通用户的Agent应用,才有真正落地的商业基础。
很多人会误以为,这波飞跃来自芯片工艺的单点突破。事实恰恰相反,VeraRubin靠的是整套系统协同设计。分布式KV缓存、KV感知路由、MegaMoE架构,再加上NVFP4四位量化技术,在不明显损失效果的前提下压低内存占用。第六代NVLink互联,速度远超普通以太网,延迟大幅降低,让72颗GPU之间,MoE模型的各个专家模块可以流畅调度。英伟达卖的早已不是单张显卡,而是一整套完整的AI发电厂。
![]()
三、Groq3LPX量产,解决智能体最头疼的延迟难题
同一天,英伟达官宣Groq3LPX全面量产,这是去年花费200亿美元收购Groq之后,交出的商业化落地成果。
智能体工作会出现一个很现实的痛点:读取海量上下文和高速输出Token,对硬件的需求完全不一样。如果全部交给GPU处理,很容易出现读取任务占满资源,生成输出卡顿拖慢整体节奏。Groq3LPX的思路就是分工协作,VeraRubinGPU负责处理海量长上下文读取,Groq3LPX专门负责高速生成Token,一个负责读,一个负责写,各司其职。
整套机架最多可以塞进256个LP30加速器,和GPU高速互联。实测跑Gemma431B,10万Token超长上下文场景,输出速度冲到3400Token每秒。处理5000个Token,耗时从50秒压缩到1.5秒,速度提升34倍。在编码任务场景,峰值输出速度甚至达到6981token/s。
![]()
![]()
过去要耗费数小时的多步骤智能体任务,现在几分钟就可以跑完。云厂商Nebius已经把这套硬件部署到自家TokenFactory,给智能体循环任务提供低延迟的算力底座。
四、VeraCPU登场,马斯克直接把算力瞄准太空
整套平台里面,最容易被忽略,却意义重大的,是全新的VeraCPU。
Agent任务不只有大模型推理,大量琐碎工作都压在CPU身上:调用工具、运行代码、调度子任务、来回搬运上下文数据。上百步连续流转,传统通用CPU扛不住这种高强度调度,这也是英伟达专门打造VeraCPU的原因。它搭载88颗自研Olympus核心,内存带宽冲到1.2TB/s,专门为智能体的调度工作而生。
![]()
![]()
样品很早就给到OpenAI、Anthropic、SpaceXAI做内部测试。SpaceXAI动作最快,直接大规模部署这套芯片,同时搭建吉瓦级别的VeraRubin算力工厂,用来支撑Grok模型。更疯狂的计划还在后面,优化定制版本的VeraRubinNVL72,会被搬到太空,作为StarmindAI卫星的算力核心,计划2028年实现大规模部署,把AI算力直接送上轨道。
![]()
![]()
五、英伟达在重新搭建Agent时代的地基
回望过去,大模型时代,英伟达靠GPU拿下训练和推理市场。来到Agent时代,它的版图已经铺开到GPU、专用CPU、推理加速器、高速互联整套全栈硬件。
![]()
单纯比拼单卡性能的时代正在过去。未来比拼的,是一整套机架系统综合能力,看整套机器跑真实智能体业务的时候,功耗、速度、成本综合表现。
VeraRubin的登场,不只是一次硬件更新。它代表整个行业的重心,正式从“把模型训得更大”,转向“让智能体能稳定、便宜、高速地持续干活”。接下来,一大批Agent应用、数字员工,会在这套新的算力底座之上,真正迎来爆发。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.