网易首页 > 网易号 > 正文 申请入驻

3431tokens/秒!英伟达Groq 3 LPX全面投产,实测数据首次披露

0
分享至


芯东西(公众号:aichip001)
编译 崔嫄伟
编辑 陈骏达

芯东西8月25日消息,昨日,英伟达在官网上宣布,面向Vera Rubin平台的Groq 3 LPX交互式推理机架已进入全面投入生产阶段。

该产品是英伟达收购Groq相关技术后首款商业化落地的机架级专用推理系统,作为Vera Rubin平台的扩展组件,专门面向AI Agent场景,解决长上下文下实时交互推理的行业痛点,Nebius是首家采用NVIDIA Groq 3 LPX的AI云服务提供商。

同日,英伟达开发者博客发布深度技术长文,详解Groq 3 LPX与Vera Rubin NVL72的软硬件协同架构,并首次披露独立第三方机构Artificial Analysis的基准测试结果。

Artificial Analysis是行业公认的中立 AI 性能评测机构,本次测试选用谷歌 2026年4月发布的Gemma 4‑31B稠密模型,该模型已经完成针对英伟达硬件的官方适配优化。在10万tokens长上下文测试环境下,Groq 3 LPX实现 3431tokens/s 的输出速度,性能达到当前公开同类方案的近4倍,同时保证模型输出精度不受损失。

一、长上下文+高交互,成为AI算力新瓶颈

随着AI Agent应用普及,多轮对话、代码生成等场景的上下文长度持续膨胀,数百轮对话后,上下文可达到数十万tokens量级。模型每一轮生成内容,都需要重新处理全部历史信息。

行业普遍痛点在于:上下文越长,推理速度越慢;而实时交互又要求单用户低延迟响应,两者难以兼顾。


▲在多轮会话中,每轮对话中蕴含的上下文信息稳步增加

传统方案通常采用张量并行(将模型拆分到多颗芯片并行计算)提升速度,但该技术在高交互的小批量场景下会出现明显短板:芯片间通信的固定启动开销占比会急剧升高,最终抵消并行计算带来的速度收益。简单来说,用户请求越零散、数据量越小,“建立连接、调度链路” 的等待时间就越容易成为性能瓶颈。

二、两大核心技术路径,破解长上下文高速交互难题

Groq 3 LPX是英伟达Vera Rubin平台的专用推理扩展系统,主打小批量、低延迟、长上下文场景,核心通过两项技术设计解决通信开销问题。

为了规避运行时通信调度带来的性能损耗,Groq 3 LPX采用确定性执行架构。在任务开始运行前,编译器就已经掌握所有计算单元、高速内存、芯片间直连链路的全部信息,提前生成精确到时钟周期的传输时间表。

与传统 “数据到达后再申请链路、争抢带宽” 的动态调度不同,这套方案提前规划好每一份数据的传输时机与路径,完全省去了实时仲裁、链路冲突等待的时间,将芯片间通信的固定启动开销压到极低水平,让张量并行在小批量场景下也能发挥出加速效果。

除此之外,Groq 3 LPX还实现了细粒度的计算‑通信重叠,以此减少算力空转。传统推理模式需要等一整块矩阵运算全部完成,再统一传输结果,会产生明显的 “通信尾部” 等待时间。

Groq 3 LPX将计算拆分为320字节的极小粒度,每计算完一小块结果就立刻通过芯片间链路发送,实现计算与传输的高度重叠。这种 “边算边传” 的模式大幅压缩了总耗时,尤其适合长上下文推理中计算量最大的注意力算子。

三、实测验证:速度提升超30倍,性能几乎不受上下文长度影响

第三方机构Artificial Analysis选用谷歌开源的Gemma 4-31B稠密模型完成标准化测试。本次测试专门针对长上下文AI推理的输出速度开展评测,分别在1万tokens、10万tokens两种输入上下文条件下,验证硬件在不同上下文长度下的生成性能;同时额外开展代码生成专项测试,考察硬件处理智能体代码任务的实际表现。该模型于2026年4月发布,官方已针对英伟达算力平台做了性能适配,是行业通用的推理性能基准测试模型,核心结果如下:

10万tokens长上下文:中位数输出速度3431tokens/s,是当前公开最快端点(870tokens/s)的3.9倍;

1万tokens短上下文:中位数输出速度3382tokens/s,性能几乎不受上下文长度影响;

在SPEED-Bench编程基准中,Groq 3 LPX搭载同款Gemma 4‑31B模型,测得中位数速度达4767tokens/s,20%的任务速度超过5520tokens/s。


▲ Artificial Analysis测试结果

从体感来看,生成5000个token的内容,该方案仅需约1.5秒;而当前主流智能体工具速度约60tokens/s,完成相同内容需要近80秒,性能提升超过30倍。测试同时确认,该配置下模型输出无精度损失、无效果下降。

四、与Vera Rubin NVL72协同,支持三种部署模式

Groq 3 LPX并非独立运行的替代产品,而是Vera Rubin平台的能力扩展,与Vera Rubin NVL72机架形成互补:NVL72擅长大规模输入处理、长上下文缓存存储;Groq 3 LPX擅长高速解码生成。二者通过架构级协同,支持三种主流部署模式:

预填充-解码分离(标准模式):NVL72负责处理输入上下文、生成KV缓存,交给LPX完成高速输出生成,实现 “读资料” 和 “写回答” 的硬件分工;

注意力-前馈网络分离:NVL72运行注意力层并维护缓存,LPX运行前馈网络层,机架间仅传输少量中间结果;

投机解码协同:LPX运行小型草稿模型快速生成候选token,NVL72上的大模型负责校验纠错,进一步提升整体生成速度。

官方表示,这套协同方案可支撑2万亿参数级别的多智能体系统,兼顾长上下文与高交互需求。

结语:架构协同新范式:AI智能体算力走向专用化分工

从通用GPU大一统,走向 “通用算力 + 专用推理” 的架构协同,正在成为AI算力的新趋势。除英伟达Groq 3 LPX方案外,行业内也出现了不少异构分离推理的探索:例如部分厂商将预填充与解码阶段拆分,由不同硬件分别承担上下文处理、token生成两类任务;Cerebras、AMD也推出了机架级异构推理方案,尝试把高吞吐的通用算力与低延迟专用推理硬件做组合调度。

Groq 3 LPX的量产落地,补上了Vera Rubin平台在高交互长上下文场景的能力短板,也为AI智能体、代码助手等强交互应用的规模化落地,提供了关键的算力支撑。不过异构架构也对软硬件调度、芯片间通信、KV缓存跨硬件流转提出更高的工程要求,后续还需要在生态适配、成本控制上持续打磨。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
姬鹏飞为儿子求情,偏偏找上最不该找的人,对方怒斥:你儿子是军中败类!

姬鹏飞为儿子求情,偏偏找上最不该找的人,对方怒斥:你儿子是军中败类!

凉州辞
2026-09-10 13:00:03
提醒大家,尽量不要办一日丧!内行老人:一日丧,最伤亲情乱家运

提醒大家,尽量不要办一日丧!内行老人:一日丧,最伤亲情乱家运

一口娱乐
2026-09-11 00:43:08
“辞职看世界”的女老师,11年后现状曝光:黯然回乡,老公已分手

“辞职看世界”的女老师,11年后现状曝光:黯然回乡,老公已分手

年代回忆
2026-09-10 21:53:36
30年代以来首次移民负增长——特朗普"零移民"政策正在重塑美国!

30年代以来首次移民负增长——特朗普"零移民"政策正在重塑美国!

凑近看世界
2026-09-10 11:30:47
保利集团董事长贺平的人生颇具传奇色彩:他娶了邓小平的女儿为妻,还曾低调斥资3000万元收回三件国宝

保利集团董事长贺平的人生颇具传奇色彩:他娶了邓小平的女儿为妻,还曾低调斥资3000万元收回三件国宝

z千年历史老号
2026-09-07 11:43:45
井柏然被爆断崖式分手倪妮!女方分手后连续点赞一个月无回应

井柏然被爆断崖式分手倪妮!女方分手后连续点赞一个月无回应

小邵说剧
2026-09-09 09:21:08
2026年养老金可能暂停调整,与社保基数上涨乏力有关?明年如何?

2026年养老金可能暂停调整,与社保基数上涨乏力有关?明年如何?

王五说说看
2026-09-11 07:24:43
回顾:星宇股份连串操作,向公众展示了什么叫草台班子

回顾:星宇股份连串操作,向公众展示了什么叫草台班子

听心堂
2026-09-11 08:50:49
“摸臀事件”不能这样结束

“摸臀事件”不能这样结束

圆方你怎么看啊
2026-09-10 00:04:51
俄外长建议牢记普京的话:若欧洲攻击俄罗斯,战争将“非常短暂”

俄外长建议牢记普京的话:若欧洲攻击俄罗斯,战争将“非常短暂”

俄罗斯卫星通讯社
2026-09-10 15:15:28
买入,买入,买入!重要事情我说个三遍!

买入,买入,买入!重要事情我说个三遍!

大碗楼市
2026-09-10 08:01:33
逃到海外3年,丁玉梅再迎噩耗,原来许家印还给她留了一张底牌

逃到海外3年,丁玉梅再迎噩耗,原来许家印还给她留了一张底牌

乐天闲聊
2026-08-27 09:53:36
历史独一档!梅西缔造神迹,连续三赛季造球30+统治美职联!

历史独一档!梅西缔造神迹,连续三赛季造球30+统治美职联!

田先生篮球
2026-09-08 21:28:42
周星驰七天饭局有的抗癌有的坐轮椅,昔日黄金配角现状唏嘘

周星驰七天饭局有的抗癌有的坐轮椅,昔日黄金配角现状唏嘘

独家影视圈
2026-09-10 19:37:51
巴萨五连胜火力全开 国家德比迎战穆里尼奥皇马

巴萨五连胜火力全开 国家德比迎战穆里尼奥皇马

带你逛体坛
2026-09-10 11:28:15
宝格丽晚宴生图:刘亦菲膀大腰圆,刘嘉玲脸肿,被蔡依林状态惊艳

宝格丽晚宴生图:刘亦菲膀大腰圆,刘嘉玲脸肿,被蔡依林状态惊艳

娱说瑜悦
2026-09-08 14:33:01
不丹要与中国划清边界?这个神秘近邻为何长期与中国存在领土纠纷

不丹要与中国划清边界?这个神秘近邻为何长期与中国存在领土纠纷

历史甄有趣
2026-09-11 09:30:42
他一生曾4次成为毛主席的上级,娶了邓公的前妻,儿子官至副国级

他一生曾4次成为毛主席的上级,娶了邓公的前妻,儿子官至副国级

谈古论今历史有道
2026-09-11 09:30:07
莫言:永远不要期望一个没有血缘关系的人,能站在你的角度替你考虑|成年人最大的清醒

莫言:永远不要期望一个没有血缘关系的人,能站在你的角度替你考虑|成年人最大的清醒

杏花烟雨江南的碧园
2026-07-27 11:15:03
李晨语中框,中国女足0-0非洲劲旅,连续2轮U20世界杯保持不败

李晨语中框,中国女足0-0非洲劲旅,连续2轮U20世界杯保持不败

侧身凌空斩
2026-09-11 01:53:03
2026-09-11 10:15:01
芯东西 incentive-icons
芯东西
智东西AI媒体矩阵品牌。芯东西,芯片产业新媒体。我们是一群追芯人,专注报道AI芯片和半导体产业创新。
2587文章数 8160关注度
往期回顾 全部

科技要闻

罗永浩连用7个“抄的”吐槽苹果折叠屏

头条要闻

泽连斯基乘坐专机从摩尔多瓦起飞 险些被俄无人机击中

头条要闻

泽连斯基乘坐专机从摩尔多瓦起飞 险些被俄无人机击中

体育要闻

16岁的国产小库里,还有多少功课要做

娱乐要闻

17岁拿下世界第一,还被亲妈吐槽?

财经要闻

向松祚:年轻人不必过早买房

汽车要闻

标配全线控底盘 全新一代智己LS6预售20.99万起

态度原创

家居
艺术
旅游
亲子
公开课

家居要闻

2026建博会(广州) 公装联探展交流活动

艺术要闻

他偷走70箱清宫文物:却在逃亡路上将国宝赠人、丢弃...

旅游要闻

大宛故地,丝路未央——走访乌兹别克斯坦纳曼干州

亲子要闻

备孕怀不上的原因有哪些?高龄备孕吃什么提高卵巢功能?

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版