网易首页 > 网易号 > 正文 申请入驻

3431tokens/秒!英伟达Groq 3 LPX全面投产,实测数据首次披露

0
分享至


芯东西(公众号:aichip001)
编译 崔嫄伟
编辑 陈骏达

芯东西8月25日消息,昨日,英伟达在官网上宣布,面向Vera Rubin平台的Groq 3 LPX交互式推理机架已进入全面投入生产阶段。

该产品是英伟达收购Groq相关技术后首款商业化落地的机架级专用推理系统,作为Vera Rubin平台的扩展组件,专门面向AI Agent场景,解决长上下文下实时交互推理的行业痛点,Nebius是首家采用NVIDIA Groq 3 LPX的AI云服务提供商。

同日,英伟达开发者博客发布深度技术长文,详解Groq 3 LPX与Vera Rubin NVL72的软硬件协同架构,并首次披露独立第三方机构Artificial Analysis的基准测试结果。

Artificial Analysis是行业公认的中立 AI 性能评测机构,本次测试选用谷歌 2026年4月发布的Gemma 4‑31B稠密模型,该模型已经完成针对英伟达硬件的官方适配优化。在10万tokens长上下文测试环境下,Groq 3 LPX实现 3431tokens/s 的输出速度,性能达到当前公开同类方案的近4倍,同时保证模型输出精度不受损失。

一、长上下文+高交互,成为AI算力新瓶颈

随着AI Agent应用普及,多轮对话、代码生成等场景的上下文长度持续膨胀,数百轮对话后,上下文可达到数十万tokens量级。模型每一轮生成内容,都需要重新处理全部历史信息。

行业普遍痛点在于:上下文越长,推理速度越慢;而实时交互又要求单用户低延迟响应,两者难以兼顾。


▲在多轮会话中,每轮对话中蕴含的上下文信息稳步增加

传统方案通常采用张量并行(将模型拆分到多颗芯片并行计算)提升速度,但该技术在高交互的小批量场景下会出现明显短板:芯片间通信的固定启动开销占比会急剧升高,最终抵消并行计算带来的速度收益。简单来说,用户请求越零散、数据量越小,“建立连接、调度链路” 的等待时间就越容易成为性能瓶颈。

二、两大核心技术路径,破解长上下文高速交互难题

Groq 3 LPX是英伟达Vera Rubin平台的专用推理扩展系统,主打小批量、低延迟、长上下文场景,核心通过两项技术设计解决通信开销问题。

为了规避运行时通信调度带来的性能损耗,Groq 3 LPX采用确定性执行架构。在任务开始运行前,编译器就已经掌握所有计算单元、高速内存、芯片间直连链路的全部信息,提前生成精确到时钟周期的传输时间表。

与传统 “数据到达后再申请链路、争抢带宽” 的动态调度不同,这套方案提前规划好每一份数据的传输时机与路径,完全省去了实时仲裁、链路冲突等待的时间,将芯片间通信的固定启动开销压到极低水平,让张量并行在小批量场景下也能发挥出加速效果。

除此之外,Groq 3 LPX还实现了细粒度的计算‑通信重叠,以此减少算力空转。传统推理模式需要等一整块矩阵运算全部完成,再统一传输结果,会产生明显的 “通信尾部” 等待时间。

Groq 3 LPX将计算拆分为320字节的极小粒度,每计算完一小块结果就立刻通过芯片间链路发送,实现计算与传输的高度重叠。这种 “边算边传” 的模式大幅压缩了总耗时,尤其适合长上下文推理中计算量最大的注意力算子。

三、实测验证:速度提升超30倍,性能几乎不受上下文长度影响

第三方机构Artificial Analysis选用谷歌开源的Gemma 4-31B稠密模型完成标准化测试。本次测试专门针对长上下文AI推理的输出速度开展评测,分别在1万tokens、10万tokens两种输入上下文条件下,验证硬件在不同上下文长度下的生成性能;同时额外开展代码生成专项测试,考察硬件处理智能体代码任务的实际表现。该模型于2026年4月发布,官方已针对英伟达算力平台做了性能适配,是行业通用的推理性能基准测试模型,核心结果如下:

10万tokens长上下文:中位数输出速度3431tokens/s,是当前公开最快端点(870tokens/s)的3.9倍;

1万tokens短上下文:中位数输出速度3382tokens/s,性能几乎不受上下文长度影响;

在SPEED-Bench编程基准中,Groq 3 LPX搭载同款Gemma 4‑31B模型,测得中位数速度达4767tokens/s,20%的任务速度超过5520tokens/s。


▲ Artificial Analysis测试结果

从体感来看,生成5000个token的内容,该方案仅需约1.5秒;而当前主流智能体工具速度约60tokens/s,完成相同内容需要近80秒,性能提升超过30倍。测试同时确认,该配置下模型输出无精度损失、无效果下降。

四、与Vera Rubin NVL72协同,支持三种部署模式

Groq 3 LPX并非独立运行的替代产品,而是Vera Rubin平台的能力扩展,与Vera Rubin NVL72机架形成互补:NVL72擅长大规模输入处理、长上下文缓存存储;Groq 3 LPX擅长高速解码生成。二者通过架构级协同,支持三种主流部署模式:

预填充-解码分离(标准模式):NVL72负责处理输入上下文、生成KV缓存,交给LPX完成高速输出生成,实现 “读资料” 和 “写回答” 的硬件分工;

注意力-前馈网络分离:NVL72运行注意力层并维护缓存,LPX运行前馈网络层,机架间仅传输少量中间结果;

投机解码协同:LPX运行小型草稿模型快速生成候选token,NVL72上的大模型负责校验纠错,进一步提升整体生成速度。

官方表示,这套协同方案可支撑2万亿参数级别的多智能体系统,兼顾长上下文与高交互需求。

结语:架构协同新范式:AI智能体算力走向专用化分工

从通用GPU大一统,走向 “通用算力 + 专用推理” 的架构协同,正在成为AI算力的新趋势。除英伟达Groq 3 LPX方案外,行业内也出现了不少异构分离推理的探索:例如部分厂商将预填充与解码阶段拆分,由不同硬件分别承担上下文处理、token生成两类任务;Cerebras、AMD也推出了机架级异构推理方案,尝试把高吞吐的通用算力与低延迟专用推理硬件做组合调度。

Groq 3 LPX的量产落地,补上了Vera Rubin平台在高交互长上下文场景的能力短板,也为AI智能体、代码助手等强交互应用的规模化落地,提供了关键的算力支撑。不过异构架构也对软硬件调度、芯片间通信、KV缓存跨硬件流转提出更高的工程要求,后续还需要在生态适配、成本控制上持续打磨。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
上手iPhone Duo后我改主意了:折叠屏为何必须做到这么好?

上手iPhone Duo后我改主意了:折叠屏为何必须做到这么好?

报错免疫体
2026-09-11 00:30:16
刘翔同门师弟,为国家拿9连冠,退役妥善安置,和上海3所高校合作

刘翔同门师弟,为国家拿9连冠,退役妥善安置,和上海3所高校合作

鲸探所长
2026-08-28 09:33:20
她是日本演员,来中国跑龙套15年才爆红,定居北京两次都嫁中国人

她是日本演员,来中国跑龙套15年才爆红,定居北京两次都嫁中国人

嘴角上翘的弧度
2026-09-10 11:55:38
法布雷加斯创造历史:率领黑马欧冠队史首胜,22岁阿根廷天才两助攻

法布雷加斯创造历史:率领黑马欧冠队史首胜,22岁阿根廷天才两助攻

足球狗说
2026-09-11 05:54:58
德国总理与极右翼党魁激烈交锋 联邦议长:“这里不是球场!”

德国总理与极右翼党魁激烈交锋 联邦议长:“这里不是球场!”

中国青年报
2026-09-10 17:40:14
Stein:联盟观察人士怀疑快船在考虑极端措施来报复伦纳德不申诉

Stein:联盟观察人士怀疑快船在考虑极端措施来报复伦纳德不申诉

云隐南山
2026-09-11 00:24:34
金正恩公开表示:对参与“海外军事行动”的朝军士兵给予赞扬;法国媒体确认了:金正恩所说很可能是被派往俄罗斯参与乌克兰战争的朝鲜部队

金正恩公开表示:对参与“海外军事行动”的朝军士兵给予赞扬;法国媒体确认了:金正恩所说很可能是被派往俄罗斯参与乌克兰战争的朝鲜部队

吉刻新闻
2026-09-10 09:58:21
出兵即侵略!中方亮明底线:敢派兵台海,本土将成为合法打击目标

出兵即侵略!中方亮明底线:敢派兵台海,本土将成为合法打击目标

伴君终老a
2026-08-20 09:29:37
耐克全球仅五份终身合同:为什么刘翔能够位列其中?

耐克全球仅五份终身合同:为什么刘翔能够位列其中?

乒乒乓乓体育
2026-08-30 18:27:37
草台班子!美网兴奋剂检测人员找不到血管,致球员手臂淤伤退赛

草台班子!美网兴奋剂检测人员找不到血管,致球员手臂淤伤退赛

全景体育V
2026-09-11 08:08:49
【2026.9.10】爆姐的饭后爆料:生命不止,爆料不息!

【2026.9.10】爆姐的饭后爆料:生命不止,爆料不息!

娱乐真爆姐
2026-09-11 00:43:50
王凯谈近几年接戏不多的原因:不是没戏拍,而是主动选择藏起来

王凯谈近几年接戏不多的原因:不是没戏拍,而是主动选择藏起来

娱说瑜悦
2026-09-10 20:12:25
马斯克旗下Boring Company完成30亿美元D轮融资,估值230亿美元

马斯克旗下Boring Company完成30亿美元D轮融资,估值230亿美元

IT之家
2026-09-10 13:46:05
没钱的男人,根本不知道女人有多主动

没钱的男人,根本不知道女人有多主动

加油丁小文
2026-09-09 09:30:07
两性关系:55-75岁这20年,惜命最好的方式,不是锻炼,而是这4点

两性关系:55-75岁这20年,惜命最好的方式,不是锻炼,而是这4点

三农老历
2026-08-22 09:29:49
井柏然和倪妮的分手瓜!

井柏然和倪妮的分手瓜!

八卦疯叔
2026-09-10 09:40:03
联合国儿童基金会再回应“催捐”风波:停捐后两年内不会致电

联合国儿童基金会再回应“催捐”风波:停捐后两年内不会致电

南方都市报
2026-09-09 22:25:10
套现146亿后跑路新加坡就能万事大吉?国家新规重拳出击:只要钱还在中国赚,拿了绿卡也照样得补税!申通前老板如意算盘,这下彻底落空了

套现146亿后跑路新加坡就能万事大吉?国家新规重拳出击:只要钱还在中国赚,拿了绿卡也照样得补税!申通前老板如意算盘,这下彻底落空了

人生录
2026-08-16 00:05:13
“生物爹”怒了:四川大叔带着叛逆女儿跑货车,一路见遍人间苦,却意外刷爆全网!

“生物爹”怒了:四川大叔带着叛逆女儿跑货车,一路见遍人间苦,却意外刷爆全网!

阅读第一
2026-09-09 08:35:40
张柏芝带着小儿子现身机场,她的一身打扮太亮眼,太贵气了!

张柏芝带着小儿子现身机场,她的一身打扮太亮眼,太贵气了!

大眼妹妹
2026-09-09 12:28:41
2026-09-11 09:31:01
芯东西 incentive-icons
芯东西
智东西AI媒体矩阵品牌。芯东西,芯片产业新媒体。我们是一群追芯人,专注报道AI芯片和半导体产业创新。
2586文章数 8160关注度
往期回顾 全部

科技要闻

一文看懂:iPhone折叠屏顶配2万6,10月才卖

头条要闻

牛弹琴:玩危险游戏 阿联酋快把阿拉伯兄弟们得罪光了

头条要闻

牛弹琴:玩危险游戏 阿联酋快把阿拉伯兄弟们得罪光了

体育要闻

16岁的国产小库里,还有多少功课要做

娱乐要闻

参加晚宴,刘亦菲因合照深陷争议

财经要闻

向松祚:年轻人不必过早买房

汽车要闻

标配全线控底盘 全新一代智己LS6预售20.99万起

态度原创

健康
教育
房产
手机
军事航空

牙疼,也可能跟心梗有关?!

教育要闻

不想做题,只想看电视

房产要闻

别不服!海南的亿万富豪,只有不到300个!

手机要闻

iOS 27线索:iPhone 18 Pro等视觉智能购物查询,将显示推广内容

军事要闻

中东“两线战火”同时升级

无障碍浏览 进入关怀版