网易首页 > 网易号 > 正文 申请入驻

OpenAI亮出自研芯片进展:端到端延迟砍掉超70%,速度超英伟达GB300

0
分享至


芯东西(公众号:aichip001)
编译 崔嫄伟
编辑 陈骏达

芯东西8月26日消息,昨日,OpenAI对外公布其首款定制推理芯片Jalapeño的实测性能结果。测试表明,Jalapeño能够在单位功耗下完成更多AI推理任务,同时显著降低请求端到端延迟。对业务侧而言,这意味着随着业务需求扩张,用户可以获得更快响应速度、更高服务吞吐以及更稳定的访问体验。

Jalapeño的性能在GPT‑OSS 120B、DeepSeek R1 670B、Kimi K2.5 1T三款模型上均得到验证,证明该架构既可以适配OpenAI自研模型,也能够支持外部开源大模型。在三款模型的测试条件下,峰值吞吐量场景下,Jalapeño每瓦可完成的AI任务量达到参考商用推理系统的1.5‑1.9倍,端到端延迟可缩减41%‑72%;针对高交互类工作负载,性能提升可达2.1‑4.1倍。

OpenAI自身大模型技术深度参与了Jalapeño的全流程研发。早期AI模型辅助团队完成芯片方案探索与设计验证,团队仅用时9个月便完成从初步架构设计到芯片流片的完整流程;新一代模型则进一步加速芯片的性能调优与软件编程工作。

一、单芯片架构设计:平衡推理速度与能效

Jalapeño的设计面向下一代大语言模型,尤其聚焦智能体高交互推理场景,核心目标是AI交互中高吞吐量与低延迟难以兼顾的行业痛点。

大模型推理分为两个核心阶段,预填充(Prefill)和解码(Decode),二者的性能瓶颈存在明显差异。预填充阶段负责处理用户输入提示词,属于算力密集型计算阶段;解码阶段则由模型逐Token生成回复,性能瓶颈主要来自内存带宽。推理运行过程中,数据在计算核心与存储单元之间的搬运会产生通信延迟,造成计算单元等待,通信开销甚至会抵消计算带来的性能收益。

推理运行过程中,数据在计算核心与存储单元之间的搬运会产生通信延迟,造成计算单元等待,通信开销甚至会抵消计算带来的性能收益。

Jalapeño的核心设计思路是最大限度削减数据搬运与通信延迟。该芯片支持将模型状态(包含生成回复必需的KV缓存)显式固定在本地存储;系统可以针对每一个推理阶段,动态调配算力、内存、网络资源组合。

网络是这套架构不可分割的组成部分。通过这套互联网络设计,全部计算任务可以在一套相互连通的硬件系统内完成,尽可能减少跨设备的数据搬运,保障每一条推理请求从接收至处理完毕,全程保持高速高效。

这套架构最终实现了一套均衡、高可适配的推理加速器:既能够适配不断迭代的各类模型架构,在预填充、解码两个阶段均具备优异性能,也可适配智能体场景下预填充与解码负载占比动态变化的工作负载。

二、用AI设计芯片,芯片也面向AI编程

AI深度介入Jalapeño的研发全过程。借助AI工具探索多样化实现方案,压缩设计‑测试‑验证迭代周期,并基于真实模型负载持续优化。AI同时参与芯片算术运算电路优化,帮助团队按期在芯片内集成更多计算算力。

Jalapeño的编程接口简洁、行为具备可预测性,同时适配人类工程师与AI程序。工程师可通过本地张量、显式通信、确定性同步完成计算任务描述;AI则负责完成任务在整套硬件系统上的映射、数据放置、资源调度与多组件协同。这套确定性的架构抽象,让AI得以攻克传统并行编程的复杂难题。

即便硬件架构具备灵活性,适配全新模型依旧需要开发对应内核和完成模型专属优化。OpenAI借助Codex搭配GPT‑Astra,仅用两个月时间,就让三款原本不在Jalapeño初始量产规划内的开源权重模型(GPT‑OSS 120B、DeepSeek R1 670B、Kimi K2.5 1T)实现高性能运行。这既体现了硬件架构的灵活度,也印证了AI辅助编程的工程效率。

针对GPT‑OSS的部分注意力模块与混合专家(MoE)模块,AI生成的算子实现代码性能较人类专家手写代码提升1.5‑1.8倍。该结果仅针对选定模块,并非完整模型,但预示了全新的芯片软件迭代范式。

三、基准测试:三款公开模型下性能表现优异

为客观评估Jalapeño的实际推理表现,OpenAI采用SemiAnalysis公开基准测试套件InferenceX,该工具可完整模拟AI请求全流程服务行为,将Jalapeño与英伟达GB200 STP和GB300 STP做横向对比,覆盖高吞吐量批量服务、高交互低延迟等全部典型推理场景。

测试结果显示,在GPT‑OSS‑120B、DeepSeek R1‑670B两款模型测试中,Jalapeño性能曲线处于帕累托最优前沿。

针对GPT‑OSS‑120B模型,对比GB200 STP,Jalapeño的每千瓦混合吞吐在单用户解码速度、端到端请求延迟维度均具备优势;高交互负载下能效优势进一步放大,相近吞吐水平下,端到端延迟可缩减约76%,兼顾整体吞吐量的同时实现更快交互响应。


针对DeepSeek R1‑670B模型,对比GB300 STP,Jalapeño同样在上述两项指标上表现更优;高交互负载下能效优势进一步放大,相近吞吐水平下,端到端延迟可缩减约80%,兼顾整体吞吐量的同时实现更快交互响应。


在与现有最优加速器保持同等最高单用户解码速度的条件下,Jalapeño在GPT‑OSS‑120B、DeepSeek R1、Kimi K2.5三款模型上,每千瓦混合token吞吐分别达到对比方案的53.7倍、104.3倍、56.1倍,高能效优势十分突出。


Jalapeño在GPT‑OSS‑120B、DeepSeek R1‑670B、Kimi K2.5‑1T三款模型上,单用户峰值生成速度分别达到1459、700、694token/s/user,相较现有最优加速器分别提升至2.7倍、4.1倍、3.8倍,在参数量更大的模型场景中,交互响应速度的优势更为突出。


在各平台最优运行条件下,Jalapeño在GPT‑OSS‑120B、DeepSeek R1‑670B、Kimi K2.5‑1T三款模型上,峰值每千瓦混合token吞吐相较现有最优加速器分别提升至1.9倍、1.7倍、1.5倍,展现出全面领先的能效水平。


在三款公开模型的测试范围内,Jalapeño在单位功耗性能与延迟指标上实现更优组合,达到帕累托最优前沿。为保证对比公平,测试按照各加速器官方标称功耗完成归一化处理。Jalapeño标称功耗700瓦,在本次测试负载下,实际持续运行功耗不超过550瓦。

Jalapeño在GPT‑OSS 120B、DeepSeek R1 670B、Kimi K2.5 1T上均展现出优秀性能。在测试规模最大的公开模型Kimi K2.5 1T上,对比参考系统,Jalapeño峰值每瓦性能提升至约1.5倍,端到端延迟缩减约71%。内部测试显示,面对OpenAI自研前沿模型时,Jalapeño的性能优势会进一步放大。这表明,随着模型负载规模扩大、算力需求提升,该架构的价值将更加凸显。

结语:自研芯片重塑AI推理基础设施

AI基础设施的核心价值,是完成现实场景下的有效计算任务。Jalapeño能够在同等功耗与硬件条件下完成更多有效推理计算,承载更大规模业务需求,降低AI服务交付成本。以Jalapeño为代表的自研推理芯片,有望凭借极低的交互响应时延,拓展智能体的落地应用边界。

同时,Jalapeño也展现出全栈协同设计与AI辅助硬件开发的全新范式。从芯片架构、存储网络设计,到算子内核的自动化生成,AI不再仅仅是被芯片运行的业务对象,更深度参与硬件研发与软件适配全流程。这一模式也为行业提供参考:面向智能体时代的推理硬件,需要兼顾硬件架构的确定性与软件层面的AI赋能,才能更好适配模型快速迭代带来的负载变化。未来随着多代芯片平台持续演进,也将进一步推动大模型推理效率与智能体应用的持续突破。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
细思极恐!这是大S汪小菲第一次见面的照片,汪小菲像极了待宰羔羊

细思极恐!这是大S汪小菲第一次见面的照片,汪小菲像极了待宰羔羊

八卦王者
2026-09-10 11:30:09
无解的阳谋!日本彻底傻眼,高市早苗做梦也没想到中国会用这招

无解的阳谋!日本彻底傻眼,高市早苗做梦也没想到中国会用这招

萧矹影视解说
2026-09-10 11:03:11
沐曦股份今日又闪崩大跌,现股价491,近两个月已大跌53%!

沐曦股份今日又闪崩大跌,现股价491,近两个月已大跌53%!

慧眼看世界哈哈
2026-09-10 15:31:38
嘲讽刘翔,媒体人:永远是别人的错,把纯个人私利包装成为全国运动员发声

嘲讽刘翔,媒体人:永远是别人的错,把纯个人私利包装成为全国运动员发声

尘语者
2026-09-10 16:48:10
1942年八路军2000人遭3000鬼子合围,手握重武器,司令员却下令一枪不许打

1942年八路军2000人遭3000鬼子合围,手握重武器,司令员却下令一枪不许打

睡前讲故事
2026-08-23 16:53:43
龚爽追悼会现场,阎维文含泪送别爱徒,丈夫哭到崩溃需搀扶!

龚爽追悼会现场,阎维文含泪送别爱徒,丈夫哭到崩溃需搀扶!

阿讯说天下
2026-09-10 11:38:40
同样是带鱼,“黑眼”和“黄眼”的区别很大!知道后别再乱买

同样是带鱼,“黑眼”和“黄眼”的区别很大!知道后别再乱买

阿龙美食记
2026-09-05 08:56:03
现在不在乎断子绝孙的人越来越多了吗?网友:已经没有软肋了!

现在不在乎断子绝孙的人越来越多了吗?网友:已经没有软肋了!

另子维爱读史
2026-09-10 10:14:57
拼了!国安8外援全部就位:加上塞鸟和茹子楠,首发或仅1名本土

拼了!国安8外援全部就位:加上塞鸟和茹子楠,首发或仅1名本土

邱泽云
2026-09-10 14:52:16
关晓彤漂白头发眉毛和睫毛,饰演白化病患者,“拍摄时路人认不出我了”,坦言这个角色甚至把她从一个i人变成了e人

关晓彤漂白头发眉毛和睫毛,饰演白化病患者,“拍摄时路人认不出我了”,坦言这个角色甚至把她从一个i人变成了e人

台州交通广播
2026-09-10 00:33:32
早上9点!CCTV5直播亚运会男篮首秀,交手记录男篮胜率100%,郭士强避免爆冷

早上9点!CCTV5直播亚运会男篮首秀,交手记录男篮胜率100%,郭士强避免爆冷

大卫的篮球故事
2026-09-10 16:44:40
部分国企之烂,根子在于一把手!

部分国企之烂,根子在于一把手!

职场资深秘书
2026-09-10 17:36:08
证监会:中长期资金持有A股流通市值较去年底增长12.5%

证监会:中长期资金持有A股流通市值较去年底增长12.5%

界面新闻
2026-09-10 15:34:15
转让二手电脑遇到“仅退款”套路,卖家从浙江打顺风车直奔800公里外讨说法;警方已刑事立案,已抓获3名犯罪嫌疑人

转让二手电脑遇到“仅退款”套路,卖家从浙江打顺风车直奔800公里外讨说法;警方已刑事立案,已抓获3名犯罪嫌疑人

都市快报橙柿互动
2026-09-10 01:16:03
韩媒放话:汉字是亚洲瑰宝,并非中国独有,将实施全民汉字教育,背后隐藏的小心思

韩媒放话:汉字是亚洲瑰宝,并非中国独有,将实施全民汉字教育,背后隐藏的小心思

王新喜
2026-09-07 23:38:09
69岁的张瑜把名下上亿资产,包括上海江景大平层和北京四合院,全部转给了外甥,一句“我蛮可怜的”,格外令人心酸

69岁的张瑜把名下上亿资产,包括上海江景大平层和北京四合院,全部转给了外甥,一句“我蛮可怜的”,格外令人心酸

人生录
2026-09-04 00:15:07
中纪委2026年“放大招”!严查四类人!伸过手的一个都跑不了!

中纪委2026年“放大招”!严查四类人!伸过手的一个都跑不了!

细说职场
2026-09-10 15:26:50
墨脱到底有多特殊?同是藏南地区,为何印度一直跨不过那道“天险”?

墨脱到底有多特殊?同是藏南地区,为何印度一直跨不过那道“天险”?

文史达观
2026-09-10 20:39:55
恭喜火箭队!今夏签约立竿见影,新助教1对1指导阿门,进行投篮特训

恭喜火箭队!今夏签约立竿见影,新助教1对1指导阿门,进行投篮特训

熊哥爱篮球
2026-09-10 08:04:15
中国首次以"武力"威慑美国!特朗普刚拍板对台出售武器

中国首次以"武力"威慑美国!特朗普刚拍板对台出售武器

叶老四
2026-09-10 10:39:43
2026-09-10 21:24:49
芯东西 incentive-icons
芯东西
智东西AI媒体矩阵品牌。芯东西,芯片产业新媒体。我们是一群追芯人,专注报道AI芯片和半导体产业创新。
2586文章数 8160关注度
往期回顾 全部

科技要闻

一文看懂:iPhone折叠屏顶配2万6,10月才卖

头条要闻

苹果推出折叠屏 三星暗讽:等你们热完我们的剩饭再说

头条要闻

苹果推出折叠屏 三星暗讽:等你们热完我们的剩饭再说

体育要闻

一年丢掉的积分排名,郑钦文用18天找回来

娱乐要闻

参加晚宴,刘亦菲因合照深陷争议

财经要闻

向松祚:年轻人不必过早买房

汽车要闻

大六座+千匹马力+71度大电池 阿维塔T09曝光/年内上市

态度原创

教育
家居
旅游
时尚
军事航空

教育要闻

孩子上学“坐不住”引来投诉,融合教育难题如何解?深圳研讨会来了

家居要闻

2026建博会(广州) 公装联探展交流活动

旅游要闻

景美鱼鲜 周末到潍坊峡山!听听游客怎么说

秋天,穿风衣吧!

军事要闻

中东“两线战火”同时升级

无障碍浏览 进入关怀版