网易首页 > 网易号 > 正文 申请入驻

OpenAI「掀桌」:自研推理芯片「墨西哥辣椒」跑赢英伟达

0
分享至

编辑|山辉、Youli

一觉醒来,关于 OpenAI 的消息真是满天飞。

先是 X 用户 Leo@synthwavedd 独家声称:OpenAI 已完成一次新的预训练,代号「Bel」,参数规模据称超过 10 万亿,或是 Doug 的继任者,可能成为 Astra /GPT-6 的基础模型……



一圈搜索下来发现,并没有准确的消息。但确凿无疑的是,OpenAI 的首款自研推理芯片出成绩了。

就在刚刚,OpenAI 公布了首款自研推理芯片 Jalapeño 的最新测试结果:取得了重大突破,这款芯片专为大语言模型推理设计,通过全新的架构设计,它能够同时提升吞吐量,并降低延迟,在保持高能效的同时,实现两者兼得。并在多个模型测试中超过 NVIDIA GB200、GB300 系统的效率表现。



随即,OpenAI CEO Sam Altman 也在 X 上表示:「我们制造了一款芯片,它的速度很快。」



需要注意的是,作为 OpenAI 首款自研推理芯片,Jalapeño 并不是用于训练下一代 GPT 模型的芯片,而是针对模型上线后的运行阶段进行优化。

简单来说:训练阶段是让模型学会能力,而推理阶段是让模型快速回答用户请求。Jalapeño 则主要解决的是第二个问题。

OpenAI 表示,传统硬件系统往往需要在两个指标之间做取舍:

  • 更高吞吐量(throughput):单位时间处理更多请求;
  • 更低延迟(latency):让用户更快得到响应。

例如,大规模批处理可以提升整体效率,但可能增加单次请求等待时间;而追求极低延迟,又可能牺牲资源利用率。Jalapeño 的目标,是在一个架构中同时优化两者。

而在具体性能方面,OpenAI 表示,在多个大模型推理测试中,Jalapeño 要优于 NVIDIA GB200 和 GB300 系统。其中测试模型包括:OpenAI GPT-OSS 120B; DeepSeek R1 670B; Moonshot AI Kimi K2.5 1T。



尤其引人注意的是DeepSeek R1 和 Kimi K2.5的出现,这似乎是在说明:Jalapeño 并不是只针对 OpenAI 自家模型优化,而是能够适配不同的大模型工作负载。

有意思的,Jalapeño 可被翻译为「墨西哥辣椒」,而在此消息一经发布后,也是立即引起了各路网友的调侃与热议。

「你打算用辣椒的名字来命名你的芯片吗?迫不及待想体验了。」



而对于 OpenAI 来说,Jalapeño 的推出,表明 OpenAI 正在尝试打通「模型 — 软件 — 芯片 — 数据中心」的一整条链路。

另外值得一提的是,此次 OpenAI 的 Jalapeño 芯片,在硬件上是与 Cerebras 进行的合作。

Tibo 发文称:「这一能力得益于我们与 Cerebras 建立的深度合作,以及他们独特的硬件架构。未来,这种合作还将进一步推动「超快速」体验的边界。

我非常期待双方继续合作,在 Cerebras 平台上不断突破极限,探索如何以最快速度运行我们能力最强的模型,并将这种体验带给对性能要求最高的客户。」



其实,OpenAI 并不是第一家走向自研芯片的 AI 公司。此前很多 AI 大厂也早已纷纷下场造芯。比如 Google 推出了 TPU; Amazon 开发 Trainium、Inferentia; Microsoft 推进 Maia; Meta 也布局自研 AI 加速器……

背后的逻辑非常类似:通用 GPU 足够灵活,但并非针对所有 AI 工作负载优化。对于每天运行海量 AI 请求的公司来说,如果能够针对自身模型、软件系统和服务方式设计芯片,就有机会进一步降低成本……

下面我们来具体看一看 Jalapeño 的能力。

更快,更省电

Jalapeño 的核心优势,是在相同功耗下完成更多 AI 工作,同时更快返回响应。现有系统通常需要在吞吐量和延迟之间取舍,而 Jalapeño 试图用同一套架构同时实现更高吞吐量和更低延迟。

OpenAI 强调,这种优势不仅出现在自家模型上,也覆盖外部开发的模型,证明 Jalapeño 是一套更通用的推理架构。

在 GPT-OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T 三个公开模型上,Jalapeño 在峰值吞吐量下实现了 1.5~1.9 倍的每瓦 AI 工作量,端到端延迟降低至对比系统的 1/1.7~1/3.6;对于高度交互式的工作负载,性能优势达到 2.1~4.1 倍。



在 GPT-OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T 上,Jalapeño 的峰值每瓦吞吐量分别达到现有最佳系统的 1.9 倍、1.7 倍和 1.5 倍。

其中,在规模最大的 Kimi K2.5 上,Jalapeño 的峰值每瓦性能约提升 1.5 倍,端到端延迟降低约 3.4 倍。



在 Kimi K2.5 1T 上,随着单用户解码速度提高,Jalapeño 相比 GB300 的每瓦吞吐量优势从峰值的 1.5 倍扩大至最高 56.1 倍。

OpenAI 没有只比较单颗芯片的峰值性能,而是更关注一个指标:在满足用户和交互式 Agent 延迟要求的情况下,每单位电力能够完成多少有用的 AI 工作。

原因也和 Agent 有关。Agent 往往需要连续完成多个步骤,一次请求中看似不大的延迟,会在整个任务执行过程中不断累积。

这也是 Jalapeño 在低延迟区间表现最明显的地方。以 DeepSeek R1 为例,在对比系统此前最佳 TBT 对应的条件下,Jalapeño 每千瓦吞吐量达到 12,258 mixed TPS/kW,对比 GB300 的 118,相差约 104.3 倍。



在 DeepSeek R1 670B 上,Jalapeño 峰值每瓦吞吐量约为 GB300 的 1.7 倍;在相同解码速度下,优势最高扩大至 104.3 倍。

OpenAI 使用 SemiAnalysis 的公开基准 InferenceX 进行测试,并与目前领先的商用系统比较。从高吞吐量服务到高度交互、低延迟场景,Jalapeño 在三个公开模型上都实现了更好的每瓦性能和延迟组合,位于 Pareto frontier(帕累托前沿)。



在 DeepSeek R1 670B 的不同运行点上,Jalapeño 在每瓦吞吐量与交互速度、端到端延迟之间形成更优组合,处于 Pareto frontier(帕累托前沿)。

Jalapeño 的额定功耗为 700W,不过在此次测试的工作负载中,实际持续功耗始终保持在 550W 或以下。

为 Agent 而生

Jalapeño 从一开始就是围绕现在及未来大语言模型,尤其是交互式 Agent 设计的。

LLM 推理的不同阶段有不同瓶颈:Prefill 更依赖计算能力,Decode 更受内存带宽限制,核心和芯片之间的数据移动也会增加延迟。

因此,OpenAI 将芯片、内存、网络、软件和机架级系统协同设计。包括 KV Cache 在内的模型状态可以被明确放置并尽可能留在本地,让 Jalapeño 同时适应 Prefill 和 Decode,并随两者工作量的变化进行调整。

OpenAI 认为,这正是 Agent 工作负载的关键特征。

有意思的是,AI 不只是 Jalapeño 要服务的对象,也直接参与了这颗芯片的开发。

借助不同阶段的模型,OpenAI 团队从最初设计到 Tape-out(流片设计定稿)只用了 9 个月。模型被用于探索不同实现、缩短设计、测量和验证周期,还参与优化芯片的算术电路。

Jalapeño 同样被设计成一个对人类和模型都清晰、可预测的编程目标。使用 GPT-Astra 驱动的 Codex,团队只用了 2 个月,就让三款原本不在 Jalapeño 初始生产计划中的开放权重模型实现了高性能运行。

在部分 GPT-OSS Attention 和 MoE 模块中,Codex 生成的实现甚至比原有人类专家手写版本快 1.5~1.8 倍。

年底部署,二代三代已经在路上

OpenAI 计划在 2026 年底前开始将 Jalapeño 部署到自己的计算基础设施中。目前团队仍在进行生产验证、完善软件、为大规模运行做准备,并继续在更多模型上验证性能。

后续的产品也已经启动,Gen 2 已经进入深度开发阶段,Gen 3 也已经开始成形。

OpenAI 将 Jalapeño 带来的效率变化总结成了三个档位:Ultra-fast 模式,可以达到过去只有 Fast 模式才有的效率;Fast 模式,可以达到过去只有 Batch 模式才有的效率;Batch 模式本身则进一步提高效率。

不过,自研芯片并不意味着 OpenAI 准备摆脱 NVIDIA。

OpenAI 明确表示,满足不断增长的 AI 需求,需要来自所有可用来源的更多算力,公司仍将继续大规模部署 NVIDIA 和其他合作伙伴的加速器,同时覆盖训练和推理工作负载。

你怎么看?欢迎评论区留言、交流!

参考链接:

https://x.com/OpenAI/status/2092300846675505602

https://x.com/sama/status/2092339694210040187

https://openai.com/index/jalapeno-first-results/

https://techcrunch.com/2026/08/25/openais-jalapeno-chip-is-built-for-fast-inference-at-scale-benchmarks-show/

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
2-2、0-0,2队退出争冠,蓉城只剩一个对手,还附带2个好消息!

2-2、0-0,2队退出争冠,蓉城只剩一个对手,还附带2个好消息!

我就是一个说球的
2026-09-05 22:27:08
郑钦文惊天逆转赢下比赛,赛后两字回应太有风度!给足凯斯面子,网友:这情商太高了!

郑钦文惊天逆转赢下比赛,赛后两字回应太有风度!给足凯斯面子,网友:这情商太高了!

心如止水o
2026-09-06 04:46:51
“韦东奕这么牛,为啥没女孩子喜欢他呢?”女儿白了我一眼说:“别的先不讲,要是有人能把这三点都接纳了,我不光服,还得佩服。”

“韦东奕这么牛,为啥没女孩子喜欢他呢?”女儿白了我一眼说:“别的先不讲,要是有人能把这三点都接纳了,我不光服,还得佩服。”

背包旅行
2026-09-01 11:59:13
轮到伊朗斩首了,导弹从天而降,大批美军官被抬走?四国集体失声

轮到伊朗斩首了,导弹从天而降,大批美军官被抬走?四国集体失声

时光流转追梦人
2026-09-06 01:37:55
兵变爆发不足24小时,四架苏-30直闯境内!谁在撑腰太明显了

兵变爆发不足24小时,四架苏-30直闯境内!谁在撑腰太明显了

共工之锚
2026-09-06 00:15:25
78年村里来了个算命瞎子,他摸了我手愣住:莫开玩笑,我不算死人命

78年村里来了个算命瞎子,他摸了我手愣住:莫开玩笑,我不算死人命

古怪奇谈录
2025-09-11 13:36:15
赵勇作出最新回应!王媛媛离队原因曝光,中国女排备战重心公布

赵勇作出最新回应!王媛媛离队原因曝光,中国女排备战重心公布

跑者排球视角
2026-09-05 18:13:57
中建集团:坚决拥护党中央决定

中建集团:坚决拥护党中央决定

新京报
2026-09-05 12:54:06
太过分了!凤姐下场连发帖子撕景甜,评容貌、咒断子绝孙,引发网友怒骂

太过分了!凤姐下场连发帖子撕景甜,评容貌、咒断子绝孙,引发网友怒骂

火山詩话
2026-09-04 06:34:14
花近2万元租海景别墅度假,夫妻俩却双双死在了最享受的地方!

花近2万元租海景别墅度假,夫妻俩却双双死在了最享受的地方!

新欧洲
2026-09-05 18:59:47
002353,签下近百亿元重大合同!已获首笔预付款

002353,签下近百亿元重大合同!已获首笔预付款

证券时报
2026-09-05 20:18:03
郑钦文:0-5落后时告诉自己不要放弃,终于有一次运气站在我这边

郑钦文:0-5落后时告诉自己不要放弃,终于有一次运气站在我这边

懂球帝
2026-09-06 02:00:30
上海海港0-0北京国安,赛后评分:不是武磊第一,北京国安5号第一

上海海港0-0北京国安,赛后评分:不是武磊第一,北京国安5号第一

侧身凌空斩
2026-09-05 21:30:01
985硕士李雷阳遇难,入职仅5天刚穿上白制服,聊天记录看哭无数人

985硕士李雷阳遇难,入职仅5天刚穿上白制服,聊天记录看哭无数人

小嵩
2026-09-05 14:38:43
王鹤任汉口学院校长

王鹤任汉口学院校长

高教网
2026-09-05 22:38:08
马斯克:凡是喜欢稳定的人,都会穷得很稳定——不敢冒险,就是最大的风险

马斯克:凡是喜欢稳定的人,都会穷得很稳定——不敢冒险,就是最大的风险

杏花烟雨江南的碧园
2026-09-04 13:15:03
普京下令暂停空袭基辅3天

普京下令暂停空袭基辅3天

每日经济新闻
2026-09-05 23:54:21
全世界只剩2架,我国有一架,美国出3000万购买被拒

全世界只剩2架,我国有一架,美国出3000万购买被拒

疯狂的小历史
2026-09-05 10:01:05
美国女篮高兴早了,国际篮联官宣,中国女篮收获意外惊喜,球迷沸腾

美国女篮高兴早了,国际篮联官宣,中国女篮收获意外惊喜,球迷沸腾

日常万物志
2026-09-05 17:11:51
2026相亲市场:大部分有房有车有存款的男人,正逐渐失去竞争力

2026相亲市场:大部分有房有车有存款的男人,正逐渐失去竞争力

舒山有鹿
2026-09-05 13:04:51
2026-09-06 06:27:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13924文章数 142729关注度
往期回顾 全部

科技要闻

华为何庭波,再次更新韬定律论文

头条要闻

江西遂川泥石流1死11失联 男子:母亲电话一直打不通

头条要闻

江西遂川泥石流1死11失联 男子:母亲电话一直打不通

体育要闻

本西蒙斯加盟国王,不管怎样,回来就好

娱乐要闻

阿Sa蔡卓妍首度求婚细节,感动落泪

财经要闻

被曝试药后死亡,药企董事竟怒怼记者

汽车要闻

千里浩瀚H5/30英寸大屏 星越L PLUS让你看到油车越级的一面

态度原创

教育
旅游
时尚
本地
军事航空

教育要闻

噩梦!油漆未干开学,学生出现身体不适,教体局:甲醛合格,家长不买账

旅游要闻

一川怒江碧水,百年古朴村寨,云雾漫染山野人间!

推广中奖名单-更新至2026年8月25日推广

本地新闻

扒完小作文,富豪们私藏的度假胜地有多绝

军事要闻

俄罗斯建"粉碎大日本帝国"纪念碑 日本急了

无障碍浏览 进入关怀版