网易首页 > 网易号 > 正文 申请入驻

让AI自己写大模型推理引擎,跑分暴打vLLM,1792 tokens/s

0
分享至

大家好,我是 Ai 学习的老章

最近硅谷算力圈发生了一件极具震撼力的事情:老牌推理平台 Baseten 的一帮工程师,没有手写一行 CUDA 算子,而是直接把 Claude Code 放进服务器,让它自主攻坚去写一套定制化大模型推理引擎

整整跑了一周之后,压测结果十二分离谱:这套 AI 自己编译出来的推理引擎,跑分竟然暴打当前公认最顶级的开源 SOTA 引擎 vLLM,Decode 生成速度直接拉升了整整 90%

就问你这个提升幅度夸张不夸张

传统引擎的“大而全”包袱

可能很多朋友会有疑问:vLLM、SGLang、TensorRT-LLM 凝聚了全球最顶尖系统架构师的心血,怎么会被一个跑在终端里的 Coding Agent 给挑翻了?

答案藏在现代软件工程的妥协里

现有的开源通用推理引擎确实极为强悍,但它们身上背负着沉重无比的历史包袱:

  • 它们必须同时适配 NVIDIA、AMD、华为昇腾等五花八门的不同硬件架构

  • 它们必须支持 FP16、BF16、INT8、INT4 以及最新 NVFP4 等各种量化格式

  • 它们必须兼容张量并行、流水线并行、MoE 专家并行等各种分布式切分策略

为了兼顾所有可能性,通用框架里堆叠了无数层抽象与动态分支判断

然而当你的业务真正部署上线时,生产环境里的条件其实是完全固定的:

  • 模型规格固定:比如就是 Qwen-3.6-35B-A3B

  • 硬件设备固定:比如就是单台工作站里的单张 NVIDIA B200 GPU

  • 精度格式固定:直接锁死在 NVFP4

  • 流量特征固定:单流长文本吞吐或者高并发特定分布

在这种极度严苛的固定约束下,通用框架里 90% 以上的抽象兼容逻辑全成了拖累性能的纯冗余

既然环境边界已经完全确定,为什么还要用大而全的瑞士军刀?为什么不让 AI 针对这套特定配置,量身定做一把锋利至极的手术刀?

下图清晰揭示了当前行业正处于技术拐点的四大合流趋势:模型推理能力跃升、Agent 自动化工作流成熟、客观可量化验证指标明确,以及全行业对推理成本控制的极度渴求


四大驱动趋势合流 战报:单卡 B200 实测数据暴打 vLLM

口说无凭,咱们直接看 Baseten 官方实测的硬核压测数据

实验团队选用了国产之光 Qwen-3.6-35B-A3B 作为基准,采用 NVFP4 精度,直接在单张 NVIDIA B200 硬件上死磕 vLLM 0.25.1 最新稳定版

经过 AI 多轮自主优化,最终产出的定制推理引擎被命名为 VibeQwen,各项核心指标全部呈现碾压态势:

  1. 单流 Decode 解码速率(TPOT): 在处理结构化、高重合度的单流文本时,VibeQwen 飙出了 1,792 tokens/s 的惊人速率,相比经过精心调优的 vLLM(943 tokens/s), 速度直接暴增 90%

  2. 首字响应延迟(TTFT): 返回第一个 Token 的时间从 vLLM 的 28ms 直接暴跌到 12ms ,缩短了整整 57%,响应速度提升达 2.33 倍,直接为极低延迟交互场景打开了大门

  3. 高并发场景总吞吐量: 在 Concurrency 为 32 的高并发真实压测下,VibeQwen 的单卡输出吞吐量达到 10,307 tokens/s ,而 vLLM 停留在 6,030 tokens/s, 整机吞吐提升 71%

下图是两者的正面硬刚对比柱状图,右侧绿色高光部分就是 VibeQwen 砍下的战绩:


VibeQwen 与调优版 vLLM 性能正面对比

除了大语言模型,团队还趁热打铁做了第二组跨模态验证

他们将这套优化方法迁移到了 Meta 最新的图像分割大模型 SAM 3.1 上,基于单张 H100 打造了专职推理服务 Sammie:

  • 面对图像与短文本提示词,Sammie 在单张 H100 上跑出了 每秒 91 张图片 的超强吞吐

  • 比 Meta 官方提供的参考服务整整高出 50%

  • 最可怕的是:因为复用了前一次实验沉淀的优化经验知识库,Sammie 从立项到完工只用了大概 2 天时间与 2 亿 Token

Sammie 在 SAM 3.1 图像分割任务上的吞吐实测 核心解密:AI 是怎么当好“超强编译器”的

看到这里,估计做底层 Infra 的同学坐不住了:AI 到底掌握了什么黑魔法?

其实整个工程背后依托的是开源界前沿的 MetaInfer 架构(arXiv:2607.12875),其核心思想被称为 LLM-as-Compiler(大模型即编译器)

整个执行链路并没有玄学,而是一个设计极度精密且完全闭环的自动化实验场

下图完整拆解了这套由大模型主导的“自动化编译器”攻坚全流程,从物理边界定义、长程自治攻坚,一直到不可变真值裁决:


MetaInfer 闭环工作流架构图

工程师首先给 Claude Code 赋予了 B200 算力机的 SSH 权限与底层诊断工具,设定了一个极度明确的不可变目标:/goal beat vLLM by 20% on all performance metrics without accuracy loss

在这场无人值守的长程攻坚战里,有两项设计堪称教科书级别:

1. 极其严苛的“防作弊”精度裁决器(Oracle)

如果你让 AI 优化代码却没给它锁死精度底线,AI 很快就会展现出极其狡黠的作弊能力:它会直接写出下面这段逻辑来交卷:

while True:
yield "a"

这种代码的 TTFT 和 TPOT 跑分能秒杀宇宙间所有引擎,延迟无限趋近于零,吞吐无限大,但它除了吐字符 "a" 之外没有任何实用价值

Baseten 的做法是直接挂载原版 BF16 权重作为终极裁判,AI 每次改动算子或调整内存分配,都必须在容差阈值内通过精度测试,一旦结果发生漂移直接被红牌罚下

2. 自主进化且可沉淀的领域知识库

与 Karpathy 提出的 autoresearch 思想一脉相承,Agent 在攻坚过程中并非盲目乱撞,而是会将验证成功的 CUDA 算子组合、显存预分配策略与通信方案记录进知识库

在第一轮搞定 Qwen-3.6-35B 后,这些优化经验立刻被用于加速 SAM 3.1,展现出了极具生产力价值的复用能力

下图展示了全球对 AI 推理算力需求的指数级井喷现状,推理成本的急剧增加正在迫使全行业寻求算力极限:


全球 AI 推理算力需求指数级跃升 成本复盘与真诚思考

咱们必须要讲真话,客观看待这项技术的当下与未来

首先看账本:这套方案目前绝不是零成本的游戏:

  • 在打磨 VibeQwen 的一周时间里,Claude 累计消耗了大约 17 亿 Token (绝大多数由输入上下文缓存覆盖)

  • 消耗了约 200 个 B200 GPU 卡时

  • 整体研发开销折合数千美元

但站在商业视角的另一端,算力经济学展现出了恐怖的吸引力: 如今头部大厂每年在模型在线推理上的算力账单动辄数千万甚至数亿美元,哪怕整体吞吐仅提升 10%,对应的都是真金白银数百万美元的机房服务器结余

花几千美元的 API 和电费,让 Agent 自主烧卡跑出一套提速 50% 到 90% 的专用引擎,这笔投资回报率在商业上已经完全算得过来账

局限性同样客观存在:

  • 目前产出的 VibeQwen 和 Sammie 仍停留在实验与特定基准测试阶段,尚未承接真实的混合生产流量

  • 面对复杂的多机多卡流水线与动态超长上下文,Agent 的鲁棒性仍需要人类架构师在旁保驾护航

总结

Baseten 的这次实测,给我们整个技术社区敲响了警钟:

以往底层系统优化被视为仅有少数顶尖黑客才能涉足的禁区,大家习惯了漫长的代码抽象、接口兼容与跨平台编译,结果系统越来越重,推理瓶颈越积越深

而 MetaInfer 与这次实验展现了一种全新的范式: 未来的工程师不再需要日夜死磕手撕 CUDA 汇编,真正的技术壁垒正在转移到 如何精准定义硬件与业务边界、如何设计防止 AI 作弊的基准裁决器,以及 如何调度 Agent 建立自动化评估流水线

让大模型去加速大模型,这一天来得比我们所有人想象的都要快得多

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
宏远速递!亚帅解释输球原因,徐杰三分14中2,卢卡被批美国张皓嘉

宏远速递!亚帅解释输球原因,徐杰三分14中2,卢卡被批美国张皓嘉

多特体育说
2026-10-10 23:58:16
《哪吒2》全球票房大涨,超越《泰坦尼克号》,再次进入全球前五

《哪吒2》全球票房大涨,超越《泰坦尼克号》,再次进入全球前五

影视高原说
2026-10-10 14:11:16
查尔斯国王立场坚定,拒绝邀请哈里王子参加圣诞庆典,父子关系依旧疏远

查尔斯国王立场坚定,拒绝邀请哈里王子参加圣诞庆典,父子关系依旧疏远

人物档案局
2026-10-10 17:06:24
局势彻底反转了!带着给中国的下马威,欧专员飞抵北京,中国的拒绝,来得猝不及防,引发舆论热议!

局势彻底反转了!带着给中国的下马威,欧专员飞抵北京,中国的拒绝,来得猝不及防,引发舆论热议!

林杰论事
2026-10-10 07:43:06
沈超任天津市河北区委书记

沈超任天津市河北区委书记

中国经济网
2026-10-09 12:07:51
惜败!广东东阳光82-86广州,球员评分:3人满分,4人及格,3人低迷

惜败!广东东阳光82-86广州,球员评分:3人满分,4人及格,3人低迷

五姑娘台球
2026-10-10 22:04:56
40岁了才开始,真的还来得及吗?网友们的评论真的太令人欣喜!

40岁了才开始,真的还来得及吗?网友们的评论真的太令人欣喜!

另子维爱读史
2026-10-10 20:33:15
辱骂王皓的三名女球迷被行政拘留 谌贻琴指示依法从严整治饭圈

辱骂王皓的三名女球迷被行政拘留 谌贻琴指示依法从严整治饭圈

劲爆体坛
2026-10-10 11:15:06
杭州降39%、广州降32%、上海降31%!不是房子卖光, 而是房东不卖了

杭州降39%、广州降32%、上海降31%!不是房子卖光, 而是房东不卖了

兴趣知识
2026-10-09 01:02:33
史诗惨案!申花7-1疯狂复仇玉昆,8粒进球全程高能碾压局

史诗惨案!申花7-1疯狂复仇玉昆,8粒进球全程高能碾压局

倾世璃歌
2026-10-11 04:16:04
社保卡有金卡还每月发补贴?北京人社局:这是诈骗

社保卡有金卡还每月发补贴?北京人社局:这是诈骗

北京网络举报
2026-10-10 16:12:07
太原市正式实施中小学春秋假制度

太原市正式实施中小学春秋假制度

界面新闻
2026-10-10 13:31:14
纪委连打10个电话让我配合核查,我怒了:我入职才3天哪来的问题

纪委连打10个电话让我配合核查,我怒了:我入职才3天哪来的问题

千秋文化
2026-07-25 19:50:42
黑水公司创始人旗下武装被曝在刚果(金)遭伏击,约20人伤亡

黑水公司创始人旗下武装被曝在刚果(金)遭伏击,约20人伤亡

观察者网
2026-10-10 10:33:14
热苏斯诺坎普58分钟3球,平均19分钟1球

热苏斯诺坎普58分钟3球,平均19分钟1球

懂球帝
2026-10-11 01:40:12
大案纪实:胆大妄为!开封前银行副行长杀人分尸,竟将尸块抛在包公祠旁,民众直呼苍天有眼

大案纪实:胆大妄为!开封前银行副行长杀人分尸,竟将尸块抛在包公祠旁,民众直呼苍天有眼

大案纪实故事
2026-10-10 15:48:16
七国申办2036年奥运会,本月底报名截止,大湾区会压哨报名吗?

七国申办2036年奥运会,本月底报名截止,大湾区会压哨报名吗?

晨光苏醒a
2026-10-10 19:11:43
红军长征饮食真相:打破“草根树皮”传说,还原当年真实丰富伙食

红军长征饮食真相:打破“草根树皮”传说,还原当年真实丰富伙食

小豫讲故事
2026-10-05 06:00:40
月薪多少,才能继续留在日本?

月薪多少,才能继续留在日本?

东京在线
2026-10-10 21:01:18
10.11早评|没完没了!美国大消息!A股要慌了?

10.11早评|没完没了!美国大消息!A股要慌了?

龙行天下虎
2026-10-11 00:59:33
2026-10-11 06:32:49
Ai学习的老章 incentive-icons
Ai学习的老章
Ai学习的老章
3536文章数 11198关注度
往期回顾 全部

科技要闻

上世纪成熟的踏板,为何今天还会断裂?

头条要闻

港媒:梅艳芳骨灰被盗三个月无线索 歌迷会公开求助

头条要闻

港媒:梅艳芳骨灰被盗三个月无线索 歌迷会公开求助

体育要闻

十年回首:湖人三榜眼的夏天,与NBA无关

娱乐要闻

宋佳一串三大满贯 争议随之而来

财经要闻

双汇因抗生素超标共被罚1.29亿元

汽车要闻

千匹马力+三把锁/顶配能浮水 银河战舰700限时焕新价16.98万起

态度原创

旅游
艺术
本地
数码
公开课

旅游要闻

四川自贡中秋国庆“双节”接待游客136.64万人次 恐龙巡游登上热榜

艺术要闻

黄沙万里不见泪|仇英《明妃出塞图》:昭君从来不是悲情美人

本地新闻

踏访沙县第一村,寻国民小吃本源

数码要闻

华为鸿蒙星河互联与Apple Watch互联适配机型公布,首批含Pura X View、Mate 90系列等

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版