网易首页 > 网易号 > 正文 申请入驻

让AI自己写大模型推理引擎,跑分暴打vLLM,1792 tokens/s

0
分享至

大家好,我是 Ai 学习的老章

最近硅谷算力圈发生了一件极具震撼力的事情:老牌推理平台 Baseten 的一帮工程师,没有手写一行 CUDA 算子,而是直接把 Claude Code 放进服务器,让它自主攻坚去写一套定制化大模型推理引擎

整整跑了一周之后,压测结果十二分离谱:这套 AI 自己编译出来的推理引擎,跑分竟然暴打当前公认最顶级的开源 SOTA 引擎 vLLM,Decode 生成速度直接拉升了整整 90%

就问你这个提升幅度夸张不夸张

传统引擎的“大而全”包袱

可能很多朋友会有疑问:vLLM、SGLang、TensorRT-LLM 凝聚了全球最顶尖系统架构师的心血,怎么会被一个跑在终端里的 Coding Agent 给挑翻了?

答案藏在现代软件工程的妥协里

现有的开源通用推理引擎确实极为强悍,但它们身上背负着沉重无比的历史包袱:

  • 它们必须同时适配 NVIDIA、AMD、华为昇腾等五花八门的不同硬件架构

  • 它们必须支持 FP16、BF16、INT8、INT4 以及最新 NVFP4 等各种量化格式

  • 它们必须兼容张量并行、流水线并行、MoE 专家并行等各种分布式切分策略

为了兼顾所有可能性,通用框架里堆叠了无数层抽象与动态分支判断

然而当你的业务真正部署上线时,生产环境里的条件其实是完全固定的:

  • 模型规格固定:比如就是 Qwen-3.6-35B-A3B

  • 硬件设备固定:比如就是单台工作站里的单张 NVIDIA B200 GPU

  • 精度格式固定:直接锁死在 NVFP4

  • 流量特征固定:单流长文本吞吐或者高并发特定分布

在这种极度严苛的固定约束下,通用框架里 90% 以上的抽象兼容逻辑全成了拖累性能的纯冗余

既然环境边界已经完全确定,为什么还要用大而全的瑞士军刀?为什么不让 AI 针对这套特定配置,量身定做一把锋利至极的手术刀?

下图清晰揭示了当前行业正处于技术拐点的四大合流趋势:模型推理能力跃升、Agent 自动化工作流成熟、客观可量化验证指标明确,以及全行业对推理成本控制的极度渴求


四大驱动趋势合流 战报:单卡 B200 实测数据暴打 vLLM

口说无凭,咱们直接看 Baseten 官方实测的硬核压测数据

实验团队选用了国产之光 Qwen-3.6-35B-A3B 作为基准,采用 NVFP4 精度,直接在单张 NVIDIA B200 硬件上死磕 vLLM 0.25.1 最新稳定版

经过 AI 多轮自主优化,最终产出的定制推理引擎被命名为 VibeQwen,各项核心指标全部呈现碾压态势:

  1. 单流 Decode 解码速率(TPOT): 在处理结构化、高重合度的单流文本时,VibeQwen 飙出了 1,792 tokens/s 的惊人速率,相比经过精心调优的 vLLM(943 tokens/s), 速度直接暴增 90%

  2. 首字响应延迟(TTFT): 返回第一个 Token 的时间从 vLLM 的 28ms 直接暴跌到 12ms ,缩短了整整 57%,响应速度提升达 2.33 倍,直接为极低延迟交互场景打开了大门

  3. 高并发场景总吞吐量: 在 Concurrency 为 32 的高并发真实压测下,VibeQwen 的单卡输出吞吐量达到 10,307 tokens/s ,而 vLLM 停留在 6,030 tokens/s, 整机吞吐提升 71%

下图是两者的正面硬刚对比柱状图,右侧绿色高光部分就是 VibeQwen 砍下的战绩:


VibeQwen 与调优版 vLLM 性能正面对比

除了大语言模型,团队还趁热打铁做了第二组跨模态验证

他们将这套优化方法迁移到了 Meta 最新的图像分割大模型 SAM 3.1 上,基于单张 H100 打造了专职推理服务 Sammie:

  • 面对图像与短文本提示词,Sammie 在单张 H100 上跑出了 每秒 91 张图片 的超强吞吐

  • 比 Meta 官方提供的参考服务整整高出 50%

  • 最可怕的是:因为复用了前一次实验沉淀的优化经验知识库,Sammie 从立项到完工只用了大概 2 天时间与 2 亿 Token

Sammie 在 SAM 3.1 图像分割任务上的吞吐实测 核心解密:AI 是怎么当好“超强编译器”的

看到这里,估计做底层 Infra 的同学坐不住了:AI 到底掌握了什么黑魔法?

其实整个工程背后依托的是开源界前沿的 MetaInfer 架构(arXiv:2607.12875),其核心思想被称为 LLM-as-Compiler(大模型即编译器)

整个执行链路并没有玄学,而是一个设计极度精密且完全闭环的自动化实验场

下图完整拆解了这套由大模型主导的“自动化编译器”攻坚全流程,从物理边界定义、长程自治攻坚,一直到不可变真值裁决:


MetaInfer 闭环工作流架构图

工程师首先给 Claude Code 赋予了 B200 算力机的 SSH 权限与底层诊断工具,设定了一个极度明确的不可变目标:/goal beat vLLM by 20% on all performance metrics without accuracy loss

在这场无人值守的长程攻坚战里,有两项设计堪称教科书级别:

1. 极其严苛的“防作弊”精度裁决器(Oracle)

如果你让 AI 优化代码却没给它锁死精度底线,AI 很快就会展现出极其狡黠的作弊能力:它会直接写出下面这段逻辑来交卷:

while True:
yield "a"

这种代码的 TTFT 和 TPOT 跑分能秒杀宇宙间所有引擎,延迟无限趋近于零,吞吐无限大,但它除了吐字符 "a" 之外没有任何实用价值

Baseten 的做法是直接挂载原版 BF16 权重作为终极裁判,AI 每次改动算子或调整内存分配,都必须在容差阈值内通过精度测试,一旦结果发生漂移直接被红牌罚下

2. 自主进化且可沉淀的领域知识库

与 Karpathy 提出的 autoresearch 思想一脉相承,Agent 在攻坚过程中并非盲目乱撞,而是会将验证成功的 CUDA 算子组合、显存预分配策略与通信方案记录进知识库

在第一轮搞定 Qwen-3.6-35B 后,这些优化经验立刻被用于加速 SAM 3.1,展现出了极具生产力价值的复用能力

下图展示了全球对 AI 推理算力需求的指数级井喷现状,推理成本的急剧增加正在迫使全行业寻求算力极限:


全球 AI 推理算力需求指数级跃升 成本复盘与真诚思考

咱们必须要讲真话,客观看待这项技术的当下与未来

首先看账本:这套方案目前绝不是零成本的游戏:

  • 在打磨 VibeQwen 的一周时间里,Claude 累计消耗了大约 17 亿 Token (绝大多数由输入上下文缓存覆盖)

  • 消耗了约 200 个 B200 GPU 卡时

  • 整体研发开销折合数千美元

但站在商业视角的另一端,算力经济学展现出了恐怖的吸引力: 如今头部大厂每年在模型在线推理上的算力账单动辄数千万甚至数亿美元,哪怕整体吞吐仅提升 10%,对应的都是真金白银数百万美元的机房服务器结余

花几千美元的 API 和电费,让 Agent 自主烧卡跑出一套提速 50% 到 90% 的专用引擎,这笔投资回报率在商业上已经完全算得过来账

局限性同样客观存在:

  • 目前产出的 VibeQwen 和 Sammie 仍停留在实验与特定基准测试阶段,尚未承接真实的混合生产流量

  • 面对复杂的多机多卡流水线与动态超长上下文,Agent 的鲁棒性仍需要人类架构师在旁保驾护航

总结

Baseten 的这次实测,给我们整个技术社区敲响了警钟:

以往底层系统优化被视为仅有少数顶尖黑客才能涉足的禁区,大家习惯了漫长的代码抽象、接口兼容与跨平台编译,结果系统越来越重,推理瓶颈越积越深

而 MetaInfer 与这次实验展现了一种全新的范式: 未来的工程师不再需要日夜死磕手撕 CUDA 汇编,真正的技术壁垒正在转移到 如何精准定义硬件与业务边界、如何设计防止 AI 作弊的基准裁决器,以及 如何调度 Agent 建立自动化评估流水线

让大模型去加速大模型,这一天来得比我们所有人想象的都要快得多

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
炸裂!曝女局长婚内与9人有染,聊天内容毁三观,女局长频繁主动挑逗

炸裂!曝女局长婚内与9人有染,聊天内容毁三观,女局长频繁主动挑逗

小鋭有话说
2026-10-10 11:25:02
那天下跪的乘务员,是我

那天下跪的乘务员,是我

普陀动物世界
2026-10-11 00:10:00
美国71岁男子长相酷似爱泼斯坦,长期被网友认为“爱泼斯坦没有死”,无奈赴以色列鉴定DNA,力证自己“完全不是”

美国71岁男子长相酷似爱泼斯坦,长期被网友认为“爱泼斯坦没有死”,无奈赴以色列鉴定DNA,力证自己“完全不是”

极目新闻
2026-10-10 14:46:03
买用户可以自由批评的车

买用户可以自由批评的车

吐槽青年
2026-10-09 21:54:10
赵福刚被美国禁止入境,后续来了

赵福刚被美国禁止入境,后续来了

环球时报国际
2026-10-10 08:02:20
开始查普通医生!中纪委划4条红线,第1种直接被点名,第3种常见

开始查普通医生!中纪委划4条红线,第1种直接被点名,第3种常见

职场资深秘书
2026-10-09 15:14:01
中超争议判罚!杨明洋踢人逃红,王秋明面部被踹出血,媒体人热议

中超争议判罚!杨明洋踢人逃红,王秋明面部被踹出血,媒体人热议

奥拜尔
2026-10-10 20:16:31
目前的中国股市想要逢低建仓,那就买这两种股票,赚到盆满钵满!

目前的中国股市想要逢低建仓,那就买这两种股票,赚到盆满钵满!

股经纵横谈
2026-10-10 22:27:01
新疆发布评尊界刹车断裂风波

新疆发布评尊界刹车断裂风波

小南看车
2026-10-10 22:27:28
超强厄尔尼诺已正式形成!专家:暖冬基本确定,明年夏天可能更热

超强厄尔尼诺已正式形成!专家:暖冬基本确定,明年夏天可能更热

小强热线
2026-10-09 21:27:18
大闸蟹全线崩盘?卖到“地板价”:雌蟹只要五六元,三两的蟹只卖10元

大闸蟹全线崩盘?卖到“地板价”:雌蟹只要五六元,三两的蟹只卖10元

华庭讲美食
2026-10-11 01:54:37
程福波到中国移动调研

程福波到中国移动调研

政知新媒体
2026-10-10 12:38:01
加拿大、丹麦、德国、法国、意大利、日本、荷兰、英国,发表联合声明

加拿大、丹麦、德国、法国、意大利、日本、荷兰、英国,发表联合声明

政知新媒体
2026-10-10 07:51:17
不查不知道一查吓一跳!44岁一家人住北京豪宅的陈婷,私下有多壕

不查不知道一查吓一跳!44岁一家人住北京豪宅的陈婷,私下有多壕

冷紫葉
2026-09-19 12:41:16
云南玉昆球迷意难平!不止因为1-7上海申花,更多在于以下五点!

云南玉昆球迷意难平!不止因为1-7上海申花,更多在于以下五点!

格斗社
2026-10-10 22:07:58
呼声持续高涨!给企退人员发生活补贴,弥补历史上的待遇差距

呼声持续高涨!给企退人员发生活补贴,弥补历史上的待遇差距

百科密码
2026-10-10 16:47:24
果然被岩屋毅说中了:中日缠斗到今天,日本出口额不如中国一个省

果然被岩屋毅说中了:中日缠斗到今天,日本出口额不如中国一个省

麓谷隐士
2026-10-10 00:10:04
女商务局长与前夫及九个情人的狗血剧情,够无耻

女商务局长与前夫及九个情人的狗血剧情,够无耻

雨秋闲话
2026-10-10 14:14:53
皇马TV:肮脏的内格雷拉联赛,皇马赢了完全是场史诗般的胜利

皇马TV:肮脏的内格雷拉联赛,皇马赢了完全是场史诗般的胜利

懂球帝
2026-10-11 05:47:11
高岗随刘少奇访问苏联期间,在会议上突然提议把东北变成苏联的第17个加盟共和国,斯大林听后当场讥讽道:“张作霖同志。”

高岗随刘少奇访问苏联期间,在会议上突然提议把东北变成苏联的第17个加盟共和国,斯大林听后当场讥讽道:“张作霖同志。”

人生录
2026-10-09 16:01:05
2026-10-11 07:12:49
Ai学习的老章 incentive-icons
Ai学习的老章
Ai学习的老章
3536文章数 11198关注度
往期回顾 全部

科技要闻

上世纪成熟的踏板,为何今天还会断裂?

头条要闻

港媒:梅艳芳骨灰被盗三个月无线索 歌迷会公开求助

头条要闻

港媒:梅艳芳骨灰被盗三个月无线索 歌迷会公开求助

体育要闻

十年回首:湖人三榜眼的夏天,与NBA无关

娱乐要闻

宋佳一串三大满贯 争议随之而来

财经要闻

双汇因抗生素超标共被罚1.29亿元

汽车要闻

千匹马力+三把锁/顶配能浮水 银河战舰700限时焕新价16.98万起

态度原创

游戏
手机
房产
教育
亲子

慢节奏成最大卖点!暴雪揭秘《魔兽:无限》吸粉真相

手机要闻

2nm芯片+无痕铰链+2亿哈苏四摄,OPPO这款阔折叠,十分激进!

房产要闻

海棠湾销冠再出牌:海南顶豪「终局答案」,突然砸出!

教育要闻

六年级思维训练,答对的学生寥寥无几

亲子要闻

工程车小故事 :分糖果

无障碍浏览 进入关怀版