网易首页 > 网易号 > 正文 申请入驻

帝国理工陆永青院士团队提出MoE推测解码新范式,专家卸载吞吐达到2.06倍!

0
分享至

智猩猩AI整理

编辑:BugMaker

MoE 模型已经把每个 token 的计算压到了少数几个专家上,但到了推测解码,另一个问题冒了出来。

一次验证的不只是一个 token,而是一棵 draft tree。树上不同节点可能走向不同专家,最后真正进入输出的只是少数节点,整棵 draft tree 却可能把更多专家卷进这次验证,带来额外的专家计算和权重访问

8月4日,Imperial College London 联合 TileLang 背后的 AI Infra 团队 Tile-AI 提出AcceptMoE。英国皇家工程院院士、IEEE Fellow陆永青(Wayne Luk)参与其中,直接优化目标模型验证阶段的专家选择,让每轮验证自动决定哪些 MoE 专家值得参与。


它不要求用户提前指定固定的 expert budget,也不依赖额外的专家预测器。实验覆盖Qwen3-30B-A3B-Instruct-2507、Qwen3-Coder-30B-A3B-Instruct 和 GPT-OSS-120B

在 SGLang 中,全部专家权重位于 GPU 时,AcceptMoE 吞吐量达到 Standard SD 的1.290 倍。采用物理专家卸载后,吞吐达到 Standard SD 的2.06 倍,同时将 Host-to-Device 数据传输量降低73.6%—77.1%

代价并不大。12 个模型–任务组合上的平均准确率,仅比使用原生路由的 Standard SD低 0.27 个百分点

01

少验证一些token,为什么

专家还是搬了一大堆

推测解码(Speculative Decoding)通常先让 draft model 一次提出多个候选 token,再交给目标模型并行验证。

放到混合专家模型(Mixture-of-Experts,MoE)上,每个 token 虽然只会选择 top-k 专家,但不同 draft node 选择的专家并不相同

在原生路由下,一棵 draft tree 验证下来,真正需要访问的是所有节点所选专家的并集,也就是激活专家并集(activated-expert union)

问题也出在这里。

很多 draft branch 最后都会被丢掉,可它们对应的专家权重已经产生了计算和访存开销。

论文引用的结果很直观。在 Qwen3-30B-A3B 上,EVICT 相比 EAGLE-3 将验证 token 数减少74.7%,激活专家数量却只减少32.5%

少验证 token,并不意味着专家数量会同步减少。


已有的 verifier-side 方法 MoE-Spec 需要提前指定专家预算 B,并在每层固定保留排名最高的 B 个专家。,而且在汇总 Router 概率时,对 draft tree 中不同位置一视同仁。

但越深的节点,本来就越不容易真正进入最终输出。

AcceptMoE 要解决的,就是哪些专家值得留,以及到底应该留多少个

02

不再固定专家数量,

AcceptMoE自己决定留谁

AcceptMoE 首先引入commitment probability,即某个草稿节点最终真正进入被接受输出前缀的概率

这里不能简单理解成“token 接受率”。它表示某个 draft position 上的节点,最终真正进入 accepted output prefix 的概率

团队提前从训练集验证轨迹中估计这个概率,再用它给 target Router 的分数加权。

直观来看,越可能真正进入输出的节点,它需要的专家就越重要。那些位于深层、最后大概率被丢弃的节点,对专家选择的影响会被压低。

接着,AcceptMoE 会保留一个root anchor,也就是 draft tree 根节点原本选择的 top-k 专家。根节点一定会进入输出,因此这部分专家优先保留。

剩下留多少专家,不再手动给一个 B。

AcceptMoE 根据专家需求分布的有效秩(effective rank)自动确定集合大小。需求集中时少留一些,需求分散时多留一些。

在 12 个模型–任务组合中,最终自动选择的平均专家集合规模约为23—34 个


进入专家卸载场景后,问题又变了一层。

一个专家如果已经在 GPU 中,直接运行即可。没有驻留的专家,则需要从 CPU 内存加载。

AcceptMoE 因此加入Residency-Aware Pruning。它优先检查低需求的非驻留专家,在 rerouting budget 和最小集合规模允许的范围内继续裁剪。

不是预测下一步要加载谁,而是直接根据现在 GPU 里有什么,改变哪些专家还能被选择。

整个过程不需要额外 learned expert predictor,也不需要预设 expert budget。

03

全驻留1.29倍,专家卸载

直接做到2.06倍

实验统一采用 EAGLE-3 draft tree,设置5 个 draft steps、EAGLE top-k=10、64 个 draft tokens,测试 GSM8K、MATH500、HumanEval 和 MBPP。

全驻留实验运行在一张RTX PRO 6000 Blackwell上,batch size=1,并使用SGLang 0.5.12.post1

AcceptMoE 在全部 12 个模型–任务组合中都超过 Standard SD,平均吞吐提升到1.290 倍,单项范围为1.217—1.339 倍,最高达到257 tokens/s

更关键的是,AcceptMoE 和 Standard SD 的平均 accepted length 都约为4.39 个 token

这部分加速并不是因为一次接受了更多 token,而是因为每次验证实际涉及的专家更少。


到了真正需要搬运专家权重的场景,差距进一步拉开。

在一张RTX 5090上,每层配置 48 个 expert slots。Standard SD 有65%—78%的运行时间花在等待专家权重加载上,AcceptMoE 将这一比例降到27%—35%

最终,AcceptMoE 相比 Standard SD 的平均吞吐达到2.06 倍


背后的数据传输变化更明显。

AcceptMoE 将三种目标模型的 H2D 专家权重传输量分别降低73.6%、77.1% 和 76.0%,专家缓存命中率则提高10.8、12.6 和 14.2 个百分点

04

自动选专家,离最优固定

配置有多远

AcceptMoE 并不是简单地“少留几个专家”。

在相同 expert budget 下,使用 Commitment-Weighted Demand 的AcceptMoE-B 平均准确率达到 90.60%,MoE-Spec 为88.15%,前者高出2.45 个百分点

也就是说,即使专家数量完全相同,挑哪些专家仍然很重要

至于 Self-Sizing 能不能代替逐个任务调参,论文专门扫描了 5 个模型–任务组合。

AcceptMoE 自动选择出的点,与每个任务实测出的最佳固定预算相比,平均只低0.97 个百分点,最差差距为1.83 个百分点

在论文扫描的最小固定预算点,准确率相较各自最佳实测配置最多下降 92.1 个百分点。一个模型上合适的 B,换到另一个模型也未必合适。


Residency-Aware Pruning 单独开启后,又能将专家权重传输量降低38.6%—48.6%,缓存命中率提高6.9—8.2 个百分点,吞吐量提高4.6%—15.1%

对应的平均准确率变化只有−0.27 个百分点

AcceptMoE 的思路其实很明确。

MoE 推测解码不能只盯着“验证了多少 token”,还要继续追问一句,这些 token 到底把多少专家卷进了这次验证,又有多少专家真的值得从 CPU 搬进 GPU。

关注+星标,获取AI前沿进展与优质开源项目

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
印度宗教代表团参观埃菲尔铁塔要求女性“回避”,法国民间政界都坐不住了

印度宗教代表团参观埃菲尔铁塔要求女性“回避”,法国民间政界都坐不住了

澎湃新闻
2026-09-08 21:29:38
勇士队格林在火箭队阿门·汤普森2.08亿美元续约后力挺他:行情

勇士队格林在火箭队阿门·汤普森2.08亿美元续约后力挺他:行情

好火子
2026-09-10 04:38:01
陪睡陪玩只是开胃菜,舔手指塞拳头、集体嫖娼、背后的事藏不住了

陪睡陪玩只是开胃菜,舔手指塞拳头、集体嫖娼、背后的事藏不住了

北海史记
2026-08-12 19:57:54
谁也没想到,4岁孩子摸人事件出现意外变化,《狗的审判》给答案

谁也没想到,4岁孩子摸人事件出现意外变化,《狗的审判》给答案

萧狡科普解说
2026-09-09 10:36:21
功亏一篑!中国队1-3不敌伊朗队,主教练换人和指挥引球迷不满

功亏一篑!中国队1-3不敌伊朗队,主教练换人和指挥引球迷不满

罗掌柜体育
2026-09-09 18:17:53
还差21球!C罗979球里程碑夜,当选全场最佳,带队积分追平新月!

还差21球!C罗979球里程碑夜,当选全场最佳,带队积分追平新月!

海浪星体育
2026-09-10 09:13:03
为何超市月薪2000多元,却没人肯辞职?超市员工:“傻子”才辞职

为何超市月薪2000多元,却没人肯辞职?超市员工:“傻子”才辞职

猫叔东山再起
2026-09-08 10:00:04
2026年,养老金计发基数陆续公布,新退休人员都需要重算吗?

2026年,养老金计发基数陆续公布,新退休人员都需要重算吗?

碎月导师
2026-09-09 09:32:36
八十年代,巴西码头的一艘游艇之上,梅艳芳与初恋的留影

八十年代,巴西码头的一艘游艇之上,梅艳芳与初恋的留影

娱你同欢
2026-09-09 20:10:29
蒋介石晚年反复痛悔:一生中最错误的决定,就是抗战结束后没有及时把主力部队撤出东北

蒋介石晚年反复痛悔:一生中最错误的决定,就是抗战结束后没有及时把主力部队撤出东北

磊子讲史
2026-07-20 15:48:31
孙楠吃素7年瘦了22斤,一点肉都不吃,早餐坚持吃纳豆体脂率12.3%

孙楠吃素7年瘦了22斤,一点肉都不吃,早餐坚持吃纳豆体脂率12.3%

椰黄娱乐
2026-09-01 10:18:13
iPhone 18 Pro 与 iPhone 18 Pro Max 正式发布:A20 Pro 芯片、可变光圈主摄与史上最长续航

iPhone 18 Pro 与 iPhone 18 Pro Max 正式发布:A20 Pro 芯片、可变光圈主摄与史上最长续航

IT168
2026-09-10 08:46:57
从0到25%:被群嘲的印度造iPhone,悄悄干到了全球四分之一?

从0到25%:被群嘲的印度造iPhone,悄悄干到了全球四分之一?

科技专家
2026-09-06 15:23:01
一夜出局!陪王菲十几年的Ryan,终究不懂顶级圈层的潜规则

一夜出局!陪王菲十几年的Ryan,终究不懂顶级圈层的潜规则

阿废冷眼观察所
2026-09-04 06:51:18
历史性一幕即将出现?俄高层放出话来:普京计划在中国办件大事

历史性一幕即将出现?俄高层放出话来:普京计划在中国办件大事

凡知
2026-09-09 12:32:45
爸爸点外卖备注“孩子化疗煎饼一半不辣一半微辣”,谁料店主看到后,悄悄往里加了点东西…

爸爸点外卖备注“孩子化疗煎饼一半不辣一半微辣”,谁料店主看到后,悄悄往里加了点东西…

黎兜兜
2026-09-08 22:56:41
武汉江岸区55岁退休,17年工龄,拿到这个数,心里总算踏实了吗?

武汉江岸区55岁退休,17年工龄,拿到这个数,心里总算踏实了吗?

吃货的分享
2026-09-10 04:51:23
独居老人三个月买900包盐,店家觉异常报警,警方破门后愣了

独居老人三个月买900包盐,店家觉异常报警,警方破门后愣了

灿烂夏天
2025-06-26 11:44:15
陈震的“谨言慎行”:车圈顶流为何彻底避开小米汽车?

陈震的“谨言慎行”:车圈顶流为何彻底避开小米汽车?

侃故事的阿庆
2026-09-09 08:52:44
央视直播澳门冠军赛9月10日赛程,陈幸同对米特兰姆,周启豪战邱党

央视直播澳门冠军赛9月10日赛程,陈幸同对米特兰姆,周启豪战邱党

乒乓球球
2026-09-09 22:28:01
2026-09-10 09:43:00
智猩猩
智猩猩
AI 技术内容与服务平台
87文章数 4关注度
往期回顾 全部

科技要闻

一文看懂:iPhone折叠屏顶配2万6,10月才卖

头条要闻

iPhone18 Pro系列价格公布:A20 Pro芯片 续航大幅提升

头条要闻

iPhone18 Pro系列价格公布:A20 Pro芯片 续航大幅提升

体育要闻

16年后再破门,被皇马放弃的少年没认输

娱乐要闻

郭德纲被处罚2天,身边人传出好消息

财经要闻

银行新高!新一轮周期,刚开始!

汽车要闻

腾势Z9GT易三方闪充尊越型32.98万元上市

态度原创

家居
时尚
艺术
教育
军事航空

家居要闻

2026建博会(广州) 公装联探展交流活动

女人不管多大,都可以看看这些“条纹T恤”,非常减龄又简约

艺术要闻

禁止出境国宝!唐代孙位唯一存世真迹,宋徽宗亲笔题名

教育要闻

教师节不送礼、不讨好,看我用“打游戏的思维”跟老师搞好关系

军事要闻

中东“两线战火”同时升级

无障碍浏览 进入关怀版