网易首页 > 网易号 > 正文 申请入驻

ICML 2026 | 我们让蒸馏模型当了采样器,Diffusion RL采样成本降低一个数量级

0
分享至




扩散模型已经成为图像和视频生成的重要底座,但当研究者希望用在线强化学习进一步优化审美质量、文本一致性和视频综合表现时,训练成本很快成为瓶颈:每次 policy rollout 往往要完成大量去噪步骤,在线采样占据了大量训练时间。

过去的 Diffusion RL 多聚焦于奖励设计与优化算法,训练时的采样成本被忽视。DMSampler 指出:在在线 RL 中,限制规模化的不只是奖励信号或优化器,很多时候是 rollout 本身太贵。

最直接的想法是减少采样步数,例如从 50 步降至 10 步,但这会导致样本质量下降。一旦奖励模型基于劣化样本进行评估,策略更新便可能偏离高质量分布。



图 1:传统 Diffusion RL 框架(左)与 DMSampler(右)的概念对比。传统方法每次 RL 更新依赖约 50 步采样;DMSampler 引入共同演化的少步蒸馏采样器,图中给出了 VBench 训练耗时从 900 小时降至 288 小时的对比。

让蒸馏模型跟着 policy 一起进化

DMSampler 的核心判断是:蒸馏模型不应仅是训练结束后的推理加速工具,更可作为低成本采样器,深度参与 Diffusion RL 的每一轮策略更新。



  • 论文标题:Distillation Models are Good Samplers for Diffusion Reinforcement Learning
  • 论文地址:https://openreview.net/pdf?id=VkMWujvv2c
  • 项目地址:https://github.com/HiDream-ai/DMSampler

具体来说,该框架维护一个与 policy model 共同演化的 few-step distilled sampler。此采样器仅需 4 至 8 步(图像任务 7 步,视频任务 16 步),并通过周期性重蒸馏来追随更新后的策略。



图 2:DMSampler 整体框架

整个框架由两个阶段交替组成。

RL 阶段:蒸馏采样器参数冻结,用混合蒸馏采样快速生成样本;样本经 reward model 打分后,用于更新 policy model。实验以 DiffusionNFT 为底层优化器,但 DMSampler 的改动在采样环节。

蒸馏阶段:更新后的 policy model 充当 teacher,对 distilled sampler 进行重蒸馏,使其重新贴近当前 policy 分布。其中,轨迹分布匹配(TDM)保证基础对齐,而奖励感知蒸馏则确保高奖励轨迹的能力得以保留。

两阶段循环推进后,policy 通过 RL 获得更好的生成能力,sampler 通过蒸馏同步追上新的 policy 分布,下一轮 RL 又能以更低的采样成本继续训练。

蒸馏:从后处理变为 RL 训练的一环

传统流程中,蒸馏往往发生在训练之后。DMSampler 改变了这个顺序,让蒸馏从「后处理」变成训练闭环的一部分。

在此框架中,RL 阶段借助蒸馏模型降低 rollout 成本,蒸馏阶段又利用 RL 优化后的 policy 提升蒸馏模型本身。两者不再是先后关系,而是共同演化关系。

混合采样:保住结构,提速后半程

在采样策略上,DMSampler 并未把整个去噪链路都交给蒸馏模型。扩散采样的前半程更决定结构、语义布局和主体内容,后半程更多影响纹理与细节。因此,让 policy model 先完成早期去噪,再由蒸馏模型接手后期步骤,可以在保持分布对齐的同时减少计算。



图 3:四种采样策略对比

论文比较了四种策略:S1 使用原 policy model 完成完整采样并启用 CFG,质量强但成本高;S2 全程使用少步蒸馏模型,速度最快但分布漂移明显;S3 先由 policy model 完成早期去噪,再切换到蒸馏模型处理后期步骤,是最终采用的方案;S4 则反过来先用蒸馏模型,早期偏差会影响后续结构,policy model 难以完全修正。

结果显示,S3 在图像任务中将步数从 40 步减至 7 步,视频任务从 50 步减至 16 步,同时保持了较高的 OCR 表现。

奖励感知蒸馏

只让蒸馏模型追上 policy 的平均分布还不够,Diffusion RL 真正要保留的是高 reward 样本背后的能力。

DMSampler 在 RL 阶段记录生成样本、初始噪声和对应 reward;进入蒸馏阶段后,框架从中筛选高 reward 轨迹。若无样本超过阈值,则至少保留 reward 最高的一条。随后,reward-weighted trajectory loss 会让蒸馏模型更重视这些轨迹,权重随 reward 单调增加。

消融实验显示,去掉奖励感知蒸馏后,图像 OCR 从 0.97 降到 0.96,视频 OCR 从 0.50 降到 0.48。提升幅度有限,但说明高 reward 轨迹有助于稳定迭代。

少步采样带来加速,性能基本不掉

在文本渲染任务上,DMSampler 将图像采样从 40 步降到 7 步、视频采样从 50 步降到 16 步,性能基本保持。与直接减少采样步数(DRS)相比,优势显著:DRS1 将步数减半并保留 CFG;DRS2 在此基础上关闭 CFG;DRS3 进一步降到 10 步。视频任务对样本质量更敏感,DRS3 的视频 OCR 回到基线水平,而 DMSampler 在 7 步图像采样和 16 步视频采样下仍保持接近完整采样的表现。



表 1:DMSampler 与直接减步策略的对比。DMSampler⁻ 为去掉 Reward-aware Distillation 的消融版本。



图 4:不同加速策略生成的视频效果对比。DRS 导致明显质量退化,DMSampler 保持高质量。

GenEval 综合评测:从 0.63 提升到 0.96

在 GenEval 基准测试上,DMSampler 取得 Overall 0.96,超过 FlowGRPO 和 DiffusionNFT 的 0.95;相比 Base(SD3.5-M)的 0.63,提升更为明显。作为参照,GPT-4o 为 0.84,Qwen-Image 为 0.91。训练效率方面,论文报告 DMSampler 需要 360 GPU hours,低于 FlowGRPO 的 2000 GPU hours 和 DiffusionNFT 的 480 GPU hours。



表 2:GenEval 基准测试结果。

1.3B 模型超过 14B,训练时间降至约三分之一

在 VBench 视频评测上,DMSampler 将 Wan2.1-1.3B 的总分从 81.23 提升到 85.00,超过 Wan2.1-14B(83.69)及 CausVid(83.88)、HunyuanVideo(83.43)。相比 DiffusionNFT,DMSampler 将训练时间从约 900 小时降至约 288 小时,总分从 84.74 提升至 85.00。



表 3:VBench 基准测试结果(完整 16 个评测维度,分两组展示)。



续表 3:其余 8 个评测维度



图 5:VBench 生成视频效果对比。

不绑定优化器,可作为通用采样模块

DMSampler 不依赖某一个 RL 优化器。研究者将其分别接入 FlowGRPO 和 DGPO,并在 GenEval 上验证:FlowGRPO 的训练成本从超过 1000 GPU hours 降到 400 GPU hours,GenEval 分数从 0.95 提升到 0.96;DGPO 的训练成本从 240 GPU hours 降到 192 GPU hours,GenEval 分数保持 0.97。



表 4:DMSampler 接入不同 RL 优化器的效果。

这表明,DMSampler 更像是一个面向在线 Diffusion RL 的采样加速模块。它不改变优化器本身的目标函数,而是降低 rollout 成本,因此可以与不同 RL 方法组合使用。

副产品:蒸馏模型同步增强

DMSampler 的主要目标是训练更强的 policy model,但共同演化的蒸馏采样器本身也获得了性能提升。在 VBench 上,该蒸馏模型取得 84.21 的总分和 85.60 的 Quality 分数,超过 CausVid(82.88)、Self Forcing(83.80)和 BLADE(83.38)等蒸馏方法。



表 5:DMSampler 蒸馏模型与其他蒸馏方法的对比。

传统蒸馏侧重推理加速,而 DMSampler 的蒸馏采样器会在训练过程中不断吸收 RL 优化后的高 reward 能力。因此,它不仅是加速器,也成为经过 reward 对齐的少步生成器。



图 6:DMSampler 蒸馏模型的生成示例。

从训练加速到协同进化

整体来看,DMSampler 首次将可训练、共同演化的蒸馏模型作为 Diffusion RL 的采样引擎。通过双阶段交替训练、混合蒸馏采样和奖励感知蒸馏,将 rollout 采样成本降到更适合在线训练的范围。

其意义不仅在于加速,更在于重新审视了采样成本这一瓶颈,并将蒸馏从后处理前移,使之与 RL 后训练在同一闭环中相互增益。实验中,DMSampler 在 GenEval 上取得 0.96,在 VBench 上取得 85.00,均达到当前最优水平。训练效率上,GenEval 任务从 DiffusionNFT 的 480 GPU hours 降到 360 GPU hours,VBench 任务从约 900 小时降到约 288 小时。它不绑定特定 RL 优化器,也可以与 FlowGRPO、DGPO 等方法组合使用。

对后续研究来说,DMSampler 的协同进化思路可以迁移到其他需要大量 rollout 的生成模型 RL 场景,也为扩散模型蒸馏与强化学习的结合提供了新的技术参考。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
秒杀孙宇晨小作文:深圳富豪“仅退款”,还把小三送进去14年

秒杀孙宇晨小作文:深圳富豪“仅退款”,还把小三送进去14年

吃瓜体
2026-09-06 11:33:54
一媒体人曝出雷人言论:一定要学好英语,国内能讲好英语的人,不会是穷人

一媒体人曝出雷人言论:一定要学好英语,国内能讲好英语的人,不会是穷人

小徐讲八卦
2026-09-06 13:18:58
“温宜公主”纪姿含北电落榜,就读中戏国际部,本人回应:考试结束后陷入了自我否定和自责,曾考虑过复读,中戏也是我一直以来梦想的学校

“温宜公主”纪姿含北电落榜,就读中戏国际部,本人回应:考试结束后陷入了自我否定和自责,曾考虑过复读,中戏也是我一直以来梦想的学校

极目新闻
2026-09-06 19:54:03
抵制英语的舆论狂欢,正在批量养出傲慢又无知的当代井底之蛙

抵制英语的舆论狂欢,正在批量养出傲慢又无知的当代井底之蛙

浪子的烟火人间
2026-09-05 23:01:23
绍兴葫芦娃全剧终!大爷连夜收走葫芦娃,网友:他这一举动,可能给周边的商户,每天带来数以万计的连锁损失

绍兴葫芦娃全剧终!大爷连夜收走葫芦娃,网友:他这一举动,可能给周边的商户,每天带来数以万计的连锁损失

火山詩话
2026-09-06 09:56:58
贵州3名未成年女孩相继离家,最小仅12岁!手机最后定位在江苏,最长已有一个月未归,家属心急如焚

贵州3名未成年女孩相继离家,最小仅12岁!手机最后定位在江苏,最长已有一个月未归,家属心急如焚

扬子晚报
2026-09-06 21:31:33
中国女篮:杨舒予18分加时险胜,韩旭22+14,队长被弃用

中国女篮:杨舒予18分加时险胜,韩旭22+14,队长被弃用

体娱荒原
2026-09-06 22:32:53
百万吃播网红“莹莹”去世,仅24岁,知情人曝原因,长期大油大盐

百万吃播网红“莹莹”去世,仅24岁,知情人曝原因,长期大油大盐

裕丰娱间说
2026-09-06 18:18:40
日本高中老师下海做女优,爸妈至今被蒙在鼓里!亲曝下海契机:男学生看到没办法专心

日本高中老师下海做女优,爸妈至今被蒙在鼓里!亲曝下海契机:男学生看到没办法专心

日本物语
2026-09-06 20:42:53
91号赛车燃爆!所在车队宣布永久退赛:组委会救援严重失职 提3要求

91号赛车燃爆!所在车队宣布永久退赛:组委会救援严重失职 提3要求

风过乡
2026-09-06 14:00:44
网民“峰哥”大肆招揽外籍人员来华搞“转运做法”,天津边检出手

网民“峰哥”大肆招揽外籍人员来华搞“转运做法”,天津边检出手

观察者网
2026-09-06 20:05:49
又一个有钱人死在了加州的路边,他是年薪百万的阿里总监,才42岁

又一个有钱人死在了加州的路边,他是年薪百万的阿里总监,才42岁

皮蛋儿电影
2026-09-06 16:09:30
你无意间撞见过啥大秘密?网友:我也撞见过我闺蜜妈妈的那啥

你无意间撞见过啥大秘密?网友:我也撞见过我闺蜜妈妈的那啥

解读热点事件
2026-09-05 00:15:12
亲华派彻底掌权,成功进入外国高层,对中国做过3好事,机会来了

亲华派彻底掌权,成功进入外国高层,对中国做过3好事,机会来了

山月明史
2026-09-06 21:15:33
江西女孩执意去香港看演唱会,全家低保被取消,家人哭诉没了经济来源生活无望

江西女孩执意去香港看演唱会,全家低保被取消,家人哭诉没了经济来源生活无望

Mr王的饭后茶
2026-09-06 14:25:17
加拿大白人发文爆料:两周内在深圳第10次被女孩拦下合影,言语满是嘲讽

加拿大白人发文爆料:两周内在深圳第10次被女孩拦下合影,言语满是嘲讽

小徐讲八卦
2026-09-06 11:00:36
曝武大杰青在美国顶级实验室干这丢人事被开除,此前出轨被亲女儿实名举报

曝武大杰青在美国顶级实验室干这丢人事被开除,此前出轨被亲女儿实名举报

可达鸭面面观
2026-09-06 15:14:05
多地严查赵一鸣、好想来……

多地严查赵一鸣、好想来……

中吴网
2026-09-06 09:46:34
忍无可忍!佛罗伦萨官宣48岁格罗索下课:建队100周年3连败输1-9

忍无可忍!佛罗伦萨官宣48岁格罗索下课:建队100周年3连败输1-9

风过乡
2026-09-07 06:39:56
10-6!世界亚军逆袭塞尔比夺英国公开赛首冠,杰克琼斯刷新纪录

10-6!世界亚军逆袭塞尔比夺英国公开赛首冠,杰克琼斯刷新纪录

世界体坛观察家
2026-09-07 06:00:13
2026-09-07 08:39:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13933文章数 142729关注度
往期回顾 全部

科技要闻

DeepSeek被曝将采购16万颗华为昇腾950DT

头条要闻

媒体:中美战区司令会晤释放的信号 台湾要听懂

头条要闻

媒体:中美战区司令会晤释放的信号 台湾要听懂

体育要闻

3.9秒绝平!杨舒予18+5成女篮救世主

娱乐要闻

杨紫获白玉兰影后!爸爸:累了就回家

财经要闻

8家中央金融企业获增资 释放什么信号?

汽车要闻

带升降立标MPV 岚图梦想家9预售价42.99万起

态度原创

房产
手机
数码
健康
军事航空

房产要闻

突发重磅!海口出台楼市新政!

手机要闻

Tim Cook或十几年来首度缺席苹果秋季发布会

数码要闻

利民推出TROFEO VISION 360 ARGB WHITE水冷散热器,售729元

脑梗取栓成功≠活下来,还有这三关

军事要闻

美伊互袭油轮 伊朗军方称或对美进行更大规模打击

无障碍浏览 进入关怀版