网易首页 > 网易号 > 正文 申请入驻

AdaGen: 让图像生成模型学会自适应策略

0
分享至



当前主流的图像生成模型——扩散模型(如 DiT)、自回归模型(如 VAR)、掩码生成模型(如 MaskGIT)、流模型(如 SiT)——都遵循一个共同范式:将复杂的图像生成任务拆解为多个可控的子步骤,逐步迭代完成。然而,这种多步策略引入了一个不可忽视的问题:每一步都需配置大量超参数(如噪声水平、采样温度、引导尺度等),而现有方法普遍依赖手工设计的静态调度规则来管理这些参数。

这种做法存在两个重要缺陷:一是需要大量专家知识和反复调参,二是"一刀切"的静态策略无法适配每个样本的独特特性

本文提出AdaGen——一个通用的、可学习的、样本自适应的生成策略框架。通过强化学习训练一个轻量级策略网络,AdaGen 能根据当前生成状态自动为每个样本定制最优的生成策略,在四大主流生成范式上均实现了显著的性能提升与效率优化。

  • 论文标题:
  • AdaGen: Learning Adaptive Policy for Image Synthesis
  • 论文链接:
  • https://arxiv.org/abs/2603.06993
  • 论文代码:
  • https://github.com/LeapLabTHU/AdaGen

核心动机:从"静态一刀切"到"动态因材施教"



图:AdaGen的核心思想。现有方法使用预定义的静态策略,所有样本共享相同调度规则;AdaGen则通过RL训练的策略网络,为每个样本自适应地产生定制化的生成策略。

现有的多步生成模型在推理时,所有样本共享同一套预定义的调度规则。以 MaskGIT 为例,即使生成步数为 T = 16,也需要配置 64 个策略参数(每步 4 个参数),实际操作中极度依赖人工经验。更关键的是,一张简单的风景图和一张复杂的人物肖像,真的应该用完全相同的生成策略吗?

AdaGen 的核心思想非常直观:引入一个通过强化学习训练的策略网络(Policy Network),让它观察当前的生成状态,自动且自适应地为每个样本决定最优的生成参数。

统一 MDP 建模:一个框架统一四大生成范式







状态转移 (Transition):由预训练的生成模型决定。扩散模型和流模型的转移由 ODE 求解器确定,是确定性的;MaskGIT 和自回归模型的转移则是随机的





对抗奖励建模:不让策略"投机取巧"

训练策略网络的另一个核心挑战在于:如何设计有效的奖励信号?论文探索了三种方案,揭示了一个重要发现:



图:三种奖励设计的对比。(a) 用FID作奖励:FID虽低至2.56,但图像质量差,保真度不达标;(b) 用预训练奖励模型:保真度好了但样本多样性严重不足;(c) AdaGen的对抗奖励建模:保真度与多样性兼顾。

(a) 用 FID 作奖励:虽然 FID 数值可以被优化到很低(2.56),但生成图像的视觉质量反而很差。策略网络学会了"刷"指标的捷径,牺牲了视觉保真度。

(b) 用预训练奖励模型:保真度上去了,但生成样本趋于同质化,多样性严重不足。策略过拟合于奖励模型的偏好。

(c) 对抗奖励建模(AdaGen 的方案):引入一个判别器作为奖励模型,与策略网络进行对抗训练。策略网络试图最大化奖励,而判别器则不断提高区分真假图像的标准,有效防止策略过拟合。最终实现了保真度与多样性的良好平衡



图:AdaGen的训练流程。策略网络控制生成过程产生图像,对抗奖励模型同时评估生成结果并不断自我进化。预训练生成模型在整个过程中保持冻结。

训练算法简洁优雅,核心循环仅包含两步:(1) 策略网络优化:生成图像,用 PPO 算法更新策略网络使奖励最大化;(2) 奖励模型优化:同时采样真实和生成图像,训练判别器更好地区分两者。两者交替进行,形成类似 GAN 的博弈过程。

动作平滑:驯服高维动作空间的探索





图:优化过程。当生成步数从T=8增加到T=32时(黄色曲线),优化变得不稳定且性能下降。引入动作平滑后(红色曲线),训练恢复稳定且性能超越T=8基线。

论文发现,不稳定性的根源在于 PPO 探索时对每步独立添加高斯噪声,导致动作序列出现剧烈且不必要的高频波动。而对于逐步推进的迭代生成过程,最优策略往往是平滑变化的。为此,论文提出动作平滑技术——对策略输出施加指数移动平均(EMA)滤波:







图:动作平滑前后的对比。左侧未平滑时,动作序列剧烈抖动(FID=3.5);右侧引入平滑后,序列合理平稳(FID=2.3)。

上图直观对比了平滑前后的效果:从杂乱无章的锯齿波到平滑有序的下降曲线,FID 也从 3.5 降至 2.3。

实验结果:四大范式全面提升

跨范式有效性验证

AdaGen 在 ImageNet 256×256 上跨越四大生成范式、六个模型进行了验证。在所有范式和推理步数下,AdaGen 均一致超越对应的基线方法,且性能增益在推理步数较少时更为显著:



表:AdaGen 在 ImageNet 256×256 上的 FID-50K 结果(↓越低越好),覆盖四大生成范式。注:MaskGIT、DiT、SiT 在不同推理步数 T 下评测;VAR 采用固定的 10 步生成,因此仅在 T=10 列报告结果。

效率优势



图:AdaGen在四种模型上的质量-效率权衡。无论是理论计算量(TFLOPs)还是实际GPU/CPU推理时延,AdaGen均能推进质量-效率前沿,实现1.6×到3.6×的推理加速。

上图系统展示了 AdaGen 在四种生成模型上的质量-效率权衡。无论是理论计算量还是实际推理延迟,AdaGen 均一致推进了质量-效率前沿,实现1.6× 到 3.6×的推理加速。

极低的额外开销

AdaGen 的策略网络仅为生成器增加0.07% 到 0.40%的额外推理计算量,因此其性能提升并不以增大推理开销为代价:



表:AdaGen 策略网络的推理开销占生成器总计算量的比例。

结语

AdaGen 将生成策略的设计从"手工艺术"转变为"数据驱动的优化问题"。通过统一的 MDP 建模、对抗奖励设计和动作平滑技术,AdaGen 以一种轻量、通用的方式,在四大主流生成范式上实现了 17% 到 54% 的性能提升,或 1.6× 到 3.6× 的推理加速。这一工作表明,多步生成模型的潜力远未被充分挖掘——一个好的"调度策略",和模型架构本身同样重要。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
昆明小伙骑单车去北京上大学,行程3300公里,历时35天

昆明小伙骑单车去北京上大学,行程3300公里,历时35天

掌上春城
2026-09-04 21:32:29
江西一女生赴港看演唱会被取消全家低保?律师:若属实于法有据,但行政比例原则有讨论空间

江西一女生赴港看演唱会被取消全家低保?律师:若属实于法有据,但行政比例原则有讨论空间

封面新闻
2026-09-06 18:22:09
曝武大杰青在美国顶级实验室干这丢人事被开除,此前出轨被亲女儿实名举报

曝武大杰青在美国顶级实验室干这丢人事被开除,此前出轨被亲女儿实名举报

可达鸭面面观
2026-09-06 15:14:05
央企行贿7610万美金,总统只分到101.17万……

央企行贿7610万美金,总统只分到101.17万……

家传编辑部
2026-09-06 21:28:20
周三、四陪上司睡,周五上海睡丈夫,朱某真面目被老公揭开:下流

周三、四陪上司睡,周五上海睡丈夫,朱某真面目被老公揭开:下流

江山挥笔
2026-09-06 15:51:56
88分钟准绝杀!96分钟惨遭世界波读秒绝平!9.2亿豪门2-2无缘连胜

88分钟准绝杀!96分钟惨遭世界波读秒绝平!9.2亿豪门2-2无缘连胜

狍子歪解体坛
2026-09-06 23:03:23
我国成立重要机构,走出统一关键一步,没想到,解放军还有大动作

我国成立重要机构,走出统一关键一步,没想到,解放军还有大动作

共工之锚
2026-09-06 00:27:18
加拿大白人发文爆料:两周内在深圳第10次被女孩拦下合影,言语满是嘲讽

加拿大白人发文爆料:两周内在深圳第10次被女孩拦下合影,言语满是嘲讽

小徐讲八卦
2026-09-06 11:00:36
又一个有钱人死在了加州的路边,他是年薪百万的阿里总监,才42岁

又一个有钱人死在了加州的路边,他是年薪百万的阿里总监,才42岁

皮蛋儿电影
2026-09-06 16:09:30
他放弃中国籍改名归化日本,如今率队"三杀"国羽夺冠,已成心腹大患

他放弃中国籍改名归化日本,如今率队"三杀"国羽夺冠,已成心腹大患

体坛小二哥
2026-09-06 22:50:03
一位侵华日军自述:我曾在一间教室里,开膛肢解了12个女学生

一位侵华日军自述:我曾在一间教室里,开膛肢解了12个女学生

千秋文化
2026-09-06 20:38:03
核弹!继去年5000亿后再输血3570亿给银行保险,背后有多重原因!

核弹!继去年5000亿后再输血3570亿给银行保险,背后有多重原因!

樱桃大房子
2026-09-06 23:07:24
被王毅外长训了4小时,德不配位的欧盟外长,终于要被"打入冷宫"?

被王毅外长训了4小时,德不配位的欧盟外长,终于要被"打入冷宫"?

爱吃醋的猫咪
2026-09-06 21:45:32
多地严查赵一鸣、好想来……

多地严查赵一鸣、好想来……

中吴网
2026-09-06 09:46:34
周慧敏深夜悲痛发文:9月3日晚,女星周慧敏更新了社交账号

周慧敏深夜悲痛发文:9月3日晚,女星周慧敏更新了社交账号

东方不败然多多
2026-09-06 08:19:23
俄罗斯星链尴尬事:租星链,不给;偷星链,不让;发射星链,不入轨

俄罗斯星链尴尬事:租星链,不给;偷星链,不让;发射星链,不入轨

李未熟擒话2
2026-09-06 07:49:18
死在加州路边的阿里总监:42岁,年薪百万,却买不到一张回程机票

死在加州路边的阿里总监:42岁,年薪百万,却买不到一张回程机票

林子说事
2026-09-06 13:39:11
19岁天才双响!12.6亿卫冕冠军5-0砍瓜切菜 开局4连胜狂轰17球

19岁天才双响!12.6亿卫冕冠军5-0砍瓜切菜 开局4连胜狂轰17球

狍子歪解体坛
2026-09-07 00:18:16
5-2!西甲黑马开局4轮不败轰10球 力压皇马升次席 61岁申花弃帅封神

5-2!西甲黑马开局4轮不败轰10球 力压皇马升次席 61岁申花弃帅封神

我爱英超
2026-09-07 03:12:05
A股:天雷滚滚,利空落地,证监会、上交所、深交所出手,2家立案

A股:天雷滚滚,利空落地,证监会、上交所、深交所出手,2家立案

慧眼看世界哈哈
2026-09-06 18:31:05
2026-09-07 05:15:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13933文章数 142729关注度
往期回顾 全部

科技要闻

DeepSeek被曝将采购16万颗华为昇腾950DT

头条要闻

中尼两国遇难失联人数为何相差如此大 专家解读

头条要闻

中尼两国遇难失联人数为何相差如此大 专家解读

体育要闻

3.9秒绝平!杨舒予18+5成女篮救世主

娱乐要闻

杨紫获白玉兰影后!爸爸:累了就回家

财经要闻

亏损高达200亿,昔日彩电霸主走下巅峰!

汽车要闻

带升降立标MPV 岚图梦想家9预售价42.99万起

态度原创

房产
本地
游戏
数码
公开课

房产要闻

突发重磅!海口出台楼市新政!

本地新闻

扒完小作文,富豪们私藏的度假胜地有多绝

一台PS5的结局:败给家人拔电源 暑假工心血付诸东流

数码要闻

科沃斯IFA放大招!家用机器人矩阵刷屏欧洲

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版