网易首页 > 网易号 > 正文 申请入驻

当AI画画得了"高分低能症",工程师们发明了一套自我纠错的把戏

0
分享至


你有没有想过这样一个问题:如果一个学生每次考试只能看到最终分数,却永远不知道哪道题错了、错在哪一步,他要怎么进步?

这听起来像个荒谬的教育场景,但它恰恰是当下用强化学习训练AI绘画模型时面临的真实困境。你给AI一个提示词,比如"一只在草地上奔跑的仓鸰雏鸟",它要经过几十步的"去噪"才能画出最终图像。而奖励模型,那个负责打分的裁判,只能在图片彻底画完之后才给出一个分数。中间那几十步到底该往哪个方向调整,没有人告诉AI。

这就是ByteDance Seed团队在这篇论文里要解决的核心问题。他们给这套方法起了个名字,叫DiffusionOPSD,翻译过来大概是"扩散模型的在线自我蒸馏"。听起来挺唬人,但拆开看逻辑其实很清楚,而且解决问题的方式相当巧妙。

先搞懂问题出在哪:分数只在终点给,过程全靠猜

扩散模型生成图像的过程,可以想象成从一团完全随机的噪声里一步步"雕刻"出图案,通常要走几十步。每一步,模型都会预测"如果现在就停下来,画面大概会是什么样子",这个预测叫作

清晰输出预测:模型在中间某一步对"最终图像会长什么样"做出的一个即时猜测,可以被解码看到,也可以被打分。

问题来了。奖励模型只会在图片彻底完成、被解码成真正的像素之后才给分。这就像老板只在项目验收那天给你反馈,你写代码的每一行、每一次修改,过程中完全是黑箱操作。你不知道第三步的那次调整是让最终结果变好了还是变差了,你只知道最后结果被打了多少分。

论文里提到几种现有的解决思路,各有各的取舍。FlowGRPO靠采样一堆轨迹,通过分组比较来估算每一步的"功劳",但这套机制依赖采样数量、似然估计的精度和离散化方式,稳定性打了折扣。ReFL则是直接把奖励模型的梯度反向传播到某一步的预测上,听起来更直接,但它只随机挑一个靠后的时间点做这件事,而且训练时既不执行后续步骤,也不真正解码出最终图片,这个反馈信号其实是"隔着一层"的。DiffusionNFT换了个思路,把生成出来的完整图片按奖励高低分组,用高分组的图片去监督模型,但问题是,一张完整图片本身并不是"你现在这一步该往哪个方向改"的明确指令,它只是一个终点参照物。

三种方法,三种妥协。DiffusionOPSD的野心是,能不能在每一步都给出一个明确、具体、可衡量的"改进目标",而不是把终点的分数硬塞给过程中的每一步。

这就好比,你想让一个学生把作文写好,直接给他一个满分范文让他模仿,和给他一句具体的修改建议"把第二段的比喻换成更贴切的",这两种反馈的效率完全不同。前者需要学生自己去猜哪里该改,后者是明确指向的。DiffusionOPSD选择的是后一条路。

核心设计:冻住一个"老师",让它给出方向明确的正负样本

DiffusionOPSD的运作方式可以拆成三步走。

第一步,冻住一个策略模型作为"行为策略",让它去跑一批完整的生成轨迹。这里出现一个关键概念:

行为策略:在训练的某一轮次里被临时冻结、不再更新参数的模型版本,专门用来生成轨迹、提供中间状态和参考预测,确保训练数据是"在当前策略水平上"采集的,而不是过时的数据。

之所以要冻住它,是因为如果一边采数据一边更新参数,数据分布和模型能力会不断错位,训练会变得不稳定。这就像你要给一个正在变化的靶子打分,靶子如果一直在动,你打的分数根本没法用来指导下一次射击。冻住它,是为了让这一轮的"考试"有一个固定的参照系。

从这批轨迹里,系统会挑选一个噪声水平比较低的中间状态作为"查询点",在这个点上,模型给出一个清晰输出预测,这个预测被称为"锚点"。锚点就是"如果现在就停下,画面大概是这样"的那个基准猜测。

第二步是整篇论文最核心的部分:围绕这个锚点,用奖励模型的梯度信息,构造出一个"正目标"和一个"负目标"。

具体做法是这样的。系统会计算奖励函数在锚点处的梯度方向,也就是"往哪个方向调整能让分数提高最多",然后沿着这个方向走几小步,得到一个分数更高的预测,这就是正目标。同时,沿着梯度的反方向走,得到一个分数更低的预测,这就是负目标。整个移动过程被限制在一个半径范围内,不能走得太远,这个限制被称为

信任域:限定目标构造时允许偏离原始预测的最大距离,防止一步走得太远导致预测偏离实际可行的图像空间,类似于给学生的修改建议设定一个"改动幅度上限",避免他把整篇文章推翻重写。

如果没有这个信任域约束会发生什么?梯度方向在局部是可靠的,但走得太远之后,原来的一阶近似就完全失效了,构造出的"正目标"可能已经不是一张合理的图片,而是某种奇怪的噪声组合,奖励模型给出的高分可能只是钻了某个漏洞。信任域的存在,保证了每一步的移动都还处在"局部线性近似仍然靠得住"的安全区间里。

这里可以打一个类比。想象你在调整咖啡的甜度,你尝了一口,觉得需要更甜一点,于是往里加了半勺糖。如果直接往里倒半斤糖(相当于没有信任域约束),那杯咖啡肯定是废了,你根本不知道半斤糖之后味道会变成什么样子,你的"往更甜方向走"的直觉判断只在小范围内有效。信任域就是那个"每次只加半勺"的克制,它让每一步调整都建立在你上一步的判断还站得住脚的范围内。

第三步,可训练的模型去"拟合"这两个目标,也就是让模型的预测尽量靠近正目标,同时远离负目标。这个拟合过程中有一个重要的技术处理,叫

停止梯度:在计算损失函数时,人为切断某些变量到参数的梯度回传路径,使得这些变量被当作固定的常数看待,而不参与反向传播的优化过程。

为什么要停止梯度?因为查询点、锚点、正负目标,这些东西都是"这一轮训练开始之前就已经确定好的教材",模型只需要专心去学这份教材,不需要在学习的过程中反过来去改教材本身。如果不做这个切断,梯度会一路传回到"教材是怎么生成的"这个环节,整个训练目标就会变得混乱不清,你甚至说不清模型到底是在学什么。

这三步做完之后,行为策略会用指数滑动平均的方式被更新一次,然后开始下一轮的轨迹采集、目标构造和拟合。整个过程像一个循环的教学相长机制,老师(行为策略)定期升级,新老师会带来新的、更贴近当前学生水平的教材。

为什么叫"自我蒸馏":没有外部老师,自己就是自己的老师

论文标题里"自我蒸馏"这个词值得多说几句。

传统的知识蒸馏,通常是一个训练好的大模型(老师)去教一个小模型(学生),老师的知识是固定的、外部提供的。但DiffusionOPSD里没有一个外部的、更强的老师,它用的是同一个模型在被冻结的那一刻的自己,加上奖励模型给出的方向修正,拼出一份临时的教材,再让处于训练中的自己去学习这份教材。

这就好比一个人练习写作,他先把昨天写的稿子拿出来(冻结的自己),请一位编辑标出哪些地方需要往好的方向改、哪些地方是要避开的坑(奖励梯度构造正负目标),然后今天的自己去按照这份修改笔记来写(拟合目标),写完之后,把今天的新稿子作为明天的参照(行为策略更新)。这个循环里,没有一个绝对权威的外部老师,每一轮的"老师"都是上一轮的"学生"升级而来的。

这种设计带来一个额外的好处:目标构造和参数拟合是完全分离、可以单独测量的两个环节。

论文里专门做了实验来验证这件事,而且实验结果相当反直觉。

一个让人意外的发现:构造出来的目标更好,不代表训练后的效果更好

这是整篇论文里我觉得最有意思的一部分。

按照直觉,如果你给模型构造了一个"更好"的学习目标,那么模型学完之后应该表现得更好才对。但实验数据显示,事情没有这么简单。

在HPSv2.1这个评估指标上,研究者做了一个对照实验:一组是用奖励梯度精心构造出来的正目标,构造阶段测得的分数提升是0.00245;另一组是用随机方向、但保持同样移动半径构造出来的目标,构造阶段测得的分数提升反而是负的,-0.03251,也就是说这个随机目标本身是"更差"的目标。

但是,当两组目标各自经过一次真实的参数更新(用一个全新初始化的AdamW优化器)之后,再去看实际效果,梯度目标组的分数变化是-0.000740,随机目标组反而是-0.000021。随机目标组的表现居然更好一点,尽管它出发点差了0.03496这么多。

而且这不是个别现象。研究者在512个不同的提示词上重复了这个实验,发现这种"构造时更差、拟合后反而更好"的反转情况,在HPSv2.1这个指标上发生的比例高达62.3%,置信区间是58.2%到66.6%。换到CLIPScore这个指标上,反转比例低一些,是29.5%,区间25.6%到33.4%。

这个结果说明什么?说明"构造出一个更好的目标"和"模型最终真的学到了这个改进"之间,并不是简单的因果传递关系。论文里给出了一个数学上的解释,他们把整个过程拆成一个精确的等式:实际实现的收益等于构造阶段的收益减去一个叫作"拟合缺口"的东西。这个拟合缺口可能是正的也可能是负的,它反映的是模型在真实优化过程中对这个目标的"消化能力",可能消化不完全,可能方向发生偏转,也可能矫枉过正。

这里可以做一个类比。假设你给两个健身教练分别设计了训练计划,教练A的计划理论上能让学员一个月增肌两公斤,教练B的计划理论上只能增肌零点五公斤。但实际执行下来,学员在教练A的计划下因为动作太难做错了姿势,反而没怎么增肌;教练B的计划虽然目标定得保守,但学员每一步都做到位了,实际增肌效果反而更接近计划值。计划(目标构造)和执行(参数拟合)是两件独立的事,一个环节的优劣不能替代对另一个环节的评估。这正是研究者反复强调的:必须把目标构造和模型拟合当成两件事分开衡量,不能只看构造出来的目标好不好看就下结论。

如果没有这个发现会怎样?研究者可能会一直在"如何构造更好的目标"这条路上死磕,却忽略了拟合这一步同样存在巨大的优化空间,甚至可能因为过度追求目标质量而忽视了拟合稳定性,最终训练出来的模型表现反而不如预期。这个发现让整个研究团队意识到,目标构造和参数拟合需要被当成两个独立的问题来对待和改进。

效果到底怎么样:数字说话

说了这么多设计理念,实际效果如何?论文在两个骨干模型上做了大量测试,一个是SD3.5-M,另一个是经过步数蒸馏加速的Z-Image-Turbo。

这里出现一个术语需要解释一下:

步数蒸馏:一种压缩生成步骤数量的技术,让原本需要几十步才能画出图像的模型,压缩到只需要几步甚至一步就能完成,极大提升生成速度,但通常会牺牲一些生成质量或者需要额外的训练技巧来弥补。

在总共20个"骨干模型加评估指标"的组合里,DiffusionOPSD拿到了其中19个的最好成绩,唯一输掉的一项是SD3.5-M上的美学评分,以12.08分对12.09分,输了0.01分,基本可以忽略。相比表现最强的竞争对手,DiffusionOPSD在某些指标上的提升幅度最高达到44.0%。

训练效率方面的数据也很扎实。相比DiffusionNFT这个直接竞品,DiffusionOPSD在SD3.5-M上节省了40%的GPU训练时长,在Z-Image-Turbo上更是节省了63%。具体到数字,SD3.5-M上每完成100次优化更新,DiffusionOPSD只需要28.2个GPU小时,而DiffusionNFT需要47.2个GPU小时;Z-Image-Turbo上,DiffusionOPSD需要149.8个GPU小时,DiffusionNFT则需要405.8个GPU小时,差距接近三倍。

更值得关注的是Z-Image-Turbo这个已经被步数压缩过的模型上的表现。论文提到,DiffusionNFT在这个骨干上,十项指标里有八项的表现居然比不训练的原始模型还差,比如HPSv3从原始的6.19掉到1.58,DeQA从4.44掉到3.37。这背后的原因,论文推测是因为步数蒸馏之后的模型,它的"过渡状态"已经和原始的多步模型不再是一一对应的关系,DiffusionNFT那种依赖完整轨迹终点做监督的方式,在这种被压缩过的模型上容易失效。而DiffusionOPSD因为它的目标是锚定在行为策略真实访问过的状态上构造出来的,对这种蒸馏后的模型反而更加友好。

这也从另一个角度说明了这个方法的一个隐藏优势:它不依赖于完整轨迹的终点反馈,而是在每一个被访问到的中间状态上都能给出局部的、可执行的指导,这种设计对生成步骤被压缩得很短的模型,天然更加稳健。

论文还做了一次人工评测,让具备理工科背景的标注员盲评DiffusionOPSD生成的图片和其他方法生成的图片,在100个测试提示词上,DiffusionOPSD对基础模型、FlowGRPO、DiffusionNFT、ReFL的胜率分别是64%、71%、90%、61%。即便是对上表现最强的对手ReFL,依然过了半数胜率的门槛。

下面这个表格摘录了论文里部分关键数据,方便直观感受差距:

| 评估维度 | SD3.5-M基础模型 | DiffusionNFT | ReFL | **DiffusionOPSD** |

| PickScore | 22.34 | 23.43 | 23.92 | **24.94** |

| HPSv2.1 | 0.279 | 0.336 | 0.358 | **0.390** |

| ImageReward | 0.85 | 1.46 | 1.28 | **1.76** |

| HPSv3 | 2.69 | 9.14 | 9.33 | **13.34** |

| 训练效率 | DiffusionNFT | **DiffusionOPSD** | 节省幅度 |

| SD3.5-M(GPU小时/100次更新) | 47.2 | **28.2** | 40% |

| Z-Image-Turbo(GPU小时/100次更新) | 405.8 | **149.8** | 63% |

拆开来看每个部件到底起了什么作用

论文做了非常细致的消融实验,一个一个部件地拆开来看到底哪个环节在真正起作用。

结果很清楚地表明,奖励梯度方向本身是最重要的因素。研究者用随机方向、无操作(什么都不改)、以及沿着"生成结果减去锚点"这个残差方向,分别替代原本的梯度方向做对比,CLIPScore从原来的0.3117分别掉到0.2311、0.2280、0.1456。残差方向那一项掉得最惨,分数几乎折半,论文提到这个变体在训练后期还会出现明显的崩溃现象。

相比之下,查询点是从真实轨迹上采样得到,还是用一个人工构造的"前向加噪"状态来代替,这个选择对结果的影响很小,只让分数从0.3117掉到0.3089,差距不到1.1%。这说明在低噪声区间,"具体是从哪条轨迹上取的这个中间状态"并不那么重要,重要的是"在这个状态上朝哪个方向去改"。

这就好比学开车,教练具体是站在车的左边还是右边指导你并不重要,重要的是他告诉你的那句"往左打半圈方向"是不是准确的。

另外一个值得记录的实验是关于分类器无关引导训练的。这里需要先解释一个概念:

分类器无关引导:一种在图像生成过程中同时使用"有条件预测"和"无条件预测"、按一定比例混合来增强生成效果的技术,常用一个叫"引导尺度"的参数来控制混合比例,数值越大,生成的图片越贴合提示词但也可能越不自然。

论文尝试了在训练阶段直接引入这种引导机制,发现效果并不理想。用引导尺度4.5或6来训练,模型最终在纯条件预测下的表现反而比不引导训练的模型下降了11%到15.5%,即便把训练和评估的引导尺度对齐,分数依然比不引导训练的基准低1.5%到2.3%。论文里用一套数学推导解释了这个现象的根源:当模型的两个分支(有条件和无条件)共享同一套参数时,损失函数只能约束这两个分支的某种特定组合,而无法约束它们各自内部那部分"隐藏"的差异,这部分差异在训练和评估用不同引导尺度的时候就会暴露出来,造成性能损失。这是个挺细节但很扎实的发现,说明想简单地把引导机制塞进在线训练流程里,没有想象中那么容易。

写在后面

读完这篇论文,最触动我的不是那些性能提升的百分比数字,而是那个"目标构造得更好不代表拟合后效果更好"的实验发现。这个结论其实在提醒我们一件更普遍的事:任何一个多步骤系统里,评估中间产出的质量和评估最终交付效果,永远是两件需要分开做的事,不能用其中一个替代另一个。

这让我想到软件工程里一个类似的老话题,代码审查时看起来逻辑最优雅的那个方案,未必在真实并发环境下跑得最稳。设计文档的精妙程度和最终系统的健壮程度之间,也隔着一层同样的"拟合缺口"。

还有一点值得琢磨,论文里那个"停止梯度"的处理方式,本质上是在人为制造一个信息隔断,让优化过程只能专心处理当下这一份教材,不去回头修改教材的生成逻辑。这种"故意制造隔断以换取训练稳定性"的思路,在很多需要交替优化的系统里似乎都适用,只是很少有人把这个取舍讲得这么清楚。

如果奖励模型本身存在偏差或者可被利用的漏洞,这套构造正负目标的机制会不会被无意中放大这种偏差?论文里限定的信任域半径能不能完全防住这种风险?这个问题论文没有细说,倒是值得继续追问下去。

Q&A

Q1:DiffusionOPSD是什么?

A:DiffusionOPSD是一种让AI绘画模型自我改进的训练方法,它让一个被临时冻结的模型版本生成图片轨迹并提供参考预测,再用奖励模型的梯度信息在中间步骤上构造出明确的"变好"和"变差"两个方向的目标,让正在训练的模型去学习靠近好目标、远离差目标,而不是像以前那样只能等图片完全生成后才拿到一个笼统的分数。

Q2:DiffusionOPSD相比其他方法效果好在哪里?

A:论文测试了两个不同的图像生成骨干模型,总共20种"模型加评估指标"的组合里,DiffusionOPSD在19种组合里拿到了最好成绩,某些指标上比第二名高出44%,而且训练所需的GPU时间比同类方法DiffusionNFT节省了40%到63%,人工评测里对多个竞品的胜率都超过六成。

Q3:为什么构造出更好的训练目标,模型学完效果反而未必更好?

A:论文的实验发现,目标构造阶段测出来分数更高的方案,经过一次真实的参数更新之后,实际效果反而可能不如构造阶段分数更低的方案,这种反转在某些评估指标上出现的比例超过六成。原因是模型真实优化过程中存在一个叫拟合缺口的东西,可能消化不完全、方向偏转或者矫枉过正,所以目标构造得好不好,和模型最终学没学到,需要分开单独衡量,不能只看其中一个环节就下结论。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
百亿资金灰飞烟灭!把公司108个美女当作后宫,丁宁到底有多狠?

百亿资金灰飞烟灭!把公司108个美女当作后宫,丁宁到底有多狠?

潋滟晴方DAY
2026-09-02 15:24:52
泰国政府官员即将赴北京学习,中国驻泰国使馆欢送

泰国政府官员即将赴北京学习,中国驻泰国使馆欢送

政知新媒体
2026-09-07 14:16:19
新月爆冷0-2升班马!47场不败终结 1.9亿三叉戟哑火 C罗争冠获利好

新月爆冷0-2升班马!47场不败终结 1.9亿三叉戟哑火 C罗争冠获利好

我爱英超
2026-09-08 05:52:49
蒋介石曾说:亡于日本,能为亡国奴;亡于共党,为奴亦不能

蒋介石曾说:亡于日本,能为亡国奴;亡于共党,为奴亦不能

兴趣知识
2026-09-07 18:34:09
大胜28分!大胜26分!2场世预赛,中国男篮或基本确认世界杯席位

大胜28分!大胜26分!2场世预赛,中国男篮或基本确认世界杯席位

林子说事
2026-09-08 09:32:51
中国不愧是游击战的祖宗,只用3年,就消灭了肆虐34年的猛虎组织

中国不愧是游击战的祖宗,只用3年,就消灭了肆虐34年的猛虎组织

蜉蝣说
2026-09-07 15:41:41
“没人告诉我这么吓人,下来腿都是软的”,紧急叫停!上海版“塞纳河畔”火出圈,但这些行为令人心惊……

“没人告诉我这么吓人,下来腿都是软的”,紧急叫停!上海版“塞纳河畔”火出圈,但这些行为令人心惊……

环球网资讯
2026-09-07 14:53:17
1965年林彪到粟裕家做客,拜别后粟裕高兴不已:总算走了!为何?

1965年林彪到粟裕家做客,拜别后粟裕高兴不已:总算走了!为何?

南书房
2026-09-08 10:15:14
电梯停了,人还在高处!80后中产债务崩塌,给所有人上了一课

电梯停了,人还在高处!80后中产债务崩塌,给所有人上了一课

流苏晚晴
2026-09-08 11:01:11
皮蛋被发现!研究发现:吃越多,或对动脉硬化患者的血管有大影响?

皮蛋被发现!研究发现:吃越多,或对动脉硬化患者的血管有大影响?

周哥一影视
2026-09-06 15:19:23
眼看“无力回天”,郑丽文主动交权离任?她的回应让大陆松了口气

眼看“无力回天”,郑丽文主动交权离任?她的回应让大陆松了口气

坠入二次元的海洋
2026-09-08 10:50:25
我国每年近千万人做肠镜!医生直言:做一次肠镜,或管十年无碍

我国每年近千万人做肠镜!医生直言:做一次肠镜,或管十年无碍

芹姐说生活
2026-08-26 23:55:43
去年休赛期为安抚字母哥签下!美记:雄鹿至今没能为特纳找到下家

去年休赛期为安抚字母哥签下!美记:雄鹿至今没能为特纳找到下家

北青网-北京青年报
2026-09-08 08:45:02
不要直接给顶薪!美媒:阿门汤普森的合同才是马刺续约卡斯尔的模板

不要直接给顶薪!美媒:阿门汤普森的合同才是马刺续约卡斯尔的模板

夜白侃球
2026-09-08 09:41:59
世界冠军夏煊泽,被免职

世界冠军夏煊泽,被免职

南方都市报
2026-09-08 11:21:40
东南亚的骗子都已经说了:普通人一辈子存款天花板是30万,电诈人员经过数据分析出来的。日本旅游签门槛是存款10万,招行金葵花门槛是50万

东南亚的骗子都已经说了:普通人一辈子存款天花板是30万,电诈人员经过数据分析出来的。日本旅游签门槛是存款10万,招行金葵花门槛是50万

纯洁的微笑
2026-09-02 12:19:46
继续狂飙,6万+了!新1元币大跌?附价格!

继续狂飙,6万+了!新1元币大跌?附价格!

天天币钞
2026-09-08 09:53:00
我在尼泊尔,见识到了当地的一妻多夫制,那里的女性毫无地位可言

我在尼泊尔,见识到了当地的一妻多夫制,那里的女性毫无地位可言

千秋文化
2026-07-11 19:25:54
57岁处级干部每天上午11点准时脱岗,全年无声无息

57岁处级干部每天上午11点准时脱岗,全年无声无息

一口娱乐
2026-09-08 08:13:25
八卦:一个月给五千就想包y我?!舞蹈区女主播开大哥专场:刷到总榜一,让我吃s都行!

八卦:一个月给五千就想包y我?!舞蹈区女主播开大哥专场:刷到总榜一,让我吃s都行!

乡野小珥
2026-09-08 12:12:29
2026-09-08 14:47:00
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
9772文章数 568关注度
往期回顾 全部

科技要闻

小米再次背水一战

头条要闻

牛弹琴:特朗普彻底玩嗨了 全世界都大开眼界啧啧称奇

头条要闻

牛弹琴:特朗普彻底玩嗨了 全世界都大开眼界啧啧称奇

体育要闻

韩旭:我一定会再次走出去

娱乐要闻

郭德纲乱改抗战歌曲被重罚!

财经要闻

全球黄金“回家”

汽车要闻

领克20 领克的纯电小钢炮这次更运动了

态度原创

教育
时尚
亲子
房产
旅游

教育要闻

4月4日出生、高考444分被殡葬专业录取的学生已入学!

白露食白——露从今夜白,味从此时鲜

亲子要闻

科普|中医:调好五脏,为孩子成长“蓄能”更重要

房产要闻

真快啊!海口这个超级城更,又有大动作!

旅游要闻

曲水亭秋晨:清泉垂柳,市井济南

无障碍浏览 进入关怀版