网易首页 > 网易号 > 正文 申请入驻

AI画图模型不需要老师,自己教自己也能学得又快又好

0
分享至


你有没有想过,教一个学生最好的方式是什么?

大部分人第一反应是:找个好老师。老师懂得多,学生跟着学,照着做,慢慢就会了。这几乎是我们从小到大接受教育的默认模式,也是这几年AI画图模型训练里最流行的思路。

但阿里巴巴和清华、浙大的一群研究者最近做了一件挺反直觉的事:他们让AI模型完全甩掉老师,自己给自己当老师,结果学得比有老师的时候还好。这篇论文的名字叫Self-OPD,发在2026年8月的arXiv上。今天我们就聊聊,这背后到底是怎么回事。

**AI画图训练的老问题:老师不好请,请了也不一定教得好**

先说说这件事为什么难。

现在主流的AI图像生成模型,靠的是一种叫Flow Matching的技术。

Flow Matching:一种让AI从纯噪声图片逐步"演化"出清晰图像的技术,模型学的是一个连续的"速度场",负责把随机噪声一步步搬运成有意义的图片。

这类模型生成能力很强,但你光让它生成好看的图不够,你还想让它精确遵守你的指令。比如你要求图里必须有"三个披萨",它得刚好画三个,不能画两个或四个;你要求招牌上写"欢迎光临",它得把字写对,不能写成乱码;你还希望画面本身审美过关,不能又对又丑。

这就是所谓的"对齐"问题:让模型的输出符合人类真正想要的目标,而不只是看起来像张图。

要解决对齐问题,业界主要有两条路。

第一条路是强化学习,代表方法叫Flow-GRPO。这类方法把画图过程看成一步步做决策,画完整张图之后打一个分,再把这个分数往回传,告诉前面每一步"你当时做得好不好"。问题是,这个分数是等图画完了才给的,相当于老师只在期末考试后告诉你一个总分,却不说清楚是哪道题扣的分。这种反馈方式研究者管它叫"稀疏奖励",训练过程容易抖动,多个目标一起优化时还容易互相拖后腿。

第二条路就是本文开头说的"找老师",专业说法叫On-Policy Distillation,简称OPD。

On-Policy Distillation(在线策略蒸馏):让一个已经训练好的、擅长某个任务的"教师模型",在学生模型自己生成的轨迹上,每一步都告诉学生"这一步应该往哪个方向走",从而给出比终审打分更密集、更及时的指导。

这条路听起来更靠谱,毕竟老师手把手教,总比自己瞎摸索强。可现实中它有两个死结。

第一个死结是成本。你想让模型同时擅长排版文字、正确计数、构图美观,那你就得分别训练三个专门的老师模型,每个老师都要单独花大量算力去训练。这就好比你想让孩子门门功课都好,结果给他请了三个私教,语文一个,数学一个,美术一个,光是请老师的钱就先花掉一大笔。

第二个死结更麻烦,是老师和学生"三观不合"的问题。教师模型和学生模型本身是两个不同的模型,它们对同一个输入的理解方式、内部表示天然存在差异。学生硬去模仿老师某一步该往哪走,模仿的过程中误差会一点点累积,越往后越跑偏,论文里管这个叫"复合误差"。而且如果你想让模型同时听三个老师的话,三个老师给出的方向经常互相矛盾,你听这个老师的就得罪那个老师,场地级别的"融合"直接在参数空间打架,最后谁的意见都没完全听进去。

**如果不找老师,让学生自己探路会怎样**

Self-OPD团队的核心想法是:干脆不要老师了,让学生自己去试错,自己给自己打分,自己决定往哪走。

具体怎么做?我们一步步拆开看。

模型在生成图片的过程中,是从一堆随机噪声开始,一步一步往清晰图片"走"的,每一步都要预测下一步该往哪个方向挪。正常情况下这个方向是确定性的,叫ODE路径。

ODE(常微分方程):这里指模型按照固定、不带随机性的路径一步步从噪声走向清晰图片的过程,每一步的方向是唯一确定的。

而Self-OPD在每一步做了个小动作:它不满足于只按一条确定路径走,而是在这个确定方向的基础上,叠加一点随机扰动,分裂出K条不同的"备选路径",这个过程叫SDE分支。

SDE(随机微分方程):给原本确定的路径加上一点随机噪声,生成多条略微不同的候选路径,相当于让模型在原地"试探"几种不同的走法。

这K条备选路径每一条都会被继续走完,生成一张完整的图片,然后用任务对应的打分模型(比如OCR识别准不准、构图对不对)给每张图打分。同时,模型还会按原本那条"标准"的确定路径也走一遍,生成一张参照图,这张参照图的分数就是基准线。

这一步的设计,你可以把它想象成一个学生自己做练习题的场景。假设一个学生正在做一道几何证明题,他先按自己最有把握的思路写了一遍(这是标准路径),然后他多试了几种略微不同的辅助线画法(这是SDE分支),每种画法最后是否能推出正确结论,他自己都能验证(打分)。他不需要老师在旁边看着,因为几何题本身就能自我验证对错。如果没有这个自我验证机制,学生就只能死记硬背老师教的某一种画法,遇到变形题就懵了。

那些比标准路径打分更高的备选路径,叫"高优势分支";打分更低的,叫"低优势分支"。这个"优势"是怎么算出来的呢?就是拿每条备选路径的分数减去标准路径的分数,再除以所有备选分数的标准差,做一个归一化。这样得到的数值,论文里叫做优势值,正值代表这条路走得比标准路径好,负值代表走得更差。

有了这个优势值之后,Self-OPD就用一个"拉扯"式的目标函数去更新模型:那些优势值为正的高分路径,把模型的预测方向往它们那边拉;那些优势值为负的低分路径,把模型的预测方向从它们那边推开。这个机制论文起名叫"全分支拉推蒸馏"。

**为什么不能简单地"哪条路好就学哪条"**

这里有个容易被忽略但很关键的细节。很多类似方法喜欢用一种叫Best-of-K的策略:K条路径里选打分最高的那一条,直接照着学,其余的路径全部扔掉不要。

Best-of-K:从多个候选结果里只挑打分最高的那一个作为学习目标,其余全部丢弃的策略。

Self-OPD的作者做了对比实验,发现Best-of-K训练效果很差,曲线上上下下很不稳定,训练一千多步之后,表现也只是勉强超过没训练过的基础模型一点点。

为什么会这样?原因是每一轮训练"最好的那条路"可能都不一样,这一轮选中的方向,下一轮可能就不是最优了,模型跟着这种忽左忽右的目标疲于奔命,梯度信号剧烈波动,学习效果自然差。而且被丢弃的那些"次优路径"里其实也藏着有用的信息,比如"这个方向明显不行,以后要避开",Best-of-K把这部分信息全浪费了。

这就像你去问路,一群人告诉你八种走法,你只信其中说得最好听的那个人,完全不理会剩下七个人的意见,哪怕这七个人里有人明确告诉你"那条路封了,别走"。你只盯着一个信息源,反而更容易走错。而如果你把所有人的意见都综合起来考虑,哪些方向被反复提及是好的,哪些方向被反复提及是坏的,你做决策会更稳。Self-OPD用全部K条分支的信息,而不只是最好的那一条,训练曲线因此更平稳,最终效果也更好。

**推得太用力也会翻车:方向感知的刹车机制**

全分支拉推听起来挺好,但这里藏着一个陷阱。

如果一条低分路径恰好和最好的那条路径方向差不多接近,你还使劲把模型往反方向推,会发生什么?答案是:你连带着把好方向也推歪了。因为方向是连续的,不是孤立的点,硬推一个和好方向很接近的坏方向,好方向也会被误伤。

Self-OPD为此设计了一个叫"方向感知衰减系数"的东西,专业说法是direction-aware attenuation。这个系数会去衡量当前这条低分路径和"最好的那条路径"之间的夹角,如果两者方向几乎一致,这个系数就会自动调低,让排斥力变弱一些;如果两者方向截然相反,系数保持在最大值,该排斥就排斥。这个系数被严格限制在0到1之间,绝不会超过1去"过度放大"排斥力。

论文里专门做了一个消融实验来验证这一点。他们把这个系数的上限从1放宽到2,也就是允许排斥力变得更强,结果训练曲线一开始表现还不错,涨得比原方案还快,但到了训练第600步左右,突然发生了断崖式的崩溃,GenEval评分从接近0.85直接跌到0.768。而设了上限的版本则一路稳定爬升,最终收敛到接近0.95。

这个实验结果挺说明问题的。这就像你开车超车,如果刹车片(排斥力上限)设计得当,遇到情况能刹得住,车速虽然慢一点但安全;如果为了追求超车速度把刹车片换成加速踏板,前期确实冲得猛,可一旦遇到一个急转弯,车子直接失控翻了。如果没有这个上限约束,模型在训练中后期积累的强排斥力最终会反噬自己,把好不容易学到的东西全部推翻。

**多个目标一起优化,怎么避免它们互相拆台**

现在说说另一个更棘手的问题:如果你同时想让模型既擅长文字排版,又擅长正确计数,还得画面好看,怎么把这三个目标捏合到一起,而不是让它们互相打架?

之前提到的教师蒸馏方法一般是怎么处理的呢?它们训练三个专门的教师模型,一个专攻文字,一个专攻构图,一个专攻审美,然后把这三个教师的"意见"在模型参数层面加权融合。这种做法论文里叫"场级融合"。

场级融合最大的问题是,当两个目标的梯度方向不一致时(比如让文字更清晰的调整,恰好会让整体审美打折扣),融合结果就是各打五十大板,谁的目标都没完全达成。更极端的情况是,有些实现干脆是"看到哪类提示词就交给对应的老师去处理",结果就是模型只在被分配给它的那个任务上表现好,换一批提示词立刻现原形。

Self-OPD换了个思路,叫"奖励层融合"。它不在参数层面掺和,而是把每个打分模型给出的分数先做归一化(z-score处理),再按权重加总,变成一个综合分数,这个综合分数只用来给K条候选路径排名,决定哪条路径是"高优势"哪条是"低优势",它自己完全不参与反向传播,不直接参与梯度计算。

这个设计的巧妙之处在于,它把"多目标怎么融合"这个难题,从参数空间挪到了轨迹空间。什么意思呢?打个比方,场级融合就像几个裁判各自打分,然后把分数硬凑成一个平均分,评委之间意见分歧越大,这个平均分越没有意义,谁都不服气。而奖励层融合更像是,先让所有裁判各自打分,但只用来排出一个综合名次,最终选出的是那个在所有裁判眼里都排名靠前的选手,而不是强行拼凑出一个谁都不完全满意的"平均选手"。选出来的这一张图,是真真切切地同时让三个打分标准都满意,而不是三个标准各退一步凑合出来的结果。

论文里针对不同任务给三个打分模型分配了不同权重,比如文字排版任务上,OCR打分、PickScore(一种衡量图片是否符合人类审美偏好的评分模型)、HPSv2(另一种类似的人类偏好评分模型)的权重比是3比1比1,这样既突出了文字任务的重要性,又不至于完全牺牲审美。

**实验结果:一个不需要老师的学生,考试成绩反而更高**

说了这么多设计思路,数据才是硬道理。

在单一目标训练的场景下,Self-OPD和几种主流强化学习方法(Flow-GRPO、GRPO-Guard)进行了对比。结果显示,在GenEval构图任务上,Self-OPD拿到0.9536的严格评分,是所有方法里最高的;在OCR文字识别任务上,Self-OPD达到0.9745的准确率,同样是最高;在人类偏好评分PickScore和HPSv2上,Self-OPD训练出的版本分别拿到24.47和0.4099,也都是表格里的最优值。

更值得关注的是混合多目标训练的结果。这一次对比对象换成了真正需要教师模型的方法,Flow-OPD和DiffusionOPD。结果是,Self-OPD这个完全不需要教师、单独一次训练出来的模型,在GenEval严格评分上拿到0.9521,OCR准确率0.9691,双双超过两个教师蒸馏方法。而且更关键的是,在"同一批测试图片"上评估审美偏好时,Self-OPD的PickScore是23.87,HPSv2是0.3214,都超过DiffusionOPD的22.72和0.2676。

这个"同一批测试图片"的评估协议特别重要,值得多说两句。为什么不直接看单独的审美测试集分数就好了?因为论文发现了一个很扎心的现象:DiffusionOPD在专门的审美测试集上表现其实不差,甚至一度领先,但一旦把镜头切回到它自己生成的GenEval和OCR任务图片上重新打审美分,分数立刻跳水,PickScore从23.95跌到22.72,跌幅超过1.2分,HPSv2从0.3729跌到0.2676。这说明什么?说明它的"审美好"是靠在专门的审美提示词上生成漂亮图片堆出来的,而在真正需要它同时兼顾文字和构图的任务上,审美这部分能力根本没有真正融合进去。

反观Self-OPD,同一批图片,从审美测试集切到任务测试集,PickScore只波动了0.48分,HPSv2只波动了0.02分,几乎可以说是纹丝不动。这就是奖励层融合和场级融合最本质的区别:一个是真的把多个目标拧成一股绳,融进了同一张图里;一个是不同提示词各自去匹配不同的"专才",看着门门都优秀,其实每门课都是不同的学生在考。

|方法|GenEval严格|GenEval连续|OCR|同图PickScore|同图HPSv2|

|SD3.5-Medium基础模型|0.5222|0.6219|0.5833|22.66|0.2824|

|Flow-OPD(教师蒸馏)|0.8594|0.9203|0.9392|23.43|0.3042|

|DiffusionOPD(教师蒸馏)|0.9150|0.9479|0.9464|22.72|0.2676|

|DiffusionNFT(无教师)|0.8888|0.9277|0.9229|23.67|0.3206|

|**Self-OPD(无教师)**|**0.9521**|**0.9691**|**0.9597**|**23.87**|**0.3214**|

**省下的不只是钱,还有大把时间**

除了效果好,Self-OPD还有个很实在的优势:省时间。

论文对比了训练DiffusionOPD所需要的教师模型的时间成本。要凑齐GenEval、OCR、审美三个专门的教师模型,分别需要46.9小时、33.2小时、85.8小时,而且这几个教师是并行训练的,所以瓶颈时间取决于最慢的那个,也就是85.8小时。等三个老师都训练完了,学生才能开始跟着蒸馏,又花了11.3小时。加起来总共要97小时,而且在教师训练的85.8小时里,学生模型完全处于闲置状态,啥也学不到。

这就好比你要开一家餐厅,先得花大半年时间分别把三位大厨(川菜、粤菜、甜点)培养出来,这大半年里餐厅一天客人都招待不了,只能干等着。

Self-OPD直接从零开始训练一个融合三种奖励的模型,不需要等任何教师准备好,大约62小时就能达到DiffusionOPD在OCR上的最终水平,大约90小时达到它在GenEval上的最终水平,两个指标都比DiffusionOPD的97小时更快。如果再加一点小技巧,先并行训练三个单目标的"热身"模型(用时37小时),再启动融合训练,总共只需要大约48小时和44小时就能分别在两个指标上追平DiffusionOPD,速度快了接近两倍,而且最终效果还更好。

**写在后面**

读完这篇论文,我印象最深的一点是,它其实在质疑一个我们习以为常的假设:训练AI模型是不是一定需要一个"更强"的对象去教它?

我们做教育,做管理,甚至做很多决策的时候,默认逻辑都是"找个懂的人来带"。但Self-OPD提出的这套自我探索加自我验证的机制说明,如果你有办法让系统自己检验自己的输出好不好(在这里就是打分模型),那自我探索本身就能替代外部教师,而且探索出来的路径天然贴合自己的能力边界,不会有"老师说的我做不到"这种落差。

论文里那个方向感知衰减系数的设计我觉得特别值得琢磨。它本质上是在说,负反馈这件事,力道过了头是会伤及无辜的。这不只是训练AI模型的道理,你去批评一个人的时候,如果batch打击面太大,把跟他做得好的地方相近的东西也一起否定了,对方反而会连好的部分都不敢坚持了。这个"方向感知"的思路,某种程度上是给"负反馈该怎么给"提供了一个可以量化的模板。

还有一点让我意外的是,奖励层融合这个设计的效果差异,不是靠理论推导出来的优越性,而是被一个具体实验现象砸实了的:同一批图片,换个测试集就翻脸不认人。这提醒我们,评估一个系统是不是真的"全面",光看它在各个单项测试上的分数还不够,得看它是不是在同一份产出上同时达标,这两者完全是两回事。

如果一个模型可以自己给自己出题、自己判卷、自己纠错,那我们离"完全不需要人类监督的AI训练"还有多远?

Q&A

Q1:Self-OPD是什么?

A:Self-OPD是一种教师免费的在线策略蒸馏框架,用于训练Flow Matching图像生成模型,它让模型通过自己生成多条随机分支路径、自我打分、自我对比,从而获得密集的每一步训练信号,不需要额外训练专门的教师模型。

Q2:Self-OPD和传统教师蒸馏方法比有什么优势?

A:Self-OPD不需要为每个新目标单独训练教师模型,省去大量算力和时间成本;同时它用奖励层融合处理多目标训练,避免了教师模型之间梯度冲突导致的"顾此失彼",实验显示它在GenEval、OCR、审美评分上普遍优于教师蒸馏方法。

Q3:Self-OPD训练速度比其他方法快多少?

A:论文实验显示,训练一个融合三种目标的DiffusionOPD教师模型需要约97小时,而Self-OPD从零训练大约62到90小时即可达到同等效果,若先做单目标热身再融合训练,总耗时可缩短到44到48小时,快了近两倍。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
天助C罗:0-2大冷门,沙特联领头羊6连胜终结,库利巴利自摆乌龙

天助C罗:0-2大冷门,沙特联领头羊6连胜终结,库利巴利自摆乌龙

侧身凌空斩
2026-09-08 04:03:30
星宇股份内部通报截图显示,因8月初对部分新入职大学生相关事项处理不当,总经理周晓萍被扣薪12个月

星宇股份内部通报截图显示,因8月初对部分新入职大学生相关事项处理不当,总经理周晓萍被扣薪12个月

张可象博士
2026-09-07 11:28:04
王俊杰绕开CBA选秀签约NBL,为何让整个篮坛坐不住?

王俊杰绕开CBA选秀签约NBL,为何让整个篮坛坐不住?

一叶禅林
2026-09-08 03:06:17
福建莆田一受灾鞋店被路人进店“捡鞋”,店主赶来大声斥责“这样做是违法的”,警方介入;网友:这种捡拾行为不合法,也可能感染细菌

福建莆田一受灾鞋店被路人进店“捡鞋”,店主赶来大声斥责“这样做是违法的”,警方介入;网友:这种捡拾行为不合法,也可能感染细菌

三湘都市报
2026-09-07 23:06:25
工商银行今日10:00预约,新5元纪念币涨了!每人5枚,入口更新!

工商银行今日10:00预约,新5元纪念币涨了!每人5枚,入口更新!

天天纪念币
2026-09-08 09:43:20
金晨生日直播发飙了!小笼包拼二胎挽回前夫!

金晨生日直播发飙了!小笼包拼二胎挽回前夫!

八卦疯叔
2026-09-08 10:35:03
女大学生晒账单哭诉生活费不够花:一天吃饭36元,一个月光吃饭就要1500,奶茶零食旅游还没算。

女大学生晒账单哭诉生活费不够花:一天吃饭36元,一个月光吃饭就要1500,奶茶零食旅游还没算。

捣蛋窝
2026-09-08 09:18:14
可直接对日本动武?中方通告全球:中国要打日本,无需任何人批准

可直接对日本动武?中方通告全球:中国要打日本,无需任何人批准

史智文道
2026-09-08 09:40:25
机会来了,亲华派彻底掌权?成功进入外国高层,对中国做过3好事

机会来了,亲华派彻底掌权?成功进入外国高层,对中国做过3好事

无情有思ss
2026-09-08 11:38:08
恭喜!她要和圈外男结婚了!

恭喜!她要和圈外男结婚了!

奋斗在韩国
2026-09-07 10:07:10
随着西班牙2-0,哥伦比亚3-1,U20女足世界杯最新积分榜出炉:中国继续领跑

随着西班牙2-0,哥伦比亚3-1,U20女足世界杯最新积分榜出炉:中国继续领跑

侧身凌空斩
2026-09-08 04:32:00
特朗普特使:泽连斯基必须同普京“作出妥协”

特朗普特使:泽连斯基必须同普京“作出妥协”

参考消息
2026-09-07 15:07:23
特朗普女婿当面撂话:没有永远的敌人,泽连斯基回应亮了

特朗普女婿当面撂话:没有永远的敌人,泽连斯基回应亮了

影视情报室
2026-09-07 11:14:04
海归学历不再吃香?三位学者做了一个“骗人”的实验

海归学历不再吃香?三位学者做了一个“骗人”的实验

新京报
2026-09-08 08:06:25
巴萨赚大了!诺坎普新星一战封神!1.5 亿都不卖!

巴萨赚大了!诺坎普新星一战封神!1.5 亿都不卖!

澜归序
2026-09-08 08:32:34
原主悔到心肝疼!网友213元买板卡内藏3块2TB固态:价值超万元

原主悔到心肝疼!网友213元买板卡内藏3块2TB固态:价值超万元

快科技
2026-09-07 19:36:21
库页岛有“三绝不”:绝不属于中国、绝不像俄罗斯、绝不承认过去

库页岛有“三绝不”:绝不属于中国、绝不像俄罗斯、绝不承认过去

墨策讲历史
2026-09-07 23:08:59
星宇事件再起争端!网友:星宇股份二次“罚”了所有人,却没一个人真疼——这波操作,把打工人当傻子

星宇事件再起争端!网友:星宇股份二次“罚”了所有人,却没一个人真疼——这波操作,把打工人当傻子

火山詩话
2026-09-07 12:46:48
杨采钰——美足鉴赏,一双嫩脚,许我童年女神的回忆

杨采钰——美足鉴赏,一双嫩脚,许我童年女神的回忆

喜欢历史的阿繁
2026-09-08 07:15:45
基辅会晤结束,特朗普女婿告诉泽连斯基:无法保证乌克兰实现和平

基辅会晤结束,特朗普女婿告诉泽连斯基:无法保证乌克兰实现和平

通鉴史智
2026-09-08 09:26:27
2026-09-08 12:36:49
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
9772文章数 568关注度
往期回顾 全部

科技要闻

小米再次背水一战

头条要闻

女孩遇"完美男友"被骗上百万 连养的狗都是"女友共享"

头条要闻

女孩遇"完美男友"被骗上百万 连养的狗都是"女友共享"

体育要闻

郑钦文,奇迹只发生在相信奇迹的人身上

娱乐要闻

郭德纲乱改抗战歌曲被重罚!

财经要闻

全球黄金“回家”

汽车要闻

领克20 领克的纯电小钢炮这次更运动了

态度原创

手机
艺术
游戏
教育
健康

手机要闻

vivo年度创作者盛典回顾,这三个信息最重要

艺术要闻

90后高学历情侣,租350m²毛坯45天改完:比买房值

索尼经典FPS复活!《杀戮地带》新作疑似开发中

教育要闻

教育要培养什么样的人?成都这所学校用一堂航天课回答

同样是脑梗,为何康复结局大不同?

无障碍浏览 进入关怀版