微软与加州大学圣地亚哥分校联合发表的一篇新论文,给大模型训练流程提了个醒:模型在SFT(监督微调)阶段表现变好,未必意味着它为后续的强化学习(RL)阶段做好了准备。在某些情况下,SFT反而可能把模型推向一个更差的RL起点。
论文提出的解决方案叫TailSFT,核心思路是在SFT阶段过滤掉那些已经被模型"学透"的样本。实验数据显示,在完全相同的RL设置下,使用TailSFT作为前置步骤,模型的最终pass@1(一次生成即正确的概率)最高能提升3.93个百分点。
![]()
SFT的"副作用":拟合过头反而拖累RL
研究团队发现了一个反直觉的现象:标准SFT在训练时,会把大量已经拟合得很好的样本反复强化。这些样本的损失(loss)已经降得很低,模型对它们的输出几乎不会出错。但问题在于,这种"过度训练"可能会挤压掉模型其他方面的能力——尤其是那些在标准训练中很少出现、但RL阶段恰恰需要去探索和发现的稀有正确行为。
换句话说,SFT让模型在"已知题"上表现更稳定,却可能让它在"未知题"上变得更保守。而RL的机制恰恰依赖于模型在多次采样中能够触达正确的行为模式,再通过奖励信号去强化它。如果SFT阶段把这些可能性抹掉了,RL就等于失去了可用的"原料"。
TailSFT的做法:把训练重心转向"还没学会"的样本
TailSFT的改动并不复杂,它改变了SFT阶段挑选训练样本的方式。具体来说,它会过滤掉那些相对于基础模型(base model)损失已经下降最多的序列——也就是模型已经掌握得很好的样本。剩下的训练重心,就落在了模型仍然欠拟合(underfit)的例子上。
这样做的目标很明确:让模型在重复采样时,仍然能够保持正确回答的可达性(reachable)。只有正确的行为还在模型的输出分布里,RL阶段才有东西可以去强化。如果SFT阶段就把这些行为"洗"掉了,RL再努力也找不到可以奖励的正确路径。
实验数据:同一套RL,起点不同结果差近4个点
论文给出的对比结果相当直观:在RL设置完全一致的前提下,用标准SFT作为起点的模型,和用TailSFT作为起点的模型,最终在pass@1指标上拉开了差距。TailSFT路线的模型最高领先3.93个百分点。这个数字说明,SFT阶段的数据选择策略,对后续RL阶段的天花板有直接影响。
这项研究的价值在于,它把"SFT和RL是两个独立阶段"的传统认知往前推了一步——两个阶段之间的衔接方式,本身就是一个可以优化的变量。对于正在搭建完整训练pipeline的团队来说,TailSFT提供了一个不需要改动RL算法、只调整前置SFT数据筛选策略就能获得收益的切入点。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.