一个反直觉的现象正在大模型训练圈引发讨论:模型经过监督微调(SFT)后,在评测指标上看起来更好了,但作为强化学习(RL)的起点,它反而可能变得更差。微软与加州大学圣地亚哥分校的一项新研究,把这个问题摆上了台面,并给出了一套名为 TailSFT 的解决方案。
研究团队发现,标准 SFT 的一个副作用是:它过度拟合了那些已经学得不错的样本,反而可能抹掉一些稀有但正确的行为——而这些行为恰恰是后续 RL 阶段需要去发现和强化的。换句话说,SFT 把模型"喂饱"了,却让 RL 没了用武之地。
![]()
问题出在"已拟合样本"上
核心矛盾在于 SFT 的训练逻辑。传统做法是对所有训练样本一视同仁地做监督学习,但 TailSFT 的作者观察到,那些相对于基础模型损失已经大幅下降的序列,其实已经被模型"吃透"了。继续在这些样本上用力,边际收益很低,反而可能挤压模型对其他模式的探索空间。
TailSFT 的做法是反着来:在 SFT 阶段,主动过滤掉这些损失已经显著下降的序列,把训练重心转向模型仍然欠拟合的样本。目标很明确——让正确的回答在重复采样下仍然可达,这样 RL 阶段才有值得去强化的行为。
同一套 RL 设置,最终成绩提升近 4 个百分点
效果是实打实的。论文数据显示,在完全相同的 RL 设置下,使用 TailSFT 作为起点的模型,最终 pass@1 成绩比标准 SFT 起点的模型最高提升了 3.93 个百分点。这个数字说明,起点质量对 RL 最终表现的影响,可能比很多人想象的要大。
研究团队把这一现象概括为:标准 SFT 通过过度训练已拟合样本,反而让 RL 变得更难;TailSFT 通过过滤这些样本,给后续 RL 阶段提供了一个更好的起点。
对训练流程的启示
这项研究给大模型训练管线提供了一个新的思考维度:SFT 和 RL 不是两个孤立的阶段,前者的输出质量直接决定了后者的探索空间。如果 SFT 阶段把模型"锁死"在已有模式上,RL 阶段能挖掘的潜力就会受限。
TailSFT 的过滤策略并不复杂,但它指向了一个更本质的问题——训练数据的价值不是均匀的,对已经学会的样本反复用力,可能是在浪费 RL 的潜力。对于正在优化训练流程的团队来说,这或许是一个值得重新审视的环节。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.