网易首页 > 网易号 > 正文 申请入驻

万分之一——大模型后训练中的极端稀疏监督

0
分享至





  • 论文标题:Extremely Sparse Supervision Incentivizes Reasoning Ability
  • 论文链接:https://arxiv.org/abs/2609.04565
  • X Post:https://x.com/iampanxu/status/2099151119658475880?s=20
  • image



后训练是提高大模型推理能力的关键一环,一次后训练至少包含了上亿个 token 的梯度信号。以数学推理为例,大模型的一条 rollout 通常包含几千个 token,如果只保留其中一个 token 处的梯度信号做参数更新,训练会崩溃吗?

亚马逊公司和杜克大学的一项最新研究表明,在这种极端稀疏的梯度信号下,训练不但没有失败,反而取得了更好的推理性能。这项研究对一个被默认且普遍接受的假设提出了挑战:大模型后训练中密集的 token-level 信号真的是必要的吗?



一个 token 所包含的丰富信息


On-Policy Distillation(OPD,在线策略蒸馏)是近期在业界和学术界中备受关注的后训练范式,在前沿大模型训练中已成为提升模型能力和实现高效能力迁移的重要技术路径。OPD 天然具有密集的 token-level 监督信号:学生模型生成推理轨迹,教师模型对轨迹中的每一个 token 提供反馈。这种密集的 token-level 监督信号一直以来被认为是 OPD 取得成功的重要特点,但也增加了理解 OPD 内在机制的难度。



研究团队以 OPD 和数学推理为起始研究场景,做了一个极端的实验:对于学生模型生成的每一条 rollout,仅随机保留一个 token 处的梯度,使其参与参数更新,同时 mask 掉其他所有 token 处的信号。换句话说,如果一条 rollout 包含了 4000 个 token,那么只有 0.025% 的 token 得到了教师模型的监督信号。实验结果出人意料:在如此极端的稀疏信号下,学生模型的推理能力依然得到显著提升。

研究团队基于 Qwen3 系列构造了9 组不同的教师—学生配置,涵盖:

1)小参数量学生模型蒸馏大参数量教师模型;

2)同等规模的教师模型和学生模型;

3)大参数量学生模型蒸馏小参数量教师模型。

不同的设置代表了教师模型与学生模型之间不同程度的表征差异。在所有组合中,随机监督一个 token,都能一致地观察到学生模型推理性能的提升。

极端稀疏的监督信号,胜过密集监督

在这种极端稀疏监督的训练模式下,学生模型推理能力的提升能否进一步扩大?这涉及监督信号的选择。在 OPD 中,每一个 token 的监督信号代表了教师模型和学生模型在该 token 处的分歧度,研究团队选择保留每一条 rollout 中分歧最大的 token。实验结果表明,仅仅一到两个 token 的监督信号可以匹配甚至超过全信号训练。



Math Reasoning OPD: Qwen3-8B student ← Qwen3-4B-Instruct-2507 teacher

如上的实验结果更是显示,监督一个或者两个 token 所得到的学生模型不仅比全信号训练得到的学生模型好,更是超过了教师模型本身。另一个有趣的观察是,尽管标准 OPD 的目标是缩小学生模型与教师模型输出分布之间的差异,但在极端稀疏监督下,推理性能最强的学生模型,其输出分布与教师模型之间的差异不仅没有缩小,反而可能进一步增大。这暗示了在极端稀疏监督的训练范式下,学生并非单纯通过模仿教师模型获得推理性能的提升。

为了进一步研究这一现象的泛化性,研究团队进行了跨任务、跨模型系列和跨后训练范式的验证,将实验拓展到了:1)代码推理任务;2)Llama 系列模型;以及 3)基于 Proximal Policy Optimization(PPO)的 Reinforcement Learning with Verifiable Reward(RLVR)。不出意料地,在这些场景下的实验结果均展现了同样的现象:极端稀疏的监督信号足以非常有效地提升模型的推理能力。



Coding Reasoning OPD: Qwen3-4B student ← Qwen3-30B-A3B-Instruct-2507 teacher

剖析极端稀疏监督背后的机制

这项工作给出了一个值得关注的数据点:一次成功的后训练,可能只需要利用几千个 token 处的梯度。在这一尺度下,研究者可以直接观察被激活 token 所承载的语义信息,以及它们对学习动力学的影响。下表展示了一些被激活且获得正奖励(教师模型希望其概率增大)的 token。



此外,研究团队利用消融试验得到了一些有趣的结论:

1)模型推理性能的提升与监督信号的稠密程度并非单调关系:随着受监督 token 的数量逐渐减少,模型推理性能起初会有所下降,但随后又会恢复;当监督变得极端稀疏时,性能甚至可以超过全信号训练。然而,当监督进一步稀疏到一定程度后,学习信号最终会变得不足,无法再带来有意义的推理性能提升。

2)OPD 实验中,当学生模型具有足够的表征能力,带正奖励的 token 可以更好地激发学生的推理能力;而当学生模型表征能力弱于教师模型时,带负奖励的 token 取得更好的训练效果。

3)极端稀疏监督也带来了更加稀疏的神经网络参数更新,万分之一的监督信号仅仅更新了 10% 的网络参数,即可取得大幅的推理性能提升。

最后,为什么一个 token 的监督信号就能如此有效?这仍然是一个开放的问题。研究团队给出了一个类比:极端稀疏监督更像是人类的自然学习过程。当人们带着一定先验知识和基础能力去学习一项复杂任务时,往往并不需要细粒度的反馈,少量但关键的纠正信号就可能显著改变后续的行为与策略。类似地,一个经过预训练、SFT 和 RL 的大模型本身已经具备了一定的推理能力;当进一步对其进行后训练时,可能并不需要覆盖每一个 token 的密集监督,少量但关键的学习信号便足以引导模型进一步调整,并带来显著的推理性能提升。

作者简介:Zhishuai Liu 是杜克大学(Duke University)的博士生,导师为 Prof. Pan Xu。本文宣传的工作是其在亚马逊(Amazon)公司实习期间完成。Dr. Xingzi Xu 和 Dr. Mehmet Saygin Seyfioglu 是亚马逊公司的 Applied Scientist,Dr. Karim Bouyarmane 是亚马逊公司的 Senior Manager。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
3-0!39岁梅西国家队告别战1射2传+完美谢幕 动情落泪 8万人致敬

3-0!39岁梅西国家队告别战1射2传+完美谢幕 动情落泪 8万人致敬

我爱英超
2026-10-07 09:31:14
极光丝袜高跟,从容极致优雅有氛围感

极光丝袜高跟,从容极致优雅有氛围感

艾斯莱斯奈斯
2026-10-06 16:23:24
22分钟砍0分0板1失误!女篮首发后卫这水平:中国队未来堪忧?

22分钟砍0分0板1失误!女篮首发后卫这水平:中国队未来堪忧?

篮球快餐车
2026-10-07 00:08:55
为什么有人满脸“老年斑”,有的却干干净净?

为什么有人满脸“老年斑”,有的却干干净净?

芹姐说生活
2026-09-15 00:00:02
官媒怒批,蔡康永跑路不到48小时,留在日本的“退路”被扒出

官媒怒批,蔡康永跑路不到48小时,留在日本的“退路”被扒出

旧史新谭
2026-10-06 13:16:26
养老金上调的补发数额、发放时间,一文讲透,退休朋友收好

养老金上调的补发数额、发放时间,一文讲透,退休朋友收好

白昼说故事
2026-10-07 17:41:28
国庆假期迎返程高峰,一游客称排队2小时充电10分钟遇充电桩故障 车主支招下高速就近找充电站

国庆假期迎返程高峰,一游客称排队2小时充电10分钟遇充电桩故障 车主支招下高速就近找充电站

红星新闻
2026-10-06 14:32:13
女孩查分721,当晚选择坠楼自杀,警方检查手机短信,发现实情

女孩查分721,当晚选择坠楼自杀,警方检查手机短信,发现实情

罪案洞察者
2025-07-16 10:48:38
4.8亿首发打不过雷霆替补!烂了这么多年,仍不打算重建,太奇葩

4.8亿首发打不过雷霆替补!烂了这么多年,仍不打算重建,太奇葩

你的篮球频道
2026-10-07 11:12:59
首销破27万台!华为Mate 90系列销量出炉:麒麟9050 Pro版占四成

首销破27万台!华为Mate 90系列销量出炉:麒麟9050 Pro版占四成

快科技
2026-10-07 18:29:08
东航欧某某多张高清照流出!长相神似孙小果,空姐被吓跪那一幕,一看就是狠角色

东航欧某某多张高清照流出!长相神似孙小果,空姐被吓跪那一幕,一看就是狠角色

秋风妃
2026-10-07 08:01:51
法媒:梅西将留下4项难以打破的阿根廷队史纪录

法媒:梅西将留下4项难以打破的阿根廷队史纪录

懂球帝
2026-10-06 21:57:32
2026年9月中国台湾省汽车销量排行榜

2026年9月中国台湾省汽车销量排行榜

中汽数研
2026-10-06 14:58:34
姚明是被迫辞职?媒体人:他想再请外教但另一拨人要请郭士强

姚明是被迫辞职?媒体人:他想再请外教但另一拨人要请郭士强

漫川舟船
2026-10-07 00:28:10
万亿砸向高速充电桩,排队为何仍是无解?

万亿砸向高速充电桩,排队为何仍是无解?

虎嗅APP
2026-10-07 04:34:11
2026年冬天最冷时间表出炉!这18天冻到骨子里,早看早准备

2026年冬天最冷时间表出炉!这18天冻到骨子里,早看早准备

时尚的弄潮
2026-10-06 01:39:09
美国囤铜囤到啥种程度?全球70%现货集中过去,中国铜价先破11万

美国囤铜囤到啥种程度?全球70%现货集中过去,中国铜价先破11万

史之铭
2026-10-07 00:23:17
反转!公开发文讨说法,全程无人接招,C罗这场对峙输得彻底明白

反转!公开发文讨说法,全程无人接招,C罗这场对峙输得彻底明白

无月可归辛
2026-10-07 08:20:41
医生发现:每天早起后先排便的人,用不了半年,身体或迎来5改变

医生发现:每天早起后先排便的人,用不了半年,身体或迎来5改变

任医生聊健康
2026-06-08 20:00:48
诺奖生理学奖出炉,发明无创检测的中国科学家再遭打压,遗憾落选

诺奖生理学奖出炉,发明无创检测的中国科学家再遭打压,遗憾落选

云景侃记
2026-10-07 11:33:53
2026-10-07 18:56:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14143文章数 142744关注度
往期回顾 全部

科技要闻

诺贝尔化学奖揭晓,两位科学家摘得大奖

头条要闻

地雷风波升级 金与正强硬发声:就是野兽也都不能进出

头条要闻

地雷风波升级 金与正强硬发声:就是野兽也都不能进出

体育要闻

从骑马舞到开口全中文 德约在北京不止七冠

娱乐要闻

吴奇隆举旗活动取消,不赚钱也守立场

财经要闻

谷歌签下科技史上最大核能协议

汽车要闻

智能化再提升 2027款东风标致、东风雪铁龙新车更人性化了

态度原创

时尚
教育
健康
手机
本地

赫本的小黑裤,裤装界的气质王者

教育要闻

【预告】10月8日|南方教研大讲堂第196场:AI赋能高中地理海洋生态文明主题研学

刷酸祛痘,为什么有人翻车?

手机要闻

还得是苹果!iPhone Duo 强制 APP 适配,不适配直接下架,安卓办不到

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

无障碍浏览 进入关怀版