网易首页 > 网易号 > 正文 申请入驻

NeurIPS 2026 | 长推理为何总在中途走偏?SAGE用结构信号纠偏,AC实例验证通过率接近8倍

0
分享至



大模型解短题常能给出流畅答案,推理链一长,却可能每一步都看似合理、终点仍然失效。来自弗吉尼亚理工大学、威斯康星大学麦迪逊分校和达特茅斯学院的研究团队在 NeurIPS2026 论文中提出SAGE:用符号闭包分析(SCA)解释长推理中的探索偏差与累积偏差,再把这一诊断变成训练时的结构引导。在 12 个基准、7 个模型家族的评测中,SAGE 的总体表现优于所比较的后训练方法;在 Andrews–Curtis(AC)实例上,Qwen3 的 Lean 验证通过率接近基础模型的 8 倍。



  • 论文名称:SAGE:MitigatingLong-HorizonReasoningBiasesviaTopologicalGuidance
  • 会议:NeurIPS2026
  • 作者:XinyueZeng,JiaweiZhang,YujunYan,DaweiZhou
  • 单位:VirginiaTech,UniversityofWisconsin-Madison,DartmouthCollege
  • 论文链接:https://arxiv.org/abs/2609.30192
  • 代码链接:https://github.com/Susan571/SAGE-NeurIPS2026

一、长推理的难处:终点才有奖,岔路却越来越多

依靠最终答案给奖励的后训练,已显著提升模型的数学推理能力;但长任务里的奖励往往稀少而滞后。一条解题路径可能经过几十甚至上百次变换,训练过程却只知道结尾成败,难以判断从哪一步开始偏离。

一种思路是让人类或过程奖励模型逐步评分,代价是要取得可靠的过程标签或验证器;另一种思路是改造探索与奖励,却不必刻画任务本身的结构。SAGE 因而追问:为什么模型更容易走向 “看起来对” 的分支?终点奖励为什么很难把早期偏差纠回来?

论文用 Andrews–Curtis(AC)任务作为压力测试。给定一个由生成元与关系式构成的群表示,模型要依次执行允许的 AC 变换,尝试到达平凡表示。每一步是否合法可以检查,但合法操作不等于已经找到通向目标的路径;真正的成功信号要到整条序列结束才能确认。

实验求解的是 1,190 个按论文设置构造的 AC 实例。这一任务把 “局部合法、全局难成” 的矛盾放大,适合检验长程推理是否能持续朝目标推进。



图 1:以 AC 任务为例,SAGE 分别用代数稀疏化和双曲结构引导缓解两类偏差。

二、SCA:把两种 “走偏” 放到同一张结构地图上

SCA(SymbolicClosureAnalysis,符号闭包分析)先给 “还能继续走” 的路径下定义:从起点出发,只要每一步都符合任务规定的局部操作,就属于局部可行域 F。它具有 “前缀封闭” 性质 —— 一旦某一步不合法,后面的延续也不能把这条前缀变回合法路径。这里的可行只是局部条件:F 中也可能有走不到答案的路线,真正成功的轨迹集合更小,而且训练时并不知道。



第一重困难是探索偏差。设第 t 层的有效分支数为 Bₜ,其中局部可行的分支数为 Bₜᶠ。论文给出的几何直觉是:深度 T 的可行前缀占比大致受到各层 Bₜᶠ/Bₜ连乘制约。若许多层都只有少量分支可行,这一比例会随深度迅速缩小;终点奖励有限时,随机采到有用轨迹就更难。



论文进一步把策略梯度的波动拆成三部分:可行域内的方差、不可行域内的方差,以及两类轨迹平均信号不同造成的方差。如果采样真正集中到 F,后两项会消失。这一分解解释了为什么 “把预算花在哪些分支上” 会影响学习信号的质量;它并不意味着局部合法就能保证解出题目。



第二重困难是累积偏差。仅在终点给奖励时,早期决策缺少直接纠偏。论文考虑带 KL 正则的优化:若参考策略找到成功轨迹的概率为 p、终点奖励上界为 Rmax、KL 惩罚强度为 λ,则最优策略与参考策略的总变差距离有如下上界。



当成功轨迹极罕见、奖励相对于 KL 约束又不强时,这个上界很小;训练难以大幅摆脱参考模型原有的早期选择,微小偏离因而可能沿长链延续。

SCA 因此给出了两个明确的设计目标:一是把采样概率集中到更有希望的局部可行分支;二是让前缀在到达终点前就得到与目标结构有关的反馈。AC 这样的符号任务能精确定义局部合法性;自然语言任务则需要估计残差和目标锚点,理论保证不能原样搬过去。

三、SAGE:让理论诊断参与训练

SAGE(StructuralAdmissibility-GuidedExploration,结构可采纳性引导探索)把上述两个目标写成互补的结构势函数。它们不是直接给出标准解,而是在训练时评价候选推理步:哪些操作与尚未解决的结构更相容,哪些前缀更接近任务目标。

代数稀疏化针对探索偏差。系统把当前尚未解决的结构表示为 “残差”,再比较候选操作对应的代数子空间能解释多少残差;解释得越多,候选操作获得越高的软兼容分数。它提高相关分支被采样的机会,但不会把其他局部合法操作一刀切地删除。

双曲结构引导针对累积偏差。系统把当前状态与目标结构映射到适于表示层级关系的双曲空间,用两者的距离形成逐步反馈:不必等终点奖励出现,训练就能区分更接近或更偏离目标的候选前缀。这里的 “接近” 是一个训练时构造的结构信号,并不是对最终正确性的证明。

在实现上,旧策略先提出一组候选推理步,SAGE 用两种势函数软重排训练时的采样;轨迹结束后,再把终点奖励与平均结构分数合起来计算组相对优势,更新策略。论文还给出一个有条件的集中性结论:若势函数能把全部局部可行与不可行轨迹拉开正间隔 Δ,重加权后两类轨迹的概率比至多乘上 exp (−λΔ)。条件是否成立,取决于具体任务中的结构先验。



这些结构模块会增加训练阶段的候选评分与距离计算成本。训练完成后,推理直接使用学到的策略,不再运行这套评分或额外搜索;因此论文所说的 “无额外推理开销” 指的是不再引入结构引导模块的在线计算。

四、结果:从平均准确率到可验证的长链成功

评测覆盖 7 项闭式数学、4 项自由文本推理和 1 项 AC 长程符号任务,共 12 个基准、7 个模型家族。比较对象包括 SFT、GRPO、EMPO,以及针对过程反馈的 GRPO-PRM。论文报告各方法采用可比的 rollout 预算、生成长度和解码约束。

1. 封闭数学推理:Qwen3.5-2B、9B、35B 的 SAGE 平均值分别为 42.11%、47.95%、64.86%;较同规模最强后训练基线高 1.83、3.02、2.49 个百分点。单项并非全胜,例如 35B 的 AIME 为 62.04%,略低于 EMPO 的 62.31%。



2. 自由文本推理:在 9B 模型上,MMLU-Pro 平均准确率由 EMPO 的 37.91% 提升至 SAGE 的 39.99%;BBH-H 从 44.04% 提升至 45.31%,ARC-C 从 39.73% 提升至 42.04%。但 GPQA 上 SAGE 的 20.86% 略低于 EMPO 的 21.11%。到 35B 规模,SAGE 在这四项指标中均居所列后训练方法之首,其中 BBH-H 为 69.07%,ARC-C 为 66.41%。



3. AC 长程任务:论文分别测量 AC 变换有效率(局部步骤是否符合规则)、ACPathSolving(整条路径是否到达目标),以及 Lean 验证通过率(最终证明是否通过形式化检查)。图中比较六种骨干模型的基础版与 SAGE 版:前者的 AC 变换有效率提高 19.2—26.0 个百分点;Lean 验证通过率提高 13.2—20.8 个百分点。在 Qwen3 上 SAGE 版的 Lean 验证通过率接近基础版的 8 倍。



再看有明确数值的同规模方法对照:在 Qwen3.5-35B 的 AC 实验中,GRPO 的 “变换有效率 / 路径求解率 / Lean 通过率” 为 54.28%/23.05%/14.64%;SAGE 达到 59.83%/31.76%/23.69%。使用学习式过程奖励的 GRPO-PRM 在 Lean 指标上为 17.36%,仍低于 SAGE 的 23.69%。

五、结语:从终点奖励走向结构引导

随着大语言模型生成越来越长的推理链,一个问题也愈发突出:步骤变多,并不意味着模型始终走在通向答案的路径上。终点奖励能告诉模型最后是否答对,却很难指出前面哪一步开始走偏。长程推理需要的,是在训练中更早地利用路径本身的结构。

SCA 从局部可行性出发,解释可行分支如何随深度变得稀少,以及稀有的终点奖励为何难以纠正早期选择。基于这一分析,SAGE 提出一套结构引导的后训练方法:代数稀疏化根据尚未解决的残差调整候选步骤的采样,双曲结构引导根据状态与目标的距离为推理前缀提供反馈,并将两种信号用于策略更新。训练不依赖金标准的逐步解答,完成后也无需在推理时额外运行结构评分。

数学、自由文本与 AC 实例上的结果显示,这种方法大大提高了答案准确率。它提供了一条新的训练路径:让模型不只从最终成败中学习,也从推理过程的结构中学习如何选择下一步。

未来,如何在规则不如 AC 明确的任务中构建可靠的结构信号,仍需继续检验。但这项工作表明,改善长推理还可以从 “让模型更有效地选路” 入手。

当训练能让模型避免那些看似合理、却难以通向目标的岔路,长推理才有机会走得更远。

作者信息

曾欣悦,弗吉尼亚理工大学计算机科学博士生,研究方向包括大语言模型推理稳定性和可靠性,相关成果发表于 ICML,ICLR,NeurIPS 等等国际顶级会议。目前致力于构建可解释、可部署的 LLM 评估与推理方法。

个人主页:https://susan571.github.io/

实验室主页:https://sites.google.com/view/dawei-zhou/vlog-lab

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
多国接连表态,种种迹象表明,我国很可能,将用不一样的方式收台

多国接连表态,种种迹象表明,我国很可能,将用不一样的方式收台

范烽舍长
2026-10-06 22:41:10
八年,从301到100%,美国正在成功地把中国无人机赶向全世界

八年,从301到100%,美国正在成功地把中国无人机赶向全世界

兴趣知识
2026-10-08 00:51:49
缅北电诈头目29岁明珍珍死刑前画面曝光:毫无悔意,面带笑容讲着“卧虎山庄”惨案细节

缅北电诈头目29岁明珍珍死刑前画面曝光:毫无悔意,面带笑容讲着“卧虎山庄”惨案细节

笔尖下的人生
2026-10-06 16:48:02
安踏集团15亿欧元收购彪马29.06%股权交易完成,正式成为第一大股东

安踏集团15亿欧元收购彪马29.06%股权交易完成,正式成为第一大股东

澎湃新闻
2026-10-07 20:54:26
10月8日周四,关于2026年调整退休人员基本养老金的通知公布了吗

10月8日周四,关于2026年调整退休人员基本养老金的通知公布了吗

云鹏叙事
2026-10-08 08:15:16
国庆返程后,很多油车车主不说话了:堵3小时才发现 电车没那么惨

国庆返程后,很多油车车主不说话了:堵3小时才发现 电车没那么惨

华庭讲美食
2026-10-08 05:11:47
天助南通支云:0-1大冷门,中甲第2遭倒数第一掀翻,3连胜终结

天助南通支云:0-1大冷门,中甲第2遭倒数第一掀翻,3连胜终结

侧身凌空斩
2026-10-07 21:25:10
台湾慌忙求缓和,大陆官媒放出狠话:必须追责!

台湾慌忙求缓和,大陆官媒放出狠话:必须追责!

叶老四
2026-10-06 15:49:57
沈腾节目中自曝:去年曾许愿工作半年休息半年,如今休息半年达成了,工作没了

沈腾节目中自曝:去年曾许愿工作半年休息半年,如今休息半年达成了,工作没了

韩小娱
2026-10-02 09:05:28
冲上热搜!为何孙颖莎止步32强也要开发布会 官方回应:特意邀请的

冲上热搜!为何孙颖莎止步32强也要开发布会 官方回应:特意邀请的

风过乡
2026-10-08 06:54:10
江苏教师陆华锋去世,年仅41岁,死因曝光可惜,给中年人提了个醒

江苏教师陆华锋去世,年仅41岁,死因曝光可惜,给中年人提了个醒

小鹿姐姐情感说
2026-10-08 05:59:41
40年养老口号大变!从“政府来养老”到“自己备养老”,看懂普通人晚年真相

40年养老口号大变!从“政府来养老”到“自己备养老”,看懂普通人晚年真相

小虎新车推荐员
2026-10-06 01:45:48
热苏斯:我读了C罗的声明,现在我要和往常一样去足协工作

热苏斯:我读了C罗的声明,现在我要和往常一样去足协工作

懂球帝
2026-10-07 17:37:19
美拟就国际学生留美工作征收高额费用

美拟就国际学生留美工作征收高额费用

财联社
2026-10-08 05:52:10
宅基地权属彻底敲定!就算老宅垮塌、房顶全塌,大伙犯不上瞎扯皮

宅基地权属彻底敲定!就算老宅垮塌、房顶全塌,大伙犯不上瞎扯皮

三农雷哥
2026-09-20 19:44:43
菲律宾被揍了,损失惨重,很头疼!

菲律宾被揍了,损失惨重,很头疼!

故事终将光明磊落
2026-10-07 10:59:59
海南一空姐被穷打工仔追求,婚后一个月,她才得知丈夫真实身份

海南一空姐被穷打工仔追求,婚后一个月,她才得知丈夫真实身份

小月文史
2024-11-19 21:11:58
佘智江(生于湖南,后获柬埔寨国籍)出镜:有些人老叫我“老大”,我觉得不好,我说实在不行叫我“江湖哥”吧

佘智江(生于湖南,后获柬埔寨国籍)出镜:有些人老叫我“老大”,我觉得不好,我说实在不行叫我“江湖哥”吧

南方都市报
2026-10-07 09:58:36
孙颖莎为何1-3爆冷出局?赛后马琳点评一针见血,说的很实在!

孙颖莎为何1-3爆冷出局?赛后马琳点评一针见血,说的很实在!

用冷眼洞悉世界
2026-10-08 09:07:57
人民币是张提货卡:能买遍全球实物,却不伺候华尔街做空

人民币是张提货卡:能买遍全球实物,却不伺候华尔街做空

丁丁鲤史纪
2026-10-08 09:14:23
2026-10-08 09:59:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14146文章数 142745关注度
往期回顾 全部

科技要闻

Claude新模型来了,调用价低至一折!

头条要闻

鼠疫研究机构员工死亡 世卫组织敦促俄方披露更多信息

头条要闻

鼠疫研究机构员工死亡 世卫组织敦促俄方披露更多信息

体育要闻

从骑马舞到开口全中文 德约在北京不止七冠

娱乐要闻

给吴奇隆点赞的同时,再看蔡康永事件

财经要闻

美联储会议纪要:年内或将再上调利率一次

汽车要闻

智能化再提升 2027款东风标致、东风雪铁龙新车更人性化了

态度原创

时尚
艺术
教育
家居
军事航空

“这条裙子”太美了,从18岁穿到80岁都很显气质

艺术要闻

全球十大顶级风光摄影师作品,太美了!

教育要闻

强行计算根号21,你敢挑战吗

家居要闻

2026建博会(广州) 公装联探展交流活动

军事要闻

外舰跟监遵义舰 结果自己先"趴窝"了

无障碍浏览 进入关怀版