网易首页 > 网易号 > 正文 申请入驻

用推理步骤的「语义冗余」给LRM过度思考踩刹车

0
分享至



推理大模型 (如 DeepSeek-R1、o1) 靠长思维链拿高分,却普遍「想太多」: 研究统计了五个代表性模型里,发现有 41–52% 的 token 是在模型给出它的最终答案之后生成的。现有的 inference-time early-exit 工作,大多盯着 trial answer 的 readiness—— 从当前推理前缀探测一个临时答案,看它置信度够不够高、连续几次是否一致、是否「看起来可以提交」。但答案看起来稳了,并不代表推理真的收敛了:模型可能还在探索、自我纠错的过程中,就短暂给出高置信、甚至连续一致的错误答案。

PUMA 换了个早停思路 ——不只看「答案稳没稳」, 主要看「最近的推理还在不在产生新的语义进展」: 当推理开始反复复述既有结论、不再提供新的语义信息时,说明推理大概率已收敛,这里才值得考虑停止。实验验证了这一信号可靠、可迁移、也可学习:在 5 个模型 × 5 个高难度基准上平均减少 26.2% token 且保持准确率,能零样本迁移到代码生成与多模态推理,乃至作为训练信号内化进模型。



  • 论文标题:Stop When Reasoning Converges: Semantic-Preserving Early Exit for Reasoning Models
  • 论文链接:https://arxiv.org/abs/2605.17672
  • 代码链接:https://github.com/giovanni-vaccarino/PUMA

长思考模型的通病:

答案已经有了,思考还在继续

像 DeepSeek-R1、Qwen3-Thinking 这类长思考模型(Long-thinking Model,LRM)靠长思维链拿高分,但很多时候,模型早就已经形成了后来会提交的答案,却还在反复验证、改写、重新推导。作者的反事实分析显示:五个代表性模型里,有 41–52% 的推理 token 生成在模型首次给出「后来会提交的最终答案」之后 —— 大量算力都花在了答案后的冗余续写上。



论文 Figure 5:五个模型中 41–52% 的 token 属于「答案后冗余」;多数模型在推理进度 40–60% 附近就已达到最终会提交的答案。

现有早停的盲区:

只盯 trial answer 的 readiness

现有的 inference-time early-exit 工作,大多盯着trial answer 的 readiness:在每个可能的停机点,从当前推理前缀诱导出一个临时答案(trial answer),据它的置信度或连续一致性判断「是否可以提交」。

问题在于,readiness 只反映答案层面的稳定,并不等于推理已经收敛。回溯实验把这一盲区量化了出来:置信度信号的误停率平均约 44%、答案一致性约 64%;更关键的是,其中相当一部分属于「过早退出」—— 若不打断,模型本能继续自我纠正并最终答对,而阈值扫描表明这一权衡无法靠调参消除。



论文 Figure 1:「答案就绪」≠「推理收敛」。置信度 / 一致性在错误答案阶段就可能误触早停,而步骤间语义相似度只在推理收敛处才明显升高。

PUMA 的关键:不只看答案稳没稳,

更看推理还有没有新信息

PUMA 换了个角度:直接观察最近的推理还在不在产生新的语义进展。若当前步与它的近邻高度相似、只是在重复 / 复述 / 重新验证既有结论、不再提供新的语义信息,就说明推理大概率已进入收敛 —— 这里才值得考虑停止。这个信号与答案层信号互补:探索阶段相邻步骤的相似度一直较低,收敛时才明显升高。

PUMA (Progress-aware Unified Monitoring framework for Adaptive early exit) 是一个即插即用的早停框架,在推理阶段运行,不改权重、也不改原始 prompt。

它把「在哪里考虑停」和「到底能不能停」拆开:一个轻量冗余探测器(基于 Qwen3-Embedding-0.6B 对比学习微调的嵌入模型)实时标出候选退出点;只有在这些点上才触发答案复核,检查试探答案(trial answer)是否足够自信、多个候选点是否一致、置信度有无明显下滑。两关都过才真正踩刹车;如果后期持续陷入重复但复核始终未通过,则由 Loop Breaker 兜底,避免无休止地继续思考。



论文 Figure 2:PUMA 框架总览 —— 冗余探测器定位候选退出点,答案复核确认后停止,Loop Breaker 兜底。左侧真实轨迹演示它删掉收敛后的冗余续写、同时保留完整推理前缀。

主实验:平均少 26.2% token,

准确率基本不掉,速度也真的上去了

作者在 5 个长思考模型(DeepSeek-R1-Distill-Qwen 7B/14B/32B、Llama-3.1-Nemotron-Nano-8B、Qwen3-30B-A3B-Thinking)和 5 个高难度基准(MATH-500、AIME24/25、OlympiadBench、GPQA-Diamond)上测试 PUMA。

结果是:平均减少 26.2% token,准确率基本保持;部分设置下,因为及时避开了答案后的「后期漂移」,准确率反而略有上升。这点和单纯要求模型「少说一点」不同。prompt 压缩会连必要推理一起压掉:例如在 Qwen3-30B 上,这类方法把准确率从 Full CoT 的 81.7% 拉低到 45–60%,PUMA 则保持在 82.5%。

与只看答案 readiness 的 Answer Convergence、Dynasor、DEER 相比,PUMA 的准确率 — 效率权衡也更稳定。省下的 token 还能转成真实推理速度:DS-7B 加速 1.40×,DS-14B 加速 1.28×。

LLM-as-Judge 的结果也显示,PUMA 保留下来的思维链在连贯性、简洁性和论证充分性上平均得分最高 —— 它做的是「删掉收敛后的冗余」,不是把思考过程生硬砍半。



论文 Table 1:三个代表性模型 × 五个基准的准确率(Acc)—token 缩减率(TR)对比(完整五模型结果见附录 Table 14)。



论文 Figure 3:token 缩减能否转化为真实提速 ——PUMA 的冗余探测器仅占 0.4–1.1% 耗时,答案复核开销也很小。



论文 Table 2:LLM-as-Judge 对各方法保留推理链的质量评分,PUMA 平均最高。

可迁移到代码生成和多模态推理,

还能把「该停就停」训练进模型

这个信号还能零样本迁移到文本数学之外:代码生成(LiveCodeBench,仅调整冗余阈值 τ_sim=0.50)减少 18–19% token、pass@1 变化不超过 1.5 个点;多模态推理(MathVista / MathVision)不重训、不调参,token 减少 23.8–33.6%。

更进一步,把 PUMA 选出的退出位置当作监督信号,用 SFT / DPO / GRPO内化进模型后,部署时不带任何 PUMA 模块也能自己「该停就停」——PUMA-RL 的平均准确率(67.0)与 token 缩减(34.9%)都反超免训练版 PUMA(66.2 / 24.3%)。



论文 Table 3:迁移到代码(LiveCodeBench)与多模态(MathVista / MathVision)推理的结果。



论文 Table 5:用 SFT / DPO / GRPO 把 PUMA 的停机信号内化进模型(评测集 MATH-500、AIME24、GPQA-Diamond)。

一句话总结:推理早停最容易踩的坑,是把「trial answer 的 readiness」当成「推理收敛」。PUMA 用「最近的推理是否还在产生新的语义进展」定位候选停机点,再用答案复核兜底 —— 实验表明,这是一个可靠、可迁移、也可学习的高效推理信号。(Limitation:方法依赖分步推理轨迹,当输出很短或难以切分时效果会打折。)

作者介绍


本文第一作者闵德海为伊利诺伊大学芝加哥分校计算机系博士生,导师为 Philip S. Yu 教授(ACM/IEEE/AAAS Fellow)。他目前在 ByteDance 美国团队担任 Research Scientist Intern,工作聚焦 Agent Harness 与 Agent 数据合成,研究方向包括 RAG/Deep Research 及高效可信大模型。该论文合作单位包括 UIC、Google Research、UIUC 和米兰理工大学。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
柬埔寨诈骗窝点内部照片曝光:有带手术室的医院、12间地下牢房、电椅等,模拟审讯室内发现用于欺骗受害者的剧本、多国假警察制服

柬埔寨诈骗窝点内部照片曝光:有带手术室的医院、12间地下牢房、电椅等,模拟审讯室内发现用于欺骗受害者的剧本、多国假警察制服

上观新闻
2026-09-09 14:33:44
长沙男童“摸臀”事件:当事女主要的不是对不起,而是一场盛大的发布会

长沙男童“摸臀”事件:当事女主要的不是对不起,而是一场盛大的发布会

News脑洞
2026-09-09 15:46:08
李想:理想i9是城市中心顶级大平层 全世界绝无仅有!

李想:理想i9是城市中心顶级大平层 全世界绝无仅有!

快科技
2026-09-09 14:00:05
德国选择党获胜,俄罗斯人庆祝

德国选择党获胜,俄罗斯人庆祝

参考消息
2026-09-08 21:47:08
越闹越大!107名毕业生被指认卖国,和星宇股份有没有关系

越闹越大!107名毕业生被指认卖国,和星宇股份有没有关系

平老师666
2026-09-08 21:41:14
“4岁男童被指摸臀”父亲发声:已第一时间道歉,相信法律会给出公正的判断

“4岁男童被指摸臀”父亲发声:已第一时间道歉,相信法律会给出公正的判断

潇湘晨报
2026-09-09 12:22:10
“每一个都死气沉沉”,一张军训照片,让家长怒了:我们的孩子为何变成这样?

“每一个都死气沉沉”,一张军训照片,让家长怒了:我们的孩子为何变成这样?

蝴蝶花雨话教育
2026-09-09 00:05:15
孙绍骋被开除党籍和公职

孙绍骋被开除党籍和公职

新京报
2026-09-09 17:11:36
华为拿下玛莎拉蒂,全网破防了!

华为拿下玛莎拉蒂,全网破防了!

财经三分钟pro
2026-09-08 15:25:19
“剪刀可以轻松剪排骨”,张小泉用AI演示剪刀用途被质疑虚假宣传,客服回应:不适合剪大块排骨,使用AI情况会记录反馈

“剪刀可以轻松剪排骨”,张小泉用AI演示剪刀用途被质疑虚假宣传,客服回应:不适合剪大块排骨,使用AI情况会记录反馈

洪观新闻
2026-09-09 16:10:34
山姆停售「供港生菜」引中产恐慌,“每年交260元会员费还能吃上无农残蔬菜吗?”

山姆停售「供港生菜」引中产恐慌,“每年交260元会员费还能吃上无农残蔬菜吗?”

Vista氢商业
2026-09-09 14:01:00
深圳一公司员工韦某(男,32 岁 ),抢救无效死亡!官方公布调查报告

深圳一公司员工韦某(男,32 岁 ),抢救无效死亡!官方公布调查报告

南方都市报
2026-09-09 15:02:22
上交所向星宇股份下发监管工作函

上交所向星宇股份下发监管工作函

界面新闻
2026-09-09 18:16:35
人社局回应星宇股份找“背锅侠”,返聘从没做过人力工作的退休高管做人力总监,如此草率吗

人社局回应星宇股份找“背锅侠”,返聘从没做过人力工作的退休高管做人力总监,如此草率吗

Mr王的饭后茶
2026-09-09 16:45:09
往长江倒黑泥后续!央视出手,真相终于大白,始作俑者要被重罚

往长江倒黑泥后续!央视出手,真相终于大白,始作俑者要被重罚

兵卒史
2026-09-09 17:37:28
长沙被摸臀女子社会性死亡!底裤被扒,正脸照曝光,黑历史流出

长沙被摸臀女子社会性死亡!底裤被扒,正脸照曝光,黑历史流出

米果说识
2026-09-08 19:28:54
分手3年哭求前男友收回赠予豪宅,以为良心发现,结果还不起房贷

分手3年哭求前男友收回赠予豪宅,以为良心发现,结果还不起房贷

青梅侃史啊
2026-09-08 22:00:41
“摸臀” 女网红社死,安徽母校评论区被冲烂,留学梦可能有变数

“摸臀” 女网红社死,安徽母校评论区被冲烂,留学梦可能有变数

四斤
2026-09-09 15:22:29
“卤米松”原研药从30元涨到800元!厂家:原料供应商变更致断货,可更换其他药品

“卤米松”原研药从30元涨到800元!厂家:原料供应商变更致断货,可更换其他药品

红星资本局
2026-09-08 18:53:05
中国男子带3.55亿现金入境越南,在口岸全被没收,只因没申报!到底能带多少?

中国男子带3.55亿现金入境越南,在口岸全被没收,只因没申报!到底能带多少?

越南语学习平台
2026-09-08 09:40:43
2026-09-09 20:19:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13953文章数 142731关注度
往期回顾 全部

科技要闻

AI重大突破!OpenAI称解开近百年数学难题

头条要闻

男子被误导签下年交60万的大额保单 连缴两年无力承担

头条要闻

男子被误导签下年交60万的大额保单 连缴两年无力承担

体育要闻

16年后再破门,被皇马放弃的少年没认输

娱乐要闻

郭德纲的商业版图,藏着不知道的真相

财经要闻

知情人士证实DeepSeek备战科创板IPO

汽车要闻

红旗HS7 PHEV申报图曝光 尺寸升级/搭载激光雷达

态度原创

数码
家居
健康
教育
时尚

数码要闻

拿命在玩电脑!旧款MacBook电池型号买错用飞线强连:起火隐患极大

家居要闻

2026建博会(广州) 公装联探展交流活动

中风康复为何像“抽丝剥茧”?

教育要闻

北京40名学生获国家级奖学金!教育部最新公布——

恭喜这位女士,把对手打哭,重回巅峰

无障碍浏览 进入关怀版