网易首页 > 网易号 > 正文 申请入驻

用推理步骤的「语义冗余」给LRM过度思考踩刹车

0
分享至



推理大模型 (如 DeepSeek-R1、o1) 靠长思维链拿高分,却普遍「想太多」: 研究统计了五个代表性模型里,发现有 41–52% 的 token 是在模型给出它的最终答案之后生成的。现有的 inference-time early-exit 工作,大多盯着 trial answer 的 readiness—— 从当前推理前缀探测一个临时答案,看它置信度够不够高、连续几次是否一致、是否「看起来可以提交」。但答案看起来稳了,并不代表推理真的收敛了:模型可能还在探索、自我纠错的过程中,就短暂给出高置信、甚至连续一致的错误答案。

PUMA 换了个早停思路 ——不只看「答案稳没稳」, 主要看「最近的推理还在不在产生新的语义进展」: 当推理开始反复复述既有结论、不再提供新的语义信息时,说明推理大概率已收敛,这里才值得考虑停止。实验验证了这一信号可靠、可迁移、也可学习:在 5 个模型 × 5 个高难度基准上平均减少 26.2% token 且保持准确率,能零样本迁移到代码生成与多模态推理,乃至作为训练信号内化进模型。



  • 论文标题:Stop When Reasoning Converges: Semantic-Preserving Early Exit for Reasoning Models
  • 论文链接:https://arxiv.org/abs/2605.17672
  • 代码链接:https://github.com/giovanni-vaccarino/PUMA

长思考模型的通病:

答案已经有了,思考还在继续

像 DeepSeek-R1、Qwen3-Thinking 这类长思考模型(Long-thinking Model,LRM)靠长思维链拿高分,但很多时候,模型早就已经形成了后来会提交的答案,却还在反复验证、改写、重新推导。作者的反事实分析显示:五个代表性模型里,有 41–52% 的推理 token 生成在模型首次给出「后来会提交的最终答案」之后 —— 大量算力都花在了答案后的冗余续写上。



论文 Figure 5:五个模型中 41–52% 的 token 属于「答案后冗余」;多数模型在推理进度 40–60% 附近就已达到最终会提交的答案。

现有早停的盲区:

只盯 trial answer 的 readiness

现有的 inference-time early-exit 工作,大多盯着trial answer 的 readiness:在每个可能的停机点,从当前推理前缀诱导出一个临时答案(trial answer),据它的置信度或连续一致性判断「是否可以提交」。

问题在于,readiness 只反映答案层面的稳定,并不等于推理已经收敛。回溯实验把这一盲区量化了出来:置信度信号的误停率平均约 44%、答案一致性约 64%;更关键的是,其中相当一部分属于「过早退出」—— 若不打断,模型本能继续自我纠正并最终答对,而阈值扫描表明这一权衡无法靠调参消除。



论文 Figure 1:「答案就绪」≠「推理收敛」。置信度 / 一致性在错误答案阶段就可能误触早停,而步骤间语义相似度只在推理收敛处才明显升高。

PUMA 的关键:不只看答案稳没稳,

更看推理还有没有新信息

PUMA 换了个角度:直接观察最近的推理还在不在产生新的语义进展。若当前步与它的近邻高度相似、只是在重复 / 复述 / 重新验证既有结论、不再提供新的语义信息,就说明推理大概率已进入收敛 —— 这里才值得考虑停止。这个信号与答案层信号互补:探索阶段相邻步骤的相似度一直较低,收敛时才明显升高。

PUMA (Progress-aware Unified Monitoring framework for Adaptive early exit) 是一个即插即用的早停框架,在推理阶段运行,不改权重、也不改原始 prompt。

它把「在哪里考虑停」和「到底能不能停」拆开:一个轻量冗余探测器(基于 Qwen3-Embedding-0.6B 对比学习微调的嵌入模型)实时标出候选退出点;只有在这些点上才触发答案复核,检查试探答案(trial answer)是否足够自信、多个候选点是否一致、置信度有无明显下滑。两关都过才真正踩刹车;如果后期持续陷入重复但复核始终未通过,则由 Loop Breaker 兜底,避免无休止地继续思考。



论文 Figure 2:PUMA 框架总览 —— 冗余探测器定位候选退出点,答案复核确认后停止,Loop Breaker 兜底。左侧真实轨迹演示它删掉收敛后的冗余续写、同时保留完整推理前缀。

主实验:平均少 26.2% token,

准确率基本不掉,速度也真的上去了

作者在 5 个长思考模型(DeepSeek-R1-Distill-Qwen 7B/14B/32B、Llama-3.1-Nemotron-Nano-8B、Qwen3-30B-A3B-Thinking)和 5 个高难度基准(MATH-500、AIME24/25、OlympiadBench、GPQA-Diamond)上测试 PUMA。

结果是:平均减少 26.2% token,准确率基本保持;部分设置下,因为及时避开了答案后的「后期漂移」,准确率反而略有上升。这点和单纯要求模型「少说一点」不同。prompt 压缩会连必要推理一起压掉:例如在 Qwen3-30B 上,这类方法把准确率从 Full CoT 的 81.7% 拉低到 45–60%,PUMA 则保持在 82.5%。

与只看答案 readiness 的 Answer Convergence、Dynasor、DEER 相比,PUMA 的准确率 — 效率权衡也更稳定。省下的 token 还能转成真实推理速度:DS-7B 加速 1.40×,DS-14B 加速 1.28×。

LLM-as-Judge 的结果也显示,PUMA 保留下来的思维链在连贯性、简洁性和论证充分性上平均得分最高 —— 它做的是「删掉收敛后的冗余」,不是把思考过程生硬砍半。



论文 Table 1:三个代表性模型 × 五个基准的准确率(Acc)—token 缩减率(TR)对比(完整五模型结果见附录 Table 14)。



论文 Figure 3:token 缩减能否转化为真实提速 ——PUMA 的冗余探测器仅占 0.4–1.1% 耗时,答案复核开销也很小。



论文 Table 2:LLM-as-Judge 对各方法保留推理链的质量评分,PUMA 平均最高。

可迁移到代码生成和多模态推理,

还能把「该停就停」训练进模型

这个信号还能零样本迁移到文本数学之外:代码生成(LiveCodeBench,仅调整冗余阈值 τ_sim=0.50)减少 18–19% token、pass@1 变化不超过 1.5 个点;多模态推理(MathVista / MathVision)不重训、不调参,token 减少 23.8–33.6%。

更进一步,把 PUMA 选出的退出位置当作监督信号,用 SFT / DPO / GRPO内化进模型后,部署时不带任何 PUMA 模块也能自己「该停就停」——PUMA-RL 的平均准确率(67.0)与 token 缩减(34.9%)都反超免训练版 PUMA(66.2 / 24.3%)。



论文 Table 3:迁移到代码(LiveCodeBench)与多模态(MathVista / MathVision)推理的结果。



论文 Table 5:用 SFT / DPO / GRPO 把 PUMA 的停机信号内化进模型(评测集 MATH-500、AIME24、GPQA-Diamond)。

一句话总结:推理早停最容易踩的坑,是把「trial answer 的 readiness」当成「推理收敛」。PUMA 用「最近的推理是否还在产生新的语义进展」定位候选停机点,再用答案复核兜底 —— 实验表明,这是一个可靠、可迁移、也可学习的高效推理信号。(Limitation:方法依赖分步推理轨迹,当输出很短或难以切分时效果会打折。)

作者介绍


本文第一作者闵德海为伊利诺伊大学芝加哥分校计算机系博士生,导师为 Philip S. Yu 教授(ACM/IEEE/AAAS Fellow)。他目前在 ByteDance 美国团队担任 Research Scientist Intern,工作聚焦 Agent Harness 与 Agent 数据合成,研究方向包括 RAG/Deep Research 及高效可信大模型。该论文合作单位包括 UIC、Google Research、UIUC 和米兰理工大学。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
“林肯”号遭遇折射美国海军衰落

“林肯”号遭遇折射美国海军衰落

参考消息
2026-09-09 12:27:49
都怪穆帅!皇马1.4亿欧新援5场0进球0助攻,赛季0首发,不受重用

都怪穆帅!皇马1.4亿欧新援5场0进球0助攻,赛季0首发,不受重用

体育知多少
2026-09-09 05:58:58
文文已确认遇害,年仅25岁!遗体已被找到,原计划两天前去新单位入职

文文已确认遇害,年仅25岁!遗体已被找到,原计划两天前去新单位入职

麓谷隐士
2026-09-09 00:10:03
320位院长落马、顶级院士被抓!而这位老人为救人放弃了天价财富

320位院长落马、顶级院士被抓!而这位老人为救人放弃了天价财富

江启
2026-09-03 11:51:47
据相关史料记载,仁川登陆后,11万人民军曾退入中国境内整训,被整编为三个军团

据相关史料记载,仁川登陆后,11万人民军曾退入中国境内整训,被整编为三个军团

历史甄有趣
2026-09-09 10:55:21
中美起冲突,新加坡挺美国;中日起冲突,新加坡挺日本;中菲起冲突,新加坡挺菲律宾;中印起冲突,新加坡挺印度

中美起冲突,新加坡挺美国;中日起冲突,新加坡挺日本;中菲起冲突,新加坡挺菲律宾;中印起冲突,新加坡挺印度

扶苏聊历史
2026-09-07 17:16:16
林豆豆有多美?1966年和毛主席在天安门的合影,22岁的她青春靓丽动人

林豆豆有多美?1966年和毛主席在天安门的合影,22岁的她青春靓丽动人

钟离踏忆
2026-09-09 06:45:08
女子和情人车震后被杀,丈夫找一夜未果,2024年情人:杀她是她想提出分手

女子和情人车震后被杀,丈夫找一夜未果,2024年情人:杀她是她想提出分手

汉史趣闻
2026-09-09 11:02:17
我跟男友去领证,他中途去厕所,手机突然亮了,上面弹出一句:哥,你可千万别忘了告诉她,你还有个4岁的女儿

我跟男友去领证,他中途去厕所,手机突然亮了,上面弹出一句:哥,你可千万别忘了告诉她,你还有个4岁的女儿

晓艾故事汇
2026-08-25 09:03:53
儿童患癌越来越多!再三呼吁:这些东西少给孩子吃!危害大

儿童患癌越来越多!再三呼吁:这些东西少给孩子吃!危害大

橘子约定
2026-08-30 14:06:45
明天凌晨苹果新CEO迎来首秀,首款折叠iPhone有哪些悬念?

明天凌晨苹果新CEO迎来首秀,首款折叠iPhone有哪些悬念?

澎湃新闻
2026-09-09 06:46:28
她若不牺牲,元帅名单中或许就会出现女性了,贺龙:她的军事成就比我高

她若不牺牲,元帅名单中或许就会出现女性了,贺龙:她的军事成就比我高

磊子讲史
2026-09-08 15:35:32
奥委会这下尴尬了:2036年奥运会,中国上海、成都、广州都没申办

奥委会这下尴尬了:2036年奥运会,中国上海、成都、广州都没申办

轻扬墨雨
2026-08-14 13:21:23
拒绝和同胞握手!两位中国台湾选手互不搭理,12年旧账藏不住了

拒绝和同胞握手!两位中国台湾选手互不搭理,12年旧账藏不住了

凉了时光人
2026-09-09 17:03:00
新款 Apple Watch 王炸新功能泄露,这确实太强了!

新款 Apple Watch 王炸新功能泄露,这确实太强了!

XCiOS俱乐部
2026-09-08 13:18:42
2026乌克兰残局已定,结局早已写好:一旦崩溃,泽连斯基将手提现金,逃往西方

2026乌克兰残局已定,结局早已写好:一旦崩溃,泽连斯基将手提现金,逃往西方

怪味历史连连看
2026-09-09 12:16:07
医生发现:能吃能喝的老人,基本在63岁,就已经不做这6件事了!

医生发现:能吃能喝的老人,基本在63岁,就已经不做这6件事了!

任医生聊健康
2026-09-08 19:55:07
2026年养老金可能暂停调整,与社保基数上涨乏力有关?明年如何?

2026年养老金可能暂停调整,与社保基数上涨乏力有关?明年如何?

虎哥闲聊
2026-09-09 10:44:17
上海交大“自曝”困境:学生走在了老师前面,高校正在被边缘化

上海交大“自曝”困境:学生走在了老师前面,高校正在被边缘化

狐狸先森讲升学规划
2026-09-08 00:40:03
承认吧,如今很多家庭已经供不起一个大学生本科四年的全部开销了

承认吧,如今很多家庭已经供不起一个大学生本科四年的全部开销了

天天热点见闻
2026-09-07 06:10:14
2026-09-09 18:23:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13952文章数 142731关注度
往期回顾 全部

科技要闻

AI重大突破!OpenAI称解开近百年数学难题

头条要闻

父亲病逝独生女未露面被伯父起诉剥夺继承权 女方发声

头条要闻

父亲病逝独生女未露面被伯父起诉剥夺继承权 女方发声

体育要闻

16年后再破门,被皇马放弃的少年没认输

娱乐要闻

郭德纲的商业版图,藏着不知道的真相

财经要闻

知情人士证实DeepSeek备战科创板IPO

汽车要闻

魏牌全新蓝山申报信息曝光 方盒子造型 5/6座可选

态度原创

手机
家居
健康
本地
公开课

手机要闻

苹果首款折叠机据传定名为iPhone Duo 可能支持Apple Pencil

家居要闻

2026建博会(广州) 公装联探展交流活动

中风康复为何像“抽丝剥茧”?

本地新闻

宁波,中国制造的隐藏大佬

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版