网易首页 > 网易号 > 正文 申请入驻

面向无梯度推理时学习的双过程架构:ReflexGrad

0
分享至

ReflexGrad:面向无梯度推理时学习的双过程架构

ReflexGrad: A Dual-Process Architecture forGradient-Free Inference-Time Learning

https://arxiv.org/pdf/2511.14584v2



摘要
扩展推理时计算已成为一种强大的范式——但更长时间的思考并不等同于学习。当前针对大语言模型的扩展推理方法会分配更多计算资源用于“思考”,但本质上仍是静态的:它们无法在执行过程中从自身犯下的错误中调整适应。在线强化学习能够实现适应,但需要在运行时进行梯度更新——这成本高昂、容易导致灾难性遗忘,且在部署中不稳定。我们提出 ReflexGrad,一种用于真正推理时学习的无梯度框架:无需重训练、无需权重更新、无需示范即可实现适应。我们的关键洞察是,有效的运行时学习需要两种互补机制——在前进过程中快速修正策略,以及在陷入困境时进行审慎的因果诊断——并在二者之间进行智能路由。ReflexGrad 的实现方式是,在保持模型权重冻结的同时,通过文本反馈优化一条自然语言“策略”。当失败发生时,系统会分析最近的动作-结果序列,以识别根本原因,并在同一执行过程中立即应用修正——从而无需多次试错。在多种交互式任务上进行零样本评估,且无需任务特定工程,ReflexGrad 展现了强大的单次执行性能,表明无梯度的推理时学习不仅在理论上有吸引力,而且在实际中可行。

关键词:推理时学习,双过程架构,文本梯度,自我反思,LLM智能体,零样本泛化


代码:https://github.com/qpiai/reflexgrad

1 引言

人工智能系统能否在执行过程中从错误中学习——无需权重更新、无需示范、也无需多次试错?我们将这种能力称为“推理时学习”,它将使已部署的系统能够实时适应,同时规避在线训练的成本和风险。然而,当前的方法尚不足:传统强化学习需要权重更新,这有导致灾难性遗忘的风险[8];而最近的推理时扩展方法[9, 14, 16–18]则增加了思考的深度,却并未实现真正的学习。

设想一个智能体试图冷却平底锅:它尝试“用冰箱冷却平底锅”,但失败了,因为冰箱门是关着的。即便是前沿模型[2, 11],它们知道“容器必须打开”,却常常无法在执行过程中从这类错误中恢复——它们无法提取教训并在同一回合中应用于后续动作。当前系统要么需要6次以上的试错回合才能学会此类模式[12],要么完全失败。我们的实验证实了这一差距:零样本的GPT-5在ALFWorld任务上尽管拥有强大的通用推理能力,成功率却仅为47.1%。

我们提出 ReflexGrad,一种填补这一空白的无梯度架构。受双过程认知理论[5]启发,我们认为有效的运行时学习需要三种互补机制,并辅以智能路由:

  • 任务分解:在执行前,将高层任务分解为有序的子目标(TODO列表),以提供策略结构并防止动作循环。

  • 快过程(TextGrad):通过基于动作结果计算的文本梯度信号来快速修正策略——在前进过程中提供渐进式改进。

  • 慢过程(Reflexion):在陷入困境时进行审慎的因果诊断——分析近期历史以识别系统性失败模式。

关键创新在于基于进度的路由:大约85%的步骤使用快过程以保证效率,而慢过程诊断仅在连续失败表明真正卡住时才会触发。TODO检查点则确保始终向前推进。

ReflexGrad在单次执行中,于ALFWorld上达到了95.6% ± 1.5%的成功率——比零样本基线提升了48个百分点,且可与需要6次以上回合和示范的多试错方法相媲美。跨领域评估在TextWorld上(89%对56%基线)也验证了其无需领域特定调优的泛化能力。我们的贡献如下:

  1. 统一的推理时学习架构,结合了层次化任务分解、基于文本梯度的快速策略修正,以及审慎的因果诊断——由新颖的基于进度的路由机制驱动。

  2. 基于进度的路由机制,智能地在快过程和慢过程之间分配计算资源,并借助TODO检查点防止动作循环并确保持续向前推进。

  3. 跨领域推理时学习的实证验证:在两种不同环境(共43个任务)中,无需权重更新、示范或领域特定调优,达到94.2%的平均成功率。

2 相关工作

我们将 ReflexGrad 与先前方法在三个关键维度上进行对比:(1)实时策略适应——该方法能否在执行过程中更新自身行为?(2)因果失败诊断——能否识别动作失败的根源?(3)单次试错学习——能否在不依赖多个回合的情况下实现高性能?

无适应的推理。ReAct [19] 将思维链推理与动作交错进行,支持可解释的单次决策。Inner Monologue [4] 在此基础上,将环境反馈纳入具身智能体的规划中。然而,这些方法既缺乏策略适应,也缺乏因果诊断——如果某个动作失败,推理或许会改变,但底层策略保持固定不变。智能体无法从经验中学会“容器必须打开”;它要么已经知晓这一点,要么就会反复失败。

文本梯度优化。TextGrad [20] 首次提出将大语言模型的反馈视为用于提示优化的梯度,从而实现实时策略适应。然而,TextGrad 是为离线多轮迭代优化而设计的,既缺乏因果诊断,也不具备单次试错能力——它只能建议“尝试另一个位置”,却无法识别动作失败的根源(例如,前提条件未满足)。DSPy [6] 与此类似,支持提示编程,但侧重于流水线优化。

面向智能体的自我反思。Reflexion [12] 开创了带有因果诊断的言语强化学习——通过分析失败的回合来识别根本原因。Self-Refine [10] 应用迭代式自我反馈来优化输出,而 LATS [21] 则通过结合树搜索与反思来统一推理和规划。Voyager [15] 通过开放式探索构建技能库,但需要跨回合的持久记忆。然而,这些方法要么缺乏回合内的策略适应,要么不具备单次试错学习能力:Reflexion 在执行过程中使用静态提示,只能跨回合学习,在 ALFWorld 上需要 6 次以上回合才能达到 91% 的成功率。ReflAct [7] 引入了目标状态反思,但仍依赖示范。

ReflexGrad。实现单次推理时学习的关键创新在于基于进度的路由——一种根据执行信号来决定何时使用哪种学习过程的机制。快速的策略修正处理常规调整(占步骤的 85%),而高成本的因果分析仅在连续失败表明真正卡住时才会被触发。这种路由机制带来了:(1)实时策略适应,实现快速的战术修正;(2)因果诊断,在卡顿时识别系统性失败模式;(3)层次化任务分解,配合 TODO 检查点以防止动作循环。该路由机制在单次零样本执行中达到了 95.6%的成功率——表明基于进度的路由能够实现真正的推理时学习。

3 问题表述


4 方法

ReflexGrad 通过三个互补组件结合智能路由来实现推理时学习。完整的执行循环请参见附录中的算法 1。


4.1 架构概览

ReflexGrad 包含三个互补能力:



4.2 层次化任务分解




4.3 快速策略修正(过程 1)

快速过程通过文本梯度计算提供渐进式改进,将 TextGrad 框架 [20] 适配到在线序贯决策场景中。




4.4 慢速因果诊断(过程 2)



4.5 基于进度的路由


4.6 双向耦合

这两个过程是双向耦合的:

反思 → TextGrad:反思产生的洞察会成为 π θ 中的持久约束。当慢速过程识别出“容器必须打开”这一规则后,后续的梯度计算将以该约束为上下文进行,从而确保快速过程遵循已习得的因果规则。

TextGrad → 反思:梯度历史为因果诊断提供证据。当反思分析停滞的进度时,它会接收到那些失败的梯度——从而实现更深入的诊断(例如,如果“尝试不同位置”反复失败,那么问题在于如何交互,而不在于哪里交互)。

为何二者缺一不可:TextGrad 擅长战术优化,但无法诊断结构性失败。Reflexion 擅长因果诊断,但代价高昂。ReflexGrad 将两者结合,实现了二者单独都无法提供的单次试错学习。

5 实验 5.1 实验设置

环境。ALFWorld [13],基于文本的家务任务环境,需要多步推理。

基准。在 零样本、单次执行设定下涵盖 34 个多样化任务——无示范、无先前经验、无多次试错。

模型。使用 GPT-5 进行 TODO 分解、损失计算、梯度合成和反思生成;使用 GPT-4o 进行动作选择。

基线:零样本 LLM、Reflexion [12]、ReflAct [7]。

5.2 主要结果

表 1 和图 2展示了实验结果:



强劲的单次执行性能。ReflexGrad 在无示范的情况下达到了 95.6% ± 1.5%的成功率(3 次运行中 34 个任务成功 32–33 个),比零样本 GPT-5(47.1%)提升了 48 个百分点,且与需要 6 次以上回合的多试错方法相当。

零动作循环。与基线方法每回合出现 3–8 次重复失败不同,ReflexGrad 通过智能路由实现了零循环。

错误分析。各次运行中持续出现的失败发生在“检查”类任务中,即智能体需要找到某个物体并在灯下对其进行检查。这类任务要求协调多个子目标(找到物体、找到灯、导航、使用灯)——这揭示了当因果链特别长时的一个局限性。

统计说明。结果为 3 次独立运行(使用不同随机种子)的均值 ± 标准差。相对于基线 48 个百分点的提升在各次运行中保持一致(方差为 ±1 个任务)。

计算成本。ReflexGrad 每步大约需要 4–6 次 LLM 调用(动作生成、损失计算、梯度计算、周期性策略更新)。对于一个典型的 15 步成功回合,总计约 75 次调用,而零样本基线约为 15 次(5 倍开销)。然而,ReflexGrad 在 1 次试错中即可成功,而 Reflexion 需要 6 次试错,因此在达到相同成功率时,总成本相当。

5.3 消融实验

为了分离各组件的贡献,我们在与完整系统完全相同的设置(相同模型、超参数、任务和随机种子)下,评估了仅含单一组件的变体。

分析。表 2 显示了跨环境的一致模式:(1)仅 Reflexion通过因果诊断带来了适度提升(ALFWorld +5 个百分点,TextWorld +5 个百分点),但缺乏回合内的快速适应;(2)仅 TextGrad实现了更强的战术优化(+23 个百分点,+16 个百分点),但无法诊断结构性失败;(3)ReflexGrad(+49 个百分点,+33 个百分点)将两者结合,产生的协同效应超过了各组件单独贡献之和。


5.4 跨领域泛化

为了评估泛化能力,我们在 TextWorld [3] 上进行了测试——这是一个程序化文本游戏环境,其任务结构与 ALFWorld 不同。我们使用完全相同的超参数(未进行任何调优),在烹饪、寻宝和解谜类别的 9 个任务上进行了测试。

ReflexGrad 在 TextWorld 上达到了 89% 的成功率(9 个任务中成功 8 个),而基线为 56%——提升了 33 个百分点(图 3)。综合两个领域:在 零领域特定工程的情况下,成功率达到 94.2%(43 个任务),表明推理时学习能够在根本不同的环境之间迁移。

5.5 定性分析

我们展示了两个执行轨迹,以说明双过程架构在实践中的运作方式(完整的逐步骤轨迹见附录 D)。

示例 1:双过程均需参与

任务:“冷却一个平底锅并将其放到台面上。”智能体开始搜索橱柜以寻找平底锅。TextGrad 快速学会“在搜索前先打开容器”(3 步内完成战术修正)。然而,在连续 5 步低进展地搜索橱柜后,Reflexion 被触发并诊断出根本原因:“炊具通常位于炉灶附近,而不是橱柜里。”这一策略性洞察将智能体引向炉灶燃烧器,并在那里找到了平底锅。后续步骤——拿起、通过冰箱冷却、放到台面上——在 TextGrad 的指导下顺利进行。关键洞察:TextGrad 处理“如何交互”的问题;Reflexion 决定“去哪里搜索”的问题。任务在 11 步内完成,零循环。

示例 2:仅快速过程即可胜任

任务:“将一个干净的杯子放入橱柜。”整个过程中进度评分始终保持在 4 以上——智能体在台面上找到杯子,在水槽处清洗,然后将其放入橱柜。路由函数 ϕ ϕ从未触发 Reflexion,因为进度从未停滞。仅靠 TextGrad 就通过策略更新学会了“使用水槽完成清洗任务”。关键洞察:基于进度的路由将昂贵的慢速诊断仅保留给真正需要它的任务。任务在 9 步内完成,零循环。

6 讨论

双过程为何有效。该路由实现了高效的计算分配:85% 的步骤使用快速过程处理常规修正,而 15% 的步骤触发慢速诊断以应对系统性失败。两者单独使用都无法成功——快速修正无法诊断结构性问题,而慢速诊断若在每步都使用则成本过高。这与双过程认知理论 [5] 相呼应:系统 1 处理常规决策;当模式匹配失效时,系统 2 介入。

局限性。(1)需要能力较强的大语言模型——未来工作应评估较小规模模型的表现;(2)结果基于文本环境;视觉领域可能需要适配;(3)增加更多基准(如 WebShop、ScienceWorld)将有助于进一步验证泛化性主张。

7 结论

我们提出了 ReflexGrad,一种用于无梯度推理时学习的双过程架构。通过将快速策略修正与审慎的因果诊断相结合——并基于进度信号在两者之间进行智能路由——ReflexGrad 能够在单次执行过程中实现真正的学习,无需权重更新、示范或多轮试错。我们的结果——在两个不同领域的 43 个任务上达到 94.2%的成功率——表明推理时学习在实际中是可行的,且无需领域特定调优即可泛化,为自适应 AI 系统开辟了新的方向。

原文链接:https://arxiv.org/pdf/2511.14584v2

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
记者拿副驾夺机质问爱尔兰主帅:你支持的人为何想杀以色列乘客?

记者拿副驾夺机质问爱尔兰主帅:你支持的人为何想杀以色列乘客?

桂系007
2026-10-04 16:54:08
iPhone 18 Pro Max彻底翻车,苹果社死了

iPhone 18 Pro Max彻底翻车,苹果社死了

李东阳朋友圈
2026-10-05 16:21:15
9月销量出炉,又是“一米穿五界”!网友:余承东不必尴尬,华为乾崑ADS车型已经遍地开花

9月销量出炉,又是“一米穿五界”!网友:余承东不必尴尬,华为乾崑ADS车型已经遍地开花

大白聊IT
2026-10-02 22:29:11
贾乃亮带甜馨迪拜出游!甜馨长到认不出!和贾乃亮搞怪自拍

贾乃亮带甜馨迪拜出游!甜馨长到认不出!和贾乃亮搞怪自拍

喜欢历史的阿繁
2026-10-05 00:15:37
王心凌的健身照绝了!这个状态,谁敢想她都44岁了?

王心凌的健身照绝了!这个状态,谁敢想她都44岁了?

小方说跑步
2026-10-03 19:20:06
中网16强对阵出炉,2-1,2-0,斯瓦泰克晋级,郑钦文下轮对手确定

中网16强对阵出炉,2-1,2-0,斯瓦泰克晋级,郑钦文下轮对手确定

南海浪花
2026-10-05 17:32:19
爱奇艺独播,38集年代刑侦大剧来袭!全演技派阵容,又有好剧追了

爱奇艺独播,38集年代刑侦大剧来袭!全演技派阵容,又有好剧追了

乡野小珥
2026-10-05 02:08:54
百年无解历史难题:为何百万大军无人割据?毛主席的智慧全是人性

百年无解历史难题:为何百万大军无人割据?毛主席的智慧全是人性

听雪禅
2026-10-05 16:40:07
太心酸了!42岁著名女歌手江苏走穴,宾客只顾吃席没人搭理

太心酸了!42岁著名女歌手江苏走穴,宾客只顾吃席没人搭理

小徐讲八卦
2026-02-12 12:13:20
开国上将晚年坦言:别再骂李德无能,草地分兵他救了红军

开国上将晚年坦言:别再骂李德无能,草地分兵他救了红军

利刃说史
2026-10-05 13:00:00
“滚回你们自己的国家!”日本42万穆斯林遭仇恨,风向彻底变了

“滚回你们自己的国家!”日本42万穆斯林遭仇恨,风向彻底变了

风流女汉
2026-06-15 15:52:33
饶颖:赵忠祥与我发生关系7年,他的特殊性癖,让我身心受到伤害

饶颖:赵忠祥与我发生关系7年,他的特殊性癖,让我身心受到伤害

林轻吟
2026-09-19 16:09:02
除了房子越来越不值钱外,2026年我国还将迎来4大“贬值潮”!

除了房子越来越不值钱外,2026年我国还将迎来4大“贬值潮”!

职场资深秘书
2026-10-05 11:38:09
54岁藤原纪香,从未活在美颜滤镜里

54岁藤原纪香,从未活在美颜滤镜里

草莓解说体育
2026-09-15 06:46:01
红薯正大量上市!研究发现:糖尿病吃一次红薯,等于给血糖添堵?

红薯正大量上市!研究发现:糖尿病吃一次红薯,等于给血糖添堵?

王医生健康讲坛
2026-10-05 20:40:06
港圈金牌经纪人霍汶希杂志同框女儿,干爹谢霆锋成焦点,亲生爸爸成最大问号

港圈金牌经纪人霍汶希杂志同框女儿,干爹谢霆锋成焦点,亲生爸爸成最大问号

草莓解说体育
2026-10-05 05:55:36
44岁姚笛独自在杭州豪宅家中煮泡面,眼神中难掩落寞

44岁姚笛独自在杭州豪宅家中煮泡面,眼神中难掩落寞

追影客栈
2026-10-03 16:08:17
最高法:回村定居的退休人员,有权重修祖宅或申请宅基地建房

最高法:回村定居的退休人员,有权重修祖宅或申请宅基地建房

智慧生活笔记
2026-10-01 09:54:07
19岁李嫣跟老爸聚餐!手不离烟动作熟练,170cm身材干瘪太像王菲

19岁李嫣跟老爸聚餐!手不离烟动作熟练,170cm身材干瘪太像王菲

一娱三分地
2025-08-14 13:28:27
笑死!北京会惩罚每一个过度规划的游客,网友:兵马俑都没你能走

笑死!北京会惩罚每一个过度规划的游客,网友:兵马俑都没你能走

夜深爱杂谈
2026-10-01 20:22:18
2026-10-05 22:43:00
CreateAMind incentive-icons
CreateAMind
CreateAMind.agi.top
1610文章数 21关注度
往期回顾 全部

科技要闻

2026年诺奖:三名科学家因光遗传学获奖

头条要闻

高市早苗新内阁遭"当头一棒":日农相丑闻被披露遭围攻

头条要闻

高市早苗新内阁遭"当头一棒":日农相丑闻被披露遭围攻

体育要闻

30天30队·热:扬尼斯、阿德巴约与克雷

娱乐要闻

蔡康永回应漏洞百出,太平轮旧事被扒

财经要闻

零跑声明切割!蔡康永两面人身份被抵制

汽车要闻

方程豹9月热销破4万 首款皮卡鲨鱼将于四季度上市

态度原创

家居
本地
健康
数码
公开课

家居要闻

2026建博会(广州) 公装联探展交流活动

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

刷酸祛痘,为什么有人翻车?

数码要闻

AMD锐龙AI Max Pro 495亮相 统一内存最高192GB

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版