智猩猩AI整理
编辑: 没方
LLM Agent 在长程任务中的递归自我改进(RSI)始终难以落地。
随着任务的拉长,历史上下文会不断膨胀,已完成步骤、过期信息、未解决目标和执行噪声混杂在一起,Agent 很容易忘记现在还差什么,进而调用错误的 Skill,甚至误以为任务已经完成。
为此,新加坡国立大学、斯坦福大学、牛津大学、普林斯顿大学的研究者们开源了一个很有意思的项目Recuris, 这是 面向长时程 Agent Harness 的经验记忆与工作记忆 递归 进化框架。
![]()
在4个长程 Benchmark、10种不同规模模型上,Recuris 在37组完成评测的组合中,有35组任务成功率都提升了。
![]()
其中,在τ²-Retail上,GPT-5.6 Sol 从58.3% 提升到76.1%,提升17.8个百分点;Claude Opus 5 从72.4% 提升到87.9%,提升15.6个百分点。
而且任务越长,Recuris 的优势反而越明显。在最长一档任务中,成功率提升达到32.2个百分点。
01
Agent 能否在不更新任何模型权重
的情况下,实现递归式自我改进?
Recuris 围绕一个冻结参数的 LLM,构建了两个紧密耦合的循环,从而实现递归式自我改进。
![]()
(1)任务内执行:经过验证的经验记忆-工作记忆耦合
Working Memory,也就是工作记忆,会持续维护一个紧凑、基于证据的任务状态,用来表示 Agent 当前已经完成了什么,以及还有哪些目标尚未解决。
这个不断变化的任务状态,会决定 Agent 应该在什么时候,从经验记忆中调用可复用的 Skill。
Agent 执行动作以后,系统还会根据环境反馈进行验证,确认任务是否真的取得了进展。
只有验证通过以后,Working Memory 才会更新。
因此,整个任务执行过程形成了一个闭环:
任务状态 → Skill 调用 → 执行 → 验证 → 任务状态更新。
![]()
(2)跨任务改进:递归式 Skill Memory 进化
经验记忆-工作记忆耦合机制,还会把 Agent 的执行过程转化成结构化的诊断证据。
有一个固定不变的 Meta-Agent 会分析这些执行轨迹,并将失败定位到具体的 Memory 组件。
例如可能是已经存储的 Skill 出了问题,也可能是 Working State 的表示方式不够准确,还可能是 Skill 调用策略或者 Checker 存在问题。
随后,Meta-Agent 会针对这些具体问题提出定向修改。
但这些候选修改不会直接写入系统。
它们必须先通过一个固定的 Validation Gate,也就是验证门。只有验证通过的更新,才会被正式接纳。
一旦新的 Memory 被接受,它就会改变未来 Agent 的执行方式。
新的执行行为又会产生新的证据,为下一轮自我改进提供材料。
于是,第二个循环形成:
记忆 → 行为 → 证据 → 失败定位 → 定向修改 → 更好的记忆。
这就是 Recuris 最核心的递归循环。
Memory 决定 Agent 如何行动,Agent 的行为又会暴露当前 Memory 存在哪些局限。这些局限继续指导下一轮 Memory 更新。
02
使用方式
目前项目要求Python 3.12 和 Git。如果要运行 SkillFlow 或 Terminal-Bench 2.1,还需要提前安装 Docker,以及 Compose V2。
首先克隆仓库:
cd recuris然后安装依赖:
pip install -e ".[all]"接下来,在项目根目录创建.env,配置兼容 OpenAI API 格式的模型 Endpoint:
OPENAI_BASE_URL=...如果使用 Qwen 等开源模型,可以通过 vLLM 在本地启动模型。例如:
--tool-call-parser hermesτ²-Bench 会让 Agent 通过 Tool Calling 调用工具,所以这里两个 Tool Calling 参数是必须的,不是可选项。如果不添加,vLLM 会拒绝请求,最终所有 Episode 都无法得到评分。
安装并初始化 Benchmark:
recuris check-data --benchmark tau2接下来让 Recuris 指向刚才部署好的模型:
# export ARGS='{"api_base":"'"$OPENAI_BASE_URL"'","api_key":"'"$OPENAI_API_KEY"'","temperature":0.0,"timeout":360,"num_retries":2,"reasoning_effort":"high","allowed_openai_params":["reasoning_effort"]}'分别运行有 Skill Memory 和无 Skill Memory 的实验,对比结果:
recuris compare --a retail_skill --b retail_bare03
总结
Recuris 最有意思的地方,并不是又给 Agent 增加了一套 Memory。
它实际上换了一种思路理解 Agent 的自我改进。
过去,我们往往把“AI 变强”理解成继续训练模型、更新权重,或者不断修改 Prompt。但 Recuris 展示了另一条路径,模型本身可以完全冻结,真正持续进化的是包裹在模型之外的 Agent Harness。
Working Memory 负责维护“我现在做到哪了”,Experiential Memory 保存“过去遇到这种问题该怎么做”;执行过程继续产生新的结构化证据,Meta-Agent 再从失败中定位具体的 Memory 缺陷,生成局部修改,并经过 Validation Gate 后写回系统。
于是,一个闭环出现了:Memory 改变行为,行为产生经验,经验暴露 Memory 的缺陷,而这些缺陷又反过来推动下一轮 Memory 进化。
关注+星标,获取AI前沿进展与开源一线动态
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.