网易首页 > 网易号 > 正文 申请入驻

Agent记忆新范式Recuris:3B小模型到Claude Opus 5全线暴涨

0
分享至



近年来,大语言模型(LLM)智能体在长程任务中展现出强大潜力,但现有智能体框架在记忆的使用方式与迭代方式上仍面临显著挑战。

传统方法多在任务开始前根据任务检索记忆或在交互过程中通过上下文来检索经验,随着任务的推进,在任务开始阶段一次性检索的记忆已无法反映当前的问题,膨胀的上下文中又混杂着过期信息与执行噪声,检索因此越来越不可靠。检索之所以不可靠,根源并不在于缺少有用的经验,而在于缺少一个紧凑而可靠的任务状态,去把已积累的经验与当前的执行需求持续对齐。

而近期的递归式自我改进(RSI)在长程任务中也面临同样的挑战,记忆的迭代几乎只由下游任务的分数决定,无法精准定位到产生问题的具体组件,因此更新往往是粗粒度的且缺乏针对性,而面对长程任务中的推理轨迹,不断增长的上下文长度也让智能体难以在分析并在其中准确找到最有效的改进策略。

在此背景下,新加坡国立大学、普林斯顿大学与斯坦福、牛津等研究团队合作提出了 Recuris(Recursive Experiential–Working Memory Evolution),作为首个将递归自我改进应用在记忆控制层内的智能体架构,Recuris 通过三项核心技术突破,无需训练即成功实现了从 3B 小模型到 Claude Opus 5 的全面提升。



  • 论文标题:Recursive Experiential–Working Memory Evolution for Long-Horizon Agent Harnesses
  • 代码仓库:https://github.com/Gen-Verse/Recuris
  • 论文链接:https://arxiv.org/abs/2608.24876

Recuris 与既有记忆方法的差别体现在两个维度上:记忆怎么被使用,以及记忆怎么被迭代。



Recuris 与既有记忆方法的两个范式差别

记忆怎么用:既有框架对着不断膨胀的对话历史做记忆的注入或检索,在长程任务中容易产生幻觉,导致技能调用错位;Recuris 在执行事件上取用技能,并由检查器把环境返回转成经过验证的状态更新,而不是听信对话里的一句「已完成」。记忆怎么迭代:既有框架从单次任务成败出发重写整个记忆;Recuris 读取结构化轨迹,把失败定位到具体组件、只修改引起问题的组件,并且只有通过验证集的门控后才被接受。

性能表现:

从 3B 小模型到 Claude Opus 5 全面暴涨

研究团队在四个长程基准(τ²-Retail、τ²-Airline、SkillFlow、Terminal-Bench 2.1)与十个模型上进行了评测。



Recuris 在从 3B 开源模型到前沿模型上的表现

从3B 的小模型到 Claude Opus 5 和 GPT-5.6-Sol 这样的前沿模型上,Recuris 均展现出了大幅的性能提升。同时在长程任务上,这一优势不随交互轮次的增加而衰减,并大幅降低了长程执行中常见失败模式的发生率。

长程可靠性:

优势不随任务变长而衰减

长程能力的常见评价困难在于,「任务变长」和「智能体提前放弃」会互相混淆。因此研究团队按任务本身需要多少轮才能完成把 τ²-Retail 分成四个分位。



按任务固有长度分位的长程表现

Recuris 在全部四个分位上都领先基线,幅度 +17.0 至 +44.7,不随任务变长而单调下滑。

结构化轨迹让失败可以被定位

递归改进的前提是知道该修哪里。研究团队没有停留在观察记忆,而是主动向记忆中注入已知故障,再让一个固定的裁判从三种证据中判断是哪个组件出了问题:只看最终成败、看原始轨迹、或看 Recuris 产出的结构化轨迹Γ。故障池按类别均衡构造,因此一个「永远答同一个组件」的裁判会得到 33.3%。



只看成败的定位准确率13.0%,低于常答同一答案的基线;看原始轨迹 37.0%,仅比基线高不到四个点;而看结构化轨迹达到64.8%,接近基线的两倍。

演化出的记忆能迁移:

跨任务,也跨模型

跨任务:记忆从16 个失败任务中蒸馏而来,在从未参与过的 86 个任务上仍带来+9.01 至 +17.44的提升。这一结果验证了 Recuris 的核心假设:结构化的失败轨迹中蕴含的信息足以支撑跨任务迁移。



演化出的记忆在留出任务上的表现

跨模型:一份记忆只在部署模型上演化一次,随后原封不动交给从未参与演化的前沿模型,同样也能产生明显提升,进一步证明了框架的泛化性。



关键技术解析

论文给出的判断是:长程场景下真正的瓶颈并非「没有可用的经验」,而是缺少一个紧凑而可靠的任务状态,用来把已积累的经验与当前的执行需求持续对齐。Recuris 的三项核心技术都围绕这一判断展开。



Recuris 架构总览

经验记忆 — 工作记忆耦合(EM–WM Coupling)

工作记忆(WM)正是那个缺失的状态表示。它持续追踪智能体的当前进展与未解决的目标,并据此从经验记忆(EM)中选取最合适的技能;技能执行后,环境反馈验证进展并更新状态,闭合成一个循环:

任务状态 → 技能选择 → 执行反馈 → 更新的任务状态

具体而言,技能调用发生在执行事件上:草拟一次状态改变调用,或到达一个交互轮次的边界,而不是对着膨胀的历史上下文做相似度匹配。智能体动作之后,检查器依据环境返回的工具回执验证进展,只有被证据支持的状态变更才会被提交:调用了技能、或尝试了一次工具调用,都不算真正完成。

结构化轨迹与组件级失败定位

既有方法大多只能从最终成败中学习,这类信号说明「出了问题」,却无法指出该修的是存储的技能、追踪的任务状态、技能调用机制,还是进度验证器。EM–WM 耦合把任务状态、被调用的技能、动作与观测显式串联起来,把执行过程本身变成了关于「记忆如何影响行为」的证据:

EM–WM 耦合 → 结构化证据 → 失败定位 → 靶向记忆演化

它把「这次任务失败了」变成「是哪一个组件让它失败」,从而使局部修补成为可能,而不必整体重写记忆。

有界的、验证门控的递归演化

一个固定的 Meta-Agent 读取结构化轨迹,把每个诊断出的失败归因到某个记忆组件,并只修改被引发问题的组件;一个固定的门控只在补丁修复了目标任务、且不在留出集上造成回退时才准入。被接受的更新改变未来的执行模式,产生新的优化信息,进而支撑下一轮更新。



递归演化的动态

主要作者介绍

余昭辰:新加坡国立大学博士生,研究方向为大语言模型推理、智能体系统与自我改进。

杨灵:普林斯顿大学博后研究员,研究方向为大语言模型和强化学习。

王梦迪:现任普林斯顿大学电子与计算机工程系终身教授,并创立并担任普林斯顿大学「AI for Accelerated Invention」中心的首任主任。她的研究领域涵盖强化学习、可控大模型、优化学习理论以及 AI for Science 等多个方向。

颜水成:新加坡国立大学教授,IEEE / ACM / AAAI / IAPR Fellow,研究方向涵盖计算机视觉、机器学习与多模态大模型。

本工作合作者包括斯坦福大学博后吴英成,牛津大学博后尹榛菲等

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
1年350万美元!30岁西蒙斯加盟国王 重回NBA赛场开启第10季

1年350万美元!30岁西蒙斯加盟国王 重回NBA赛场开启第10季

罗说NBA
2026-09-04 21:45:39
女篮世界杯|中国女篮首秀输给美国队33分,鹤立鸡群的张子宇暴露软肋

女篮世界杯|中国女篮首秀输给美国队33分,鹤立鸡群的张子宇暴露软肋

上观新闻
2026-09-05 04:00:39
冲上热搜!律师被堵法庭外,法官强行缺席开庭!大律师公开批评重庆两江新区法院滥用审判权,严重影响重庆法治形象

冲上热搜!律师被堵法庭外,法官强行缺席开庭!大律师公开批评重庆两江新区法院滥用审判权,严重影响重庆法治形象

宾语观世
2026-09-04 19:42:54
福建福鼎暴雨过后,街道上淤泥和杂物堆积,白茶重镇损失严重满街都是被水泡的茶叶

福建福鼎暴雨过后,街道上淤泥和杂物堆积,白茶重镇损失严重满街都是被水泡的茶叶

Mr王的饭后茶
2026-09-04 18:00:33
德国工业界要求每周工时从35小时恢复到40小时!10月将迎劳资谈判决战

德国工业界要求每周工时从35小时恢复到40小时!10月将迎劳资谈判决战

红星新闻
2026-09-04 18:13:36
当众拒唱国歌不认中国籍,把两个孩子全送出国,如今报应终于来了

当众拒唱国歌不认中国籍,把两个孩子全送出国,如今报应终于来了

鹤羽说个事
2026-09-02 16:51:59
中国撤展后,不到24小时,韩国外交部紧急灭火

中国撤展后,不到24小时,韩国外交部紧急灭火

戎评
2026-09-04 16:32:49
中国解放军陆军将赴俄罗斯参加实兵演习

中国解放军陆军将赴俄罗斯参加实兵演习

看看新闻Knews
2026-09-04 16:43:05
包揽前两名!张雪机车再创历史 德比斯:这一刻等了20年 冲第7冠

包揽前两名!张雪机车再创历史 德比斯:这一刻等了20年 冲第7冠

念洲
2026-09-05 06:51:55
寿司郎“男孩当众小便”事件家长道歉:愿赔偿在餐厅的全部消费,解释称“小孩突然要上厕所,看到视频后‘无地自容’”

寿司郎“男孩当众小便”事件家长道歉:愿赔偿在餐厅的全部消费,解释称“小孩突然要上厕所,看到视频后‘无地自容’”

封面新闻
2026-09-04 20:59:19
绝平被吹!1-2主场惨遭逆转 13.6亿卫冕冠军惨遭爆冷开局3轮不胜

绝平被吹!1-2主场惨遭逆转 13.6亿卫冕冠军惨遭爆冷开局3轮不胜

狍子歪解体坛
2026-09-05 07:20:00
俄罗斯建“粉碎大日本帝国”纪念碑,日本要求修改,俄方:不予采纳

俄罗斯建“粉碎大日本帝国”纪念碑,日本要求修改,俄方:不予采纳

大风新闻
2026-09-04 22:22:06
西贝被曝拖欠离职补偿金!贾国龙:要相信公司,2028年才能给!

西贝被曝拖欠离职补偿金!贾国龙:要相信公司,2028年才能给!

品牌新
2026-09-04 19:23:40
闹大了!49岁高管在上海长海医院试药后当天昏迷,50天后离世,家属讨说法被骂“滚开”

闹大了!49岁高管在上海长海医院试药后当天昏迷,50天后离世,家属讨说法被骂“滚开”

子非鱼人
2026-09-05 00:14:07
0-1神剧情!88分钟世界波绝平被吹 94分钟点球被扑 14.5亿豪门连胜止步

0-1神剧情!88分钟世界波绝平被吹 94分钟点球被扑 14.5亿豪门连胜止步

狍子歪解体坛
2026-09-05 05:11:27
突发!巨人史玉柱套现80亿走人,收到警示函

突发!巨人史玉柱套现80亿走人,收到警示函

大厂财经社
2026-09-05 01:08:40
新京报这则删除的新闻,太魔幻了

新京报这则删除的新闻,太魔幻了

林中木白
2026-09-04 17:54:32
无缘首进大满贯16强!吴易昺0-3阿尔卡拉斯,中国球员单打仅剩郑钦文

无缘首进大满贯16强!吴易昺0-3阿尔卡拉斯,中国球员单打仅剩郑钦文

全景体育V
2026-09-05 06:08:35
詹姆斯转发点赞!76人三巨头再次合体:演练多种战术备战新赛季

詹姆斯转发点赞!76人三巨头再次合体:演练多种战术备战新赛季

罗说NBA
2026-09-05 06:11:24
何应钦与冈村宁次是同学,受降前一晚,何应钦特意派人传话,暗示冈村仪式上不要随身带军刀,免得当众缴刀颜面尽失,对老同学脸面颇为照顾

何应钦与冈村宁次是同学,受降前一晚,何应钦特意派人传话,暗示冈村仪式上不要随身带军刀,免得当众缴刀颜面尽失,对老同学脸面颇为照顾

扶苏聊历史
2026-09-04 16:28:57
2026-09-05 09:32:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13921文章数 142729关注度
往期回顾 全部

科技要闻

华为何庭波,再次更新韬定律论文

头条要闻

牛弹琴:164国赞成只有美国1票反对 世界地图要变了

头条要闻

牛弹琴:164国赞成只有美国1票反对 世界地图要变了

体育要闻

小卡来去10首轮,快船7年彩礼一场空

娱乐要闻

古天乐公司欠债1.49亿

财经要闻

姚洋:刺激消费要守住两个“大西瓜”

汽车要闻

搭载天枢领航Ultra 长安启源Q06预售14.79万元起

态度原创

旅游
游戏
本地
时尚
公开课

旅游要闻

海航这次挨骂挺冤枉;穷游党狂喜,坐廉航去欧洲 | 一周视频速递

那啥,你知道DLSS 5可以用在绅士游戏上吧?"/> 主站 商城 论坛 自运营 登录 注册 简体中文 简体中文 English 那啥,你知道DLSS 5可以...

本地新闻

扒完小作文,富豪们私藏的度假胜地有多绝

杨紫:自渡成舟

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版