网易首页 > 网易号 > 正文 申请入驻

学术分享丨LSTM之父最新97页综述:Agent如何真正学会「自我进化」?

0
分享至

转自 新智元

过去两年,self-reflection、self-correction、self-play、agentic RL、skill learning、test-time adaptation、open-ended evolution、self-evolving agent等概念不断涌现。

它们有时指模型继续训练,有时指Prompt或工具自动优化,也有时被直接归入递归式自我改进(Recursive Self-Improvement,RSI)。

问题在于,这些术语描述的变化层级和强度并不相同,却长期缺少一套统一坐标系。

近日,来自吉林大学、KAUST、阿尔伯塔大学和瑞士人工智能实验室等机构的研究团队发布综述,从系统层面重新定义「自我改进」,并将模型训练、记忆演化、工具创建和Agent架构搜索放进同一张地图。配套项目目前已整理312篇相关工作。


论文链接: https://arxiv.org/abs/2607.13104

项目主页: https://selfimproving-agent.github.io/

代码链接: https://github.com/selfimproving-agent/awesome-Self-Improving-Agents

值得一提的是,这篇综述发布后迅速在海外AI社区获得关注。配套GitHub仓库一周左右已收获200+Stars,;X上也有不少论文推荐帖也获得了约800个Likes。这也折射出一个清晰信号,self-improving agent正成为海外研究者和开发者共同关注的新焦点。


图 1:配套 GitHub 仓库在一周左右获得200+Stars。


图2:X上的论文推荐帖获得约800个Likes。


图3:现代自我改进Agent的整体版图。

什么才算「自我改进」

论文将基础模型Agent表示为:

其中,θ是基础模型参数;Σ是围绕模型运行的脚手架,包括Prompt、Memory、Tools,以及路由、调度和安全约束等控制逻辑。

这个定义划出了一条重要边界:上下文中的临时计划、对话历史和一次性反思,只属于运行时状态;只有当系统依据自身执行产生的轨迹、评价或验证结果,持久修改了θ或Σ,并让下一次任务从不同起点出发,才构成真正的self-improvement。

因此,self-reflection和self-correction本身不必然等于自我改进。一次任务中「再想一遍」可以提高当前答案,却未必留下任何跨任务能力。反过来,一条经过验证并写入长期记忆的规则、一个被修复后持续复用的工具,哪怕没有更新模型权重,也已经改变了Agent未来的行为。

自我改进也不是大模型时代突然出现的概念。从反馈控制、学习如何学习、自指程序,到Gödel Machine和元学习,相关思想延续了数十年。基础模型带来的变化,在于自然语言成为统一的修改介质:错误可以写成批评,经验可以压缩为记忆,工具和工作流可以直接生成与重写。自我修改由此从低层代码与权重搜索,逐渐变成更可表达、也更可检查的工程过程。


图4:基础模型提供认知能力,Prompt、Memory、Tools与控制逻辑共同决定Agent如何感知、推理和行动。

两条路线

写进模型,或写进系统

第一条路线是Foundation Model Improvement。Agent自己生成训练示例、评价信号,或从真实环境与世界模型中获得探索经验,再通过SFT、偏好优化或强化学习写回参数。这类更新较慢、成本较高,也不易回滚,但一旦成功,能力可以跨任务共享。

论文将其学习信号分为三类:一是自生成示例与推理轨迹,二是模型给出的分数、偏好或批评,三是来自代码执行、网页交互、游戏和机器人环境的真实或模拟经验。Self-Instruct、Constitutional AI、WebRL等分别体现了这些思路。

风险也很直接:模型可能把自身错误重新训练进权重,导致偏差放大、模型坍塌或灾难性遗忘;也可能学会钻奖励函数和世界模型的空子。参数更新因此必须配合数据过滤、外部验证、版本管理和回滚。

第二条路线是Scaffolding Improvement。模型参数保持不变,系统改写Prompt,整理和淘汰Memory,选择、修复或创建Tools,甚至重构规划器、路由器和整套Agent代码。TextGrad、Mem0、Voyager、Gödel Agent、Darwin Gödel Machine等工作都可放入这条路线。它更轻量、更透明,也更容易验证和撤销,因此是当前工程实践中最活跃的方向。

论文对skill的处理尤其值得注意:skill不是Prompt、Memory、Tool之外的第五个组件,而是一种「可序列化、可复用的更新」。同一个技能可以被存成工具及其调用约定,可以是一条工作流或记忆,也可以被固化进权重或控制逻辑。换言之,skill描述的是「保留下来的能力单元」,而不是它被存在哪里。

这种定义也区分了两类技能:对象级skill用于完成外部任务,例如反复调用一段「收集资源」流程;元级skill则直接作用于Agent自身,例如重写Prompt、整理Memory、创建工具或触发参数更新。后者一旦还能改进「如何改进自己」,就开始触及RSI最核心的自指结构。

但这里需要降温:今天多数所谓RSI,仍是受目标函数、测试集、沙箱和权限边界约束的「有限自我修改」,距离不受约束的智能爆炸相去甚远。论文关注的重点也不是科幻式失控,而是如何让这种更新可测量、可归因、可回滚。

两条路线并非彼此排斥。更合理的系统会让脚手架承担快速、局部、可逆的探索,再把反复验证有效的经验蒸馏进参数,形成「快速适应—慢速固化」的双时间尺度。


图5:基础模型更新与脚手架更新构成两条主路径。

六大应用场景

论文系统梳理了六类应用:软件工程、网页导航与自动化、游戏与策略推理、科学发现、具身智能与机器人、通用计算机控制。它们的共同点是Agent都能从环境获得反馈;差异在于反馈是否可靠、获取成本多高,以及失败能否撤销。

软件工程拥有编译器、单元测试和持续集成,是反馈最密集、结果最容易验证的试验场。网页Agent面对的则是持续变化的页面、DOM和API,需要把成功与失败轨迹沉淀为记忆、grounding策略或可复用工具。游戏能够提供可重置环境、清晰规则和self-play经验,但也可能让Agent过拟合固定对手或钻模拟器的空子。

科学发现把循环扩展到假设、实验与证据管理,难点在于新颖性、可复现性和反馈延迟。具身智能需要跨越仿真与现实,处理sim-to-real gap和物理安全。通用计算机控制则要跨应用与操作系统形成可迁移的程序性经验。

在这些场景中,skill可以是代码修复流程、网页策略、游戏技能库、实验工作流、机器人动作程序或桌面操作脚本。介质不同,核心都是把一次成功转化为可复用的持久更新。


图6:自我改进Agent的六类代表性应用,以及各领域常用的环境与反馈来源。

如何评测一个会持续变化的系统

传统基准只测静态模型的最终分数,但自我改进Agent的研究对象是一条更新轨迹。可信实验至少要回答:固定预算下每轮提高多少?能否迁移到未见任务?旧问题是否再次失败?消耗了多少工具调用与人工监督?安全风险是否累积?

论文区分了可执行指标与Judge-based评测:前者适合代码和工具调用,后者覆盖开放式、长链条任务。如果同一个模型既提出改进又负责打分,Agent可能只是越来越会讨好「裁判」。因此,生成者与评估者应分离,并用独立Judge、隐藏测试和可验证子集校准。

评测还要覆盖两个层面:机制级评测隔离Prompt、Memory、Tool或参数更新的贡献;领域级评测检验其能否承受分布变化、执行成本和安全约束。不只看Agent达到多高,还要看它以多大代价、沿怎样的轨迹到达。


图7:自我改进Agent常用benchmark的分布,覆盖模型层与脚手架层、静态任务与交互式任务。

从快速探索到慢速固化

论文给出的核心设计原则,可以概括为八个字:快环探索,慢环固化。

在反馈嘈杂、任务变化快时,优先修改Prompt、Memory、Tools和控制逻辑,因为这些变化透明、便宜、可回滚。只有当一种策略经过充分验证,证明能够跨任务迁移时,再把它蒸馏或微调进模型权重,成为稳定的长期能力。真正成熟的系统不会在「改模型」与「改脚手架」之间二选一,而会让两条路径形成协同循环。

论文据此提出六个方向:测试时持续适应、主动探索与好奇心、参数蒸馏与模型—脚手架联合优化、资源受限的改进效率、多Agent协作式共同进化,以及面对环境变化的开放世界鲁棒性。

进化越深入

安全边界越重要

当Agent能够修改Memory、Tools乃至自身代码时,安全对象本身也在变化。一次Prompt Injection可能不再只是临时干扰,而会被写入记忆或工具逻辑,成为持久漏洞。因此,Critic应被视为受治理的基础设施,提出更新与批准更新也不应由同一闭环完全控制。每次修改都要经过功能、权限和安全检查。尤其在Full Scaffolding与RSI场景中,Agent应被当作受保护环境中的「不可信程序」,所有更新都需经过分层门控。

未来的AI进步,未必只来自更多参数。更值得关注的是:Agent能否从失败中提取经验,把经验封装为可复用skill,管理自己的记忆与工具,修改工作流程,再把验证过的能力稳妥沉淀下来。当AI从「每次任务都重新开始」,走向「每次任务都留下可验证的成长」,它才真正跨过从工具到学习型系统的门槛。所谓self-evolving agent的关键,也不在「进化」这个热词本身,而在每一次更新是否持久、有效,并且始终处于可控边界之内。

结语

这篇综述真正提供的,不是又一个关于「AI自我进化」的宏大预言,而是一套判断进步是否真实发生的工程语言:经验有没有被保存,能力能不能被复用,收益能否跨任务迁移,更新是否经得起验证。

未来的Agent或许会越来越擅长修改自己,但比「会进化」更重要的,是它知道该改什么、为什么改,以及什么时候不应该改。

参考资料:

https://arxiv.org/abs/2607.13104

编辑:LRST

【免责声明】转载出于非商业性的教育和科研目的,只为学术新闻信息的传播,版权归原作者所有,如有侵权请立即与我们联系,我们将及时删除。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
1米3袖珍美女:嫁给1米48男孩,婚后丈夫奇迹长高,最终不欢而散

1米3袖珍美女:嫁给1米48男孩,婚后丈夫奇迹长高,最终不欢而散

梦醉为红颜一笑
2026-09-05 01:01:29
星宇股份61岁的人力资源总监成背锅侠,撤回处罚通报原因曝光

星宇股份61岁的人力资源总监成背锅侠,撤回处罚通报原因曝光

平老师666
2026-09-07 22:39:36
正式离队,或无缘续约?李梦去向3选1,或将降薪,张隆看懂了

正式离队,或无缘续约?李梦去向3选1,或将降薪,张隆看懂了

凉生枕时e
2026-09-07 10:54:42
武大86页PDF举报、母校切割校友、正颌手术变“鞋拔子脸”:一年三场舆论风暴,百年名校的招牌还能经得起几次折腾?

武大86页PDF举报、母校切割校友、正颌手术变“鞋拔子脸”:一年三场舆论风暴,百年名校的招牌还能经得起几次折腾?

二宝妈妈谈教育
2026-09-04 14:57:04
汤家凤呼吁取消英语,他这个“坏种”,竟然是南京大学博士

汤家凤呼吁取消英语,他这个“坏种”,竟然是南京大学博士

汉史趣闻
2026-09-06 10:13:22
一把火烧光100亿投资!35名顶尖专家全部牺牲,中国预警机血泪史

一把火烧光100亿投资!35名顶尖专家全部牺牲,中国预警机血泪史

董董历史烩
2026-09-08 10:11:00
打赏陪睡案女主播合租室友发声:魏莹每月陪睡一两次,枕头没干过,经常哭到缺氧

打赏陪睡案女主播合租室友发声:魏莹每月陪睡一两次,枕头没干过,经常哭到缺氧

世界圈
2026-08-24 20:54:42
比尔·盖茨亲口承认:Ctrl+Alt+Delete是个错误

比尔·盖茨亲口承认:Ctrl+Alt+Delete是个错误

我是一个粉刷匠2
2026-09-07 01:06:52
泉州市委副书记周小华,拟任新职!戴清泉,拟任正厅长级职务!

泉州市委副书记周小华,拟任新职!戴清泉,拟任正厅长级职务!

坠入二次元的海洋
2026-09-08 08:58:03
地产首富,落幕!

地产首富,落幕!

新浪财经
2026-09-06 11:30:29
家属突发讣告!24岁女网红确认离世,出事三天前还在更新账号

家属突发讣告!24岁女网红确认离世,出事三天前还在更新账号

南方都市报
2026-09-08 08:00:08
小米再次背水一战

小米再次背水一战

全天候科技
2026-09-08 00:47:41
赛力斯新车官宣:9月8日继续开售,22.98万起

赛力斯新车官宣:9月8日继续开售,22.98万起

手机讲坛
2026-09-08 00:52:45
羽协换届竞体司司长张新任主席 夏煊泽被罢免纪委书记李论当副主席

羽协换届竞体司司长张新任主席 夏煊泽被罢免纪委书记李论当副主席

劲爆体坛
2026-09-08 11:43:37
孙千9年前来台嫩照曝!柴智屏揭相中她与宋威龙过程 网赞眼光太强

孙千9年前来台嫩照曝!柴智屏揭相中她与宋威龙过程 网赞眼光太强

ETtoday星光云
2026-09-07 11:03:05
不是!快船你玩吗,交易八村塁?

不是!快船你玩吗,交易八村塁?

体育新角度
2026-09-07 21:33:57
《兰香如故》央八播出:但凡36岁谭松韵演技拉垮一点,都压不住这两位美貌兼实力派女配角

《兰香如故》央八播出:但凡36岁谭松韵演技拉垮一点,都压不住这两位美貌兼实力派女配角

奴染
2026-09-07 00:15:18
谢贤前女友Coco直播被说丑,本人回应:“姐都40岁了,把头发往下一放还是迷倒一大片的”

谢贤前女友Coco直播被说丑,本人回应:“姐都40岁了,把头发往下一放还是迷倒一大片的”

韩小娱
2026-09-04 05:54:22
61岁男演员全家美国享乐!住豪宅开快艇吃龙虾,一句回应点燃舆论

61岁男演员全家美国享乐!住豪宅开快艇吃龙虾,一句回应点燃舆论

娱说瑜悦
2026-09-07 18:32:08
委内瑞拉称将遵守委中之间石油协议,外交部发言人已明确表示:中国和委内瑞拉的合作与第三方无关,中国在委内瑞拉的合法权益必须得到保护

委内瑞拉称将遵守委中之间石油协议,外交部发言人已明确表示:中国和委内瑞拉的合作与第三方无关,中国在委内瑞拉的合法权益必须得到保护

吉刻新闻
2026-09-07 22:07:41
2026-09-08 13:20:49
中国人工智能学会
中国人工智能学会
中国人工智能学会网易官方账号
4273文章数 1492关注度
往期回顾 全部

科技要闻

小米再次背水一战

头条要闻

女孩遇"完美男友"被骗上百万 连养的狗都是"女友共享"

头条要闻

女孩遇"完美男友"被骗上百万 连养的狗都是"女友共享"

体育要闻

郑钦文,奇迹只发生在相信奇迹的人身上

娱乐要闻

郭德纲乱改抗战歌曲被重罚!

财经要闻

全球黄金“回家”

汽车要闻

领克20 领克的纯电小钢炮这次更运动了

态度原创

房产
数码
教育
时尚
艺术

房产要闻

真快啊!海口这个超级城更,又有大动作!

数码要闻

拜雅MMX 100 wireless、AVENTHO Y耳机国行上架,12日发售

教育要闻

教育要培养什么样的人?成都这所学校用一堂航天课回答

白露食白——露从今夜白,味从此时鲜

艺术要闻

90后高学历情侣,租350m²毛坯45天改完:比买房值

无障碍浏览 进入关怀版