网易首页 > 网易号 > 正文 申请入驻

AI 走出代码沙盒之后,如何在物理世界自我进化?

0
分享至


来源:AI科技评论

作者:MirroS

编辑董子博

真正的智能把每一次未知变成下一轮进化的起点。

2026年3月,安德烈·卡帕西(Andrej Karpathy)发布了 AutoResearch,这是一个专门设计得极为简洁的自主 AI 研究系统,它很好地展示了递归自我改进(Recursive Self-Improvement,简称RSI)背后的逻辑:所谓递归自我改进,是指一个智能系统能够改进“产生下一次改进”的机制本身。智能体通过编辑训练代码,运行固定的实验,保留那些能够提升验证效果的改动,并不断重复这一过程。每一次成功的迭代都会为下一轮迭代提供一个更强的起点,使系统的进步能够不断累积并产生复合效应。

AutoResearch 把这个基础循环表现得格外清晰:

提出方案实验评估保留有效改进重复迭代propose → experiment → evaluate → retain → repeat

且展示了这一循环实现人工智能系统自身组件自我改进的潜力。

然而,这只是在一个封闭的、基于规则的软件沙盒内的演化:环境是固定的,其相关状态和动作是有边界的,其目标也是预先设定好的。智能体能发现什么方法有效,却发现不了自己究竟身处什么样的世界。

物理现实打破了这一假设:它的规则只有部分是已知的,环境条件持续变化,其中的交互关系也无法被完全枚举。家用机器人不可能被赋予一份涵盖所有可能遇到的物体、人物以及接触关系的完整规则文件。工厂控制系统也不能假设,其数字孪生(digital twin)始终能够准确反映一台机器,因为随着零部件磨损和运行条件的变化,机器本身也在不断变化。一个自主实验室也可能会遇到当前假设无法解释的结果。在物理世界中进行自我改进,必然会遭遇由actor、世界模型,或二者共同的局限所导致的意外结果。

因此,Physical RSI必须同时提升actor和世界模型,两者中的每一次进步,都会为另一方揭示出下一阶段需要突破的新的前沿。



01


将现实映射为世界模型

Physical RSl自我改进中最难的问题不在于Actor,而是环境。Actor是递归自我改进中较为熟悉的部分:提出方案、行动、观察、更新、重复迭代。在一个封闭的数字领域中,环境可以通过静态代码、测试和评价指标来定义。然而,现实世界无法以这种方式被描述,它过于庞大而无法被完整枚举,变化过于动态而无法被冻结,同时按需重现的成本也过高。

要让现实世界能够被纳入递归改进的过程,我们需要把它映射为一种不断演化的计算表征:一个具备智能体能力的世界模型(agentic world model)。“映射”并不意味着像素级的精确复制,只是保留那些决定一个动作能否成功的状态、关系和因果动态。世界模型通过抽象来实现泛化,捕捉那些在外观变化中依然保持不变的对象、关系、事件和规则。

语言使模型能够调用预训练模型中的科学知识和常识,而代码则把这些知识转化为明确的状态、变量和可执行的动态过程。因此,一个基于代码的智能体世界模型可以把意外事件转化为模拟器和一套可复用的规则,这些规则能够在不同的房间、不同颜色的电缆、不同的机器人,甚至表面上不同的科学系统之间迁移。它的抽象出来的规则可能是错的,但这些规则是可以被明确地测试和修正的。


02

意外是Physical RSl的引擎


在开放世界中,一次分布外事件(out-of-distribution event,简称 OOD 事件)是一个路由信号(routing signal),它揭示了系统能力的边界,以及下一步需要进化的方向。我们把这样的事件称为一次“意外”。设想一只机器狗,它的腿被电缆缠住了。首先要问的问题不是它应该尝试哪种恢复动作,而是世界模型智能体能否重现刚刚发生的一切。如果它无法建模电缆路径、接触关系、张力以及腿部运动如何共同导致这一失败,那么系统面临的就是environment gap。世界模型智能体必须抽象出缺失的动态规律,并将这一“意外”转化为一类可复现的环境情境。一旦这一失败能够被复现,剩下的问题就是执行者是否能够摆脱这一困境。如果不能,系统就存在一个skill gap。随后,actor就进入自身的递归自我改进(RSI)循环,在扩展后的环境中探索、搜索并优化应对策略。

修正后的世界模型和新的策略都必须在现实中得到验证。如果验证失败,这种偏差就会成为进一步诊断和改进的新证据。如果验证成功,系统便会内化一个更好的世界模型和一种新的行为方式。

演化循环因此变为:

遭遇意外诊断抽象模拟求解验证内化(encounter → surprise → diagnose → abstract → simulate → solve → verify → internalize)


正如一个智能体化的 LLM 系统可以通过生成并验证训练代码、数据和算法,从而推动自身下一阶段的改进一样,Physical RSI则产生于智能体能够自主发现并解决OOD事件的能力之中。每一次意外都将成为一个完整的学习过程,这一过程建立在智能体自身积累的物理知识基础之上:识别发生了什么故障,修正世界模型,寻找应对策略,在现实中进行验证,并最终将新知识固化。通过规模化积累这些经验,可以形成推动智能体和世界模型持续加速改进的递归式基础。



03

Physical RSI的研究路线图

Physical RSI的关键组成部分,需要在多个尚未充分发展的能力方向上取得突破,从而形成一条清晰的发展路线。

环境理解与抽象(Environment understanding and abstraction系统需要将多模态观测信息映射为结构化、可执行的表征形式(如代码、语言等),从而捕捉环境中的关键实体、关系与动态变化。这一能力支撑着循环中的“诊断 → 抽象”阶段。

智能体物理推理(Agentic physical reasoning系统需要协调来自不同来源的知识与模拟能力,将物理推理转化为一种可组合、验证、迭代的过程。这对应着循环中的“模拟 → 求解 → 验证”阶段。

基于经验的持续学习(Continual learning from experience每一次经过验证的抽象表示和解决方案,都应被整合为持久化的世界知识、可复用技能以及回归测试机制。这些能力必须能够超越最初的问题场景实现泛化,同时保持根据新证据进行调整的灵活性。这对应着“内化”阶段。

发现未知(Discovering the unknown系统需要通过识别自身知识的不确定性,并主动设计具有信息价值的实验,探索自身认知边界。将发现未知作为系统内在目标,驱动着循环中的“遭遇 → 意外”阶段,并使整个进化循环得以闭合。


这一发展路线同样需要下一代评估体系和可解释性研究的支持。评估的目标不再是衡量系统在固定基准测试上的表现,而是考察系统能否以可靠、高效且自主的方式,将未知问题转化为经过验证、可复用的能力。与此同时,机制可解释性将成为一种科学工具,用于理解、监测并引导自我改进型智能的内部运行过程。


04


从局部解决方案迈向通用智能


物理 RSI 的价值,尤其体现在那些每一次行动都是对一个尚未被完全建模的世界进行实验的场景中。在机器人、先进制造以及自主科学实验等领域,进化循环遵循着同一逻辑:在现实中行动,发现世界模型遗漏之处,并基于一个更加丰富的世界理解做出下一次行动。

起初,这种进步看起来只是针对具体任务的优化:让失效的机器人恢复运行,修正制造过程中的缺陷,提高蛋白质设计效果。但递归过程改变了被改进的对象。系统不再只是在一个固定世界中解决问题,而是在不断扩展能够产生解决方案的世界。失败逐渐成为结构化知识,意外逐渐成为新的模型,而过去无法解决的问题也开始变得可以被处理。

因此,通用智能并不仅仅意味着在既定问题空间中实现更优的优化能力,而是一种扩展问题空间本身的能力——将每一次与未知的相遇,都转化为下一次智能进化的起点。

阅读最新前沿科技趋势报告,请访问21世纪关键技术研究院的“未来知识库”


未来知识库是 “21世纪关键技术研究院”建 立的在线知识库平台,收藏的资料范围包括人工智能、脑科学、互联网、超级智能,数智大脑、能源、军事、经济、人类风险等等领域的前沿进展与未来趋势。目前拥有超过8000篇重要资料。每周更新不少于100篇世界范围最新研究资料。 欢迎扫描二维码或访问https://wx.zsxq.com/group/454854145828进入。

截止到2月28日 ”未来知识库”精选的百部前沿科技趋势报告

(加入未来知识库,全部资料免费阅读和下载)

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
独家回应!绍兴“葫芦爷爷”把7个葫芦剪了收回家?

独家回应!绍兴“葫芦爷爷”把7个葫芦剪了收回家?

极目新闻
2026-09-05 22:25:26
西方为何痛批中国治沙?真相曝光:动了的不是沙子,是老外奶酪!

西方为何痛批中国治沙?真相曝光:动了的不是沙子,是老外奶酪!

史之铭
2026-08-25 17:15:36
豪门悲喜夜:皇马0-1首败,巴黎圣日耳曼1-2首败,利物浦2-0首胜

豪门悲喜夜:皇马0-1首败,巴黎圣日耳曼1-2首败,利物浦2-0首胜

侧身凌空斩
2026-09-05 05:25:02
上汽奥迪官宣:A7L限时降15.59万,Q6降近19万!

上汽奥迪官宣:A7L限时降15.59万,Q6降近19万!

爱卡汽车
2026-09-04 03:53:47
越南政府的决议实际上就是要扼杀广西平陆运河出海口

越南政府的决议实际上就是要扼杀广西平陆运河出海口

安安说
2026-08-31 11:15:16
广东一准女大学生去世,未等到大学报到,妈妈透露原因,一句话也没留下

广东一准女大学生去世,未等到大学报到,妈妈透露原因,一句话也没留下

育学笔谈
2026-09-05 16:18:23
“小宝探花”案件回顾:疯狂约会上百名女性,一人拍摄,一人贩卖

“小宝探花”案件回顾:疯狂约会上百名女性,一人拍摄,一人贩卖

就一点
2025-12-30 21:32:02
18.6 万美金!唐斯把布伦森卡给买了!!

18.6 万美金!唐斯把布伦森卡给买了!!

柚子说球
2026-09-05 19:03:46
被央媒严厉批评后还敢如此傲慢敷衍的,除了星宇找不到第二家

被央媒严厉批评后还敢如此傲慢敷衍的,除了星宇找不到第二家

王新喜
2026-09-05 17:58:28
这是加斯利的反击!蒙扎杆位属于他!职业生涯首杆!

这是加斯利的反击!蒙扎杆位属于他!职业生涯首杆!

五星体育
2026-09-05 23:17:26
父亲用扁担送双胞胎姐妹上大学!俩人高考差3分,考入同一大学,住同一寝室

父亲用扁担送双胞胎姐妹上大学!俩人高考差3分,考入同一大学,住同一寝室

封面新闻
2026-09-04 23:39:05
出轨女子第二波聊天记录曝光,虎狼之词惊呆吃瓜网友,她嫌丢人开始批量投诉了

出轨女子第二波聊天记录曝光,虎狼之词惊呆吃瓜网友,她嫌丢人开始批量投诉了

汉史趣闻
2026-09-01 17:55:01
局势恶化,中美第三轮交锋启动,中方破18年纪录,再抛259亿美债

局势恶化,中美第三轮交锋启动,中方破18年纪录,再抛259亿美债

老谢谈史
2026-09-05 16:28:05
恭喜!曝有意签回乐福!已经分开整整12年

恭喜!曝有意签回乐福!已经分开整整12年

篮球实战宝典
2026-09-05 23:28:15
真的有人喜欢微胖吗?一个人的时候,常常会感到不自信

真的有人喜欢微胖吗?一个人的时候,常常会感到不自信

娱你同欢
2026-07-31 23:28:29
我的一位医生朋友告诉我,脑梗时快要发生时,会频繁出现3种症状

我的一位医生朋友告诉我,脑梗时快要发生时,会频繁出现3种症状

千秋文化
2026-09-05 20:04:03
挽救2局点,国羽世界第一24-22!痛失2局点,国羽世界第2爆冷出局

挽救2局点,国羽世界第一24-22!痛失2局点,国羽世界第2爆冷出局

求球不落谛
2026-09-05 15:34:35
欧盟加入经济弃儿行动,美以一致:终结伊朗政权

欧盟加入经济弃儿行动,美以一致:终结伊朗政权

移光幻影
2026-09-05 17:02:52
任何一艘美航母上,都要带足大量女兵?她们在航母上有什么作用?

任何一艘美航母上,都要带足大量女兵?她们在航母上有什么作用?

墨策史
2026-07-25 19:13:16
婚外胚胎案喊刑事介入,三娃非亲生案装看不见:所谓法学教授,也不过是看性别下菜

婚外胚胎案喊刑事介入,三娃非亲生案装看不见:所谓法学教授,也不过是看性别下菜

少爷写春秋
2026-09-05 22:41:46
2026-09-05 23:52:49
人工智能学家 incentive-icons
人工智能学家
人工智能领域权威媒体
5023文章数 37516关注度
往期回顾 全部

科技要闻

华为何庭波,再次更新韬定律论文

头条要闻

江西遂川泥石流1死11失联 男子:母亲电话一直打不通

头条要闻

江西遂川泥石流1死11失联 男子:母亲电话一直打不通

体育要闻

本西蒙斯加盟国王,不管怎样,回来就好

娱乐要闻

阿Sa蔡卓妍首度求婚细节,感动落泪

财经要闻

被曝试药后死亡,药企董事竟怒怼记者

汽车要闻

千里浩瀚H5/30英寸大屏 星越L PLUS让你看到油车越级的一面

态度原创

房产
艺术
本地
教育
数码

房产要闻

突发重磅!海口出台楼市新政!

艺术要闻

上海外滩最后一个新建筑,设计没翻车!

本地新闻

扒完小作文,富豪们私藏的度假胜地有多绝

教育要闻

2026医学志愿咨询实战:金显宅特色班和5+3不是同一条路

数码要闻

联发科最强Soc!天玑9600 Pro单核成绩突破4000分:vivo首发

无障碍浏览 进入关怀版