网易首页 > 网易号 > 正文 申请入驻

构建超越已知世界的「Physical RSl」

0
分享至


看到了一篇非常受启发的文章,来自MirroS,转载分享给大家——

真正的智能,不是在一个固定世界中进行优化,而是将每一次与未知的相遇,都转化为下一次进化的起点。

2026年3月,安德烈·卡帕西(Andrej Karpathy)发布了AutoResearch,这是一个专门设计得极为简洁的自主AI 研究系统,它很好地展示了递归自我改进(Recursive Self-Improvement,简称RSI)背后的逻辑:

所谓递归自我改进,是指一个智能系统能够改进“产生下一次改进”的机制本身。智能体通过编辑训练代码,运行固定的实验,保留那些能够提升验证效果的改动,并不断重复这一过程。

每一次成功的迭代都会为下一轮迭代提供一个更强的起点,使系统的进步能够不断累积并产生复合效应。

AutoResearch把这个基础循环表现得格外清晰:

提出方案实验评估保留有效改进重复迭代
propose → experiment → evaluate → retain → repeat

且展示了这一循环实现人工智能系统自身组件自我改进的潜力。

然而,这只是在一个封闭的、基于规则的软件沙盒内的演化:环境是固定的,其相关状态和动作是有边界的,其目标也是预先设定好的。智能体能发现什么方法有效,却发现不了自己究竟身处什么样的世界。

物理现实打破了这一假设:它的规则只有部分是已知的,环境条件持续变化,其中的交互关系也无法被完全枚举。

家用机器人不可能被赋予一份涵盖所有可能遇到的物体、人物以及接触关系的完整规则文件。

工厂控制系统也不能假设,其数字孪生(digital twin)始终能够准确反映一台机器,因为随着零部件磨损和运行条件的变化,机器本身也在不断变化。一个自主实验室也可能会遇到当前假设无法解释的结果。

在物理世界中进行自我改进,必然会遭遇由actor、世界模型,或二者共同的局限所导致的意外结果。

因此,Physical RSI必须同时提升actor和世界模型,两者中的每一次进步,都会为另一方揭示出下一阶段需要突破的新的前沿。


01

将现实映射为世界模型


Physical RSl自我改进中最难的问题不在于Actor,而是环境。Actor是递归自我改进中较为熟悉的部分:提出方案、行动、观察、更新、重复迭代。

在一个封闭的数字领域中,环境可以通过静态代码、测试和评价指标来定义。

然而,现实世界无法以这种方式被描述,它过于庞大而无法被完整枚举,变化过于动态而无法被冻结,同时按需重现的成本也过高。

要让现实世界能够被纳入递归改进的过程,我们需要把它映射为一种不断演化的计算表征:

一个具备智能体能力的世界模型(agentic world model)。

“映射”并不意味着像素级的精确复制,只是保留那些决定一个动作能否成功的状态、关系和因果动态。世界模型通过抽象来实现泛化,捕捉那些在外观变化中依然保持不变的对象、关系、事件和规则。

语言使模型能够调用预训练模型中的科学知识和常识,而代码则把这些知识转化为明确的状态、变量和可执行的动态过程。

因此,一个基于代码的智能体世界模型可以把意外事件转化为模拟器和一套可复用的规则,这些规则能够在不同的房间、不同颜色的电缆、不同的机器人,甚至表面上不同的科学系统之间迁移。

它的抽象出来的规则可能是错的,但这些规则是可以被明确地测试和修正的。

02

意外是Physical RSl的引擎

在开放世界中,一次分布外事件(out-of-distribution event,简称OOD 事件)是一个路由信号(routing signal),它揭示了系统能力的边界,以及下一步需要进化的方向。

我们把这样的事件称为一次“意外”。设想一只机器狗,它的腿被电缆缠住了。首先要问的问题不是它应该尝试哪种恢复动作,而是世界模型智能体能否重现刚刚发生的一切。

如果它无法建模电缆路径、接触关系、张力以及腿部运动如何共同导致这一失败,那么系统面临的就是environment gap

世界模型智能体必须抽象出缺失的动态规律,并将这一意外转化为一类可复现的环境情境。

一旦这一失败能够被复现,剩下的问题就是执行者是否能够摆脱这一困境。如果不能,系统就存在一个skill gap

随后,actor就进入自身的递归自我改进(RSI)循环,在扩展后的环境中探索、搜索并优化应对策略。

修正后的世界模型和新的策略都必须在现实中得到验证。如果验证失败,这种偏差就会成为进一步诊断和改进的新证据。如果验证成功,系统便会内化一个更好的世界模型和一种新的行为方式。进化循环变为:

演化循环因此变为:

遭遇意外诊断抽象模拟求解验证内化
(encounter → surprise → diagnose → abstract → simulate → solve → verify → internalize)


正如一个智能体化的LLM 系统可以通过生成并验证训练代码、数据和算法,从而推动自身下一阶段的改进一样,Physical RSI则产生于智能体能够自主发现并解决OOD事件的能力之中。

每一次意外都将成为一个完整的学习过程,这一过程建立在智能体自身积累的物理知识基础之上:识别发生了什么故障,修正世界模型,寻找应对策略,在现实中进行验证,并最终将新知识固化。

通过规模化积累这些经验,可以形成推动智能体和世界模型持续加速改进的递归式基础。


03

Physical RSI的研究路线图

Physical RSI的关键组成部分,需要在多个尚未充分发展的能力方向上取得突破,从而形成一条清晰的发展路线。

环境理解与抽象(Environment understanding and abstraction:系统需要将多模态观测信息映射为结构化、可执行的表征形式(如代码、语言等),从而捕捉环境中的关键实体、关系与动态变化。这一能力支撑着循环中的“诊断→ 抽象”阶段。

智能体物理推理(Agentic physical reasoning:系统需要协调来自不同来源的知识与模拟能力,将物理推理转化为一种可组合、验证、迭代的过程。这对应着循环中的“模拟→ 求解→ 验证”阶段。

基于经验的持续学习(Continual learning from experience:每一次经过验证的抽象表示和解决方案,都应被整合为持久化的世界知识、可复用技能以及回归测试机制。这些能力必须能够超越最初的问题场景实现泛化,同时保持根据新证据进行调整的灵活性。这对应着“内化”阶段。

发现未知(Discovering the unknown:系统需要通过识别自身知识的不确定性,并主动设计具有信息价值的实验,探索自身认知边界。将发现未知作为系统内在目标,驱动着循环中的“遭遇→ 意外”阶段,并使整个进化循环得以闭合。


这一发展路线同样需要下一代评估体系和可解释性研究interpretability)的支持。

评估的目标不再是衡量系统在固定基准测试上的表现,而是考察系统能否以可靠、高效且自主的方式,将未知问题转化为经过验证、可复用的能力。

与此同时,机制可解释性(mechanistic interpretability)将成为一种科学工具,用于理解、监测并引导自我改进型智能的内部运行过程。

04

从局部解决方案迈向通用智能


物理RSI的价值,尤其体现在那些每一次行动都是对一个尚未被完全建模的世界进行实验的场景中。

在机器人、先进制造以及自主科学实验等领域,进化循环遵循着同一逻辑:

在现实中行动,发现世界模型遗漏之处,并基于一个更加丰富的世界理解做出下一次行动。

起初,这种进步看起来只是针对具体任务的优化:让失效的机器人恢复运行,修正制造过程中的缺陷,提高蛋白质设计效果。但递归过程改变了被改进的对象。

系统不再只是在一个固定世界中解决问题,而是在不断扩展能够产生解决方案的世界。

失败逐渐成为结构化知识,意外逐渐成为新的模型,而过去无法解决的问题也开始变得可以被处理。

因此,通用智能并不仅仅意味着在既定问题空间中实现更优的优化能力,而是一种扩展问题空间本身的能力——

将每一次与未知的相遇,都转化为下一次智能进化的起点。


朋友圈会发一些具体的案例和商业化日常~

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
张馨予何捷买15W电车,背4.1W包穿超短裙很惹火,喝奶茶不怕长肉

张馨予何捷买15W电车,背4.1W包穿超短裙很惹火,喝奶茶不怕长肉

小疯子耶
2026-09-05 05:50:32
法国人吐槽坐中国高铁被歧视!唯独他被抽查,工作人员还扬言爱投诉就投诉,评论区十分团结

法国人吐槽坐中国高铁被歧视!唯独他被抽查,工作人员还扬言爱投诉就投诉,评论区十分团结

谭谈社会
2026-09-03 20:26:28
“许昌不大,我非找到你不可”!顾客团购小龙虾苦等20多分钟,写差评遭商家威胁

“许昌不大,我非找到你不可”!顾客团购小龙虾苦等20多分钟,写差评遭商家威胁

火山詩话
2026-09-05 08:01:47
郭富城太太时装展脚抖快摔倒,嫁港 9 年还要翻译,现场反应引热议

郭富城太太时装展脚抖快摔倒,嫁港 9 年还要翻译,现场反应引热议

寒士之言本尊
2026-09-03 18:47:12
毫无明星架子!林永健夫妇现身北京4S店,务实选车太接地气

毫无明星架子!林永健夫妇现身北京4S店,务实选车太接地气

乡野异闻录
2026-09-04 18:20:18
内娱的审美该醒醒了,张子枫林允一起参加活动,一个干瘪一个饱满

内娱的审美该醒醒了,张子枫林允一起参加活动,一个干瘪一个饱满

小椰的奶奶
2026-09-04 16:41:42
28.99万 !现代汽车正式上市!

28.99万 !现代汽车正式上市!

科技堡垒
2026-09-04 10:45:57
上海女子400万兰博基尼停地库,被偷成空壳,维修费要300多万

上海女子400万兰博基尼停地库,被偷成空壳,维修费要300多万

听心堂
2026-09-04 09:50:16
英国公开赛四强对阵诞生,5-0,5-2,两大磨王会师,比赛难看了

英国公开赛四强对阵诞生,5-0,5-2,两大磨王会师,比赛难看了

南海浪花
2026-09-05 03:55:25
上海竞体中心回应称刘翔目前关系还在原单位,媒体人:他是活祖宗 常年在国外风险大

上海竞体中心回应称刘翔目前关系还在原单位,媒体人:他是活祖宗 常年在国外风险大

尘语者
2026-09-03 16:52:12
“爷爷黄毛,奶奶满背”,一家五口火了,网友:孩子上小学后不简单

“爷爷黄毛,奶奶满背”,一家五口火了,网友:孩子上小学后不简单

熙熙说教
2026-09-02 13:31:16
重大伤亡!9月4日,据最新消息披露,伊朗在这一轮与美军的对战中伤亡惨重,18人死亡、142人受伤

重大伤亡!9月4日,据最新消息披露,伊朗在这一轮与美军的对战中伤亡惨重,18人死亡、142人受伤

扶苏聊历史
2026-09-04 14:54:35
台湾民调出炉,赖清德、郑丽文满意度格外惊人,韩国瑜被逼到墙角

台湾民调出炉,赖清德、郑丽文满意度格外惊人,韩国瑜被逼到墙角

夜寒兮月孤静
2026-09-04 07:38:09
牺牲114人消灭解放军1000人,班公洛战役,印少校一人改变战局?

牺牲114人消灭解放军1000人,班公洛战役,印少校一人改变战局?

楚风说历史
2026-08-19 09:30:03
罗体:麦克托米奈将于下周二在利物浦市接受心脏手术

罗体:麦克托米奈将于下周二在利物浦市接受心脏手术

懂球帝
2026-09-04 17:40:05
莆田失联人员家属:凌晨山体滑坡掩埋房屋,九旬外婆和六旬舅舅失联,应急局:救援人员已全部投入救援中

莆田失联人员家属:凌晨山体滑坡掩埋房屋,九旬外婆和六旬舅舅失联,应急局:救援人员已全部投入救援中

极目新闻
2026-09-04 22:56:21
斯诺克英国公开赛太残酷:随着特鲁姆普5-1,中国军团已全军覆没

斯诺克英国公开赛太残酷:随着特鲁姆普5-1,中国军团已全军覆没

侧身凌空斩
2026-09-05 04:30:48
电池税开征,纯电车利润快归零了

电池税开征,纯电车利润快归零了

虎嗅APP
2026-09-04 02:54:35
曝景甜与孙宇晨闹掰的真相:男方设局想套牢她,5000万美金是房款

曝景甜与孙宇晨闹掰的真相:男方设局想套牢她,5000万美金是房款

生命之泉的奥秘
2026-08-29 20:53:20
新进展!武大女教授被举报事件:其父目前已调任安大副校长,武大已介入调查,细节曝光

新进展!武大女教授被举报事件:其父目前已调任安大副校长,武大已介入调查,细节曝光

子非鱼人
2026-09-04 00:04:43
2026-09-05 10:15:00
AI异类 incentive-icons
AI异类
从硅谷到中关村,AI信息与测评
251文章数 11关注度
往期回顾 全部

科技要闻

华为何庭波,再次更新韬定律论文

头条要闻

深圳校服网上出圈本地家长"冷淡":好多年前就这样了

头条要闻

深圳校服网上出圈本地家长"冷淡":好多年前就这样了

体育要闻

小卡来去10首轮,快船7年彩礼一场空

娱乐要闻

古天乐公司欠债1.49亿

财经要闻

姚洋:刺激消费要守住两个“大西瓜”

汽车要闻

搭载天枢领航Ultra 长安启源Q06预售14.79万元起

态度原创

艺术
健康
家居
手机
公开课

艺术要闻

明朝灭亡那年,他画了一群女生玩古代飞花令

脑梗取栓成功≠活下来,还有这三关

家居要闻

2026建博会(广州) 公装联探展交流活动

手机要闻

苹果首款折叠屏新命名出炉:iPhone Duo 下周正式揭晓

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版