网易首页 > 网易号 > 正文 申请入驻

构建超越已知世界的「Physical RSl」

0
分享至


看到了一篇非常受启发的文章,来自MirroS,转载分享给大家——

真正的智能,不是在一个固定世界中进行优化,而是将每一次与未知的相遇,都转化为下一次进化的起点。

2026年3月,安德烈·卡帕西(Andrej Karpathy)发布了AutoResearch,这是一个专门设计得极为简洁的自主AI 研究系统,它很好地展示了递归自我改进(Recursive Self-Improvement,简称RSI)背后的逻辑:

所谓递归自我改进,是指一个智能系统能够改进“产生下一次改进”的机制本身。智能体通过编辑训练代码,运行固定的实验,保留那些能够提升验证效果的改动,并不断重复这一过程。

每一次成功的迭代都会为下一轮迭代提供一个更强的起点,使系统的进步能够不断累积并产生复合效应。

AutoResearch把这个基础循环表现得格外清晰:

提出方案实验评估保留有效改进重复迭代
propose → experiment → evaluate → retain → repeat

且展示了这一循环实现人工智能系统自身组件自我改进的潜力。

然而,这只是在一个封闭的、基于规则的软件沙盒内的演化:环境是固定的,其相关状态和动作是有边界的,其目标也是预先设定好的。智能体能发现什么方法有效,却发现不了自己究竟身处什么样的世界。

物理现实打破了这一假设:它的规则只有部分是已知的,环境条件持续变化,其中的交互关系也无法被完全枚举。

家用机器人不可能被赋予一份涵盖所有可能遇到的物体、人物以及接触关系的完整规则文件。

工厂控制系统也不能假设,其数字孪生(digital twin)始终能够准确反映一台机器,因为随着零部件磨损和运行条件的变化,机器本身也在不断变化。一个自主实验室也可能会遇到当前假设无法解释的结果。

在物理世界中进行自我改进,必然会遭遇由actor、世界模型,或二者共同的局限所导致的意外结果。

因此,Physical RSI必须同时提升actor和世界模型,两者中的每一次进步,都会为另一方揭示出下一阶段需要突破的新的前沿。


01

将现实映射为世界模型


Physical RSl自我改进中最难的问题不在于Actor,而是环境。Actor是递归自我改进中较为熟悉的部分:提出方案、行动、观察、更新、重复迭代。

在一个封闭的数字领域中,环境可以通过静态代码、测试和评价指标来定义。

然而,现实世界无法以这种方式被描述,它过于庞大而无法被完整枚举,变化过于动态而无法被冻结,同时按需重现的成本也过高。

要让现实世界能够被纳入递归改进的过程,我们需要把它映射为一种不断演化的计算表征:

一个具备智能体能力的世界模型(agentic world model)。

“映射”并不意味着像素级的精确复制,只是保留那些决定一个动作能否成功的状态、关系和因果动态。世界模型通过抽象来实现泛化,捕捉那些在外观变化中依然保持不变的对象、关系、事件和规则。

语言使模型能够调用预训练模型中的科学知识和常识,而代码则把这些知识转化为明确的状态、变量和可执行的动态过程。

因此,一个基于代码的智能体世界模型可以把意外事件转化为模拟器和一套可复用的规则,这些规则能够在不同的房间、不同颜色的电缆、不同的机器人,甚至表面上不同的科学系统之间迁移。

它的抽象出来的规则可能是错的,但这些规则是可以被明确地测试和修正的。

02

意外是Physical RSl的引擎

在开放世界中,一次分布外事件(out-of-distribution event,简称OOD 事件)是一个路由信号(routing signal),它揭示了系统能力的边界,以及下一步需要进化的方向。

我们把这样的事件称为一次“意外”。设想一只机器狗,它的腿被电缆缠住了。首先要问的问题不是它应该尝试哪种恢复动作,而是世界模型智能体能否重现刚刚发生的一切。

如果它无法建模电缆路径、接触关系、张力以及腿部运动如何共同导致这一失败,那么系统面临的就是environment gap

世界模型智能体必须抽象出缺失的动态规律,并将这一意外转化为一类可复现的环境情境。

一旦这一失败能够被复现,剩下的问题就是执行者是否能够摆脱这一困境。如果不能,系统就存在一个skill gap

随后,actor就进入自身的递归自我改进(RSI)循环,在扩展后的环境中探索、搜索并优化应对策略。

修正后的世界模型和新的策略都必须在现实中得到验证。如果验证失败,这种偏差就会成为进一步诊断和改进的新证据。如果验证成功,系统便会内化一个更好的世界模型和一种新的行为方式。进化循环变为:

演化循环因此变为:

遭遇意外诊断抽象模拟求解验证内化
(encounter → surprise → diagnose → abstract → simulate → solve → verify → internalize)


正如一个智能体化的LLM 系统可以通过生成并验证训练代码、数据和算法,从而推动自身下一阶段的改进一样,Physical RSI则产生于智能体能够自主发现并解决OOD事件的能力之中。

每一次意外都将成为一个完整的学习过程,这一过程建立在智能体自身积累的物理知识基础之上:识别发生了什么故障,修正世界模型,寻找应对策略,在现实中进行验证,并最终将新知识固化。

通过规模化积累这些经验,可以形成推动智能体和世界模型持续加速改进的递归式基础。


03

Physical RSI的研究路线图

Physical RSI的关键组成部分,需要在多个尚未充分发展的能力方向上取得突破,从而形成一条清晰的发展路线。

环境理解与抽象(Environment understanding and abstraction:系统需要将多模态观测信息映射为结构化、可执行的表征形式(如代码、语言等),从而捕捉环境中的关键实体、关系与动态变化。这一能力支撑着循环中的“诊断→ 抽象”阶段。

智能体物理推理(Agentic physical reasoning:系统需要协调来自不同来源的知识与模拟能力,将物理推理转化为一种可组合、验证、迭代的过程。这对应着循环中的“模拟→ 求解→ 验证”阶段。

基于经验的持续学习(Continual learning from experience:每一次经过验证的抽象表示和解决方案,都应被整合为持久化的世界知识、可复用技能以及回归测试机制。这些能力必须能够超越最初的问题场景实现泛化,同时保持根据新证据进行调整的灵活性。这对应着“内化”阶段。

发现未知(Discovering the unknown:系统需要通过识别自身知识的不确定性,并主动设计具有信息价值的实验,探索自身认知边界。将发现未知作为系统内在目标,驱动着循环中的“遭遇→ 意外”阶段,并使整个进化循环得以闭合。


这一发展路线同样需要下一代评估体系和可解释性研究interpretability)的支持。

评估的目标不再是衡量系统在固定基准测试上的表现,而是考察系统能否以可靠、高效且自主的方式,将未知问题转化为经过验证、可复用的能力。

与此同时,机制可解释性(mechanistic interpretability)将成为一种科学工具,用于理解、监测并引导自我改进型智能的内部运行过程。

04

从局部解决方案迈向通用智能


物理RSI的价值,尤其体现在那些每一次行动都是对一个尚未被完全建模的世界进行实验的场景中。

在机器人、先进制造以及自主科学实验等领域,进化循环遵循着同一逻辑:

在现实中行动,发现世界模型遗漏之处,并基于一个更加丰富的世界理解做出下一次行动。

起初,这种进步看起来只是针对具体任务的优化:让失效的机器人恢复运行,修正制造过程中的缺陷,提高蛋白质设计效果。但递归过程改变了被改进的对象。

系统不再只是在一个固定世界中解决问题,而是在不断扩展能够产生解决方案的世界。

失败逐渐成为结构化知识,意外逐渐成为新的模型,而过去无法解决的问题也开始变得可以被处理。

因此,通用智能并不仅仅意味着在既定问题空间中实现更优的优化能力,而是一种扩展问题空间本身的能力——

将每一次与未知的相遇,都转化为下一次智能进化的起点。


朋友圈会发一些具体的案例和商业化日常~

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
数据显示,超15%的中青年夫妻处于“干婚”状态,68%的中年人拥有固定深交的异性网友

数据显示,超15%的中青年夫妻处于“干婚”状态,68%的中年人拥有固定深交的异性网友

舒山有鹿
2026-07-25 09:57:20
多名学生转新校区后头晕流鼻血,甲醛到底超没超标?

多名学生转新校区后头晕流鼻血,甲醛到底超没超标?

新民周刊
2026-09-04 21:48:44
家委会要给晚托老师订餐,每人每月仅分摊18元,44位家长仅1人不同意,评论区吵翻了!

家委会要给晚托老师订餐,每人每月仅分摊18元,44位家长仅1人不同意,评论区吵翻了!

谭谈社会
2026-09-04 16:50:17
《街霸》电影春丽演员苦练大腿!每天狂吃12个鸡蛋

《街霸》电影春丽演员苦练大腿!每天狂吃12个鸡蛋

3DM游戏
2026-08-29 11:32:21
韩国警方推断郑昌圣和受害中国籍女留学生确实曾为恋人关系!

韩国警方推断郑昌圣和受害中国籍女留学生确实曾为恋人关系!

奋斗在韩国
2026-09-04 13:26:40
越南29艘马德雷山舰“坐滩”我南海岛礁,现反倒率先向中国挑衅

越南29艘马德雷山舰“坐滩”我南海岛礁,现反倒率先向中国挑衅

闻识
2026-09-04 07:53:18
一个主字,砍断了44万医生的退路

一个主字,砍断了44万医生的退路

宝哥精彩赛事
2026-09-04 11:04:02
上海一员工被通知坐硬座通宵出差 次日9点打卡 拒绝后被公司以旷工为由开除 仲裁认定:单位违法 劳动者有休息权

上海一员工被通知坐硬座通宵出差 次日9点打卡 拒绝后被公司以旷工为由开除 仲裁认定:单位违法 劳动者有休息权

每日经济新闻
2026-09-04 23:12:52
章泽天对话何超琼实录!何超琼:豪门也没有理所当然的机会,压力最大时永远先做最难的事;遇见张国荣梅艳芳等挚友,是自己最轻松的十年

章泽天对话何超琼实录!何超琼:豪门也没有理所当然的机会,压力最大时永远先做最难的事;遇见张国荣梅艳芳等挚友,是自己最轻松的十年

极目新闻
2026-09-03 07:57:42
她和何勇闪婚闪离,如今坐拥多家影视公司,已是国内知名导演

她和何勇闪婚闪离,如今坐拥多家影视公司,已是国内知名导演

林轻吟
2026-09-04 16:44:38
霸气!郑钦文击球遭干扰后训斥观众 中文怒吼:不要喊 全场瞬间安静

霸气!郑钦文击球遭干扰后训斥观众 中文怒吼:不要喊 全场瞬间安静

我爱英超
2026-09-04 07:43:43
伊朗副总统:当初选择日本车就好了,中国车质量差价格高

伊朗副总统:当初选择日本车就好了,中国车质量差价格高

贱议你读史
2026-09-02 21:21:39
山东省委书记林武、省长周乃翔带头捐款

山东省委书记林武、省长周乃翔带头捐款

政知新媒体
2026-09-04 10:06:55
德国博主吐槽中国网民乱讲,欧洲面包根本没那么硬,引发网友争议

德国博主吐槽中国网民乱讲,欧洲面包根本没那么硬,引发网友争议

娱乐圈见解说
2026-09-05 01:33:29
《街头霸王》苏联肥有多变态,他有十几种方法可以看户型

《街头霸王》苏联肥有多变态,他有十几种方法可以看户型

街机时代
2026-09-03 18:10:03
随着比分定格1-4,43岁德罗西率队3连败,39岁法布雷加斯率队2连胜

随着比分定格1-4,43岁德罗西率队3连败,39岁法布雷加斯率队2连胜

侧身凌空斩
2026-09-05 04:39:56
面对4架歼-16D出击,阿联酋豁出去了:掏出美法战机,在新疆联训

面对4架歼-16D出击,阿联酋豁出去了:掏出美法战机,在新疆联训

共工之锚
2026-09-05 00:16:05
知名演员(白某,36岁)宣布破产:不敢买咖啡,甚至想接雨水洗澡

知名演员(白某,36岁)宣布破产:不敢买咖啡,甚至想接雨水洗澡

黎兜兜
2026-09-04 23:09:27
这个没人味的通报,让人醉了

这个没人味的通报,让人醉了

常识群
2026-09-04 18:06:59
女性负债,真的开始“集中爆雷”了。

女性负债,真的开始“集中爆雷”了。

老陆不老
2026-09-04 21:51:34
2026-09-05 07:20:49
AI异类 incentive-icons
AI异类
从硅谷到中关村,AI信息与测评
251文章数 11关注度
往期回顾 全部

科技要闻

OpenAI深夜王炸!GPT-6 Astra来了

头条要闻

受试者试药死亡 知名公司董事怼记者:滚开 烦不烦

头条要闻

受试者试药死亡 知名公司董事怼记者:滚开 烦不烦

体育要闻

小卡来去10首轮,快船7年彩礼一场空

娱乐要闻

古天乐公司欠债1.49亿

财经要闻

姚洋:刺激消费要守住两个“大西瓜”

汽车要闻

搭载天枢领航Ultra 长安启源Q06预售14.79万元起

态度原创

手机
健康
家居
艺术
时尚

手机要闻

史上首次!全球超40%手机涨价 新机价格同比高25%

脑梗取栓成功≠活下来,还有这三关

家居要闻

2026建博会(广州) 公装联探展交流活动

艺术要闻

明朝灭亡那年,他画了一群女生玩古代飞花令

今日热点:人人影视变正版了;工作人员冒充StrayKids向粉丝打招呼……

无障碍浏览 进入关怀版