网易首页 > 网易号 > 正文 申请入驻

怎样让 Codex 在物理世界干活?清华大学联合无问芯穹、正行创新全新开源具身智能体基础设施 RPent,端到端任务加速 7 倍 | 前沿在线

0
分享至


编辑:前沿在线 编辑部

Codex、Claude Code 等数字世界智能体已经向我们展示出一种全新且高效的工作方式:大模型理解目标,拆解任务,调用适当的工具,并根据执行结果不断调整计划,直到完成任务。

随着 GPT-6 Astra 开始接受真实机器人操作测试,这种“让大模型作为决策大脑”的智能体范式正逐渐走向物理世界。同时也把一个曾经遥远的问题变得越来越具体:

通用大模型,能否成为机器人的“大脑”,让机器人真正完成现实世界中的复杂任务?

但机器人面对的不是可以随时回滚的代码,在物理世界里,环境持续变化、状态无法完全观测,动作一旦发生也很难轻易撤销,抓取、装配、插拔等精细操作更需要专门的模型与控制能力。

物理世界中的智能体,不只是“想明白”,还必须“看得见、做得到、反应快”,并且“记得住”。

今天,由清华大学、无问芯穹、正行创新联合发起的具身智能体基础设施 RPent 正式开源。

RPent 面向真实物理世界,将通用大模型的任务理解与规划能力、VLA 等专家模型的精细操作能力,以及记忆、工具和机器人接口连接起来,形成从感知、决策、执行到反馈纠错的完整闭环,使智能体能够持续适应环境变化,并将经过验证的经验沉淀为可复用的能力,在与物理环境的持续交互中不断学习和进化。

在 LIBERO-PRO 基准测试中达到 92.6% 的任务成功率,并将端到端任务完成速度优化 7 倍以上。

RPent 由大规模具身强化学习框架 RLinf 的核心团队打造,延续了团队在具身智能基础设施领域的技术积累。

开源代码链接:https://github.com/RLinf/RPent,也可以直接扫描下方图中二维码查看仓库:

RPent 真机效果展示:从“会动”到“会做事”在这一视频中,RPent 展示了多个有趣的开放式任务:机器人将钢珠倒入碗中,双臂协同擦拭盘子,还会主动移开遮挡物,找到藏在碗下的勺子。

值得注意的是,这些任务并不是为每一种场景单独训练一个专用策略。机器人真正发生的变化,是开始从“执行学过的动作”,走向“理解任务、调用能力,并根据环境变化调整行动”。

例如,当任务变化为“将干净餐具放入纸箱”时,面对同一只蓝色盘子,冻结 VLA只会沿用训练时学到的动作,将它错误地放入金属篮中; 而在 RPent 中,智能体会先观察当前环境,再根据新的目标选择放置位置。执行过程中,如果视觉定位出现偏差,它还会检查结果、排除错误目标,并重新定位手中的盘子。任务变了,机器人也能随之改变行动。
另一个任务中,机器人需要读取瓶身和袋子上的品牌标签,将不同饮料放入对应的袋子。 抓起瓶子后,它会先进行小幅试抬,确认夹持稳定; 当原有运动路径不可行时,再调整腕部姿态继续执行。 接着,面对被碗遮挡的勺子,机器人也不会直接尝试抓取,而是先移开两个碗,让目标重新变得可见、可达。 这里展示的已经不再是一条预先写死的动作序列,而是一个完整的“观察—判断—执行—纠错”闭环。
最后两个任务则进一步展示了 RPent 对已有能力的复用。 机器人可以将原本用于“拿起并放置容器”的技能重新组合,用于倾倒钢珠;又把抓取动作与双臂协同、持续接触组合起来,完成持盘、擦拭和收纳。 探索成功后,RPent 会把经过验证的任务逻辑沉淀为任务卡(Task Card);再次执行时,RPent 可以启用Flash Mode ,通过任务卡直接复用这套流程,只根据当前视觉状态做必要调整,避免每一步都重新调用大模型,有效降低了具身智能体执行的延时。

整套 Demo 想展示的,并不是“机器人又学会了几个动作”,而是一个更重要的问题:当机器人走向开放世界,新的任务、物体和障碍不断出现时,它能否像人一样将已有技能重新组织起来,完成训练分布之外的任务?

RPent 所探索的,正是这样的具身智能体形态——机器人不再只是执行一条固定指令,而是能够理解目标、调用能力、应对变化,并将一次成功沉淀为下一次可以复用的经验,这正是具身智能体的雏形。

RPent 核心设计思路

当前具身智能的发展,正在逐渐呈现两种不同的技术路线。

一条是纯 VLA 端到端:用一个视觉-语言-动作模型直接吃下观测、吐出动作,精细操作做得很好,但一旦任务变长、语言变花、场景被扰动就迅速退化

另一条是纯大模型 Agent(如 CAP-X 这类工作):随着 GPT-6 这一代通用模型对具身任务的覆盖率快速提升,让大模型直接输出动作已经能跑通不少任务 —— 但它在亚厘米级的精度、执行时延与“越用越强”这几件事上仍有明显短板。

两条路线之间并非简单的替代关系,而是对应了不同层次的能力:


RPent 并不是在两种路线之间进行折中,更不是让某一个模型变得无所不能,包办从任务理解到机械臂控制的全部工作,而是将具身智能拆解为不同层次的能力,让不同模型各自承担最擅长的事情:

  • 通用大模型负责理解任务、制定计划;

  • VLA、WAM 等专家模型负责高精度动作执行;

  • 记忆系统沉淀经验,推动智能体持续优化;

  • 框架负责连接模型、工具与真实环境,形成闭环。

形成“观察—规划—执行—反馈—再规划”的闭环,让智能体从一次性执行任务,走向在真实世界中持续成长。而背后算法源于团队 7 月份提出的 Harness VLA工作(链接:https://arxiv.org/abs/2607.08448)


开放的模块化架构,让模型、工具和硬件各司其职

RPent采用开放的模块化设计,将系统划分为用户层、智能层、接口层和环境层四大层级。

在用户层,可以通过交互式命令行或 Web Dashboard 下达任务,并查看视觉输入、推理过程和动作轨迹。智能层中的规划器结合基础模型、Memory 与工具库拆解任务,动作原语则把 VLA、WAM 和程序化技能封装成可调用工具。

在环境层和接口层,机器人控制、模型服务和仿真环境可以独立部署,通过轻量级通信连接。上层任务逻辑不必绑定某一种机器人或仿真器,新增设备只需实现标准动作、状态与环境接口。

当前RPent已覆盖LIBERO Pro、RoboCasa、RoboTwin、RoboDojo等仿真环境,以及 Franka、双臂 Franka、YAM 、SO101等真实设备。


用户层(User Layer):智能体交互入口

用户层提供类似 Claude Code / Codex 的交互式 CLI,以及可选 Web Dashboard。用户可以下达任务指令,并实时查看智能体推理过程、视觉输入和动作轨迹,实现对智能决策过程的可观测及实时交互。

智能层(Intelligence Layer):任务规划与能力调度中心

智能层由Agentic PlannerAction Primitive组成。Agentic Planner 结合基础模型、Memory 和 Tool Library,实现任务理解、规划与工具调用,并通过Agentic Loop完成“规划 → 执行 → 反馈 → 记忆更新”的持续优化。

Action Primitive 将 VLA、WAM 等学习型操作模型,以及 Code as Policy 等程序化技能统一封装为标准工具,使大模型负责复杂任务理解与规划,专家模型负责高精度动作执行,从而兼顾泛化能力与操作精度。

接口层(Interface Layer):统一连接模型与机器人

接口层将智能体决策转换为机器人可执行指令,为不同设备提供统一调用接口,包括动作执行、状态读取、环境渲染和设备复位等能力。无论是真实机器人还是仿真平台,上层 Agent、提示词和工具均无需针对设备重新开发,实现跨机器人、跨环境迁移。

环境层(Environment Layer):连接真实与仿真世界

环境层负责任务执行,目前已支持 LIBERO Pro、RoboCasa、RoboTwin 等仿真环境,以及 Franka、双臂 Franka、YAMam 等真实设备。新增机器人只需作为独立模块接入robots/目录,即可被框架自动识别和调用。

此外,智能层与环境层采用独立进程架构,支持模型服务、机器人控制和仿真环境的独立部署、迁移与重启,为持续研发和长期运行提供工程保障。

通过模块化架构与统一接口设计,RPent 不绑定单一模型或机器人,而是构建了一个开放、可扩展的具身智能基础设施,让不同模型、技能与硬件能够灵活组合、高效协同。

同时,每一次任务执行产生的反馈都可以沉淀到记忆系统,为后续任务提供经验支持,使智能体在真实环境中持续学习与优化,将智能体的能力从“一次性部署”推向了“持续演进”。


统一接口设计,让智能体以标准方式连接物理世界

在数字世界中,Agent 的能力边界很大程度上取决于它能调用哪些工具。MCP 的出现,让大模型可以通过统一的工具协议访问搜索、代码、数据库等数字资源。

但进入物理世界之后,问题变得复杂得多。

机器人、相机、传感器、仿真器和各种物理设备都有各自的接口。即使是完成同一个任务,不同机器人也可能使用完全不同的控制方式。如果每接入一种设备,都需要重新开发一套 Agent,那么智能体很难真正规模化扩展。

因此,RPent 将“工具—机器人—环境”进一步抽象,通过分层接口把智能决策与物理执行解耦。将“大模型决策”与“物理设备执行”连接起来,实现智能体、工具和硬件之间的统一协作。


RPent 用三层接口把智能决策与设备执行分开:

  • MCP 统一描述可调用能力。无论底层是 VLA、程序化技能还是其他工具,规划器都通过统一定义进行选择和调用。

  • RPC 连接工具、模型服务与机器人环境,使真实设备、仿真平台、本地进程和远程服务可以独立部署。

  • MHS 面向更广泛的物理设备提供统一读写与控制抽象,使智能体未来能够从机器人扩展到实验仪器、家庭设备和工业系统。

(在开头的真机视频中展示了Franka和YAM的操控,都来自于统一接口。)

通过 MCP、RPC 与 MHS 的分层设计,RPent 正在构建一套连接模型、工具、机器人与物理设备的统一接口体系,让智能体能够像调用数字工具一样调用物理能力,从“操作数字资源”进一步走向“操作真实世界”。


Memory 机制驱动,让一次成功沉淀为长期能力

能完成一次任务,并不意味着真正拥有了这项能力。

在物理世界中,试错的成本远高于数字环境。一次失败的抓取可能需要重新布置场景,一次错误操作甚至可能造成设备损坏。

如果每次执行结束后经验随即消失,智能体就只能反复从零开始。

RPent 的 Memory 系统希望改变的正是这一点:让一次探索产生的经验,成为未来任务执行的基础。

RPent 将经验按复用范围组织为三层记忆,并为记忆记录适用范围、类型、可信度和支撑证据。新经验需要经过验证后才能提高可信度;相互冲突的记录会被保留和隔离,避免偶然成功污染已有能力。


记忆机制中包含 Recipe,也就是可迁移的任务方案,而不是某一次执行中的固定坐标。例如,系统可以记录“先根据任务描述和当前画面确认目标,再调整夹爪位置,调用 VLA 完成抓取,并检查抓取结果”的操作过程。

当物体位置改变时,智能体重新观察环境,再复用相同逻辑,而不是直接沿用原来的坐标。探索模式允许更新记忆;评测模式只读使用已经冻结的经验,使演进过程更加可控。

在 LIBERO-Pro Goal 实验中,引入记忆机制后,RPent 在任务扰动环境下表现出明显提升:在位置交换任务中,成功率从 31.0% 提升至 87.0%

此外,RPent 支持记忆资产分发。一次探索产生的经验可以同步至其他智能体,使单个智能体获得的能力能够成为整个系统持续进化的基础。

通过 Memory 系统,RPent 将智能体从“一次性完成任务”推进到“持续学习和积累经验”。

智能体的能力不再完全依赖模型预训练,而是在真实世界交互中不断增长。


开启 Flash Mode,让智能体跟上物理世界节奏

将大模型引入机器人控制回路,为智能体带来了更强的理解和规划能力,但也带来了新的挑战:大模型推理速度通常远慢于机器人动作执行速度。在物理环境中,等待模型生成下一步决策可能成为整个系统的主要延迟来源。

因此,RPent 并不是单纯追求更快的大模型,而是通过架构优化减少不必要的调用,让智能体运行节奏更加贴近真实世界。

在实际应用中,大量机器人任务具有较强重复性:任务目标和执行逻辑基本稳定,变化的主要是物理位置、姿态和环境状态。对于这类任务,如果每次都从头进行完整规划,无疑会产生大量重复推理。

RPent 通过 Flash Mode 来解决 Agentic Planner 应用于真机的这一加速问题,其核心技术载体是任务卡(Task Card)。

在探索阶段,RPent 允许规划器调用大模型、VLA 和程序化技能,尝试不同动作组合,并将成功且经过验证的任务流程压缩为 Task Card。Task Card 保存任务阶段、动作原语、关键目标与检查条件,不保存只能在一次场景中使用的固定坐标。

进入 Flash Mode 后,系统优先按照 Task Card 执行:视觉模块重新定位关键物体,执行模块根据当前状态调整动作;只有在检查失败、环境偏离或流程无法继续时,才重新调用规划器处理。这样既保留了大模型应对变化的能力,也避免在稳定流程中反复进行高成本推理。


在 LIBERO Object 的 200 次评测中,开启Flash Mode将平均执行时间从 283.6 秒降低至 40.9 秒,在成功率仅下降 3.5 个百分点的情况下,实现约 7 倍加速。这也是开头真机视频中 Flash Mode 的技术含义:把探索得到的成功方案转化为可以快速复用、同时保留环境适应能力的执行流程。

RPent 将已经验证的任务逻辑沉淀下来,在环境发生变化时仅做必要调整,让具身智能体从“每次重新规划”走向“经验复用执行”——不只是记住过去做过什么,更能将已有经验转化为更高效的行动。


Leaderboard:展示模型与系统协同后的能力

社区当下对于Agentic Planner存在相同的问题:到底进展到哪一步了?为了回答这个问题,RPent 推出了Leaderboard 板块(https://rpent.readthedocs.io/zh-cn/latest/rst_source/leaderboard.html),采用不同技术路线、不同基座模型的方案在性能和延时的对比一目了然。


性能Leaderboard:目前展示了LIBERO-Pro、LIBERO、RoboCasa365 Target50 与 RoboTwin


延时Leaderboard:目前展示了LIBERO-Pro、RoboCasa365 与 RoboTwin

GPT-6 Astra 在 RPent 中展现出突出的长程任务与扰动适应能力。在更强调指令变化、布局变化和长程执行的 LIBERO-Pro 上,RPent / GPT-6 Astra 达到 92.63%,相比图中第二名 RPent / Opus-4.7 的 82.4% 高出 10.23 个百分点;相比 π_RLinf 的 50.0% 高出 42.63 个百分点。此外,开启了Flash Mode的RPent明显降低了延时。

在 RoboCasa365 Target50 的厨房长程任务中,RPent / GPT-6 Astra 达到 59.20%,位列图中第一,和 RPent / GPT-5.5 的 57.1%。这说明更强的基础模型经过 RPent 的工具组织、记忆与执行闭环后,能够有效转化为物理任务能力。

其余榜单也显示了 RPent 对不同模型与执行配置的兼容性:RPent / Opus-4.7 在 LIBERO 达到 96.0%;RPent / GPT-5.5 在 RoboTwin达到62.4%,均处于图中领先位置。结果更值得关注的不是某一个模型单独完成了全部控制,而是通用模型、专家模型、工具和记忆系统可以在同一框架内协同发挥作用。


为物理世界中持续进化的智能体,构筑开放的基础设施

从 Codex、Claude Code 到 RPent,AI 正在从“在数字世界完成任务”,走向“在物理世界完成任务”。当智能体走向真实世界,变化的不只是模型能力的边界,也包括支撑这种能力运行的基础设施形态

机器人需要看见环境、理解任务、调用不同能力、完成精细动作,还需要根据真实反馈不断调整策略,并把已经验证过的经验保留下来。

所以,围绕这一完整过程来组织智能体系统的 RPent,并非只是一个开源的“让大模型控制机器人”的框架,而是一套能够连接模型、工具、机器人与环境,并支持智能体在真实世界中持续运行、积累经验和不断递归演进的智能中枢。

从一次任务,到一类任务;从一次执行,到持续进化。

RPent 所代表的,正是大模型真正走进物理世界之后,需要重新构建的下一层基础设施。

开源地址:https://github.com/RLinf/RPent


前沿动态前沿大会
前沿人物

「在看」,给前前加鸡腿

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
提醒!中国游客在日本奈良喂鹿遭公鹿从背后袭击,背部被顶出深长伤口,就诊花费两千余元;有不少网友发帖称有类似情况

提醒!中国游客在日本奈良喂鹿遭公鹿从背后袭击,背部被顶出深长伤口,就诊花费两千余元;有不少网友发帖称有类似情况

扬子晚报
2026-09-21 07:29:36
王鹤棣的瓜,真是越扒越有啊

王鹤棣的瓜,真是越扒越有啊

黎兜兜
2026-09-21 23:13:34
百万粉网红李雷相亲记宣布停更:常年受谣言困扰,患上抑郁症……

百万粉网红李雷相亲记宣布停更:常年受谣言困扰,患上抑郁症……

柴狗夫斯基
2026-09-21 07:57:43
“我爸眼睛价格,是11.3元”,全网疯传视频,撕开多少家庭的绝望

“我爸眼睛价格,是11.3元”,全网疯传视频,撕开多少家庭的绝望

米果说识
2026-09-19 12:03:54
直播3小时副乳走光无人管:流量退潮时,体面才是最后的遮羞布

直播3小时副乳走光无人管:流量退潮时,体面才是最后的遮羞布

放开他让wo来
2026-09-16 00:05:28
有我没他:弗洛伦蒂诺马德里德比前大发雷霆

有我没他:弗洛伦蒂诺马德里德比前大发雷霆

本泽体育
2026-09-21 15:17:55
永远可以相信第4棒的他!张展硕超越孙杨,游出4×200自历史最快一棒

永远可以相信第4棒的他!张展硕超越孙杨,游出4×200自历史最快一棒

全景体育V
2026-09-21 19:50:09
现在最怕西贝倒掉的人,可能是罗永浩

现在最怕西贝倒掉的人,可能是罗永浩

功夫财经
2026-09-21 06:52:51
回顾:被宠坏的“恶少”李天一,被判10年后出狱,仍然死性不改

回顾:被宠坏的“恶少”李天一,被判10年后出狱,仍然死性不改

白云故事
2025-01-24 18:25:03
电池容量突破航空运输监管临界值 苹果为iPhone 18 Pro Max引入出厂固件限电机制

电池容量突破航空运输监管临界值 苹果为iPhone 18 Pro Max引入出厂固件限电机制

cnBeta.COM
2026-09-21 21:41:05
再也瞒不下去了!德国专家曾指出,中美之所以尚未爆发冲突,不是因为美国没本事,而是美国可能已经察觉到了形势的严峻

再也瞒不下去了!德国专家曾指出,中美之所以尚未爆发冲突,不是因为美国没本事,而是美国可能已经察觉到了形势的严峻

z千年历史老号
2026-09-14 17:23:40
业主:拒缴物业费不犯法,因为业主作为买方,有不购买服务的自由

业主:拒缴物业费不犯法,因为业主作为买方,有不购买服务的自由

三农老历
2026-09-19 13:35:51
中国女足5-1菲律宾 亚运会头名进8强+决赛前避开日本 王妍雯戴帽

中国女足5-1菲律宾 亚运会头名进8强+决赛前避开日本 王妍雯戴帽

我爱英超
2026-09-21 17:00:52
12天6个涨停板!股民:没几个人敢买!

12天6个涨停板!股民:没几个人敢买!

数据挖掘分析
2026-09-21 15:19:10
“贾国龙要求罗永浩下跪才愿意和解”冲上热搜,罗永浩发文回应

“贾国龙要求罗永浩下跪才愿意和解”冲上热搜,罗永浩发文回应

第一财经资讯
2026-09-22 01:17:09
AMD涨超6%,再度创下历史新高

AMD涨超6%,再度创下历史新高

界面新闻
2026-09-21 21:41:30
全球首家AI妓院,革了成人行业的命

全球首家AI妓院,革了成人行业的命

广告案例精选
2026-04-02 14:49:22
1662元挂脖连衣裙第一次穿就发生意外,链条脱落造成走光,商家称吊牌已剪有异味拒退,消费者艰难维权10天终拿到退款

1662元挂脖连衣裙第一次穿就发生意外,链条脱落造成走光,商家称吊牌已剪有异味拒退,消费者艰难维权10天终拿到退款

扬子晚报
2026-09-21 22:03:39
外网炸锅特朗普与女助理爱尔兰高尔夫球场亲密照片疯传

外网炸锅特朗普与女助理爱尔兰高尔夫球场亲密照片疯传

麦桐看娱乐
2026-09-21 06:49:25
郭士强称“中国男篮所有人都非常辛苦”,央媒发声:如果训练结果无法转化为得分,这种“苦劳”是资源的浪费、机会的错失

郭士强称“中国男篮所有人都非常辛苦”,央媒发声:如果训练结果无法转化为得分,这种“苦劳”是资源的浪费、机会的错失

政知新媒体
2026-09-21 16:40:42
2026-09-22 01:55:00
前沿在线 incentive-icons
前沿在线
前沿在线官方账号,关注AI、机器人、智能车等前沿领域;
445文章数 1236关注度
往期回顾 全部

科技要闻

吃AI红利的凡人,年薪10万美元,每天3万步

头条要闻

iPhone18第一批受害者来了 网友:24小时死机5次

头条要闻

iPhone18第一批受害者来了 网友:24小时死机5次

体育要闻

跟着华裔天才重仓AI,勇士旧将成资本大佬

娱乐要闻

张佳宁穿搭宽松小腹微凸 引发怀孕猜测

财经要闻

酒鬼酒经销商半年跑了40%

汽车要闻

全系800V/红旗司南智驾 红旗天工07预售权益价16.99万起

态度原创

健康
亲子
艺术
公开课
军事航空

专家提醒:癫痫发作别掐人中!

亲子要闻

哎呦,我的糖果忘记掉地上了

艺术要闻

一生难得一见!国宝级书画全卷展开,看到就是赚到!

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

莫斯科称遭"有史以来最大规模袭击"

无障碍浏览 进入关怀版