网易首页 > 网易号 > 正文 申请入驻

怎样让 Codex 在物理世界干活?清华大学联合无问芯穹、正行创新全新开源具身智能体基础设施 RPent,端到端任务加速 7 倍 | 前沿在线

0
分享至


编辑:前沿在线 编辑部

Codex、Claude Code 等数字世界智能体已经向我们展示出一种全新且高效的工作方式:大模型理解目标,拆解任务,调用适当的工具,并根据执行结果不断调整计划,直到完成任务。

随着 GPT-6 Astra 开始接受真实机器人操作测试,这种“让大模型作为决策大脑”的智能体范式正逐渐走向物理世界。同时也把一个曾经遥远的问题变得越来越具体:

通用大模型,能否成为机器人的“大脑”,让机器人真正完成现实世界中的复杂任务?

但机器人面对的不是可以随时回滚的代码,在物理世界里,环境持续变化、状态无法完全观测,动作一旦发生也很难轻易撤销,抓取、装配、插拔等精细操作更需要专门的模型与控制能力。

物理世界中的智能体,不只是“想明白”,还必须“看得见、做得到、反应快”,并且“记得住”。

今天,由清华大学、无问芯穹、正行创新联合发起的具身智能体基础设施 RPent 正式开源。

RPent 面向真实物理世界,将通用大模型的任务理解与规划能力、VLA 等专家模型的精细操作能力,以及记忆、工具和机器人接口连接起来,形成从感知、决策、执行到反馈纠错的完整闭环,使智能体能够持续适应环境变化,并将经过验证的经验沉淀为可复用的能力,在与物理环境的持续交互中不断学习和进化。

在 LIBERO-PRO 基准测试中达到 92.6% 的任务成功率,并将端到端任务完成速度优化 7 倍以上。

RPent 由大规模具身强化学习框架 RLinf 的核心团队打造,延续了团队在具身智能基础设施领域的技术积累。

开源代码链接:https://github.com/RLinf/RPent,也可以直接扫描下方图中二维码查看仓库:

RPent 真机效果展示:从“会动”到“会做事”在这一视频中,RPent 展示了多个有趣的开放式任务:机器人将钢珠倒入碗中,双臂协同擦拭盘子,还会主动移开遮挡物,找到藏在碗下的勺子。

值得注意的是,这些任务并不是为每一种场景单独训练一个专用策略。机器人真正发生的变化,是开始从“执行学过的动作”,走向“理解任务、调用能力,并根据环境变化调整行动”。

例如,当任务变化为“将干净餐具放入纸箱”时,面对同一只蓝色盘子,冻结 VLA只会沿用训练时学到的动作,将它错误地放入金属篮中; 而在 RPent 中,智能体会先观察当前环境,再根据新的目标选择放置位置。执行过程中,如果视觉定位出现偏差,它还会检查结果、排除错误目标,并重新定位手中的盘子。任务变了,机器人也能随之改变行动。
另一个任务中,机器人需要读取瓶身和袋子上的品牌标签,将不同饮料放入对应的袋子。 抓起瓶子后,它会先进行小幅试抬,确认夹持稳定; 当原有运动路径不可行时,再调整腕部姿态继续执行。 接着,面对被碗遮挡的勺子,机器人也不会直接尝试抓取,而是先移开两个碗,让目标重新变得可见、可达。 这里展示的已经不再是一条预先写死的动作序列,而是一个完整的“观察—判断—执行—纠错”闭环。
最后两个任务则进一步展示了 RPent 对已有能力的复用。 机器人可以将原本用于“拿起并放置容器”的技能重新组合,用于倾倒钢珠;又把抓取动作与双臂协同、持续接触组合起来,完成持盘、擦拭和收纳。 探索成功后,RPent 会把经过验证的任务逻辑沉淀为任务卡(Task Card);再次执行时,RPent 可以启用Flash Mode ,通过任务卡直接复用这套流程,只根据当前视觉状态做必要调整,避免每一步都重新调用大模型,有效降低了具身智能体执行的延时。

整套 Demo 想展示的,并不是“机器人又学会了几个动作”,而是一个更重要的问题:当机器人走向开放世界,新的任务、物体和障碍不断出现时,它能否像人一样将已有技能重新组织起来,完成训练分布之外的任务?

RPent 所探索的,正是这样的具身智能体形态——机器人不再只是执行一条固定指令,而是能够理解目标、调用能力、应对变化,并将一次成功沉淀为下一次可以复用的经验,这正是具身智能体的雏形。

RPent 核心设计思路

当前具身智能的发展,正在逐渐呈现两种不同的技术路线。

一条是纯 VLA 端到端:用一个视觉-语言-动作模型直接吃下观测、吐出动作,精细操作做得很好,但一旦任务变长、语言变花、场景被扰动就迅速退化

另一条是纯大模型 Agent(如 CAP-X 这类工作):随着 GPT-6 这一代通用模型对具身任务的覆盖率快速提升,让大模型直接输出动作已经能跑通不少任务 —— 但它在亚厘米级的精度、执行时延与“越用越强”这几件事上仍有明显短板。

两条路线之间并非简单的替代关系,而是对应了不同层次的能力:


RPent 并不是在两种路线之间进行折中,更不是让某一个模型变得无所不能,包办从任务理解到机械臂控制的全部工作,而是将具身智能拆解为不同层次的能力,让不同模型各自承担最擅长的事情:

  • 通用大模型负责理解任务、制定计划;

  • VLA、WAM 等专家模型负责高精度动作执行;

  • 记忆系统沉淀经验,推动智能体持续优化;

  • 框架负责连接模型、工具与真实环境,形成闭环。

形成“观察—规划—执行—反馈—再规划”的闭环,让智能体从一次性执行任务,走向在真实世界中持续成长。而背后算法源于团队 7 月份提出的 Harness VLA工作(链接:https://arxiv.org/abs/2607.08448)


开放的模块化架构,让模型、工具和硬件各司其职

RPent采用开放的模块化设计,将系统划分为用户层、智能层、接口层和环境层四大层级。

在用户层,可以通过交互式命令行或 Web Dashboard 下达任务,并查看视觉输入、推理过程和动作轨迹。智能层中的规划器结合基础模型、Memory 与工具库拆解任务,动作原语则把 VLA、WAM 和程序化技能封装成可调用工具。

在环境层和接口层,机器人控制、模型服务和仿真环境可以独立部署,通过轻量级通信连接。上层任务逻辑不必绑定某一种机器人或仿真器,新增设备只需实现标准动作、状态与环境接口。

当前RPent已覆盖LIBERO Pro、RoboCasa、RoboTwin、RoboDojo等仿真环境,以及 Franka、双臂 Franka、YAM 、SO101等真实设备。


用户层(User Layer):智能体交互入口

用户层提供类似 Claude Code / Codex 的交互式 CLI,以及可选 Web Dashboard。用户可以下达任务指令,并实时查看智能体推理过程、视觉输入和动作轨迹,实现对智能决策过程的可观测及实时交互。

智能层(Intelligence Layer):任务规划与能力调度中心

智能层由Agentic PlannerAction Primitive组成。Agentic Planner 结合基础模型、Memory 和 Tool Library,实现任务理解、规划与工具调用,并通过Agentic Loop完成“规划 → 执行 → 反馈 → 记忆更新”的持续优化。

Action Primitive 将 VLA、WAM 等学习型操作模型,以及 Code as Policy 等程序化技能统一封装为标准工具,使大模型负责复杂任务理解与规划,专家模型负责高精度动作执行,从而兼顾泛化能力与操作精度。

接口层(Interface Layer):统一连接模型与机器人

接口层将智能体决策转换为机器人可执行指令,为不同设备提供统一调用接口,包括动作执行、状态读取、环境渲染和设备复位等能力。无论是真实机器人还是仿真平台,上层 Agent、提示词和工具均无需针对设备重新开发,实现跨机器人、跨环境迁移。

环境层(Environment Layer):连接真实与仿真世界

环境层负责任务执行,目前已支持 LIBERO Pro、RoboCasa、RoboTwin 等仿真环境,以及 Franka、双臂 Franka、YAMam 等真实设备。新增机器人只需作为独立模块接入robots/目录,即可被框架自动识别和调用。

此外,智能层与环境层采用独立进程架构,支持模型服务、机器人控制和仿真环境的独立部署、迁移与重启,为持续研发和长期运行提供工程保障。

通过模块化架构与统一接口设计,RPent 不绑定单一模型或机器人,而是构建了一个开放、可扩展的具身智能基础设施,让不同模型、技能与硬件能够灵活组合、高效协同。

同时,每一次任务执行产生的反馈都可以沉淀到记忆系统,为后续任务提供经验支持,使智能体在真实环境中持续学习与优化,将智能体的能力从“一次性部署”推向了“持续演进”。


统一接口设计,让智能体以标准方式连接物理世界

在数字世界中,Agent 的能力边界很大程度上取决于它能调用哪些工具。MCP 的出现,让大模型可以通过统一的工具协议访问搜索、代码、数据库等数字资源。

但进入物理世界之后,问题变得复杂得多。

机器人、相机、传感器、仿真器和各种物理设备都有各自的接口。即使是完成同一个任务,不同机器人也可能使用完全不同的控制方式。如果每接入一种设备,都需要重新开发一套 Agent,那么智能体很难真正规模化扩展。

因此,RPent 将“工具—机器人—环境”进一步抽象,通过分层接口把智能决策与物理执行解耦。将“大模型决策”与“物理设备执行”连接起来,实现智能体、工具和硬件之间的统一协作。


RPent 用三层接口把智能决策与设备执行分开:

  • MCP 统一描述可调用能力。无论底层是 VLA、程序化技能还是其他工具,规划器都通过统一定义进行选择和调用。

  • RPC 连接工具、模型服务与机器人环境,使真实设备、仿真平台、本地进程和远程服务可以独立部署。

  • MHS 面向更广泛的物理设备提供统一读写与控制抽象,使智能体未来能够从机器人扩展到实验仪器、家庭设备和工业系统。

(在开头的真机视频中展示了Franka和YAM的操控,都来自于统一接口。)

通过 MCP、RPC 与 MHS 的分层设计,RPent 正在构建一套连接模型、工具、机器人与物理设备的统一接口体系,让智能体能够像调用数字工具一样调用物理能力,从“操作数字资源”进一步走向“操作真实世界”。


Memory 机制驱动,让一次成功沉淀为长期能力

能完成一次任务,并不意味着真正拥有了这项能力。

在物理世界中,试错的成本远高于数字环境。一次失败的抓取可能需要重新布置场景,一次错误操作甚至可能造成设备损坏。

如果每次执行结束后经验随即消失,智能体就只能反复从零开始。

RPent 的 Memory 系统希望改变的正是这一点:让一次探索产生的经验,成为未来任务执行的基础。

RPent 将经验按复用范围组织为三层记忆,并为记忆记录适用范围、类型、可信度和支撑证据。新经验需要经过验证后才能提高可信度;相互冲突的记录会被保留和隔离,避免偶然成功污染已有能力。


记忆机制中包含 Recipe,也就是可迁移的任务方案,而不是某一次执行中的固定坐标。例如,系统可以记录“先根据任务描述和当前画面确认目标,再调整夹爪位置,调用 VLA 完成抓取,并检查抓取结果”的操作过程。

当物体位置改变时,智能体重新观察环境,再复用相同逻辑,而不是直接沿用原来的坐标。探索模式允许更新记忆;评测模式只读使用已经冻结的经验,使演进过程更加可控。

在 LIBERO-Pro Goal 实验中,引入记忆机制后,RPent 在任务扰动环境下表现出明显提升:在位置交换任务中,成功率从 31.0% 提升至 87.0%

此外,RPent 支持记忆资产分发。一次探索产生的经验可以同步至其他智能体,使单个智能体获得的能力能够成为整个系统持续进化的基础。

通过 Memory 系统,RPent 将智能体从“一次性完成任务”推进到“持续学习和积累经验”。

智能体的能力不再完全依赖模型预训练,而是在真实世界交互中不断增长。


开启 Flash Mode,让智能体跟上物理世界节奏

将大模型引入机器人控制回路,为智能体带来了更强的理解和规划能力,但也带来了新的挑战:大模型推理速度通常远慢于机器人动作执行速度。在物理环境中,等待模型生成下一步决策可能成为整个系统的主要延迟来源。

因此,RPent 并不是单纯追求更快的大模型,而是通过架构优化减少不必要的调用,让智能体运行节奏更加贴近真实世界。

在实际应用中,大量机器人任务具有较强重复性:任务目标和执行逻辑基本稳定,变化的主要是物理位置、姿态和环境状态。对于这类任务,如果每次都从头进行完整规划,无疑会产生大量重复推理。

RPent 通过 Flash Mode 来解决 Agentic Planner 应用于真机的这一加速问题,其核心技术载体是任务卡(Task Card)。

在探索阶段,RPent 允许规划器调用大模型、VLA 和程序化技能,尝试不同动作组合,并将成功且经过验证的任务流程压缩为 Task Card。Task Card 保存任务阶段、动作原语、关键目标与检查条件,不保存只能在一次场景中使用的固定坐标。

进入 Flash Mode 后,系统优先按照 Task Card 执行:视觉模块重新定位关键物体,执行模块根据当前状态调整动作;只有在检查失败、环境偏离或流程无法继续时,才重新调用规划器处理。这样既保留了大模型应对变化的能力,也避免在稳定流程中反复进行高成本推理。


在 LIBERO Object 的 200 次评测中,开启Flash Mode将平均执行时间从 283.6 秒降低至 40.9 秒,在成功率仅下降 3.5 个百分点的情况下,实现约 7 倍加速。这也是开头真机视频中 Flash Mode 的技术含义:把探索得到的成功方案转化为可以快速复用、同时保留环境适应能力的执行流程。

RPent 将已经验证的任务逻辑沉淀下来,在环境发生变化时仅做必要调整,让具身智能体从“每次重新规划”走向“经验复用执行”——不只是记住过去做过什么,更能将已有经验转化为更高效的行动。


Leaderboard:展示模型与系统协同后的能力

社区当下对于Agentic Planner存在相同的问题:到底进展到哪一步了?为了回答这个问题,RPent 推出了Leaderboard 板块(https://rpent.readthedocs.io/zh-cn/latest/rst_source/leaderboard.html),采用不同技术路线、不同基座模型的方案在性能和延时的对比一目了然。


性能Leaderboard:目前展示了LIBERO-Pro、LIBERO、RoboCasa365 Target50 与 RoboTwin


延时Leaderboard:目前展示了LIBERO-Pro、RoboCasa365 与 RoboTwin

GPT-6 Astra 在 RPent 中展现出突出的长程任务与扰动适应能力。在更强调指令变化、布局变化和长程执行的 LIBERO-Pro 上,RPent / GPT-6 Astra 达到 92.63%,相比图中第二名 RPent / Opus-4.7 的 82.4% 高出 10.23 个百分点;相比 π_RLinf 的 50.0% 高出 42.63 个百分点。此外,开启了Flash Mode的RPent明显降低了延时。

在 RoboCasa365 Target50 的厨房长程任务中,RPent / GPT-6 Astra 达到 59.20%,位列图中第一,和 RPent / GPT-5.5 的 57.1%。这说明更强的基础模型经过 RPent 的工具组织、记忆与执行闭环后,能够有效转化为物理任务能力。

其余榜单也显示了 RPent 对不同模型与执行配置的兼容性:RPent / Opus-4.7 在 LIBERO 达到 96.0%;RPent / GPT-5.5 在 RoboTwin达到62.4%,均处于图中领先位置。结果更值得关注的不是某一个模型单独完成了全部控制,而是通用模型、专家模型、工具和记忆系统可以在同一框架内协同发挥作用。


为物理世界中持续进化的智能体,构筑开放的基础设施

从 Codex、Claude Code 到 RPent,AI 正在从“在数字世界完成任务”,走向“在物理世界完成任务”。当智能体走向真实世界,变化的不只是模型能力的边界,也包括支撑这种能力运行的基础设施形态

机器人需要看见环境、理解任务、调用不同能力、完成精细动作,还需要根据真实反馈不断调整策略,并把已经验证过的经验保留下来。

所以,围绕这一完整过程来组织智能体系统的 RPent,并非只是一个开源的“让大模型控制机器人”的框架,而是一套能够连接模型、工具、机器人与环境,并支持智能体在真实世界中持续运行、积累经验和不断递归演进的智能中枢。

从一次任务,到一类任务;从一次执行,到持续进化。

RPent 所代表的,正是大模型真正走进物理世界之后,需要重新构建的下一层基础设施。

开源地址:https://github.com/RLinf/RPent


前沿动态前沿大会
前沿人物

「在看」,给前前加鸡腿

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
男子给前女友快递有毒饮料,女子一直没喝,她的两室友误饮中毒,导致肝功能损害,男子的电脑数据,完整记录了预谋杀害全过程,被判8年

男子给前女友快递有毒饮料,女子一直没喝,她的两室友误饮中毒,导致肝功能损害,男子的电脑数据,完整记录了预谋杀害全过程,被判8年

南方都市报
2026-09-21 12:02:31
蓝战非到底多有钱,他的收入拆解如下

蓝战非到底多有钱,他的收入拆解如下

东方不败然多多
2026-09-19 11:04:50
太可怕了!江苏女生哭诉侍候父亲的至暗时刻,字里行间恐惧与绝望

太可怕了!江苏女生哭诉侍候父亲的至暗时刻,字里行间恐惧与绝望

火山詩话
2026-05-30 17:59:42
广东超40所学校官宣!中秋国庆连休13天!

广东超40所学校官宣!中秋国庆连休13天!

王姐懒人家常菜
2026-09-21 12:34:12
许嵩结婚风波升级!圈内无一人参加,大量粉丝脱粉,称女方野心大

许嵩结婚风波升级!圈内无一人参加,大量粉丝脱粉,称女方野心大

娱说瑜悦
2026-09-21 19:11:32
五角大楼UFO文件披露:3名天线工程师事后脱发、皮肤发红,一人数年后现恶性转化迹象

五角大楼UFO文件披露:3名天线工程师事后脱发、皮肤发红,一人数年后现恶性转化迹象

红星新闻
2026-09-20 18:07:10
乌前防长:泽连斯基本来准备大选,听说扎卢日内可能参选后放弃

乌前防长:泽连斯基本来准备大选,听说扎卢日内可能参选后放弃

桂系007
2026-09-21 23:42:37
乌克兰收复要塞谢列德涅!清除库皮扬斯克20座俄军阵地

乌克兰收复要塞谢列德涅!清除库皮扬斯克20座俄军阵地

项鹏飞
2026-09-19 20:12:54
闲鱼又出事了:一个二手平台,怎么就成了最黄的引流入口?

闲鱼又出事了:一个二手平台,怎么就成了最黄的引流入口?

大佬灼见
2026-09-21 15:35:21
正式量产!长鑫科技直线拉涨

正式量产!长鑫科技直线拉涨

财闻
2026-09-21 13:26:13
王曼昱刚败下阵不到一天,离谱一幕上演,她竟与孙颖莎同病相怜

王曼昱刚败下阵不到一天,离谱一幕上演,她竟与孙颖莎同病相怜

兰亭墨未干
2026-09-22 00:22:14
医院病房迎来大调整!逐步取消三人间,住院不用再遭罪

医院病房迎来大调整!逐步取消三人间,住院不用再遭罪

普陀动物世界
2026-09-19 00:16:12
《交锋》大结局:马憩朱应甲正式见面,之前入狱的三人竟成马憩的得力助手

《交锋》大结局:马憩朱应甲正式见面,之前入狱的三人竟成马憩的得力助手

肆季娱乐
2026-09-21 10:40:20
定居美国13年,回国捞金惨遭"驱逐",53岁活成了笑话

定居美国13年,回国捞金惨遭"驱逐",53岁活成了笑话

锅锅爱历史
2026-09-02 14:28:57
卖爆了?歼-10CE和“枭龙”拿下约112架大单,中国战机要火了

卖爆了?歼-10CE和“枭龙”拿下约112架大单,中国战机要火了

军武速递
2026-09-21 21:07:20
“秦始皇陵为什么不挖”冲上热搜,文物修复专家:贸然打开冲击很大,没必要动,要对天地、对自然有敬畏之心

“秦始皇陵为什么不挖”冲上热搜,文物修复专家:贸然打开冲击很大,没必要动,要对天地、对自然有敬畏之心

极目新闻
2026-09-20 14:12:54
女排复仇泰国!全队怒吼+蹦跶庆祝,赵勇开心,3主攻搭肩拥抱!

女排复仇泰国!全队怒吼+蹦跶庆祝,赵勇开心,3主攻搭肩拥抱!

篮球资讯达人
2026-09-21 19:03:19
2009年,宁波籍留美博士在大学校园餐厅内当着7人的面,将学妹杀害,行凶后他未逃离,留在原地等候警方到场,主动伸手配合警方戴上手铐

2009年,宁波籍留美博士在大学校园餐厅内当着7人的面,将学妹杀害,行凶后他未逃离,留在原地等候警方到场,主动伸手配合警方戴上手铐

人生录
2026-09-12 00:05:19
忙活一桌子,狗都不吃!丈夫过生日,妻子自我感动 ,网友吐槽

忙活一桌子,狗都不吃!丈夫过生日,妻子自我感动 ,网友吐槽

蝴蝶花雨话教育
2026-05-31 00:05:20
毛泽东四渡赤水最奇在于:有一个不能说的真相,他自始至终没透露

毛泽东四渡赤水最奇在于:有一个不能说的真相,他自始至终没透露

纪史行者
2026-09-21 07:45:08
2026-09-22 01:07:00
前沿在线 incentive-icons
前沿在线
前沿在线官方账号,关注AI、机器人、智能车等前沿领域;
445文章数 1236关注度
往期回顾 全部

科技要闻

吃AI红利的凡人,年薪10万美元,每天3万步

头条要闻

覃伟中被查:上月刚辞任深圳市长 曾在中石化任职21年

头条要闻

覃伟中被查:上月刚辞任深圳市长 曾在中石化任职21年

体育要闻

跟着华裔天才重仓AI,勇士旧将成资本大佬

娱乐要闻

张佳宁穿搭宽松小腹微凸 引发怀孕猜测

财经要闻

酒鬼酒经销商半年跑了40%

汽车要闻

全系800V/红旗司南智驾 红旗天工07预售权益价16.99万起

态度原创

时尚
家居
亲子
本地
数码

夏秋换季,学宋慧乔“挂件衣服”出门

家居要闻

2026建博会(广州) 公装联探展交流活动

亲子要闻

哎呦,我的糖果忘记掉地上了

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

数码要闻

小米推出米家即热饮水机Pro:3秒即热出水,399元

无障碍浏览 进入关怀版