![]()
编辑:前沿在线 编辑部
Codex、Claude Code 等数字世界智能体已经向我们展示出一种全新且高效的工作方式:大模型理解目标,拆解任务,调用适当的工具,并根据执行结果不断调整计划,直到完成任务。
随着 GPT-6 Astra 开始接受真实机器人操作测试,这种“让大模型作为决策大脑”的智能体范式正逐渐走向物理世界。同时也把一个曾经遥远的问题变得越来越具体:
通用大模型,能否成为机器人的“大脑”,让机器人真正完成现实世界中的复杂任务?
但机器人面对的不是可以随时回滚的代码,在物理世界里,环境持续变化、状态无法完全观测,动作一旦发生也很难轻易撤销,抓取、装配、插拔等精细操作更需要专门的模型与控制能力。
物理世界中的智能体,不只是“想明白”,还必须“看得见、做得到、反应快”,并且“记得住”。
今天,由清华大学、无问芯穹、正行创新联合发起的具身智能体基础设施 RPent 正式开源。
RPent 面向真实物理世界,将通用大模型的任务理解与规划能力、VLA 等专家模型的精细操作能力,以及记忆、工具和机器人接口连接起来,形成从感知、决策、执行到反馈纠错的完整闭环,使智能体能够持续适应环境变化,并将经过验证的经验沉淀为可复用的能力,在与物理环境的持续交互中不断学习和进化。
在 LIBERO-PRO 基准测试中达到 92.6% 的任务成功率,并将端到端任务完成速度优化 7 倍以上。
RPent 由大规模具身强化学习框架 RLinf 的核心团队打造,延续了团队在具身智能基础设施领域的技术积累。
开源代码链接:https://github.com/RLinf/RPent,也可以直接扫描下方图中二维码查看仓库:
RPent 真机效果展示:从“会动”到“会做事”在这一视频中,RPent 展示了多个有趣的开放式任务:机器人将钢珠倒入碗中,双臂协同擦拭盘子,还会主动移开遮挡物,找到藏在碗下的勺子。
值得注意的是,这些任务并不是为每一种场景单独训练一个专用策略。机器人真正发生的变化,是开始从“执行学过的动作”,走向“理解任务、调用能力,并根据环境变化调整行动”。
例如,当任务变化为“将干净餐具放入纸箱”时,面对同一只蓝色盘子,冻结 VLA只会沿用训练时学到的动作,将它错误地放入金属篮中; 而在 RPent 中,智能体会先观察当前环境,再根据新的目标选择放置位置。执行过程中,如果视觉定位出现偏差,它还会检查结果、排除错误目标,并重新定位手中的盘子。任务变了,机器人也能随之改变行动。
另一个任务中,机器人需要读取瓶身和袋子上的品牌标签,将不同饮料放入对应的袋子。 抓起瓶子后,它会先进行小幅试抬,确认夹持稳定; 当原有运动路径不可行时,再调整腕部姿态继续执行。 接着,面对被碗遮挡的勺子,机器人也不会直接尝试抓取,而是先移开两个碗,让目标重新变得可见、可达。 这里展示的已经不再是一条预先写死的动作序列,而是一个完整的“观察—判断—执行—纠错”闭环。
最后两个任务则进一步展示了 RPent 对已有能力的复用。 机器人可以将原本用于“拿起并放置容器”的技能重新组合,用于倾倒钢珠;又把抓取动作与双臂协同、持续接触组合起来,完成持盘、擦拭和收纳。 探索成功后,RPent 会把经过验证的任务逻辑沉淀为任务卡(Task Card);再次执行时,RPent 可以启用Flash Mode ,通过任务卡直接复用这套流程,只根据当前视觉状态做必要调整,避免每一步都重新调用大模型,有效降低了具身智能体执行的延时。
整套 Demo 想展示的,并不是“机器人又学会了几个动作”,而是一个更重要的问题:当机器人走向开放世界,新的任务、物体和障碍不断出现时,它能否像人一样将已有技能重新组织起来,完成训练分布之外的任务?
RPent 所探索的,正是这样的具身智能体形态——机器人不再只是执行一条固定指令,而是能够理解目标、调用能力、应对变化,并将一次成功沉淀为下一次可以复用的经验,这正是具身智能体的雏形。
RPent 核心设计思路
当前具身智能的发展,正在逐渐呈现两种不同的技术路线。
一条是纯 VLA 端到端:用一个视觉-语言-动作模型直接吃下观测、吐出动作,精细操作做得很好,但一旦任务变长、语言变花、场景被扰动就迅速退化。
另一条是纯大模型 Agent(如 CAP-X 这类工作):随着 GPT-6 这一代通用模型对具身任务的覆盖率快速提升,让大模型直接输出动作已经能跑通不少任务 —— 但它在亚厘米级的精度、执行时延与“越用越强”这几件事上仍有明显短板。
两条路线之间并非简单的替代关系,而是对应了不同层次的能力:
![]()
RPent 并不是在两种路线之间进行折中,更不是让某一个模型变得无所不能,包办从任务理解到机械臂控制的全部工作,而是将具身智能拆解为不同层次的能力,让不同模型各自承担最擅长的事情:
通用大模型负责理解任务、制定计划;
VLA、WAM 等专家模型负责高精度动作执行;
记忆系统沉淀经验,推动智能体持续优化;
框架负责连接模型、工具与真实环境,形成闭环。
形成“观察—规划—执行—反馈—再规划”的闭环,让智能体从一次性执行任务,走向在真实世界中持续成长。而背后算法源于团队 7 月份提出的 Harness VLA工作(链接:https://arxiv.org/abs/2607.08448)
![]()
开放的模块化架构,让模型、工具和硬件各司其职
RPent采用开放的模块化设计,将系统划分为用户层、智能层、接口层和环境层四大层级。
在用户层,可以通过交互式命令行或 Web Dashboard 下达任务,并查看视觉输入、推理过程和动作轨迹。智能层中的规划器结合基础模型、Memory 与工具库拆解任务,动作原语则把 VLA、WAM 和程序化技能封装成可调用工具。
在环境层和接口层,机器人控制、模型服务和仿真环境可以独立部署,通过轻量级通信连接。上层任务逻辑不必绑定某一种机器人或仿真器,新增设备只需实现标准动作、状态与环境接口。
当前RPent已覆盖LIBERO Pro、RoboCasa、RoboTwin、RoboDojo等仿真环境,以及 Franka、双臂 Franka、YAM 、SO101等真实设备。
![]()
用户层(User Layer):智能体交互入口
用户层提供类似 Claude Code / Codex 的交互式 CLI,以及可选 Web Dashboard。用户可以下达任务指令,并实时查看智能体推理过程、视觉输入和动作轨迹,实现对智能决策过程的可观测及实时交互。
智能层(Intelligence Layer):任务规划与能力调度中心
智能层由Agentic Planner和Action Primitive组成。Agentic Planner 结合基础模型、Memory 和 Tool Library,实现任务理解、规划与工具调用,并通过Agentic Loop完成“规划 → 执行 → 反馈 → 记忆更新”的持续优化。
Action Primitive 将 VLA、WAM 等学习型操作模型,以及 Code as Policy 等程序化技能统一封装为标准工具,使大模型负责复杂任务理解与规划,专家模型负责高精度动作执行,从而兼顾泛化能力与操作精度。
接口层(Interface Layer):统一连接模型与机器人
接口层将智能体决策转换为机器人可执行指令,为不同设备提供统一调用接口,包括动作执行、状态读取、环境渲染和设备复位等能力。无论是真实机器人还是仿真平台,上层 Agent、提示词和工具均无需针对设备重新开发,实现跨机器人、跨环境迁移。
环境层(Environment Layer):连接真实与仿真世界
环境层负责任务执行,目前已支持 LIBERO Pro、RoboCasa、RoboTwin 等仿真环境,以及 Franka、双臂 Franka、YAMam 等真实设备。新增机器人只需作为独立模块接入robots/目录,即可被框架自动识别和调用。
此外,智能层与环境层采用独立进程架构,支持模型服务、机器人控制和仿真环境的独立部署、迁移与重启,为持续研发和长期运行提供工程保障。
通过模块化架构与统一接口设计,RPent 不绑定单一模型或机器人,而是构建了一个开放、可扩展的具身智能基础设施,让不同模型、技能与硬件能够灵活组合、高效协同。
同时,每一次任务执行产生的反馈都可以沉淀到记忆系统,为后续任务提供经验支持,使智能体在真实环境中持续学习与优化,将智能体的能力从“一次性部署”推向了“持续演进”。
![]()
统一接口设计,让智能体以标准方式连接物理世界
在数字世界中,Agent 的能力边界很大程度上取决于它能调用哪些工具。MCP 的出现,让大模型可以通过统一的工具协议访问搜索、代码、数据库等数字资源。
但进入物理世界之后,问题变得复杂得多。
机器人、相机、传感器、仿真器和各种物理设备都有各自的接口。即使是完成同一个任务,不同机器人也可能使用完全不同的控制方式。如果每接入一种设备,都需要重新开发一套 Agent,那么智能体很难真正规模化扩展。
因此,RPent 将“工具—机器人—环境”进一步抽象,通过分层接口把智能决策与物理执行解耦。将“大模型决策”与“物理设备执行”连接起来,实现智能体、工具和硬件之间的统一协作。
![]()
RPent 用三层接口把智能决策与设备执行分开:
MCP 统一描述可调用能力。无论底层是 VLA、程序化技能还是其他工具,规划器都通过统一定义进行选择和调用。
RPC 连接工具、模型服务与机器人环境,使真实设备、仿真平台、本地进程和远程服务可以独立部署。
MHS 面向更广泛的物理设备提供统一读写与控制抽象,使智能体未来能够从机器人扩展到实验仪器、家庭设备和工业系统。
(在开头的真机视频中展示了Franka和YAM的操控,都来自于统一接口。)
通过 MCP、RPC 与 MHS 的分层设计,RPent 正在构建一套连接模型、工具、机器人与物理设备的统一接口体系,让智能体能够像调用数字工具一样调用物理能力,从“操作数字资源”进一步走向“操作真实世界”。
![]()
Memory 机制驱动,让一次成功沉淀为长期能力
能完成一次任务,并不意味着真正拥有了这项能力。
在物理世界中,试错的成本远高于数字环境。一次失败的抓取可能需要重新布置场景,一次错误操作甚至可能造成设备损坏。
如果每次执行结束后经验随即消失,智能体就只能反复从零开始。
RPent 的 Memory 系统希望改变的正是这一点:让一次探索产生的经验,成为未来任务执行的基础。
RPent 将经验按复用范围组织为三层记忆,并为记忆记录适用范围、类型、可信度和支撑证据。新经验需要经过验证后才能提高可信度;相互冲突的记录会被保留和隔离,避免偶然成功污染已有能力。
![]()
记忆机制中包含 Recipe,也就是可迁移的任务方案,而不是某一次执行中的固定坐标。例如,系统可以记录“先根据任务描述和当前画面确认目标,再调整夹爪位置,调用 VLA 完成抓取,并检查抓取结果”的操作过程。
当物体位置改变时,智能体重新观察环境,再复用相同逻辑,而不是直接沿用原来的坐标。探索模式允许更新记忆;评测模式只读使用已经冻结的经验,使演进过程更加可控。
在 LIBERO-Pro Goal 实验中,引入记忆机制后,RPent 在任务扰动环境下表现出明显提升:在位置交换任务中,成功率从 31.0% 提升至 87.0%。
此外,RPent 支持记忆资产分发。一次探索产生的经验可以同步至其他智能体,使单个智能体获得的能力能够成为整个系统持续进化的基础。
通过 Memory 系统,RPent 将智能体从“一次性完成任务”推进到“持续学习和积累经验”。
智能体的能力不再完全依赖模型预训练,而是在真实世界交互中不断增长。
![]()
开启 Flash Mode,让智能体跟上物理世界节奏
将大模型引入机器人控制回路,为智能体带来了更强的理解和规划能力,但也带来了新的挑战:大模型推理速度通常远慢于机器人动作执行速度。在物理环境中,等待模型生成下一步决策可能成为整个系统的主要延迟来源。
因此,RPent 并不是单纯追求更快的大模型,而是通过架构优化减少不必要的调用,让智能体运行节奏更加贴近真实世界。
在实际应用中,大量机器人任务具有较强重复性:任务目标和执行逻辑基本稳定,变化的主要是物理位置、姿态和环境状态。对于这类任务,如果每次都从头进行完整规划,无疑会产生大量重复推理。
RPent 通过 Flash Mode 来解决 Agentic Planner 应用于真机的这一加速问题,其核心技术载体是任务卡(Task Card)。
在探索阶段,RPent 允许规划器调用大模型、VLA 和程序化技能,尝试不同动作组合,并将成功且经过验证的任务流程压缩为 Task Card。Task Card 保存任务阶段、动作原语、关键目标与检查条件,不保存只能在一次场景中使用的固定坐标。
进入 Flash Mode 后,系统优先按照 Task Card 执行:视觉模块重新定位关键物体,执行模块根据当前状态调整动作;只有在检查失败、环境偏离或流程无法继续时,才重新调用规划器处理。这样既保留了大模型应对变化的能力,也避免在稳定流程中反复进行高成本推理。
![]()
在 LIBERO Object 的 200 次评测中,开启Flash Mode将平均执行时间从 283.6 秒降低至 40.9 秒,在成功率仅下降 3.5 个百分点的情况下,实现约 7 倍加速。这也是开头真机视频中 Flash Mode 的技术含义:把探索得到的成功方案转化为可以快速复用、同时保留环境适应能力的执行流程。
RPent 将已经验证的任务逻辑沉淀下来,在环境发生变化时仅做必要调整,让具身智能体从“每次重新规划”走向“经验复用执行”——不只是记住过去做过什么,更能将已有经验转化为更高效的行动。
![]()
Leaderboard:展示模型与系统协同后的能力
社区当下对于Agentic Planner存在相同的问题:到底进展到哪一步了?为了回答这个问题,RPent 推出了Leaderboard 板块(https://rpent.readthedocs.io/zh-cn/latest/rst_source/leaderboard.html),采用不同技术路线、不同基座模型的方案在性能和延时的对比一目了然。
![]()
性能Leaderboard:目前展示了LIBERO-Pro、LIBERO、RoboCasa365 Target50 与 RoboTwin
![]()
延时Leaderboard:目前展示了LIBERO-Pro、RoboCasa365 与 RoboTwin
GPT-6 Astra 在 RPent 中展现出突出的长程任务与扰动适应能力。在更强调指令变化、布局变化和长程执行的 LIBERO-Pro 上,RPent / GPT-6 Astra 达到 92.63%,相比图中第二名 RPent / Opus-4.7 的 82.4% 高出 10.23 个百分点;相比 π_RLinf 的 50.0% 高出 42.63 个百分点。此外,开启了Flash Mode的RPent明显降低了延时。
在 RoboCasa365 Target50 的厨房长程任务中,RPent / GPT-6 Astra 达到 59.20%,位列图中第一,和 RPent / GPT-5.5 的 57.1%。这说明更强的基础模型经过 RPent 的工具组织、记忆与执行闭环后,能够有效转化为物理任务能力。
其余榜单也显示了 RPent 对不同模型与执行配置的兼容性:RPent / Opus-4.7 在 LIBERO 达到 96.0%;RPent / GPT-5.5 在 RoboTwin达到62.4%,均处于图中领先位置。结果更值得关注的不是某一个模型单独完成了全部控制,而是通用模型、专家模型、工具和记忆系统可以在同一框架内协同发挥作用。
![]()
为物理世界中持续进化的智能体,构筑开放的基础设施
从 Codex、Claude Code 到 RPent,AI 正在从“在数字世界完成任务”,走向“在物理世界完成任务”。当智能体走向真实世界,变化的不只是模型能力的边界,也包括支撑这种能力运行的基础设施形态。
机器人需要看见环境、理解任务、调用不同能力、完成精细动作,还需要根据真实反馈不断调整策略,并把已经验证过的经验保留下来。
所以,围绕这一完整过程来组织智能体系统的 RPent,并非只是一个开源的“让大模型控制机器人”的框架,而是一套能够连接模型、工具、机器人与环境,并支持智能体在真实世界中持续运行、积累经验和不断递归演进的智能中枢。
从一次任务,到一类任务;从一次执行,到持续进化。
RPent 所代表的,正是大模型真正走进物理世界之后,需要重新构建的下一层基础设施。
开源地址:https://github.com/RLinf/RPent
![]()
前沿动态前沿大会
前沿人物
点「在看」,给前前加鸡腿
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.