网易首页 > 网易号 > 正文 申请入驻

具身智能开始拼高质量数据了!灵初Psi-R2.5用强 Pair Data重做训练链路

0
分享至

编辑|山辉

两年前,一段机器人炒虾的视频在网上爆火。


视频地址:https://mp.weixin.qq.com/s/IqD4HP_vmA7QDb1qJHOz0g


视频中的机械臂一手端锅、一手拿铲,把虾翻炒后倒进碗里,看起来已经很像一个熟练的厨房帮手。

但机器人学会这套动作并不轻松。研究人员需要先亲自操控机器人完成任务,反复采集真机示范,再通过模仿学习让机器人逐渐学会独立执行。对于一个固定任务,大约要采集 50 次这样的示范。

如今,灵初智能在相似的任务中,展示了机器人学习的另一种可能。在这组演示里,人只需要示范一遍,无需重新训练或微调模型,机器人就能把这段操作作为类似 Prompt 的上下文,尝试完成新任务。


视频地址:https://mp.weixin.qq.com/s/IqD4HP_vmA7QDb1qJHOz0g

人类示范「准备配菜 — 青椒下锅 — 龙虾下锅」三步流程后,Psi-R2.5 通过 In-Context Learning 按顺序复现任务,无需重新训练模型。

同样是炒菜,两年前关注的是机器人「会不会」,现在灵初更关注机器人「怎么学」。

对人来说,拿起锅铲,翻动食材,几乎都是下意识完成的。那能不能跳过一遍遍的采集真机数据,直接把人类的操作经验拿来训练机器人?

灵初此前已经在沿着这条路前进。

四月发布的 Psi-R2 和 Psi-W0 将十万小时规模的人类数据用于预训练,并通过 Psi-W0 和强化学习,把人手轨迹进一步优化成机器人能够执行的轨迹。但这意味着,Policy 与 World Model 需要反复 rollout,轨迹还要继续用强化学习微调,整个转换链路依然繁琐。

现在,灵初智能正式发布新一代具身基础模型 Psi-R2.5。

这一次,团队没有继续把重点停留在「十万小时人类数据」上,而是开始处理数据规模起来之后的两个新问题:哪些数据真正有价值,以及怎样让这些人类数据更顺畅地进入机器人的训练过程。

  • 项目演示与完整技术博客: Scaling Pair Data for Embodied Intelligence
  • https://www.psibot.ai/scaling-pair-data-for-embodied-intelligence-zh/

在数据转换方面有一个关键变化,既然从人类数据到机器人数据的转换很麻烦,能不能反过来,先从本来就能执行的真实机器人数据出发?

答案落在了Pair Data上。

Scaling Pair Data:让人类数据真正进入机器人训练

为什么不能直接把人类视频拿来训练机器人?核心还是 Embodiment Gap。

一方面,人手和机械手在视觉上存在差异,相机参数、环境变化等也会带来Visual Embodiment Gap;另一方面,人类 action 与真实机器人数据之间还存在手部姿态估计、关节结构带来的运动学误差,以及摩擦力等物理参数误差,也就是Dynamic Embodiment Gap

前面提到,上一代 Psi-W0 已经能够将人手轨迹优化成可执行的机器人轨迹,但每条数据仍需要经过 World Model rollout 和强化学习微调。

Psi-R2.5 改变了 Pair Data 的构建方式。

灵初把只按照相同任务语义收集的数据称为「弱 Pair Data」;如果图像上除本体外基本一致、时序上逐帧对应,同时 action 可以直接在机器人上 replay,则称为「强 Pair Data」。


视频地址:https://mp.weixin.qq.com/s/IqD4HP_vmA7QDb1qJHOz0g

强 Pair Data


视频地址:https://mp.weixin.qq.com/s/IqD4HP_vmA7QDb1qJHOz0g

弱 Pair Data

团队从真实机器人数据出发,逆向生成对应的人手数据。

这一步很有意思:最终明明是要把人类数据转成机器人数据,为什么先反过来生成一遍人手数据?

关键在于,真实机器人数据本身已经包含可以直接使用的图像和 action。团队从这些机器人数据出发,生成与之一一对应的人手数据,就先得到了一批成对的人类 — 机器人数据。

有了这批强 Pair Data,团队进一步训练了带 action 的端到端人类数据到机器人数据转换模型,让新的人类操作数据可以直接与机器人数据对齐。


视频地址:https://mp.weixin.qq.com/s/IqD4HP_vmA7QDb1qJHOz0g


那要怎么验证转换有没有用?一是可以把转换后的机器人数据直接放到真机上 replay;二是拿这些数据继续训练模型。

最终,人只需要用普通手机或相机拍下一段操作视频,就可以通过这套 pipeline 将其转换成不同机器人的数据。


视频地址:https://mp.weixin.qq.com/s/IqD4HP_vmA7QDb1qJHOz0g


相比上一代,这一次真正缩短了「拿到一段人类数据」和「得到机器人真正能用的数据」之间的距离。

从人类示范到真实任务,只要 1—2 个工作日

但把人类数据转换成机器人能够使用的数据,只解决了「怎么学」的问题。

面对具体场景,机器人还需要处理任务步骤和现场环境等一系列的变化。

因此,Psi-R2.5 在模型结构上也做了调整。

相比上一代 Psi-R2 和 Psi-W0 两个模型分别承担不同功能,R2.5 采用了双层架构:上层负责长程任务拆解,把一段长 instruction 分解成对应的 subtask;下层再结合当前观测,输出机器人具体的操作轨迹。其中,上层模型以 QwenVL3.5-4B 为骨干,下层则使用 Wan2.2-IT2V-5B,两者通过同一批预训练数据进行训练。



不过,基础模型到了真实客户现场,仍然很难做到不经过额外训练,就直接应对所有任务。不同场景里的 SKU、步骤和作业节拍往往高度定制,所以后训练在相当长一段时间内仍然是必要环节。

为此,灵初开发了一套基于灵巧手的 HIL(Human-in-the-Loop)+ RL 后训练框架:只需要少量数据,就可以在基础模型上继续微调;部署过程中出现的失败案例,也会实时回流,用于后续迭代。

来看一个直观例子:手机盒装配。

这是一个步骤很多、同时对精细操作要求很高的任务。如果直接从零开始用模仿学习训练,成功率很低;而在 HIL 和后训练 RL 的基础上,经过几轮迭代后,成功率可以提升到 99%,整个过程只需要 1—2 个工作日。


视频地址:https://mp.weixin.qq.com/s/IqD4HP_vmA7QDb1qJHOz0g


Scaling Pair Data 解决了怎样让人类示范成为机器人真正能用的训练数据,而 HIL 和 RL 则是让模型在进入具体现场之后,能更稳定地完成任务。

对于临时出现的新任务,Psi-R2.5 还探索了另一种更轻量的方式:In-Context Learning。人先示范一遍,再把这段轨迹作为类似 Prompt 的上下文输入,让机器人根据示范完成之前不会的任务。

机器人的 context 和语言模型还有一点不同,它不是单纯的一段文字,而可以是一段人类示教视频。

借助前面的强 Pair Data 转换能力,人类示范可以先被转换成对应的机器人数据,再作为 Prompt 输入模型。ICL 可以让机器人在不更新模型参数的情况下,根据文本提示或物理提示,对新任务进行零样本泛化。


视频地址:https://mp.weixin.qq.com/s/IqD4HP_vmA7QDb1qJHOz0g


从实际使用上看,这两种方式可以对应不同的任务需求:需要长期稳定执行的任务,可以继续通过后训练和现场数据迭代;面对新的任务,则可以通过示范和上下文学习,更轻量地完成适配。

十万小时之后,数据 Scaling 开始比拼「信息量」

假设有 10000 小时数据,覆盖 100 个任务,每个任务重复 100 小时;另一批数据只有 100 小时,同样覆盖 100 个任务,每个任务只有 1 小时。

两者时长相差 100 倍,但真正包含的任务信息量,可能并没有那么大差别。

因此,在人类数据达到十万小时量级之后,Psi-R2.5 开始主动压缩重复数据:减少单个任务的数据量,在相同数据规模下尽可能覆盖更多任务;同时通过 Autolabeling 数据管线,把拆分后的原子任务标得更细,再进行审核。

Scaling 的重点,也开始从单纯增加时长,转向提高同等数据规模里的信息量

这种变化也延伸到了评测。

Psi-R2.5 在训练过程中引入仿真评测,并设置了一个包含 50 个复杂任务的多任务真机评测集。测试时还会持续随机化任务初始状态,用来观察模型在组合泛化上的表现。


视频地址:https://mp.weixin.qq.com/s/IqD4HP_vmA7QDb1qJHOz0g

Psi-R2.5 多任务真机评测,覆盖 50 个复杂任务,并随机化任务初始状态。

那么到底应该怎样判断一段人类数据够不够好?

其实标准很简单,真正高质量的人类数据,应该能够直接训练出完成对应任务的模型。

前面用于验证数据转换效果的两种测试,在这里也成为衡量数据质量的标准:转换后的数据既要能够在机器人上 replay,也要能够真正用于后训练,并让模型泛化到相关任务。

这也解释了为什么 Pair Data 会成为 Psi-R2.5 这一轮数据升级的重要一环。

如果一段人类数据只能在语义层面告诉模型「人在做什么」,它对机器人操作的帮助仍然有限;而当它经过转换后,能够直接 replay、能够拿来训练模型,它才真正提供了机器人最需要的操作信息。

从 Psi-R2 到 Psi-R2.5,从灵初的数据路线可以看到一个明显变化:先把人类数据规模做到十万小时,然后再开始重新计算,这十万小时里到底有多少有价值的信息。

具身智能走向规模化,数据成本始终是一道绕不开的门槛。

机器人每进入一个新场景、学习一个新任务,如果都要重新采集大量真机数据,再完成一轮训练和适配,能力扩张的速度很快就会被数据生产拖住。

人类数据提供了另一种可能。它足够丰富,也更容易持续获得,但规模优势只有真正转化成机器人能够执行、能够训练、能够泛化的操作数据,才有意义。

从 Psi-R2 到 Psi-R2.5,灵初一直在往这个方向推进。强 Pair Data 提高人类数据与机器人数据的对齐质量,HIL+RL 压缩具体任务的适配成本,ICL 则进一步尝试让机器人面对新任务时少一次重新训练。

未来,人类数据还能在多大程度上降低机器人的训练与部署成本,值得期待。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
全红婵不对劲。不是她以后不比赛了,而是她今年19岁了,居然开始了自己的精致路线。

全红婵不对劲。不是她以后不比赛了,而是她今年19岁了,居然开始了自己的精致路线。

小琦聊生活
2026-09-23 11:36:31
亚运会三连冠!中国女排3-0横扫日本队,夺队史亚运会第10冠

亚运会三连冠!中国女排3-0横扫日本队,夺队史亚运会第10冠

全景体育V
2026-09-22 19:55:58
志愿者受不了了!日本媒体痛批名古屋亚组委:回避准备不足人为失误 凸显无能

志愿者受不了了!日本媒体痛批名古屋亚组委:回避准备不足人为失误 凸显无能

狍子歪解体坛
2026-09-23 12:11:48
太讽刺了!自己支持率跌到32%,却平均每天点名拜登3次,特朗普的"甩锅账本"被扒光

太讽刺了!自己支持率跌到32%,却平均每天点名拜登3次,特朗普的"甩锅账本"被扒光

可达鸭面面观
2026-09-22 20:05:12
笑喷!女排夺冠,一人领奖激动到穿反裤子,球迷:肯定兴奋过头了

笑喷!女排夺冠,一人领奖激动到穿反裤子,球迷:肯定兴奋过头了

南海浪花
2026-09-23 07:49:47
王皓真生气了!质问林诗栋:在场上什么感觉啊?正手反手都不会接

王皓真生气了!质问林诗栋:在场上什么感觉啊?正手反手都不会接

风过乡
2026-09-23 06:28:00
中南大学一餐20元,新生心疼哭!打电话跟家长诉苦,说食堂饭菜太贵,引发热议

中南大学一餐20元,新生心疼哭!打电话跟家长诉苦,说食堂饭菜太贵,引发热议

火山詩话
2026-09-23 08:06:06
罗永浩发长文正式回应理记:如果微博不处理就连微博一起告到法院

罗永浩发长文正式回应理记:如果微博不处理就连微博一起告到法院

柴狗夫斯基
2026-09-22 16:18:04
金建宇突然离世,年仅28岁

金建宇突然离世,年仅28岁

第一财经资讯
2026-09-23 10:20:07
北约秘书长吕特抛出惊人预判,他警示外界,一旦中国采取行动收复台湾,俄罗斯有可能随之在欧洲发起行动,北约要提前做好....

北约秘书长吕特抛出惊人预判,他警示外界,一旦中国采取行动收复台湾,俄罗斯有可能随之在欧洲发起行动,北约要提前做好....

回京历史梦
2026-09-23 09:20:36
初中生早餐“碳水开会”?难怪上课打瞌睡!真正的营养早餐长这样

初中生早餐“碳水开会”?难怪上课打瞌睡!真正的营养早餐长这样

医药养生保健报社
2026-09-22 20:57:42
台湾网红“馆长”在直播中表示,未来将不再组织赴大陆的活动,因为来一次亏一次,高昂的成本实在烧不起

台湾网红“馆长”在直播中表示,未来将不再组织赴大陆的活动,因为来一次亏一次,高昂的成本实在烧不起

人生录
2026-09-21 16:43:29
震惊!网传9月30号楼市大政策,首套新房利率有望降到2.05%左右,网友:我们缺的不是利息

震惊!网传9月30号楼市大政策,首套新房利率有望降到2.05%左右,网友:我们缺的不是利息

火山詩话
2026-09-23 07:18:57
董明珠获“全球可持续制冷领导者” 为全球气候治理提供中国方案

董明珠获“全球可持续制冷领导者” 为全球气候治理提供中国方案

凤凰WEEKLY
2026-09-17 16:31:53
0-3!输球不可怕,可怕的是日女排主帅赛后这番话,彻底被打服!

0-3!输球不可怕,可怕的是日女排主帅赛后这番话,彻底被打服!

田先生篮球
2026-09-22 21:29:02
德媒:中国特供奥迪电动车那么好,为什么我们买不到

德媒:中国特供奥迪电动车那么好,为什么我们买不到

中国青年报
2026-09-22 15:48:20
特朗普遭美议员警告,绝不能在涉台问题上让步

特朗普遭美议员警告,绝不能在涉台问题上让步

共工之锚
2026-09-23 00:21:11
雷军回应“打新宇树挣了100多亿”

雷军回应“打新宇树挣了100多亿”

澎湃新闻
2026-09-22 19:07:44
六神花露水焕新包装被指用印钞专用纸 律师:未使用人民币图样不违规

六神花露水焕新包装被指用印钞专用纸 律师:未使用人民币图样不违规

快科技
2026-09-23 08:52:02
女子晒出与释永信合照:带十几个姐妹花一万进少林寺求财,最后真有人发了

女子晒出与释永信合照:带十几个姐妹花一万进少林寺求财,最后真有人发了

砼话里都是骗人的
2026-09-23 08:42:17
2026-09-23 13:28:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14055文章数 142737关注度
往期回顾 全部

科技要闻

2026网易未来大会上午场:科技如何破界

头条要闻

两幼童被蜇死全身几百处伤口 养蜂人"不认错、不道歉"

头条要闻

两幼童被蜇死全身几百处伤口 养蜂人"不认错、不道歉"

体育要闻

300万英镑,他们买下了一位队史传奇

娱乐要闻

梅启明被彻底除名遗产清零

财经要闻

全市场都在卷自营

汽车要闻

5.1米的启境GX7,底盘凭什么又稳又舒服?

态度原创

数码
亲子
游戏
本地
公开课

数码要闻

华为四款新品今日集中开售 三折叠套装卖到29999元

亲子要闻

ICU工作15年,见过太多年轻患者的悲剧,这些孩子的共同点就是生活习惯不健康

《巫师3 重制版》NS2预载开启!占用42.3GB

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版