网易首页 > 网易号 > 正文 申请入驻

具身智能开始拼高质量数据了!灵初Psi-R2.5用强 Pair Data重做训练链路

0
分享至

编辑|山辉

两年前,一段机器人炒虾的视频在网上爆火。


视频地址:https://mp.weixin.qq.com/s/IqD4HP_vmA7QDb1qJHOz0g


视频中的机械臂一手端锅、一手拿铲,把虾翻炒后倒进碗里,看起来已经很像一个熟练的厨房帮手。

但机器人学会这套动作并不轻松。研究人员需要先亲自操控机器人完成任务,反复采集真机示范,再通过模仿学习让机器人逐渐学会独立执行。对于一个固定任务,大约要采集 50 次这样的示范。

如今,灵初智能在相似的任务中,展示了机器人学习的另一种可能。在这组演示里,人只需要示范一遍,无需重新训练或微调模型,机器人就能把这段操作作为类似 Prompt 的上下文,尝试完成新任务。


视频地址:https://mp.weixin.qq.com/s/IqD4HP_vmA7QDb1qJHOz0g

人类示范「准备配菜 — 青椒下锅 — 龙虾下锅」三步流程后,Psi-R2.5 通过 In-Context Learning 按顺序复现任务,无需重新训练模型。

同样是炒菜,两年前关注的是机器人「会不会」,现在灵初更关注机器人「怎么学」。

对人来说,拿起锅铲,翻动食材,几乎都是下意识完成的。那能不能跳过一遍遍的采集真机数据,直接把人类的操作经验拿来训练机器人?

灵初此前已经在沿着这条路前进。

四月发布的 Psi-R2 和 Psi-W0 将十万小时规模的人类数据用于预训练,并通过 Psi-W0 和强化学习,把人手轨迹进一步优化成机器人能够执行的轨迹。但这意味着,Policy 与 World Model 需要反复 rollout,轨迹还要继续用强化学习微调,整个转换链路依然繁琐。

现在,灵初智能正式发布新一代具身基础模型 Psi-R2.5。

这一次,团队没有继续把重点停留在「十万小时人类数据」上,而是开始处理数据规模起来之后的两个新问题:哪些数据真正有价值,以及怎样让这些人类数据更顺畅地进入机器人的训练过程。

  • 项目演示与完整技术博客: Scaling Pair Data for Embodied Intelligence
  • https://www.psibot.ai/scaling-pair-data-for-embodied-intelligence-zh/

在数据转换方面有一个关键变化,既然从人类数据到机器人数据的转换很麻烦,能不能反过来,先从本来就能执行的真实机器人数据出发?

答案落在了Pair Data上。

Scaling Pair Data:让人类数据真正进入机器人训练

为什么不能直接把人类视频拿来训练机器人?核心还是 Embodiment Gap。

一方面,人手和机械手在视觉上存在差异,相机参数、环境变化等也会带来Visual Embodiment Gap;另一方面,人类 action 与真实机器人数据之间还存在手部姿态估计、关节结构带来的运动学误差,以及摩擦力等物理参数误差,也就是Dynamic Embodiment Gap

前面提到,上一代 Psi-W0 已经能够将人手轨迹优化成可执行的机器人轨迹,但每条数据仍需要经过 World Model rollout 和强化学习微调。

Psi-R2.5 改变了 Pair Data 的构建方式。

灵初把只按照相同任务语义收集的数据称为「弱 Pair Data」;如果图像上除本体外基本一致、时序上逐帧对应,同时 action 可以直接在机器人上 replay,则称为「强 Pair Data」。


视频地址:https://mp.weixin.qq.com/s/IqD4HP_vmA7QDb1qJHOz0g

强 Pair Data


视频地址:https://mp.weixin.qq.com/s/IqD4HP_vmA7QDb1qJHOz0g

弱 Pair Data

团队从真实机器人数据出发,逆向生成对应的人手数据。

这一步很有意思:最终明明是要把人类数据转成机器人数据,为什么先反过来生成一遍人手数据?

关键在于,真实机器人数据本身已经包含可以直接使用的图像和 action。团队从这些机器人数据出发,生成与之一一对应的人手数据,就先得到了一批成对的人类 — 机器人数据。

有了这批强 Pair Data,团队进一步训练了带 action 的端到端人类数据到机器人数据转换模型,让新的人类操作数据可以直接与机器人数据对齐。


视频地址:https://mp.weixin.qq.com/s/IqD4HP_vmA7QDb1qJHOz0g


那要怎么验证转换有没有用?一是可以把转换后的机器人数据直接放到真机上 replay;二是拿这些数据继续训练模型。

最终,人只需要用普通手机或相机拍下一段操作视频,就可以通过这套 pipeline 将其转换成不同机器人的数据。


视频地址:https://mp.weixin.qq.com/s/IqD4HP_vmA7QDb1qJHOz0g


相比上一代,这一次真正缩短了「拿到一段人类数据」和「得到机器人真正能用的数据」之间的距离。

从人类示范到真实任务,只要 1—2 个工作日

但把人类数据转换成机器人能够使用的数据,只解决了「怎么学」的问题。

面对具体场景,机器人还需要处理任务步骤和现场环境等一系列的变化。

因此,Psi-R2.5 在模型结构上也做了调整。

相比上一代 Psi-R2 和 Psi-W0 两个模型分别承担不同功能,R2.5 采用了双层架构:上层负责长程任务拆解,把一段长 instruction 分解成对应的 subtask;下层再结合当前观测,输出机器人具体的操作轨迹。其中,上层模型以 QwenVL3.5-4B 为骨干,下层则使用 Wan2.2-IT2V-5B,两者通过同一批预训练数据进行训练。



不过,基础模型到了真实客户现场,仍然很难做到不经过额外训练,就直接应对所有任务。不同场景里的 SKU、步骤和作业节拍往往高度定制,所以后训练在相当长一段时间内仍然是必要环节。

为此,灵初开发了一套基于灵巧手的 HIL(Human-in-the-Loop)+ RL 后训练框架:只需要少量数据,就可以在基础模型上继续微调;部署过程中出现的失败案例,也会实时回流,用于后续迭代。

来看一个直观例子:手机盒装配。

这是一个步骤很多、同时对精细操作要求很高的任务。如果直接从零开始用模仿学习训练,成功率很低;而在 HIL 和后训练 RL 的基础上,经过几轮迭代后,成功率可以提升到 99%,整个过程只需要 1—2 个工作日。


视频地址:https://mp.weixin.qq.com/s/IqD4HP_vmA7QDb1qJHOz0g


Scaling Pair Data 解决了怎样让人类示范成为机器人真正能用的训练数据,而 HIL 和 RL 则是让模型在进入具体现场之后,能更稳定地完成任务。

对于临时出现的新任务,Psi-R2.5 还探索了另一种更轻量的方式:In-Context Learning。人先示范一遍,再把这段轨迹作为类似 Prompt 的上下文输入,让机器人根据示范完成之前不会的任务。

机器人的 context 和语言模型还有一点不同,它不是单纯的一段文字,而可以是一段人类示教视频。

借助前面的强 Pair Data 转换能力,人类示范可以先被转换成对应的机器人数据,再作为 Prompt 输入模型。ICL 可以让机器人在不更新模型参数的情况下,根据文本提示或物理提示,对新任务进行零样本泛化。


视频地址:https://mp.weixin.qq.com/s/IqD4HP_vmA7QDb1qJHOz0g


从实际使用上看,这两种方式可以对应不同的任务需求:需要长期稳定执行的任务,可以继续通过后训练和现场数据迭代;面对新的任务,则可以通过示范和上下文学习,更轻量地完成适配。

十万小时之后,数据 Scaling 开始比拼「信息量」

假设有 10000 小时数据,覆盖 100 个任务,每个任务重复 100 小时;另一批数据只有 100 小时,同样覆盖 100 个任务,每个任务只有 1 小时。

两者时长相差 100 倍,但真正包含的任务信息量,可能并没有那么大差别。

因此,在人类数据达到十万小时量级之后,Psi-R2.5 开始主动压缩重复数据:减少单个任务的数据量,在相同数据规模下尽可能覆盖更多任务;同时通过 Autolabeling 数据管线,把拆分后的原子任务标得更细,再进行审核。

Scaling 的重点,也开始从单纯增加时长,转向提高同等数据规模里的信息量

这种变化也延伸到了评测。

Psi-R2.5 在训练过程中引入仿真评测,并设置了一个包含 50 个复杂任务的多任务真机评测集。测试时还会持续随机化任务初始状态,用来观察模型在组合泛化上的表现。


视频地址:https://mp.weixin.qq.com/s/IqD4HP_vmA7QDb1qJHOz0g

Psi-R2.5 多任务真机评测,覆盖 50 个复杂任务,并随机化任务初始状态。

那么到底应该怎样判断一段人类数据够不够好?

其实标准很简单,真正高质量的人类数据,应该能够直接训练出完成对应任务的模型。

前面用于验证数据转换效果的两种测试,在这里也成为衡量数据质量的标准:转换后的数据既要能够在机器人上 replay,也要能够真正用于后训练,并让模型泛化到相关任务。

这也解释了为什么 Pair Data 会成为 Psi-R2.5 这一轮数据升级的重要一环。

如果一段人类数据只能在语义层面告诉模型「人在做什么」,它对机器人操作的帮助仍然有限;而当它经过转换后,能够直接 replay、能够拿来训练模型,它才真正提供了机器人最需要的操作信息。

从 Psi-R2 到 Psi-R2.5,从灵初的数据路线可以看到一个明显变化:先把人类数据规模做到十万小时,然后再开始重新计算,这十万小时里到底有多少有价值的信息。

具身智能走向规模化,数据成本始终是一道绕不开的门槛。

机器人每进入一个新场景、学习一个新任务,如果都要重新采集大量真机数据,再完成一轮训练和适配,能力扩张的速度很快就会被数据生产拖住。

人类数据提供了另一种可能。它足够丰富,也更容易持续获得,但规模优势只有真正转化成机器人能够执行、能够训练、能够泛化的操作数据,才有意义。

从 Psi-R2 到 Psi-R2.5,灵初一直在往这个方向推进。强 Pair Data 提高人类数据与机器人数据的对齐质量,HIL+RL 压缩具体任务的适配成本,ICL 则进一步尝试让机器人面对新任务时少一次重新训练。

未来,人类数据还能在多大程度上降低机器人的训练与部署成本,值得期待。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
北京协和医院发布讣告

北京协和医院发布讣告

医学界
2026-09-23 14:26:18
二道贩子倒腾什么最赚钱?网友:看完觉得自己要财富自由了!

二道贩子倒腾什么最赚钱?网友:看完觉得自己要财富自由了!

夜深爱杂谈
2026-09-23 20:00:01
日经225指数涨幅扩大至1.5%

日经225指数涨幅扩大至1.5%

证券时报
2026-09-24 10:17:03
法系"听劝式"反击!标致、雪铁龙三款2027款SUV上市13.97万起

法系"听劝式"反击!标致、雪铁龙三款2027款SUV上市13.97万起

汽车网评
2026-09-24 10:00:15
高市早苗在纽约与特朗普会面,主动赶记者出去:要谈的事太多了,请出去吧;联大演讲企图呼吁删除“敌国条款”

高市早苗在纽约与特朗普会面,主动赶记者出去:要谈的事太多了,请出去吧;联大演讲企图呼吁删除“敌国条款”

极目新闻
2026-09-23 10:17:17
原来她是刘学义妈妈,长相标致气质优雅知性,难怪儿子能如此优秀

原来她是刘学义妈妈,长相标致气质优雅知性,难怪儿子能如此优秀

娱说瑜悦
2026-09-23 23:16:08
亚运会国乒爆大冷!世界冠军轰然倒下,孙颖莎丢局,蒯曼轰11:1

亚运会国乒爆大冷!世界冠军轰然倒下,孙颖莎丢局,蒯曼轰11:1

星Xin辰大海
2026-09-24 07:13:33
时隔60年再入亚运决赛!日乒男团3-0韩国 松岛张本户上都在进步

时隔60年再入亚运决赛!日乒男团3-0韩国 松岛张本户上都在进步

颜小白的篮球梦
2026-09-23 18:09:32
今夜,跳水!三大利空突袭,加息大消息!

今夜,跳水!三大利空突袭,加息大消息!

中国基金报
2026-09-24 01:24:23
国乒男团VS日本争冠!王楚钦PK松岛辉空 林诗栋大战张本智和

国乒男团VS日本争冠!王楚钦PK松岛辉空 林诗栋大战张本智和

念洲
2026-09-24 08:46:11
累趴还是被对手踢趴?国足亚运队赛后合照,胡荷韬趴在地上

累趴还是被对手踢趴?国足亚运队赛后合照,胡荷韬趴在地上

懂球帝
2026-09-23 23:51:07
13比1,马科斯连最后翻盘机会都不留,杜特尔特女儿结局已定?

13比1,马科斯连最后翻盘机会都不留,杜特尔特女儿结局已定?

兰妮搞笑分享
2026-09-24 08:10:25
多亏了这个外国人,留下乾隆的真实相貌,和电视上看到的不一样

多亏了这个外国人,留下乾隆的真实相貌,和电视上看到的不一样

云居历史
2026-09-21 16:31:26
全线翻绿!奉陪到底!A股发生什么了?

全线翻绿!奉陪到底!A股发生什么了?

龙行天下虎
2026-09-24 10:34:19
能开油车还是开油车吧!车管所真心话:油车能不换,真的别换。

能开油车还是开油车吧!车管所真心话:油车能不换,真的别换。

趣味萌宠的日常
2026-09-23 00:39:41
美国:中国要做什么就让他去做吧

美国:中国要做什么就让他去做吧

小马姨
2026-09-20 09:15:43
罗永浩回应17000名员工失业问题:你老板让人看得,辟谣精日言论

罗永浩回应17000名员工失业问题:你老板让人看得,辟谣精日言论

蜜桔娱乐
2026-09-22 21:15:04
天赋碾压奥利塞!皇马锁定拜仁超级天才!绝世妖星坐等加盟

天赋碾压奥利塞!皇马锁定拜仁超级天才!绝世妖星坐等加盟

奶盖熊本熊
2026-09-24 06:49:00
陪睡陪玩只是开胃菜,舔手指塞拳头、集体嫖娼、背后的事藏不住了

陪睡陪玩只是开胃菜,舔手指塞拳头、集体嫖娼、背后的事藏不住了

北海史记
2026-08-12 19:57:54
“神股”跌停,上市仅6日市值跌超50%

“神股”跌停,上市仅6日市值跌超50%

21世纪经济报道
2026-09-24 11:28:23
2026-09-24 12:04:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14061文章数 142738关注度
往期回顾 全部

科技要闻

Claude在DNA里挖出新发现!大佬张锋点赞

头条要闻

多个省政府领导班子调整 四位公安厅长履新副省长

头条要闻

多个省政府领导班子调整 四位公安厅长履新副省长

体育要闻

300万英镑,他们买下了一位队史传奇

娱乐要闻

冯小刚回应《抓特务》亏本

财经要闻

没了1400亿 新希望养猪的坑到底有多深?

汽车要闻

谁不想要更聪明更省劲的越野

态度原创

教育
时尚
艺术
亲子
家居

教育要闻

教育部:每天体育活动2小时+1节体育课+课间15分钟,排进课表

早秋记住一组穿衣公式,叫外套搭配白T恤,清爽高级又耐看

艺术要闻

毛主席送给尼克松总统一幅字,至今无人看懂(附毛主席最全书法合集)

亲子要闻

那么到底是谁错了呢?

家居要闻

2026建博会(广州) 公装联探展交流活动

无障碍浏览 进入关怀版