网易首页 > 网易号 > 正文 申请入驻

机器人开始学会“三思而后行”?这家公司将世界模型接入灵巧操作,任务成功率提高至75%

0
分享至



机器人家务到底做得怎么样了,距离真正解放我们的双手还有多远?拧灯泡、撕厨房纸、抽出叠放纸杯,对人类轻而易举,但在具身智能领域,如何让机器稳定完成这些看似简单的操作,一直是个难题。

过去几年,机器人基础模型逐渐从针对单项任务训练,转向利用视觉、语言和动作数据学习通用策略。视觉语言动作模型(VLA)可以根据画面和指令输出动作,世界模型则尝试预测动作执行后环境将如何变化。

但如果机器人最终要进入工位、厨房和家庭,它需要追赶的或许不只是人类“完成动作”的能力。人类已经积累了海量与现实世界交互的经验,从怎么看物体、怎样用手,到接触失败后如何调整。如何让模型、训练数据和机器人本体都围绕这些经验共同演进,正在成为具身智能的一条重要路线。

9 月 10 日,生数科技联合创始人、首席执行官(CEO)骆怡航在 2026 外滩大会发布 Motus2。该模型由生数科技研究团队与清华大学共同完成,面向高自由度灵巧操作,已在采用 WUJI Hand 2、Sharpa Wave 等灵巧手的双臂机器人上测试。



Motus2 给出的技术路线,正可从人与模型、数据和硬件关系理解。它用共享模型连接动作生成、后果预测和价值评估,从约 13 万小时人类第一视角视频中提取操作先验,再用机器人轨迹完成本体适配。在执行端,双目视觉、工作记忆和触觉传感分别补充深度、历史与接触信息。

其核心变化,是让机器人在行动前“多想一步”,并把想象结果变成学习信号。前代 Motus 已联合建模视频与动作,Motus2 再加入价值模型,提出动作、预测后果并判断其是否接近目标。反馈既筛选当次动作,也用于更新策略。

给动作后果打分

如果想让机器人自主完成任务,那么首先需要回答一个问题:根据当前观测和任务指令,下一步应该执行什么动作。

工业机器人通常依赖预设轨迹、状态机或人工设计的规划器,在工位、物体位置和流程高度确定时稳定有效。一旦物体形态、摆放方式或任务指令发生变化,规则与轨迹往往需要重新设计。

近年来,模仿学习和视觉语言动作模型从示范数据中学习“观测—动作”映射,提高了任务泛化能力。但这类方法更擅长复现已有行为,通常缺少对动作后果及其任务价值的显式判断。

世界模型由此提供另一种思路。它不急于把动作送给真实机器人,而是根据当前观测和候选动作,先预测未来几帧环境可能发生什么变化。近年来,DreamDojo、Ctrl-World 等研究都在探索动作条件世界模型,机器人因此获得一个近似的内部模拟器。

此前,生数科技发布的 Motus 已在统一潜在动作世界模型中连接视频预测和动作生成。它既可作为世界动作模型(WAM),根据语言指令、当前观测和视觉历史生成动作,也可作为动作条件世界模型(AC-WM),在给定动作后预测未来视觉状态,分别回答“下一步做什么”和“执行后会发生什么”。

不过,“能想象未来”仍不等于“知道哪个未来更好”。机器人还需要依据人类设定的任务目标,在多个可能结果中判断哪一种更值得执行。

为此,Motus2 在这套结构中增加了价值模型(VM):类似人类在行动前权衡不同选择及其后果的思维,机器人需要根据动作及其结果评估任务进展,通过价值模型判断“这个结果是否更接近目标”。


图|Motus2 整体架构

但要让同一个模型兼顾动作、预测和评价,还必须确保三类信息按照真实行动顺序流动,不能让机器人在训练时“偷看答案”。

假如模型在生成动作时读取到了执行这个动作以后才出现的画面,相当于利用了现实部署时不存在的未来信息,训练结果则难以在实际部署中复现。

因此 Motus2 采用动作优先(Action-first)的信息流,让动作只读取此前信息,未来视频读取动作,价值评估再读取动作和预测结果,以保证动作生成过程符合真实部署时的因果顺序。

在此基础上,预测和评价结果进入两条路径。一条用于推理阶段的当次动作选择,另一条用于训练阶段的长期策略更新。

具体而言,在推理阶段,模型通过 Best-of-N 规划生成多个候选动作,分别预测其后果并评分,再选择较优方案执行。完成一个动作片段后,机器人重新获取真实环境中的观测,随后开始下一轮规划。这种方式仅改变本次动作选择,但不会更新参数。

第二种发生在训练阶段。Motus2 通过引入基于模型的强化学习(MBRL),可以将模拟器预测的未来和评估器给出的价值转化为策略更新信号:高价值方案得到更强引导,低价值动作逐渐减少。这意味着,世界模型预测出的未来不再只用于展示,也能反过来影响动作策略,使模型以后更容易生成有利于完成任务的方案。

另外,区别于主要依赖高质量成功示范进行行为克隆的训练方式,失败数据在此体系中也获得了新的用途。例如,经过筛选的成功示范可以直接监督动作学习;失败和次优轨迹虽然不适合作为模仿目标,却可以用于学习动作导致的环境变化,并为价值模型提供“哪些结果偏离任务目标”的判断依据,间接参与策略优化。

研究团队在放置手机和多指操作两项真机任务中,分别进行了每项 20 次闭环测试。基础策略的平均成功率为 65%,单独加入规划后达到 67.5%,单独加入 MBRL 后达到 72.5%,同时使用两种机制后达到 75%。

从对照结果看,推理时规划使成功率提高了 2.5 个百分点,MBRL 带来的提升为 7.5 个百分点。二者结合后较基础策略共提高 10 个百分点,说明在这两项任务中,更新策略产生的作用更明显,而规划可以在此基础上进一步改善当次动作选择。

如何学习 13 万小时的数据

在搭好了行动、预测和评价框架后,下一道门槛是数据。

灵巧手单手可有 20 个以上自由度,遥操作采集既需要设备、操作者和标定,也要承担磨损与安全成本。因此,如何获得足够丰富的操作数据,并将其扩展至不同任务和机器人本体,成为训练灵巧操作模型的一大难题。

目前,业内常见的数据扩展路径包括大规模机器人遥操作、仿真生成与从人类视频中提取先验。其中,机器人数据最接近部署本体,却昂贵且覆盖有限;仿真便于批量试错,但接触、材质和传感噪声与现实仍有差距。互联网或第一视角视频规模更大,却通常缺少可直接执行的机器人动作标签。

为缓解高质量机器人数据稀缺、不同数据源又难以直接对齐的问题,Motus2 采用了分层的数据扩展路径,先从人类第一视角视频中学习操作经验,再逐步迁移到机器人。

其数据体系包含约 13 万小时原始录像,训练依次使用单目视频、同步双目视频与人类动作,最后加入机器人轨迹和人机对应数据。


图|人类数据金字塔

论文披露的第一视角语料约 13 万小时,其中超过 11 万小时为单目数据,覆盖多种物体、场景和人类操作行为,帮助模型学习较广泛的视觉知识及状态变化。

第二阶段引入约 1.74 万小时同步双目素材。左右视角不仅增加画面数量,更提供视差形成的隐式深度线索,并支持更准确的三维手部姿态估计,使模型进一步学习手与物体之间较细粒度的空间关系。

不过,由于人手与灵巧手在关节数量、尺寸、活动范围和控制接口上并不一致,,若把人类姿态生硬映射到机器人关节,轻则动作变形,重则产生自碰撞或无法形成有效抓握。

为跨越这道“本体鸿沟”,Motus2 使用数十小时人机对齐数据,以及包含机器人轨迹在内、总计超过 100 小时的中间训练数据。此后,模型还要通过目标任务数据完成后训练,才能把人类操作经验转化为特定机器人可以执行的动作。

五项真机任务中,仅经人类数据预训练的模型平均成功率为 51%,加入机器人域中间训练后升至 84%。放置小球和贴合橡皮为 100%,拧灯泡 90%,多指操作 70%,放置手机 60%。人类视频提供操作先验,机器人数据仍负责动作落地。



此外,团队还用 2,000 至 20,000 小时双目数据比较人类动作预测误差。数据增加时,最优误差持续下降,并在测量范围内与数据时长的对数近似线性。但该指标是留出集上的人类动作预测,并非真机成功率,也不能推出扩张会无限保持同样收益。

因此,“以人为牵引”并不等于让机器人照搬人。更准确的说法是,先用人的视角和动作扩大模型对物理交互的认识,再用少量但更昂贵的对齐数据、机器人轨迹和目标任务数据逐级校正。数据路径要与模型接口匹配,而能否迁移又受到硬件形态约束,模型、数据与硬件在这里形成了相互制约的三角。

补全记忆与触觉

完成本体适配后,机器人仍不等于拥有人的操作能力。有些任务依赖已经发生的历史信息,另一些则取决于手指与物体间的实时接触,仅凭当前画面难以准确判断。

一般而言,业内会选择以扩大视觉上下文、压缩历史为记忆标记,或引入力觉和触觉传感来补足信息。但前者将面临历史完整度与计算量的取舍,后者则要处理采样频率、噪声、传感器形态和模型融合成本。

为此,Motus2 分别引入工作记忆与触觉专家,使机器人能够调用此前观测,并根据最新触觉反馈调整动作。

寻找隐藏方块时,机器人先要记住方块进入哪只杯子,再经历杯子移动和遮挡。固定滑动窗口开销不随任务时长增长,但早期线索会被逐出上下文。Motus2 比较了保留完整历史的全局自回归,以及把中间历史压缩成标记的混合记忆。

测试结果显示,在寻找隐藏方块和依据历史提示按键两项测试中,全局自回归在仿真环境中的平均成功率为 78%,混合记忆为 52%。转移到真机后,两者分别为 57.5% 和 25%。这意味着,在两项测试中,直接读取完整历史比压缩历史信息更有利于完成任务。

这些结果也反映出记忆方式需要在信息完整度与运行成本之间取舍。完整历史能够保留更多线索,也会增加上下文长度和计算开销。同时,真机成功率低于仿真结果,表明真实环境中的视觉变化、遮挡和执行误差仍会影响历史信息的调用。


图|Motus2 九项真机演示

触觉处理的是另一种不可见信息。抽取叠放纸杯时,夹得太松会滑落,太紧则可能带出下层纸杯。撕纸时,双手的受力位置和方向持续变化。摄像头通常要等物体发生明显位移后才能确认失误,指尖传感器却能更早捕捉接触力和形变。

若让完整策略模型随每次触觉更新重新推理,高频传感会带来延迟。因此,Motus2 沿用 T-Rex 的触觉响应思路,设置轻量触觉专家,主模型生成动作片段并缓存特征,每个短片段执行前,专家读取最新触觉,对尚未执行的动作作最后修正。

这一分工体现了模型与硬件的协同。主干负责较低频的全局语义和动作规划,触觉专家处理高频、局部的接触变化。训练时还预测动作后的真实力信号,帮助模型学习接触如何演化,部署时则只输出修正后的动作,避免每一步都重新运行大模型。

在抽取纸杯和撕纸两项任务中,加入触觉后平均成功率从 60% 升至 72.5%。其中抽取纸杯由 65% 升至 75%,撕纸由 55% 升至 70%。这组消融实验支持了触觉对精细接触操作的作用,但范围仍限于两项任务与特定平台,不能视作对所有材料和操作的普遍结论。

上述测试使用了单手 20 自由度的 WUJI Hand 2 和单手 22 自由度的 Sharpa Wave 等平台。


图|生数科技提出的通用世界模型五级演进路线

此外,生数科技还提出了通用世界模型(GWM)五级路线,以描述通用世界模型从生成环境走向自主行动的能力演进。五级路线依次为 L1“生成世界”、L2“与世界交互”、L3“在世界中行动”、L4“自主世界智能体”和 L5“世界组织者”。

按此框架,Motus2 已掌握 L3“在世界中行动”的关键能力:既能理解当前状态,也能预判行动后的未来,还能生成可执行的真实机器人动作。更进一步,它把 Evaluation 与 Feedback 明确接入闭环,形成“行动 → 预测 → 评估 → 反馈 → 再学习”的循环。

由此,这一机制初步展现出类似 RSI(Recursive Self-Improvement,递归自我改进)的特征:模型会借助自身对世界的预测和评估结果,反向优化行动策略。

世界模型开始拥有一定的自我演进能力,也是生数为从 L3 迈向 L4“自主世界智能体”的一次重要探索。

值得注意的是,Motus2 始终“以人为牵引”进行技术迭代,进一步印证了人类经验在机器人能力演进中的重要性。未来,若要继续迈向长期自主决策,仍需更可靠的预测、跨本体评测和规模化触觉采集,也取决于模型、数据与硬件能否协同演进。

运营/排版:何晨龙

注:封面/首图由 AI 辅助生成

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
“野人先生 冷处理”热搜第一,野人先生冰淇淋被罗永浩吐槽难吃后涨粉数万,至今品牌方仍未回应

“野人先生 冷处理”热搜第一,野人先生冰淇淋被罗永浩吐槽难吃后涨粉数万,至今品牌方仍未回应

洪观新闻
2026-09-14 15:18:09
8强全敲定!中国男篮1-4决赛对手出炉:幸运出线,中国台北难度大

8强全敲定!中国男篮1-4决赛对手出炉:幸运出线,中国台北难度大

墨史轩
2026-09-14 14:08:42
左手推理成本暴降96%,右手性能反超大模型!当小模型学会了何时求助

左手推理成本暴降96%,右手性能反超大模型!当小模型学会了何时求助

机器之心Pro
2026-09-13 12:00:09
17人涉嫌制售伪劣电动自行车电池!被广州警方执行逮捕

17人涉嫌制售伪劣电动自行车电池!被广州警方执行逮捕

南方都市报
2026-09-14 16:25:09
于东来突然宣布:胖东来今后员工仅施行四年合同制、不续签,为社会培养更多人才

于东来突然宣布:胖东来今后员工仅施行四年合同制、不续签,为社会培养更多人才

台州交通广播
2026-09-13 17:48:01
几乎全军覆没?马斯克宣布突破,外媒:6G弯道超车没戏了

几乎全军覆没?马斯克宣布突破,外媒:6G弯道超车没戏了

江启
2026-09-14 06:10:25
被终身禁足!前国脚申思+祁宏将俱乐部股份转给父亲 网友提出质疑

被终身禁足!前国脚申思+祁宏将俱乐部股份转给父亲 网友提出质疑

念洲
2026-09-14 16:40:45
"我们是华人, 不是中国人!" 女子一句话引爆全网

"我们是华人, 不是中国人!" 女子一句话引爆全网

澳微Daily
2026-09-13 15:59:00
事发监控视频曝光:山西一公职人员醉驾超速致夫妻身亡,刹车灯曾亮起但车未停下;岗位公示牌显示其系主任科员,死者家属称对方至今未道歉

事发监控视频曝光:山西一公职人员醉驾超速致夫妻身亡,刹车灯曾亮起但车未停下;岗位公示牌显示其系主任科员,死者家属称对方至今未道歉

台州交通广播
2026-09-14 01:43:04
当AI开始替人办事,中国经济的“系统升级”时刻来了

当AI开始替人办事,中国经济的“系统升级”时刻来了

智谷趋势
2026-09-14 10:41:21
广西“谢美梦”啤酒被指为方言脏话,曾解释意为“梦的开始”,律师:违背公序良俗

广西“谢美梦”啤酒被指为方言脏话,曾解释意为“梦的开始”,律师:违背公序良俗

潇湘晨报
2026-09-14 17:41:16
无敌是多么寂寞!连胜36场!他们20年没输过了!

无敌是多么寂寞!连胜36场!他们20年没输过了!

柚子说球
2026-09-14 09:01:13
最新爆料:伊朗总统曾大声质问革命卫队总司令为何向商船开火,但总司令也毫不知情,最终发现一个边缘派系自行采取行动、破坏一切

最新爆料:伊朗总统曾大声质问革命卫队总司令为何向商船开火,但总司令也毫不知情,最终发现一个边缘派系自行采取行动、破坏一切

鲁中晨报
2026-09-14 11:35:03
特朗普称泽连斯基“必须停止”攻击俄罗斯炼油厂

特朗普称泽连斯基“必须停止”攻击俄罗斯炼油厂

新华社
2026-09-13 23:03:06
身家2000亿美元也要套现?甲骨文82岁创始人拟卖75亿美元股票,一天后突然反悔

身家2000亿美元也要套现?甲骨文82岁创始人拟卖75亿美元股票,一天后突然反悔

红星新闻
2026-09-14 13:32:38
1.5亿人用AI管健康,蚂蚁阿福做对了什么?

1.5亿人用AI管健康,蚂蚁阿福做对了什么?

智谷趋势
2026-09-11 18:23:59
香港女星麦家琪在广东小县城租房,两层楼月租才1000块

香港女星麦家琪在广东小县城租房,两层楼月租才1000块

不太爱笑的小羊
2026-09-14 15:34:42
700万粉丝博主突发讣告,带给大家无数欢乐的83岁姥姥,在睡梦中安详离世……网红田姥姥现身评论区留言:老姐姐一路走好

700万粉丝博主突发讣告,带给大家无数欢乐的83岁姥姥,在睡梦中安详离世……网红田姥姥现身评论区留言:老姐姐一路走好

大风新闻
2026-09-14 16:25:14
高兴太早,中国男篮狂胜菲律宾却收坏消息,裁判无耻,多人受伤

高兴太早,中国男篮狂胜菲律宾却收坏消息,裁判无耻,多人受伤

宗介说体育
2026-09-14 14:44:06
全球最亲子的邮轮,沦为色情窝点?

全球最亲子的邮轮,沦为色情窝点?

旅界Pro
2026-09-14 07:37:19
2026-09-14 18:07:00
DeepTech深科技 incentive-icons
DeepTech深科技
麻省理工科技评论独家合作
17241文章数 515213关注度
往期回顾 全部

科技要闻

时隔近9年,特斯拉新款Roadster拟十一发布

头条要闻

特朗普表态后 苏格兰、威尔士、北爱尔兰首席大臣会晤

头条要闻

特朗普表态后 苏格兰、威尔士、北爱尔兰首席大臣会晤

体育要闻

兹维列夫,从三十年0冠到一百天2冠

娱乐要闻

敬一丹采访视频曝光,原来早有预兆

财经要闻

蔡昉:农民工落户可释放万亿消费潜力

汽车要闻

限50台/售54.99万起 别克世纪CENTURY黑金限量版上市

态度原创

艺术
游戏
旅游
手机
公开课

艺术要闻

中国西大门!伊宁机场迁建项目新进展,效果图曝光

《时之笛RE》烫箔封面对比!独特纹理 收藏党要抓紧

旅游要闻

济南大明湖:一半湖光,一半泉城

手机要闻

iOS27正式版前瞻!三大实用改动,闹钟可调休,果粉:苹果听劝了

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版