网易首页 > 网易号 > 正文 申请入驻

看一段视频就能学技能!机器人“一教就会”新时代来了

0
分享至



作者:吕鑫燚

出品:具身研习社


过去两年,具身智能行业最核心的话题,都落在了数据身上。

机器人掌握抓取、整理、叠衣服、使用工具等技能都离不开数据的浇灌,为此,行业投入了大量资源采集操作数据。有人通过遥操和本体设备反复示范,有人在仿真环境中生成任务轨迹,也有团队不断增加场景、物体和动作的覆盖范围。

但机器人真正进入现实环境后,还会遇到另一个难题:面对一个没有学过的新任务,很难用预训练模型直接应用,它往往仍要重新采集数据,再进行微调和验证,才能获得稳定效果。

在工厂等任务较为单一的标准化场景中,这种方式尚能运行。但在家庭、商业服务等开放场景中,任务更零散,环境变化也更大。不同家庭的物品、空间和习惯都不一样。如果机器人每学一个新任务,都要重新采集数据和训练,落地成本将很难下降、落地周期也被拉得无限长。

自变量机器人日前发布并开源的HOST框架,就尝试改变这种学习方式。

HOST全称为Human-to-robot One-Shot Skill AcquisiTion,即“人类到机器人单样本技能获取”。它希望让机器人只看一段数十秒的人类演示视频,就能理解任务并学习新技能。实验中,机器人只观看一段平均29秒的人类视频,复现新技能的成功率达到62%。与Pi-0.5结合微调的方案相比,HOST所需的数据量只有其1/50,学习时间只有其1/500。



但HOST真正重要的地方,不只是更快。

它改变了机器人向人类学习的思路。过去,很多方法试图把人类动作直接翻译成机器人动作。HOST则不要求机器人照着人的身体运动,而是先理解任务完成后的结果,再根据这个结果规划自己的动作。

这一次,机器人不再靠“死记硬背”掌握技能,而是懂得每段动作轨迹对应的结果。知其然,更知其所以然。



很长一段时间内,业内更偏好让机器人通过人类视频学习,人做一遍,机器人看一遍,然后照着做一遍。

这是一个很自然形成的逻辑,但真正执行时,问题很快显现。

人和机器人的身体结构完全不同。人类可以用五根手指拿起杯子,机器人可能只有两指夹爪。人的手腕、手指和肌肉,也无法直接对应机器人的关节和电机。

不同机器人之间的结构也不一样。同一个任务,人形机器人、轮式双臂机器人和单臂机械臂的完成方式可能完全不同。因此,直接模仿动作可能并不是最通用、最简单的办法。

HOST绕开了这一问题。它不先问“人类的手是怎么动的”,而是先判断“这个动作完成后,环境发生了什么变化”。

例如,人类拿起桌上的杯子时,HOST关注的不是手指怎样弯曲,而是杯子从桌面上被拿起。随后,机器人会把这个结果转换为自身视角下的目标画面。最后,它再根据目标画面反推出机械臂和夹爪应该怎样运动。

整个过程可以分成三步:先判断自己执行到了任务的哪个阶段;再理解人类动作产生的结果,并转换为机器人视角下的结果;最后根据目标结果推理动作并执行。

这样一来,视觉结果就成了人类与机器人之间的“中间语言”。

不同的人可以用不同方式拿杯子,不同机器人也可以使用不同夹爪。只要目标都是“把杯子稳定拿起”,机器人就可以根据自己的结构寻找合适动作,而不必逐帧模仿人类。

这更接近人的观察学习方式。人类学习一项新任务时,也不会记住示范者每一个关节的运动。我们通常先理解对方想做什么,再结合自己的身体和工具完成任务。HOST希望让机器人也具备这种能力。

理解结果只是第一步。机器人还要解决更实际的问题:人类和机器人的执行速度通常不同。

比如,一段视频里的人用10秒完成切菜并开始翻炒,但机器人在10秒时可能还没有切完。如果系统只按照时间播放视频,机器人就会提前看到后面的步骤,整个任务很快错位。

因此,HOST不是按时间对齐,而是按任务进度对齐。

它会把人类视频中的每一帧,以及机器人执行中的每一步,都转换到同一个向量空间,再寻找两者在任务进度上的对应关系。

可以把它理解为:机器人不必在执行到第5秒的时候,只参考视频第5秒,而是先判断自己做到了哪一步,再找到视频中最匹配的画面。



根据自变量公布的结果,这种方法让任务进度的时间对齐误差降低了一个数量级。即使某一步变慢,机器人也能按照自己的节奏继续完成任务。



HOST的核心是一个带有视觉预测能力的级联策略模型,采用双专家MoT架构。

通俗来说,它像两个分工不同的大脑。“视频专家”负责看懂画面、判断任务进度,并预测接下来可能出现的结果;“动作专家”负责把预测出的结果转化为机器人动作,并控制执行。

在训练阶段,HOST分为“同体预训练”和“人机视频训练”两个阶段。

第一阶段是同体预训练。机器人先学习机器人自身执行任务的视频和轨迹。它要学会看到当前画面后,预测下一步会出现什么结果,也要学会为了达到这个结果应该怎样行动。第二阶段是人机视频训练。模型再学习人类演示视频,把人类完成任务的过程转换为机器人视角下的目标结果,再根据目标结果生成动作。

需要说明的是,HOST并不是完全不训练。模型在正式使用前,仍然要完成基础预训练。真正变化的是:模型训练完成后,权重会被冻结。机器人学习某个新技能时,不再为这个技能重新微调,而是在推理过程中通过视频获得技能。

在自变量公布的实验中,HOST只看一段平均29秒的人类视频,复现新技能的成功率达到62%。

作为对比,Vid2Robot和AWDA同样从单段视频中学习技能,成功率为19%。Pi-0.5结合微调的方案,需要50个机器人任务示范,并进行约4小时微调,成功率为38%。

按照这一对比,HOST只需要Pi-0.5微调方案1/50的数据样本量和1/500的学习时间,成功率则高出24个百分点。



这组数据背后,反映的是技能开发成本的变化。

微调模式下,增加一个新技能,通常要重新设计流程、采集机器人示范、筛选数据、训练模型,再进行测试和调试。如果效果不好,还要补充数据重新训练。

HOST则尝试把这一过程压缩成一段人类演示视频。一个会做这项任务的人,只要做一遍给机器人看,就可能把技能教给机器人。用户不需要理解模型,也不需要记录关节轨迹。

当然,62%的成功率也说明HOST仍有提升空间。看一次视频就学会技能,并不等于机器人已经能稳定掌握所有复杂任务。

但它证明了一点:机器人学习新技能,不一定只能依赖反复修改模型参数。视觉理解和推理,也可能成为更高效的技能获取方式。

微调还有一个常见问题:学习新技能时,旧技能可能受到影响。

因为微调会直接修改模型参数。新数据不断改变模型内部能力,有时会让模型更擅长新任务,却削弱原有能力。自变量公布的结果显示,Pi-0.5结合微调的方案学习新技能后,过去技能的保留率只有17%。

HOST的技能学习发生在推理阶段,不会因为某个新任务修改模型权重。

在这种模式下,演示视频更像一本可以随时调用的“菜谱”。机器人执行某个技能时,就读取对应视频。更换任务时,则调用另一段视频,不必重新训练模型。

HOST还测试了50个包含不同物体、工具和基础动作的任务,均展现出学习新技能的能力。

当光照、物体、场景和位置发生变化时,HOST的成功率仍保持在50%以上。即使执行过程中物品被移动,机器人也能调整动作继续任务。

这说明它不是单纯背下一套固定轨迹,而是在结合当前状态和目标规划下一步动作。



HOST对家庭机器人的意义尤其明显。

家庭不是标准化生产线。每个家庭的物品、空间和习惯都不同。即使是整理桌面、叠衣服、收纳杯子,也可能有完全不同的要求。这些任务数量多,而且很难提前穷举。



如果机器人每掌握一个新技能、进入一个新场景、甚至碰到一个新物体,都需要重新干预与微调,那么它真正进入家庭干活的日子,将被无限期推迟。

更理想的方式,是机器人拥有通用基础能力,同时能够在使用中继续学习。

用户不需要编程,也不需要遥控机器人做几十次标准示范。只要像教另一个人一样,把任务做一遍给机器人看。

HOST正在尝试把这种交互方式变成可能。

当技能教学从“采集数据并微调模型”变成“展示一遍任务过程”,机器人适应不同家庭和不同用户的成本就有机会下降。用户也不再只是从固定菜单里选择功能,而可以通过自然演示,帮助机器人获得新的工作方式。

目前,自变量已经将HOST的论文和代码开源。

真正有长期价值的机器人,不仅要已经会做很多事,还要能在遇到新任务时,看懂人类的意图,并快速学会新的做法。

HOST距离这一目标仍有继续优化的空间。但它已经展示了一种可能:一段数十秒的人类视频,可以直接成为机器人学习新技能的材料。

当机器人开始通过观察理解任务,而不是只靠一次次微调记住动作,具身智能距离真实生活,也就更近了一步。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
中国英伟达,跌爆了

中国英伟达,跌爆了

包不同
2026-09-07 23:37:07
“捐了好几年钱,一个电话都没给我打过,才停一个月,电话一下子就打过来了” ,当事人回应

“捐了好几年钱,一个电话都没给我打过,才停一个月,电话一下子就打过来了” ,当事人回应

澎湃新闻
2026-09-07 22:05:05
特朗普暗示把新墨西哥州改为“新美国州”,州长讽刺:有美国之前就叫这名,整天浪费时间研究地图

特朗普暗示把新墨西哥州改为“新美国州”,州长讽刺:有美国之前就叫这名,整天浪费时间研究地图

第一财经资讯
2026-09-07 21:04:48
伊朗副总统:当初选择日本车就好了,中国车质量差价格高

伊朗副总统:当初选择日本车就好了,中国车质量差价格高

贱议你读史
2026-09-02 21:21:39
搭第五代THS混动 丰田发布新款皇冠家族官图

搭第五代THS混动 丰田发布新款皇冠家族官图

车质网
2026-09-07 09:35:40
巴拉圭外长提出愿跟中国建交,但有一个前提条件,中方回应太高明

巴拉圭外长提出愿跟中国建交,但有一个前提条件,中方回应太高明

悦心知足
2026-09-06 21:38:51
福州市委常委、秘书长郑彧,拟任新职!副市长陈东,任芜湖市代理市长!

福州市委常委、秘书长郑彧,拟任新职!副市长陈东,任芜湖市代理市长!

林子说事
2026-09-07 10:12:04
4年4次挑衅中国,美网拒握手被骂上热搜,如今又要来深圳参赛

4年4次挑衅中国,美网拒握手被骂上热搜,如今又要来深圳参赛

史之韵
2026-09-07 15:17:35
杨毅开喷:骂宫鲁鸣的纯属饭圈,还幻想李梦打世界杯?

杨毅开喷:骂宫鲁鸣的纯属饭圈,还幻想李梦打世界杯?

林间小温柔
2026-09-07 20:54:42
E-10!官宣加盟开拓者!韩国球星联手杨瀚森

E-10!官宣加盟开拓者!韩国球星联手杨瀚森

篮球实战宝典
2026-09-07 23:08:20
世界杯 韩国女篮不敌匈牙利排名小组第三 朴智贤21分姜怡瑟6投0中

世界杯 韩国女篮不敌匈牙利排名小组第三 朴智贤21分姜怡瑟6投0中

一世菜鸟a
2026-09-07 22:55:48
“温宜公主”纪姿含回应北电落榜:文化课过线但未过校考,已入读中戏国际部

“温宜公主”纪姿含回应北电落榜:文化课过线但未过校考,已入读中戏国际部

手工制作阿歼
2026-09-07 02:05:06
长鑫科技回应“与苹果合作”

长鑫科技回应“与苹果合作”

第一财经资讯
2026-09-07 19:41:12
女人退休1年仍在公司食堂用膳,公司突然遇到难处,女人:我来吧

女人退休1年仍在公司食堂用膳,公司突然遇到难处,女人:我来吧

白云故事
2025-08-11 17:05:05
全世界都被普京骗了?打乌克兰只是幌子,真正目标其实已悄悄布局四年

全世界都被普京骗了?打乌克兰只是幌子,真正目标其实已悄悄布局四年

扶苏聊历史
2026-08-27 16:15:02
持球高后卫,官方:前NBA球员达拉诺-班顿加盟山东高速男篮

持球高后卫,官方:前NBA球员达拉诺-班顿加盟山东高速男篮

懂球帝
2026-09-07 18:09:07
要是没有中国横插一脚,美国人在这个世界的日子,你不知道有多爽

要是没有中国横插一脚,美国人在这个世界的日子,你不知道有多爽

贱议你读史
2026-09-02 21:29:26
戴笠心腹管家晚年揭露:他当年安顿胡蝶时,仅因瞥见一个小细节,就腾空整个小院

戴笠心腹管家晚年揭露:他当年安顿胡蝶时,仅因瞥见一个小细节,就腾空整个小院

饭小妹说历史
2026-09-06 09:20:03
台媒:台湾资深演员庞祥麟辞世,享年80岁

台媒:台湾资深演员庞祥麟辞世,享年80岁

界面新闻
2026-09-07 16:45:26
2-0进美网16强!中国女网37岁王牌闪耀:不老传奇真猛,奖金54万

2-0进美网16强!中国女网37岁王牌闪耀:不老传奇真猛,奖金54万

李喜林篮球绝杀
2026-09-07 10:54:32
2026-09-07 23:52:49
具身研习社
具身研习社
记录具身智能浪潮迭代。
254文章数 1关注度
往期回顾 全部

科技要闻

小米澎程N90 Max定价26.99万元

头条要闻

伊朗试验特殊武器爆炸场面如同地狱 美军舰直接跑了

头条要闻

伊朗试验特殊武器爆炸场面如同地狱 美军舰直接跑了

体育要闻

中超争冠形势:成都蓉城下轮打平夺冠

娱乐要闻

热搜第一,演员李沐宸致歉

财经要闻

证监会原副主席王建军一审被判无期徒刑

汽车要闻

智能可变大空间SUV 小米澎程系列车型上市 20.99万起

态度原创

亲子
教育
健康
游戏
公开课

亲子要闻

低精力的妈妈,务必主动戒掉这个习惯

教育要闻

70%比50%大百分之几

同样是脑梗,为何康复结局大不同?

LPL首支决赛队伍诞生!AL被零封上路窒息下路绝望,Tarzar释怀的笑

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版