![]()
作者|周松
原创首发|蓝字计划
不少家长平时教小朋友写作业,半个小时就能把自己气崩溃。
可真要让他们教一台机器人叠衣服、倒水,才知道什么叫真正的地狱模式。
教机器人学一个新动作,就像教小朋友写字。不仅要反复示范几十次,还需要工程师在旁边采集数据、调整模型。甚至是“左耳进右耳出”,同一个字,换支笔就不会写了。
不过,最近自变量机器人发布的HOST机器人学习框架,试图把过去的几十次示范,压缩成一段视频。
![]()
图源:自变量HOST官网
用他们的话来说,机器人现在也开始“看一遍就会”了。
人类只需要留下一个示范视频,机器人看完以后,就能自己尝试完成同一项任务。整个技能获取过程平均只需要29秒,也不用重新调整模型参数。
在50项新任务中,HOST的平均成功率为62%;而π₀.₅在接受50条机器人示范并完成微调后,平均成功率为38%。
也就是说,过去反复示范50次都不一定教会的动作,现在机器人看一遍就敢自己上手。
只不过,人有五根手指,机器人可能只有一只夹爪;人类三秒做完的动作,机器人可能需要五秒。
它究竟怎么只靠一段视频,学会人类的动作?
对着视频学,学习速度提升500倍
过去教机器人做家务,主流方法包括示教复现、模仿学习和强化学习等。
名字虽然不同,麻烦却差不多:人类需要反复示范,机器人需要大量练习,工程师还得不断调整模型参数。
![]()
图源:自变量HOST论文截图
一个简单动作,可能需要采集几十次甚至更多数据;换一个角度、场景或者物体,又可能要重新训练。
而让机器人直接观看人类的教学视频,原本是一条更省事的路。
可真学起来,第一个问题就出现了:
人和机器人干活的速度根本不一样。
人类三秒就能拿起水壶,把水倒进杯子;机器人可能花了三秒,还在调整夹爪,研究怎么抓住水壶。
如果硬是按照视频时间一秒一秒照着学,那很容易就会碰上大家的进度条不一样,陷入“跨服聊天”。
HOST的处理方式,类似人类照着做菜视频学做饭。
视频里的人已经把菜下锅,并不代表你也要立刻下锅。只要知道自己现在做到洗菜、切菜还是开火,再去找视频里的对应步骤就行了。
机器人也是如此。
HOST会先判断机器人当前做到哪一步,再从教学视频里寻找相同阶段。机器人正在抓水壶,就去看人类抓水壶时的画面;等它把水壶移动到杯子上方,再继续学习后面的动作。
![]()
图源:自变量HOST官网
这样一来,即使人类三秒完成倒水,机器人需要五秒,学习过程也不会乱套。
据自变量披露,相比Physical Intelligence推出的π₀.₅加监督微调方案,HOST需要的示范数量减少至约五十分之一,技能获取速度较最快的监督微调基线提升约507倍。
![]()
图源:自变量HOST官网
同样只看一段人类视频的两项基线中,表现最好的一项平均成功率也只有19%,HOST高出43个百分点。
不过,跟得上视频,只解决了“跨服聊天”的问题。
有一个更加现实的问题摆在HOST 面前:
人有五根手指,机器人可能只有一只夹爪。
即使它看懂了人类正在做什么,也不可能原样照抄人类的动作。
能抓到老鼠的,就是好机器人
很多人可能没有发现,我们在做一个简单的动作时,都会有非常多的感官配合。
比如抓起一个杯子时,我们的眼睛负责判断距离,手指根据杯子的重量和摩擦力调整握力,手腕还会随时修正角度。
机器人没有同样的手指、肌肉和身体经验。让它照抄人类手臂移动的轨迹,很容易撞到桌子,或者夹了半天也没拿起杯子。
因此,HOST没有让机器人照抄人类的动作,而是先看人类把事情做成了什么样,再用自己的身体实现同样的结果。
![]()
图源:自变量HOST官网(画面加速处理)
这种理念,和我们一句熟悉的谚语非常接近:黑猫白猫,能抓到老鼠的就是好猫,只不过这次上阵的是一个机器猫。
这就像同样要把一件衣服放进柜子,有人用左手,有人用右手;动作可以不同,只要衣服最后放进去了就行。
HOST把这项工作交给同一个模型中两个分工不同的模块:一个负责看懂视频、判断进度和预测结果,另一个负责生成机器人动作。
更关键的是,机器人学习新技能时,不需要重新训练模型,也不用修改原有参数。
过去,机器人每学一项新任务,都可能要重新调整模型。新能力写进去以后,还可能覆盖原有能力,出现“刚学会叠衣服,又把怎么倒水忘了”的情况,这就是所谓的“灾难性遗忘”。
HOST更像是给机器人建立了一个“技能收藏夹”。
每看完一段教学视频,它就把这次任务保存成一份可以调用的经验。以后遇到相同任务,再把对应经验找出来,不必为了增加一个新技能,重新改造整个大脑。
自变量给出的实验结果显示,之前的π₀.₅加微调方案学习新技能后,旧技能的保留率只有17%;而现在他们的HOST由于不修改模型参数,新旧技能不会直接相互覆盖,之前学过的还能在后面继续使用。
![]()
图源:自变量HOST官网
这也带来了另一个好处:降低成本。
毕竟从反复训练到随看随学,省下了反复采集数据和微调模型的成本,最终“教机器人做事”这块的成本确实降了下来。
但这里还有一个很容易产生的误解:
HOST只需要一段视频,不代表机器人此前什么都没学过。
恰恰相反,这台“看一遍就会”的机器人,已经提前练习了近20万次。
机器人的“小镇做题家”
HOST所谓的“看一遍就会”,只是说机器人面对一项新任务时,只需要看一段示范视频。
在此之前,它早就经历了漫长的“题海战术”。
HOST首先使用了193462段机器人操作轨迹进行训练,覆盖229项不同任务。
这些数据其实早就教会了机器人一些最基本的规律:机械臂应该怎么移动,夹爪怎样抓住物体,一个动作做下去,眼前的画面又会发生什么变化。
![]()
图源:自变量HOST官网(画面加速处理)
不仅如此,为了让机器人读懂人类的教学视频,HOST随后又使用了5847段人类示范视频,并为它们配上完成相同任务的机器人操作轨迹。
人类怎样拿起杯子,机器人又该怎样用夹爪实现相同结果,都是在这个阶段慢慢学会的。
所以,HOST的“一段视频学会新技能”,更像一个已经做过近20万道练习题的学生,看完一道新例题以后,很快摸清了解题方法。
这和一个从来没上过学的小朋友,看一遍奥数题就突然开窍,显然不是一回事。
但近20万次练习,也没有让HOST的突破失去意义。
过去,教机器人完成一个新任务,通常需要专业人员遥控机器人反复示范,再把收集到的数据交给模型继续训练。
按照HOST使用的对照方案,采集50次机器人示范,再完成后续微调,一项新技能大约需要4到4.9个小时。
HOST将一项新技能的平均获取时间压缩至约29秒,同时省去了后续微调模型的过程。
也就是说,HOST没有让机器人的全部训练成本凭空消失。
它仍然建立在近20万段机器人轨迹和5847段人类示范视频之上;真正被大幅压缩的,是机器人以后每增加一项新技能的成本。
![]()
图源:自变量HOST论文截图
至于这段视频最后由谁来拍,目前还没有明确答案。
机器人厂商可以在产品出厂前准备技能,项目交付人员也可以根据现场环境补充任务;未来如果操作足够简单,消费者或许也可以亲自示范。
HOST本身只是一种学习方法,还没有决定机器人最终会以什么产品形态来到用户面前。
因此,把HOST理解成机器人刷一段视频便什么都会,显然夸大了它的能力。
即使HOST能解决机器人怎样更快学会下一项技能的问题,但谁来教、什么时候教,以及买家愿不愿意亲自教,都要等真正的产品出现以后,才有答案。
参考资料:
[1]自变量机器人:自变量开源 HOST 框架,让机器人看一条数十秒视频学会新技能,较主流方法提速 500 倍、数据量仅需 1/50
[2]APPSO:机器人刷一段「短视频」,就能学会新技能?自变量 HOST 技术「神器」来了
[3]圆周智行:摆脱数据依赖 自变量找到了机器人进家的通用秘钥
[4]PaperAgent:机器人看29s视频学会一个新技能,自变量开源HOST框架
[5]极客公园:自变量200亿估值背后,具身智能在给什么定价?
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.