聪明、丝滑、灵巧,一家美国创业公司为机器人的跨本体泛化提供了一种新解法。
就在24小时之前,美国机器人创业公司Reward AI发布其首款机器人基础模型OM-1。它具备三大特点:直接从人类操作数据中学习,不使用遥操作或机器人本体数据;同一个模型可以零样本迁移到桌面机械臂、工业机械臂和人形机器人;在包装、调酒、折叠衣物等任务中,以接近人类的速度连续执行。
![]()
最关键的是,换一种机器人,不必把已经学到的操作能力全部推倒重练。这是OM-1最令人惊艳的能力。
Reward AI同时公开了一组演示:机械手按住水晶头卡扣,拔出锁紧的以太网线;两只机械臂协同完成手机包装;双臂机器人折叠衣物、拿取酒瓶并调制饮品;OM-1可以驱动人形机器人进行全身操作和导航,但更多细节尚未公布。
![]()
从Demo来看,所有片段均为原速播放,手机包装、调酒和衣物折叠等长时程任务的执行时间不到30秒。英伟达机器人负责人Jim Fan在相关发布下的评价很短:“So smooth!”
但它真正想改变的,是机器人模型、训练数据与硬件之间的关系。
01
跨本体不是新命题,摆脱机器人数据才是关键
让同一个模型控制不同机器人,并不是OM-1第一个提出的目标。
Physical Intelligence在2024年发布的机器人基础模型π0,使用了开放机器人数据集以及团队从八种机器人上采集的数据。Google DeepMind发布的Gemini Robotics 1.5已经展示过在ALOHA 2、双臂Franka和Apollo人形机器人之间迁移动作;2026年7月发布的Gemini Robotics 2则称,可以用数小时数据、通常不到200个样本适配新的双臂机器人。
OM-1选择了一条更激进的数据路线:负责操作决策的同一个模型只从人类示范中学习,不需要先为不同机器人采集训练数据,也不需要针对具体机器人重新微调。
这条路线来自Reward AI两位创始人长期积累的研究。CEO Zipeng Fu拥有斯坦福大学计算机科学博士学位,师从机器人学习学者Chelsea Finn,参与过Mobile ALOHA、HumanPlus等项目;CTO Chen Wang同样毕业于斯坦福计算机系,师从李飞飞和C. Karen Liu,研究方向集中在人类动作学习、灵巧操作和长时程规划。
![]()
OM-1直接延续了Chen Wang等人在斯坦福开展的DexCap研究:不再先让人遥控机器人,而是记录人类如何自然地完成工作,再让同一个模型把这些经验迁移到不同机器人上。
使用遥操作采集数据时,人的动作要先经过某台机器的关节、夹爪和控制系统,数据里容易混入特定硬件的特征。OM-1则把数据采集放到机器人之前:人先自然操作,模型学习其中可复用的能力,再由不同机器人的底层控制系统负责执行。
02
把人“下意识会做的事”记录下来
人拿起杯子、拧开瓶盖或者整理衣物时,很少会思考每根手指应该移动多少。接触前减速、物体滑动时增加抓力、盒盖没有对齐时轻推一下,这些轻推、滑动、扭转和力量变化,构成了Reward AI所说的“潜意识身体智能”。
为了捕捉这些信息,团队开发了可穿戴设备Omnibody Hand。它没有机械复制人手的全部关节,而是用七自由度保留最重要的功能:拇指与食指完成精细捏取,多根手指协同发力,并在精确抓取和力量抓取之间切换。
设备同步记录图像、手部轨迹、手指间距离、触觉信号和用力大小。模型学到的不只是“手移动到了哪里”,还包括什么时候接触、物体是否抓稳,以及拉动或托举时需要多大力量。
![]()
为了记录快速动作,Reward AI在视觉惯性追踪之外加入电磁追踪。在八种速度、每种速度十次的测试中,其方案在最高速度下将平均过冲误差从24.9毫米降至9.5毫米,降幅约60%。这一数字衡量的是手部追踪误差,不是机器人任务成功率,但说明系统可以在不要求人刻意放慢动作的情况下,更准确地记录示范。
![]()
对于一个此前没有学习过的新任务,Reward AI称,OM-1需要的人类示范数据总时长不到30分钟。新任务仍然需要示范;所谓“零样本”,主要指同一个模型换到另一种机器人身体上时,不需要进行本体特定的微调。
03
从拔网线到四臂包装,模型必须边做边调整
OM-1公布的任务不是简单的抓取和放置。
拔网线就是一个典型例子。机械手必须先找准水晶头上的卡扣,将其按下,再向外拉。位置偏一点,接头就不会释放;只增加拉力,反而可能损坏接口。
![]()
开启冰箱门考验的是力量适应,机器人需要根据未知阻力不断调整。调酒和衣物折叠包含多个连续步骤,手机包装则要求四只机械臂围绕同一件物品协同操作。
![]()
Reward AI称,演示中还出现了几种涌现行为:一只机械臂出现偏差时,其他机械臂会调整动作进行补偿;操作失败后,模型会重新尝试;物体受到外部干扰时,它会改变动作;如果环境变化过大,机器人会停止执行。
这些表现说明,OM-1生成的不是只能从头播放到尾的固定轨迹,而是根据接触状态、任务进度和其他机械臂的动作持续调整。
OM-1真正激进的地方,不是第一个提出跨本体,而是试图把机器人本体从上层模型的训练数据中拿掉:让人类示范成为可以长期复用的数据源,让具体机器人只是执行这些能力的不同身体。
如果这条路线能够经受长时间运行和更多硬件的验证,机器人数据就可能不再随着一代硬件退役而贬值。今天记录的人类操作,可以继续教会明天才被制造出来的机器人。
这才是OM-1此次发布最值得关注的赌注。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.