网易首页 > 网易号 > 正文 申请入驻

李飞飞团队造了个世界动作模型:换个底座,机器人成功率直接飙升

0
分享至

编辑|Panda

9 月 22 日,以 FLUX 图像模型闻名的 Black Forest Labs 跨界发布了开源 7B 世界动作模型 FLUX 3 Action。据其官方博客,该模型在英伟达 RoboLab-120 榜单上超过了此前最强的开源模型 Cosmos 3 Nano,参数量却不到后者一半。一家做图像生成的公司跑来卷机器人控制,说明视频模型里积累的「物理直觉」正被越来越多的团队当作机器人大脑的底座。

这条路线即所谓世界动作模型(World-Action Model,WAM)。自今年 2 月英伟达在 DreamZero 论文中明确提出这一术语以来,相关论文快速涌现。但热闹背后有个尴尬的问题:这些系统几乎都同时换了视频骨干、训练数据、视频与动作的交互方式和推理流程,谁也说不清究竟是哪个设计带来了提升。

本周,斯坦福大学李飞飞、吴佳俊、Ehsan Adeli 等人的团队发布论文,提出开放的世界动作建模框架OpenWAM,试图给这个问题一个系统性的回答。



OpenWAM 框架总览:三阶段训练、共享 MoT 架构、四种可配置交互方式,以及可冻结复用的局部动力学模型。



  • 论文标题:OpenWAM: An Open Framework for Composable World-Action Models
  • 论文地址:https://arxiv.org/abs/2610.07922
  • 项目主页:https://openwam.stanford.edu
  • 代码仓库:https://github.com/OpenWAM/OpenWAM

为什么需要一张「统一考卷」

传统的视觉-语言-动作模型(VLA)像一个凭条件反射开车的司机,看到画面、听到指令就直接给出动作。

WAM 则多了一步「脑内预演」:同时预测接下来几秒画面会怎样,以及为此该怎么动。视频天然记录了物体如何下落、碰撞和被推动,用海量视频预训练过的模型因此自带物理先验。

问题在于,「预测画面」和「生成动作」可以有很多种耦合方式:先想象再动作,先动作再想象后果,两者同时生成,或者各算各的。各家选择不同、底座和数据也不同,放在一起比较,就像几位厨师同时换了食材、灶具和下锅顺序,很难判断菜好吃究竟归功于哪一步。

第二个问题更隐蔽。机器人训练数据大多是成功示范,只告诉模型「正确的路怎么走」,几乎不包含「手多伸出去两厘米会怎样」。这好比只看过教练完美绕桩录像的学员,记住了路线,却不懂方向盘打多少车会偏多少。

OpenWAM对前者的回答是共享底座加可切换的交互方式,对后者的回答是大规模「反事实」数据。

同一副骨架,四种「先想还是先动」

OpenWAM 从阿里开源的视频模型 Wan2.2-5B 出发,先在约 334 万条机器人与人类交互视频上继续预训练,名义时长约 1.46 万小时,全程不用动作标签,在 32 块 B200 上训练了 14 天。

关键改动是「因果化」:每个视频块只能看到当前及之前的内容,不能偷看未来。原来的模型像拿着整本剧本反复改台词,现在则要像直播一样按时间顺序往下演,这正是机器人逐步行动所需要的。

随后,团队用Mixture-of-Transformers(MoT)架构把 5B 的视频专家和 2B 的动作专家拼在一起。两者各自保留归一化、投影和前馈层,只在一层联合注意力中交换信息。



共享 MoT 架构,视频专家与动作专家在打包后的 token 上做联合注意力。

在这副骨架上,团队定义了四种「交互程序」:

  • VTA先想象画面再生成动作
  • ATV顺序相反
  • Joint让两者同时生成并互相参考
  • Decoupled则让两者在未来部分互不可见

这像同一支乐队演同一首曲子,变的只是谁先起奏、彼此能否听见。四者共用底座、tokenization 和 flow matching 目标,唯一的变量是生成顺序和跨模态注意力,比较因此有了「控制变量」的意味。



四种交互程序(A–D)与两种局部动力学程序(E–F)的注意力掩码。

把「动作翻译器」拆出来单独训练

论文更具新意的部分,是把逆向动力学模型(IDM)和正向动力学模型(FDM)拆成可独立训练的组件。

IDM 像翻译:输入当前画面、机器人本体状态和一段想象出的未来视频,输出具体动作;FDM 则反过来,根据动作预测画面会变成什么样。

关键在于「局部」:两者都不接收任务指令和更早的历史,只关心「这一小段画面变化对应什么动作」。因此它们不绑定具体任务,可以和任何兼容的视频预测器拼接,视频模型决定「该发生什么」,IDM 负责「怎么做到」。

但只学过成功示范的翻译器见识太窄。为此团队构建了LIBERO-Long-CF 数据集:恢复示范中的仿真器状态,执行被改动过的动作,比如停止、反向、加噪声、改变夹爪开合时机等,共得到 32000 个片段、约 410 万条控制记录,是原始示范的 29.7 倍,其中 72.3% 的片段改变了物体的摆放状态。很多分支根本完成不了任务,但这正是重点。回到驾校的比方,这相当于教练让学员故意多打半圈方向盘,学员记住的不再只是路线,还有车本身的脾气。

实验:底座很能打,翻译器能搬家

在 LIBERO 四个子集上,四种交互程序的成功率都很高,VTA 平均达 98.6%,略高于论文引用的 LingBot-VA(98.5%)和 π0.5(96.9%)等已报告结果。不过 LIBERO 已接近饱和,更值得关注的细节是:在 LIBERO-Long 上,未来部分互不可见的 Decoupled(97.0%)与双向交互的 Joint(96.6%)不相上下。



四个 LIBERO 子集上的闭环成功率(%),基线为已报告结果。

真机上,团队用两台 Franka FR3 机械臂测试了烤面包、还原 2×2 魔方最后一层和按颜色分拣杯子,VTA 和 Joint 平均成功率分别为 92.1% 和 91.9%。



左为三项真机双臂任务,右为用于组件迁移的四个 LIBERO-90 任务。



视频链接:https://mp.weixin.qq.com/s/dI7-LFSWJsGak7e1PbTiZg

消融实验显示了底座的分量:其他条件不变,用原版 Wan2.2 初始化时 VTA 在 LIBERO-Long 上只有 68.4%,换成机器人视频预训练的因果底座后升至 97.8%,提升 29.4 个百分点。作者强调,这是数据与因果化改造的共同效果。



视频骨干初始化方式对 LIBERO-Long 成功率的影响。

最关键的是组件迁移实验。团队把在 LIBERO-Long 上训练的 IDM 冻结,搭配针对四个 LIBERO-90 新任务调整过的视频预测器。

结果,示范加反事实数据训练的局部 IDM 平均成功率达 84.0%,而接收完整上下文的 IDM 只有 47.0%,只用示范训练的局部 IDM 更是只有 21.5%。

「只看局部」和「见过足够多样的后果」缺一不可,两者结合才得到一个能搬家的动作翻译器。 需要注意的是,目标任务上的视频预测器用含动作标签的示范微调过,这并非零样本迁移,作者对此有明确说明。



冻结 IDM 迁移到四个 LIBERO-90 任务的成功率。

FDM 的结论一致。从同一状态出发执行 16 种不同动作,让模型判断预测画面对应哪个真实结果,随机猜测约为 6%,只用示范训练的 FDM 为 21.1%,加入反事实数据后升至 71.3%,模型终于能分清「这样推」和「那样推」的区别。



局部 FDM 在反事实转移上的预测表现。

结语

作者也坦承了局限:组件复用主要在仿真中验证,真机上「故意做错」的成本高得多;FDM 也只覆盖短时程预测。但 OpenWAM 的价值不在于又多刷了零点几个百分点。在 WAM 论文以周为单位涌现的当下,一个固定底座、只改一个变量的公共试验台,能帮助领域从「谁的分更高」转向「为什么更高」。而可复用的动作翻译器则暗示,未来的机器人大脑或许不必是整体训练的黑箱,负责想象与负责落地的模块可以各自迭代、按需拼装。那些没能完成任务的轨迹,恰恰是让模型理解物理世界的养料。

目前,团队已开源训练、评测与组合代码,以及预训练视频模型权重。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
iPhone几年换一次最划算?

iPhone几年换一次最划算?

科技华叔
2026-08-25 10:33:49
反复警告不如出手一次!中方暂停燃油出口,整个亚洲能源危机?

反复警告不如出手一次!中方暂停燃油出口,整个亚洲能源危机?

观察者海风
2026-10-08 15:35:43
10月8日龙虎榜,机构青睐这19股

10月8日龙虎榜,机构青睐这19股

证券时报
2026-10-08 20:58:03
曾经的广东四小虎,四十年大浪淘沙,如今两极分化,命运天差地别

曾经的广东四小虎,四十年大浪淘沙,如今两极分化,命运天差地别

天气观察站
2026-10-08 12:48:02
“这拿筷子姿势,太恶心了”,一段母女吃饭视频火了,又一个贫民窟的小公主

“这拿筷子姿势,太恶心了”,一段母女吃饭视频火了,又一个贫民窟的小公主

蝴蝶花雨话教育
2026-10-06 11:47:56
不是战争,不是疾病······未来几个月,缅甸民众要更难了!

不是战争,不是疾病······未来几个月,缅甸民众要更难了!

书写传奇
2026-10-08 22:27:04
私下安抚球员+瓜帅回归站台 曼城军心已稳?

私下安抚球员+瓜帅回归站台 曼城军心已稳?

体坛周报
2026-10-08 09:48:29
离战争不远了!美国已露出4大迹象,军事专家张召忠预言要成真?

离战争不远了!美国已露出4大迹象,军事专家张召忠预言要成真?

補懂事的孩紙
2026-10-08 18:17:41
黎姿55歲生日晒全家福 胞弟黎嬰氣色佳溫馨同框:最緊要健康

黎姿55歲生日晒全家福 胞弟黎嬰氣色佳溫馨同框:最緊要健康

粤睇先生
2026-10-07 00:36:51
张本智3-0周启豪!赛后张本智和毫不客气检讨失利,说得很实在!

张本智3-0周启豪!赛后张本智和毫不客气检讨失利,说得很实在!

体育一点就通
2026-10-08 16:28:01
香港男星面部僵硬被指医美过度,曾与圈外女友订婚,婚事最终告吹

香港男星面部僵硬被指医美过度,曾与圈外女友订婚,婚事最终告吹

小武侃风云
2026-10-01 04:01:41
孙德荣改口道歉陈乔恩!遭反击「别再提我」 回应:我只是工作人员

孙德荣改口道歉陈乔恩!遭反击「别再提我」 回应:我只是工作人员

ETtoday星光云
2026-10-08 17:23:15
养老金重算补发即将开启,工龄40年,养老金重算补发能有多少?

养老金重算补发即将开启,工龄40年,养老金重算补发能有多少?

虎哥闲聊
2026-10-07 21:08:52
队内德比见真章!27岁女队悍将14-16抗压强势挺进,这次两人双赢

队内德比见真章!27岁女队悍将14-16抗压强势挺进,这次两人双赢

体话我说
2026-10-08 22:14:07
菲海警在中国海警水炮拦截下,还是完成对仁爱礁破船医疗后送任务

菲海警在中国海警水炮拦截下,还是完成对仁爱礁破船医疗后送任务

三叔的装备空间
2026-10-08 21:33:53
网友直播猛踩尊界V800刹车:上万人观看,狂收礼物

网友直播猛踩尊界V800刹车:上万人观看,狂收礼物

三言科技
2026-10-08 22:47:16
朝鲜核爆后的隐患越来越重:地下六次核试验对中国也产生了影响

朝鲜核爆后的隐患越来越重:地下六次核试验对中国也产生了影响

据说说娱乐
2026-10-08 05:24:35
悲催!新婚夫妻国庆假期在马尔代夫不幸溺水身亡!本是一场新婚蜜月,却变成人间惨剧

悲催!新婚夫妻国庆假期在马尔代夫不幸溺水身亡!本是一场新婚蜜月,却变成人间惨剧

王老师你还好吗
2026-10-08 02:08:13
《巫师3RE》也遇上鬼脸BUG了!免费升级那还说啥

《巫师3RE》也遇上鬼脸BUG了!免费升级那还说啥

游民星空
2026-10-07 17:23:09
浙江一60岁大妈天天吃梨子,年底去体验,出来的报告让医生惊讶

浙江一60岁大妈天天吃梨子,年底去体验,出来的报告让医生惊讶

涛哥讲堂
2025-07-21 11:42:39
2026-10-08 23:20:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14155文章数 142746关注度
往期回顾 全部

科技要闻

江淮汽车回应"尊界V800刹车踏板支架断裂"

头条要闻

女局长被举报婚内出轨至少9人 大量亲密聊天记录公布

头条要闻

女局长被举报婚内出轨至少9人 大量亲密聊天记录公布

体育要闻

梅西社媒发文告别国家队 C罗点赞留言:致敬 拥抱

娱乐要闻

演员王晓慧刚担女主,就被曝已婚生子

财经要闻

央行:中国从不搞竞争性货币贬值

汽车要闻

特别版配色/碳纤尾翼 2027款深蓝L06将于10月9日上市

态度原创

房产
游戏
健康
旅游
军事航空

房产要闻

三亚崖州,拟出安居房新政!

德玛西亚杯:总算保住了名头!JDG让一追二,成功击败NAVI

痘坑留下后,还能填平吗?

旅游要闻

全世界都知道中国人放假了:冰岛热度翻倍,老外也学会错峰了

军事要闻

美日将在距台仅110公里处演习

无障碍浏览 进入关怀版