网易首页 > 网易号 > 正文 申请入驻

李飞飞团队造了个世界动作模型:换个底座,机器人成功率直接飙升

0
分享至

编辑|Panda

9 月 22 日,以 FLUX 图像模型闻名的 Black Forest Labs 跨界发布了开源 7B 世界动作模型 FLUX 3 Action。据其官方博客,该模型在英伟达 RoboLab-120 榜单上超过了此前最强的开源模型 Cosmos 3 Nano,参数量却不到后者一半。一家做图像生成的公司跑来卷机器人控制,说明视频模型里积累的「物理直觉」正被越来越多的团队当作机器人大脑的底座。

这条路线即所谓世界动作模型(World-Action Model,WAM)。自今年 2 月英伟达在 DreamZero 论文中明确提出这一术语以来,相关论文快速涌现。但热闹背后有个尴尬的问题:这些系统几乎都同时换了视频骨干、训练数据、视频与动作的交互方式和推理流程,谁也说不清究竟是哪个设计带来了提升。

本周,斯坦福大学李飞飞、吴佳俊、Ehsan Adeli 等人的团队发布论文,提出开放的世界动作建模框架OpenWAM,试图给这个问题一个系统性的回答。



OpenWAM 框架总览:三阶段训练、共享 MoT 架构、四种可配置交互方式,以及可冻结复用的局部动力学模型。



  • 论文标题:OpenWAM: An Open Framework for Composable World-Action Models
  • 论文地址:https://arxiv.org/abs/2610.07922
  • 项目主页:https://openwam.stanford.edu
  • 代码仓库:https://github.com/OpenWAM/OpenWAM

为什么需要一张「统一考卷」

传统的视觉-语言-动作模型(VLA)像一个凭条件反射开车的司机,看到画面、听到指令就直接给出动作。

WAM 则多了一步「脑内预演」:同时预测接下来几秒画面会怎样,以及为此该怎么动。视频天然记录了物体如何下落、碰撞和被推动,用海量视频预训练过的模型因此自带物理先验。

问题在于,「预测画面」和「生成动作」可以有很多种耦合方式:先想象再动作,先动作再想象后果,两者同时生成,或者各算各的。各家选择不同、底座和数据也不同,放在一起比较,就像几位厨师同时换了食材、灶具和下锅顺序,很难判断菜好吃究竟归功于哪一步。

第二个问题更隐蔽。机器人训练数据大多是成功示范,只告诉模型「正确的路怎么走」,几乎不包含「手多伸出去两厘米会怎样」。这好比只看过教练完美绕桩录像的学员,记住了路线,却不懂方向盘打多少车会偏多少。

OpenWAM对前者的回答是共享底座加可切换的交互方式,对后者的回答是大规模「反事实」数据。

同一副骨架,四种「先想还是先动」

OpenWAM 从阿里开源的视频模型 Wan2.2-5B 出发,先在约 334 万条机器人与人类交互视频上继续预训练,名义时长约 1.46 万小时,全程不用动作标签,在 32 块 B200 上训练了 14 天。

关键改动是「因果化」:每个视频块只能看到当前及之前的内容,不能偷看未来。原来的模型像拿着整本剧本反复改台词,现在则要像直播一样按时间顺序往下演,这正是机器人逐步行动所需要的。

随后,团队用Mixture-of-Transformers(MoT)架构把 5B 的视频专家和 2B 的动作专家拼在一起。两者各自保留归一化、投影和前馈层,只在一层联合注意力中交换信息。



共享 MoT 架构,视频专家与动作专家在打包后的 token 上做联合注意力。

在这副骨架上,团队定义了四种「交互程序」:

  • VTA先想象画面再生成动作
  • ATV顺序相反
  • Joint让两者同时生成并互相参考
  • Decoupled则让两者在未来部分互不可见

这像同一支乐队演同一首曲子,变的只是谁先起奏、彼此能否听见。四者共用底座、tokenization 和 flow matching 目标,唯一的变量是生成顺序和跨模态注意力,比较因此有了「控制变量」的意味。



四种交互程序(A–D)与两种局部动力学程序(E–F)的注意力掩码。

把「动作翻译器」拆出来单独训练

论文更具新意的部分,是把逆向动力学模型(IDM)和正向动力学模型(FDM)拆成可独立训练的组件。

IDM 像翻译:输入当前画面、机器人本体状态和一段想象出的未来视频,输出具体动作;FDM 则反过来,根据动作预测画面会变成什么样。

关键在于「局部」:两者都不接收任务指令和更早的历史,只关心「这一小段画面变化对应什么动作」。因此它们不绑定具体任务,可以和任何兼容的视频预测器拼接,视频模型决定「该发生什么」,IDM 负责「怎么做到」。

但只学过成功示范的翻译器见识太窄。为此团队构建了LIBERO-Long-CF 数据集:恢复示范中的仿真器状态,执行被改动过的动作,比如停止、反向、加噪声、改变夹爪开合时机等,共得到 32000 个片段、约 410 万条控制记录,是原始示范的 29.7 倍,其中 72.3% 的片段改变了物体的摆放状态。很多分支根本完成不了任务,但这正是重点。回到驾校的比方,这相当于教练让学员故意多打半圈方向盘,学员记住的不再只是路线,还有车本身的脾气。

实验:底座很能打,翻译器能搬家

在 LIBERO 四个子集上,四种交互程序的成功率都很高,VTA 平均达 98.6%,略高于论文引用的 LingBot-VA(98.5%)和 π0.5(96.9%)等已报告结果。不过 LIBERO 已接近饱和,更值得关注的细节是:在 LIBERO-Long 上,未来部分互不可见的 Decoupled(97.0%)与双向交互的 Joint(96.6%)不相上下。



四个 LIBERO 子集上的闭环成功率(%),基线为已报告结果。

真机上,团队用两台 Franka FR3 机械臂测试了烤面包、还原 2×2 魔方最后一层和按颜色分拣杯子,VTA 和 Joint 平均成功率分别为 92.1% 和 91.9%。



左为三项真机双臂任务,右为用于组件迁移的四个 LIBERO-90 任务。



视频链接:https://mp.weixin.qq.com/s/dI7-LFSWJsGak7e1PbTiZg

消融实验显示了底座的分量:其他条件不变,用原版 Wan2.2 初始化时 VTA 在 LIBERO-Long 上只有 68.4%,换成机器人视频预训练的因果底座后升至 97.8%,提升 29.4 个百分点。作者强调,这是数据与因果化改造的共同效果。



视频骨干初始化方式对 LIBERO-Long 成功率的影响。

最关键的是组件迁移实验。团队把在 LIBERO-Long 上训练的 IDM 冻结,搭配针对四个 LIBERO-90 新任务调整过的视频预测器。

结果,示范加反事实数据训练的局部 IDM 平均成功率达 84.0%,而接收完整上下文的 IDM 只有 47.0%,只用示范训练的局部 IDM 更是只有 21.5%。

「只看局部」和「见过足够多样的后果」缺一不可,两者结合才得到一个能搬家的动作翻译器。 需要注意的是,目标任务上的视频预测器用含动作标签的示范微调过,这并非零样本迁移,作者对此有明确说明。



冻结 IDM 迁移到四个 LIBERO-90 任务的成功率。

FDM 的结论一致。从同一状态出发执行 16 种不同动作,让模型判断预测画面对应哪个真实结果,随机猜测约为 6%,只用示范训练的 FDM 为 21.1%,加入反事实数据后升至 71.3%,模型终于能分清「这样推」和「那样推」的区别。



局部 FDM 在反事实转移上的预测表现。

结语

作者也坦承了局限:组件复用主要在仿真中验证,真机上「故意做错」的成本高得多;FDM 也只覆盖短时程预测。但 OpenWAM 的价值不在于又多刷了零点几个百分点。在 WAM 论文以周为单位涌现的当下,一个固定底座、只改一个变量的公共试验台,能帮助领域从「谁的分更高」转向「为什么更高」。而可复用的动作翻译器则暗示,未来的机器人大脑或许不必是整体训练的黑箱,负责想象与负责落地的模块可以各自迭代、按需拼装。那些没能完成任务的轨迹,恰恰是让模型理解物理世界的养料。

目前,团队已开源训练、评测与组合代码,以及预训练视频模型权重。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
中国不接招,美国自己耗死!全世界等中美开战,中国连看都懒得看

中国不接招,美国自己耗死!全世界等中美开战,中国连看都懒得看

无心小姐姐
2026-10-05 16:18:07
西媒爆料,穆帅严厉训话姆巴佩,告诫姆巴佩要低调;皇马再曝更衣室冲突,“2名球星大打出手”

西媒爆料,穆帅严厉训话姆巴佩,告诫姆巴佩要低调;皇马再曝更衣室冲突,“2名球星大打出手”

福酱的小时光
2026-10-08 17:46:23
李小璐再发文引评“如果没当时,和贾乃亮可独占鳌头”!

李小璐再发文引评“如果没当时,和贾乃亮可独占鳌头”!

默默有话说
2026-10-08 13:32:22
随着温特0-3,WTT中国大满贯女单8强全部诞生:4名中国选手在列

随着温特0-3,WTT中国大满贯女单8强全部诞生:4名中国选手在列

侧身凌空斩
2026-10-08 21:26:45
大明星赵薇的前夫,判了!

大明星赵薇的前夫,判了!

微微热评
2026-07-29 12:12:29
明珍珍被抓前有多壕,麻袋装钱,把中国人明码标价,生日警察护航

明珍珍被抓前有多壕,麻袋装钱,把中国人明码标价,生日警察护航

史说方休
2026-10-07 21:01:54
未成年人谨慎选择观看!惊悚电影《生化危机:爆发夜》热映,有孩子观影时吓哭被家长带离

未成年人谨慎选择观看!惊悚电影《生化危机:爆发夜》热映,有孩子观影时吓哭被家长带离

可乐谈情感
2026-10-07 18:10:36
蔡康永在内地捞金金额曝光!保守1个亿,《奇葩说》2600万、代言800万、书卖了500万册

蔡康永在内地捞金金额曝光!保守1个亿,《奇葩说》2600万、代言800万、书卖了500万册

小徐讲八卦
2026-10-08 14:59:31
刚刚!江淮汽车股价跌停,或因尊界刹车测试,踏板支架断裂

刚刚!江淮汽车股价跌停,或因尊界刹车测试,踏板支架断裂

说财猫
2026-10-08 13:29:05
刘亦菲被曝“掉了瑞幸、天梭等多个代言”,瑞幸官微深夜连发三个问号后晒出新宣传照回应;随后她“一下子加五个代言”冲上热搜

刘亦菲被曝“掉了瑞幸、天梭等多个代言”,瑞幸官微深夜连发三个问号后晒出新宣传照回应;随后她“一下子加五个代言”冲上热搜

无比
2026-10-06 11:33:08
英媒:过去10年球衣涨价超50%,但柬埔寨生产工人时薪仍不到1英镑

英媒:过去10年球衣涨价超50%,但柬埔寨生产工人时薪仍不到1英镑

懂球帝
2026-10-08 15:13:20
50岁胡可真的显老吗?在巴黎街头喝咖啡的一幕,给出了答案

50岁胡可真的显老吗?在巴黎街头喝咖啡的一幕,给出了答案

木子爱娱乐大号
2026-10-08 18:48:21
重磅!央视强力站台楼市,房价再次起飞?

重磅!央视强力站台楼市,房价再次起飞?

专业聊房君
2026-10-08 17:09:32
7000公里外突发大消息!胡塞武装无视中国劝告,如今后果显现了!

7000公里外突发大消息!胡塞武装无视中国劝告,如今后果显现了!

丁丁鲤史纪
2026-10-07 10:12:41
汤姆·克鲁斯新片被曝巨亏2.5亿美元,或成影史最大票房惨案之一

汤姆·克鲁斯新片被曝巨亏2.5亿美元,或成影史最大票房惨案之一

浅遇时光
2026-10-08 07:22:27
出现第二例死亡,应全力施压俄罗斯共享鼠疫信息

出现第二例死亡,应全力施压俄罗斯共享鼠疫信息

黔有虎
2026-10-07 20:03:37
震惊!“小仙女”们集体发帖,怀念早年大方买单男生,网友一针见血:和娱乐圈怀念煤老板一样,怀念撒钱的冤大头

震惊!“小仙女”们集体发帖,怀念早年大方买单男生,网友一针见血:和娱乐圈怀念煤老板一样,怀念撒钱的冤大头

火山詩话
2026-10-08 06:54:27
某小区楼顶发现可疑骨头?成都警方通报

某小区楼顶发现可疑骨头?成都警方通报

界面新闻
2026-10-08 21:00:06
特朗普据悉买入了最高2500万美元的Meta股票

特朗普据悉买入了最高2500万美元的Meta股票

财联社
2026-10-08 21:46:39
社保开始大数据倒查!挂靠、违规补缴,旧账终身追溯!

社保开始大数据倒查!挂靠、违规补缴,旧账终身追溯!

细说职场
2026-10-08 14:51:57
2026-10-08 22:35:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14155文章数 142745关注度
往期回顾 全部

科技要闻

江淮汽车回应"尊界V800刹车踏板支架断裂"

头条要闻

女局长被举报婚内出轨至少9人 大量亲密聊天记录公布

头条要闻

女局长被举报婚内出轨至少9人 大量亲密聊天记录公布

体育要闻

梅西社媒发文告别国家队 C罗点赞留言:致敬 拥抱

娱乐要闻

演员王晓慧刚担女主,就被曝已婚生子

财经要闻

央行:中国从不搞竞争性货币贬值

汽车要闻

特别版配色/碳纤尾翼 2027款深蓝L06将于10月9日上市

态度原创

教育
家居
亲子
旅游
手机

教育要闻

2026上海中考语文平均分116.83分

家居要闻

2026建博会(广州) 公装联探展交流活动

亲子要闻

备孕男性要补硒吗?2026年研究给出了剂量和效果数据

旅游要闻

【甘快看】成纪故事|秦安黄土沟壑间“长”出艺术村落

手机要闻

博主爆料华为阔直板多产品线布局,nova系列或跟进

无障碍浏览 进入关怀版