网易首页 > 网易号 > 正文 申请入驻

智元发布原生世界动作模型,首次验证Scaling路径!

0
分享至


机器人前瞻(公众号:robot_pro)
作者 钟宸
编辑 漠影

机器人前瞻9月10日报道,昨日,智元发布了原生世界—动作模型(World Action Model,WAM)GE-Act 2.0

智元称,GE-Act 2.0的所有模型参数,包括视觉表征、未来生成、动作预测等核心组件均从随机初始化开始,在具身操作数据上从头训练。

训练完成后,模型不针对评测任务做任何微调和示范,直接在陌生场景、陌生物体上,接受语言指令跟随、多技能操作和陌生环境泛化等真机零样本(Zero-shot)检验,覆盖100项原子任务、20类技能、两种机器人本体。

结果显示,随着数据规模扩大100倍,模型不仅原有技能更稳定,还逐步解锁了此前完全无法完成的新任务,包括折叠毛巾、嵌套纸杯、拔插笔盖、插花等较精细动作。

智元称,原生世界—动作模型的Scaling路径首次被系统性验证。

一、可在复杂场景完成任务,展现长程任务能力

在相同的零样本OOD协议下,智元评估了GE-Act 2.0在目标对象、颜色、大小、形状、位置和顺序方面的指令理解能力。实验表明,该算法能够在杂乱的场景中准确选择目标对象,且能够遵循习得动作偏好(Learned Action Biases)不同的指令,并且能够通过指令组合使能力泛化到新的任务场景中

首先,GE-Act 2.0可以在复杂场景中执行指令。在智元展示的视频中,模型可在杂乱的物品中识别指令所需的正确物品,并执行夹起的操作。

且该模型能够遵循更复杂的“抓取和放置”指令,结合物体和颜色的区别,正确识别需要移动的物体以及放置的位置。在智元展示的视频中,搭载该模型的G1-OP可将绿色苹果放到绿色的盘子中,并将橙子放到橙色的盘子中。

其次,GE-Act 2.0展现了避免习得动作偏好的能力。在视频中,即使鞋子在鞋盒旁边,G1-OP会遵循把杯子放进鞋盒的指令。智元指出,该策略遵循指令对象-目的关系,而非场景暗示的关系。

同时,模型还能够打断原来的指令,执行最新的指令,在智元展示的视频中,G1-OP可在取消拿起绿色杯子的指令后继续执行拿起蓝色杯子的指令,且进行了连续两次取消,但从视频来看,杯子差一点就要被拿起,且G1-OP显得有些“手忙脚乱”。


GE-Act 2.0还能够在非标准场景中,通过执行连续的单步指令,实现零样本泛化能力,从而完成全新的长程任务。它能利用语言指导,将熟悉的操作技能转化为新的任务序列,而无需针对特定任务的微调。

在展示的视频中,G1-OP的目标是食物放入托盘中,它可以将苹果、芒果、零食袋以及瓶子分不同步骤放进盘中。

二、重新设计架构,展现跨本体迁移能力

这一模型是怎么做到的?智元对此的解释是,GE-Act 2.0面向具身操作重新设计整套架构,给出了从头预训练的完整方法论。


首先,智元设计了更高效的视觉编码器CoAE,将一帧256×384画面压缩为24个视觉token,仅为DINOv3的十六分之一,同时保留语义、运动与局部结构。

压缩后反推动作的精度与DINOv3、V-JEPA 2.1等高信息量表征接近,在4,000条机器人操作数据的受控测试中,指令—画面匹配准确率达97.95%,为五种对照表征中最佳。

其次,智元采用一步式视觉规划,一次生成完整未来,并让动作误差直接反馈给世界模型。配合高效视觉表征,模型在RTX 5090显卡上生成一个连续动作chunk仅需104毫秒。

最后,GE-Act 2.0采用了知识对齐选择性优化方法(KASO),即一次生成多个可能的未来,只选择与真实动作最一致的结果参与训练。在陌生场景的分布外(OOD)评测中,机器人选对指令目标的比例较基线提高7.5个百分点,最终完成抓取的成功率提高10个百分点。

在数据架构上,GE-Act 2.0提出让每类数据承担合适的学习任务:

  • 使用3.9万小时“指令—视频”数据预训练世界模型,学习环境如何变化,其中包含3,000小时无本体数据(不带动作标注的第一视角与人类操作视频);
  • 以3.2万小时机器人轨迹预训练逆动力学模型(IDM),学习“画面这样变化时机器人做了什么”,其中包含2,000小时失败操作与真实场景部署回流(rollout)数据,不要求成功标签;
  • 最后通过3万小时“指令—视频—动作”完整数据进行联合训练,把两种能力连接起来。


在评测中,GE-Act 2.0把真机零样本表现作为标准:不微调、不示范、不换模型,测试中的场景、背景、光照和物体实例均未进入训练。

在相同训练配方下,最后一阶段分别使用300/1,200/5,000/30,000小时四档数据,智元指出,模型在三方面展现出Scaling:

首先是取得非零成功率的任务,在G1-OP机器人上从39项增至76项,在G2-90D机器人上从24项增至72项。智元指出,折叠毛巾、嵌套纸杯、拔插笔盖、插花等较精细动作在小规模数据训练的模型上无法被理解,而当数据达到3万小时规模时出现显著的能力顿悟

从智元在技术博客展现的视频来看,G1-OP可在零样本的情况下,完成将倾倒的水瓶扶正的操作。

以及将一个杯子,套至另一个杯子内的操作。


以及擦去桌面油污的操作。


而对于仅贡献训练数据不足2%的G2-90D,该模型依然在零样本的情况下完成指令,诸如摘取笔帽,从视频来看,机械臂能精准识别到笔帽并完成摘取操作,同时右臂依然握住笔杆。


以及把芒果放进容器内的操作,但从视频来看,似乎机械臂并未准确定位到容器中央。

而从任务成功率的数据来看,G1-OP机器人总体成功率从17.1%提升至44.1%,G2-90D机器人从13.4%提升至31.1%,且5,000到30,000小时仍未见明显饱和


另外,虽然G1-OP机器人贡献超50%训练数据,G2-90D机器人占比不足2%,但后者总体成功率仍随共享数据扩大提升17.7个百分点,出现了跨本体的能力迁移



最后,微调后的GE-Act 2.0在RoboTwin陌生环境测试中取得60.52%成功率,在GenieSim指令遵循测试中获得0.770分,均超过π0.5、GR00T N1.7等参与比较的模型

结语:从头训练,验证具身Scaling Law

从GE-Act 2.0的发布来看,智元正在试图回答具身智能领域一个核心但尚未被充分验证的问题:世界—动作模型是否也能像大语言模型一样,走出一条清晰的Scaling Law路径?

答案是初步肯定的。当训练数据从300小时扩展到3万小时,模型不仅在原有任务上表现更稳定,更在折叠毛巾、嵌套纸杯、插花等精细操作上出现了“顿悟”。

不过,G1-OP零样本44.1%的成功率也提醒我们,这条路径虽然被验证存在,但距离真正的应用仍有不小的距离。

跨本体迁移的出现固然令人振奋,说明模型学到的并非某一台机器人的肌肉记忆,而是某种更通用的操作语义,但G2-90D在部分任务中暴露的定位偏差以及数据上的差距,也说明能力在不同本体间的迁移可能并不均匀。

接下来值得关注的,是当数据规模继续扩大一个数量级后,是否还会涌现出现在尚未预见的新能力,以及能否实现更广泛的应用。

技术博客:https://ge-act-v2.github.io/#conclusion

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
新疆12岁男孩捡1岁女婴,18年后娶她为妻,找到妻子亲生父母后傻了

新疆12岁男孩捡1岁女婴,18年后娶她为妻,找到妻子亲生父母后傻了

如烟若梦
2025-06-12 17:20:44
重情重义!宏远老板60大寿朱芳雨杜锋合体庆生,徐杰周鹏都来了

重情重义!宏远老板60大寿朱芳雨杜锋合体庆生,徐杰周鹏都来了

宝哥精彩赛事
2026-09-11 12:58:44
李途纯去世,家属曝光其临终前状态,原来他曾被1个女人害惨了

李途纯去世,家属曝光其临终前状态,原来他曾被1个女人害惨了

静若梨花
2026-09-11 10:14:44
特奥多罗公开辱华,台下响起掌声,中国不承认裁决,高官拒绝参会

特奥多罗公开辱华,台下响起掌声,中国不承认裁决,高官拒绝参会

影孖看世界
2026-09-10 16:53:46
大跌眼镜!贝森特连60亿美元都没“舍得买”?美债陷入恐慌性抛售

大跌眼镜!贝森特连60亿美元都没“舍得买”?美债陷入恐慌性抛售

财联社
2026-09-11 09:24:04
85周年大秀后,Coach这波秋季包最低100美元起

85周年大秀后,Coach这波秋季包最低100美元起

时光慢旅人
2026-09-11 04:05:56
iPhone 17系列官网涨价线下大降价,差价达500元

iPhone 17系列官网涨价线下大降价,差价达500元

界面新闻
2026-09-11 13:12:23
一波未平一波又起!打假人举报付曾学术造假,付磊女儿曝爷爷大瓜

一波未平一波又起!打假人举报付曾学术造假,付磊女儿曝爷爷大瓜

阿讯说天下
2026-09-11 11:29:31
除夕夜老婆说要加班,却穿着情侣睡衣在初恋家包饺子,我直接把家门反锁,连夜挂了卖房的牌子,让她在外面过年吧

除夕夜老婆说要加班,却穿着情侣睡衣在初恋家包饺子,我直接把家门反锁,连夜挂了卖房的牌子,让她在外面过年吧

晓艾故事汇
2026-09-05 15:28:37
这个污蔑中国的恶毒谣言,被粉碎!

这个污蔑中国的恶毒谣言,被粉碎!

海外网
2026-09-08 14:35:07
彻底退出南通!又一豪华4S店闭店!

彻底退出南通!又一豪华4S店闭店!

濠河神聊
2026-09-11 17:53:34
与何超琼同居14年,至今没领证没生娃没名分,地位早已超越陈百强

与何超琼同居14年,至今没领证没生娃没名分,地位早已超越陈百强

凡知
2026-09-11 13:11:15
扬言要让中国向世界道歉的阿丘,被央视除名后,如今状态令人唏嘘

扬言要让中国向世界道歉的阿丘,被央视除名后,如今状态令人唏嘘

喜欢历史的阿繁
2026-08-26 03:58:11
为防止战争来临,中国需快速大量制造052D,为何不是055大驱?

为防止战争来临,中国需快速大量制造052D,为何不是055大驱?

奇趣放大镜
2026-09-01 15:36:03
中方接到消息,统一在岛内破冰,谷立言反应强烈,要把特朗普害惨

中方接到消息,统一在岛内破冰,谷立言反应强烈,要把特朗普害惨

麓谷隐士
2026-09-12 00:05:07
张继科:刘翔是奥运冠军!是我们国家的英雄 别的不知道不能胡说

张继科:刘翔是奥运冠军!是我们国家的英雄 别的不知道不能胡说

念洲
2026-09-11 07:00:49
iPhone 18 Pro Max全球价格对比,国行到底贵不贵

iPhone 18 Pro Max全球价格对比,国行到底贵不贵

搞机小帝
2026-09-10 18:30:59
梅西一走,阿根廷全乱了?

梅西一走,阿根廷全乱了?

五星体育
2026-09-11 17:09:46
长城军工、内蒙一机、中兵红箭、光电股份,谁是军工超跌反弹老大

长城军工、内蒙一机、中兵红箭、光电股份,谁是军工超跌反弹老大

长风价值掘金
2026-09-11 18:27:10
宁可被骂也无所谓了!惠州女孩月薪3000扛不住6000房贷,发视频喊话国外前男友回来收回房子。

宁可被骂也无所谓了!惠州女孩月薪3000扛不住6000房贷,发视频喊话国外前男友回来收回房子。

捣蛋窝
2026-09-09 13:59:20
2026-09-12 05:35:00
机器人前瞻
机器人前瞻
智东西AI媒体矩阵品牌。机器人前瞻,机器人产业新媒体,专注报道全球机器人创新。
898文章数 17关注度
往期回顾 全部

科技要闻

苹果折叠屏比小米华为贵5000元,该怎么选

头条要闻

18岁女子加前男友微信被现男友发现 争吵后跳楼身亡

头条要闻

18岁女子加前男友微信被现男友发现 争吵后跳楼身亡

体育要闻

37岁还能场场进球,还能翻跟头!

娱乐要闻

黄晓明直言帮太多白眼狼,杨颖遭殃

财经要闻

女装“玖姿”母公司跨境贸易迷局:安正时尚说谎了吗?

汽车要闻

买菜车也有小乐趣 风云T7不止是台合格家用SUV

态度原创

本地
游戏
手机
旅游
公开课

本地新闻

Onestage x 乐华娱乐暑期巡回选拔2026

逼老外学中文的魔兽时光服,又要用三件新橙装吊他们胃口了"/> 主站 商城 论坛 自运营 登录 注册 简体中文 简体中文 English 逼老外学...

手机要闻

豆包手机二代下周发布!努比亚晒NaviX Ultra蓝境配色真机图

旅游要闻

上海旅游节开幕倒计时,中外演出团队集结黄浦江畔彩排

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版