网易首页 > 网易号 > 正文 申请入驻

拒绝视频生成,深度跃迁提出具身基座模型全新路线

0
分享至

编辑|杨文

智能涌现的早期迹象,出现了。

机器人手拿一包爆米花,正准备将它放进微波炉,此时实验人员把微波炉门关上。数采员从未采集过这种情况的数据。机器人继续保持手中的目标物,重新打开微波炉门,接着完成原来的任务。


视频链接:https://mp.weixin.qq.com/s/waF8Tebyk02mdBo1avutDg


类似地,在另一次实验中,微波炉门只留下一条狭窄缝隙。机器人没有回到训练中学过的把手操作流程,直接用手里的包装将门推开。


视频链接:https://mp.weixin.qq.com/s/waF8Tebyk02mdBo1avutDg


这两段演示来自深度跃迁最新发布的世界动作模型 DELE-w0.5。其技术报告将这种表现称为「目标条件下的行为重组」,即当环境偏离训练轨迹,机器人仍能保留原来的任务目标,并根据新的状态调整动作。

深度跃迁是一家专注于从真实任务中持续进化的跨本体具身大脑平台公司,已完成由复星创富独家投资的天使轮融资。核心团队长期研究生成式策略、强化学习与具身智能,并围绕真实机器人任务自主研发了 DELE 系列具身大脑模型。



  • 项目主页:https://deepleap-x.com/research/dele-w0.5
  • 论文链接:https://arxiv.org/pdf/2608.22067

目前,一类世界动作模型建立在视频生成模型之上,机器人在执行动作前,需要同时预测动作和未来视觉轨迹。这种方式能够提供丰富的时空信息,但会消耗大量计算资源。为了输出一组低维动作,模型需要处理机械臂移动、物体外观和光影变化等高维视觉内容。

DELE-w0.5 放弃了这条链路。训练时,模型联合学习机器人动作和动作完成后的未来世界表征;推理时,未来世界表征分支被移除,机器人根据语言和当前视觉信息直接生成动作。

在 640 次真机实验中,DELE-w0.5 取得 62.5% 的完整任务成功率和 81.3% 的平均阶段进度。两项指标均远超过最强基线

不生成未来视频,模型如何学会动作与世界变化之间的关系?这种未来世界表征,又如何转化为真实世界中的执行能力?

视频生成技术,为何成了控制负担?

当前机器人基础模型大致有两条路线。

第一条是视觉 — 语言 — 动作模型,即 VLA。它接收语言指令、当前多视角观测和本体自身状态,然后直接输出动作。整个过程可以分为三步:输入语言指令和当前观测,接着由视觉语言模型(VLM)进行任务规划,最后由动作专家(Action Expert)将规划解码为机器人可执行的控制信号。

这条链路相对直接。模型能够学习当前观察与动作之间的映射关系,至于这些动作会给环境带来什么变化,相关信息通常被隐含地编码在模型参数中。

第二条路线是世界动作模型,也就是 WAM

视频式 WAM 会同时预测机器人动作和未来视觉轨迹,模型通过未来画面学习物体运动、空间变化和接触关系,进而获得更丰富的时空先验。问题在于,对于机器人操作而言,世界模型的目的并不是复现真实世界在每一个中间时刻的视觉信息,而是预测动作执行后达到的世界表征。中间帧仅描述不同物理状态之间的视觉过渡,不仅占用大量的模型容量和计算资源,而且无法直接刻画机器人动作所要实现的物理结果。

以开门为例,机器人真正需要完成的是稳定抓住把手、旋转把手、推开门,并让门保持在指定角度,至于机械臂在每一帧中的外观变化,控制系统没有必要逐一还原。

这种差异会直接反映在计算成本上。多帧视频 latent 通常远大于对应的动作序列,它们会增加模型的序列长度、显存占用和训练负担。在推理阶段,模型还需要对高维的视频与动作 latent 进行多轮去噪,机器人的控制循环因此受到视频生成速度的限制。

近年来,部分研究开始通过小型视频骨干、稀疏视频 token 和少步扩散等方式降低开销。这些方法能够减轻计算压力,视频轨迹依然保留在核心建模目标中。

DELE-w0.5 进一步提出:对于机器人控制,世界模型真正需要预测什么?深度跃迁将重点放在动作完成后的世界表征上

开门任务中,关键结果是门是否打开并保持稳定;杯中加冰任务中,目标是冰块进入直立的杯子,相关工具回到指定位置;冰箱取可乐任务中,机器人需要保留目标饮料,并完成冰箱关门。这些结果都可以用未来世界表征来刻画。

由此,三类模型形成了不同的预测目标。VLA 预测当前条件下的动作,视频式 WAM 联合预测动作和完整未来视觉轨迹,DELE-w0.5 联合预测动作和动作结束后的未来世界表征



模型仍然学习未来,需要处理的未来信息变得更加紧凑,也更贴近机器人控制目标。

未来世界表征只参与训练,不参与推理

DELE-w0.5 采用双流 Transformer 架构

模型首先接收语言指令、机器人当前的多视角图像和本体状态,语言指令由 Qwen3 编码,视觉信息由 DINO-v3 编码,包括一个头部视角和两个腕部视角。在动作侧,模型一次预测长度为 60 的动作序列,对于 Astribot S1 双臂机器人,每个时间步包含 14 维动作,覆盖两只机械臂的位置变化、姿态变化和夹爪状态。

模型内部包含条件流和噪声流。条件流处理语言与当前视觉,并将两类信息融合为统一的条件表征。噪声流处理加入噪声的动作序列与未来世界表征,模型通过 Flow Matching 同时学习动作去噪和未来状态去噪。


DELE-w0.5 架构概览。


未来世界表征在这里并非一张生成出来的图片。它来自 DINO-v3 对未来观察的编码,用来表征物体位置、机械臂状态和空间关系等信息,模型只需在 latent 空间学习这种状态变化,无需还原完整视觉画面,也无需生成中间视频帧。

DELE-w0.5 还设计了非对称注意力机制。训练过程中,动作 token 可以读取语言、当前观察和动作序列内部的信息,无法读取未来状态目标,这样可以防止动作预测提前看到未来答案。


训练和推理阶段的注意力掩码。


未来世界表征 token 可以读取语言、当前观察和动作。它需要学习一个具体问题:执行这组动作后,环境会进入什么状态?

未来世界表征的损失会通过共享参数参与模型训练,动作生成路径虽然不读取未来世界表征 token,其底层表征仍会受到动作后果学习的影响。这意味着,未来世界表征在 DELE-w0.5 中承担训练监督功能,它帮助模型建立动作与环境变化之间的联系,不会成为机器人每次行动前必须经过的显式步骤。

进入推理阶段后,未来世界表征 token 被全部移除,模型只保留语言、当前观察和动作,机器人无需先生成未来图片,也无需等待一段未来视频完成去噪,控制链路因此变得更短。

DELE-w0.5 没有使用开源机器人基础模型、VLA 或视频生成模型的既有权重进行二次封装,其核心基座从底层自研,模型结构、可行动世界状态表征、具身数据配方和本体适配均围绕真机任务设计。

数据显示,DELE-w0.5 在英伟达 RTX 4090 上的推理延迟中位数为 87.5 毫秒。其推理速度快于 GWP0.5、π0.5、LingBot-VLA2 和 HY-VLA,与 Spirit-v1.5 接近,同时取得了更高的完整任务成功率。

从具身智能角度看,DELE-w0.5 真正改变了什么?

DELE-w0.5 与视频 WAM 的差别,不只是生成帧数从多变少,还有模型依赖关系发生了根本变化:



视频生成关注的是观察空间中的连续变化,机器人控制关注的是物理世界中的可执行结果。对于「打开冰箱并取出饮料」这样的任务,机器人真正需要保持的是:

  • 冰箱门是否已经打开;
  • 饮料是否已经被取出;
  • 物体当前由哪只手持有;
  • 之前完成的状态是否在后续动作中被破坏;
  • 最终是否实现「饮料在手中且冰箱已经关闭」。

它并不需要在决策前复现冰箱门打开过程中的每一个视觉瞬间。因此,未来世界表征分支的价值并不只是提供额外监督,也是迫使策略学习一种结果导向的状态转移表征:一个动作是否正确,不仅取决于它是否像示范动作,还取决于它是否能够把环境推进到与任务目标一致的未来状态。

真机检验

未来世界表征是否真的改善了机器人动作,最终还要回到真实任务中检验。

研究团队在 Astribot S1 双臂机器人上设置了四项长程任务:打开一扇带把手的门、从冰箱中取出一罐可乐、向杯中加入冰块,以及将爆米花包装放进微波炉并启动加热。这些任务覆盖了接触式操作、目标提取、双手交接、工具使用、受限空间放置和最终状态确认。

实验比较了 DELE-w0.5 与 GWP0.5、XR0、π0.5、LingBot-VLA2、HY-VLA、Spirit-v1.5 和 GR00T-N1.7 七种代表性策略。所有方法使用相同的任务数据完成等量微调,并采用一致的任务指令、场景重置方式、180 秒执行预算和成功标准。4 项任务、8 种方法,每个方法在每项任务上进行 20 次正式测试,共组成 640 次真机实验

为了更加准确地衡量长程执行能力,技术报告采用两个指标。

第一个是完整任务成功率。机器人必须满足最终物理条件,整个任务才会被记为成功。

第二个是有序阶段进度。它记录机器人连续完成到了哪一步,如果前置步骤没有完成,后面的偶然动作不会被计入进度。这一指标可以显示模型究竟在哪个阶段失败,也能避免一次成功抓取掩盖后续执行问题。



有序任务阶段与完整任务完成条件。阶段 0 表示未取得有效进展,到达最终阶段表示完整完成任务。

结果显示,DELE-w0.5 在自身 80 次测试中成功完成 50 次,完整任务成功率达到 62.5%。最强基线 XR0 完成 24 次,成功率为 30.0%,DELE-w0.5 高出 32.5 个百分点,约为其 2.1 倍。在平均有序阶段进度上,DELE-w0.5 达到 81.3%,该指标下表现最好的基线 GWP0.5 为 61.3%,差距达到 20.1 个百分点。



每项任务 20 次测试的真机实验结果。平均进度对四项任务等权计算;总体成功率基于每种方法的全部 80 次测试计算



性能与效率概览。(a)平均有序阶段进度与总体完整任务成功率。(b)总体成功率与英伟达 RTX 4090 上的核心模型推理延迟中位数。(c–f)各项任务的成功率与成功完成任务时的运行时长。实心标记表示实测完成时长的中心值,空心标记表示根据遥测数据得出的估计值。

分任务来看,DELE-w0.5 的开门成功率为 80%,冰箱取可乐为 65%,杯中加冰为 45%,微波炉爆米花任务为 60%。四项任务均取得最高结果。



分阶段长程任务分析。每个单元格表示,在 20 次测试中,有序前缀得分达到或超过对应阶段的测试比例。各任务区块采用相同的模型坐标轴和概率刻度;Full 表示完整任务成功率。

真正拉开差距的地方,主要出现在任务后半程。

开门任务中,DELE-w0.5 在 20 次测试里全部到达旋转把手并推门的阶段,最终完成 16 次。多数基线能够接触并抓住把手,随后容易在旋转与推门的配合中失败。


视频链接:https://mp.weixin.qq.com/s/waF8Tebyk02mdBo1avutDg


冰箱取可乐任务中,DELE-w0.5 有 18 次成功取出目标罐,13 次完成整个任务,剩余失败主要出现在双手交接和最终关门。


视频链接:https://mp.weixin.qq.com/s/waF8Tebyk02mdBo1avutDg


杯中加冰是最长的任务。DELE-w0.5 有 19 次拿起冰铲,14 次进入杯子抓取阶段,11 次成功取得冰块,最终有 9 次完成倾倒和场景恢复。


视频链接:https://mp.weixin.qq.com/s/waF8Tebyk02mdBo1avutDg


微波炉任务中,DELE-w0.5 每次都能打开微波炉并拿起包装,16 次完成关门,12 次成功启动加热。


视频链接:https://mp.weixin.qq.com/s/waF8Tebyk02mdBo1avutDg


这组数据说明,长程操作的难点经常出现在技能之间的连接处。机器人抓住一个物体后,它还要保持此前取得的任务状态,切换执行手臂和交互对象,并把流程推进到最终条件。DELE-w0.5 更频繁地到达任务后半程,也更容易将阶段性进展转化为完整成功。

从研究评测看,62.5% 是一项亮眼结果,它显著超过同数据、同协议下的代表性基线,也证明这条技术路线具有潜力。距离工业级稳定部署,模型还需提高成功率,并接受更开放环境的检验。

研究人员还测试了 DELE-w0.5 的zero-shot 跨背景能力

从杂乱的办公工位,到开阔的会议室场景,DELE-w0.5 在桌面材质、空间布局、光照与视觉背景显著变化的环境中,依然能够完成微波炉和杯中加冰操作任务。


视频链接:https://mp.weixin.qq.com/s/waF8Tebyk02mdBo1avutDg



视频链接:https://mp.weixin.qq.com/s/waF8Tebyk02mdBo1avutDg


不依赖固定场景、不记忆特定背景,DELE-w0.5 已经具备跨背景的泛化能力。

结语

世界模型的价值,最终要由机器人能否完成任务来检验,画面生成得多真实,只代表模型对视觉过程的还原能力,动作能否围绕目标任务展开、承接前一步结果,并将环境推进到正确终态,更接近真实部署的要求。

对于具身智能,最有用的未来信息未必是一段可以观看的视频,它也可以是不追求完整视觉复现,却足以融合真实物理空间信息、以约束行动的世界表征。

DELE-w0.5 已经沿着这个方向迈出一步。它的意义不在于提前终结路线之争,在于为世界模型提供了新思路:不再以生成视觉过程为中心,而是以机器人行动结果为中心。接下来,DELE-w0.5 会为跨物体、跨场景和跨本体等任务提供全新的思想,真机部署的结果将检验这条路线能够走多远。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
34岁萨林杰宣布退役!NBA+CBA生涯赚了多少钱?退休金又有多少?

34岁萨林杰宣布退役!NBA+CBA生涯赚了多少钱?退休金又有多少?

锅子篮球
2026-09-04 14:41:42
正式官宣!前国安锋霸加盟美职联,7月曾重返工体,世界杯单挑C罗

正式官宣!前国安锋霸加盟美职联,7月曾重返工体,世界杯单挑C罗

体坛鉴春秋
2026-09-04 15:33:59
足协官方:申花外援米内罗禁赛三场

足协官方:申花外援米内罗禁赛三场

五星体育
2026-09-04 09:36:04
赛力斯问界销量近乎腰斩,“遥遥领先”为何卖不动了?

赛力斯问界销量近乎腰斩,“遥遥领先”为何卖不动了?

大厂财经社
2026-09-02 13:22:05
爆雷!Lululemon,突然崩了!

爆雷!Lululemon,突然崩了!

证券时报
2026-09-04 10:41:15
潍坊市投资集团有限公司党委委员、副总经理程明接受纪律审查和监察调查

潍坊市投资集团有限公司党委委员、副总经理程明接受纪律审查和监察调查

闪电新闻
2026-09-04 18:09:35
天津一租客父亲在出租屋跳楼身亡致房子变凶宅,房东索赔50万元:“租客父亲不止一次要跳楼”;法院:非正常死亡影响房屋交易,判赔10万元

天津一租客父亲在出租屋跳楼身亡致房子变凶宅,房东索赔50万元:“租客父亲不止一次要跳楼”;法院:非正常死亡影响房屋交易,判赔10万元

扬子晚报
2026-09-04 17:26:20
抗战胜利81周年,为什么说“只有正视历史才能赢得尊重”?

抗战胜利81周年,为什么说“只有正视历史才能赢得尊重”?

薛定谔的BUG
2026-09-03 09:08:59
52次失误还能赢? 郑钦文用一场“丑陋的胜利”,撕碎美网AI预测

52次失误还能赢? 郑钦文用一场“丑陋的胜利”,撕碎美网AI预测

玫瑰枪口抵心脏w
2026-09-04 07:52:15
65岁刘德华登新闻联播冲上热搜:四十载沉淀,影协副主席职位加身

65岁刘德华登新闻联播冲上热搜:四十载沉淀,影协副主席职位加身

行者聊官
2026-09-04 17:29:47
央八首播!34集谍战巨制来袭,仅播出一天,收视率直接登顶,终于有让我熬夜狂追的谍战大剧了

央八首播!34集谍战巨制来袭,仅播出一天,收视率直接登顶,终于有让我熬夜狂追的谍战大剧了

阿废冷眼观察所
2026-09-04 16:34:14
首富张一鸣拿下2000亿贷款,全力争夺全球新霸主!

首富张一鸣拿下2000亿贷款,全力争夺全球新霸主!

大厂财经社
2026-09-04 11:17:56
广东东莞男孩独自在家饿肚子打不通妈妈电话,民警一查发现妈妈手机在深圳被捡到了

广东东莞男孩独自在家饿肚子打不通妈妈电话,民警一查发现妈妈手机在深圳被捡到了

环球网资讯
2026-09-04 15:09:06
9月开局行好运,横财扎堆进门,金玉满堂彩的生肖,恭喜上榜!

9月开局行好运,横财扎堆进门,金玉满堂彩的生肖,恭喜上榜!

毅谈生肖
2026-09-04 11:25:22
金正恩访问越南,乘专列耗时65小时40分,为什么不坐飞机?原来大有讲究

金正恩访问越南,乘专列耗时65小时40分,为什么不坐飞机?原来大有讲究

文史道
2026-08-15 23:01:48
奥马尔·萨拉杰,遇袭身亡

奥马尔·萨拉杰,遇袭身亡

第一财经资讯
2026-09-01 23:55:56
特朗普玩大了,美国电网进入紧急状态,中国的变压器一个都不许买

特朗普玩大了,美国电网进入紧急状态,中国的变压器一个都不许买

叶老四
2026-09-03 17:41:41
A股收评:放量下跌!科创50跌2.1%,算力硬件板块集体回调,大消费板块强势

A股收评:放量下跌!科创50跌2.1%,算力硬件板块集体回调,大消费板块强势

和讯网
2026-09-04 15:38:03
马丁内利+萨默维尔+沃特金斯,利雅得新月1.9亿欧组英超三叉戟

马丁内利+萨默维尔+沃特金斯,利雅得新月1.9亿欧组英超三叉戟

懂球帝
2026-09-04 01:44:26
方媛好能忍!郭富城本人满脸皱纹,还有老年斑,个子不高像小老头

方媛好能忍!郭富城本人满脸皱纹,还有老年斑,个子不高像小老头

瞎说娱乐
2026-08-22 16:07:15
2026-09-04 19:15:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13921文章数 142729关注度
往期回顾 全部

科技要闻

OpenAI深夜王炸!GPT-6 Astra来了

头条要闻

52名新加坡公民在中国广西被捕 外交部回应

头条要闻

52名新加坡公民在中国广西被捕 外交部回应

体育要闻

小卡来去10首轮,快船7年彩礼一场空

娱乐要闻

古天乐公司欠债1.49亿

财经要闻

姚洋:刺激消费要守住两个“大西瓜”

汽车要闻

小米与中创新航、欣旺达动力达成战略合作

态度原创

教育
本地
游戏
手机
健康

教育要闻

#媒体原创 教育部:将继续坚守师德师风第一标准 坚决对师德失范行为“零容忍”

本地新闻

扒完小作文,富豪们私藏的度假胜地有多绝

索尼推出《GTA6》主题手柄 限定主机会跟进吗?

手机要闻

OPPO A7 Pro手机配色公布:8000mAh电池,9月11日发售

脑梗取栓成功≠活下来,还有这三关

无障碍浏览 进入关怀版