网易首页 > 网易号 > 正文 申请入驻

NVIDIA 李柏依:机器人只会「看」还不够,它还得学会「听」| ECCV 2026

0
分享至


给生成模型引入仿真,补上难以获得的声音感知。

作者丨张岂萍

编辑丨幸丽娟

机器人要进入真实世界,需要处理的信息远不止视觉。

倒水时,声音可以帮助判断杯子是不是快满了;物体发生碰撞时,不同材质会发出不同的声音;一个人在小房间和大房间里说话,空间回声也不一样。然而,这些人类习以为常的多模态感知,以及诸如切苹果、叠杯子这类极其复杂的双手灵巧操作,在机器人的训练阶段却面临着极其高昂的“数据采集壁垒”。

当机器人需要的数据很难直接采集,传统物理仿真又补不全这些信息时,还有没有别的办法?

在 ECCV 2026 主题为“Visual Perception and Reasoning in the Interactable World”的Workshop上,NVIDIA Research 科学家、UC Berkeley 研究者李柏依(Boyi Li)通过线上连线分享了她近期在这一方向上的两项工作。

她博士毕业于康奈尔大学,师从 Serge Belongie 与 Kilian Q. Weinberger,之后在 UC Berkeley 与 Jitendra Malik、Trevor Darrell 开展研究,目前研究重点包括具身智能中的高效多模态、泛化建模和交互智能系统。

面对这些难以直接采集的数据,她尝试了两条不同的路径:模拟器里没有的声音,可以“生成”出来;机器人身上昂贵的操作数据,也可以从人类视频里获得。

第一条路径是MultiGen。传统物理模拟器已经可以模拟相当逼真的倒水过程,却没有与画面同步的声音。李柏依团队利用现实世界中的视频和音频训练生成模型,再让它为仿真视频补上对应的声音。她将这个思路概括成一句话:“Don’t just simulate physics – generate perception”不只模拟物理过程,还要生成感知

另一条路径是DexImit。与其大量采集昂贵的双手机器人示范,团队尝试利用人类操作视频,恢复其中手与物体的交互,再将这些交互转化为机器人能够学习和执行的双手操作数据。

一个补上仿真世界里缺失的感知,一个把人类操作转化为机器人可以学习的示范。背后的思路是一致的:机器人训练需要的,不只是把物理世界模拟得更真实,还要把那些难以直接获得的感知和交互信息,变成机器人可以学习的数据。

以下是李柏依的演讲分享,AI科技评论根据其演讲内容进行了不改原意的编辑:


Efficient Multimodal Intelligence for Embodied Agents in Interactive Worlds(交互世界中的具身多模态智能)

01


机器人为什么需要“听见”世界?

我们一直在研究多模态系统。

现在的多模态已经不只是图像和语言,还包括 3D 几何、声音、嗅觉和触觉等信息。这些模态可以帮助模型进行泛化和推理,也可以用于机器人、医疗等真实场景。

今天我主要分享其中两个与机器人有关的工作。

先从声音开始。

我们先来看一个很有意思的任务。假设现在有一根水管正在往瓶子里倒水,你需要判断什么时候水会溢出来。如果没有声音,只看水管里的水流,其实很难判断瓶子里面发生了什么。

如果把声音加进来呢?

其实在日常生活中,我们一直在利用声音理解周围发生的事情。比如烤肉的时候,我们可以通过声音判断它的状态;玻璃碎了、门打开了、可乐被打开了、水烧开了,我们也可以通过声音知道发生了什么。

声音还能提供空间信息。在小房间、大房间,甚至更大的空间里说话,声音听起来都会不一样。它也可以帮助我们判断物体的材质和状态。比如洗碗的时候,不同材质的杯子、瓶子和盒子会发出不同的声音;有时候我们还会摇一摇薯片罐,通过声音判断里面是不是还有东西。

那机器人能不能也利用声音?

我们希望训练一个机器人策略,让它同时利用视觉、物理信息和声音,更准确地执行任务。要做到这一点,我们首先需要多模态数据。

但真实世界里的这类数据很难采集。

那 simulation 呢?现在的物理模拟器已经可以生成非常逼真的视觉效果。比如倒水,我们能够看到整个物理过程,看起来已经很真实了。

问题是,没有与画面对应的声音。


如果要训练同时利用视觉、物理信息和声音的机器人策略,我们就需要包含这些信息的多模态数据,而且不同模态之间还要彼此对应。现有的物理模拟器没办法提供这样的音频。

那这些声音从哪里来?

02


MultiGen:

不只模拟物理,还要“生成感知”

我们开始重新看已经拥有的数据。

现实世界里其实有大量同时包含视频和声音的数据,比如 YouTube 等来源的视频。我们把这些视频收集起来,作为In-the-Wild Data

我们的目标是训练一个Audio Generative Model:给模型一段视频,让它生成与视频内容对应、并且在时间上对齐的声音。我们选择 diffusion model 作为基础模型,在训练时输入视频,让模型学习生成对应的音频。


训练完成之后,我们发现这个模型对不同的视频内容有比较好的泛化能力。给它一段视频,它能够生成与画面对应的声音。

接下来,我们把物理模拟器生成的视频输入这个模型,让它生成对应的声音。这样,模拟器负责生成视觉信息和机器人的物理轨迹,生成模型负责补上音频,最后得到一套Simulated Multimodal Dataset


有了这些数据之后,我们就可以进一步训练同时利用视觉和声音的 Multimodal Robot Policy,再把它部署到真实环境中。

我们测试了不同的容器和液体。比如把液体倒进不规则的容器,机器人需要自己判断什么时候停止;换成可乐之后,声音和音高都发生了变化,但机器人仍然可以完成倒水任务。

我们还测试了环境变化。比如在倒水过程中把灯关掉,让视觉受到干扰,机器人仍然能够继续完成任务。我们也加入了背景噪声,在比较嘈杂的环境里,策略仍然能够识别倒水的声音。

为了进一步验证效果,我们比较了两种策略:一种只使用视觉,另一种同时使用视觉和声音。

先看不透明容器。因为无法直接看到容器内部的液体状态,只使用视觉时误差比较大;加入声音之后,误差明显下降。

我们也测试了透明容器。即使在这种情况下,视觉本身已经能够提供更多信息,加入声音之后,性能仍然有所提升。


我们还做了一个更直接的对比实验。两组实验保持完全相同的设置,一组机器人只使用视觉,另一组同时使用视觉和声音。倒水过程中,我们把灯关掉,等机器人判断应该停止之后,再把灯打开。

只使用视觉的时候,水已经溢出了杯子。

机器人在感知上其实非常脆弱。一旦视觉受到干扰,整个系统就很容易失效。在这种情况下,声音可以发挥很重要的作用,帮助系统变得更加鲁棒。

这也是我们最后想表达的:“Don’t just simulate physics – generate perception.”

不只模拟物理过程,还要生成感知。


03


DexImit:

机器人数据还能从哪里来?

刚才我们讲的是生成音频信号。

接下来,我们来看另一类与真实世界有关的交互信息:人和机器人怎样与真实世界中的物体发生交互。

这项工作的出发点很简单。我们关注Bimanual Dexterous Manipulation,也就是双手灵巧操作。它对于通用机器人非常重要,很多真实世界任务都需要两只手和灵巧操作,比如抓取、倒水、使用工具,以及长时序操作。


但真实机器人上的双手灵巧操作数据,采集起来既昂贵,又耗费人力。

与此同时,人类操作视频几乎是无限的。它们可以来自日常演示,也可以来自视频生成模型,而且这些视频本身就包含了人类操作物体的知识。

那我们能不能直接从人类视频中生成机器人的灵巧操作数据?

这就是我们提出DexImit的出发点。它的全称是Learning Bimanual Dexterous Manipulation from Monocular Human Videos。我们希望从人类视频出发,在仿真中生成模仿这些人类操作的机器人双手数据。


04


从一段人类视频,到真实机器人

具体怎么做?整个 pipeline 有四个阶段。


第一步是恢复人手和物体的运动。我们直接从一段单目人类视频开始,进行深度估计、手部姿态估计、3D 生成和物体的 6D pose estimation,最后把这些信息统一到 World Coordinate 中,得到手和物体随时间变化的 4D 交互轨迹。


但把轨迹恢复出来还不够。一段双手操作视频里,两只手可能同时在做不同的事情,一个长任务里也会连续出现多个动作。

所以第二步我们会把整个过程拆成不同的子任务,再安排两只手分别在什么时候执行什么动作。


接下来还有一个问题:人的手和机器人的手并不一样。

人的动作不能直接复制给机器人。我们需要根据前面恢复出来的交互,生成机器人真正能够执行的抓取姿态。这里我们会考虑 force closure 等物理约束,再通过 motion planning 生成平滑、无碰撞的机械臂轨迹,最终得到完整的仿真机器人示范。


得到这些数据之后,我们还会进行Augmentation。比如改变物体的位置和尺度、相机视角以及 observation,让训练出来的策略能够更好地泛化到真实世界。

数据质量同样很重要。我们还会利用视觉语言模型理解原始的人类操作视频,再检查生成出来的数据是否与原始操作一致。


那这些生成出来的数据到底能不能用?

我们主要想回答几个问题:生成的数据本身是不是有效?和已有方法相比,能不能得到更好的双手灵巧操作数据?面对更复杂、更长的任务还能不能工作?最后,能不能实现 zero-shot real-world deployment?

我们测试了不同来源和不同难度的人类视频。可以看到,人工采集的数据质量更好;随着任务变得越来越复杂,生成数据的准确性和可用性也会下降。


我们还和已有方法进行了比较。对于真实世界里更加复杂的任务,比如制作饮料、烹饪、切苹果和叠杯子,仅仅把视频中的动作恢复出来是不够的。尤其是long-horizon、fine-grained、contact-rich tasks,我们需要比较准确的 reconstruction,同时还要保证生成出来的动作交互在物理上是合理的。

比如切苹果,机器人不仅需要准确判断苹果的位置,还要控制切下去的力量,同时保证抓取足够稳定。



最后,我们进一步测试了 zero-shot real-world deployment。

为了让策略更好地泛化到真实环境,我们会对物体位置和尺度、相机视角以及 observation 做 augmentation。我们也做了 ablation study,分别改变其中一些设置。结果可以看到,完整方法的表现最好,这些 augmentation 对真实世界部署非常重要。


我们把 DexImit 生成的数据部署到了真实机器人上。

当然,DexImit 目前还有一些限制。

首先是柔性物体和关节物体。现在的 3D 生成阶段主要依赖 SAM 3D,它假设的是刚性物体几何,目前还不能很好地处理柔性物体或者带有关节结构的物体。未来可能需要更先进的 geometry reconstruction 或 generative modeling 来解决这个问题。

第二是移动操作。现在的方法主要面向桌面上的双手操作。如果机器人需要一边移动、一边操作物体,还需要进一步建模机器人本体的运动和环境动态。

第三是长视频。整个 pipeline 由多个模块连续执行,误差可能会随着时间不断累积。视频越长,这个问题越明显。有些情况下还是需要人工介入,比如调整基于 VLM 的子任务分解,或者修正重建过程中出现的问题。

最后是手内操作,比如在手里旋转一个橙子。这类任务中,手和物体之间会产生非常严重的遮挡,单目视频能够提供的信息有限,目前 DexImit 也没有专门针对这种情况设计机制。


我们的代码已经开源,大家感兴趣的话也可以进一步尝试。

05


Q&A 现场问答

Q1(现场观众):有没有哪些特定的噪声或声音,会对机器人策略产生负面影响?或者有些声音对人类有用,但机器人却无法利用?

李柏依:这是一个很好的问题,我们也一直在思考。比较有意思的是,我们在训练时其实没有做任何噪声增强(noise augmentation),但模型在有背景噪声的情况下依然比较鲁棒。我们猜测,可能是因为音频本身是一维信号,不同声音之间比较容易区分。比如模型训练过倒水的声音之后,即使环境中同时出现其他声音,也可以把不同的声音区分开。当然,这只是我们目前的推测。

Q2(现场观众):有没有一些任务,即使加入声音,对机器人也没有什么帮助?

李柏依:这个我们还没有测试。但很容易想到声音在哪些任务里发挥作用。比如当视觉信息受到干扰的时候,声音就很重要。对于其他任务,比如拿起一个杯子或者拿起手机,声音可能就没有那么重要。通常我们并不需要依靠声音去抓取手机或者杯子。

为了方便大家抱团交流、互通会议消息,我们专门建了ECCV 2026参会交流群!进群你会解锁这些「福利」

  • 会议情报站投稿 DDL、格式规范、评审进度……关键节点第一时间送达,再也不怕错过 deadline,投稿准备稳稳的。

  • 同行茶话会天南海北的同行都在群里,聊心得、碰思路、攒人脉,科研路上我们同行。

  • 前沿补给站最新研究成果、热点方向实时同步,结合会议主题帮你捋清投稿脉络,给论文灵感加满油。

  • 现场后援团:(会议期间专属开启):到了会场也不用慌——

    路线导航场馆分布、报告厅怎么走,群里随时问;

    议题共读热门 session、Keynote 现场探讨,错过也能追;

    Poster 汇编现场海报精华整理,一键收藏不遗漏;

    约局广场约饭局、采访局、交流局……想唠嗑、想合作、想面基,群里发起就成。

进群传送门:扫码进群或添加微信Qvv0909777,备注:ECCV + 单位/学校+姓名+方向。

搞科研/搞技术,信息差很重要。

来,一起快人一步!

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!

公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
沙特退出中国主导,取代SWIFT的跨境数字货币平台;面对胡塞威胁,沙特被迫站队美国

沙特退出中国主导,取代SWIFT的跨境数字货币平台;面对胡塞威胁,沙特被迫站队美国

以色列飛飛
2026-09-22 09:00:03
1962年,甘肃常务副省长王秉祥,因拒绝枪毙13位县委书记被撤职,复出后升任省委书记

1962年,甘肃常务副省长王秉祥,因拒绝枪毙13位县委书记被撤职,复出后升任省委书记

方圆文史
2026-09-14 17:29:50
罗永浩又赢了,理记闭嘴了

罗永浩又赢了,理记闭嘴了

大张的自留地
2026-09-23 10:30:57
台湾学者称“大陆现在把‘一国两制’当成敬酒,‘武力统一’当成罚酒”,国台办:“两制”台湾方案会充分吸收两岸民众意见和建议

台湾学者称“大陆现在把‘一国两制’当成敬酒,‘武力统一’当成罚酒”,国台办:“两制”台湾方案会充分吸收两岸民众意见和建议

政知新媒体
2026-09-23 12:28:13
国际油价跳水,金银同步下跌

国际油价跳水,金银同步下跌

第一财经资讯
2026-09-23 13:44:29
票房破22亿,只是开始,张译、古天乐、雷佳音要掀起一波新高潮了

票房破22亿,只是开始,张译、古天乐、雷佳音要掀起一波新高潮了

阿废冷眼观察所
2026-09-23 00:44:44
南开教授胡金牛“段子手式”简介更新:自嘲有的研究方向已快被AI取代

南开教授胡金牛“段子手式”简介更新:自嘲有的研究方向已快被AI取代

澎湃新闻
2026-09-23 19:24:03
将日本记者干沉默!日媒失态:用争议图片报道张博恒 韩美女也遭殃

将日本记者干沉默!日媒失态:用争议图片报道张博恒 韩美女也遭殃

风过乡
2026-09-23 07:16:25
2026幼儿园“修仙”名单火了!全班名字像仙侠主角,网友:全员神仙

2026幼儿园“修仙”名单火了!全班名字像仙侠主角,网友:全员神仙

辣妈当小小
2026-09-23 08:57:15
中方访美前夕,第一夫人梅拉尼娅的一封信,道出特朗普的真实处境

中方访美前夕,第一夫人梅拉尼娅的一封信,道出特朗普的真实处境

共工之锚
2026-09-23 00:29:39
算是踢到铁板了!这届日本亚运会,给全世界好好上了一课:没有中国,生意很难做

算是踢到铁板了!这届日本亚运会,给全世界好好上了一课:没有中国,生意很难做

扶苏聊历史
2026-09-10 14:58:19
菲律宾今天弹劾门槛投票!参议员单多数即可推翻,16,票定罪要求

菲律宾今天弹劾门槛投票!参议员单多数即可推翻,16,票定罪要求

晨光苏醒a
2026-09-23 12:18:34
中纪委亮重拳,全国严查“逃逸式”辞职!

中纪委亮重拳,全国严查“逃逸式”辞职!

职场资深秘书
2026-09-23 12:01:48
曝王玉雯杨玏结婚又离婚,二人曾花800万合资买房,分手原因被扒

曝王玉雯杨玏结婚又离婚,二人曾花800万合资买房,分手原因被扒

小疯子耶
2026-09-22 15:09:31
儿子15年不上班,服药自尽后,母亲整理遗物发现银行卡金额后愣了

儿子15年不上班,服药自尽后,母亲整理遗物发现银行卡金额后愣了

兰姐说故事
2025-01-21 17:10:03
汪峰把公司1100人砍到400人,700人被裁。他说:“引入AI两个月,剩下400人干得比原来还好”,财务笑开了花。

汪峰把公司1100人砍到400人,700人被裁。他说:“引入AI两个月,剩下400人干得比原来还好”,财务笑开了花。

LULU生活家
2026-08-15 14:17:30
一个国家能蠢到什么程度?看看法国就明白了:法国黑人接近800万,巴黎新生儿里70%是黑人

一个国家能蠢到什么程度?看看法国就明白了:法国黑人接近800万,巴黎新生儿里70%是黑人

怪味历史连连看
2026-09-08 01:55:32
不查不知道,坐拥北京山庄,有4个孙子孙女的陈佩斯,私下有多壕

不查不知道,坐拥北京山庄,有4个孙子孙女的陈佩斯,私下有多壕

洲洲影视娱评
2026-09-22 13:45:57
画面不堪入目,地下人奶交易乱象,成年人躺进怀里吃奶的灰色黑产

画面不堪入目,地下人奶交易乱象,成年人躺进怀里吃奶的灰色黑产

易玄
2026-09-12 10:24:46
中方通报后,新西兰回应了,新总理发声:预计中国不会反对

中方通报后,新西兰回应了,新总理发声:预计中国不会反对

丁懰惊悚影视解说
2026-09-21 16:36:45
2026-09-23 20:04:49
AI科技评论 incentive-icons
AI科技评论
点评学术,服务AI
7668文章数 20785关注度
往期回顾 全部

科技要闻

一夜三款新模型,AI价格战再升级

头条要闻

南开教授胡金牛"段子手式"简介更新 曾自称"力压普京"

头条要闻

南开教授胡金牛"段子手式"简介更新 曾自称"力压普京"

体育要闻

300万英镑,他们买下了一位队史传奇

娱乐要闻

王玉雯杨玏被曝结婚又离 荒唐一幕出现

财经要闻

全市场都在卷自营

汽车要闻

性能与实用兼得 全新奥迪S5 Avant上市 57.18万元

态度原创

健康
旅游
教育
艺术
时尚

痘痘没成熟,千万别硬挤!

旅游要闻

赶紧收藏!中秋、国庆惠阳上新40项文旅活动

教育要闻

2026想给孩子报记忆力培训班?隆成义最强大脑特训营口碑推荐

艺术要闻

深圳4座新全球总部:大疆尖塔、京东画境、OPPO曲面、科达利窗口

消失的天后,带病复出,先赚10个亿

无障碍浏览 进入关怀版