网易首页 > 网易号 > 正文 申请入驻

【附PPT】申恒涛:世界模型驱动产业发展

0
分享至


  202 6 年 7月 21日 - 23 日, 202 6 中国汽车论坛在上海嘉定举办。本届论坛由中国汽车工业协会主办,以 “新开局,新机遇,新征程——共绘汽车产业高质量发展新蓝图”为主题,由“1场闭门峰会、1个大会论坛、1场技术领袖峰会、13个主题专题论坛、N场行业发布”等16场会议和若干配套活动构成,各场会议围绕汽车行业热点重点话题,探索方向,引领未来。其中,在7月 23 日 上 午举办的 “【主题论坛十】AI驱动智能网联新能源汽车产业数智新发展”上, 同济大学计算机科学与技术学院院长申恒涛发表精彩 演讲 。以下内容为现场 发言 实录:


  今天非常荣幸。其实这是我第一次跨界演讲,从来没有在汽车产业这样的这个领域吧,与大家分享一下我们的一些科研的一些走向和成果。大家最近听到世界模型非常多,是吧?的确是这半年来,应该说整个人工智能领域,甚至说所有领域里面,可能最火的一个词。


  世界模型在今年上半年的投融资就大概有500亿。那创业世界模型的有三部分人,一部分就是我这种的大学教授、科研团队做最前沿的科技的。一部分是所谓的一些天才少年,很年轻的人,对吧?除了创业,那还有第三部分人,就是来自你们汽车产业做智驾的人,然后呢,除了这个创业世界模型。就是让世界模型看看如何来赋能智慧驾驶,主要是这三批人来创业世界模型。

  那大家听的世界模型很多,那么到底世界模型是什么呢?那今天主要是想跟大家分享一下我们这方面的一些思考以及最新的一些成果吧。那世界模型的目的就是要实现从以前的数字世界到物理世界的这样一个本质性的跨越。那他要做什么呢?他要感知这个物理世界,对不对?要理解这个物理世界。要能想象与预演我们这个世界是如何去发展的、如何去变化的,同时,我们要做规划与执行。

  举个例子,让机器人如何在我们这个物理世界当中去执行任务,去做任务。这是世界模型主要要实现的东西。那具体来讲,可以说是感知与压缩、想象与预演,以及规划与执行。所以通过世界模型的这样一个闭环。智能体可以实现高效的学习,逐步实现空间智能。举个例子,让汽车能够在物理世界当中能够更好地去驾驶这样一个目标,这是世界模型。



  那有人把世界模型分成了三大路径,比如渲染器、规划器、模拟器,做世界模型的人无非就这三方面做这方面。什么是渲染器?渲染器,那就是让生产出来内容更加真实。我渲染这些内容,让内容看起来更像我们真实的物理世界。那这一部分叫渲染器。那第二部分呢,叫规划器。那规划器就是我应该让车或者机器人去做什么,该做什么。这是规划器,那第三部分是模拟器。模拟器是做什么的?是要模拟我们现在这个物理世界的现状,以及要预测它的未来。


  那大家可以看这三个路径,哪个是最为核心的呢?哪个是最为核心的呢?肯定是模拟器。你可以理解渲染器和规划器是模拟器的具体应用。你只有通过这个模拟器去理解这个物理世界了,理解它的运行的规律了,并且能够发现新的规律了。然后,我用这些规律、这些物理世界的规律,用到渲染器当中,用到规划器当中。这是整个3个技术路径的一个核心的区别吧。应该说,模拟器才是真正的世界模型的本质。

  这是3个路径,那世界模拟器我们说了,核心就是要理解这个物理世界。以后我们要做状态的模拟、状态的模拟。那状态的模拟在现阶段,那我们就可以通过生成很多数据、生成很多数据。有的人说做仿真的数据,对不对?那通过仿真与真实数据的结合,我可以产生一些复合性的数据。所以在现阶段,特别是智能驾驶这个领域。那绝大部分研究世界模型的是做什么?就是数据的生成,你也可以理解它仿真器,就是让这个系统去仿真我们这个物理世界的现状,对吧?然后做一些预测,能够帮助我们更好地去学习驾驶,防范风险。

  但是到底能不能防范风险,世界模型还做不到这一点。那世界模型的仿真器可以让你在仿真的环境当中去学习驾驶,这个没有问题,让你驾驶得更加熟练。但是世界模型不能做什么呢?它不能预测不可预知的未来。举个例子,突发的交通事故,这个是没法去预测的。它的预测是什么?基于这个世界运行的规律。那什么叫规律?就是发生太多次了,我才能形成一种规律,或者是必须这样做了,它才叫规律,是不是?那突发的交通事故,举个例子,它不是规律。

  所以在现阶段的研究很多的世界模拟器就是通过状态的预演,我能生成一些高效的数据来做下一步的训练。那我们团队开发了悠然无界世界模型,我们团队从去年开始就做世界模型,我记得很清楚,去年1月份的时候,我就在全国应该是做了第一个关于空间智能的演讲,只是说当时国内还不是很火。去年5月份,我们发布了无界世界模型的1.0版本。一点点慢慢发展,那依然没有太大的影响。那从今年1月份开始硅谷那边,对吧?两大AI教母、教父,对不对?他们各融了十几亿美元以后,世界模型赛道突然火起来了。

  那么,我们无界世界模型在5月份也相应地发布了2.0的版本。那这个世界模型有什么特点呢?那各个方面都有一些创新吧,主要是两方面。一方面就是数据方面的一个创新,我们在数据增强与数据增广方面做了很大的创新。那通过这样的方式,我就可以用很少量的高质量数据完成训练。这是第一个创新。第二个创新是模型框架的创新。那模型框架的创新,我们主要用了两方面的创新,一个是动态记忆的机制,第二个呢,就是双通路的这种动作控制的调制。

  那我们通过这种模型的创新,我们可以实现用更少数据、更快的训练,从而能够实现更强的性能。那我们通过数据端优化,大家可以看到,我们把训练数据降低了97%。也就是别人用100条数据,我们只用3条数据即可完成。那训练的时长的话,我们降低了86%,我们只用差不多14%或者十分之一的训练时长就完成了训练的任务。而我们的效果到底如何呢?这是我们最终实现的效果,在今年5月份。Word Arena是世界模型领域最权威的榜单,每月更新一次,其中CPR2026赛事参与量最大、内容最全,是极具权威性的终极榜单。


  那我们的开源模型,在该榜单中世界排名第一。我们的模型在总榜上面排名世界第二,但实际综合实力也是第一,可以说是双榜第一。同时我们的世界模型泛化性比较强,我们参与了整个Word Arena所有的Track比赛。能够参与所有Track比赛的模型少之又少,本次赛事共有100多个模型参赛,真正覆盖全部赛道的仅有3个模型,我们的模型依旧位列全球第一,这是Word Arena的官方排名情况。

  那第二个模型呢,我们说叫规划器。刚才我们说了,我们有渲染器、规划器、模拟器三大路径。刚才介绍的世界模型,可以理解为模拟器,而这款全新模型可以理解为规划器。规划器的核心,就是将视觉模型与动作模型相结合,形成端到端模型,只有这种模型才能直接应用到机器本体上面。模拟器本身不能直接用到机器本体,必须结合动作模型,才能控制机器人的动作,判定下一步执行内容,因此该模型也叫作视觉空间动作模型。


  大家常提及视觉动作模型、Word Action Model,而我们这款新模型定义为世界空间动作模型。这个模型最大的创新点,就是所有的认知、建模、规划、执行动作,均以3D世界和3D物体作为基础理解单元,开展具体任务执行与规划。以往的Word Action Model大多依托2D视频、图像完成动作规划,不具备3D空间认知能力。而我们的模型将真实3D世界与3D物体融入整体框架,能够实现更精准的规划与动作执行。


  该模型需要与设备本体结合,因此参与了机器人挑战赛。在仿真开源平台的赛事中,我们的模型位列世界第一;在真机训练赛事中,我们排名世界第四。取得第四名的主要原因,是我们团队软硬件资源有限,仅完成一次训练就取得该成绩。本次赛事共有100多个模型参赛,汇聚了全球绝大多数知名机器人企业、具身智能企业,公开开源参赛模型仅有十几个,整体参赛规模略大于世界模型赛道赛事。


  那么我们的未来发展方向是什么呢?整个行业的未来,一定是基于世界模型。世界模型能够完成感知、想象与行动全流程工作,但必须依托智能体作为中介载体,才能赋能机器人、无人机、随身设备等各类机器本体。当下行业热议机器人应用,核心原因是机器人涉及复杂的行为动作控制,技术难度更高、应用场景更丰富。而无人机、随身设备无需复杂本体行为控制,仅需依托数字世界智能体完成与物理世界的交互即可。


  但机器人应用更为复杂,尤其是人形机器人,需要依托智能体控制肢体、躯干完成各类具体任务。无论何种硬件载体,行业未来的核心架构,都是依托世界模型赋能硬件本体。简单来说,世界模型负责理解物理世界、推演场景变化,多模态大模型负责场景规划、人机交互,两类模型缺一不可,是行业核心基础模型。依托两类基础模型,可搭建具身智能体,适配各类服务机器人设备。

  具身智能体集成感知、规划、导航等多项模型能力,不局限于多模态大模型与世界模型,还包含各类行业专属技能Skills。不同行业对应的技能体系各不相同,现阶段绝大多数技能模型以视觉模型为主。智能体相当于硬件设备的核心大脑,搭载该大脑的各类硬件设备,能够实现智能化运行,这就是行业未来的基础技术框架。

  接下来为大家展示我们自研的具身智能系统“Geek Mind(Geek心智)”搭载机器人完成任务的实际效果。我们的企业为考拉悠然,首款展示机器人命名为考拉一号。机器人语音:好嘞,我现在就去帮你拿一瓶椰子水。我没有发现椰子水,现在去前台询问工作人员。对于机器人而言,智能体是软硬件结合的功能模块。机器人语音:你好,请问哪里有椰子水?智能体的最终形态,是集成所有模型能力的专用芯片,如同设备SIM卡一般,搭载后即可激活设备智能能力,目前行业暂未实现芯片级落地,现阶段以功能模块形式呈现。

  机器人语音:您好,这是您需要的椰子水,请取走。

  从演示视频中可以看到,不同智能设备本体之间可实现交互通信、协同作业。本次演示除考拉一号机器人外,还有袋鼠一号设备,两款智能设备可联动配合,完成复杂、长周期的复合型任务,这是具身智能体落地应用的直观展示。目前我们已在多个行业落地实践场景,首先是飞机制造车间的机器狗巡检场景。


  飞机制造车间环境复杂、巡检点位繁多、巡检任务烦琐,往往需要多款不同类型机器人协同完成巡检、问题排查工作,车间内外作业环境差异较大。我们的具身智能体支持即插即用,可适配各类巡检机器人本体,快速适配不同作业场景,独立完成各类专项巡检任务,有效适配飞机制造车间的复杂作业需求。


  第二个是低空经济领域的低空智能体落地实践。我们针对低空专属空间搭建专属世界模型,配套打造防火救灾专项低空智能体。该智能体集成多模态大模型、世界模型、森林防火专属知识库以及多模态技能池Skills,搭载至低空作业系统后,可自主完成物理空间三维建模,构建高逼真3D物理世界场景,所有作业规划、应急处置、空间调度工作,均可在仿真场景中落地执行。


  最后是智慧驾驶领域的实践应用。此前提到,当前世界模型在智能驾驶领域主要用于场景仿真。我们已与上汽、上汽检达成项目合作,聚焦智能驾驶场景认知领域开展技术落地,核心功能是高风险驾驶场景的识别与评估。该项目依托多模态大模型决策技术架构,融合海量驾驶数据、场景理解技能、智慧驾驶专属知识库,搭建智能驾驶场景认知与风险评估系统。

  该系统可实现驾驶关键片段提取、场景精准识别、场景深度理解、风险量化评估四大核心功能。本次落地项目中,我们并未应用世界模型,核心原因是实时性受限。本项目依托智能体搭载的各类视觉Skills技能模型,实现毫秒级实时响应,适配自动驾驶动态场景需求。而世界模型的三维建模、场景推演算力消耗极大,现阶段无法实现毫秒级实时反馈,无法适配自动驾驶实时作业场景。

  现阶段世界模型在智能驾驶领域的核心应用,仅局限于离线场景仿真,通过搭建仿真路况环境,让车辆在虚拟场景中完成驾驶训练、场景学习,优化驾驶Skills技能,暂无法落地实时行车场景。以上就是我今天的全部分享内容,谢谢各位!

  (注:本文根据现场速记整理,未经演讲嘉宾审阅)


特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
1958年毛泽东途经沈阳,邓华设宴招待,毛泽东当面问:怎么不见陶万荣?

1958年毛泽东途经沈阳,邓华设宴招待,毛泽东当面问:怎么不见陶万荣?

微野谈写作
2026-09-12 15:10:03
2026-09-16 16:31:00
行联社
行联社
尽览出行服务大事
1369文章数 234关注度
往期回顾 全部

汽车要闻

方向盘踏板全取消 特斯拉Cybercab国内亮相实拍

头条要闻

8岁孩子名下多出两套房 系母亲"同居男友"为躲债过户

头条要闻

8岁孩子名下多出两套房 系母亲"同居男友"为躲债过户

体育要闻

道曼双响比肩鲁尼 阿森纳轻松晋级却有两人挨骂

娱乐要闻

郭麒麟瘦到全网认不出,为新剧塑形

财经要闻

中际旭创六家供应商股东疑现关联人

科技要闻

赛力斯接管问界,撑得住华为给的身价吗?

态度原创

时尚
艺术
健康
旅游
游戏

条纹打底衫,还是很适合秋天的!

艺术要闻

宝安中心壹方中心整层怎么选 宝安1525㎡参考报价

脑血管里有个“不定时炸弹”?

旅游要闻

三部门发文 事关自驾游出行、房车营地搭建

巫师3重制版要媲美造现代新作体验 不只是简单翻新

无障碍浏览 进入关怀版