网易首页 > 网易号 > 正文 申请入驻

八仙桌谈世界模型:估值涨50倍风口背后,行业还在被数据困住

0
分享至


去年我来参加世界机器人大会(WRC)的时候,当时我们公司的估值只有现在的1/50;就12个月的时间,我们公司的估值涨了50倍。极佳视界联合创始人、首席科学家朱政表示。

今年世界机器人大会(WRC)主论坛第三天,围绕“世界模型到服务人类的现实距离”做了一场圆桌,除了主持人之外,主办方请了八位AI和世界模型公司负责人,我起名了“八仙桌”。

主持人是获聘中国电子学会世界模型专委会主任委员的之江实验室主任、阿里云创始人王坚院士。

八位对话嘉宾分别是:

  • 大晓机器人董事长、商汤科技联合创始人王晓刚,

  • 奥比中光创始人、董事长黄源浩,

  • 无界动力创始人、CEO张玉峰,

  • 跨维智能创始人、CEO贾奎,

  • 智澄AI创始人、CEO胡鲁辉,

  • 飞渡科技联合创始人、总经理宋彬,

  • 蚂蚁灵波科技首席科学家沈宇军,

  • 极佳视界联合创始人、首席科学家朱政

当时我进场晚了一丢丢,但回看整个视频,我觉得这场圆桌很有趣,比之前CEO圆桌更有针对性,而且我们听到了很多世界模型风口之外的一些落地难点。

比如,飞渡科技联合创始人、总经理宋彬讲的比较实在——世界模型之所以叫世界模型,一定是要大、要宏观、要有微观、要能够连续化。

朱政也坦言,世界模型数据这个成本太高了。

“我们之前做过一些实验:大概用了几十万个小时的数据,然后训练一个几十亿参数左右的世界模型,包括一个基模,它的训练成本可能在一亿(元人民币)左右。如果按照这个比例计算的话,假如说我们今年或者明年、甚至说后年,数据量比如说增长到几千万个小时、甚至上亿小时,然后当我们的模型参数量再增长十倍、甚至说增长百倍,那么如果我们不提升样本利用效率的话,这就意味着我们可能要花上千亿来训练一个具身(基模)或者世界模型。”

当然,这场圆桌把行业里做世界模型的一众创业者聚到一起,核心就是聊清楚,现在大火的世界模型,到底跟过去 VLA 这类模仿学习模型差别在哪,以及落地路上绕不开的现实难题。

过去机器人相关模型大多靠大量样本做模仿学习,擅长处理固定不变的场景;而世界模型的核心,是能够预判物理世界后续的状态变化,把理解、生成、预测捏合到一块。嘉宾们普遍认为,它不只是好看的视频生成,更关键是补齐物理智能,再叠加认知能力,才有机会支撑机器人完成复杂的现实任务,不少人也提到,属于具身智能的关键转折点,或许已经离我们不远。

而想要让世界模型真正服务现实世界,光靠模型本身远远不够。现场大家达成的共识是,不能一直困在实验室里,要走到真实场景中迭代。比较可行的路径,是先从工业、商业这类相对可控的场景落地,在实际作业里积累经验,再慢慢向家庭这种复杂环境渗透。同时还要解决安全冗余、人机交互、端侧低功耗部署这些现实约束,不能只追求模型纸面能力有多强,要兼顾真实环境下的稳定性和可靠性。

当然,像跨维这类坚持做合成数据(Sim2Real)方向的,也是世界模型的重要一个部分。

以下为本次论坛对话的全文,部分口语词有一些改变,但基本不改原意的整理:


话题一:世界模型的理解为何天差地别?

王坚(主持人,中国工程院院士、之江实验室主任、阿里云创始人):最近这几年"世界模型"这个词又比较热,所以我想特别从你们自身的经历——你们经历过的,甚至经历过的教训也好、经验也好——谈一谈你们所认识的世界模型,跟现在其他讲的模型有什么不一样的地方?当前有哪些非常有意思的技术路线,值得跟大家分享一下?


王晓刚(大晓机器人董事长、商汤科技联合创始人)其实我们是从 2024 年开始的:2024 年 10 月份,我们发布了开悟世界模型 1.0。

过去几年,我们认为世界模型的应用经历了几个阶段。

第一个阶段,世界模型主要用来做数据增强——我们说举一反三、反一百,对吧,通过世界模型可以生成很多很多各式各样的数据,作为训练数据的补充。

到了第二个阶段,世界模型就可以用来做模拟仿真器,模拟动态世界的动态变化。比如包括端到端自动驾驶,就在世界模型里面通过强化学习不断地自身演进进化。

到第三个阶段,就是今天大家更加期待的 World Action Model(世界动作模型):我们把世界模型直接部署到机器人的中端大脑,让它实时地去驱动本体。

世界模型比起以前的比如 VLA 这样的模型,最大的特点是它能够对世界的未来状态进行生成和预测。

像我们以前在机器人领域、自动驾驶领域看到的 VLA,那些还属于模仿学习,它针对特定的任务、特定的硬件本体,你很难期待它做出智能的涌现。它比较擅长做静态场景,比如我们要抓取一瓶水,当所有环境不发生变化的时候,它去预测这个运动轨迹。而今天我们的世界模型,假设的是我们的世界在交互过程当中也在不断地演化变化,那么我们在一边执行动作的过程当中,一边对各种平行空间里未来可能产生的各种后果做出推理和演绎、做出判断。


今天我们的世界模型,应该具备我们说的理解、生成、预测一体化:一个模型能够对复杂的任务进行拆解,能够判断我们执行的效果是成功还是失败、完成度是多少——这是理解;生成,是对未来世界的状态进行生成和演绎;预测,就是要能够控制我们的本体的动作——这三种能力共享特征。

黄源浩(奥比中光科技集团股份有限公司创始人、董事长):讲世界模型,一般都是跟大语言模型相对的。2022年底ChatGPT出来之后,大家都知道大语言模型效果特别好;然后过了一阵,2023、2024 年逐步有人讲空间智能、讲世界模型,这个时候我就特别兴奋。

因为这个大语言模型只能与人交互,而世界模型能够让机器人、具身智能真正地帮人类干活,解放的是80亿人类的劳动力,让人类能够去做更多(有价值的事)。大家都在说,原来的 GPT 只能"远方不能实地干活"嘛,世界模型就是解决这个问题的。在座的都是世界模型的专家老师,我们是做数据的——视觉数据,然后我们也联合很多触觉数据公司,把数据做到毫秒级硬件同步的级别,给世界模型训练提供一个很好的养料。近几年也看到这个世界模型,从 VLA、VLA 到世界模型的生成,逐步在转向,逐步有点意思。甚至我们预测,这个世界模型跟具身智能的 GPT 时刻可能很快要到来,所以非常兴奋。而且这个市场,往往比 GPT 这种数字智能——具身智能比数字智能的市场可能要大五倍十倍,所以现在非常兴奋。所以我们卖铲子的就不多说,听听其他的模型专家多说一点。

王坚:源浩,听你的口音是潮汕人,是吧?

黄源浩:对。

王坚:这个别人再说,潮汕人对中国的AI贡献还是很大的。所以你刚才讲"具身智能的GPT 时刻",我们是不是能够把它改成"具身智能的 DeepSeek 时刻"。

张玉峰(无界动力创始人、CEO):我以前在地平线做智能驾驶和智能驾驶芯片。快速谈一下我对于世界模型的理解和一些分享。

其实世界模型这个概念存在很久了,对于未来状态的预测,本身它就是一个泛世界模型。我的联合创始人、CTO夏正武老师 2011 年在中国科学院自动化所读博士的时候,研究的就是 model-based reinforcement learning——基于模型的强化学习,它本身就是世界模型的雏形。


只不过那个时候比 AlphaGo 打败世界围棋冠军(2016年)还早了几年,那会儿的同学们还都在愁强化学习找工作怎么办。

这些年,强化学习火了,世界模型更火了。从大家的研究研发、还有场景落地的需求来讲,也看到了面向具身智能已有的一些范式带来的挑战:其实 VLA 也好,或者其他本质上基于模仿学习的范式,追求的还是数据量足够大、分布足够好的情况下的一种概率分布和"肌肉记忆"。而对物理世界底层逻辑的理解、对关键信息的提炼,由此带来的比较好的泛化——few-shot、one-shot、zero-shot 这种涌现——一直没有看到。当然数据稀缺也是一方面,但范式本身(也有局限)。在人工智能三要素——数据、算法、算力——里这也是分不开的。所以现在世界模型给大家带来的,是重新聚焦在这个概念上,希望突破以模仿学习为底层逻辑的范式的限制。

刚才王老师也讲到世界模型有几种分类,其实李飞飞老师前段时间也讲可能有三类:Render(渲染)、Simulator(仿真)还有 Planner(决策)。

对于具身智能来讲,核心是像人一样:在以自身动作为条件的情况下,去预测这个世界的下一个状态;或者为达到某个目的,我们到底该采取什么行动。这是人还有一些其他哺乳动物与生俱来的能力。

其实我们的理念也是这样的:这个能力是我们现在具身大脑要去学到的最主要能力。我们本身不需要去学习、也很难学习到对一个物理世界从可见光到底层原子的各个维度复杂真实的模拟——短时间内很难做到,就像天气预报在未来几年可能依然很不准。

但是人依赖自己"大致正确"的世界模型,就已经能够完成很多的任务。那我们觉得具身智能应该聚焦在这个层面。聚焦这个层面也意味着我们无界动力坚持的路线是空间世界模型——这也就意味着,很多的计算不是发生在像素层面的,而是要让模型学到高维的空间表征,让它能够更高效地去推理、去关联这些时空的因果关系。

贾奎(跨维智能创始人、CEO)我们其实这一波 AI 的热潮,基本上从 2017、2018 年 Transformer 之后:我们到大语言模型,到图像生成,到视频生成,到 3D 生成,到我们现在聊的世界模型。


那么世界模型其实是整个这六、七年生成式 AI 的——至少到目前为止我认为是一个最高潮。

因为我们能够生成语言、能够生成视频、能够生成 3D,那么世界模型,无论是从预测下一个状态还是从生成的角度,其实是希望能够完全生成符合三维物理、几何绝对正确的这样一个世界。从这个角度讲,世界模型是生成式 AI 皇冠上的明珠。

那么从这样的诉求的角度讲——因为我们从广义上来讲,无论是你生成视频、生成 3D,还是生成完全几何物理真实的世界,都可以叫世界模型——我们跨维智能尤其比较关注的是:你要能够生成三维物理、几何绝对正确的、可交互的动态环境。

从这个角度讲,我们是希望世界模型的隐空间的 token,是要能够定义在正确的时空节点上。这样你才能真正生成出来不仅仅是机器人的例如末端的正确轨迹和任务,并且你还能预测出:你的机器人也好、其他物理智能体也好,对这个环境发生动态的改变以后,环境怎么正确地变化。所以世界模型简单说,它相比无论大语言模型、视频语言模型还是 VLA,上限要高得多,当然它对数据的诉求也非常大。那么我们也是期望在接下来不管是五年还是十年,世界模型能够有更大的发展。

胡鲁辉(智澄AI创始人、首席执行官):大家好,我是来自杭州的智橙AI。我们公司以通用人工智能作为愿景,我们也很自豪(很早就投入)世界模型,我们把物理智能、世界模型作为我们公司的一个核心技术,也可以说是机器人能力的一个核心技术。


其实说世界模型,因为最近比较火嘛,应该是从今年开始。我的感觉是,它作为一个技术,可能也是通用智能里的一个核心关键。记得最近这一波通用智能应该也就是十几年,从 AlexNet 开始,到 AlphaGo,然后 Transformer、到 GPT,都是现象级的。

那么我们说下一个(现象级)是什么?我觉得很有可能就是世界模型。因为它本身要解决的问题,跟通用智能下面要解决的问题可能是差不多的。

我们已经经历了 CV 时代,或者说多模态大模型时代,也看到了智能涌现、泛化性这方面的事情,那么下个问题,我觉得通用智能可能要解决的就是理解物理世界——"理解"可能是个核心。这里头其实也是通用智能本身要解决的问题,那么世界模型可能是个很好的技术,能够帮助我们解决(无论是)虚拟世界里头也好、物理世界里头也好的理解问题。这也就是为什么出现了世界模型。

那我原来的背景是Meta,我们公司用的是JEPA的技术路线,也就是(杨立昆)那条路线的,相信这个世界模型能够在通用智能的能力里头起到刚才说的 AlexNet、Transformer 这种颠覆性的影响。当然大家也介绍很多了,它各个方面——渲染、仿真、规划——其实我觉得核心一点还是:怎么能够让人工智能理解物理世界,可能是世界模型要解决的问题。简单分享一下。

宋彬(北京飞渡科技股份有限公司联合创始人、总经理)飞渡科技主要是做空间智能这个方向,同时也是做数字孪生这个方向的,所以今天聊到世界模型也很高兴。


之前我们也聊过数字孪生,也聊过数字原生,也聊过元宇宙,突然聊世界模型。这个世界模型,我们自己这几年也总结了一下,包括也看到咱们贾教授有些文章、杨立昆教授的文章、李飞飞(的说法),大体大家可以分为七个流派:

有些是基于像素的视频生成;有些是基于物理 AI 的角度;也有基于联合的这种方式;还有最新抛出来的基于因果的,还有基于循环因果的——就是Loop这个方法,最新应该是 2026 年提出来的。我们看完这些之后发现一些共性。

第一个共性:我们让 AI、让具身智能、让机器人首先具备快速理解这个世界的能力,以及生成任务的能力——至于说你生成的这个能力让它理解到几何多少精度、力度多少,这基于我们场景的驱动。

第二个能力,在于它们要具备模拟、仿真还有推演的能力。这里面必然涉及一种能力,就是物理的常识。物理常识是其他大模型比较缺乏的一种能力,因为过去我们看到更多是一种数据拟合得到的方法,而物理常识显然是我们过去在做工业工程里面特别需要的能力。还有一个在于对空间结构、对时空突破的一种理解和推演的能力。

第三个很显然就是因果。因为我们做(数字孪生)这个方向,因果有时候我们需要的是强因果关系。后来我们开始做 AI 的时候,发现它很多是基于统计学习的方法——我们看很多是黑盒,但我们要白盒、要(可解释的)神经网络、要因果推理。所以因果这种能力,各个流派大家都往这个方向努力,只不过走的路径不一样。

就像飞渡,我们走的是站在时空的拓扑空间语义的角度,建立我们的本体、建立我们的语义,来构建它整个的底座。再下来第三个能力,就是我们说的规划,以及我们在物理世界上的任务执行的能力。

所以我个人看了这七大流派之后,总结了这几个能力。

最后我后来想了想,这种能力,对比我们是具身智能机器人也好,就好比我们说的九年义务教育:小学初中这九年,就是把我们这个人培养出对物理的常识、对社会的伦理、对道德等等的具备;上到初中之后,就开始特殊的训练,有些进入了职高,有些进入了高中,有些进入了其他方向。我把这个世界模型的底座能力,理解为它还有泛化很强的一种通用能力。以上就是我对世界模型的理解。

沈宇军(蚂蚁灵波科技首席科学家):感谢王院士。我是来自蚂蚁灵波科技的沈宇军。

蚂蚁灵波是一家给机器人做大脑的公司,说白了,我们还是希望通过一些 AI 的能力、一些模型的能力,让机器人能够在这个世界上真正地服务好人类,把动作做得更完美,这是我们的目标。


前几位老师对世界模型表达了一些比较生动、比较形象的看法,我在这里面关于世界模型就想说两个点。

第一个点是,非常开心能够看到大家逐渐开始意识到视频这个模态对于人工智能的重要性。因为机器人在现实生活中干活是离不开 dynamics(动态)的,不管是突发状况也好,还是整个交互过程中也好,其实更多是动态的建模。我觉得在视频这个方向上,可能对这个方面会有比较大的提升,这可能也是跟之前很多 AI 模型不太一样的地方。

第二个点我想说的是,世界模型大家都知道比较火,潜力也比较大,但是可能从灵波的视角来看,我们更关注的是这个模型的发展是不是真的对机器人操作会有真实的帮助。

如果第二点没有办法证明的话,其实我觉得我们前面对这个视频、对这个时序的建模可能做得再好,也是在空中楼阁。所以好处是大家现在开始意识到视频的重要性了,未来的目标我们就是想证明:对视频有更好的理解,是不是真的能够更好地帮助机器人干活。我就说这两点。

朱政(极佳视界联合创始人、首席科学家):我是来自极佳世界的朱政。各位嘉宾知道极佳世界,可能因为我们的主要标签就是世界模型。我们公司大概是 2023 年年初成立的,到现在已经三年半的时间了。

这三年半的时间里,其实我们感触是非常深刻的。2023 年我们刚成立的时候,其实是语言模型最火的时候:大家不管做垂类场景的语言模型,还是做通用语言模型的预训练,都非常的火热。


我记得因为我在公司主要负责技术这一块,我当时需要花费非常多的精力给各种投资人去讲解究竟什么是世界模型。然后投资人的反应都非常一致,他们的反应是:你们是一个非常优秀的团队,假如你们愿意去做语言模型的话,我一定会投你们,但是我实在搞不懂究竟什么是世界模型。

当然经过这三年的发展,到了大概去年的时候,情况已经有很多的改观:已经有很多投资人主动找上我们,因为他们内部在立各种项目,要在中国找一些世界模型的标的公司,要专门投世界模型的公司。

可以给大家举一个奇怪的例子:去年的这个时候我来参加 WRC 的时候,当时我们公司的估值只有现在的1/50;就十二个月的时间,我们公司的估值涨了五十倍。所以非常得益于大家对于世界模型的关注。

其实这三年以来,我们做了非常多垂类场景的世界模型,包括自动驾驶的世界模型、具身(智能)的世界模型,以及我们现在正在做的内容影视的世界模型。

现在我们其实在做的一件事情是,从理论方法层面、数据层面、还有训练模型层面,把这些垂类场景的世界模型给统一起来,做一个所谓的通用的世界模型。我们希望中的通用世界模型,可能不仅仅是应用于这样的一些短剧的生成,或者说是具身(智能)训练的基模——我们希望它可以更加纯粹地去预测未来世界的物理状态,而不仅仅局限于隐空间 RGB 的(预测),或者是比较隐晦的 latent 空间(的预测)。

当然,最近我们正在探索,因为我们发现这件事情可能靠我们一家创业公司是没有办法完成的,所以很多时候需要学术界、工业界,包括投资界的大家的共同努力。

然后再汇报一下:我们在今年年初也牵头成立了一个通用世界模型的(联合)实验室。得知王院士要在中国电子学会的领导下组建这个专委会,我们也是非常积极地报名参加,希望能在专委会的领导之下结交更多的朋友,让世界模型早日像语言模型一样,真正可以做到通用场景的泛化。谢谢。


话题二、世界模型真正服务人类应具备哪些核心能力?

王坚:其实刚才宇军在谈的时候就讲到了关于服务人类的事情,所以我觉得,对机器人很有意思的一件事是:一谈机器人大家就会谈到人形机器人,人形机器人自然而然好像跟人就比较接近一点。

但是我们今天有一个最基本的问题:如果这个世界模型要真的服务人类,那它今天应该具备哪些最核心的能力?我们今天离这个目标还有多远?

王晓刚:谢谢。我们认为,具身的世界模型实际上应该具备三个核心能力。第一个我们叫生成式智能,因为世界模型的核心就是能够生成对未来世界的推演和预测——这里面无论是视频的生成,还是对未来隐变量的生成。

但是刚才像宇军也说了,你光生成漂亮的视频、像素级的美观,这还不能够完成跟物理世界的交互。那么缺的就是第二个能力,我们叫做物理智能:这里面包括空间智能、空间的能力,以及我们认识的、跟物理操作的物体的物理规律、物理属性是什么样的,包括一些空间的记忆。

第三个能力,我认为是认知智能:我们今天在具身(智能)里面做的还是一些比较tabletop(桌面级)的、比较简单的动作,但未来我们进入更复杂的场景、进入家庭很长程复杂的任务,怎么进行长程复杂的任务分解?怎么对我们今天动作执行的状态进行一个判断?这需要认知的能力。

所以这里面,我觉得非常急缺的可能就是中间的这个物理智能。因为前面像我们之前在视频生成,包括今天的大语言模型、多模态模型,对于认知智能和生成方面的能力都是有一定的积累的。

另外,我们从实验当中也发现,其实我们的物理智能——对空间的物理规律、物理因果的理解——(目前)主要还是从视频生成这个分支里得到的(世界模型有两个分支:一方面预测动作,另一方面生成视频)。

但是为什么有时候我漂亮的视频并不意味着我学到了物理规律呢?第一个,我们今天学的好多视频不是真实的视频,是电影特效、科幻的视频;而且我们非常缺的是在工作当中的第一视角交互的视频。另外除了视频本身以外,我们还有相机的位置几何的信息、物理的属性,还有多视角的摄像等等这一系列——只有综合起来,才能把物理智能学好。


黄源浩:我觉得一方面模型需要不断地进化,但另外一方面数据是特别重要的。其实世界模型也有很多个类别,能力都得好。

所以我觉得需要做的事情还蛮多的:从模型到数据到本体的执行,这都要不断地进步。但是现在也已经有一些可以落地的:先从这个最需要的方向、最贵的、最人类不愿意干的活开始落地,然后后面泛化性好了、智能高了,再往更多的场景去渗透。所以现在应该说是,未来在不断落地,然后模型不断迭代,包括传感器、手、脑的迭代过程中越来越好。所以数据、模型跟本体都要好。

张玉峰:其实基本上刚才两位嘉宾都讲得非常好,一些最基础的能力,世界模型要能学到才能真正的服务人类:对于物理世界底层逻辑的理解、长程任务能够完成,以及场景泛化才能支持。

那其实这几个维度,也是我们做物理 AI 的时候智能提升的核心维度。这里背后有训练方法、数据,也包括模型大小,还有其实(另外一个问题是)我们用什么样的场景来牵引——现在具身智能、世界模型处在那样一个早期阶段,能够在实际场景中得到持续的进化,如果它不走出实验室的话,不产生实际的数据的回传的话,这个正向的螺旋上升的效果起不来,那它很难真正达到服务人类的标准。

所以我们现在总体思路是说:用工业来练——当然也不是所有工业的方方面面,用我们选定的一些工业场景去练技能、练世界模型的技能,让它在一些有商业价值、有复制性的场景下,传统工业自动化不太容易做的情况下,这种任务上能够去做技能学习,也能做出价值创造。

比如说我们面向安全带织布、柔性物体的一些操作,其实是传统工业自动化很难做到的,但是我们用这个基于模型、基于端到端、基于世界模型的方法,就能够去预测、能够去快速地响应被操作物体的形变,进而比较好地完成一个相对复杂的任务。

在商业场景去练泛化,因为商业场景体现得比较多的特质是:光线、背景,如果是咖啡、快餐连锁店,哪怕装修的风格是类似的,每个店的布局、一些细节也是不同的,但做的任务相对具象。在这种情况下,我们就可以非常好地去聚焦说:背景再怎么变、顾客的人来人往再是什么样子,我们都可以把事情做好。

进家庭,其实现在是比较有挑战的,因为它把几个挑战的维度全放在一起了。所以我们觉得在未来的一两年,我们用工业练技能、商业练泛化,让世界模型在这个过程中得到有效的进化和能力的提升。

在这之外的话,其实就是说安全、与人共生——人机共生是今年 WRC 的主题之一。安全性怎么保障?其实我们在做 L4 的自动驾驶的时候,哪怕 L2+ 的时候,模型端到端和一个额外的安全机制、冗余机制的并存,也是非常关键的。

所以这一点我想也是:我们真正能够服务人的时候,只靠一个大的模型、没有额外的安全机制,那可能也是不够的。最后一点是,我们原本计划是让世界模型让机器人闷声地干好活,后来发现但凡人机共生的时候,语言交互能力还是非常关键的,还是要有一个非常好的交互能力。以及人怎么能够——模型如何能够慢慢地把人的一些视角,不是那种遥操作视角,而是类似于大人老师教学生、大人教小孩子一样——(把人类视角)要么作为上下文、要么作为其他途径,让机器人也能够在实际场景下得到学习。

昨天(8月21日)某具身智能头部公司(Generist AI)发布了 Gen 1.5,它也展示了一些初步的 one-shot learning 的能力:通过人类的一些简单的示教,可以做到在一些简单任务上 60% 左右的成功率。那我想,这就是我们让最终世界模型能够服务人类之前,需要努力的方向。谢谢。

贾奎:好的。我们这个环节的命题是"世界模型怎么能够服务人类"。那么人的话,其实简单说可能有两种诉求:

一方面人需要情绪价值,希望有好的内容让人能够享用;

另一方面人总要吃饭,人希望机器人能给自己把活都干。所以从这个角度讲,人有这么两个大的方面的需求。

那么世界模型,或者说我们 AI 本身在长期的研究里面,就有两个方向的研究:一个是感知理解,另一个就是重建生成。那么(对于)重建生成,

我们也希望,如果我们能够有一个大一统的模型的话,这个世界模型是可以去生成完全跟我们的世界一样的这样的内容的创作:这样一个完全三维、几何物理正确的世界,我们把它投影到文本上,实际上就是语言的生成;把它投影到不同视角、或者任何一个视角的镜像的话,它其实就是图片或者视频。

另一方面,我们也希望用这样的世界模型去驱动机器人,把人从劳动中解放出来。所以我们也希望世界模型能够去感知、去理解,然后去驱动机器人或者其他的物理智能体。

就跟刚才我聊到的一样,其实我们对于世界模型的理解,是它是整个 AI 的一个大一统的重器。因为只要你能够感知理解、生成完全正确的一个世界,那么你既可以给人类创作好的内容供人享用,你也可以去驱动机器人也好、其他的智能体也好——就像刚才我们几位嘉宾说到的,不论是把人从工厂里这些重复性的劳动中解放出来,还是说在家庭里面能够理解人的意图、知道不同的对象该怎么操作,然后真的帮人把这活给干了。

那么从科学的角度讲,世界模型其实也是整个 AI、机器学习、统计学,也许是接下来至少十年的一个长期的、真正的统一的学术诉求。

胡鲁辉:刚才王院士是问世界模型的应用和(通用)机器人的关系。我觉得世界模型应该有两大应用:一个在数字空间里头,还有就是在物理世界里头。

数字空间呢,其实刚才也提到了,一般就是三维空间,或者说问答——大家可能也知道杨立昆的 JEPA 有一个很大应用就是问答,这从模式上跟语言大模型有类似的关系。

不过怎么样,我想世界模型在数字空间里头,有可能会更深层次地跟语言模型或者说多模态大模型(形成)一个升级,因为世界模型核心要解决的是理解的问题,而多模态大模型可能还是缺乏这个(能力)。还有一个很大的应用就是物理世界里头,这也就说到(通用)机器人的关系,包括我们公司做的事情,就是让通用人工智能赋能到物理世界,就是说世界模型跟机器人结合起来。

我们觉得机器人是让通用智能闭环、或者说落地的最好场景之一。

这里头可能有很多问题和挑战。我觉得其实也可以围绕世界模型本身要解决的核心问题、或者说通用智能本身要解决的核心问题来看。刚才提到理解物理世界,其实“理解”这两个字我个人觉得很抽象——你说什么是理解?

那么理解,我们从(几个层面)来看:一个是我们对 physical(物理)、对 dynamics(动力学)的理解;我们对物理世界的交互、对任务、对规划的理解。

这某种程度上也就是世界模型在人形机器人里头应用起来的核心关键。

还有一个很重要的方面,就是世界模型比较重要的因果关系:我们怎么预测下一个时空、怎么让机器人做下一个动作,或者说机器人看到这种环境以后我们应该怎么来做。

这里头有一系列问题,我个人觉得(核心)是刚才说的 physical 和 dynamics,然后通过因果关系来做推理。那么在这种情况下,我觉得很有可能世界模型可以帮助之前的强化学习也好、VLA 也好(所)不能很好解决的(人形)机器人里头的一些事情。

我们公司其实最早的时候,因为愿景比较远大——通用泛化的通用智能机器人——但期间还是比较聚焦一些场景,就是能够让世界模型或者说机器人快速落地的场景。我们最早一个(落地场景)是家用里的一个场景。我们现在大家可能看到家用也好、工业也好、或者一些特殊场景,一般我们觉得刚需或者说能够落住的地方,可能是智能机器人最快落地的场景。但是我们分析下来,(各场景)做的任务其实差不多,没有说家里可能更难一点——有可能它更复杂一点、环境变化更多一点,但也没见得它比工业或者比一些特殊场景简单多少或复杂多少。

核心关键,我觉得是家用它不仅仅是完成一个任务,它涉及到安全、隐私或者说能力方面,不是简单完成一个任务、一个事情。这也就是我们怎么把人工智能或者世界模型跟物理世界所结合起来的事情,因为这里头它跟人类有更直接的交互。所以我觉得世界模型如果说作为 AI 3.0、AI 4.0 的话,很有可能就是怎么能解决安全、隐私、能力这方面的问题。这可能也是个技术问题。

大家可能觉得这是个法律法规(问题),因为我当时在 Meta 的时候,当时有一个隐私(事件),欧盟对 Meta 的一个隐私罚款——50 亿罚款。很多人觉得我把规范做好就可以了,但其实 Meta 的理念不是这样,它是通过技术、人工智能方法来解决这些问题。所以我觉得世界模型的未来、或者说世界模型真正能够落地,这些环节可能少不了。

如果没有一些好的技术能够让世界模型的技术更好地跟人交互的话,那么像安全性、隐私性(的解决)可能少不了。

宋斌:服务人类,其实刚好这段时间我刷到一个东西。既然讲服务于人类,就要讲人类的需求层次的问题。刚好看到咱们(视频平台)里面经常有一些短剧,当时我在想,这个短剧挺吸引人的,我说如果是基于世界模型来做这个短剧行不行呢?我觉得应该是可以。因为我们本来就是做这方面技术的,如果换成我们来做,应该也能快速地基于世界模型的能力生成一个短剧。

这个短剧很有可能就能够让大家来买单——因为说实话,看那个短剧我还真的买了单了。如果用世界模型来做,那果然商业肯定也就是买单的。比如说我们的很多需求是这种消费级的需求,其实我认为现在我们已有一部分场景,真的就是世界模型在做一些商业化(落地)。这是第一个。

第二个,我想得更多的,是面向人类的这种功能性的需求——就是我们为了工作,比如产业级或者工业级这种需求的时候,那我说世界模型它到底离这个目标还有多远?

我刚刚看到咱们那个(开场)视频,我觉得挺好,有一句话大家听到没有——"再试一次,再试一次,再来一次",我听得很激励,也很热血。

后来我在想,如果这句话是我们的客户跟我们说的,那该多好啊:"再给我一个机会,再让我试一次",那我觉得这是我遇到的最好的客户。很遗憾,我们很多客户是 2B 的、2G 的,是工业级场景、工程的场景。那么他们的需求是什么呢?要的是可确定性、可靠性,要一定的准确率,而是在一个长时序里面的一种稳定性、确定性的输出。

那我想今天我们说这七大流派也好、几大流派也好,是否都能做到这一点呢?很显然,在我看来,在我们过去的工作来看,确实很难。

就说物理 AI 这个事,你说现在单场的物理 AI 准确(率)能做多少?那么现在如果换到世界模型要做泛化——如果说泛化符合真实物理场景,一定是多场的物理场的耦合求解,并且你还得保证长时序的稳定性输出、保证一定的准确率,就这么一件事,我估计我们还得攻克很多年。

其实刚刚第二位演讲者讲了很多四大问题,我看了一下,有些问题总结还是不错的,其实就是现实当中我们在工业上所遇到的问题。还有一个问题是什么呢?就是开放式的环境。昨天我看到一个机器人跑着跑着,跑一个直线居然撞墙了。我说它为什么能撞墙呢?说明什么道理?说明它在开放式的环境里,对我们空间的本体和主体、以及空间结构和时空拓扑的理解和推演的能力不够。

那你说这个东西有没有(能力做)?有,但是(第一)他是在机器人端上,我们的计算能力不够;第二个,这种时空语义的解析的成本过高;第三个问题就是说,我们的 ROI 不合理,所以导致了很难去普及。

这就是我们飞渡为什么一直在追求它的 ROI 是合理的,否则的话很难普及,当然还包括很多问题。

但是有一点:今天的 AI 包括很多方法能出来,包括我们自己的(实践),又做了很多,确实比我们过去在研究一个问题的时候,整个解决问题的效率和准确率是倍增的。过去一个问题要三年,基于这套体系来做(仿真)也好、什么方法来做也好,我们整个有可能会倍增。也就是说,我们的目标有多远?我觉得它可能会有一个类似摩尔定律的逻辑来看待这个事,有可能是两年三年,有可能是五年。

那么第二个,就讲到很多风险、安全的问题。

其实我刚刚比较认同前面说得很好的。不管怎么样,第一,机器人不管 AI 也好,访问数据、本体的时候一定有隔离层,这是我们过去在做企业级应用里面一直遵循的。因为我的客户经常跟我们说——安全、安全、安全,一周的三次会都在讲安全。

确实如此。我认为一定要有一个隔离机制,因此我比较推崇的是基于本体语义这个角度来做隔离层。

第二个,要有熔断机制。当然这个话题,今天我也不是专门研究安全,很难展开,但是我认为我们所有从事世界模型、具身智能还是包括别的方面(的人),在这个事情上确实要多考虑一分。那么可能未来这个世界模型真的能够更好地为人类提供安全、可靠、舒适的服务。

沈宇军:刚才王院士提出这个问题的时候,其实我脑海里一直在想一个事情。因为如果我们现在要聊的这个事情是以机器人为载体的时候,我觉得可能 AI 能够服务人类会提出一个比较新的挑战。

因为机器人这个载体,跟之前 AI 服务人类所有的载体,比如说云计算也好,再比如说自动驾驶的车也好,有一个比较大的问题,就是机器人本身不能是一个功耗太高的东西。然后在功耗要求比较低的时候,我们如果一边想要追求智能的上限,一边又想要保持一个低功耗,我感觉这个中间可能是一个很难去平衡的点。我觉得可能在我的视角看,这可能是未来不管是什么样的模型,真的想要在机器人上更好地服务人类,可能会一定会遇到的一个问题。

因为大家都知道,现在的 AI 范式其实还是计算,基本上就是大数据碰上了大算力,然后才有了现在这一代的 AI 范式。

那我们需要的智能越高,可能需要的数据就越多;数据越多,可能模型的参数量就越大;参数量越大,推理的时候可能消耗的计算资源就更多。但是因为机器人本身它是不能够不断地给自己发电的,它跟车不一样,车可以边开边发电,机器人那可能是不行。

那在这一点上,可能由于这个边缘部署的问题,会限制它算力的发挥。那么如何能够更高效地让这个计算发挥出它的价值。

也就是说,在智能的上限和部署的低功耗限制之间如何做好一个平衡,我感觉这个可能是真的有一天我们期待机器人能够服务人类的时候,一定要解决的一个问题。

朱政:因为王院士这个问题,其实我非常赞同刚才各位嘉宾的想法。这里边我觉得,世界模型距离真正能服务人类,现在可能一个最大的短板,仍然是模型的能力。

当然虽然也有很多其他的问题,比如说机器人的本体、机器人的功耗、电池等等,但是模型能力现在仍然是一个比较大的短板。当然,模型能力的提升需要各方面共同的努力。

第一个问题,就是知识从哪里来?当然显然知识应该从数据里面来。这里面比如说,我们训一个具身基模,或者训一个具身的世界模型,我们用的大部分数据还是这种无标注的视频数据,或者带 Action 标注的视频数据,它和文本数据有非常本质的区别。

因为大家的文本数据里面天然就蕴含了丰富的知识,所以说我们不会讨论知识的问题;但是视频数据、包括带 Action 标注的视频数据,我怎么给它增加更多的知识?比如说今年比较火的Ego的数据,包括去年比较火的UMI的数据,里面蕴含的知识可能比之前的遥操作(数据)要丰富一些,当然它所含的噪音也会更大一些。我们怎么把这种不同表现形式的知识给组织起来,这是一个比较重要的问题。

然后第二步,我们有了这些知识之后,怎么把这些知识交给我们的模型?因为现在大家都知道,不管是世界模型还是具身基模,其实我们的模型参数容量还是非常小的,相比较语言模型或者相比较(其他)多模态模型,大概参数量可能只有它们的十分之一,甚至说是百分之一。

虽然说我们世界模型要完成任务的解空间可能会比语言模型要小一些,但是我觉得,这里边第一步我们还是要把模型容量足够做大。

我们第一步要把大模型给做出来之后,有很多方法可以把模型做小。然后这是第二点。然后当然就是,一个只经过预训练的模型显然是不能很好地在物理世界里边运转的。这个其实现代语言模型已经给我们一个比较好的示范,就是在执行任务的时候做所谓的自进化(self-evolving):我们需要在不停地跟物理世界交互里边,去学一些不管是家庭还是工业场景的特定知识,然后来不断地增强模型。


话题三、高质量数据会不会成为企业成本障碍

王坚:其实刚才大家讨论里边已经谈到了一个很关键的问题,就是关于数据的问题。

大家都知道这一次的人工智能的变革,是极大地依赖于数据来源的,那我觉得世界模型就更加(如此)了,但世界模型里边还有一个很大的挑战,就是它跟物理规律之间的关系。

这里面很有意思的事情是:在我们现实里边,有的假的东西让大家看起来像真的,但是有些真的符合物理规律的,看起来又像假的。所以其实数据是一个非常非常挑战的事情。

但大家都知道数据的成本,其实语言数据的成本都是很高的,那对你们就更加了。所以这个东西会不会成为创新企业的一个不可逾越的成本障碍?有没有机会真的大家共建把它做好?

王晓刚:其实我觉得这是具身(智能)和大语言模型一个非常重要的差别。大语言模型的数据可能来自互联网,有些互联网企业在这里面具有天然的优势;另外,基本上有些语言模型公司它没有数据,也能从公开的渠道获取这些数据。

但今天我们具身的数据,说实话,尤其是真人操作的数据,历史上积累是零。那这些数据从哪来呢?我们的实践里面告诉我们,它得从一些真实的生产生活环境中采集而来。我们自己也实验过:如果你是建一个实验室,雇一些采集员,给他编好一些剧本,让他不停地去执行这些动作的话,其实对我们最终训练的效果是非常有限的,而且是比较差的,因为这种里面学习的模式比较单一。

我们真正需要的就是 in the world(真实世界)的数据,这里面越自然越好。那这里面我们又不可能雇佣很多的数据采集员去做这件事,所以这里就要跟场景方有一个深入的合作。

就是像我们这种制造业、零售行业、酒店行业,在全国有成千上万的工人,把他们动员起来,能够实现这些数据一个快速的积累。

而且我们这里面也通过前面的实践,实际上是逐渐看到了 scaling law:当你从这种 in the world 的数据里采集的数据量逐渐增加的时候,你未来这个基模型越来越强,对于真机的依赖是越来越小。

可能以前是我需要上百个小时去教会一个本体做某项技能,现在可能是几个小时就可以会了。我觉得可能将来也许更少,也许就不需要真机的数据。那这里面也对我们的数据采集的质量,包括里面的标注提出了很多的要求。像我们可以把这些数据分若干等级:比如说我们是头戴一个第一视角的单目或者双目的运动相机,在一些比较单一的场景里面采集出原始视频,这些也能用,但是我们就可以观察到,随着它的规模的增大,它给智能提供的上限其实是比较低的。

另外呢,如果我们身上戴的传感器是比较多的,多摄像头的协同,包括我们加上一些力触觉的手套,在采集的场景里面更加 diversify(多样化),而且采集的时候不但是有成功的,还把很多失败的例子也采集进来,这些数据的价值就非常高。

今天我们看到这个市场上不同类型的数据,可能是从几十块钱到一千块钱左右,实际上也是市场上就给它了这样的一个定位。但是 anyway,我觉得今天今年大家能够看到,其实是我们这个行业对从真实场景里面(采)的数据有一个迫切的需求,市场也格外的繁荣,而且也给了我们一些传统行业——刚才提到的制造业、零售这些行业的巨头——一个非常好的契机:他们知道他们的场景是有价值的,他们想进入这个具身领域,一个很好的切入点就是从数据这里开始。

但是这里面的关键是,我们要能够快速迭代,这里面所谓的技术壁垒,我觉得在这个过程中,更多的是要跟我们现有的传统行业的头部企业去合作,能够一起去建立这种行业里面的专有数据集。

黄源浩:数字智能是大算力跟大数据催生的:大算力来自英伟达,现在有越来越多的算力提供方;大数据是互联网本来就有非常多数据。

那具身智能现在刚才大家说的,数据是很多零,那怎么办呢?政策(性)遥操作质量非常高,(但)成本更高。然后具身智能的数据最重要还是来自于跟人学习,把人的技能都给拿到。那数据最近特别火,就像我们公司现在,大家就是要来买这种各种采数据的设备,而且都着急,非常着急。因为有了数据,模型就迭代快;因为迭代快,它(就赢了)——这个模型跟数据的飞轮是赢者通吃的一个市场,你第三名以外可能没太大用了。所以数据目前是非常非常重要。但是现在也看到一个问题,就是数据的质量参差不齐,然后数据标准也不统一。

那究竟我们要什么样的数据?其实我们要跟人学习,无非是现在两个:

一个是locomotion(移动),现在其实已经做得挺好了,强化学习(训练)就可以了;

另外一个就是manipulation(操作),就是我们拧螺丝啊、钉钉子啊、FPC(柔性电路板)啊这种灵巧的操作,目前这个数据基本上非常少,而机器人是最需要这些数据的。那这些数据,现在开始有人用视频,后面有人用第一视角,然后第一视角之后发现只有视频还没有触觉,所以就加了触觉手套。手套现在也还不太成熟,所有的很多手套公司都跟我们在合作,手套现在还不太成熟。

所以这里边数据(还有问题),而且数据的同步性(有问题):我这个眼睛(看到)的数据是这个时刻,那手套的数据可能差个 15 个毫秒,那这已经不对了。而且力的精度(不够),力也没有测滑的力。所以我觉得这个行业目前,具身智能数据跟模型的这种数据飞轮的转动是最重要的。

最重要的、最大量的数据应该——除了互联网,那就是真人数采。真人数采加上后面的强化学习,有那么多场景、有那么多人可以采数据,但是需要有一套设备、一套标准。

比如说同步要做到什么样的一个同步,然后包括我不同机器人或者不同素材源拿到的数据能不能复用:我采的数据可能这个 FOV(视场角)是 160 度,晓刚老师用的机器人可能是 120 度,那能不能用?所以这一点要有标准。

标准呢,就是说要做到3D——刚才各位老师讲的空间智能,就要做到 3D 的空间(一致)的数据,然后你可以从视场角放大缩小都可以,可以从第一视角看、第三视角看都可以,然后(知道)在空间里边(手)在哪个姿态、哪个位置,力是多少,物体(被)操作的时候是什么状态。

只有把数据完整地记录下来,然后这些数据才可复用、才可跨本体复用、跨模型复用,然后数据成本才会降下来。所以我觉得现在数据很重要,数据标准更重要。

那目前可能定化标准有时候还做不到,但是我们能做到八成,先做到八成、做到九成,就慢慢增加了。我期待王院士来挑这个头。

张玉峰好。那个,其实(行业)对于数据类别,对于(数据的)金字塔应该也有基本共识了:从互联网数据,到带一定标注的 Ego(第一视角)数据——可能(带)末端的轨迹,也可以没有——还有真机等等。

我们这次也发布了一个可穿在身上的设备:头上是五个鱼眼的 360 度鱼眼,然后加一个(穿戴)套服,手上两个手环——套服加鱼眼。因为这类数据一方面是必要的,另一方面也是想办法能减少采数的成本:让我们客户的工人也好、服务员也好,(可以)戴着(干活)。

在我们展台上,我们跟韩国一家咖啡品牌联名运营的这个咖啡店,我们的咖啡师就戴着这样的穿戴设备在做咖啡,去采数据。

在类别上,我觉得大家在统一;可能在配比数据的这个"菜谱"上,还是会有很多的差异性,这个就不展开了。在数据量上来讲的话,确实像语言类的数据,可能头部的语言模型企业能用到的百万亿 Token 量级的语料,相当于百万亿以及人类说话时长的这些数据的体量,确实比具身智能的量大好几个数量级。所以接下来,比如说现在大家看,过百万小时的具身智能数据,可能已经有初步的行业共识,是一个小的拐点。

这里头其实想表达一点:量是其一,质(量)更重要。

质量里头我们比较看重的是——我们叫"有效信息密度"。属于观测观察型的、没有什么真正的接触、或者缺少有效轨迹的(数据,价值有限)。

第二类可能简单接触,就是 pick and place(拿放)这些;

第三类相对价值比较高的,就是接触点比较密集、信息量相对密一些的,比如易碎物品的抓取,这类数据我们觉得价值会相对更高一些。

还有一类第四类数据,我们觉得非常非常有价值,就是失败情况下的数据。这类数据我们发现,它的量和质量再混入到我们的训练数据中之后,如果它们的质量和量都能提升的话,对于模型的成功率和出现可逆情况下的失败之后的恢复,是有很大的帮助的。

像刚才有一位嘉宾也讲"再试一次,再试一次"——多融入一些失败的数据,既能提升一次成功率,也能提升失败之后的自我恢复,这一类数据我们现在也非常关注。

然后再回到世界模型这个话题的话,其实我觉得模型学习,举一个例子,很多时候确实是靠对数据获得一种概率分布的高质量性。

比如说骑车不撞马路牙子,可能就是因为看到了百万次、千万次的轨迹没有压马路牙子。那你看我们人类的小朋友,其实骑几趟(自行)车也就知道碰马路牙子什么后果了。所以世界模型天然对数据的依赖性会小很多。

我们也有个粗略的估计:相比现在以模仿学习为基础范式的方式,可能能小个三分之二的数据依赖量。所以我觉得这个路线肯定还是非常对的。最后就是,因为我一直在讲世界模型作为这种 planner(规划器),作为机器具身智能的大脑,其实现在很多数据尤其是负样本的数据,确实也需要用世界模型作为数据生成(器)、作为仿真环境的这种用途,帮我们去产生更多比较难采到的数据。

最近我们也看这个像自动驾驶的博弈倒车这个事情,像 Tesla 已经做得很不错了,其实这类场景的数据是非常少的。那其实头部的一些自动驾驶的玩家,也都是会混合一些实际采集的和这种基于模型生成的比较难采到的数据,来增加模型的能力。

贾奎:我们每一位嘉宾也聊了,其实我们现在确实处于靠数据、模型大小和算力堆起来的 AI 智能的时代。那么回到如果我们以通用的物理 AI 或者通用的具身智能为目标的话,其实可能我们远远低估了实现这个通用它所对数据的要求。

因为可以简单想一下:人(类)对着你面前的一个东西、两个东西,你都可以做出无穷无尽的任务,每个任务都对应的是不同的动作。

那么所以从这个角度讲,也是最近我在行业里面专门去推动的,叫做 Physical Token 经济学的这么一个思考。

那么 Physical Token 经济学,它不是在讲一个 Token 卖多少钱的问题,而是说如果我们真的想要实现通用的物理 AI、通用的具身智能,你从最开始你的数据基建、你的模型架构设计、你整个从模型到本体到应用场景,该怎么做的问题。

因为如果你不趁这个早期阶段去思考这个问题,很可能我们想的通用的物理 AI 是不可能实现的。

那么这就回到了数据。因为你的任务是无穷无尽的,所以我们必须找到一个可持续的、成本可接受的方式。

再回到通用的目标来说,其实通用机器人的通用泛化性由两种耦合起来组成:一种是语义泛化性,一种是物理泛化性。

语义泛化性解决的是机器人看到不同的对象,知道这个动作该怎么做的问题,本质上(是)人的认知之后形成的人的动作的能力;物理泛化性解决的是当你训练时候的数据、测试的时候物理条件改变以后,你的机器人仍然能够稳定工作的问题。那么前者,语义泛化性,本质上是人的认知、建立在人的认知之上的人的行为的智能。

那么这部分数据其实必须来自于真实数据,因为真实数据的本质其实是人的数据。即使是这样,但是我们必须找到一个非常高效率、低成本的方式。我们知道刚才很多专家聊到,真机采集是非常低效、很贵的。

所以我们现在追求不管是一个 in-human(人穿戴)的方式,还有一个 UMI的方式。但即使是一个UMI的方式,你拿着夹爪、戴着手套,其实一个人一天也只能采 500 条到 1000 条。但是我们必须找到一个像无人驾驶一样(的方式)——因为我们每天都会开车,我们自然就会获取海量的数据;我们必须找到一个像 2020 年到 2025 年已经建立起来的训练大语言模型的这种范式(的方式)——因为我们每个人都每天用手机、都会打字、都会拍照、都会拍视频并且会共享。

所以对于具身智能来说,我们找到一个无成本的获取人类行为数据的方式。就像我们现在Ego的方式,最好是徒手的方式,不影响我们的工作、不影响我们的生活,那么这是能够学习到人类的经验的。那么这样的数据训练(出来),虽然能够学习到动作该怎么做,但是不精准,因为我们需要驱动一个机器人去稳定地工作。

那么这样就需要一个高效的后训练的方式。

高效的后训练方式,这里我们跨维智能其实是行业里面不多的一个坚持用合成数据、用生成式仿真去做后训练的公司。

因为你只有用这样的合成数据的方式去做后训练,后训练出来的模型直接能够驱动机器人,能够高成功率、高精度、高稳定性地去工作,那么你才不需要去现场采数据。

因为最终用户付给你这个带技能的机器人的成本,只是一个你替代的人工的成本;如果你有大量的采数据的成本,那么你绝对是亏钱的。所以从这个第一性原理的角度讲,我们也必须追求最高效的后训练的数据方式,那么最好就是用生成式仿真、用合成数据,因为它解决的是一个物理泛化性的问题。

所以我们希望用这样的预训练的人类经验的最高效的数据,和生成式仿真合成的后训练的数据,能够把我们的机器人、或者说这个世界模型驱动机器人,进入到各种各样的应用场景。在应用场景中自主地把这个数据的飞轮给转起来,就像我们无人驾驶的车一样。

这样的话,也许有机会我们能够实现我们世界模型驱动的物理 AI 的一个落地。

胡鲁辉:我们也是觉得数据非常重要,特别对世界模型。我们公司注重于世界模型这一块,我们今年也(开源)了世界模型,然后今年呢也会开源这个数据集这一块,数据跟模型共同来推进这个事情。

但是呢,刚才大家说到数据的质量、复杂性——物理世界里头、物理智能里头要求更高。其实大家已经在(多模态)大模型(上)看到这个事情。但我想呢,物理智能里头,它主要是讲泛化性的时候,有三个层面的泛化:一个就是我们叫任务的泛化、环境的泛化、本体的泛化——就是三重的泛化。

数字空间里头的数据往往不需要本体、或者(不需要)环境。那么这三重(泛化对数据的要求),它不是个加法,它是个乘法。也因为这个,我们对数据的需求越来越多,或者说要求质量性、一致性,要求也是越来越高。

但是我觉得随着科技的发展,(通用)人工智能本身(在进步):以前你想打标签,对吧,现在我们基本上不打标签了,慢慢地走向了人工智能帮助我们(处理)数据上的一些变化。

举个例子,具身智能我们最早都是用实采的数据为主,那现在呢也开始走向了用Ego或者 UMI 这种方式。但我觉得这个有可能还是个中间阶段。往后的话,具身智能或者(通用)智能的数据,可能会走向另外两个层面。

其实你想吧,我们人学东西的时候,不是第一视角学东西的,不是 Ego 的数据能学的——我们其实是第三视角(学习),看别人学一下就学会了。所以我觉得往后应该是第三视角,或者说用生成的方式,让物理智能获得更多的数据。因为这样(用第三视角)的话,很多数据本身是现成的:视频也好、网上也好,本身有很多现成的一些数据,那这里头可以快速应用起来。

还说到一点,就是视角模型和人形机器人这个数据的关系。其实刚才也说了,世界模型核心(要)解决一个什么问题?就是理解的问题。

智能它如果有理解这个层面,那么对数据的依赖性,某种程度上(会下降)——不是说需要海量数据。你想我们人学一个东西,是通过理解的方式去学,人不需要很多很多数据——当然也需要数据——就不是说需要无穷无尽的数据。

这也就是为什么(不同于)VLA 或者说一些强化学习(的地方)。那么我想世界模型本身对数据可能有依赖,数据非常重要,还有就是说世界模型本身一个质的变化,就是通过理解的层面,对数据的依赖性会急剧下降。还有一个,它本身也能够生成数据——仿真也好、生成也好,这也就是世界模型的特色。

比如说有些场景一般我们采集很难获得,那么通过世界模型它理解的程度,它可以去生成、或者说(仿真)这些数据。我想这些数据这个问题很重要,但是我觉得对具身智能或者世界模型,应该是比较乐观一个状态。

宋彬:既然讲了高质量,这是个痛点,也是个难点,也是很多商业公司的一个关键的点。从简而言之,围绕我们这十几年搞数据(的工作),说数据自己的(体会)而言:高质量围绕世界模型刚刚讲的物理 AI、物理常识、因果性、时空拓扑的关系,以这个为目标情况下,我们的高质量数据应该如何去做?

建议:第一,物理导向、物理常识导向;第二个,空间约束条件去导向,去收集、去整理、去治理我的数据。

那么你收集的数据跟我要训练、要预期的结果,可能会大大地节省。第二个我觉得就是相关性怎么变成因果性。因为我们在世界模型里追求的是因果性,所以在数据关系的建立上,怎么基于本体语义建立它的因果性。

第三,还有一个小小的建议:既然要讲到物理规律怎么去找出,那么基于我们的观测数据——我讲的观测数据肯定不是讲的视频、照片了,因为这个做的认识很多了——是说声、光、电磁这些,包括我们今天的环境(做)的观测数据。因为观测数据本身的采集这套体系,它是很多是来自于工业体系,工业体系建立起来了。那么观测数据在于观测数据,我们去寻找我们的物理规律、去寻找我们的时空拓扑,那我相信可能会意外的惊喜。

最后一点,我觉得刚刚贾教授讲得很透彻了,两大类(数据),很透彻了,讲得很好,毕竟在商业上也做得很好。

第二个就讲了这个所谓的共享交换的问题。我是觉得借这个机会呼吁一下:因为世界模型要叫世界模型,一定是要大、要宏观、要有微观、要能够连续化。

那么很显然,作为商业化的公司想着做到世界模型不容易。所以也因此建议、也呼吁我们的政府、我们的一些(行业)联盟,能否尽可能地形成一些公开的数据集、基础性的数据集,供大家各行各业来使用。那么第二个呢,因此呢,在接下来我们刚好也参与了课题,那么可能我们今年年底会开放一些城市的、用于具身智能和科学研究的一些数据集,这个我们也会开放出来。这个我也跟课题相关成员单位已经达成一致,那么这个数据集我们研发了两年的时间,我们会把(它)开放出来,所以大家可以关注飞渡科技的公众号。那么第二下来我想的,数据之间的关系,我觉得还在市场化。

因为现在国家不是在搞数据资产(入表)吗?数据要(流通),所以我觉得大家形成一个价值交换体系,那我认为数据可能就能流动起来了。好,谢谢。

沈宇军:我对于数据可能就想说两个点。

第一个点,其实我觉得数据的一个核心,是知道我对一个数据的、比如说某一个东西的精度下限要求到底是多少。因为大家都会讲的一个点是精度越高越好,但是越高可能会带来成本越高。我觉得一个非常非常核心的东西,就是我能不能知道:精度到达一个什么水平的时候,对模型来说就已经够用了。因为只有在这个点摸清楚的时候,可能才能更好地做到数据质量和数据规模的一个 balance(平衡)。这是第一个点。

然后第二个点,我觉得可能在谈数据的总体体量之前,更关键的一个点是数据的分布。就是同样是十万条数据,这十万条数据到底应该涵盖哪些动作、哪些任务——其实十万个同样的任务其实是没有意义的嘛。所以我觉得在做数据的时候经常容易被忽视的,就是刚刚说到的那两个点:我们对数据的最低质量要求到底是多少,以及数据的分布应该长成什么样子。

朱政:好的,因为时间限制,所以我就补充非常简短的一点。我觉得除了数据规模、包括数据的标准这些事情之外,我们还要很需要重视的一点,就是样本的利用效率。

因为我们之前做过一些实验:我们大概用了几十万个小时的数据,然后训练一个几十亿参数左右的世界模型,包括一个基模,它的训练成本可能在一亿(元人民币)左右。如果按照这个比例计算的话,假如说我们今年或者明年、甚至说后年,数据量比如说增长到几千万个小时、甚至上亿小时,然后当我们的模型参数量再增长十倍、甚至说增长百倍,那么如果我们不提升样本利用效率的话,这就意味着我们可能要花上千亿来训练一个具身(基模)或者世界模型。

这显然是不现实的,这会比语言模型的(成本)还要高很多。因为据大家估计,现在一个语言模型、一个旗舰的模型,可能从立项到最后模型的发布,会花几十亿人民币到几十亿美金之间,我觉得这对一个商业公司来讲还是勉强可以接受的。

但是假如说我们的具身基模包括我们的世界模型要花更多的钱的话,这其实不管从商业角度来讲,还是从其他方面来讲,都是不健康的。所以说我觉得,一方面我们在不断地收集新的数据、不断提升数据质量的过程中,还要同步迭代我们的模型,让我们的样本利用效率得到进一步的提升,以便于我们在有限的预算的情况下把模型训出来。


一句话表达当下最应该优先做的一件事

王坚大家最后一个机会还是留给大家,就是希望你们真的用一句话来表达一下:为了实现你们的理想,你们自己当下最应该优先做的一件事是什么?能不能有一句话能表达出来?

王晓刚:对我们来说的话,还是要能够抓住场景,尽早地实现规模化,这样无论是数据还是机器人部署的本身(都能跑起来)。

黄源浩:我们最喜欢做的是数据标准化,让大家之间的数据可以流通,然后数据可以服务更多的模型公司。

张玉峰:在保障人机安全的前提下,加快机器人的真机部署,让我们从落地、数据闭环、模型迭代这样的一个螺旋上升的机制能够迅速产生,在部署中进化。

贾奎:我们希望跟行业一起,将模型推到更多的应用场景,真实地给人类解决问题。

胡鲁辉:我觉得通用智能和世界模型发展到这个阶段,也是很希望大家一起来推动(通用)智能。我觉得核心关键就是一个技术突破,因为现在不是互联网时代,是通过技术突破能够推动(通用)智能、数据各个方面的发展。

宋斌:我们是做空间智能的,我们相信也希望空间智能能更好地赋能具身智能,健康地、更好地发展。好,谢谢。

沈宇军:一句话来说,我觉得就是想清楚我们希望拥有的能力到底是什么。

朱政:对,我们希望在未来几年,可以快速地从当前垂类场景的世界模型,走向真正的通用的世界模型。

王坚:特别感谢各位嘉宾的分享,特别是贾奎总谈到关于Physical Token,平时也听你讲过,很受启发。也代表我个人的致敬。就像朱政总说的,就是希望明年这个时候还见到你们,你们公司每个人的价值都翻了 50 倍。感谢所有的嘉宾,谢谢你们的时间,也谢谢你们认真的聆听。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
炸裂!巴萨肠子悔青!5000 万甩卖弃将欧冠首秀轰帽子戏法

炸裂!巴萨肠子悔青!5000 万甩卖弃将欧冠首秀轰帽子戏法

奶盖熊本熊
2026-09-10 07:31:02
9月10日苹果发布会全系列汇总:4款iPhone加3款手表加AirPods5售价和亮点一文说透

9月10日苹果发布会全系列汇总:4款iPhone加3款手表加AirPods5售价和亮点一文说透

叮当当科技
2026-09-07 09:12:17
七连胜终结!郑钦文1-2遭莱巴金娜逆转,目送对手登顶世界第一!

七连胜终结!郑钦文1-2遭莱巴金娜逆转,目送对手登顶世界第一!

海浪星体育
2026-09-10 02:10:54
这10样东西过期1天也要扔,第一名天天用,毒性最强!

这10样东西过期1天也要扔,第一名天天用,毒性最强!

三农老历
2026-09-10 03:41:46
印度专家谈到中国时满脸不可置信:中国竟有50多个城市有地铁!

印度专家谈到中国时满脸不可置信:中国竟有50多个城市有地铁!

奇葩游戏酱
2026-09-09 07:06:57
齐达内:若有机会选金球奖得主,他会一次又一次把票投给梅西

齐达内:若有机会选金球奖得主,他会一次又一次把票投给梅西

懂球帝
2026-09-09 14:54:07
75:72!中国女篮75-72险胜波多黎各,一战诞生三大不争的事实!

75:72!中国女篮75-72险胜波多黎各,一战诞生三大不争的事实!

田先生篮球
2026-09-10 03:45:18
某车企公关误发小米澎程攻防需求,媒体群紧急解散!

某车企公关误发小米澎程攻防需求,媒体群紧急解散!

鞭牛士
2026-09-09 16:19:24
女子称打赏24岁男主播390余万且婚内出轨致离婚,其父痛哭称一家人陷困境;前夫起诉主播及公司等返还

女子称打赏24岁男主播390余万且婚内出轨致离婚,其父痛哭称一家人陷困境;前夫起诉主播及公司等返还

扬子晚报
2026-09-09 07:43:04
报仇不隔夜!以色列72名议员联署支持台湾,转头就被狠狠上了一课

报仇不隔夜!以色列72名议员联署支持台湾,转头就被狠狠上了一课

究竟谁主沉浮
2026-09-09 18:24:36
李想:理想i9是城市中心顶级大平层 全世界绝无仅有!

李想:理想i9是城市中心顶级大平层 全世界绝无仅有!

快科技
2026-09-09 14:00:05
将新科世界第1打到与教练争吵!郑钦文昂首离开:1-2惜败 6交手1胜

将新科世界第1打到与教练争吵!郑钦文昂首离开:1-2惜败 6交手1胜

风过乡
2026-09-10 05:56:06
苹果新机代抢连夜涨价!有黄牛将加价3000到5000元!专家:消费者可能“钱货两空”…

苹果新机代抢连夜涨价!有黄牛将加价3000到5000元!专家:消费者可能“钱货两空”…

北京商报
2026-09-09 15:37:33
父亲病逝独生女全程未露面,伯父起诉剥夺继承权,女儿:早断绝来往,他曾说有侄子养老,升高中起断我学费生活费;法院:7500元遗产归伯父

父亲病逝独生女全程未露面,伯父起诉剥夺继承权,女儿:早断绝来往,他曾说有侄子养老,升高中起断我学费生活费;法院:7500元遗产归伯父

大风新闻
2026-09-09 17:08:03
220万买下临街旺铺,有房本却无权锁门;法院判决:需给后方两铺留通道留门

220万买下临街旺铺,有房本却无权锁门;法院判决:需给后方两铺留通道留门

大风新闻
2026-09-09 19:55:08
河南济源市发生3.6级地震,洛阳、郑州等多地网友:有震感

河南济源市发生3.6级地震,洛阳、郑州等多地网友:有震感

环球网资讯
2026-09-09 19:32:01
原来还有这么多小众的工作,网友:每天盈利2万

原来还有这么多小众的工作,网友:每天盈利2万

夜深爱杂谈
2026-09-09 20:43:13
越南以为中日会抢着接南北高铁项目,结果万万没想到,日本直接撤了,中国企业从头到尾沉默,连价都懒得报

越南以为中日会抢着接南北高铁项目,结果万万没想到,日本直接撤了,中国企业从头到尾沉默,连价都懒得报

扶苏聊历史
2026-09-09 15:54:30
藏了半年的伊朗最高领袖穆吉塔巴,行踪终于被美以情报局扒光了!原来他一直不露面,是昏迷了

藏了半年的伊朗最高领袖穆吉塔巴,行踪终于被美以情报局扒光了!原来他一直不露面,是昏迷了

扶苏聊历史
2026-09-08 14:57:02
9月10日A股预警:这4个板块明天最好别碰,踩中可能就是大面

9月10日A股预警:这4个板块明天最好别碰,踩中可能就是大面

风风顺
2026-09-10 03:20:03
2026-09-10 08:44:49
智能纪元AGI
智能纪元AGI
专注科技、科学、商业产业报道
2606文章数 10612关注度
往期回顾 全部

科技要闻

一文看懂:iPhone折叠屏顶配2万6,10月才卖

头条要闻

iPhone18 Pro系列价格公布:A20 Pro芯片 续航大幅提升

头条要闻

iPhone18 Pro系列价格公布:A20 Pro芯片 续航大幅提升

体育要闻

16年后再破门,被皇马放弃的少年没认输

娱乐要闻

郭德纲的商业版图,藏着不知道的真相

财经要闻

银行新高!新一轮周期,刚开始!

汽车要闻

腾势Z9GT易三方闪充尊越型32.98万元上市

态度原创

教育
房产
亲子
时尚
游戏

教育要闻

聚焦十个关键,激发育人活力!现代教育治理体系这样构建

房产要闻

设计之都、中央法务区、均禾大道南侧……白云甩出3宗硬核宅地!

亲子要闻

一图读懂丨科学照护之包裹婴儿

女人不管多大,都可以看看这些“条纹T恤”,非常减龄又简约

初代《刺客信条》Steam更新暗示重制版将公布

无障碍浏览 进入关怀版