一张照片能告诉AI,房间里有一张桌子。但如果把镜头移到桌子背后,那里应该是什么样?如果机器人伸手推动桌上的杯子,接下来又会发生什么?
识别物体、生成画面和理解空间,是相互关联、却不能直接画等号的能力。李飞飞创办的World Labs,正在尝试跨越它们之间的距离。
![]()
昨晚,World Labs发布新一代世界模型Atlas。这是一款全域模型,团队从零开始预训练,使其能够原生处理文本、图像、视频和3D数据。Atlas将用于后续Marble及其他产品,目前面向部分合作伙伴开放早期访问,而非全面上线。
![]()
Atlas能做什么?
按照官方披露,Atlas的主要能力包括世界生成、重建和模拟等广泛任务。它支持可控运镜,可利用像素级相机控制,从一张或多张图像生成图像和视频,输出长达1分钟的1440p视频。
空间重建方面,Atlas可以根据一张或数十张输入图像重建真实世界场景。它既可以生成来自新视角的图像帧,也可以生成明确的3D输出,其性能优于目前最先进的3D重建专用模型。
时空模拟能力让Atlas通过输入视频对空间和时间进行建模,重新构建视频以获得戏剧性的视觉效果,并为机器人实现真实到模拟的工作流程。图像生成方面,它可以根据文本生成图像和360度全景图,遵循复杂的提示,渲染文本,并生成各种各样的视觉风格。
技术路线:多模态自回归扩散Transformer
Atlas采用多模态自回归扩散Transformer:序列元素逐个生成,每一步参考已有上下文,而视觉输出通过去噪产生;相机位姿和深度也是模型处理的数据类型。
这套设计的重要性,可以用一个拍摄任务来理解。
"让镜头向左移动"是一句意图描述;指定相机在空间中的位置和朝向,则是一组可检验的约束。前者需要模型猜测用户想要什么,后者允许创作者检查镜头到底有没有到达指定位置。
对于需要反复修改、衔接不同镜头的制作流程,差别不只是控制更细,是用户能否把同一个环境当作可重复使用的场景,而非每次重新抽取一段视频。
重建与生成也有类似关系:证据充分的区域,应当尽量还原;没有拍到的区域,只能依据已有信息推测。一个模型同时承担这两种任务,意味着使用者必须清楚,哪些部分来自观测,哪些部分来自补全。
但这里需要值得注意的是,生成得合理,不代表它就是现实中原本的样子。即便如此,Atlas的生成效果也足够令人惊叹。
为什么是World Labs?
更耐人寻味的是,交出这份答卷的并不是OpenAI、Google这类资源无上限的巨头,而是李飞飞在2024年才创办的World Labs。那么,为什么做出这款多模态世界模型的是她的团队?
World Labs的故事,不能只从Atlas开始讲。
李飞飞1999年获得普林斯顿大学物理学学士学位,2005年获得加州理工学院电气工程博士学位。她推动的ImageNet及相关竞赛,是现代计算机视觉发展的重要基础;她也曾于2017年至2018年担任谷歌副总裁及Google Cloud AI/ML首席科学家。
为啥要把她的履历再介绍一遍,因为把她一直在做的事放在一起看,可以发现问题的延续性。
ImageNet时代,一项核心任务是让机器识别照片里的内容。空间智能则把问题推进了一层:不仅要知道"这是什么",还要知道它在哪里、从另一个方向看是什么样,以及它与周围物体存在什么关系。
![]()
例如,"这是一把椅子"是类别识别;判断机器人能否从椅子和墙壁之间穿过去,则需要尺度、几何和行动后果。语言可以描述这个问题,但文字描述本身不能替代空间判断。
从Marble到RTFM:一条清晰的研发路径
2024年9月,World Labs公开亮相。早期投资方Radical Ventures当时披露,公司从起步阶段就将目标设定为感知、生成和交互三维世界,并计划先从创作者能够使用的虚拟空间切入,再扩展能力。
因此,今天的机器人方向并不是看到具身智能升温后突然增加的一条业务线。更准确地说,创造空间是较早可以交付的入口,而让机器在空间中行动,是更难兑现的长期目标。
创始团队的构成,也能解释这条路线。World Labs由李飞飞与Justin Johnson、Ben Mildenhall、Christoph Lassner共同创办,几人的积累集中在视觉、图形学和三维表示,而不只是语言建模。
Ben Mildenhall于2020年在加州大学伯克利分校获得博士学位,之后在Google Research工作。他是NeRF论文的共同第一作者之一。这项研究利用神经网络表示场景,并从已有照片合成新视角,是理解这支团队技术背景的重要线索。
Justin Johnson的研究涉及视觉推理、视觉与语言、图像生成和三维推理,博士毕业于斯坦福。Christoph Lassner则长期研究高效的场景表示和渲染,开发过后来成为PyTorch3D球体渲染后端的Pulsar。目前Lassner已公开宣布退出日常职位,继续担任顾问。
这些经历并不能证明Atlas直接采用了某项早期研究,但能解释团队为什么会执着于同一件事:画面背后的空间,能否被稳定地表示、重建和调用。
回看公开研发节点
World Labs并不是一开始就拿出了今天这套完整能力。2024年12月,公司首先展示可在浏览器中探索、具有持续性的三维世界。2025年9月,展示重点转向更大、更精细的环境,Marble也进入早期测试。
到2025年11月12日,Marble正式向所有用户开放。
Marble的意义,是把研究结果变成能够继续加工的资产。用户不仅可以从文本、图像、视频和粗略三维布局生成世界,还能编辑、扩展、合并场景,并导出高斯泼溅、网格或视频。对于创作者来说,这比一次性生成结果更接近工作流:生成之后,还能修改和交付。
与此同时,团队在2025年10月公开了另一条研究线:RTFM,即Real-Time Frame Model。
据官方博客透露,RTFM的设计围绕三个关键原则。它探索的是"学习出来的渲染器"。传统图形系统先建立几何、材质、光照,再计算画面;RTFM则从已有画面预测新视角,不必先建立显式三维模型。官方当时将目标定为在单张H100上实现交互式帧率,并通过优化架构、蒸馏和推理系统达到这一目标。
假如用户先进入客厅,再走到厨房,最后回到客厅,模型不能重新"发明"一间客厅。但如果把用户看过的所有画面都放进上下文,计算与存储开销又会不断增加。RTFM的解决思路是给画面绑定空间。
从ImageNet到空间智能,从Marble到Atlas,World Labs的每一步都在回答同一个问题:机器如何理解并操作它所在的世界。Atlas的发布,是这个长期问题的一个阶段性答案。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.