李飞飞在办公室里叠衣服,动作自然,光影真实——但画面里的她,是数字分身。这段由World Labs新一代世界模型Atlas生成的视频,被她本人转发调侃:"我们办公室里确实真的在叠衣服!"
从去年发布的Marble到今天的Atlas,这家由李飞飞创办的公司,把世界模型从"能看"推向了"能懂空间"。官方给出的定义是:世界上第一个能以像素级相机控制生成图像与视频帧、并将其重建为3D的多模态世界模型。翻译成大白话:它不再只是生成画面,而是理解画面里的空间关系,并据此生成新视角。
![]()
一个模型,四种模态
Atlas被World Labs称为"全模态模型"(omni model),从零开始预训练,原生处理文本、图像、视频和3D四种数据。它的能力可以拆成四块:
- 相机可控生成:从1到6张参考图出发,按指定机位和角度生成新视角,最高输出1440p、最长1分钟的视频。
- 空间重建:从1到几十张输入图重建真实场景,输出新视角图像帧,也输出点云和3D高斯泼溅等显式3D结果。
- 时空模拟:从输入视频中同时建模空间与时间,用于视频重构图和机器人的Real-to-Sim流程。
- 图像生成:包括文生图和360度全景图。
目前Atlas不开源,仅向少数合作伙伴开放早期访问申请,后续将驱动Marble及World Labs的其他产品。
核心设计:把相机位姿变成"原生输入"
Atlas最核心的设计叫"空间上下文"(spatial context)。它是一个多模态自回归扩散Transformer,输入在三维空间中进行grounded,形成空间上下文,再基于该上下文生成多模态输出。
类比大语言模型:LLM把输入编码成context,再基于context生成后续token。Atlas的流程相同,区别在于——进入context的每一张图像都被锚定在三维空间中的一个具体位置,它带着相机位姿一起进来。
这个改动带来的直接后果是:相机不再靠文字描述。过去让视频模型"向左推轨""升降镜头",只能把这些电影术语写进提示词里,模型理解到什么程度是个黑箱。Atlas把相机几何做成了原生输入类型。World Labs表示,这能让创作者"坐进导演椅,而不是在拉老虎机的拉杆"。
更有意思的是对上下文的编排。你可以往空间上下文里放两张毫不相关的参考图,并指定它们在三维空间中的相对位置,Atlas会生成一个在两者之间平滑过渡的世界——它自己想象出门廊、走道和转角。博客里给了一个例子:把一张站点图片和一张地面图片拼在一起,模型补出了中间从来不存在的空间。
架构与成绩:两条技术线的混合体
架构上,Atlas是一个多模态自回归扩散Transformer,几个关键词拆开看:
- 多模态:原生处理文本、图像、相机位姿和深度图,视频被表示为图像序列。
- 自回归:输出逐个元素生成,每个任务只是一种不同的序列排列。
- 扩散:采用rectified flow,靠逐步去噪生成结果。
- Transformer骨干:保证对现代硬件的适配。
World Labs强调,这是LLM和视频模型两条技术线的混合体,因此能同时吃到KV缓存、分离式部署这类LLM侧的推理优化,以及扩散蒸馏、CFG、VAE改进这类视频侧的算法进展。
评测给出两块。相机可控生成上,World Labs用单张输入图配1到3段电影化的运镜指令,交由第三方人类评分者盲选。结果是Atlas对MiniMax H3的胜率75%,对Gemini Omni Flash 81%,对阿里HappyHorse 1.1为86%,对FLUX 3为93%,对字节Seedance 2.5为94%,且运镜轨迹越复杂优势越大。
但需要注意,World Labs在博客里自己写明:对比的其他模型不接受相机位姿作为原生输入,运镜只能通过文本提示描述。换句话说,75%到94%这个区间衡量的,很大程度上是"原生相机接口"对"文本描述运镜"的差距,而不是纯粹的画面生成质量差距。因此,World Labs并不是说"Atlas的视频生成能力全面碾压上述模型"。
3D重建部分。在稀疏视角重建任务上,Atlas的平均误差(AbsRel×10⁻³)为25.3,优于Pi3X(posed)的28.7、π³的34.7、VGGT-Ω 1B的36.4、Depth Anything 3的39.3和MapAnything的47.7。World Labs称所有基线结果均由自己复现以保证评测协议一致。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.