网易首页 > 网易号 > 正文 申请入驻

李飞飞团队发布新一代世界模型Atlas:从零训练,一次性打通视频生成、 3D重建与机器人仿真

0
分享至



今天,李飞飞创办的空间智能公司 World Labs 发布了新一代世界模型 Atlas。World Labs 在社交平台上将其称为“全球首个多模态世界模型”,希望用同一个基础模型同时完成视频生成、3D 重建和时空模拟。

和目前主流的视频生成模型不同,Atlas 并不是在现有视频或 3D 模型上继续改造而来。World Labs 从零开始对它进行预训练,让文本、图像、视频和 3D 数据从训练起步阶段就进入同一个模型,并尝试把这些不同形式的信息统一理解为同一个三维空间。


(来源:X)

基于这个空间,它既可以从一张照片生成新的视角,也可以按照给定的镜头轨迹生成最长 1 分钟、1440p 的视频,还能将照片和视频重新构建成点云和 3D 高斯泼溅(Gaussian Splatting)场景,进一步用于影视制作、游戏以及机器人仿真。

Atlas 目前已经向少数合作伙伴开放早期测试,未来也会成为 World Labs 旗下 3D 世界生成产品 Marble 的底层模型。

这也是 World Labs 成立两年以来最重要的一次基础模型发布。这家公司由李飞飞与 Justin Johnson、Christoph Lassner、Ben Mildenhall 共同创立,后几位分别来自计算机视觉、生成式 AI 和计算机图形学领域。

2024 年,World Labs 以 2.3 亿美元融资正式走出隐身模式;今年 2 月,公司又完成 10 亿美元新融资,其中 Autodesk 投资 2 亿美元,AMD、英伟达和 Fidelity 等也参与其中。

过去两年,World Labs 一直在强调一个判断:语言模型让机器学会了处理“文字”,下一步则需要让 AI 真正理解“空间”。

一个模型,同时生成视频和重建 3D 世界

Atlas 最核心的变化,是把相机在三维空间中的位置和姿态直接变成模型的一种原生输入。

普通视频模型接受“镜头向左移动”“绕着物体旋转”等自然语言指令后,本质上仍然是在像素空间里猜测后续画面。Atlas 则会把每一张输入图像与对应的相机位置绑定起来,放进一个共享的 Spatial Context(空间上下文)。

对于这个能力,我们可以简单理解为:模型不仅知道“这张照片里有什么”,还知道“这张照片是从空间中的哪里拍出来的”。

因此,当用户移动摄像机时,Atlas 要做的不只是生成另一张看起来合理的图片,还要尽量让新的画面与此前观察到的空间结构保持一致。对于原图中没有出现的区域,模型再利用自身的世界知识补全。World Labs 展示的例子中,只给 Atlas 一张机器人的正面照片,再把镜头绕到背后,模型能够生成此前完全没有出现在输入中的机器人背面以及周围环境。

这种机制也让 Atlas 获得了比普通视频模型精细得多的运镜控制。

World Labs 在社交平台展示的一段视频中,团队只提供了 7 张参考图,然后人工设计了一整条相机轨迹,Atlas 最终生成了一段 1 分钟、1440p 的连续视频。镜头可以在复杂场景中前进、旋转、转向,而不是只能依赖一句“航拍”“推进镜头”来碰运气。

World Labs 还做了一组相机控制测试。Atlas 与 Seedance 2.5、FLUX 3、Gemini Omni Flash 等模型分别按照指定镜头轨迹生成视频,再由第三方标注者判断哪一段更符合预定运镜。在与 Seedance 2.5 的对比中,94% 的评审选择了 Atlas;与 Gemini Omni Flash 对比时,这一比例为 81%。

不过这组测试也有一个需要注意的地方:Atlas 可以直接读取精确的相机轨迹,而其他视频模型并不支持这种输入,因此 World Labs 只能把相同的镜头运动转换成文字提示。这实际上既体现了 Atlas 的优势,也意味着它并不是完全同条件的纯视频质量比较。

Atlas 的第二项能力则更接近传统计算机视觉:从稀疏图片重新构建 3D 世界。

一张照片也可以完成,但需注意,这里的“重建”并不代表照片之外的部分是真实的。

World Labs 展示了一个案例。第一次只输入一张花园照片时,Atlas 能从空中重新观察这个花园,但花园以外的房屋和环境基本都是模型根据常识“想象”出来的;加入第二张小屋照片后,小屋的位置开始与真实环境对应;再加入第三张主屋照片后,整个空间才进一步接近实际场景。

World Labs 将这套机制概括为:模型看到得越多,需要想象的就越少。通常两三张图片已经可以得到较为忠实的重建,而 Atlas 最多也能利用超过 100 张图片作为空间上下文。

更重要的是,它得到的并不只有一段“看起来像 3D”的视频。

Atlas 可以同时预测每一帧的深度,把结果组合成点云,并进一步生成 3D高斯泼溅场景。后者可以直接在本地以较高帧率渲染,也是 World Labs 目前 Marble 产品使用的 3D 表示形式。这代表着同一个模型生成的结果,可以进一步进入游戏、VFX、建筑设计等现有 3D 工作流。

几部手机,为机器人重建真实世界

如果说前两项能力主要解决的是空间,Atlas 更进一步的目标则是把时间也放进世界模型。

World Labs 展示了一个类似《黑客帝国》“子弹时间”的案例。

传统的多视角自由视点视频,通常需要大量同步摄像机和专门的拍摄系统。World Labs 的研究人员只使用 3—5 台普通手机或运动相机,从几个方向同时拍摄动态事件。Atlas 将这些视角重新对齐并建立空间模型后,用户可以在事件已经发生以后,再从现实中根本不存在的摄影机位置观看同一个瞬间。


(来源:World Labs)

而这项能力最终指向的,不只有影视制作。World Labs 同时展示了 Atlas 在机器人 Real-to-Sim (真实到仿真)中的应用。

研究人员首先用手机视频拍摄两个真实环境,分别从视频中选取 24 帧完成空间重建;随后让不同形态的机器人沿着任意路径在这个虚拟空间中移动。除了重建环境本身,Atlas 还会根据机器人的位置,生成其机载摄像头应该观察到的 RGB 图像和深度数据。

随着机器人在其中移动,它还需要持续获得与当前位置对应的视觉和深度观测。Atlas 希望把这两件事交给同一个模型完成:既重建机器人所在的世界,也生成机器人在这个世界中“看到”的内容。

World Labs 还展示了进一步面向机器人操作的实验。通过少量真实世界录像,Atlas 可以辅助建立包含物体运动和交互的模拟场景,包括刚体、带关节物体以及可变形物体。完成模拟后,研究人员还可以改变物体及其位置、机器人动作、光照和背景,从同一个真实任务中扩展出更多训练和测试环境。

过去如果想把一家真实工厂、一间仓库或者一套住宅转化成可用于机器人模拟的环境,往往需要更复杂的扫描和建模设备。World Labs 希望借助世界模型,把其中相当一部分过程压缩成普通手机就能够完成的数据采集。

Atlas 之所以能够在视频生成、3D 重建和机器人模拟之间切换,也与它的底层架构有关。

Atlas 是一个多模态自回归扩散 Transformer(multimodal autoregressive diffusion transformer)。和普通视频模型不同,文本、图像、相机位姿和 3D 深度图等不同信息都会被放进同一个序列中,每一张图像和深度图还会与明确的相机位置绑定,由此组成一个共享的 Spatial Context。

在生成过程中,Atlas 又结合了两套我们已经熟悉的技术路线:一方面,它像语言模型一样采用自回归方式,根据此前的上下文逐个生成新的元素;另一方面,它又像现代图像和视频模型一样,通过扩散模型的逐步去噪处理高维视觉信息。


(来源:World Labs)

世界模型正在从“生成画面”走向“建立空间”

Atlas 不是过去一年出现的第一个世界模型。

2025 年 8 月,Google DeepMind 发布 Genie 3,可以从文本实时生成 720p、20—24fps 的交互式环境,并在几分钟内维持基本的一致性;去年 11 月,World Labs 自己推出的 Marble 已经可以接受文本、图片、视频和粗略 3D 布局,生成可自由探索和导出的 3D 世界;今年 6 月,英伟达又推出 Cosmos 3,用统一架构处理语言、图像、视频、声音和机器人动作,将世界模拟进一步延伸到 Physical AI。

因此,如果严格按照行业定义来看,“全球首个多模态世界模型”其实并不是一个没有争议的说法。World Labs 自己此前就将 Marble 称为多模态世界模型,英伟达也将 Cosmos 3 称为全模态世界模型(omnimodal world model)。

Atlas 更值得关注的地方,是把过去相对分离的生成、重建和模拟任务,进一步放进了一个以 3D 空间为核心的统一基础模型里。

今年 6 月,李飞飞和 World Labs 曾经把现阶段的世界模型分成三类:负责产生视觉画面的 Renderer(渲染器)、负责建立几何结构和物理环境的 Simulator(模拟器),以及负责决定智能体下一步行动的 Planner(规划器)。他们当时提出,最终目标应该是让这三个方向重新汇合到一个统一的世界模型中。

Atlas 显然是朝这个方向迈出的一步:它已经开始同时承担渲染器和模拟器的部分工作。但距离真正能够“模拟现实世界”,它仍然有明显距离。

目前 Atlas 公布的机器人案例主要证明了空间重建、视觉观测生成和简单物体交互能力,World Labs 尚未公布它在碰撞、摩擦、材料特性、复杂动力学以及长时间物理演化上的系统性测试,也没有证明由 Atlas 生成的模拟环境能够稳定提高机器人策略在真实世界中的成功率。

世界模型用于机器人训练时,最危险的问题恰恰是一个视觉上完全合理的世界,在物理上却可能是错误的。相关研究者也一直将 sim-to-real gap视为这类技术必须解决的核心问题。

与此同时,Atlas 目前还没有公开模型参数规模、训练数据量和训练算力,也没有发布权重;它刚刚进入少量合作伙伴的早期测试阶段,目前的能力和 benchmark 主要来自 World Labs 自己公布的结果,还缺少独立测试。

因此,Atlas 现在还不能被简单理解成一个已经能够“预测现实”的物理世界模拟器。

但它展现出了一条越来越明确的技术路线:过去的生成模型学习如何根据已有像素预测下一帧,而世界模型正在尝试回答一个更复杂的问题——如果摄像机移动到世界中的另一个位置,会看到什么;如果一个物体或机器人在这个世界里开始运动,接下来又会发生什么。

1.https://www.worldlabs.ai/blog/atlas

2.https://www.worldlabs.ai/atlas

3.https://www.worldlabs.ai/blog/marble-world-model

4.https://www.worldlabs.ai/blog/taxonomy-of-world-models

5.https://deepmind.google/blog/genie-3-a-new-frontier-for-world-models/

6.https://www.nvidia.com/en-us/ai/cosmos/

运营/排版:何晨龙

注:封面/首图由 AI 辅助生成

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
美媒这次彻底摊牌了!据《军事观察杂志》透露,中国在大连造的004型航母排水量预计冲到11万吨,造船速度更是美军同类工程的2倍

美媒这次彻底摊牌了!据《军事观察杂志》透露,中国在大连造的004型航母排水量预计冲到11万吨,造船速度更是美军同类工程的2倍

扶苏聊历史
2026-09-03 14:15:44
暂无法离开美国!李月汝本人揭秘:更换护照 结果新旧护照一起寄丢了

暂无法离开美国!李月汝本人揭秘:更换护照 结果新旧护照一起寄丢了

醉卧浮生
2026-09-03 11:25:33
日媒:日本持“经营签”外国人加速离开

日媒:日本持“经营签”外国人加速离开

环球网资讯
2026-09-04 06:54:47
阿萨德父子恐怕怎么也想不到,两代人几十年都办不到的事,朱拉尼上台才二十个月就干成了

阿萨德父子恐怕怎么也想不到,两代人几十年都办不到的事,朱拉尼上台才二十个月就干成了

人生录
2026-09-04 00:30:06
性专家说:当一个异性开口跟你要钱,要礼物,不管对方是不是想试探你的真心,你都应该明白,你已被对方列入供养者行列

性专家说:当一个异性开口跟你要钱,要礼物,不管对方是不是想试探你的真心,你都应该明白,你已被对方列入供养者行列

心理观察局
2026-08-05 06:46:04
国产HDD厉害了:性能提升21倍,成本降80%,美日厂商要完蛋了?

国产HDD厉害了:性能提升21倍,成本降80%,美日厂商要完蛋了?

互联网.乱侃秀
2026-09-01 10:23:47
油车被电车打得满地找牙,工信部终于发话了:坚决抵制非理性竞争

油车被电车打得满地找牙,工信部终于发话了:坚决抵制非理性竞争

侃故事的阿庆
2026-09-04 00:27:30
前妻:赫斯基带着新女友出去度假,真让人恶心

前妻:赫斯基带着新女友出去度假,真让人恶心

懂球帝
2026-09-03 22:24:13
新一代理想MEGA正式上市:售价50.98万元,仅保留Home一个版本,CLTC续航710km,双电机四驱,本周内开启交付

新一代理想MEGA正式上市:售价50.98万元,仅保留Home一个版本,CLTC续航710km,双电机四驱,本周内开启交付

台州交通广播
2026-09-02 23:55:16
金球奖没悬念了?拜仁6000万巨星狂飙:68场轰75球,比金边罗还猛

金球奖没悬念了?拜仁6000万巨星狂飙:68场轰75球,比金边罗还猛

球场没跑道
2026-09-03 11:35:41
难怪都说现在小孩子的身高就是一个谜了,评论区笑不活了

难怪都说现在小孩子的身高就是一个谜了,评论区笑不活了

夜深爱杂谈
2026-09-03 20:20:14
续航719km+3.2秒破百!焕新版Model Y来袭,老车主看完直呼想换车

续航719km+3.2秒破百!焕新版Model Y来袭,老车主看完直呼想换车

音乐时光的娱乐
2026-09-04 06:10:46
心理学:拿下中年女人的身体,最高明的手段就四个字,猫咪原则,而不是死缠烂打

心理学:拿下中年女人的身体,最高明的手段就四个字,猫咪原则,而不是死缠烂打

心理观察局
2026-09-04 06:43:25
官方:费内巴切与32岁中场塔利斯卡解约;球员75场攻入44球

官方:费内巴切与32岁中场塔利斯卡解约;球员75场攻入44球

懂球帝
2026-09-04 03:43:07
尼泊尔泥石流中幸存的“楼坚强”,难道只是因为“幸运”吗?

尼泊尔泥石流中幸存的“楼坚强”,难道只是因为“幸运”吗?

良有方
2026-09-04 06:07:21
“凌晨1点,空姐突然推销上墨镜了” 海航系低成本航司卖货“折磨”乘客?知情人士“带货少要扣钱!”

“凌晨1点,空姐突然推销上墨镜了” 海航系低成本航司卖货“折磨”乘客?知情人士“带货少要扣钱!”

新浪财经
2026-09-03 18:55:19
高铁女孩熟睡男生盯死手机不敢转头,两百万外网围观无声的人机对峙,藏着成年人不敢破冰的社交尴尬防线

高铁女孩熟睡男生盯死手机不敢转头,两百万外网围观无声的人机对峙,藏着成年人不敢破冰的社交尴尬防线

明话直说
2026-08-25 18:07:55
开油车的乐了,电车车主慌了!2026油电新政落地,建议提前了解

开油车的乐了,电车车主慌了!2026油电新政落地,建议提前了解

小谈食刻美食
2026-09-02 08:21:13
11年后,陈意涵揭开花少2最残忍的真相:杨洋不是走丢,是被丢下

11年后,陈意涵揭开花少2最残忍的真相:杨洋不是走丢,是被丢下

晴晴的娱乐日记
2026-09-03 12:29:36
全世界都被普京骗了?打乌克兰只是幌子,真正目标其实已悄悄布局四年

全世界都被普京骗了?打乌克兰只是幌子,真正目标其实已悄悄布局四年

扶苏聊历史
2026-08-27 16:15:02
2026-09-04 07:44:49
DeepTech深科技 incentive-icons
DeepTech深科技
麻省理工科技评论独家合作
17185文章数 515199关注度
往期回顾 全部

科技要闻

英伟达129亿美元拿下Hugging Face

头条要闻

媒体:美国驻华大使馆关心灾情的方式令人不适

头条要闻

媒体:美国驻华大使馆关心灾情的方式令人不适

体育要闻

梅西:巴萨10号与阿根廷10号

娱乐要闻

王宝强携女友回工作室!相恋8年仍未婚

财经要闻

章子怡套现3亿 上美拿什么补韩束的缺?

汽车要闻

限时权益价28.99万起 FREELANDER神行者8正式上市

态度原创

家居
旅游
本地
艺术
游戏

家居要闻

2026建博会(广州) 公装联探展交流活动

旅游要闻

2026教师节郑州、河南部分免票景区

本地新闻

昆明的雨,解锁汪曾祺的浪漫雨季

艺术要闻

放大《汉宫春晓图》:撕掉宫斗剧滤镜,这才是明代深宫女子的真实日常

《堕落之主2》官方角色人气对决 两大性感女角同台

无障碍浏览 进入关怀版