![]()
编辑:kid
拍过 AI 视频的人,大概都经历过这种崩溃:
你写了半天提示词,要求镜头绕人物一圈。结果镜头是动了,人物的脸也跟着“重新装修”了一遍;背景里的门一会儿在左边,一会儿又跑到了右边。
说白了,很多 AI 视频看起来像导演,工作方式却更像抽卡。
现在,李飞飞想把这件事改掉。
9 月 1 日,她创办的 World Labs 发布了新模型 Atlas。官方给出的演示很直接:放进一张或几张照片,再指定镜头从哪里出发、往哪里走,Atlas 就能生成新的视角,最长可以做到 1 分钟、1440p。
更夸张的是,它不只想生成一段好看的视频,还想把照片背后的空间“搭”出来。
![]()
01
以前让 AI 运镜靠许愿,现在可以直接“画路线”
Atlas 最容易看懂的能力,叫“相机控制生成”。名字有点硬,实际操作并不复杂。
以前用 AI 生成视频,你只能告诉它:“镜头慢慢向左移动,再绕到人物背后。”至于它怎么理解,基本看运气。
Atlas 换了一种做法:别只用文字形容,直接把相机的位置、角度和运动路线交给模型。
这就像过去你只能站在摄影棚外喊“拍得高级一点”,现在终于能走进去,告诉摄影师机位放哪儿、轨道怎么铺、镜头什么时候转弯。
World Labs 展示的例子里,用户可以用一到六张参考图,手动设计镜头路径,再让 Atlas 补出沿途画面。模型还会尝试保持人物、建筑和背景之间的空间关系,不让它们随着镜头移动随意“漂移”。
官方称,Atlas 最长能生成 1 分钟的 1440p 视频。这个数字很抢眼,但现在还不能简单理解成“人人都能一键拍大片”——Atlas 目前只向部分合作伙伴开放早期体验,普通用户还无法大规模实测它的稳定性、速度和成本。
![]()
02
只拍到正面,背面从哪里来?答案是:AI 猜的
Atlas 最神奇、也最需要警惕的地方,是它能生成相机从未拍到的区域。
比如你只给它一张机器人的正面照,然后把虚拟镜头绕到背后。原图里根本没有背面信息,Atlas 仍会生成一个“看起来合理”的背影。
这不是它真的看见了背面,而是模型根据训练中学到的世界知识,把缺失部分补了出来。
所以,Atlas 生成的是一个“可能存在的世界”,不一定是原本那个世界的精准复制。
这个区别非常重要。
如果是拍广告、做分镜、设计游戏场景,合理的想象往往已经够用;但如果拿它复原事故现场、建筑细节或新闻画面,模型补出来的内容就不能被当成事实。
当然,用户也能通过增加照片来减少它“自由发挥”的空间。World Labs 表示,输入的视角越多,Atlas 掌握的真实信息就越完整,依赖想象补洞的地方也会越少。官方展示了斯坦福校园等案例:从少量地面照片出发,生成新的俯视和移动视角,还能输出点云、3D Gaussian Splatting 等三维结果。
对普通人来说,可以把它理解成:过去 AI 只会把一张照片改漂亮;现在它开始尝试回答“这张照片拍摄的地方,转过身可能是什么样”。
03
真正的大招,可能不是拍视频,而是给机器人造“练功房”
如果 Atlas 只是让短视频运镜更丝滑,它会是一个很吸睛的创作工具。
但 World Labs 真正押注的,是机器人。
训练机器人有个现实难题:不能真让它在工厂、仓库和家里一天撞八百次桌角。真实采集又慢又贵,人工搭建仿真环境同样费时。
Atlas 的思路是,先用手机或少量相机拍下现实空间,再把它转换成一个可供机器人反复试错的数字训练场。
![]()
在官方演示中,研究人员用普通拍摄设备记录环境和机器人操作,再让 Atlas 协助生成机器人在不同位置可能看到的画面与深度信息。一个现实房间,可以被复制成多个光照、摆放和障碍物条件不同的版本,供机器人反复训练。
这有点像学车。
以前必须把新手直接塞进真实道路;现在先做出一个足够像真的驾校模拟器,让它在虚拟世界里练到不再横冲直撞。
World Labs 还展示了“子弹时间”式的视频重构:不用电影片场那种密密麻麻的相机阵列,只用三到五台普通手机或运动相机,就能从新的角度观看已经发生的动作。
![]()
这也是 Atlas 最有传播力的反差:看上去只是几部手机和几张照片,背后想做的却是一个能拍摄、能重建、还能让机器人进去训练的世界。
不过,演示漂亮不等于已经解决所有问题。画面在视觉上连贯,不代表尺寸、碰撞、受力和时间变化都符合真实物理规律。机器人要在工厂或家庭里可靠工作,还需要更多第三方测试。
04
结语
大语言模型让 AI 学会了“说世界”,图像模型让 AI 学会了“画世界”。Atlas 想再往前走一步:让 AI 知道镜头站在哪里,画面背后还有多大空间,下一步可以往哪儿走。
它现在仍处于早期阶段,普通用户能不能用、一次生成要花多少钱、长镜头会不会变形,都还没有答案。
但方向已经很清楚了:AI 视频的下一场竞争,可能不再只是比谁画面更精致,而是谁更能听懂导演的话;世界模型的下一场竞争,则是看谁能把现实更快地搬进电脑,再让机器人走进去。
如果几张手机照片就能生成一个可随意运镜的三维空间,你最想先拿它来做什么——重拍一段旧回忆,还是给自己家做一个数字分身?
— 完 —
科技前沿进展每日见
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.