![]()
9月2日,“AI 教母” 李飞飞的创企 World Labs 发布了全球首个多模态世界模型—— Atlas。
![]()
World Labs 官方介绍,其从头开始对 Atlas 进行预训练,使其能够接受多模态输入,包括相机移动,并将其转化为 3D 视图。
通过在模型的空间上下文中定位多个输入视图,Atlas 允许用户生成具有精确控制的图像和视频帧。
Atlas 还能从一张到多张输入图像输出明确的 3D 模型,超越了顶级开源重建模型。
Atlas 会根据你指定的任意摄像机位置和角度生成一个或多个参考图像。生成的视图与输入图像的内容和几何形状相匹配,能够平滑地扩展图像,自主想象输入中看不到的场景部分。
![]()
![]()
![]()
具体来看,Atlas 是一个多模态自回归扩散 Transformer,它的能力包括:
相机控制生成:Atlas 通过像素精确的相机控制从一张或多张图像生成图像和视频,输出最长 1 分钟的 1440p 视频。
空间重建:Atlas 能够重建从一张到数十张输入图像的真实场景。它既能从新颖视角生成图像帧,也能生成显式三维输出,优于专门用于三维重建的先进模型。
时空模拟:Atlas 通过输入视频建模空间和时间,重新构图视频以增强戏剧性视觉效果,并支持机器人的真实到模拟工作流程。
图像生成:Atlas 支持从文本生成图像和 360 度全景,它可以跟随复杂的提示,渲染文本,并生成各种视觉风格。
World Labs 官方表示,目前 Atlas 已经向部分合作伙伴开放 Early Access,将在未来几周内开放早期访问。
李飞飞本人将其视作 World Labs 的「里程碑式」成果,表示Atlas为从视觉特效到机器人的众多应用场景打开了大门。
![]()
飞飞高徒、英伟达机器人主管 Jim Fan 也来捧场,指出:这是机器人领域 Real-to-Sim 的一大步。
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.