9月2日,李飞飞旗下创企World Labs发布了“全球首个多模态世界模型”——Atlas,该模型不再满足于生成图片、文字,而是可生成具有像素级精确的图像和视频帧,并将其重建为3D世界。
Atlas的核心能力围绕“理解与模拟3D世界”展开,旨在让AI真正理解3D世界的物理法则和几何结构,而不仅仅是生成看起来合理的2D画面,底层创新在于用“空间上下文”(Spatial Context)替换“文本上下文”。Atlas展现出的关键能力包括:只需1到6张图片,就能生成最长1分钟的1440p视频;“少即是多”的空间重建;能处理普通手机拍摄的视频,组成一套多视角拍摄系统;可根据文本描述生成图像及360°全景图。
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.