刷短视频刷了这么多年,你有没有想过,未来抖音不再只是用来 “看” 视频,而是可以直接走进画面当中?已经退居日常管理多年的张一鸣,罕见亲自下场盯一个重点项目。根据彭博社的报道,字节跳动正在推进一款实时空间视频 AI 模型,创始人亲自跨部门协调研发团队,优先调配 AI 算力资源,这款项目最快预计 10 月就会对外亮相。
![]()
很多人会疑惑,一个 AI 模型,为什么需要创始人亲自介入协调?在字节内部,这并不是一次普通模型迭代,而是试图把短视频平台,升级成为可交互虚拟空间的入口。这套新模型建立在已经成熟的 Seedance 电影级视频生成底座之上,但它不再是生成一段录好的短视频,而是可以实时生成能够响应用户动作、语音的三维虚拟环境。
报道披露项目的核心技术目标:实现每秒 20 帧生成速度,端到端延迟控制在 0.05 秒。这个数字意味着,当你戴着 Pico 头显转动头部、向前行走,或者开口发出指令,眼前的虚拟场景可以即时跟随发生变化,不会出现明显卡顿和滞后,达到基础实时交互的门槛。未来可以落地到互动直播、AI 短剧、轻量化虚拟游戏,创作者不需要昂贵的本地图形工作站,依靠云端算力,就能搭建完整的虚拟场景。
![]()
这套方案最巧妙的地方,是把绝大多数吃算力的生成计算全部放在云端服务器完成,Pico 头显只负责采集人的动作、语音信号,接收传回的画面流。
反观 Meta、苹果的空间硬件路线,无论是 Quest 系列还是 Vision Pro,都把强大的芯片塞进头显本体。高性能硬件带来更好的本地体验,但代价就是设备售价居高不下,重量、续航始终难以兼顾,也直接拉高普通消费者的入门门槛,这也是多年来 VR 硬件一直很难大规模普及的现实阻碍。
![]()
字节走了一条差异化路线:用云端 AI 生成来降低终端门槛。理论上,就算是配置普通、价格更低的 VR 头显,只要网络条件达标,同样能够体验复杂的虚拟空间,竞争的重心从比拼头显芯片性能,转向比拼 AI 世界模型、云计算能力、内容生态分发能力。
字节想跑通一套完整的业务飞轮:AI 世界模型负责生成虚拟内容,云计算承担海量算力压力,抖音、TikTok 作为巨大的创作者和用户池产出内容,Pico 硬件作为沉浸式的交互终端,把这几块业务全部串联在一起。
当然,构想很宏大,但现实依旧绕不开几座大山。把实时 3D 生成全部压在云端,意味着体验高度依赖网络稳定性,一旦网络抖动,画面卡顿、撕裂会直接毁掉沉浸感受。同时,大规模并发的云端 AI 推理,算力成本非常高昂,百万级用户同时在线的成本压力,至今还没有成熟行业案例可以参考。
过去 Meta 大力投入元宇宙,花掉巨额资金,却一直没能解决用户少、内容匮乏的恶性循环。字节的优势在于手握短视频海量创作者生态,不需要从零孵化用户。但同样需要面对考验:AI 实时生成的场景能不能保证物理逻辑通顺,大规模商用之后的成本能不能压到大众可以接受的区间。
这已经不再是简单的短视频升级,它在重新定义用户打开平台的方式:从手指上下滑动刷内容,变成身体直接进入 AI 构建出来的虚拟空间。
字节用 AI 生成虚拟世界,你觉得这套模式,会比传统元宇宙方案更容易走进普通人生活吗?
# 字节跳动 #世界模型 #Pico #AI 虚拟空间
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.