![]()
【摘要】在AIGC视频赛道竞争进入平台化阶段后,独立创业公司的增长逻辑正在发生变化。近期,生数科技相继与光轮智能、星尘智能等具身智能企业展开合作,并将技术布局进一步延伸至世界模型,试图打开视频生成之外的第二增长曲线。
这一转向背后,更值得关注的是生成式AI产业竞争边界的变化。当视频模型能力逐渐趋近,行业竞争开始向更广泛的产业场景延伸,世界模型也成为连接数字世界与物理世界的重要方向。从数字内容生成到物理世界认知,越来越多企业开始尝试寻找技术迁移的新路径。
不过,世界模型究竟意味着能力的自然延伸,还是产业竞争催生的新叙事,行业尚未形成统一答案。从视频生成走向具身智能,真正需要验证的,不只是模型能力能否迁移,更是技术价值能否跨越数字世界与物理世界之间的边界。
以下是正文:
01
视频大模型进入下半场,创业公司的窗口期正在收窄
2024年,OpenAI发布Sora,让视频生成大模型成为全球AI产业最受关注的赛道之一。国内企业迅速跟进,生数科技推出Vidu、快手发布可灵、字节跳动上线即梦,视频生成能力几乎以月为单位持续迭代。生成能力也从一开始的生成几秒钟的短视频,到支持1080P、长时长、多主体一致性生成,模型能力不断刷新行业预期,甚至把才火起来的视频短剧商业,一下子就变成了它的领域和商业。
生数科技正是在这一阶段走进大众视野。2022年,团队提出U-ViT(All are Worth Words)架构,为后续视频生成模型奠定了技术基础;2024年4月,Vidu正式发布,能够一次生成最长16秒、1080P高清视频,并在人物一致性、镜头语言等方面展现出较强表现,成为国内较早受到市场关注的视频生成模型之一。
不过,仅仅一年多时间,行业竞争的重心已经悄然发生变化。
早期的视频模型竞争,更多围绕生成效果展开:谁能够生成更长的视频、谁能够保持更好的时空和人物一致性、谁能够理解更复杂的文本提示词,往往决定了产品的关注度和生成视频的商业价值。但当模型能力快速接近之后,竞争开始向更广的维度延伸。
一方面,互联网平台拥有天然的产品入口和用户生态。字节跳动将视频生成能力与剪映、即梦等产品协同,快手依托可灵与短视频生态形成联动,腾讯、阿里也持续完善各自的大模型产品矩阵。对于平台企业而言,视频生成只是AI能力体系中的一个环节,可以快速接入内容创作、广告营销、办公协同等成熟场景,形成产品和商业闭环。
另一方面,视频模型商业化也进入新的阶段。模型训练需要持续投入算力,高质量视频数据采集与迭代同样成本高昂,而用户对生成质量、速度和价格的要求却在不断提高。竞争逐渐从模型效果扩展到产品体验、运营能力和商业化效率。目前国内视频生成模型第一梯队已聚集即梦、可灵、Vidu等多家产品,模型能力差距持续缩小,行业竞争呈现平台化、淘汰化趋势。
对于生数科技这样的创业公司而言,这意味着行业竞争进入了新的阶段、新的考验。
即使Vidu保持着较强的技术竞争力,也已经形成MaaS、SaaS等产品体系,并持续拓展海外市场覆盖全球200多个国家和地区。但随着视频生成模型逐渐走向成熟,创业公司的竞争压力也在增加。相比互联网平台企业,创业公司在用户入口、内容生态、算力资源以及商业化场景等方面往往缺少长期积累,仅依靠模型能力差异,较难建立持续性的竞争壁垒。
因此,仅依靠视频生成这一单一赛道,如何进一步拓展技术价值和商业空间,成为摆在生数科技面前的一道现实课题。将已有的模型能力延伸至新的产业场景,寻找新的价值锚点,也成为其近年来战略调整的重要方向。
02
从视频生成到世界模型:生数科技为何押注具身智能?
在外界看来,生数科技近期频繁与具身智能企业合作,似乎意味着一家视频生成公司开始跨界机器人赛道。但从技术演进的路径来看,这一转向并非毫无关联,而是试图将视频生成过程中积累的能力延伸到新的应用场景。
Vidu的核心竞争力,从来不只是生成一段画面,而是AI工具理解画面如何随时间变化。
无论是人物动作的连续性、镜头切换的自然衔接,还是复杂场景中的物体交互,视频生成模型都需要学习现实世界中事物的运动规律,并预测下一时刻可能发生的变化。这也是生数科技早期提出U-ViT架构的重要意义所在。U-ViT将Transformer引入扩散模型统一框架,在图像、视频等多模态生成任务中建立起较强的时空建模能力,也成为Vidu持续迭代的重要技术基础。相关论文发表于2022年,随后又支撑了Vidu视频大模型的研发。
![]()
图源:Vidu官网
这种能力,恰好与近年来AI领域不断升温的“世界模型”形成了一定程度的连接。
与文本模型相比,视频天然包含连续时间、空间变化和物体运动信息,因此不少研究者认为,视频生成模型在学习现实世界动态规律方面具有一定优势,这也成为近年来世界模型研究的重要技术来源之一。
目前行业对于世界模型尚无统一定义,但普遍认为,其目标是在模型内部建立对现实世界状态及其变化规律的可预测表示。对于视频模型而言,它需要预测下一帧画面;对于机器人而言,它还需要进一步预测自身动作将如何影响环境,并据此完成决策与执行。虽然两者面对的问题复杂程度并不相同,但都离不开对时间变化、空间位移和真实因果关系的持续建模。
也正因为如此,越来越多企业开始尝试将视频生成能力延伸至物理世界认知。2026年以来,生数科技陆续与光轮智能、星尘智能等具身智能企业展开合作。其中,光轮智能主要布局机器人数据生成、仿真训练等基础能力,星尘智能则聚焦具身智能系统研发。双方合作的共同目标,是探索世界模型与机器人感知、规划、控制能力的结合,为机器人训练提供更加丰富的数据和环境支持。
![]()
图源:光轮智能
这一布局也体现出生数科技对自身定位的调整。
相比直接进入机器人本体制造,公司更希望延续自身在生成式AI上的技术积累,将视频模型训练过程中形成的时空建模、多模态理解和世界预测能力,进一步沉淀为通用世界模型能力,并尝试成为具身智能产业链中的底层能力提供者。生数科技近年来也逐步将“视频生成模型”拓展为“通用世界模型”的发展方向,希望构建连接数字世界与物理世界的基础模型。
从企业战略来看,这并非简单地进入一个热门赛道,更像是在原有技术基础上寻找新的商业化出口。当视频生成市场逐渐进入平台化竞争阶段,时空建模能力是否能够服务于机器人、自动驾驶等更广泛的物理世界任务,也成为生数科技试图回答的新问题。
03
从数字AI到物理AI,生数科技要跨越的不只是技术鸿沟
从视频生成走向具身智能,生数科技试图完成的并非简单的业务延伸,而是一次从数字世界能力向物理世界能力的迁移。但真正决定这条路径能否成立的,并不只是模型能力是否足够强,更在于数字AI积累能否适应物理AI完全不同的技术逻辑与商业逻辑。
目前,行业对于“世界模型”仍没有统一定义。对于视频生成模型而言,世界模型更多体现为对未来视觉状态的预测,即根据已有信息生成符合空间关系和运动规律的下一帧画面;而对于具身智能而言,世界模型还需要帮助机器人理解环境状态、预测行动后果,并进一步完成感知、规划和执行。两者都涉及对现实规律的学习,但面对的问题并不相同。
换句话说,视频模型能够预测数字世界里会发生什么,并不意味着机器人就知道自己应该怎么做。
这也是数字AI转变成物理AI的第一道技术鸿沟。
相比互联网海量的视频、图片数据,具身智能真正稀缺的是高质量动作数据。机器人不仅需要知道杯子会不会掉落,还需要知道应该以怎样的力度抓取、里面是否有液体、如何调整姿态、在环境发生变化时如何实时修正动作。这些能力更多依赖真实机器人数据、仿真训练以及长期环境交互的数据积累,而非单纯的视频生成能力。
因此,当前包括NVIDIA、Google DeepMind等企业在内,都在加码机器人数据平台、仿真训练环境以及世界模型研究。这也说明,世界模型虽然可能成为连接数字世界与物理世界的重要技术方向,但距离支撑完整机器人系统仍需要多个环节共同突破。
更值得关注的是,数字AI与物理AI之间的差异,并不只存在于技术层面,也体现在商业模式上。
过去几年,生成式AI的发展主要围绕数字内容展开。视频生成模型可以通过API调用、软件订阅、创作者工具等方式快速触达用户,商业化路径更接近互联网软件产品。而具身智能面对的是现实产业场景,客户关注的不仅是模型效果,还包括机器人采购成本、部署周期、稳定运行能力以及长期维护服务。
这意味着,生数科技如果希望将视频生成能力延伸至具身智能,需要面对的不只是技术迁移问题,还需要重新适应一个完全不同的产业生态。在数字内容领域,模型能力提升可能直接带来用户增长;但在机器人领域,技术价值最终需要通过硬件协同、场景落地和规模化交付体现。
因此,生数科技真正需要验证的是原有技术积累能否在新的产业链中形成新的商业价值。
从数字AI到物理AI,这条路径具备一定想象空间,也符合人工智能向现实世界延伸的发展趋势。但两者之间横跨的数据、工程、商业模式等多个环节,也意味着这场转型远比一次技术迁移更加复杂。世界模型能否成为连接两者的关键基础设施,仍需要产业实践进一步验证。
04
尾声
从视频生成到具身智能,生数科技的转向并非一次简单的业务扩张,而是生成式AI产业竞争逻辑变化下的一次主动调整。当视频模型逐渐走向平台化竞争,创业公司需要寻找新的价值空间,世界模型便成为连接数字世界与物理世界的一种可能路径。对于生数科技而言,真正希望迁移的并不是一款视频模型,而是多年积累的时空建模能力。
不过,技术迁移从来都不是概念迁移。从生成视频到理解世界,再到支撑机器人完成真实交互,中间仍有大量技术和工程问题等待验证。世界模型究竟会成为具身智能时代的新基础设施,还是仍需跨越更多产业化门槛,答案或许不在概念本身,而在未来能否经受住真实场景和商业化落地的持续检验。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.