网易首页 > 网易号 > 正文 申请入驻

6毛一秒后,AI视频开始补物理课

0
分享至



生成视频的单价在跌,拿到可用镜头的成本却未必下降。

AI 短剧让这笔隐性开销变得具体。人物转身后五官变样,连贯的动作中途断裂,台词与口型对不上,几秒钟的画面就足以暴露问题。观众只需一瞬间就会出戏,制作团队却可能为此重做整段镜头。生成费用降了,返工仍然要付钱。

价格竞争因此只能解决视频生产的一部分问题。可灵、MiniMax、字节Seedance和 Google Veo 等模型,让创作者有了更多选择;圈内流传的“6毛一秒”,也强化了生成视频越来越便宜的印象。不过,不同报价对应着不同的分辨率、时长、音频能力和套餐条件,很难直接当作同一把尺子。对付费用户,更有意义的比较是:交付一条合格镜头,究竟需要花多少钱、等多久。

越过画质与分辨率的初级门槛,这门生意正悄悄换了“卷法”:意图能不能理解对,动作连不连贯,事情发展合不合常理。落到AI视频实际创作中,这最终影响的是生成效率:同一段镜头需要尝试多少次,才能得到一条连贯、自然且具备可用潜力的结果,往往比单纯的每秒价格更能反映视频生成的真实成本。

9月16日,智象(HiDream.ai)推出原生全模态视频模型 HiDream-O1-Video-1.0(下文简称HiDream V1),被视为这个行业转折的样本。其将物理规律和模型智能放在了产品叙述的中心,希望改善的,是模型能否理解要求、保持动作连贯,并让事件按合理的因果关系发生。

在这款最新模型上,智象把篇幅留给了物理规律和模型智能水平。

在一次内部讨论会上,创始人梅涛和团队在白板上用彩笔写下对世界模型的设想。正中间是一行红字:“mold the world”,建模世界,也建构世界。

在智象CTO姚霆眼里,这款视频模型已经在解“理解世界”这道更难的命题。

姚霆说,智象对于原生模全态模型架构的底层思想,仍然是让各个模态都在统一框架下生长,在上面长出图像生成模型、长出视频生成模型、长出交互式世界模型,但其中,他们会对于如何在这个底层框架上长成真正的世界模型,作出新的探索和尝试。这也是这家公司独特的技术风格和基因。

梅涛把世界模型拆成三步:先学各种模态的表达,对现实完整建模;再结合物理法则和因果推演,也就是 Reason the world;最终顺着人的想法把物理世界重建出来,即 mold the world。

这次发布强调的物理规律与模型智能,正卡在推演与建构之间。这也是智象几类模型里最靠近 mold the world 的一次尝试。视频模型补齐,这家公司的世界模型拼图才算齐整。

近半年,头部模型轮番降价,圈内传出“6毛一秒”。尴尬的是,成片流水线上的试错开销一点没省。

具身智能,成了考量视频模型能否理解现实的另一道试题。归根结底,考的都是对物理世界合不合理的推演,正是梅涛所说的“Reason the world”。

从理解到建构世界:最关键的指标是智能水平

视频模型的下一道门槛,是把漂亮画面变成可靠的叙事。

2025年6月北京智源大会上,梅涛曾将尚未解决的问题归为叙事性、稳定性和可控性。梅涛与姚霆对行业“Aha moment”的描述也很具体:用户交出一份剧本,系统生成一部符合标准的长片。这个目标同时要求模型理解故事、安排镜头,并让前后发生的事情彼此说得通。

HiDream V1支持文本、图片、视频多模态输入,直接输出音画一体视频。在 Artificial Analysis 带音频图生视频榜上,这款模型排名全球第四,和MiniMax H3、字节 Seedance系列、阿里wan 3同处于全球头部视频模型梯队,中国最顶尖的视频模型正在形成集群竞争的态势。



我们选择在此时,和姚霆再次交流。

HiDream-O1-Video-1.0 从立项到发布用了半年左右,姚霆把这一代与此前视频模型的差别归到三处。

其一是理解模型,先用它读图和读文本,再据此规划。也就是,先理解,后生成。把对输入内容的理解前置到生成之前。

其二是原生全模态架构,视频、文本、音频被放进同一个共享空间里交互,注意力机制采用 linear attention 与 full attention 的混合模式,在速度和效果之间换到更好的权衡。

其三是后训练,用强化学习把物理规律合理程度和音画同步程度顶上去。真正拖慢进度的工程难点落在两处:前期多模态数据的采集与对齐,以及训练框架的并行,后者对 infra 的要求很高。

技术架构的创新是这款视频模型的亮点,姚霆说,这套思路的起点是一次针对性评测。

团队把市面上的视频模型摆在一起测,发现制约智能水平的关键正在于物理规律做得差。姚霆的判断是,视频模型与别人的分野在智能水平,把训练数据复刻一遍算不上智能,训练集长什么样就出什么样,那只是复制。

为了提升智能,HiDream V1让前置的理解模型先读懂画面里的物理规律、读懂文本,再做一轮规划:镜头多长、场景在哪、画面里有什么、用哪种景别和构图、台词与背景声怎么设计。

「这组三支视频中,第一支视频为HiDream V1生成,其余两支为模型A和模型B生成」







提示词:[0秒-4秒] 黑暗泥泞的战壕里,一位疲惫的士兵面部特写,他正对着无线电轻声耳语。台词:“我们需要支援,动作轻点。” 环境音:微弱的风声。[4秒-10秒] 突然他抬起头,拼尽全力大吼。台词:“小心炮袭!” 音效:巨大、震耳欲聋的爆炸声和刺耳的警报声。

规划清单里权重最高的部分交给物理,物体在重力下怎么落,碰撞怎么反馈,惯性怎么延续,光影怎么衰减,空间怎么保持连续。理解结果作为条件信号灌进原生全模态模型,充当生成条件,物理规律的合理性和音画的同步程度都能明显抬升;再通过强化学习,把物理规律的合理程度往上推。


该视频由HiDream V1生成

把最下面的支撑书突然抽走,中间的书和橡皮随即自然下落。无论是失去支撑后的运动反应,还是物体之间的联动变化,都符合真实世界的物理逻辑,说明模型对重力和受力关系的理解已经比较到位。

类似以上镜头在视频生成实践中往往是抽卡重灾区:支撑物被抽走的瞬间,上面的物体要么定在半空,要么乱飞穿模,生成十几条也未必挑得出一条能用的。物理规律遵循得好的直接收益就体现在素材可用率上——少抽卡、一遍过、能直接剪。

这套设计的原因是语言模型对物理规则的理解本身就够用,它能做物理题,缺的是把这层理解迁移到视觉模型。这个缺口,是否能通过补充数据、堆叠3D仿真合成的样本解决?答案是不能。姚霆当然也承认边界,因为现在还没有模型能百分百解决物理规律,而智象的目标是把视频模型在这块的智能水平往上提一提。

姚霆告诉笔者,所谓的智能水平,从几个角度衡量,首先,是对用户意图的理解;其次是对生成过程的强推演;第三是对物理规律的体现。

梳理下来,这套解法由内向外递进:先借意图前置理顺物理关系,避免主体走样、动作变形;再通过原生联合建模锁定声画同频;最后由内容决定镜头长短,回应梅涛强调的可控性。

第二步是声音与画面一起跑。音画同生指的是声音随画面一起生成,敲击、说话、环境变动与对应的声音天然踩在同一个节拍上,无需等视频做完再贴一段配乐。对做视频后期剪辑来说,这省掉的是一整道对轨工序——爆炸声不用再逐帧手动去卡。

姚霆解释,这条路线的收益与代价是,原生音画联合建模的优势在于对齐,感知上更自然;若走业内常见的两阶段方案,先出画面再贴音频,两者之间容易割裂。音频、视频、文本被联合建模,原生一体化,这套形态与原生全模态架构天然耦合,模态之间的信息交互也更充分。代价集中在算力,音画联合建模的训练周期,比单任务单模态要长一些。

第三步是让时长服从内容。用户没有卡死秒数时,模型顺着动作幅度与叙事节律判断镜头长短;专业创作者也可以自己定时间,镜头不必为了凑整硬塞进固定的时间格。


该支视频为HiDream V1生成

提示词:一只小猫趴在窗边,听到窗外的鸟叫,抬起头看了一眼,然后又懒洋洋地趴下。

值得留意这段提示词的写法:没有分镜、没有秒数,没有“不要穿模”等的补丁,只有一个小故事。如果模型对物理规律理解和体现不到位,创作者习惯在提示词里打补丁,把模型容易犯的错提前叮嘱一遍;当物理和时长成为模型自己会算的事,这些补丁都可以删掉,提示词重新回到讲故事本身。

这款视频模型发布之后,距离把一份剧本直接跑成一部长片的“Aha moment”,是更近了,还是仍有鸿沟?

姚霆给了一个谨慎的回答,新的视频模型,在物理规律上,算往前迈了一小步。

一套底座,同源演进,长出了一个世界模型的版图

做世界模型,业内不止视频这一条路。

视频生成关心时间和事件的推移;空间智能与 3D 交互侧重三维环境和操作;具身智能死磕物理感知、动作规划和反馈;自动驾驶聚焦场景预判。每条线上都有人跑,既有大模型公司,也有机器人队伍和 3D 技术老兵,各家目标和成熟度差别不小。

这条赛道远谈不上收敛。2026 年以来,世界模型成了大模型之后最热的关键词,海内外机构密集入场。OpenAI 的 Sora 系列自称“世界模拟器”,从海量视频像素里涌现出物理规律;李飞飞的 World Labs 走空间智能路线,用显式的 3D 表示重建可交互的世界;图灵奖得主杨立昆的 AMI Labs 押注 JEPA 潜空间预测,认为直接生成像素是一种幻觉……

资本正在为这场路线之争加压。

2026 年上半年,国内世界模型相关融资超过三十起,总额超过四十亿元;海外,李飞飞的 World Labs 拿下超十亿美元融资,英伟达与 AMD 罕见同时押注,杨立昆的 AMI Labs 以 10.3 亿美元种子轮创下欧洲 AI 领域的纪录。热钱涌入的另一面,是这个赛道至今没有一把公认的尺子。

行业里已经有人提醒,当前缺少公平、标准、统一的评测基准,多数评测还停留在视频生成一类的指标上,而世界模型真正需要的是物理因果推演能力。

这也是此次智象的新模型强调的能力。图像模型管静态内容,视频模型管运动与时间,世界模型抓空间交互,具身模型抓感知执行,这是智象定下的矩阵。

搭建这张版图并非单线推进。2026年4月底,公司推出统一原生全模态架构与图像大模型 HiDream-O1-Image;8月发布原生全模态交互式世界模型HiDream-O1-World;9月7日发布具身世界模型HiDream-O1-Embodied;直到9月16日,视频模型 HiDream-O1-Video-1.0 补全登场。图像在前,视频在后,中间隔了几个月。

而视频模型这条线本身的技术积累,要追溯到更早。

2024年1月,智象率先实现超15秒视频生成技术突破;同年7月,推出全球首个商用 DiT 大模型 HiDream 2.0;12月,发布采用扩散自回归架构的 HiDream 3.0。从 DiT 到扩散自回归,持续推动视频模型从生成能力向深层理解演进。今天发布的 HiDream-O1-Video-1.0,则实现了在面向世界模型方向的新一代 UiT 架构上的再次升级。

从时间线可以看到,智象的视频模型经历了从 TGANs-C 到 DiT、再到扩散自回归、最终走向 UiT 架构的完整演进。



(虎嗅注:TGANs-C 是智象团队于 2017 年提出的早期视频生成模型,也是全球较早的文生视频研究之一,采用 GAN 路线生成连续动态画面。以 Sora 为代表的 DiT 架构,则通过 Transformer 统一处理图像或视频单元,取代传统扩散模型中的 U-Net,提升画面细节与表现力;扩散自回归结合逐段生成与扩散去噪,增强长视频的连贯性和稳定性。UiT 是智象布局的原生全模态架构,将文本、图像、视频、音频和动作等信号纳入统一模型,实现一体化的对齐、理解与生成。)

这条技术线也解释了为什么 HiDream-O1-Video-1.0 能在物理规律和智能水平上实现系统级提升。

姚霆承认,视频模型的行业路线并未完全收敛,行业传统 DiT 架构通常搭配 full attention。

智象选的是另一条:依托自己的原生全模态架构,把音频信号、视频、文本放在一起原生地联合建模,抬高模型的天花板,同时用 linear attention 与 full attention 的混合模式,在速度和效果之间换到更好的位置。(虎嗅注:full attention 与 linear attention:full attention 让每个单元都和其余所有单元两两比对,效果最好,但计算量随序列长度平方增长。linear attention 用近似计算把开销压到与长度成正比,长视频上更快、更省显存,代价是精度会略打折扣,所以智象把两者混合着用。)

这个选择的背后是一次取舍。只做视频、再往世界模型延伸,是把任务一件件串起来做;智象把原本串行的几个任务并到一个阶段,先把统一的底座打厚。

代价是单个任务看着慢,好处是底座一旦成立,后面的模型出得就快。

回到智象未来的那条时间线。“图像在前、视频在后”容易被读成一条串行的工序,好像先做完图像,再回头做视频。姚霆纠正了这个印象:统一的基础模型立起来之后,各个任务是并行推进的,图像和视频同时在同一个底座上生长,只是视频的算力消耗比图像大得多、训练周期也长,露面才晚了一截。并且,视频模型的迭代频率,业内普遍就不高。

底层逻辑是让不同任务的能力从同一个底座上长出来,不必围着视频单搞一套烟囱。这套架构此前在图像上试过水:HiDream-O1-Image 用 8B 参数做出了超大参数体量的效果,关键在底层架构更早完成了跨模态对齐、理解和生成,跟堆卡卷参数无关。

当然,这种路径也更符合创业团队追求高研发杠杆的战略选择。原生全模态路线的关键,是把有限投入转化为可以持续复用的底层能力,让不同任务共享同一套技术底座,而不必每进入一种新模态就重起炉灶。

这笔账的核心是,哪些数据流和工程工具真能共享?既有积累给视频模型省了多长开发时间?底座升级怎么带动其他业务?多线并进会不会反而分散算力?

共享到哪一层,姚霆给的例子是原生全模态基础架构本身:图像模型和视频模型共用其中一部分,结果是两者在语义上高度一致。而 V1 里的前置理解模块必须单独建设,尤其要往“视频中的物理规律”这个方向加强。

“一个架构上长出来的几朵花”,是姚霆对 O1 系列的概括。



视频 Agent 也将持续为底层模型的迭代提供参考,进一步提升模型对用户需求的理解。

做视频生成模型的这波人,最有可能把世界模型做成

从图像切到视频,再从内容延伸到具身推演,有智象自己的脉络。

智象给自己的定位是“视频领域的 Anthropic”:避开大厂锋芒,不去拼没有边界的通用基模,顺着垂直场景优化模型,做企业服务而不是单纯追 C 端流量。这解释了它为什么没把刷榜和卷参数当成唯一的故事。

姚霆把护城河拆成了四层:最底下是基础模型能力,对外做通用 API,这里迟早杀成红海,价格见底,利润摊薄;往上是标准功能,比如通用文生视频、图生视频,容易同质化;再往上是行业定制能力,比如剧本分镜拆解、广告视频生成;最顶层是嵌进产业流程的端到端工作流。姚霆觉得,真正的壁垒在三四层,那些沉在具体行业里的经验,别人很难调个 API 就抄走。这套防线理论目前更多是智象自己的战略判断,能不能挡住巨头和同行的追赶,还要看时间给出的答案。

姚霆给了时间表:接下来一个月内,V1 的意图理解、物理模拟与音画协同会全部接入Agent。

至于一个真实的创作者端到端成片案例,姚霆告诉笔者,要等 V1 接入 vivago R1 agent(国内版本[够搭]) 之后才有样本。提效多少也不好量化,因为不同用户对效果的要求本就不同;到了视效上的专业把握和最终剪辑成片,仍要人工兜底。

“做视频生成模型的这波人,最有可能把世界模型做成。”梅涛曾说。

2026 年行业对世界模型的理解逐步形成共识:世界模型本质上要训练出一个能够理解并预测物理世界的大模型,不具备大模型训练能力的公司,很难真正做好这件事。拥有视频模型训练能力的公司,已经具备世界模型训练基础。从文艺创作类视频模型拓展具身智能相关的世界模型,需要加入更多训练数据符合物理规律。因此场景数据的选择、规模和标注质量变得较为关键。

也因此,具身智能成了智象未来进入世界模型的其中一个切口

HiDream V1对具身智能的助力有两处。数据生成层面,它能产出物理规律更合理的视频,用来做具身智能的训练数据扩增;架构层面,基于HiDream V1可以更好地搭 World Action Model,供具身模型继续演进。

和诺亦腾的协同,目前推进的正是第一块。也就是具身智能训练数据的样本扩增。

视频生成模型公司究竟可以为具身的数据带来多大价值?又如何衡量?当通用大模型的能力也被引入具身模型训练中时,与视频生成公司之间是能力互补还是竞争?

姚霆说,如今,智象未来在具身训练数据上,团队已经做到毫米级精度的合成数据生成。这是什么概念?如果说生成的数据的精度达到厘米级的精度,那对它的预训练就已经有很好的提升。如果误差达到毫米级,那可能不仅仅是预训练了,后训练的话都会有很大的作用。

至于GPT这样的模型,姚霆举了个例子,当你让模型生成一个苹果,通用模型可能会生成像苹果形状的物体。但不一定会生成一个真正的苹果。而多模态的模型,可以生成一个真实世界的苹果。

结语

HiDream V1 问世,是智象参与前排角逐的一步,过去的投入能不能帮上新业务,不同的模型能不能相互搭手,这些能力能不能在真实干活中持续修正。

视频模型的竞争,还远未到语言模型这种“神仙打架”的阶段,路线也尚未收敛,但技术迭代在加快,从原来大概一年一迭代,到现在缩短到半年左右。

不过,世界模型的构想再宏大,“mold the world”写在白板上再好看,撑起它的始终是那些不起眼的物理常识:杯子还会不会突然蒸发,动作前后接不接得上,金属撞击与声音波形对不对得齐。

世界可以始于想象,但商业终究要按期交出答卷。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
抵达北京,姚明官宣,正式上任,亮相新岗位,亲自督战

抵达北京,姚明官宣,正式上任,亮相新岗位,亲自督战

喜欢体育的猫
2026-09-24 12:24:57
国足3球大胜!7战马尔代夫全胜,王子铭戴帽,连刷6大纪录

国足3球大胜!7战马尔代夫全胜,王子铭戴帽,连刷6大纪录

奥拜尔
2026-09-24 21:32:25
真相大白!王楚钦带队输球原因曝光,王皓用错人,刘国正一针见血

真相大白!王楚钦带队输球原因曝光,王皓用错人,刘国正一针见血

曹说体育
2026-09-24 19:34:13
交通运输部副部长李扬:中秋和国庆隔了3天,有的人会进行调休,假期会有13天,长途旅游出行会成为新的增长点,我们有信心让大家平安出行

交通运输部副部长李扬:中秋和国庆隔了3天,有的人会进行调休,假期会有13天,长途旅游出行会成为新的增长点,我们有信心让大家平安出行

政知新媒体
2026-09-24 19:02:48
马未都被质疑好大的“谱”!与一众商界大佬聚会,全程不起身,别人敬酒他也坐着,周鸿祎带小弟出席

马未都被质疑好大的“谱”!与一众商界大佬聚会,全程不起身,别人敬酒他也坐着,周鸿祎带小弟出席

火山詩话
2026-09-24 06:11:17
2999元 !苹果新品突然上架,9月24日 ,正式开售

2999元 !苹果新品突然上架,9月24日 ,正式开售

科技堡垒
2026-09-24 09:35:56
无缘9连冠!国乒男团36年首败 日本60年首金 张本智和疯狂庆祝

无缘9连冠!国乒男团36年首败 日本60年首金 张本智和疯狂庆祝

念洲
2026-09-24 19:14:19
不回国了?名古屋亚运会出现荒唐的一幕,两名朝鲜成员不愿回家了

不回国了?名古屋亚运会出现荒唐的一幕,两名朝鲜成员不愿回家了

青青衫书生
2026-09-24 12:37:07
已确认!是西安籍演员窦骁

已确认!是西安籍演员窦骁

91.6陕西交通广播
2026-09-24 15:34:33
越南深度改革对我国的启示

越南深度改革对我国的启示

大国老记老顾
2026-09-24 11:18:00
刚刚,Claude发现神秘DNA系统!狂烧21 亿Token挖出「上帝手术刀」

刚刚,Claude发现神秘DNA系统!狂烧21 亿Token挖出「上帝手术刀」

新智元
2026-09-24 07:39:57
游本昌安然离世,生前朋友圈置顶是胡歌!六公主缅怀,众星发文悼念

游本昌安然离世,生前朋友圈置顶是胡歌!六公主缅怀,众星发文悼念

露珠聊影视
2026-09-24 15:30:21
66.8万!吉利新车正式上市!

66.8万!吉利新车正式上市!

科技堡垒
2026-09-24 09:36:29
以色列驻美大使儿子遭车冲撞生命垂危,一司机被击毙,内塔尼亚胡赴美前探望

以色列驻美大使儿子遭车冲撞生命垂危,一司机被击毙,内塔尼亚胡赴美前探望

红星新闻
2026-09-24 16:21:49
亚运会9连冠梦碎!可怕的不是国乒2-3输日本,而是仅靠王楚钦不够

亚运会9连冠梦碎!可怕的不是国乒2-3输日本,而是仅靠王楚钦不够

侃球熊弟
2026-09-24 18:07:12
亚运会|王楚钦谈男团失利:心情非常沉重,能力上还有差距

亚运会|王楚钦谈男团失利:心情非常沉重,能力上还有差距

北青网-北京青年报
2026-09-24 21:31:04
亚运16连胜!中国女篮大胜蒙古晋级四强 杨舒予21分张子宇20+9

亚运16连胜!中国女篮大胜蒙古晋级四强 杨舒予21分张子宇20+9

醉卧浮生
2026-09-24 13:33:50
演员赵露思成都甜品店试营业,1份凉面48元,营业仅40分钟后,第一批商品基本售完,有消费者为了吃上一口,排队长达90分钟

演员赵露思成都甜品店试营业,1份凉面48元,营业仅40分钟后,第一批商品基本售完,有消费者为了吃上一口,排队长达90分钟

大风新闻
2026-09-24 17:05:10
价格太夸张了,小米正式发布 18 Pro/18 Pro Max!

价格太夸张了,小米正式发布 18 Pro/18 Pro Max!

XCiOS俱乐部
2026-09-23 20:44:19
比利简金杯:郑钦文0-2生涯首负保利尼,意大利1-1扳平比分

比利简金杯:郑钦文0-2生涯首负保利尼,意大利1-1扳平比分

懂球帝
2026-09-24 22:19:05
2026-09-24 23:28:49
虎嗅APP incentive-icons
虎嗅APP
个性化商业资讯与观点交流平台
27875文章数 688104关注度
往期回顾 全部

科技要闻

Claude在DNA里挖出新发现!大佬张锋点赞

头条要闻

高市飞十几小时只见特朗普35分钟 回国未见美官员送机

头条要闻

高市飞十几小时只见特朗普35分钟 回国未见美官员送机

体育要闻

巴图姆,以父之名

娱乐要闻

93岁游本昌去世 最后一句话惹人泪目

财经要闻

跌光1400亿,“女王”亏麻了

汽车要闻

全新第四代博越L 上市限时价9.29万元起

态度原创

健康
家居
旅游
手机
房产

鼻子三角区的痘,千万别乱挤!

家居要闻

2026建博会(广州) 公装联探展交流活动

旅游要闻

改名藏玄机!从杨黄寨到马头寨,一个名字改写贵州千年土司格局

手机要闻

许斐确认小米18 Pro系列手机将走向全球,推出国际版

房产要闻

中秋、国庆小长假来了,但我劝你别离开海口

无障碍浏览 进入关怀版