![]()
本文刊发于《现代电影技术》2026年第9期
专家点评
龚 波
正高级工程师
中国电影科学技术研究所(中央宣传部电影技术质量检测所)党委书记、所长,《现代电影技术》编委会主任
当前,动作捕捉、虚拟摄制、体积视频采集、3D/4D高斯泼溅、实时渲染等技术日趋成熟,具身感知与智能决策的有效结合正推动影视摄制向人机共生模式转变。同时,虚拟现实电影已纳入电影管理范畴,标准化进程全面提速,具身化观影正从技术实验走向产业实践。未来电影科技的具身化演进将呈现三个积极态势:一是具身智能与电影数智资产深度融合,推动人工智能从生成工具向具备感知与决策能力的具身化创作主体演进;二是虚实融合持续深化,具身智能机器人拍摄与多智能体协同将催生新型人机共创模式,推动影视摄制向全链条具身化、智能化、融合化发展;三是高新技术格式电影加速推广应用,高帧率、沉浸式音频与具身播映体验形成良性互动,虚拟现实、多感官交互不断拓展观众沉浸维度。《从离身生成到具身共创:具身理论下影视行业生态重构与发展路径》一文,系统梳理了影视行业从离身摄制到具身共创的技术演进,提出具身化技术革新不仅是创作生产工具迭代,更是创作认知、流程架构与传播形态的深层重构;论文还从算法多样性引导、跨模态审美校准、技术标准构建、版权确权等层面提出治理路径建议,为人工智能时代具身智能在影视产业中的发展与应用提供了有价值的参考借鉴。
基金项目
国家社科基金一般项目“县级融媒体中心建设的实践困境与对策研究”(23BXW067)。
作者简介
![]()
郭全中
博士,中央民族大学新闻与传播学院教授、博士生导师,互联网平台企业发展与治理研究中心主任,主要研究方向:智能传播、智能经济、人工智能。
徐嫣泓
中央民族大学新闻与传播学院硕士研究生在读,主要研究方向:戏剧与影视。
![]()
摘要
在人工智能(AI)、数字媒介技术加速迭代与影视工业化深度转型的背景下,传统影视产业在内容生产效率、叙事表达边界与分发传播模式上遭遇结构性瓶颈,亟需通过前沿智能技术的系统性嵌入实现生产范式的升级。本文引入具身认知(Embodied Cognition)理论框架,从多智能体(Multi⁃Agent)协同创作链路演进、摄制技术具身化范式革新、具身虚拟现实(EVR)体验呈现方式发展三个技术维度,系统剖析具身理论引导下,具身认知、具身智能、具身媒介、具身交互等概念和技术与影视创作全链条的融合机理,并结合国内外代表性实践案例归纳当前融合阶段的技术特征、应用限度与约束条件。研究认为,具身认知理论下影视行业的技术革新不仅是生产工具的迭代升级,更是创作认知范式、制作流程架构与媒介传播形态的深层重构,需从算法多样性引导、跨模态审美校准、技术标准体系构建与数字版权确权机制等层面建立系统性技术治理路径。
关键词
具身化;具身认知;具身媒介;具身交互;具身智能
1
引言
具身认知(Embodied Cognition)概念最早由莫里斯・梅洛-庞蒂在《知觉现象学》中系统论述,认为身体是知觉与认知的本源,主张人类认知活动应当扎根于躯体感知实践,力图使认识过程回归于身体本身,从而彻底颠覆了笛卡尔“身心二元对立”的传统认知框架[1]。维维安・索布切克率先将该理论引入电影研究领域,建构起了“电影身体”相关分析框架[2]。由此,具身思想逐步从纯哲学范畴落地为影像内容创作的核心指导逻辑,为影像创作与受众接受范式提供坚实理论基础。
具身认知是认知科学领域的重要理论框架。当前热门的具身智能(Embodied Intelligence)技术,其思想源自具身认知,是受其启发发展起来的人工智能(AI)技术范式。
随着生成式人工智能(GAI)、空间计算等前沿技术取得突破性进展,虚拟摄制、动作捕捉、扩展现实(XR)、实时渲染、多模态感知与多智能体(Multi⁃Agent)协同等技术逐步落地,全球影视产业正处于从传统摄制体系向工业化、智能化摄制流程深度转型的关键节点。传统影视产业长期依赖的线性生产模式日益暴露出多维度的结构性困境:内容生产层面,人力密集型的创作流程面临“效率天花板”与成本增长的双重制约;叙事表达层面,传统视听语言的边界约束限制了创作者对沉浸式、交互式叙事形态的探索;分发传播层面,单向度的播映模式已难以适配多终端、多场景、多交互形态的媒介生态。
在此背景下,影视内容创作生产正在经历一场从离身式符号生成(Disembodied Symbol Generation)向具身化身体-环境耦合(Embodied Body⁃environment Coupling)的深层转向,不仅打破了媒介形态、受众体验与叙事文本间的传统边界,更为产业业态升级提供了新的技术路径与理论视野。然而,这一变革绝非制作工具层面的简单迭代,而是对内容创作观念、技术体系与传播范式的全方位重构;具身化进程与影视行业深度融合的过程中,技术发展失衡、专业人才断层、行业规范滞后等问题也逐步显现。如何在工具理性与影视作品的人文内核之间保持张力,在商业开发与原创表达之间寻求平衡,已然成为行业实践与学术研究共同关注的核心议题。
本文正是在这一理论背景下,系统梳理影视产业的变革趋势,深入分析融合过程中面临的现实挑战,并针对性提出适配影视产业高质量发展的优化路径。
2
具身认知理论下影视行业变革趋势
2.1 影视行业具身化发展框架
具身认知、具身媒介(Embodied Media)、具身智能、具身交互(Embodied Interaction)等概念与技术,正与影视创作、生产、播映的全链条发生深度融合。这一融合过程可沿“创作端-摄制端-呈现端”三个环节加以梳理(图1)。在创作端,多智能体协同编剧、AI辅助创意生成引擎与剧本智能评估优化系统构成了多智能体协同创作链路的演进路径,推动剧本生成、概念设计、分镜生成等环节从人工主导向人机协同转型。在摄制端,虚拟摄制系统、动作捕捉与数字人驱动、实时渲染引擎、具身智能机器人拍摄辅助以及机器人特技替身共同构成了具身化摄制技术的范式革新,使拍摄过程从传统的人工操作向智能感知与自主决策延伸。在呈现端,虚拟现实(VR)沉浸观影空间、多感官反馈交互与大空间多人协同体验的发展,则标志着具身虚拟现实(Embodied Virtual Reality, EVR)体验呈现方式的持续升级,推动观众从被动观看走向具身参与。
![]()
图1 影视行业具身化发展框架
2.2 影视内容智能生成技术的具身化演进
2.2.1 离身式AI生成的实践困境
当前AI影视生产的主流形态可被概括为离身式AI生成,即AI主体缺乏身体感知与环境交互能力,完全依赖文本提示词和符号运算驱动内容产出。这一阶段的技术实践虽然在生产效率上实现了突破,但其内在局限性也日益暴露。
导演尼尔·布洛姆坎普推出的AI短片Nightborne,画面由Seedance 2.0系统生成,创作者全程参与创作把控,对每一个分镜和段落节点进行精细设计与决策:人把控故事内核,AI承接重复性视觉生产,大幅压缩前期创意试错周期[3]。这一模式本质上仍是人主导下的工具性使用,AI缺乏自主创作意识与身体感知,创作主体仍然是人类创作者本身。2026年戛纳电影节全球首映的《地狱磨砺》(Hell Grind)被誉为全球首部“AI原生”(AI Native)影片,全片时长95分钟,首次验证了AI以极低制作成本实现长片电影人物高度一致性的技术可行性。该片采用“剧本拆分-多组并行生成”的生产模式,Seedance提供画面生成能力,Soul Cinema和Soul Cast提供叙事支持;团队将完整剧本拆解为若干章节,由不同小组同步生成画面,平均每组日产高质量素材仅约2.5分钟;全片共生成超过16,000段视频片段[4]。为保障画面品质,团队采用极致的提示词工程(Prompt Engineering),单段提示词平均约3000个英文单词,指令维度覆盖8K IMAX级画质、自然光布局、180°快门运动模糊等影像技术参数,甚至需通过文字约束强制AI遵循重力、惯性等物理定律,以规避道具漂浮等低质生成问题[4]。这恰恰暴露了离身式AI生成的根本缺陷:物理规律并非AI通过身体感知自然习得,而需依靠文本约束人工植入。
上述实践表明,当前AI影视工具存在四重短板:一是物理世界认知依赖人工约束,缺乏通过身体交互习得环境规律的能力;二是长时序一致性靠海量试错维持,缺乏连续的身体状态与记忆机制;三是创作自主性不足且对提示词工程高度依赖,仍处于“人发出指令、AI执行”的被动模式;四是多智能体协同尚需人工调度,智能体间缺乏基于具身认知的自主协商与联动能力。其核心症结在于,现有系统尚未建立真正的身体与环境的耦合感知与自主决策机制。
正是这些离身式AI生成无法突破的技术瓶颈,推动影视AI从符号生成走向具身化,开启影视创作的具身化技术转型期。
2.2.2 AI影视创作的感知增强路径
在离身式AI生成暴露出根本局限之后,AI影视创作开始向更具环境感知与逻辑连贯性发展演进。这一阶段的核心特征并非AI获得了真正的物理身体,而是通过对人类具身经验利用,以及对场景空间与角色状态的连续性建模,使AI从“逐帧指令执行”走向“情境化生成”。
具身化以身体与环境的耦合感知为核心特征,使AI主体具备空间推理、物理直觉与连续身体经验,从而突破纯符号生成的技术瓶颈。以爱奇艺纳逗Pro为例,其将武打设计、空间摄影等影视工业的专业知识与动作经验封装为专业Agent与360度全景工具[5],使AI不再被动执行指令,而是具备“会打戏”“懂机位”的专业身体记忆,实现影视技艺的智能传承与高效复用。该路径的本质是将人类创作者积累的具身经验对象化、可复用化,让专业技能不再局限于个体身体,而是成为可调用、可迭代的智能资产。
腾讯WorkRally通过情绪氛围Agent与连续镜头Agent,实现角色情绪在多镜头间的动态衔接、动作状态的跨镜头延续以及场景空间逻辑的一致性维护[6];同时依托内置的“S+级”影视动漫技能库,将微表情、肢体语言、动作编排等专业影视表演知识封装为可调用的算法技能,有效缓解AI生成内容中角色情绪衔接不畅、动作穿帮、跨镜头空间错位等问题。上述技术路径在效果层面与具身认知理论中“认知与行动依赖于主体-环境交互”的命题具有一定呼应性,角色表演连贯性不再完全依赖人工逐帧调控,而在一定程度上通过系统对剧情情境、动作状态与空间关系的连续性理解获得支撑。但就技术实现而言,当前AI角色尚不具备真正意义上的自主身体经验与内在情绪记忆,其具身性仍体现为对人类表演知识的系统化封装与跨镜头一致性维护,属于影视生产领域具身化发展的早期应用形态。
2.2.3 具身认知支撑的多智能体协同创作系统
在AI技术驱动影视创意体系迭代的行业趋势下,多智能体协同系统正在逐步取代传统线性创作流程,成为全球影视工业化生产的重要辅助手段。与离身式单一文本生成模型不同,影视专用多智能体架构以具身认知数据为底层支撑,可在叙事、美术、表演与镜头四大模块各司其职并实现实时数据互通,形成“人类统筹、多智能体协同”的全新创意生产逻辑。整套系统可自动解析剧本文本,同步完成分镜排布、角色肢体具身动作生成、虚拟场景实时预演(PreViz)与镜头运动模拟等全链条工作,打破以往编剧、分镜师与美术团队割裂的创作壁垒,大幅压缩前期筹备周期。
学术研究层面,电影智能体(FilmAgent)能在虚拟3D空间中模拟导演、编剧、演员等角色,使演员Agent在虚拟环境中具备空间感知与动作执行能力,自动完成从剧本到摄制的全流程[7],为智能体影视内容具身化创作提供了可参考的技术范式。产业应用层面,万兴科技推出的万兴剧厂(reelmate.cn)构建了涵盖编剧、角色导演、场景美术、分镜导演等多专业Agent的协同创作工作流,通过结构化数据流转实现从剧本到成片的全链路AI化生产[8]。但需指出的是,万兴剧厂更偏向工作流式多智能体,其模块以流水线式编排且自主性弱,尚不具备自主身体感知与环境交互能力,属于多智能体架构的初级形态,与真正意义上的具身多智能体系统存在技术代差。
从离身式生成到工作流式多智能体,再到具身多智能体协同,构成了影视创作AI技术演进的清晰脉络(图2)。
![]()
图2 影视创作AI技术演进
2.3 电影摄制的具身化范式革新
2.3.1 虚拟摄制与具身认知技术的融合迭代
在智能技术迭代与后电影媒介转型的双重背景下,传统数字影视制作面临诸多难以规避的困境。长期以来,整套生产体系虚实脱节、表演还原度不足,工业化成本较高。传统工作流程以蓝幕/绿幕拍摄、离线动作捕捉与分段线性模式为主线,其将演员肢体表演、实景拍摄空间与虚拟数字场景拆分成互不连通的独立板块,无论是创作者还是终端受众都难以获得完整身体层面的沉浸式体验。
LED虚拟摄制方式则一定程度上改进了上述问题,通过渲染引擎实时渲染与LED屏内拍摄空间的融合,实现了“所见即所得”:演员无需面对蓝幕/绿幕进行无实物表演,而是置身于真实光影与数字场景共存的物理空间中,肢体运动、视线方向与情绪反馈均可与虚拟环境实时交互,从根本上弥合了表演主体与数字场景的割裂感。然而,当前LED虚拟摄制仍存在前期资产制作周期长、场景交互自由度有限、数字角色与真人表演难以同框实时交互等技术瓶颈,其本质仍是“人在真实空间、景在数字空间”的半具身模式,距离创作者与受众双向的完全具身体验尚有差距。
具身智能技术通过融合多维度感知、实时交互与数字生成能力,重构影视行业生产逻辑,从根源上突破传统影像制作面临的技术瓶颈与创作局限。在具身化摄制阶段,智能化拍摄辅助系统依托多模态感知、自主导航与实时运动规划能力,能够在复杂片场环境中完成摄影机运镜、焦点跟踪、场景扫描等任务,实现人机协同的现场创作(图3),达到身体-环境耦合的人机共生状态。
![]()
图3 电影摄制的具身化演进
2.3.2 动作捕捉技术的具身化发展演进
动作捕捉技术的核心价值不仅在于提升了数字角色的制作效率,更在于其在影视创作中首次建立了一条从真人身体到数字角色的直接通路:演员的具身运动经验无需经过语言描述、图像绘制等符号转译,而是通过传感器直接转化为数字表演数据。这一过程恰如具身理论所揭示的:认知与行动并非纯粹的符号运算,而是深植于身体的形态约束、物理经验与环境交互中。动作捕捉本质上是对人类身体图式的数字化编码,它为数字角色赋予了源于真实身体的运动逻辑与物理质感,也为后续AI表演的具身化提供了基础数据。
传统影视动作捕捉依赖全身标记点与百万级专业影棚,其部署周期长、外景环境使用难度大,成为应用过程中的核心技术短板。近年来,动作捕捉技术迎来轻量化迭代,基于计算机视觉(CV)和AI的动作捕捉方案日趋成熟。维塔(Wētā FX)在《阿凡达:水之道》中采用了解剖学上合理的面部系统(Anatomically Plausible Facial System, APFS),用178条肌纤维曲线替代传统面部行为编码系统(FACS)线性混合形状,其内部通过神经网络编码肌肉连接关系,实现更加自然的面部动画求解。维塔还使用深度学习(DL)面部求解器加速从捕捉数据到角色绑定的转换流程。
此外,更多采用非专业设备的动作捕捉方法涌现:MediaPipe Holistic仅基于消费级单摄像头即可将面部468个关键点、手部21个关键点(单手)及全身33个姿态关键点的预测整合为统一流程;其通过INT8定点量化与结构化剪枝,模型体积从原始FP32版本的12.4 MB压缩至3.2 MB,推理延迟降低至12 ms,普通个人计算机终端即可实时解算,外景拍摄无需搭建专业棚屋[9]。DancingBox将动作捕捉重新定义为“数字木偶戏”,旨在通过直观操作物理物体以生成数字角色动画,仅需单个普通摄像头,捕捉用户操控日常物品(毛绒玩具、香蕉、笔等)的粗略运动,再通过AI生成模型还原为自然人体骨骼动画。系统无需标记点、动作捕捉服或深度传感器,大幅降低了创作门槛;局限在于精度不及专业多相机系统,且当前为非实时处理[10]。EmbodMocap创新性地仅用两部带激光雷达(LiDAR)的iPhone,实现野外环境下的4D人体-场景同步重建。其核心突破在于通过双目几何约束破解单目深度歧义,融合视觉惯性里程计与带蒙皮多人线性人体模型(Skinned Multi⁃Person Linear Model, SMPL)参数优化,将关节误差控制在5.6 cm[11]。对影视行业而言,这意味着中小短剧、动画制作和虚拟摄制团队无需搭建专业动作捕捉棚,仅用消费级设备即可完成动作采集与场景预演,把影视级动作捕捉的硬件门槛从数十万元降至数千元,为低成本影视生产和具身化内容创作开辟了新路径。
需要指出的是,当前主流动作捕捉仍属于单向的具身经验转译,其捕获的是身体的输出(运动),但被动作捕捉数据驱动的数字角色,本身并不具备感知-行动闭环,无法在环境中自主学习和适应。真正的具身角色,还需要从“被驱动的身体”走向“能自主行动的身体”(图4)。届时,惯性传感与神经接口让身体自身成为采集主体,动作捕捉将不再依赖外部观察系统,身体的主体性得以彻底回归。
![]()
图4 动作捕捉的具身化发展趋势
2.3.3 具身智能人形机器人参与电影制作成为趋势
人形机器人参与电影制作从技术展望加速走向落地,标志着具身智能从数字内容层深入到物理生产层。2025年9月北京文化论坛上,宇树科技创始人王兴兴判断,2026年机器人有望尝试参与电影特技表演,几年内有望替代特技演员完成高危动作[12]。
机器人参与电影制作已有产业先例:水下拍摄领域率先验证了以机械载体替代真人进入高危环境完成拍摄的可行性,鳍源科技联合索尼推出的影视级智能水下机器人拍摄系统,凭借厘米级精准悬停、自动抗流、全维运镜和岸上远程一体化操控能力,已在《蛟龙行动》中完成超过400小时水下场景拍摄,并应用于《酱园弄》《东极岛》等院线电影摄制[13]。尽管当前水下拍摄机器人仍以遥控水下机器人(Remotely Operated Vehicle, ROV)形态为主,尚不具备人形结构与自主决策能力,但其所开辟的技术路线为人形机器人进入影视特技领域提供了可参照的产业范式。宇树科技G1人形机器人已实现连续空翻、蹬墙后空翻、4 m/s高速集群跑位等高难度动作,《刺杀小说家2》片尾字幕亦标注了宇树科技的机器人拍摄支持[14]。从水下遥控机器人化解高危外景拍摄痛点,到人形机器人冲击“人体不可及”的动作极限,影视制作的人机协作谱系正在持续拓展。随着具身智能泛化能力提升,人形机器人有望在灾难、科幻、动作等题材中承接坠落、爆破、极端环境等高风险特技镜头,成为继蓝幕/绿幕合成、动作捕捉和LED虚拟摄制之后,又一重塑影视生产流程的关键技术变量。
2.3.4 3D/4D高斯泼溅技术实现具身空间重建
3D高斯泼溅(3DGS)由Kerbl等人提出,将静态场景表示为数百万个各向异性高斯基元,通过可微分光栅化实现百帧级实时渲染,主要用于建筑扫描、文物数字化等静止空间的三维重建[15];4D高斯泼溅(4DGS)则在此基础上引入形变场机制,维护一组规范(Canonical)3D高斯作为静态基底,再由轻量神经网络预测每一时刻高斯的位移、旋转与缩放,将动态场景编码为时空连续表示,绕开了逐帧独立存储导致的显存爆炸问题[16]。
2025年前后,欧美视效行业率先将4DGS推向商业制作:英国Union VFX联合Clear Angle Studios搭建半球形体积采集棚,将4DGS应用于电影群戏制作,通过真人表演采集生成可重新打光、可实例化复制的4D高斯体素角色,替代传统“建模-绑定-动画”流程构建大规模数字人群,提升了群众镜头的真实感与制作效率[17]。同年,《超人》成为首部大规模应用动态高斯技术的好莱坞商业长片:氪星父母的全息影像由Infinite Realities完成百级相机阵列的体积采集与4DGS训练,交付Framestore合成,其核心优势在于单次采集即可从任意角度重构同一段表演,免去了传统数字替身数月的建模、绑定与毛发制作周期[18]。
国内方面,4DGS的工程化落地虽起步稍晚,但在实时直播场景中实现了跨越式突破。凌云光·元客视界自主研发的LuStage S4D人体动态建模系统,通过70路4K相机的360°多视角同步采集完成亚毫米级精度的4D动态重建,精准还原演员发丝纹理、皮肤毛孔与微表情细节,并支持4K实时渲染,实现真人与数字分身同框无穿帮。2026年央视春晚《梦底》节目中,该方案完成全球首例4K超高清4D光场重建直播,演员与多位高精度数字分身同台共舞、跨时空穿行,画面达到广电超高清播出标准,标志着4DGS体积视频技术从实验室演示正式进入规模化播出阶段[19]。
3D/4D高斯泼溅技术的意义不止在于提升空间重建的精度与渲染实时性,更在于推动影视空间呈现从离身式影像再现向具身式环境具现的范式转型。传统影视中,空间经摄影机单一视点框定为二维影像,观众以离身的旁观者身份接受导演预设的空间关系,身体经验在空间认知中是缺席的。3D高斯泼溅实现的自由视点实时渲染,使观者能够在重建空间中自主移动、变换视角,空间认知不再来自被动接受的固定视点画面信息,而是生成于身体移动中的多视角感知整合,这与具身理论“空间认知源于身体-环境持续交互”的核心命题形成深层呼应。4D高斯泼溅更进一步将时间维度纳入空间重建,让动态场景中的身体探索成为可能,数字空间从静态感知对象转变为动态耦合环境。可以说,3D/4D高斯泼溅为影视内容提供了真正意义上的具身空间底座,它不仅重建了空间形态,更重建了观者与空间的具身关系。
2.4 多感官具身虚拟现实全面落地
2.4.1 具身虚拟现实(EVR)电影概念和VR大空间体验
全球影视传播技术正加速从单向平面视听模式向具身虚拟现实(EVR)沉浸式形态演进。EVR以身体化身、空间漫游与多感官联动为核心特征,使观众从被动观看者转变为故事空间中的具身参与者,其叙事逻辑也从线性传达转向交互涌现。自Carpio等学者于2023年系统提出EVR电影的概念框架以来[20],该领域已形成从短篇交互叙事、长篇个性化内容到线下VR大空间全域体验的发展脉络。
作为EVR早期成熟范本,Baobab Studios创作的Baba Yaga与Paper Birds搭建了具身交互的基础范式[21]。Baba Yaga以斯拉夫民间传说为蓝本,观众以第一人称化身主角Sasha,通过拾取道具、操控魔杖等手部交互推动剧情分支,角色的视线锁定与对话回应强化了身体在场感;Paper Birds则以音乐为叙事媒介,让观众通过深度感知与交互解锁看不见的世界。两部作品均获奖项认可,其中Baba Yaga获艾美奖,证明具身交互能够显著提升受众的情感沉浸与叙事参与度,为EVR的技术落地奠定了创作经验。需要指出的是,这一阶段的交互仍以手柄控制与手部追踪为主,温度、触感等全身多感官反馈尚属后续研究方向。
在短篇交互框架逐步成熟后,长篇化与个性化成为EVR技术迭代的重要方向。当前,国内外团队均在探索可复用的数字角色具身资产库与情感交互机制,如基于面部追踪的情绪识别已被应用于部分VR叙事实验,使观众的表情变化能够影响故事走向,在一定程度上弥补了早期EVR内容剧情模板化、交互形式单一的局限,推动具身交互技术向更长时长、更丰富叙事层次发展演进。
线下大空间体验则代表EVR向文旅与沉浸式场馆延伸的应用形态。以Colosseum: The Legendary Arena为代表的基于位置的娱乐(Location⁃Based Entertainment, LBE)VR项目,依托自由漫游定位与多人同场技术,使观众能在古罗马斗兽场等历史场景中自由行走、探索通道、遇见角斗士,以身体行动解锁历史叙事。该项目由Eclipso公司联合Small Creative制作,在保证历史严谨性的同时实现了高度沉浸的具身体验,已在伦敦、纽约等地展映[22]。同类项目还包括该公司的Titanic: Echoes from the Past[23]等。
我国VR大空间作品在政策引导与文旅消费升级的双重驱动下,呈现出鲜明的本土化发展特征。2025年3月,国家电影局发布《关于促进虚拟现实电影有序发展的通知》,正式将VR电影纳入电影行业管理体系,为内容创作与市场发行提供了制度保障,标志着国产VR大空间内容进入规范化发展阶段[24]。
“文博活化”是国内VR大空间最具特色的应用领域。陕西历史博物馆联合深圳元象科技推出的《壁画那边是唐朝》,以章怀太子墓壁画为蓝本,观众可通过自由漫游进入壁画内部空间,与唐代人物交互[25];大足石刻打造的《无面之神》则将世界文化遗产与沉浸式演艺结合,成为文旅融合的典型样本[26]。科普自然与工业题材同样发展迅速。君看文化的《深海奇遇》《雨林奇遇》[27,28]系列已在全国20余个城市落地;工信部工业文化发展中心联合北京星赛出品的航天题材《九天揽月》[29]、博采传媒打造的抗美援朝题材《火线·断桥狙击》[30],分别探索了工业文化与红色资源的沉浸式转译路径。整体而言,国内VR大空间走了一条政策先行、文化资源驱动、多题材并行的差异化路线。
2.4.2 EVR电影的发展趋势
EVR电影的发展,从具身认知视角审视,呈现出一条从“视觉在场-行为介入-身心在场”的清晰演进脉络。第一阶段的全景观影以360°全景视频为代表,观众虽被包裹于球形影像中,获得前所未有的空间视野,但其身体仍处于缺席状态,仅能转动视线而无法改变空间位置,沉浸感停留在视觉层面的幻象建构。
随着六自由度(6DoF)追踪、手柄交互与空间定位技术的成熟,虚拟现实电影进入交互叙事阶段:观众的身体动作首次被纳入叙事机制中,行走、注视、伸手等动作成为推动剧情发展的有效输入,观者从被动的旁观者转化为主动的叙事参与者。当前沿技术进一步走向大空间沉浸式VR,虚拟现实电影正迈入全感具身的新阶段:触觉背心、温控装置、气味模拟器与体感地板等多感官反馈设备将触觉、温度、气味、风力等物理刺激全链路激活,观影者的整个身体被纳入虚拟环境的感知回路;虚拟化身(Avatar)与真实身体的运动同步产生自我归属效应,使观众不再只是身处虚拟世界,而是以一个完整的具身主体身份“活在其中”。如图5所示,上述演进不仅是技术维度的叠加升级,更标志着虚拟现实电影在本体论层面完成了对传统观影模式的根本重构:电影不再是“被观看的对象”,而是可实现身心在场的“可栖居的世界”。
![]()
图5 虚拟现实电影的具身化发展趋势
3
具身认知视域下影视产业高质量发展路径
3.1 构建人机协同创作体系,坚守艺术原创内核
当前,影视具身化发展进程中暴露出技术美学失衡与内容同质化等问题,技术层面的具身化走在了内容前面,但创作层面尚未形成与之匹配的美学语言与叙事方法。对此,行业亟需建立人为主导、多智能体协同的标准化人机协同创作体系,在具身理论的指导下重新界定人与智能体的创作分工,让技术具身真正服务于内容表达,而非沦为形式炫技,从根源上规避算法同质化弊端,守住影视艺术的原创底色与审美价值[31]。
人机协同创作体系的核心是重塑创作者主导、智能辅助的创作思路,重构影视全流程创作分工。在全新体系下,智能体主要承担重复性、技术性工作,高效赋能创作落地,而一些核心的内容环节,比如创意构思、叙事架构、情感表达以及美学表达应该始终由人来主导。技术可批量完成虚拟场景搭建、多模态交互等基础性工作,以此降低创作的人力与时间成本;创作者则聚焦创作优质新颖的剧本,将重心放在塑造人物弧光上,潜心设计交互叙事等创意环节,实现技术工具与艺术美学的平衡。
在坚持智能工具赋能创作的前提下,我们可通过一些标准化举措来平衡生产效率与原创艺术价值。首先应推进人机权责边界标准化,清晰划定分工范畴,将分镜初稿绘制、标准化角色肢体生成、基础虚拟场景搭建等重复性及流程化执行工作交由多智能体系统完成,而叙事主题、人物精神内核等相关人文审美与核心价值表达交由人类主创把控,从创作源头遏制算法照搬热门模板带来的同质化问题。其次,应建立分层适配的智能化创作流程,针对不同影视品类定制专属多智能体工作流。院线电影制作过程中,应增设多层人工审美审核环节,兼顾艺术深度与精细预演的需求;而轻量化微短剧可启用极简智能生成链路来压缩筹备周期;交互EVR影片能够依托智能体批量生成多元交互支线,适配沉浸式叙事的独特需求[32]。再次,应同步完善数据配套长效机制,优化多智能体训练数据集结构,扩充非遗、地域小众文化和现实原创叙事等多元素材储备,降低流量爆款内容在样本库中的占比,以此减少算法固化的叙事套路。
总而言之,仅依靠智能体无法创作出具备人文温度的优质影像,唯有坚守人类创作主体性,才能让多智能体技术服务于原创表达。
3.2 分层落地轻量化制作技术,构建普惠技术生态
技术工具本身的可及性可能会成为制约影视具身化规模化落地的现实瓶颈。虽然4DGS、人形机器人、高精度动作捕捉等前沿制作技术效果突出,但高昂的采购运维成本,设备协议互不兼容的问题也不容小觑。再加上核心技术受制于海外厂商,优质资源集中于少数头部大厂,中小团队难以参与具身影视创作[33]。因此,行业需分层落地轻量化数字制作技术。
针对发展动作捕捉、人形机器人与4DGS等具身制作技术,应同时兼顾头部工业化产能升级与中小团队技术可及性,弥合行业内部的技术资源鸿沟。首先,可推行差异化的技术分层供给模式,针对市场不同创作主体的现实条件匹配对应技术方案。头部影视基地、大型制片企业重点布局高精度4D光场设备与人形机器人拍摄系统,充分借鉴海外成熟工业实践[34]。而面向资金预算有限的中小影视团队、独立创作者,应当大力推广无标记、轻量化动作捕捉方案,有效缓解硬件成本过高带来的落地阻碍。
在此基础上,应当积极推广开源技术框架,鼓励国内头部科技企业适度开放动作捕捉与渲染底层模型资源,统一不同硬件设备之间的数据交互接口,以解决当前行业普遍存在的技术孤岛难题。当前不同厂商产出的动作捕捉素材、三维场景格式互不兼容,素材跨流程转换需要耗费大量人力进行二次校准。标准化接口与开源底座,可降低不同设备之间的适配成本,打通从前期拍摄到后期制作的数据链路[35]。 我们若要打破海外动作捕捉设备长期形成的专利垄断,必须大力推进国产底层技术自主研发,重点攻克面部微表情还原精度不足、多人同场场景交互延迟偏高的技术短板,以此来逐步摆脱对海外硬件与算法的依赖。
3.3 打造分层全域EVR传播矩阵,实现线上线下IP互通
制作端的技术升级,最终需要通过传播渠道触达受众。当前EVR内容存在明显的两极分化:高端多感官沉浸体验成本高昂,普通大众难以接触;而线上轻量化产品又缺少深度交互能力,线上线下IP素材相互割裂,限制了IP商业价值释放[21]。对此,行业应当打造分层全域EVR沉浸传播矩阵,实现线上线下IP互通。具体来说,应该实施产品分层运营策略,面向不同受众群体搭建梯度化的体验体系。比如以手机增强现实(AR)为载体的轻量化线上产品面向普通大众,降低参与门槛;中端家用VR短片适配拥有消费级VR设备的爱好者;线下大型多感官EVR场馆则瞄准深度文化消费群体,提供完整全身交互的沉浸体验[22]。
在此基础上,应该推动数字资产全域复用,建立统一的虚拟人与空间具身素材存储标准,打破院线电影、线上交互内容与线下文旅体验间的数据壁垒,实现同一套影视数字资产跨场景流转调用。迪士尼全域IP具身运营体系便是成熟范本,其将影视角色动作捕捉素材同步应用于电影、移动端AR与乐园线下人偶项目,极大提升了IP资产利用效率。与此同时,硬件成本的下降也可进一步消解高端设备带来的受众圈层固化困境。因此,我们应持续推动触觉等交互外设走向轻量化与平价化,扩大EVR的受众覆盖面。打通线上线下传播链路,让EVR具身叙事跳出小众实验项目范畴,真正实现IP价值的持续释放。
3.4 完善人才培养、行业标准、数字版权的产业配套支撑体系
创作观念的具身化转向与制作技术的持续升级,为影视行业的具身化发展提供了内容与技术双重基础,但行业规模化落地仍受制于人才结构滞后等底层产业短板。技术迭代速度远超产业配套建设速度[34],导致以具身理论为支撑的一系列新技术,包括从具身化内容生成到具身式空间重建、从具身化虚拟摄制到具身交互,难以在行业内形成普遍应用。因此,必须进一步完善产业配套支撑体系,重视人才培育,对行业进行有效规范,持续推进数字版权保护体系的完善,为影视高质量发展筑牢制度与人才保障。具体而言,可大力推进复合型交叉人才培育,也可从高校入手,推动高校与影视科技企业共建影视艺术与具身技术融合的实训专班;另外增设多智能体协同制作、虚拟摄制与EVR交互设计等新兴课程,破解传统影视人才不懂技术、技术人员缺乏艺术审美能力的难题。其次,对标国际经验建立本土行业规范,制定国内量化行业指标,统一动作捕捉精度、交互延迟与数字人效果验收等关键技术参数,减少不同影棚设备输出质量参差不齐与项目缺少统一评判依据的情况。
此外,针对动作捕捉采集数据、虚拟人物形象与EVR交互剧本等新型客体,应当厘清权属边界,同时构建数字资产存证溯源体系,健全数字资产版权保护机制。好莱坞数字资产版权判例表明,虚拟具身资产侵权存在着取证难与权责模糊的问题。只有完善确权、存证与维权全链条机制,才能充分保障创作者的合法权益,从而激发市场原创动力。因此,我们应该同步补齐制度与要素短板,为多智能体创作、虚拟摄制和EVR沉浸式内容的规模化落地营造规范有序、健康稳定的产业环境,推动影视具身化从试点示范走向市场常态化。
4
结语
综上所述,在具身理论的视野下审视,影视产业的具身化转向是数字媒介演进与文艺行业革新的必然走向。从具身认知的观念更新,到具身智能的技术突破,再到具身媒介的空间重构与具身交互的体验革新,多重力量正在共同推动影视创作从离身式符号生成走向具身化身体与环境耦合。随着AI技术的不断成熟、行业配套体系的持续完善,以及受众沉浸式文化消费需求的加速释放,这一具身化进程将逐步化解当前影视行业在技术落地与产业运营等方面的现实难题,重塑影视内容生产、空间呈现与沉浸式传播的完整逻辑,成为推动影视行业创新发展的关键动力。
影视行业的长远发展不能单纯依赖技术驱动,更需坚守人文创作底色,兼顾产业迭代与行业规范建设。只有平衡好技术赋能与艺术原创、产业发展与制度治理的关系,充分挖掘具身化转型的文化传播价值与产业经济价值,打破传统影视的发展局限,才能推动行业完成智能化升级,助力影视精品化提质增效。唯有这样,才能为新时代文化和影视产业的高质量、可持续发展夯实长久基础底座。
参考文献
(向下滑动阅读)
[1] 梅洛-庞蒂.知觉现象学[M].姜志辉,译.北京:商务印书馆,2001.
[2] 薇薇安·索布恰克.肉体的思想:具身性和影像文化[M].李三达, 夏开丰, 刘昕,译.上海:上海社会科学院出版社,2025.
[3] AI交付局.《第九区》导演发布AI科幻惊悚短片,下一步将挑战AI长片[EB/OL].(2026⁃07⁃22)[2026⁃08⁃20].https://zhuanlan.zhihu.com/p/2063260845245 837999.
[4] 网视互联.15人/14天/95分钟:一部AI电影凭什么杀进戛纳?[EB/OL].(2026⁃05⁃23)[2026⁃08⁃20].https://user.guancha.cn/main/content?id=1657003&comments-container.
[5] 爱奇艺.官宣!爱奇艺发布全国首个专业影视制作智能体“纳逗Pro”[EB/OL].(2026⁃03⁃30)[2026⁃08⁃20].https://pages.iqiyi.com/p/scpr/63x0au29.html.
[6] 腾讯云.AI漫剧工业化:腾讯WorkRally以智能流水线攻克精品内容产能瓶颈[EB/OL].(2026⁃06⁃18)[2026⁃08⁃20].https://cloud.tencent.com/developer/article/2693080.
[7] Xu Z, Wang J, Wang L, et al. FilmAgent: Automating Virtual Film Production Through a Multi‑Agent Collaborative Framework[C]//SIGGRAPH Asia 2024 Technical Communications. New York, NY, USA: Association for Computing Machinery, 2024:15.
[8] 刺猬公社.WAIC 2026丨从“抽卡”到“调度”,万兴剧厂越过AI影视技术分水岭[EB/OL].(2026⁃07⁃20)[2026⁃08⁃20].https://finance.sina.com.cn/wm/2026-07-20/doc-iniinfqe4976711.shtml.
[9] MediaPipe Holistic.MediaPipe Holistic[EB/OL].[2026⁃08⁃20].https://chuoling.github.io/mediapipe/solutions/holistic.html.
[10] Yuan H, Bousseau A, Pan H, et al. DancingBox: A Lightweight MoCap System for Character Animation from Physical Proxies[C]//Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems, 2026.
[11] Wang W, Pan L, Pi H, EmbodMocap: In⁃the⁃Wild 4D Human⁃Scene Reconstruction for Embodied Agents[PP/OL].(2026⁃02⁃26)[2026⁃08⁃20].https://arxiv.org/abs/2602.23205.
[12] 新京报.视频|宇树科技王兴兴:明年机器人有望做特技演员[EB/OL].(2025⁃09⁃23)[2026⁃08⁃20].https://news.qq.com/rain/a/20250923A03CCB00?id=20250923A03CCB00&path=a&app=news&suid=&redirect_pc=1.
[13] 东方网.鳍源科技联合索尼,共同打造影视级智能水下拍摄系统[EB/OL].(2025⁃11⁃23)[2026⁃08⁃20].https://caijing.chinadaily.com.cn/a/202511/23/WS6922d03fa310942cc4992e54.html.
[14] 中国基金报.国庆档新片《刺杀小说家2》获宇树科技机器人拍摄支持[EB/OL].(2025⁃10⁃08)[2026⁃08⁃20].https://www.chnfund.com/article/AR46371a77-17b4-a5fb-4882-3a1cd5537e88.
[15] Kerbl B, Kopanas G, Leimkuehler T, et al. 3D Gaussian Splatting for Real⁃Time Radiance Field Rendering[J]. ACM⁃Transactions on Graphics, 2023, 42(4):14.DOI:10.1145/3592433.
[16] Wu G, Yi T, Fang J,et al. 4D Gaussian Splatting for Real⁃Time Dynamic Scene Rendering[PP/OL].(2024⁃07⁃15)[2026⁃08⁃20].https://arxiv.org/abs/2310. 08528.
[17] Fxguide.Union VFX on production‑ready Gaussian splat crowds[EB/OL].(2026‑07‑01)[2026‑08‑20]. https://www.fxguide.com/fxpodcasts/union-vfx-on-production-ready-gaussian-splat-crowds/.
[18] Frei V. Superman: Stephane Ceretti – Production VFX Supervisor[EB/OL].(2025⁃09⁃16)[2026⁃08⁃20].https://www.artofvfx.com/superman-stephane-ceretti-production-vfx-supervisor/.
[19] VR/AR星球.春晚《梦底》惊艳出圈:凌云光LuStage 4D高斯光场技术开创业界先河[EB/OL].(2026⁃02⁃25)[2026⁃08⁃20].https://www.vrarworld.cn/guoneizixun/12362.html.
[20] Carpio R, Birt J, Baumann O. Using case study analysis to develop heuristics to guide new filmmaking techniques in embodied virtual reality films[J/OL].(2023⁃01⁃27)[2026⁃08⁃20].https://www.tandfonline.com/doi/full/10.1080/17510694.20 23.2171336.
[21] Chen Y, Baharin H. Embodied Virtual Reality Cinema: Redefining the Cinematic Experience through Immersion and Interaction[C]//Proceedings of Asian CHISymposium 2024,2024: 51⁃55.
[22] Eclipso Entertainment. Colosseum: The Legendary Arena[EB/OL].[2026⁃08⁃20].https://eclipso-entertainment.com/en/New-York/colisee/.
[23] Eclipso Entertainment. Titanic: Echoes from the Past[EB/OL].[2026⁃08⁃20].https://eclipso-entertainment.com/en/sevilla/titanic/.
[24] 国家电影局. 首张“龙标”颁发一周年:虚拟现实电影的从0到1[EB/OL]. (2026⁃04⁃13)[2026⁃08⁃24]. https://www.chinafilm.gov.cn/xwzx/gzdt/202604/t20260413_984436.html.
[25] 陕西历史博物馆.壁画那边是唐朝——陕历博VR大空间沉浸式数字体验项目重磅启幕[EB/OL].(2025⁃09⁃08)[2026⁃08⁃20].https://www.sxhm.com/info/news/detail/18143.html.
[26] 重庆市大足区人民政府. 国内首创!大足石刻LBE演艺《无面之神》开启南宋时空穿越之旅[EB/OL]. (2025⁃06⁃12)[2026⁃08⁃24]. http://www.dazu.gov.cn/zwxx_175/qxdt/202506/t20250612_14705212_zbb.html.
[27] 中国网.君看文化携《深海奇遇》斩获2025 LBE China年度双项大奖[EB/OL].(2025⁃06⁃23)[2026⁃08⁃24]. http://animation.china.com.cn/2025-06/23/content_43151957.html.
[28] VR陀螺.FBEC2025|君看文化&联影创艺&金彩视界影业《雨林奇遇》荣获第十届金陀螺奖“年度优秀XR LBE大空间内容”[EB/OL]. (2025⁃12⁃11)[2026⁃08⁃24]. https://www.vrtuoluo.cn/544309.html.
[29] 新华网. 《九天揽月》LBE大空间VR沉浸剧目震撼首发[EB/OL]. (2026⁃07⁃31)[2026⁃08⁃24]. https://m.sohu.com/a/1057516860_12099886.
[30] 德清县人民政府. 德清“VR战场”让抗美援朝历史“活”起来[EB/OL]. (2026⁃04⁃30)[2026⁃08⁃24]. http://www.deqing.gov.cn/col/col1229212604/art/2026/art_bff820ee2a4a41f9b099c3337669f6c2.html.
[31] 殷乐,高慧敏. 具身互动:智能传播时代人机关系的一种经验性诠释[J].新闻与写作,2020 (11):28⁃36.
[32] Wu W, Zhu Z, Shou Z M. Automated Movie Generation via Multi⁃Agent CoT Planning[PP/OL]. (2026⁃03⁃10)[2026⁃08⁃20].https://arxiv.org/abs/2503.07314.
[33] Swords J, Willment N. The emergence of virtual production – a research agenda[J]. Convergence, 2024, 30(5): 1557⁃1574.
[34] Bugahhoos M, Von Jungenfeld R, Epsley B. Virtual production for the micro: Investigating obstacles and tailoring workflows for small UK production studios[J]. Convergence: The International Journal of Research into New Media Technologies, 2026, 32(3): 860⁃889.
[35] Martin F, Guerrero J M, Garcia A A, et al. MOCAP4ROS2: An Open Source Framework for Motion Capture Systems in Robotics[C]//Proceedings of the 18th International Symposium on Open Collaboration. New York: Association for Computing Machinery, 2022.
期刊导读 |《现代电影技术》2026年第9期
林思玮等:中国虚拟现实电影技术、创作与产业发展研究
郑屹等:视觉设计元素与审美情感关联的结构化标注方法及系统实现
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.