网易首页 > 网易号 > 正文 申请入驻

《现代电影技术》|罗强等:具身智能机器人技术闭环与影视IP赋能路径研究

0
分享至


本文刊发于《现代电影技术》2026年第8期

专家点评

刘 达

正高级工程师

中国电影科学技术研究所(中央宣传部电影技术质量检测所)总工程师

《现代电影技术》主编

具身智能(Embodied Intelligence)是继大模型之后人工智能(AI)发展的新赛道与新风口,被誉为人工智能(AI)的下一个浪潮,是迈向通用人工智能(AGI)的必由之路。具身智能属于物理AI,其本质是智能与本体的深度融合,智能体与环境通过主动感知、具身认知、动态交互,形成感知-认知-交互一体化的智能系统,进而实现人工智能从静态、预设逻辑向动态、实时感知与决策行动的重大进化。近年来具身智能领域关键核心技术加速突破和迭代进化,具身智能全链路技术闭环不断发展完善,为具身智能的产业化发展奠定了基础。《具身智能机器人技术闭环与影视IP赋能路径研究》一文基于具身智能“感知-决策-执行-反馈”全链路协同贯通技术闭环逻辑,以陪伴机器人为例系统阐述了具身智能机器人的技术演进、发展瓶颈、影视IP具身化及技术复用路径,设计构建了“具身闭环技术层-IP情感赋能层-场景体验层”分层架构,为具身智能机器人在影视行业落地应用和规模化发展提供了理论思考与实践指导。当前,以人形机器人为代表的具身智能机器人距离大规模商业应用仍有漫长的道路要走,技术成熟度、安全可靠性、应用场景拓展、系统成本控制等均需持续突破和有效解决。但是,不可否认,人工智能从离身智能向具身智能发展演进是大势所趋,具身智能正不断突破传统AI局限,实现从数字世界到物理世界的关键跨越,其正从模型能力竞争进入系统工程落地竞争,芯片、数据、本体、应用场景和安全体系的高效协同将成为未来发展与竞争的焦点和关键。电影行业应以推进全产业链智能化升级和培育发展未来产业为契机,在具身智能领域开展前瞻布局,科学定制具身智能系统行业应用整体方案,加快构建完善电影行业具身智能创新生态,积极服务电影智能产业与智能经济发展。

作者简介


罗 强

硕士,北京大学信息技术高等研究院实验室副主任,主要研究方向:机器人、具身智能。

周鹏程

硕士,北京大学信息技术高等研究院实验室副主任,主要研究方向:智能体、工业智能。


摘要

具身智能的核心在于“感知-决策-执行-反馈”全链路协同构成的自主智能闭环,而非孤立技术模块的简单叠加。本文以这一技术逻辑为起点,以陪伴机器人为例,系统探讨了具身智能机器人在该范式下的演进路径、核心瓶颈与设计策略。研究表明,陪伴机器人的智能化水平受制于闭环中最薄弱的一环,即感知粗糙则决策失据,决策僵化则执行无效,执行偏差而无反馈修正则系统无法持续进化。在技术层面,本文详细分析了三维语义建图与多模态情感感知、视觉-语言-动作(VLA)模型与世界模型的协同决策、端到端强化学习驱动的自然动作生成,以及基于仿真平台的数据闭环反馈等关键技术进展与挑战。在此基础上,提出“IP具身化”作为陪伴机器人从功能工具跃迁为情感伙伴的关键路径,以迪士尼雪宝机器人(Olaf Robot)为典型案例,剖析影视IP如何通过技术复用平台实现规模化落地。最终,本文构建了“具身闭环技术层-IP情感赋能层-场景体验层”三层设计框架,为陪伴机器人产品定义与产业化路径提供理论参照与实践指导。

关键词

具身智能;陪伴机器人;影视IP;视觉-语言-动作模型;深度强化学习

1

引言

2026年,具身智能产业已从实验室探索阶段迈入初步商业化验证期,人形机器人在工业制造、物流配送、商业服务等领域的应用逐步铺开。然而,陪伴机器人这一被寄予厚望的品类,仍处于“高期待、低满足”的困境。大量面市产品被用户评价为“昂贵的玩具”,其能对话却无法理解空间语境,能移动却难以适应动态家居环境,能执行简单指令却缺乏对用户情绪状态的主动识别与响应。

市场数据印证了这一落差。QYResearch数据显示,2025年全球宠物伴侣机器人市场销售额达8.61亿美元,预计2031年增至16.28亿美元,年复合增长率11.2%[1]。中国市场方面,艾媒咨询数据显示,2025年中国情绪经济市场规模达2.7万亿元,超六成消费者愿意为情绪价值付费[2]。然而,人工智能(AI)毛绒玩具退货率高达30%至40%,部分高价产品因“所有安慰话术都是固定模板”而引发用户不满[2]。2025年开始,国内各个展会和媒体公开亮相的情感陪伴机器人厂商已超过10家,产品价格涵盖千元到十万元以上,形成玩具到仿生的梯队格局,但试用产品后,普遍存在同质化严重、沦为“大号早教机”或“聊天工具”的问题。

这一困境的根源在于:多数产品仅实现了具身智能闭环中的某一环节或某几个环节,而非全链路协同贯通。具身智能的核心定义已逐步形成行业共识——机器能够理解物理世界并与之实时交互,实现“感知-决策-执行-反馈”的完整闭环。陪伴机器人的智能化水平不取决于视觉识别精度多高、语言模型参数多大、运动控制多平滑,而取决于闭环四环节中最薄弱的一环。任一环节的断裂或不足,都将导致整体体验崩塌。

与此同时,影视IP与机器人的深度融合正在开辟一条独特的产品路径。迪士尼(Disney)于2025年11月通过其官方网站及社交媒体正式发布雪宝机器人(Olaf Robot),其凭借对动画角色质感的精准复现和自然流畅的人机交互体验,为陪伴机器人提供了“情感价值优先于功能价值”的另类范本[3]。这一案例表明,当技术闭环趋于成熟,IP赋能可能是陪伴机器人突破“工具感”窠臼、建立深层情感连接的关键杠杆。

本文研究兼具理论意义与实践意义。理论意义在于,从具身智能的技术逻辑出发,构建陪伴机器人研发的系统性分析框架,避免囿于单一技术环节的碎片化讨论。实践意义在于,通过解剖雪宝机器人等前沿案例,提炼可复用的技术路径与设计原则,为产业界的产品定义提供参照。

2

具身智能闭环:技术解构与瓶颈分析

如图1所示,具身智能技术总体可分为感知层、决策层、执行层、反馈层。其中感知层可理解为人的眼、鼻、耳等器官,可主动感知、接收、获取环境信息,对机器人而言需要根据物理特征、几何形状等信息,通过多模态融合技术,形成抽象的环境感知、认知、理解并形成标准化的语义结果;决策层相当于人的大脑,借助于感知层的信息及任务理解,形成动作规划决策,最终输出运动速度、轨迹等指令;执行层接收决策层指令,将其分解成可执行的动作,如语音对话、关节的旋转角度、卡爪的开合、灵巧手的抓取等;反馈层通过以上三层的实时数据反馈,对感知、决策、执行过程进行闭环,形成自主进化,使系统最优。


图1 具身智能技术闭环

2.1 感知层:从几何重建到语义理解

感知层是具身智能闭环的起点,其任务不仅是“看见”环境,更是“理解”环境。陪伴机器人所处的家庭场景具有高度非结构化特征,包括家具布局频繁变动、物品种类繁杂多样、光照条件动态变化,这对其感知系统提出了远超工业机器人的要求。

2.1.1 三维语义建图

传统机器人感知方案主要依赖激光雷达进行几何建图,能够输出“哪里有障碍物”的距离信息,却无法回答“障碍物是什么”这一语义层面的问题。对于陪伴机器人而言,这种感知能力的缺失是致命的,其需要知道“这是沙发”以便在附近安全地攀谈,需识别“这是楼梯”以避免跌落,需区分“这是玩具”和“这是易碎品”以决定是否可以触碰。

实现感知能力的提升,突破方向在于从二维感知向三维语义感知的跃升。以INDEMIND为代表的技术方案,通过立体视觉技术构建全屋三维地图,同时利用深度学习模型对场景中的物体进行实时语义标注,即将“客厅沙发”“卧室衣柜”“厨房插座”等语义信息嵌入地图表征之中。该方案采用端侧加云端低算力混合模型,端侧模型算力需求仅5~10 TOPS,支持消费级平台部署。动态语义建图技术使机器人能够持续感知环境变化,当沙发移位、地毯收起、新物品出现时,系统通过视觉闭环检测实时更新地图,避免因环境变动导致的定位失效或导航卡顿问题。据INDEMIND公布的数据,该方案使电线类障碍物识别准确率提升90%,并支持跨楼层作业[4]。

感知层的技术进阶可概括为三个递进层次:

(1)几何感知层:仅输出环境的空间几何信息(前方0.5 m有障碍物),其中激光雷达方案精度高,但缺乏语义理解。摄像头方案颜色、纹理等信息更丰富,但缺乏三维空间信息。

(2)语义感知层:在几何信息基础上叠加物体类别、功能属性等语义标签,使机器人能够理解场景中“有什么”以及“是什么”。

(3)情境感知层:在语义理解基础上进一步融合用户行为模式与情绪状态,使机器人能够理解“这里正在发生什么”以及“用户需要什么”。

陪伴机器人的感知闭环要求三者兼具,尤其第三层次,即识别用户情绪状态(经核实,INDEMIND平台已支持6种基础情绪及25种以上微表情识别[4])、理解手势意图(区分静态手势如“OK”与动态手势如“挥手告别”,支持数十种手势识别)、构建用户专属知识网络(记忆用户偏好、习惯与社交关系),是陪伴机器人区别于工业机器人的核心能力要求。

2.1.2 多模态情感感知

情感感知是陪伴机器人感知层的特殊维度。与传统情感计算研究侧重于单一模态(如仅依靠语音语调或仅依靠面部表情)不同,面向真实交互场景的陪伴机器人需融合视觉、语音、文本乃至生理信号等多模态信息进行综合判断。

当前技术方案通常采用以下融合策略:视觉通道负责面部表情识别与头部姿态分析;语音通道负责语调、语速、音高等声学特征提取;自然语言处理(NLP)通道负责语义内容的情感倾向分析;三者通过多模态融合模型(如基于Transformer架构的跨模态注意力机制)进行综合判断,输出用户情绪的类别与强度估计。INDEMIND平台已实现“情绪感知-表达感知-行为感知-环境感知-命令输入”的多维度感知融合[4]。

然而,多模态情感感知在真实场景中仍面临显著挑战:家庭环境中的光照变化、遮挡、多人同时说话等干扰因素严重影响各模态信号质量;不同模态信息在时间上的异步性增加了融合难度;个性化差异(同一表情在不同个体身上可能表达不同情绪)要求系统具备自适应校准能力。此外,斯坦福大学2026年调研显示,主流情感AI附和用户错误或不当言论的概率比人类高出49%,形成“谄媚”风险,这对情感感知系统的伦理安全性提出了新的要求[2]。

2.2 决策层:视觉-语言-动作(VLA)模型与世界模型的协同进化

决策层是具身智能闭环的“大脑”,其核心任务是将感知层输出的环境理解转化为可执行的任务规划。近年来,大模型技术的突破为决策层带来了革命性变化。

2.2.1 VLA模型:视觉-语言-动作的统一框架

VLA模型融合视觉(Vision)、语言(Language)和动作(Action)三种模态,使机器人能够理解环境、解析人类指令并自主生成物理动作序列。其技术实质是将自然语言指令映射到具身操作空间。当用户发出“帮我从冰箱拿一瓶水”的指令时,搭载VLA模型的机器人可无需遥操作介入、无需针对该特定场景事先采集训练数据,通过自主规划路径从冰箱中识别并抓取水瓶送达用户手中[5]。

谷歌DeepMind于2023年7月正式提出VLA概念,其RT⁃2模型将机器人动作离散化为文本词元(token),与视觉语言数据联合训练,在未见任务上实现超50%的成功率[6]。此后VLA领域论文爆发式增长:据谷歌学术统计,VLA相关结果共有2820条,仅2025年就发表了1390条,几乎占总量的一半[6]。

VLA模型的典型架构包括:视觉编码器(如ViT)将图像输入编码为视觉特征;语言编码器(如LLaMA)将指令文本编码为语义特征;跨模态融合模块通过注意力机制对齐视觉与语言表征;动作解码器输出离散动作序列或连续控制信号。训练范式通常采用大规模互联网数据预训练结合机器人操作数据的微调。

2024至2025年间,VLA模型在性能和效率上取得显著突破。Physical Intelligence、斯坦福、谷歌等机构联合开源的OpenVLA以7B参数、1/7于RT⁃2⁃X模型的体积,在29种操作任务中成功率高出后者16.5%,可在消费级图形处理器(GPU)上快速适配[6]。Physical Intelligence发布的π0及升级版π0.5在洗衣折叠、桌面清洁等家庭任务中展现零样本执行能力,π0.5已在未知家庭场景中无需训练即可完成清洁任务[6]。中国团队亦有重要贡献:智平方(深圳)科技股份有限公司与北京大学联合推出的RoboMamba率先将状态空间模型Mamba引入VLA架构,推理速度达主流模型的3倍,并入选2024年神经信息处理系统大会(NeurIPS 2024);HybridVLA和FiS⁃VLA分别在混合架构和快慢双系统方向取得突破,后者受卡尼曼双系统理论启发,打破了操控效率与推理能力不可兼得的困局[6]。

对于陪伴机器人而言,VLA模型的意义在于使机器人从“你说什么它做什么”的指令执行者,升级为能够理解意图、自主分解任务、动态调整规划的智能伙伴。例如,当孩子说“我想玩”,机器人需要理解这并非指向某个具体物品的指令,而是一个开放性意图,需结合当前场景(玩具在哪里、天气如何、用户情绪状态)自主生成合适的陪伴方案。

2.2.2 世界模型:预测与预判的能力

更具突破性的是世界模型(World Model)的引入。与传统模型仅基于当前状态做决策不同,世界模型通过学习物理规律和环境动态,在内部表征中预测未来状态的演化轨迹,模拟了人类“脑内推演”的能力[5]。

Ha等[7]于2018年提出的经典框架使用变分自编码器(VAE)将视觉压缩至潜在空间,用循环神经网络预测未来,再在“梦境”中学习行动。此后该领域沿着两条路径演进:一是表征世界模型,在潜在空间中预测抽象状态而不生成逼真像素,如Yann LeCun提出的JEPA框架和Meta的V⁃JEPA 2;二是生成式世界模型,直接生成并模拟世界的具体表现,如OpenAI的Sora和谷歌DeepMind的Genie系列[8]。2025年8月发布的Genie 3被英伟达(NVIDIA)科学家Jim Fan誉为“游戏引擎2.0”,可根据文本或图像提示实时生成可交互的三维虚拟环境,以720P、24 FPS持续运行,并具备记忆能力[8]。

世界模型的技术实现通常包含三个组件:状态编码器将当前观测压缩为隐状态表示;动态预测器基于当前状态和候选动作预测下一状态的概率分布;奖励预测器评估预测状态的价值。通过这一“想象-评估-选择”机制,搭载世界模型的机器人具备了主动预判能力:在倒茶时预判水流轨迹和杯子重心变化,在做三明治时预判食材堆叠的稳定性,在行走于斜坡时预判重心偏移量从而提前调整步态。当前VLA领域已出现将世界模型或未来预测模块叠加到视觉语言模型(VLM)与动作解码器架构上的趋势[6]。

这一能力对陪伴场景尤为关键。设想以下情境:机器人看到儿童跑向茶几上放置的玻璃杯,不应机械地等待“把杯子递给我”的指令,而应在执行任何动作前预判碰撞风险,主动采取避让或保护措施。世界模型使这一“先想后做”的类人推理成为可能。

2.2.3 决策层的现实瓶颈

尽管VLA模型和世界模型展现出巨大潜力,决策层在实际部署中仍面临严峻挑战。由Ma等[9]于第11届国际学习表征会议(ICLR 2023)提出的标准评测任务中,三维场景情景问答(SQA3D)基于ScanNet的650个场景构建,考察空间关系理解、常识理解、导航和多跳推理能力。原始论文中,最优多模态方法准确率仅为47.20%,人类基准为90.06%。随着GPT⁃4V等大型视觉语言模型的应用,准确率已提升至55%~60%区间,但仍与人类水平存在显著差距[6]。

泛化能力的不足意味着机器人在训练数据覆盖的场景中表现良好,一旦环境布局、物体类别或任务描述超出训练分布,决策质量即显著下降。对家庭这一高度开放、极度非结构化的场景而言,这一瓶颈尤为致命。一个在实验室环境中表现完美的陪伴机器人,进入真实家庭后可能因窗帘颜色变化、家具位置微调、光线角度改变而陷入“认知失调”。跨场景泛化能力的突破,将是决策层从实验室走向千家万户的关键门槛。

2.3 执行层:端到端学习与物理实现的统一

决策层输出的规划需落地为物理动作,执行层的核心命题是如何让机器人动得自然、精准、可靠。传统执行方案依赖预设运动库与基于模型的轨迹规划器,但面对复杂地形和动态障碍时往往捉襟见肘。

2.3.1 端到端强化学习

端到端强化学习的执行范式实现了从感知到控制的直接映射:以视觉观测(如球的位置、队友位置、场地边界线)为输入,直接输出机器人关节角度或力矩控制指令,中间不依赖显式的路径规划或运动学求解模块[5]。深度强化学习算法〔如软演员-评论家(SAC)、近端策略优化(PPO)〕通过大量试错学习最优策略,使机器人能够在复杂动态环境中实现鲁棒的运动控制。从仿真到现实(Sim⁃to⁃Real)迁移的主流技术手段包括域随机化、域适应以及对齐仿真与真实环境的状态转移动力学等。2024年NVIDIA研究团队提出的DrEureka框架利用大语言模型(LLM)自动构建奖励函数和域随机化分布,大幅降低了仿真到现实的工程门槛[10]。

清华“火神队”的机器人足球队是该技术路径的典型验证。该队分别于2025年6月国内首场机器人足球3V3 AI赛、2025世界人形机器人运动会5V5足球赛中夺冠。团队带头人清华大学自动化系研究员赵明国[11]指出,机器人踢足球涵盖感知、决策、运动控制全链路技术,与智能驾驶的底层逻辑相通,并强调需重视“腿足具身智能”,将“像人一样行动”与大语言模型“像人一样对话”形成互补。通过端到端强化学习训练的机器人实现了无遥操状态下的走、跑、跳、翻跟头等复杂动作,并能在有障碍物的崎岖路面上维持平衡与动态适应能力[5]。

2.3.2 执行层的情感表达

陪伴机器人的执行层承担着工业机器人所没有的特殊使命,即动作的情感表达。不同于工业机械臂追求精准、高效、可重复,陪伴机器人的动作需传达情绪、个性与生命力。一个动作僵硬、运动轨迹单一、缺乏“性格”的机器人,无论感知多精准、决策多聪明,都难以与用户建立情感连接。

迪士尼雪宝机器人在此方面提供了重要启示。其物理形态为三球堆叠结构,头部和身体一样大、脚却只有两个小雪球,在现实中几乎无法实现平衡,且动画中雪宝机器人的脚在行走时会“滑动”,完全违背重力定律[12]。开发团队为此设计了非对称六自由度腿部机构,左腿髋关节朝后、膝盖朝前,以最大限度地避免双腿在运动中的碰撞,从而确保行走动作的稳定性和机构安全性[12]。雪宝机器人下半身雪球被设计成柔性泡沫裙摆,既能保持形状又能在需要时发生形变;脚部采用柔性泡沫材质以吸能,减轻摔倒损伤;胡萝卜鼻子和树枝手臂通过磁铁固定,可在跌倒时自动脱离减少损坏[12]。

开发团队通过深度强化学习在虚拟物理仿真环境中进行大量训练,让机器人自主学习“摇摇晃晃却始终保持平衡”的步态,精准复现了动画角色特有的 “反物理”却有温度的动作质感[3]。为解决行走噪音问题(波士顿动力机器狗的“咔哒”声对可爱角色是灾难),团队设计了专门的降噪奖励机制:训练中AI因产生较大冲击力而受惩罚,从而学会更柔和的落地方式,最终实现约13.5 dB的降噪效果[12]。这种先仿真、后迁移的训练模式,将人类需数年才能掌握的复杂运动能力压缩至数月完成训练[12]。

2.4 反馈层:闭环的进化引擎

反馈层是具身智能系统区别于传统自动化系统的根本所在。其要求机器人将执行结果,如动作成功与否、用户反应如何、环境状态变化,实时反馈至系统,驱动感知模型、决策模型、执行策略的持续优化,形成“训练-验证-反馈-进化”的完整飞轮。

2.4.1 数据闭环的关键意义

反馈层的重要性体现在两个层面。就单次交互而言,即时反馈使机器人能够在线调整行为(如抓取物体时通过力觉反馈调整夹爪力度);就系统进化而言,长期积累的反馈数据构成了模型持续迭代的养分,使机器人能够在部署后仍持续提升能力。

具身智能领域学者北京大学助理教授、银河通用机器人创始人兼CTO王鹤[5]指出,当前机器人领域最稀缺的资源并非算力或模型架构,而是高质量的真实交互数据。王鹤主张“具身智能的爆发必须靠合成数据先行”,高质量合成数据同时包含视觉信息、任务级语言标签和严格符合动力学约束的机器人动作轨迹,信息密度最高且理论上可无限扩充[6]。反馈层能否有效运转,直接决定了数据积累的速度与质量,进而决定了系统进化的效率。

2.4.2 反馈机制的现实挑战

反馈层在落地中面临三重挑战。

第一是触觉模态的融入。VLA模型整合视觉、语言、动作三种模态已属不易,加入触觉信息(力度感知、材质辨识、温度感应、表面湿度检测)将导致多模态融合模型的复杂度急剧上升。2025年的Tactile⁃WAM研究揭示了一个关键问题:直接将触觉加入VLA模型反而会降低模型感知成功率,在ManiFeel仿真中,仅用RGB图片的模型成功率为5.8%,而直接加入触觉的朴素方案反而降至1.3%,这一现象被研究者称为“触觉污染”[13]。其根源在于视觉信号连续、全局、稠密,而触觉信号局部、稀疏、事件驱动,随意融合会破坏预训练视觉骨干的动态预测能力。Tactile⁃WAM通过VIDEOCLEAN掩码机制和触觉感知偏置,在接触密集型任务上达到87.5%的成功率(RGB⁃only仅1.5%),表明触觉融合需要结构化设计而非简单拼接[13]。该研究还提出了三点启发:触觉应作为未来物理状态被预测而非仅作为输入模态;多模态融合需有结构,不同模态应进入不同功能模块;触觉最重要的是变化事件而非静态数值[13]。

第二是实时性约束。家庭陪伴场景中的交互要求反馈延迟在毫秒级别,超出该阈值的响应将破坏交互的自然感。这对端侧推理芯片的算力与能效提出苛刻要求。业界正在通过专用低功耗AI芯片〔如神经网络处理单元(NPU)、异构计算平台〕和模型轻量化压缩技术(如量化、剪枝、知识蒸馏)寻求突破。

第三是数据闭环的系统性建设。真实场景中的交互数据难以规模化、标准化地采集和标注,涉及隐私保护、数据安全、场景多样性等多重约束。值得注意的是,2026年7月15日,《人工智能拟人化互动服务管理暂行办法》正式实施,明确要求服务提供方具备“用户隐私权和个人信息保护、过度依赖风险预警、情感边界引导、心理健康保护等安全能力”,这对数据闭环的合规性建设提出了更高要求。

仿真训练平台是加速反馈迭代的关键基础设施。雪宝机器人的开发依托NVIDIA、谷歌DeepMind与迪士尼研究院(Disney Research)三方联合开发的开源Newton物理引擎[14]。Newton基于NVIDIA Warp和OpenUSD框架构建,由DeepMind的MuJoCo⁃Warp提供支持,实现人形机器人仿真提速70倍以上、手动操作任务提速100倍[14]。迪士尼基于Newton框架自研的Kamino模拟器可在单块GPU上并行运行数千个异质虚拟环境[15]。Newton于2025年9月在机器人学习大会(CoRL)上发布测试版本,由Linux Foundation管理,已被苏黎世联邦理工学院、慕尼黑工业大学、北京大学等机构及多家企业采用[14]。这一仿真加速反馈的模式,为陪伴机器人反馈层的快速迭代提供了可复用的技术范式。

3

IP具身化:影视叙事与闭环技术的融合设计

3.1 影视IP赋能的情感逻辑

陪伴机器人的核心价值主张不在于完成某项具体功能性任务(如清洁、搬运、安防),而在于与用户建立持续的情感连接。这一价值定位决定了其产品逻辑与工业机器人截然不同:功能精度与任务成功率是基础准入门槛,而“使用户相信魔法真实存在”才是竞争制高点。图2构造出情感驱动的具身智能闭环,实现陪伴机器人核心价值。


图2 情感驱动的具身智能闭环架构

影视IP在这一过程中扮演了不可替代的角色。经典动画角色已通过多年乃至数十年的叙事积累建立起深厚的情感资产。用户对雪宝的喜爱不取决于它能做什么,而源于它在《冰雪奇缘》系列电影中展现的温暖、幽默与天真的角色人格。当这一角色以具身形态出现在用户面前时,用户自然而然地以对待角色的方式与之交互,而非以审视工具的功能性视角来评价其表现。这种认知框架的转换,使IP具身化机器人获得了普通机器人难以企及的“情感起跑线”。

华特迪士尼幻想工程研发高级副总裁Kyle Laughlin[5]主张,其设计哲学的核心在于以叙事为原点,将游客的预期情感体验作为首要考量。据此,技术系统的功能并非自我彰显,而应达到体验层面的透明性;其最终目的是使游客无需关注技术实现的细节,而能全身心投入与既定角色之间的情感共鸣。这一理念揭示了IP具身化的核心设计原则:技术应服务于角色质感的还原,而非彰显技术自身的存在感。

3.2 雪宝机器人的技术解析

雪宝机器人作为影视IP具身化的里程碑式案例,其技术方案完整映射了具身智能闭环的四环节协同。雪宝机器人于2025年3月在英伟达GPU技术大会(NVIDIA GTC)上与黄仁勋同台亮相,同年11月24日由迪士尼官方正式公布,并于2026年在香港迪士尼乐园和巴黎迪士尼乐园正式“上岗”。

3.2.1 感知环节

雪宝机器人集成了多传感器融合感知系统,能够实时识别周围环境中的游客位置、动作姿态,并通过视觉与语音分析游客的年龄层次与语言风格偏好。这一感知能力使其能够根据交互对象的不同调整交互方式,面对儿童时使用更简单的词汇和更活泼的语调,面对成人时则可展开更复杂的对话。游客拔下机器人胡萝卜鼻子的同时,其会做出夸张反应[12]。

3.2.2 决策环节

雪宝机器人的决策层采用“AI自主加后台辅助”的混合架构。核心行为模式(如行走方向选择、基本动作序列生成)由AI自主决策,以保证交互的自然流畅;而在涉及角色性格一致性关键内容的场合(如特定对白、叙事推进节点),则由后台团队适时介入辅助决策[3,13]。迪士尼官方明确表示,至少在初期阶段,雪宝机器人并非一个有自主意识、可以随心走动和说话的完全体,游客不应期待与它进行长时间的一对一交流[15]。这种混合架构体现了IP具身化中一个根本原则:技术自主性的边界不由技术可行性定义,而由角色一致性需求定义。

3.2.3 执行环节

雪宝机器人执行层最具突破性的设计在于其步态。其三球堆叠结构的重心位置与传统双足或四足机器人截然不同,动态平衡控制极具挑战性。开发团队采用深度强化学习在Newton/Kamino仿真环境中进行大规模训练,让机器人在虚拟世界中反复尝试跌倒与恢复,自主发现最优平衡策略[16]。迪士尼将《冰雪奇缘》原版动画师请到现场提供动作参考,AI在模拟器中反复试错,学习如何在保持物理平衡的同时模仿出标志性的“雪宝步”[12]。其胳膊采用球面五连杆结构,通过躯干内部执行器远程驱动;嘴巴用单个执行器同时驱动上下颌;眼睛拥有独立偏航控制及通过四连杆远程驱动的俯仰和眨眼功能[12]。训练完成后将策略迁移至实体机器人,实现了摇摇晃晃却始终不倒的行走效果,精准复现了动画角色那种充满生命力与幽默感的运动质感。

3.2.4 反馈环节

雪宝机器人的开发过程中,Kamino模拟器扮演了高效反馈引擎的角色。通过在GPU加速的物理仿真环境中并行运行数千个训练实例,系统可快速积累训练经验[15]。训练中产生的行为数据不断反馈至策略网络,驱动步态策略持续优化。这种“仿真加速-策略优化-实机迁移”的反馈闭环,大幅缩短了从概念验证到产品落地的时间周期。研发团队成员表示:“过去开发一个机器人需要数年时间,现在使用强化学习,我们能够在几个月内就让机器人活起来”[12]。

3.3 技术复用平台:从单一角色到IP宇宙

雪宝机器人的产业意义不只在于单一角色的成功,更在于其背后的技术复用逻辑。迪士尼通过Newton加Kamino构建的通用训练平台,其核心能力模块包括动态平衡控制、非结构化地形适应、基础动作库,在虚拟环境中完成训练后,可快速适配不同形态的角色IP,仅需针对角色的特定物理外形进行定制化调整[4]。

这一技术平台已验证了多角色的可延展性。2024年3月在NVIDIA GTC上亮相的BDX机器人是一款星球大战风格的双足角色机器人,身高0.66 m、总重15.4 kg,每条腿5个自由度,头部与颈部4个自由度,配备NVIDIA Jetson机载计算机[17]。BDX通过强化学习在NVIDIA Isaac Gym中训练行走姿态,将动作分为持续性、周期性和偶发性三类,累计10小时公开展示运行一次未摔倒[17]。需指出的是,BDX在公开演示中由专业人员通过复杂控制器遥操作,并不具备自主感知和行为能力[17]。此外,迪士尼还展示了自平衡的H.E.R.B.I.E.机器人(源自《神奇四侠》角色),以及可追溯至2018年Project Kiwi项目的小树人格鲁特机器人(身高约76 cm,可眨眼、单脚站立)[18]。

Kyle Laughlin指出,BDX机器人及最新一代雪宝机器人系统能够通过物理动作与人机交互,将叙事主题与情感体验具象化于现实空间。然而,Laughlin进一步区分了两类角色的实现难度:BDX机器人在电影中本身即被设定为机器人角色,其物理存在与角色身份具有内在一致性;而雪宝作为动画虚构角色,其向物理世界的具身化迁移则面临更为显著的技术与表征挑战[5]。这一对比揭示了技术复用平台面临的差异化挑战:从机器人角色到动画角色的具身化,技术难度呈指数级增长。

2026年7月,迪士尼公布加速器项目第12期名单,首次同时押注两家物理AI初创公司Physical Intelligence(专注通用任务执行)和FieldAI(专注复杂真实环境中的自主导航与不确定性推理),目标是让机器人从“在花车上表演”演进到“在园区自由漫步”[15]。

对于整个陪伴机器人产业,这一模式的启示是深远的:与其为每个细分场景开发专用机器人形态,不如构建可迁移的具身智能技术平台,以影视IP内容生态填充应用层。当技术闭环的各环节趋于成熟,竞争焦点将从硬件参数指标转向内容生态的丰富度,谁能拥有并持续激活更多具有情感号召力的IP资产,谁就掌握了陪伴机器人市场的核心竞争壁垒。

4

三层设计框架:闭环、影视IP与场景的系统整合

基于前述技术分析与案例研究,本文提出陪伴机器人产品设计的“三层架构”框架(图3),旨在为产品定义、技术选型与商业化路径提供系统化的设计参照。


图3 陪伴机器人的三层设计框架

4.1 第一层:具身闭环技术层

该层为所有陪伴机器人产品的通用技术底座,其完备性决定了产品的基础体验下限。核心建设内容包括:

(1)感知能力建设:实现三维语义建图,使机器人能够理解场景中物体的类别、功能与空间关系;实现多模态情感感知,融合视觉、语音、文本信号识别用户情绪状态、手势意图与行为模式;建立用户知识图谱,记忆个体偏好、社交关系与历史交互。INDEMIND等国内厂商已在端侧加云端混合架构上实现5~10 TOPS算力下的实时语义建图[7]。

(2)决策能力建设:部署VLA模型,实现从自然语言指令到动作序列的端到端映射;引入世界模型,使机器人具备环境状态预判与任务规划推演能力;建立安全决策边界,确保在模型不确定性较高时采取保守策略。OpenVLA、π0.5等开源模型为中小团队提供了可用的技术起点[6]。

(3)执行能力建设:采用端到端强化学习训练运动策略,适应非结构化的家庭环境;开发具有情感表达力的动作库,使运动轨迹传达机器人“个性”。雪宝机器人的降噪步态训练表明,通过精细化奖励函数设计可在运动质感与工程约束间取得平衡[12]。

(4)反馈能力建设:构建仿真-实机联合训练平台,加速策略迭代;建立真实场景数据采集与标注流程,形成持续进化的数据飞轮。Newton开源物理引擎及Isaac Lab等平台已为行业提供了基础设施[14]。

4.2 第二层:IP情感赋能层

该层是陪伴机器人的差异化核心,决定了产品的情感连接深度与用户粘性。核心设计原则包括:

(1)角色人格化设计:基于影视IP的角色性格档案、标志性动作习惯、独特语言风格,进行精细化行为设计。雪宝的“摇摇晃晃”步态、格鲁特的“好奇凝视”动作,均非通用运动策略所能产生,而需针对角色特质专门设计。

(2)技术隐身原则:以角色一致性体验为最高设计优先级。在AI自主与人工介入之间建立动态平衡机制,确保角色“说符合角色身份的话,做符合角色性格的事”。必要时限制AI的过度自主性以维护角色形象的纯粹性。

(3)内容生态构建:围绕影视IP开发持续更新的交互剧情线、知识问答体系、情感陪伴场景,使机器人的陪伴内容具有叙事深度与成长性,避免沦为单一的问答工具。

4.3 第三层:场景体验层

该层是用户直面交互的界面,需根据目标用户群体与应用场景进行定制化设计:

(1)家庭陪伴场景:面向儿童成长陪伴时,侧重于寓教于乐、情感支持与安全监护;面向老人情感陪护时,侧重于日常关怀、认知刺激与紧急情况响应;面向Z世代生活陪伴时,侧重于趣味交互、社交媒介与个性化表达。

(2)文旅场景:在主题乐园、商业综合体等公共空间部署IP角色机器人,提供沉浸式交互体验,增强空间的情感吸引力与消费转化率。

(3)教育/疗愈场景:基于影视IP叙事框架开发情感教育课程、社交技能训练、心理疏导辅助等功能模块,使陪伴机器人在功能性之外承载更多社会价值。

5

结论与展望

本文从具身智能“感知-决策-执行-反馈”闭环的技术逻辑出发,系统分析了陪伴机器人的演进路径、核心瓶颈与设计策略,主要研究结论如下:

第一,陪伴机器人的智能化水平取决于闭环中最薄弱环节的强度,而非最强环节的突出表现。感知、决策、执行、反馈任一环节的断裂都将导致整体体验崩塌。当前各环节均已取得显著技术进步。VLA模型论文2025年发表量近乎翻倍、Newton物理引擎已开源、雪宝机器人实现“数月训练即可上岗”,但距离家庭场景的普适应用仍有差距,尤以跨场景泛化决策能力和触觉反馈融合为关键瓶颈。Tactile⁃WAM研究揭示的“触觉污染”现象表明,多模态融合远非简单拼接,需要结构化的架构设计[13]。

第二,影视IP的具身化为陪伴机器人提供了突破“工具感”的有效路径。雪宝机器人的案例证明,当技术服务于角色质感的还原而非技术自身展示时,用户的情感接纳度显著提升。IP具身化的核心设计原则在于“以角色一致性定义技术边界”,而非以技术可行性定义角色行为。迪士尼“AI自主加后台辅助”的混合决策架构,正是这一原则的工程化体现。

第三,“通用技术底座加IP个性插件”的平台化架构是陪伴机器人规模化的可行路径。技术层面的复用性与内容层面的差异性相结合,可兼顾研发效率与产品差异化。迪士尼从BDX到雪宝机器人再到H.E.R.B.I.E.的技术演进,以及Newton引擎的开源化,验证了这一架构的可延展性。

展望未来,陪伴机器人领域值得关注的趋势包括:世界模型与VLA模型的进一步融合将使决策层具备更强的因果推理能力,Genie 3等生成式世界模型已展示出实时生成交互式三维环境的能力[8];仿真训练平台的成熟将大幅缩短产品研发周期并降低实地测试风险,Newton引擎的人形机器人仿真提速70倍以上已初见成效[14];轻量化大模型在端侧的部署将使机器人在无网络环境下仍具备高质量交互能力,谷歌已发布首个离线VLA模型[6]。

中国市场的机遇与挑战并存。产业政策层面,北京、深圳等地已发布具身智能专项行动计划(2025—2027年),在关键零部件、AI芯片、人机融合技术等方面设定突破目标[19]。市场层面,中国拥有超过3亿单身人口和3.2亿老年人口的陪伴刚需[2],优必选U1系列人形机器人在2026年6月预售全渠道订单突破1.3万台[2]。IP资源方面,从泡泡玛特LABUBU系列的全球火爆(母公司市值突破1760亿港元)到经典动画形象、传统神话人物、当代流行文化符号,中国具备丰富的本土IP储备[20]。监管层面,2026年7月实施的《人工智能拟人化互动服务管理暂行办法》为行业划定了合规边界[2]。如何将这些具有情感共鸣的IP资产与具身智能闭环技术进行深度融合,将是未来五年陪伴机器人赛道的关键竞争维度。技术闭环提供了“能做什么”的能力底座,IP赋能则回答了“为什么用户会喜爱”的价值命题,二者的深度融合,才是陪伴机器人从实验室走向千万家庭的通路。

参考文献

(向下滑动阅读)

[1] QYResearch. 2025—2031全球及中国宠物伴侣机器人行业研究及十五五规划分析报告[R/OL].(2025⁃10⁃30) [2026⁃08⁃18]. https://www.qyresearch.com.cn/reports/5434443/pet-companion-robots.

[2] 艾媒咨询. 2025—2029年中国情绪经济消费趋势洞察报告[R], 2026.

[3] The Walt Disney Company. Walt Disney Imagineering Brings 'Frozen' Olaf Robotic Character to Life[EB/OL]. (2025⁃11⁃24)[2026⁃08⁃05]. https://thewaltdisneycompany.com/news/olaf-robotic-character/.

[4] INDEMIND. 既能读懂情绪,还能多模态交互!INDEMIND用空间智能重新定义陪伴机器人[EB/OL]. (2025⁃09⁃26)[2026⁃08⁃05]. https://www.indemind.com.

[5] 王鹤, 龚雯. 何时能摆脱遥控器?[EB/OL]. (2025⁃11⁃18)[2026⁃08⁃18]. http://lw.news.cn/20251118/d5b43663e0ed43b49fa2b02f4faa6982/c.html.

[6] 新智元. VLA爆发!从美国RT⁃2到中国FiS⁃VLA,机器人即知即行的终极进化[EB/OL]. (2025⁃07⁃08)[2026⁃08⁃05]. http://m.toutiao.com/group/7524625659

286356521/.

[7] Ha D, Schmidhuber J. World Models[PP/OL]. (2018⁃03⁃27)[2026⁃08⁃05].https://arxiv.org/abs/1803.10122.

[8] AI科技评论. 深度长文解读“世界模型”:在虚构与真实交接之处凝视未来[EB/OL]. (2025⁃10⁃30)[2026⁃08⁃13].https://mp.weixin.qq.com/s/Ij0qwpqiYKMGo1wIUG4XVQ.

[9] Ma X, Yong S, Zheng Z, et al. SQA3D: Situated Question Answering in 3D Scenes[PP/OL]. (2023⁃04⁃12)[2026⁃08⁃05].https://arxiv.org/abs/2210.07474.

[10] BAAI. DrEureka: Language Model Guided Sim⁃To⁃Real Transfer[EB/OL]. (2024⁃06⁃04)[2026⁃08⁃05]. https://hub.baai.ac.cn/paper/32dfd775-4960-4406-b1be-7d195f643982.

[11] 新浪财经. 清华大学赵明国:人形机器人也需重视“腿足具身智能”[EB/OL]. (2025⁃09⁃22)[2026⁃08⁃05]. https://finance.sina.cn/hy/2025-09-22/detail-infrksie1348030.d.html.

[12] APPSO. 迪士尼真把雪宝造出来了!AI让它学会用两个雪球走路[EB/OL]. (2026⁃01⁃14)[2026⁃08⁃05]. http://m.toutiao.com/group/7595193746820530714/.

[13] 智科天地.让机器人“摸到未来”:Tactile⁃WAM 如何把触觉加入世界动作模型?[EB/OL]. (2026⁃06⁃29)[2026⁃08⁃18]. http://m.toutiao.com/article/7656691906709979654/.

[14] 智东西. 英伟达开源物理引擎Newton可用了!发推理模型、世界模型,全力加速机器人研发[EB/OL]. (2025⁃09⁃30)[2026⁃08⁃05]. http://m.toutiao.com/group/7555566131478594083/.

[15] DeepTech深科技. 迪士尼物理AI版图曝光,它挑中了这两家公司[EB/OL]. (2026⁃08⁃02)[2026⁃08⁃05]. https://www.toutiao.com/article/7656691906709979

654/.

[16] 廖绍伶. 迪士尼和 NVIDIA 合作最新 AI 机器人「雪宝」亮相!长得不像机器人挑战在哪?[EB/OL]. (2025⁃11⁃26)[2026⁃08⁃18].https://techorange.com/2025/11/26/disney-nvidia-olaf-robot-ai-breakthrough/.

[17] 智东西. 迪士尼是怎么做双足机器人的?[EB/OL]. (2024⁃08⁃01)[2026⁃08⁃05]. http://m.toutiao.com/group/7398133695703482906/.

[18] 网易新闻. Disney开发两足步行机器人 完美重现Groot行走挥手场景[EB/OL]. (2021⁃04⁃25)[2026⁃08⁃05]. https://59188saintaubert.com/__proxy_domain/3g.163.com/dy/article/G8EILP0N0514B52J.html.

[19] 华经产业研究院. 2025年中国具身机器人行业分类、政策、产业链及下游分析[EB/OL]. (2025⁃11⁃17)[2026⁃08⁃05]. https://m.sohu.com/a/955224311_120928700/.

[20] 雪球. 泡泡玛特商业案例分析:从潮玩巨头到全球化IP生态的崛起[EB/OL]. (2025⁃03⁃20)[2026⁃08⁃05]. https://xueqiu.com/8321460154/328235155.

期刊导读 |《现代电影技术》2026年第8期

王健等:面向电影行业应用的人工智能大模型技术评测研究

朱君:面向影视虚拟摄制的高保真数字资产管线研究


特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

电影技术微刊 incentive-icons
电影技术微刊
电影技术微刊
685文章数 209关注度
往期回顾 全部

专题推荐

乌蒙深处 清凉毕节

无障碍浏览 进入关怀版