今年年初,英伟达创始人黄仁勋提出了一个概念:物理AI。
什么意思?就是AI能够理解物理世界规律、并在真实空间里感知、推理和行动的人工智能系统。他认为,这是AI发展的下一个阶段。
因此,2026年也被称为“物理AI”元年,业内普遍认为真正实现“物理AI”至少需要3年以上。
实际上,黄仁勋口中的“物理AI”,已经被一家中国科技公司做出来了。这家公司叫影身智能,他们打造了一个叫“4D世界模型”的技术底座。
![]()
01
世界模型,让AI走进真实物理世界
先说说,从大语言模型到世界模型,究竟有多远。
大语言模型的核心,是预测下一个Token。它擅长语言、知识和逻辑。你问它问题,它答得头头是道。
但真实世界里没有Token。
以机器人为例,要完成一个动作,光听懂指令远远不够。它还要能够理解真实物理世界当中的复杂规则,以及物体在特定场景下受到的影响,并且预测下一秒会发生什么。
世界模型干的就是这件事:让AI学习真实世界如何运行。它预测下一个物理状态。
举个例子,一台从没有在工厂环境训练过的机器人,没人教它如何工作。但它看了几千小时的人类操作视频,慢慢摸清了物体被拉、被扭、被推时的形变规律。动手之前,它就能预判接下来会发生什么。
这就是世界模型的能力。
那问题来了,为什么一定是4D?
行业里现有的主流路线,各有各的短板。
VLM和VLA路线,靠语言、图像和动作数据训练。缺点在于:力控、材质、形变这些物理细节,很容易在数据里丢掉。
二维视频路线,画面可以做得很逼真。但深度信息、空间结构、真实的交互反馈,二维画面里没有。视觉逼真和物理真实,根本就是两回事。
三维重建路线,能还原空间形态。但缺了时间维度,就只能描述某一个瞬间,理解不了动态变化,也预测不了下一步。
影身智能创始人闵伟有个判断:“语言是人类的母语,机器的母语在三维物理世界里。”AI训练用的语言、图片、视频,都是真实世界被压缩后的投影。降维必然损失大量信息。
触觉、力学、风场、热场、电磁场等物理规律,本质上都依赖完整的四维时空才能被真实承载,二维像素空间根本无法容纳这些信息。正因如此,原生4D世界模型成为继大语言模型、视频生成模型之后的新一代基座。
![]()
4D世界模型-手物操作生成视频对比(中间为影身智能4D世界模型)
这也解释了一个行业怪现象:数据从十万小时堆到千万小时,泛化问题依然没解决。数据的关键不在数量而在于质量,更确切地说,在维度。
所以影身智能选了4D路线:三维空间,加上时间维度。尽可能完整地保留真实世界中的空间结构、动作过程、材料变化和交互因果。
按行业传统,世界模型的技术路线分成了四类。闵伟把自己划在第五类:以4D时空为核心的动态世界模型。前四类用的都是互联网上的现成数据,影身智能从底层创造了一种从来没有过的数据集。
02
影身智能的技术底座:4D数采、4D基座模型和垂域模型
方向定了,怎么落地?影身智能搭了三层技术底座。
第一层,4D数采,解决高维数据从哪来。
世界模型首先是数据问题。全球的4D数据只有上百小时,大多数躺在实验室里。传统采集方式有多贵?今年春晚那个演员和分身共舞的节目,4D建模的机器要200多万,算下来成本至少2000元一分钟。
影身智能的方案,叫“影身360”。用4到6个普通RGB摄像头环绕工位,多角度同步采集,再用自研算法合成为高精度4D时空数据。
普通摄像头,加消费级GPU,就能跑起来。
这套系统的价值在于四点:降低了4D数据的获取门槛;可以在真实生产现场持续采集;能延伸到演唱会、赛事、活动这些动态场景;让4D数据从实验室的稀有样本,变成可持续生产的数据资产。
正如闵伟所说“互联网上有几百亿张图片,信息量可能不如一位老师傅在产线上刷几十秒胶。”那几十秒里,包含了力度、角度、曲面贴合、流体形态变化。全是物理世界最真实的反馈。
他还提到了李飞飞的ImageNet。在那之前,标注图片只有几千张,大家在现有数据集上雕花,模型性能每次只进步一两个百分点。100万张标注图片的数据集出来之后,才有了后来的深度学习浪潮。每一次AI的重大变革,底层驱动力都是新一代数据集。
第二层,4D基座世界模型,让AI三能一体。
影身智能的4D基座世界模型“破界S1”,是一套面向真实世界的底层模型体系。核心能力可以概括成“三能一体”。
渲染能力,重建和生成高保真4D场景。让模型看得见,也产生了基本的数据集。
仿真能力,在4D数据基础上融入触觉反馈、惯性参数、材质属性,学习材料形变、受力变化、运动轨迹和交互因果。解决"算得准"的问题。传统仿真高度依赖预设参数,这套体系直接从真实数据里学规律。
规划能力,基于物理理解生成机器人动作序列。让机器人真正动起来,通过观察熟练工人操作,理解工艺意图,自主泛化到新的作业对象上。
三种能力统一在4D时空表征之上,模型能理解并预测真实的物理过程。
第三层,垂域模型,把通用能力变成行业能力。
基座模型提供通用物理理解,真正进入商业场景,还要针对具体行业和任务做垂域模型。
物理具身方向,可以形成工厂场景的涂胶、压底、穿鞋带、包装、折纸盒等垂域模型。数字文娱方向,可以形成演唱会4D重建、赛事4D直播、数字人生成、沉浸式内容分发等垂域模型。
垂域模型的价值,是把技术变成可复用、可规模化。
03
4D世界模型场景落地:物理具身与数字文娱
先看制鞋。这是个典型的"双柔性"场景。
第一重柔性在材料。鞋面布料软,会变形、会起皱,机械臂抓不住;第二重柔性在生产。鞋款按月迭代,小批量、多批次,传统编程的机械臂完全跟不上节奏。
![]()
在实施之前,晋江的工厂老板问了闵伟三个问题:你的设备要改造产线吗?要停工吗?要派工程师驻场吗?闵伟只回答了两个字,不用。
落地效果怎么样?在晋江鞋厂的流水线上,一台台机械臂夹起鞋面,沿着曲面轮廓均匀涂胶。力度、角度、速度,由视觉系统和力控算法实时调节。十多秒后,鞋面被送到下一个工位,另一台机械臂开始压底。以前坐在这些工位上的,是工人。夏天车间里胶水味刺鼻,戴着口罩进去,待一分钟都难受。工人一待就是一天。
涂胶机器人
现在,机器人1:1替代人工,单工位半天完成部署。它通过观看工人操作学习新鞋型,效率跟熟练工人相当,还能7×24小时连转。原来45人的生产线,现在5个人管机器就够了。
更关键的是,机器人每在产线上跑一天,都在回传真实的4D操作数据。数据训练模型,模型变强后适应更多产线,产线又产出更多数据。数据飞轮就这样转动起来了。
凭借卓越的实施效果,2025年,影身智能拿下国内具身智能领域首个千万级柔性智造订单。2026年,在手柔性智造订单达到数亿元级别,排产规模千台级。初代产品ShadowGlue和ShadowPress已经完成稳定性测试,进入规模化交付阶段。
影身智能在具身智能领域的布局并不止于工业场景。依托世界模型的泛化能力,在逐步打开柔性工业这一万亿级市场的同时,影身智能正将技术与产品能力向养老照护、家庭清洁、厨房餐饮等生活服务场景延伸,推进照护机器人、清洁机器人以及炒菜、面点机器人等产品研发,探索具身智能在B、C两端的规模化应用路径。
再看数字文娱,这是4D世界模型的另一条商业曲线。
为什么4D能力可以进数字文娱?想一想,演唱会、赛事、发布会、重大活动,同样是动态的物理世界。舞台、人物、动作、灯光、空间、视角,全都在实时变化。
![]()
闵伟描述过一个场景:现在演唱会门票按座位卖,坐第一排和坐山顶,体验天差地别。把演唱会的4D数据采集下来,通过技术分发到各个终端。你坐在哪都无所谓,戴上4D眼镜,偶像就在你眼前。
![]()
对演艺人员进行360度实时动态4D重建
可能的应用方向包括:演唱会4D采集与沉浸式回放、体育赛事4D直播、重大活动的空间化记录。
04
一家冉冉升起的物理智能公司
强大的4D世界模型背后,是一支堪称豪华的技术团队。影身智能成立于2024年6月,围绕原生4D数据、世界模型和具身智能做全栈布局。
创始人闵伟,清华大学精密仪器系直博,20年柔性操作领域积累,曾在阿里本地生活从零搭建机器人团队,完整走过技术、产品到商业化的全过程。清华大学刘烨斌教授为合作的核心科学家,深耕三维视觉和AI多年。公司研发人员占比超过90%。
对于企业来说,影身智能提供的价值超出了单台设备的范畴。零产线改造、零停工、零驻场编程,一套持续进化的物理智能解决方案。设备跑得越久,模型越强,交付效率越高。
在资本层面,公司今年第一季度完成近亿元融资,投资方包括恒生电子、松禾资本、深高投等机构。技术布局上,影身智能计划在2026年底至2027年上半年,发布大规模4D数据集和具身智能大模型。
结束语:
影身智能这个名字,源自柏拉图的洞穴寓言。困于洞穴的人只能看见影子,唯有走出洞穴才能看见真实的世界。仅靠视频学习,就是那个洞穴;而4D才是真实世界。影身智能的使命,就是帮助机器人穿透影子、抵达真实:以视频为基础,但不止于视频,最终透过视频看见更高维度的真实世界。
物理AI的战场,在车间、在产线。因为,真正理解物理世界的AI,必须在真实场景中被训练、被验证,并且持续迭代。
世界模型真正的较量才刚刚开始。中国公司,已经坐在了牌桌上。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.