![]()
文 | 童蔚
你有没有发现,这一年多来,AI越来越“开窍”了。它不光能看懂你发的表情包,还能听明白语音里的潜台词,甚至开始透过电脑屏幕和摄像头,打量周围的世界。
可一旦从数字世界进入物理世界,问题就来了。天上的无人机在飞,产线上的机器人在移动,商超便利店里的摄像头一直在记录……现实世界不会按暂停键,AI来不及说“你等一下,我先算算”。
对这些设备来说,AI需要的不是偶尔“聪明”,而是持续在场。比如持续接收视频流,并更新对环境的理解,然后在任何需要介入的时刻,做出几乎同步的响应。
这就是物理AI要解决的第一个问题:让AI在动态世界里不掉线。
这两天,一款来自杭州的多模态模型提供了解题的新思路。
![]()
从感知、定位到行动的能力链
6月27日至29日,联汇科技VLX端侧流式多模态模型系列连续三天面向全球发布。它包含三款模型,VLX-Flow、VLX-Seek和VLX-Go,分别对应实时感知、精准定位与行动执行,构成一条完整的能力链。
VLX = Vision-Language-eXecution,也就是“视觉-语言-执行”一体化多模态模型。
VLX-Flow,它负责持续感知。人在走,车在跑,视角在切换,没有什么是静止等待分析的。传统的视频理解,通常是等视频录制完毕后再整体分析。VLX-Flow改变了这一模式,视频像流水一样不断进入,模型边接收边更新理解,实时记忆“刚才发生了什么”。
![]()
VLX-Flow 处理连续输入的视频片段,并维护视觉缓存与语义记忆以支持低延迟交互。
传统方法每隔一段抽一帧分析,好比看连环画,中间的动作连贯性容易丢失。VLX-Flow将视频切分为连续的小片段,按顺序处理,保证了动作的连续性。你随时提问,它都能随时作答。处理一路视频最快仅需0.06秒,还能同时处理好几路。
第二个VLX-Seek,负责精准定位。要让机器人“把桌上那个红杯子拿过来”,它需要在画面中精确锁定杯子的位置。VLX-Seek采用一种“区域匹配”的方式替代传统的坐标预测,定位效率更高。
![]()
最后是VLX-Go,负责行动执行。理解与定位后,还需要转化为实际行动,比如前进、转向、避障、跟随等。
![]()
这三个模型共享同一基座,在同一条视频流上协同工作,形成“感知→定位→行动”的完整闭环。这也与6月初CVPR 2026(IEEE国际计算机视觉与模式识别会议)上的趋势不谋而合。在会上,实时感知和精准定位成为热门关键词。
(了解三个模型的更多技术详情:
https://github.com/om-ai-lab/VLX-Flow,https://github.com/om-ai-lab/VLX-Seek,https://github.com/om-ai-lab/VLX-Go)
![]()
无人机和手机上也能跑
VLX最值得关注的地方,在于它的整套设计思路。
行业的主流做法是:先训练一个巨大的云端模型,再通过压缩、蒸馏等方式移植到端侧。你可以理解为,先建一栋摩天大楼,再拆解搬运到别处重建。
VLX走的则是另一条路,从出生之日起,就按照端侧的算力边界来设计整个系统。这相当于直接在目标位置建造一栋合适的房子。
结果就是“小而准”在实际场景中,可能比“大而全”更有效。
![]()
它不依赖网络连接,数据无须上传云端,隐私安全更有保障,响应速度也更快。此外,当视频流持续输入时,历史信息不断累积,传统模型会越来越慢。VLX-Flow通过双层记忆机制,解决了这个问题。一层保留近期画面细节,另一层维护长程的语义上下文,使响应延迟始终保持稳定,不会因为看得久了就变迟钝。
手机算力有限,还要同时跑App,留给AI的空间本就不多;无人机、机器人、摄像头更是如此,一丢丢延迟都可能影响任务成败。在有限算力下持续理解环境、完成行动闭环,这是它们共同的刚需,也是VLX的着力点。
那么具体到实际场景,VLX能做什么?
工业流水线上,质检机器人可以一边盯着产品流动,一边实时找出瑕疵品;工程现场,无人机飞过就能同步识别安全隐患,不用等降落后再回传分析;安防场景里,系统不再“被动等查询”,人员突然闯入、物体遗留、异常动作发生等,它都能主动触发提醒。
![]()
多模态领域的老玩家
支撑VLX落地的,是一支在多模态赛道深耕多年的团队。
联汇科技位于滨江区互联网产业园,公司CEO兼首席科学家赵天成毕业于卡耐基梅隆大学(CMU)语言技术研究所,核心团队来自CMU、清华、浙大等高校。
![]()
赵天成(资料图,摄影 陈中秋)
这家公司切入多模态领域的时间点,比大多数人意识到的都要早:2021年,推出国内最早的视觉语言大模型之一;2022年,取得工信部大模型检测的001号证书;2023年“百模大战”全面打响时,抢先发布自研OmModel多模态大模型的V3版本,以及国内首批大模型驱动的智能体应用。
去年,他们将DeepSeek-R1的强化学习推理范式引入机器视觉领域,开源项目VLM-R1上线仅一周便在GitHub上获得2.7k Star,成绩堪称亮眼。
![]()
杭州的物理AI版图正在成形
当物理AI和世界模型已经成为全球科技巨头公认的下一座金矿,在视觉硬件、大模型、先进制造等领域有长期产业积累的杭州正在编织一张大网。
除了联汇科技,这里还站着一批各具特色的玩家,各自从不同角度切入这场变革:
群核科技:旗下酷家乐平台积累超4.8亿个3D模型,以此为基础搭建具身智能虚拟训练场,让机器人在模拟环境中提前学会在物理世界干活。已与智元机器人、银河通用等企业达成合作。如果说大多数公司是在具体场景中应用物理AI,群核科技的定位则更偏底层,它想成为物理AI时代的“基础设施提供者”。
![]()
空间理解模型SpatialLM运行原理
凌迪科技:以自研柔性仿真引擎为核心,能让数字布料在虚拟世界中的垂坠感、褶皱、光泽无限接近真实世界。这恰好是物理AI最需要、也最难攻克的一环——形变体物理仿真。目前已服务全球超3000家时尚企业,并成为英伟达Newton物理引擎平台全球唯一形变体模拟引擎合作伙伴。
![]()
机器人抓取柔性面料的仿真训练
影身智能:公司自研原生4D世界模型,从数据源头直接构建“三维空间+时间维度”的建模能力。聚焦“双柔性”制造场景,涂胶和压底机器人已在“中国鞋都”晋江制鞋产线上实现1:1替代人工,不改产线、不停工。目前已获近亿元融资,在手柔性智造订单超2亿元。
![]()
制鞋产线上的压底机器人
智澄AI:创始人兼CEO胡鲁辉2024年4月首次提出“物理智能”概念,专注物理智能世界模型与通用机器人研发。去年至今已完成三轮融资,累计签约订单近15亿元,覆盖智能制造、安防巡检、生化检测等场景。
![]()
智澄AI的人形机器人TR5 PRO
肇观智能:前AMD核心团队创立,专攻端侧视觉感知芯片VPU。如果说大模型是物理AI的“大脑”,他们做的就是“视网膜”,把光信号转化为空间感知,在端侧完成实时的三维感知和环境识别。产品已覆盖200多个下游场景,近期将总部迁至杭州。
![]()
风语筑具身智能:6月刚刚入驻滨江的国家人工智能应用中试基地(具身智能)。基于近20年积累的三维空间资产,构建“真实场景采集-数字场景构建-仿真训练验证”的物理AI训练体系。
![]()
恩和生物科技:物理AI驱动的生物制造公司,3月发布全球首个面向生物制造领域的物理人工智能平台SAION AI。它就像一个能思考、会动手,还能自我进化的“AI科学家”,能将研发目标拆解为可执行方案,并直接驱动实验设备运行。已与新和成、伊利、珀莱雅等企业深度合作……
![]()
![]()
“中国第二好”的投资人投了DeepSeek
不玩虚的,国产“世界模型”已能让机器人进厂打工
考察完“AI六小虎”,杭州投了智谱
点喜欢
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.