一个代号为「做个人吧」(MVP)的神秘具身智能团队,最近放出了一连串让人坐不住的Demo视频。视频里,机器人端着一杯水穿过人群,被人撞到肩膀的瞬间,杯子里的水没有洒出来——它没有提前规划路径,而是靠瞬时反应稳住了平衡。
更让人意外的是,这个团队至今没有公开身份。他们只通过视频和一份技术说明,向外界展示了自家模型在物理理解、自进化、长程任务执行上的表现。在具身智能赛道被VLA(视觉语言动作模型)和WAM(世界动作模型)主导的当下,这个神秘玩家抛出的技术路线,似乎指向了另一个方向。
![]()
80%的零样本成功率意味着什么
团队给出的核心数据是:模型在zero-shot(零样本)场景下的任务成功率已经达到80%。所谓零样本,就是机器人没有针对某个具体场景做过预先训练,第一次上手就要完成复杂任务。
从Demo来看,这个能力不是停留在实验室的摆拍。机器人被要求整理客厅,面对的是没有预先编排的杂物摆放,它完成了;两台不同型号的机器人被放到一起,协作抖床单,也完成了;收纳多件物品时,它没有一件件来回搬运,而是像人一样规划了一次多带几件的路径。
团队在说明中强调,这个模型把动力学预测与长期状态统一了起来,相当于给机器人装了一个「物理大脑」。它的行为基于对物理规律的理解,而不是对动作的简单模仿。
和主流路线的分歧在哪里
这个技术路线,和目前行业里主流的VLA、WAM模型形成了鲜明对比。团队在材料中直接点出了主流模型的软肋:一旦遇到遮挡、接触、形变这类需要物理推理的任务,VLA和WAM就容易失效。原因在于,它们本质上是在模仿动作的样子,并不理解动作背后的物理规律。
换句话说,主流模型擅长的是统计拟合,而MVP团队声称自己做的是让机器人理解「为什么」。端水杯不被撞洒、扶住易拉罐不让它倒,这些场景考验的不是动作库的丰富程度,而是对物体运动规律的实时判断。
团队还提到,模型具备自进化的能力,机器人能自主学习、持续更新自己的行为策略。在决策时,它表现出类似人类的效率和逻辑——比如一次多带几件物品而不是往返跑,这种选择背后是自主意图,不是预设的条件反射。
跨本体协作背后的技术信号
双机器人协作抖床单的Demo,是另一个值得注意的细节。两台不同型号的机器人,由同一个模型驱动,完成了需要实时配合的任务。这说明模型不依赖特定的硬件形态,具备跨本体的泛化能力。团队称之为「一脑多形」——同一个大脑,可以装进不同的身体。
如果这个能力属实,它意味着具身智能的训练逻辑可能发生变化:不再需要为每一款机器人单独训练一套模型,而是训练一个通用的「物理大脑」,再适配到不同硬件上。
户外测试在即,身份仍是谜
团队透露,下一步即将在开放环境中进行户外测试。相比室内Demo,户外意味着光照变化、地面不平、突发干扰,对物理理解能力的考验会大得多。80%的零样本成功率能否在真实世界里维持,是接下来最值得盯的点。
至于团队身份,目前没有任何线索。他们选择用视频和结果说话,而不是先亮出背景。在具身智能这个融资和关注度都极高的赛道里,这种匿名发布的方式本身就带着一种态度:先看东西,再谈其他。
如果户外测试也能跑通,这个神秘团队的技术路线可能会成为VLA和WAM之外的另一极。到时候,行业要讨论的就不只是「谁家的机器人更灵活」,而是「机器人到底该不该理解物理」这个更底层的问题。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.