You are what you eat(你吃什么,你就是什么)。
这句英文日常俗语,可能很多人都听过。它最早由法国美食家布里亚-萨瓦兰在1825年的著作《厨房里的哲学家》(被后世称为“饮食圣经“)中写道 “告诉我你吃什么,我就能知道你是什么样的人”。
他认为,一个人的心理、情绪和身体健康,与他所吃的食物息息相关;好的食物能塑造健康的身体和温和的性格,而糟糕的食物则会损害人的体魄和内心。
几十年后,德国哲学家费尔巴哈也用一句简洁有力的话再次强调了这一观点——“A man is what he eats.(人如其食)”。
没成想过了两百零一年,从塞纳河畔到黄浦江边,我听到了全球最聪明的五个大脑,说了类似的观点,这一次他们说的不是人,而是机器人:未来竞争的关键在数据,标准化的高质量数据投喂的机器人,才能真正的聪明起来、好用起来。
![]()
WAIC世界人工智能大会期间,我没想到会经历这么一个场景,场外是机器人舞台对决挥拳,场内是科学家们为了理念辩论,激烈异常。
智元、觅蜂把具身智能领域里的五位大咖请到了上海同台:Physical Intelligence 的任至意、Genesis AI 的王尊玄、Dyna Robotics 的马也骋、Sunday Robotics 的赵子豪,再加上佐治亚理工的徐丹飞,清一色华人青年学者,个个手握全球顶流的技术路线。
![]()
表面是学术交流,话里话外全是锋芒。有人说VLA已经过时,有人力挺WAM才是正道;有人坚持只做AI 大脑,有人笃定软硬件全栈整合才是答案。
吵得越凶,越能看清一件事:所有路线之争的终点,都指向同一个胜负手,那就是数据。
看惯了产业界一团和气的我,听着这些“吾爱吾师,吾更爱真理”,为了真理越辩越明而在台上你来我往的大咖们,有种感觉到了什么叫赤子之心,也感受到了具身智能最大的魅力所在,这个产业此刻还足够纯粹。
机器人的大脑,该选哪种设计?
最先擦出火花的,是机器人大脑的技术路线之争。
“VLA已死,WAM当立!”这个说法,最近很有市场。
VLA(视觉 - 语言 - 动作模型),是指让机器人看懂画面、听懂人类指令,直接输出动作指令,是当下主流的方案;WAM(世界动作模型)则让机器人能提前预判做完动作后环境会变成什么样,边预判边执行,稳定性更强。
来自硅谷明星公司Physical Intelligence 的任至意当然不同意这个说话,他自豪地说:“到目前为止,没看到哪家的演示效果能超过自家的 π0.7 模型,VLA 还没死。”
![]()
△ 现场展示的数据采集装置
PI 是当前全球最火的具身模型公司之一,它的 π0.7 模型刚拿下了跨本体泛化的天花板成绩。
跨本体泛化,简单说就是在A 款机器人上学到的技能,不用重新教、不用微调,直接就能用到结构完全不同的 B 款机器人身上。
在任至意看来,VLA 和 WAM 根本不是非此即彼的敌人,未来一定会走向融合:一个负责听懂指令、知晓任务,一个负责预判后果、谨慎执行。
Dyna Robotics 的马也骋并不同意这一观点,他拿出了数据:团队切换到WAM 路线后,在餐巾折叠这类工业场景里,可靠性提升非常明显:商用模型 DYNA-1 能做到 24 小时无人干预,连续折叠 850 多张餐巾,成功率 99.4%。
在马也骋看来:在追求高稳定性、低调试成本的落地场景里,WAM 的效率确实比传统 VLA 更高。
其实,在花生看来,这俩看似针锋相对,其实说的是同一件事:无论选哪种大脑架构,决定能力上限的从来不是架构本身,是喂进去的训练数据。
π0.7 的跨技能迁移,靠的是海量多场景、多形态机器人的真实交互数据;Dyna 的工业级稳定性,靠的是真实上岗后攒下的全流程数据。
架构只是容器,数据才是真正的燃料。
做全栈,还是只做大脑?
具身智能走到最后,到底该软硬件一把抓,还是只专心做好AI 大脑?
腾讯首席科学家、Robotics X 实验室主任张正友在圆桌里说得很坦诚:腾讯只做大脑,不做机器人本体。理由很实在:“腾讯历史上做硬件没太多成功经验,有自知之明。”
这句自嘲收获了全场的笑声,还有人拍手叫好,多说一句,在花生看来,无论是自嘲,还是如话中所说主动设定边界,清晰表达观点,都是非常自信的表现。
![]()
△ 具身智能要想变得更聪明,就要有更好的数据投喂它,而数据采集就是在制作教科书,因此 备受市场关注
在张正友看来,这行不会只有一种赢家,就像手机时代有苹果那样的全栈模式,也有安卓这样的开放生态,纯大脑路线一样有生存空间。
PI的态度感觉有些松动。任至意坦言,现阶段用结构简单、维护成本低的机器人本体,是为了快速迭代模型;但长期来看,软硬件垂直整合的优势更大,未来不排除下场自己做硬件。毕竟软硬件深度绑定,才能把模型能力压榨到极致,也才能拿到最贴合自身模型的第一手训练数据。
智元走的则是最重的全栈路线。智元合伙人、觅蜂科技董事长姚卯青告诉花生:商业化落地要面对客户对可靠性、成本、一致性的严苛要求,只有打通机器人本体、硬件、算法、控制、落地全链路,才能在系统层面找到最优解。
更关键的是,全栈意味着数据闭环的主动权完全握在自己手里。机器人每天在真实场景里产生的成功、失败、异常恢复数据,都会持续回传给模型,形成越用越聪明的正向飞轮
如果说第一个问题是技术路线之争,那这轮本质就是商业问题,后者没有对错高低,只有不同阶段的选择罢了。
就看谁能以更低的成本、更快的速度、更高的质量,持续生产真实物理交互数据,谁就能跑得更快。
拼到最后,就看数据质量
五个大咖争了一个上午,产生了唯一的共识:具身智能想要迎来类似ChatGPT的爆发时刻,核心瓶颈就是数据。
姚卯青认为目前业内存在三道墙,阻碍了发展:一是数据墙,真实世界的交互数据极其稀缺,获取成本极高;二是表征墙,不同任务、不同场景、不同机器人之间的经验没法通用共享;三是闭环墙,真实场景里试错代价大、反馈慢,很难规模化迭代。
而各家企业选择的措施,其实就是不同路径的破壁人罢了。
有人深挖高价值真机数据,有人通过无本体采集把真实世界的人类操作经验规模化,还有人让机器人先在虚拟世界里反复练习。路径千差万别,目标高度一致:把物理世界里的动手经验,变成AI 模型能看懂、能学习的标准化数据。
![]()
△ 数据采集工厂也被视作机器人的学校
在花生看来,这也是觅蜂科技的最大价值所在,ta就像是一家数据基础设施公司。
通过搭建数据采集、治理、评测的全链路平台,把散落在各个场景里的交互经验,加工成能驱动模型进化的通用燃料,相当于把人类在真实世界里积累的经验,整理成机器人看得懂、学得会的“武林秘籍”。
纵观商业世界,当别人争着掘金的时候,卖铲子的人往往会最先占据先机。
姚卯青,提出了一个很有趣的判断:要让机器人达到实现开箱即用,大概需要一亿小时级别的真实交互数据。而现在整个行业的数据规模,和这个目标还差了上万倍。
英雄所见略同, 7月20日,佐治亚理工学院助理教授、NVIDIA 研究员徐丹飞发了一串手绘涂鸦式的推文,看似是随手的铅笔画,背后是对具身scaling law的思考。
![]()
看来具身智能的前行之路,道阻且长呢。
多说两句,两年前,花生来WAIC,具身智能也就五六家企业;去年来WAIC,大家比的是演示视频好不好看,参数够不够炫;今天聊具身,大家吵的是落地成功率、数据成本、部署效率。
如今的,具身智能走出了PPT 阶段。路线越多元,争论越激烈,越说明这个行业正在从蛮荒走向成熟,这是件好事儿啊。
文 | 李皙寅·花生
编辑 | 黑松
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.