这次WRC,我在乐聚和蚂蚁灵波联合主办的论坛里听了两个多小时。最让我难忘的,是这场论坛的议题和嘉宾们给出的一些“反常识”观点。
第一场问「本体好不好学」,第二场问「数据好不好用」,第三场问「模型好不好评」。12位嘉宾来自整机、零部件、芯片、数据和高校。乐聚没有把话题收在关节参数和产品演示上,反而把机器人最难回答的几道题都摆了出来。
![]()
现场有三句话,让我印象很深。
“硬件正在从交付物变成模型能力的前提条件。”
“我们积累的并不只是数据量,而是对每一条数据生命周期的优化。”
“评测的最终价值不是对外证明什么,而是指引你调整数据分布的方向。”
这三句话连起来看,意思很清楚:一台机器人能不能干活,已经不是本体、数据或模型中的任何一环可以单独回答的问题。
过去谈机器人,大家容易盯着一台机器能不能完成一个漂亮Demo。现在,一些更现实的问题被摆上了桌面:同一个动作能不能稳定重复完成?一台机器上训好的策略,换一台还能不能用?采回来的数据到底有没有价值?
这些问题更接近机器人进场景之后的日常。
所以,三场对话听下来,我看到的新变化就在这里:机器人行业正在把注意力从“做出一个动作”,转向“把一件事稳定地做下去”。
01
本体先变了:硬件开始为模型负责
第一场对话聚焦本体。无锡泉智博科技创始人陈万楷先提了一个过去很少被单独讨论的变化:以前,机器人硬件主要服务于人;现在,本体多了一类使用者,模型。
运动控制模型要求硬件可建模、可描述,VLA模型要求不同机器之间尽可能可复现。关节误差、传感器同步、动作空间耦合,因而会一路影响数据复用和策略迁移。陈万楷那句“硬件正在从交付物变成模型能力的前提条件”,说的就是这个变化。
国地共建人形机器人创新中心常务副总经理刘宇飞把新要求概括成七个字:“易采、易学、易迁移。”
![]()
他提到,不同本体的关节噪声和性能并不一致,传感器同步、接口协议、运动空间都要做额外处理。一个真实的喇叭装配场景用了1000多条数据,基本跑通了三台机器人协同取料、装配、装箱,但因为产品和工装高度一致,泛化能力仍然有限。
“做成一次”和“换个环境还能做”,中间隔着一整套工程。
更有意思的是,乐聚在几位供应链嘉宾的发言里反复出现。陈万楷说,乐聚一直在给关节提出更高要求;杭州黑漫科技创始人杨子赫则提到,他们正在与乐聚打造工业可编程灵巧手。
这些细节说明乐聚向供应链提出的要求,已经不止是把硬件交付出来,还要让这套硬件对模型友好。
本体的成绩单正在换。会做什么动作依然重要,但动作空间是否干净、参数是否可描述、换机是否好迁移,越来越决定它能不能批量复制。
02
数据也变了:多不等于好,快也不只指采得快
第二场对话由乐聚智能合伙人、技术总监王松主持。这个安排本身就挺有意思:一家整机企业,在WRC上讨论怎么采数据、怎么定标准、数据怎么保值。
王松说,具身数据一年前还像一片荒漠,现在却突然冒出了Umi、Ego、真机、仿真、合成、小脑等多种路线。声音越来越多,方向反而不好判断。所以他的结论很直接:“具身数据从荒漠开始,没有标准答案。”
这门生意也确实够重。采集员要一帧一帧遥操作、动捕,数据回来还要清洗、对齐、质检。视角没对上、时间戳没同步、坐标系没统一,前面干的活很可能白费。
蚂蚁灵波首席数据科学家黄用韬把问题从“采多少”挪到了“反馈多快”。动作有问题,当天告诉采集员,他当天就能改;过一周再说,人已经记不清当时怎么操作,错误数据也积累了一批。因此他提出:“反馈时效决定数据价值密度。”
![]()
目前,蚂蚁灵波披露的真机数据已经超过10万小时,覆盖20多种机器人构型和超过3.6万种任务分布。但让黄用韬更在意的是数据分布,以及半天左右能不能把反馈送回去。
好数据的标准会随模型变化。几个月前有效的数据,换一版模型、换一个benchmark,价值可能就变了。能留下来的不只是硬盘里的一批文件,还包括这条数据由谁生产、在哪个任务里用过、给哪一版模型带来过什么变化。用黄用韬的话说:“我们积累的是对每一条数据生命周期的优化。”
简智新创副总裁雷腾给了一个更直观的例子。一位客户采购10万小时数据,希望由5000个人、每人采20小时完成,而不是让100个人、每人采1000小时。总量没变,人的分布变了,动作里的细小差异也会跟着变。他把这个经验概括为:“采集数据,人多量小比人少量大效果更好。”
诺亦腾合伙人何勇说得更尖锐。他们在动作捕捉数据中发现,一个数据集里大约只有20%的数据会对模型行为改变起到核心作用,剩下80%更多是同质化数据。“只有20%的数据真正推动模型,最难的是挑出好数据。”
到这里,乐聚为什么要把数据单独拿出来谈,也就不难理解了。对整机企业来说,机器人既是数据采集的载体,也是模型最终落地和验证的地方。只把本体造出来,不参与数据回流和模型迭代,整条链路就接不上。
03
模型的变化:评测开始为迭代找方向
第三场对话则是聚焦模型。这并不是让“大脑”出来做个压轴表演,而是追问一件更费劲的事:模型更新了一版,我们怎么知道它真的变好了?
蚂蚁灵波首席科学家沈宇军先问,大家都说要做通用模型,可通用到底怎么评?一项任务的成功率很高,不等于它能处理更多任务。于是他说:“打造通用模型,先要有通用benchmark。”评测要评通用性,也要服务模型迭代。
具身智能的评测比大语言模型重得多。上海交通大学副教授李永露曾设计过一个任务,让机器人拿起钥匙、插进钥匙孔并打开,团队反馈太难。可没过几天,行业里就出现了相近的演示。题目到底太难,还是模型离目标太远?行业连“该考什么”都还在摸索。
沈宇军回忆,蚂蚁灵波第一次发布模型时,内部做了3万多次测试,成本和工作量都很大。李永露更看重benchmark里的相对提升:一类数据加进去以后,同一任务家族下的多个子任务是不是一起变好?如果没有,就该回头检查数据组织和训练方法。他说:“评测的最终价值不是对外证明什么,而是指引你调整数据分布的方向。”
![]()
破壳机器人创始人许华哲对仿真评测更谨慎。他直言:“仿真标不出真实世界的摩擦。”他举了一个例子,Google曾花大约6个月,把一个环境里的摩擦系数等参数标得很细。仿真与真机的相关性可以做高,但换到别的房间就未必成立。
北京通用人工智能研究院具身机器人中心主任黄思远看到了另一面:真机评测太重。模型如果两天一版、一周一版,还要跨本体、跨控制器、跨规划器测试,仅靠真机很难长期支撑。所以他的判断是:“规模化验证需要更加依赖仿真评测。”
一个担心仿真不真,一个担心真机太慢。两种判断都成立。行业缺的,是一条既能对应真实世界、又能规模化运行的评测链路。
这场论坛有收获,恰恰因为嘉宾没有硬凑共识。分歧留在台面上,问题也就更清楚了。
本体端要回答的是,易学性怎样写进规格书,制造、算法和交付方又该怎样分担一致性与迁移成本。
数据端要回答的是,当模型需要的数据配方一直变化,标准如何建立,采回来的数据又怎样保值。
到了模型端,问题更难:什么样的benchmark真能评通用性?仿真与真机怎样建立稳定相关性?机器人又能不能从一次失败里学会调整?
这些问题,现场没有完整答案。一场论坛也不可能回答完。
但一家公司问什么,往往比它展示什么更能暴露方向。乐聚这次问的,已经不是机器人能不能做出一个动作,而是它能不能把一件事稳定地做下去。
走出会场时,我反而觉得问题更多了。不过至少,这个行业开始问对问题了。
— 欢迎您在评论区跟我们交流 —
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.