中国和美国在机器人领域的竞争,正延伸到一个经常被低估的战场:数据。
不久前,估值近400亿美元的美国机器人公司Figure正式发布了Index。普通人通过App记录自己做家务或工作的过程,就能获得报酬。视频经过筛选、去重和标注后,被用于训练Figure的机器人模型Helix。
目前,Index已经覆盖108个国家,拥有4.4万名周活跃用户,累计收到超过1600万条视频,并向数据采集者支付了1500万美元。在Helix 2.5测试中,经Index预训练后,机器人在30套陌生住宅中执行三类任务的零样本成功率,从9%跃升至56%。
![]()
9月23日,觅蜂科技在上海发布全球首个全品类高质量物理AI数据众包服务平台“觅蜂派”,同时宣布启动亿元补贴计划,并发起“场景数据联盟”。
中美两家公司几乎同时盯上了同一个命门:机器人要进入现实世界,不仅需要更聪明的模型和更可靠的身体,还需要足够丰富、足够真实的数据。
回头看人工智能过去十多年的发展,数据的重要性早已被反复证明。李飞飞用ImageNet证明,大规模、高质量的标注数据可以改变计算机视觉;杰夫·迪恩推动的大规模计算和训练系统,让更多数据能够被模型消化;亚历山大·王则通过Scale AI,把数据采集、清洗和标注做成了一门产业。
算法决定模型怎样学习,数据决定模型能够见过多大的世界。
IT桔子数据显示,2026年上半年,25家中国具身智能数据创业公司合计拿到超过170亿元融资。数据已经成为具身智能赛道里资本最密集押注的方向之一。
与互联网上现成的文本和图片不同,机器人需要的许多数据尚未被系统记录。农作物怎样采收、水管怎样维修、货架怎样整理,这些动作背后的轨迹、力度、触觉和空间关系,都散落在日常生活和千行百业中。觅蜂派想做的,就是把这些经验转化为机器人能够学习的数据。
01
让普通人成为机器人训练师
“觅蜂派”是一款面向普通用户的物理AI数据众包App。目前覆盖22大类场景、5000多个任务和50000多个真实环境。任务既包括打扫房间、擦玻璃、整理文件,也涉及物流仓储、餐饮零售、养老照护、汽车服务和农业生产。
用户在觅蜂派中领取任务,佩戴MEgo设备完成指定操作,上传数据并通过验收后获得报酬。MEgo设备负责记录第一视角视频、手部运动、空间轨迹、触觉和力觉等信息;数据上传后,再由MEgo Engine完成切分、标注和质量评估。
![]()
“物理AI最好的老师,是每一个认真生活的人。”觅蜂科技董事长兼CEO姚卯青在发布会上说。
在发布会现场,这句话有一个很具体的落点。我看到一位42岁的宝妈李国英和其他首批参与者一起走上舞台,领取“001号机器人训练师”证书。
李国英平时从事网约车运营工作。内测期间,她戴上MEgo设备,记录浇花、擦玻璃、整理桌面和文件的过程。大约15分钟后,数据通过审核,她获得了任务收入。此后,她开始利用下班时间,在做家务时完成采集。
觅蜂派内测一个月,注册用户达到2万人,累计产生1.3万份任务提交。
对普通人来说,这是进入机器人产业门槛很低的一种方式:不用学习编程,只需把原本就在做的事情记录下来,就可能多获得一份收入。对机器人公司而言,众包则能进入专职团队难以覆盖的家庭、工厂、农田和维修车间,把普通人掌握的动作变成训练数据。
02
觅蜂派不只是另一个Index
觅蜂派与Index都通过任务、审核和报酬,把分散的用户组织成数据采集网络。但Index是Figure专属的数据管线,主要服务Helix;觅蜂派则面向多类客户提供数据服务。
姚卯青将这些客户归纳为三类:同时拥有本体和算法的具身智能公司、需要物理世界数据的世界模型公司,以及希望把能力从互联网延伸到真实世界的大模型厂商。
Figure只需要回答Helix缺什么,觅蜂派要回答不同模型、不同机器人和不同行业分别需要什么。这决定了觅蜂派必须同时解决两个问题:场景能不能足够广,数据能不能稳定交付。
姚卯青说,现在“叠衣服数据已经泛滥了”。机器人真正缺少的是修水管、修车、采摘作物和维护设备等长尾技能。客户需要的任务可能具体到海南果园采摘椰子,或某条电机生产线上拧一颗螺丝。找到这些场景,往往比拍下动作更难。
![]()
中国的优势不只是人多,还包括密集的制造业体系、物流网络和服务业态。大量机器人未来要学习的任务,今天已经有人在工厂、仓库、门店和农田里反复完成。
Figure依靠全球用户获得环境和人的多样性,觅蜂派则试图把中国的产业密度变成数据密度。
众包扩大了数据来源,也放大了质量控制的难度。设备戴歪、手部没有入镜或者动作无效,都不能直接交付;平台必须把这些来源分散、质量不一的数据,接入同一套处理、质检和交付体系。
03
觅蜂真正的壁垒,是一条数据管线
在数据采集领域,做一套采集设备、搭建一支采集团队,已经很难构成长期壁垒。觅蜂真正想建立的,是一条从客户需求出发,经过采集和处理,再回到模型效果的数据管线。
觅蜂科技把数据从采集到进入模型的过程,概括为“采、懂、译、用”。
在“采”的一端,觅蜂以MEgo设备为入口,同时覆盖真机遥操、UMI、Ego第一视角数据和仿真数据,采集方式也包括自有团队、集中式采集和众包网络。
![]()
不同数据承担的作用并不一样。Ego数据容易扩大规模和场景覆盖,适合在预训练阶段帮助模型形成泛化能力;真机数据成本更高,却能与机器人本体直接对齐,更适合后训练和具体任务优化;仿真数据则可以补充现实中难以反复获得的情况。
“懂”和“译”主要由MEgo Engine完成。它先理解和切分长程任务,再通过高精度位姿重建与动作映射,把人的操作拆解为抓、拿、放、拧、按等120多种原子动作,转化为统一的空间数据。
在数据真正进入模型前,ManiEval还会进行多维度质检与分级。它从格式与时序、任务完整性、传感器质量、语义准确性和动作可学习性等维度建立统一标准,再让不同质量的数据匹配模型训练、评测和长尾场景学习等不同需求。
姚卯青介绍,在完成自动切分并进入结算环节的数据中,超过95%最终可以被利用。
最后是“用”。经过处理和分级的数据进入预训练、后训练和强化学习,模型在真机上的表现又会反过来告诉平台:哪些数据有效、哪些场景尚未覆盖、下一轮应该采什么。
觅蜂采用的是“以销定产”的逻辑:先判断客户缺什么,再把任务派给拥有相应场景和技能的人,而不是先生产大量数据,再寻找买家。
目前,觅蜂已经拥有2万套MEgo设备和超过100万小时的真实世界无本体数据。觅蜂派补上的,是一张可以向更多职业、地区和产业场景扩张的社会化采集网络。
硬件可以被模仿,App也可以被复制。但客户需求、场景资源、采集网络、数据处理和模型反馈一旦形成循环,后来者面对的就不再是一台设备,而是一套已经积累了数据和运营经验的系统。
04
发动群众只是开始
在觅蜂派的任务大厅里,单条任务的收益最高30元,但使用采集设备并非完全免费。觅蜂派业务总经理张智富介绍,MEgo设备的标准使用费为每天39元,推广期降至每天19元。未来,平台还会根据设备形态、任务质量和有效率调整价格及补贴。
![]()
19元的设备使用费容易引发疑问,但数据采集和跑网约车、送外卖一样,也需要专业设备,一定的门槛能减少设备闲置。用户真正关心的是任务是否充足、收入能否覆盖成本、验收标准是否清楚。否则,再低的设备使用费用也没有意义。
隐私是另一条不能绕开的线。当设备进入家庭和工厂,它可能拍到人脸、文件和生产环境。觅蜂科技目前采用自动脱敏,并通过实名认证、电子签约、授权留存和合规审核管理数据。
觅蜂派接下来要证明的,是能否持续组织用户、进入稀缺场景,并把质量不一的数据稳定交付给客户。我仍然看好这一步,因为机器人要进入现实世界,就必须见过工厂里的零件偏差、农田里的泥和家庭环境中的遮挡。
Figure正在发动全球用户为Helix收集数据,觅蜂科技则试图把中国千行百业的工作经验,变成面向不同模型和机器人公司的数据服务能力。
发动群众只是开始,把人、场景和任务组织起来,再把采回来的数据稳定交付出去,才是觅蜂要建立的壁垒。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.