![]()
9 月 3 日,北京人形首次对外完整开放具身智能机器人数据与训练基地。相比此前运动会上跑出 8.64 秒百米成绩的天工,这次被摆到台前的,是过去藏在机器人背后的另一套能力:数据。
北京人形把这套数据体系比喻成天工的「风火轮」。如果具身天工是身体,「慧思开物」提供大脑,数据就像持续流动的血液。运动会上被看到的是冠军天工最终跑出了多快,藏在它背后的「风火轮」,解决的则是机器人如何持续获得新的能力。
这次开放提供了一个观察具身智能竞争的不同切面:当本体和模型之外,数据开始被单独建设成一套规模化能力,它承担的也不只是让单个机器人获得新的能力。北京人形正在把这套数据能力进一步向产业延伸,通过高质量数据交付、开源数据集、训练服务和标准建设,服务更多企业和科研机构,并进一步带动具身智能产业生态的发展。
冠军天工背后的「风火轮」
天工在运动会上跑出 8.64 秒百米成绩,也进入举重、舞蹈、跨障等不同任务。赛场上看到的是机器人最终呈现出来的运动和操作能力,但赛场背后,每一次真实任务同样也是一次高强度验证:哪里还做不好、哪些环境没有适应、哪些任务出现新的长尾问题,都会继续形成新的数据需求。
![]()
这让本体、模型和数据之间形成了一套循环。具身天工负责以身体进入真实世界,「慧思开物」负责感知、决策和执行,数据负责持续不断的供给。冠军是这套系统最终被看到的结果,「风火轮」则负责让它继续往前转。
但这套数据体系并不是把所有可能的数据全部采一遍。目前,北京人形的数据基地已经覆盖家居、工业、商业、康养、医药、办公六大应用领域和 30 多个真实子场景,场景本身也会随着实际落地需求不断变化。此前媒体参观时看到过开门锁等任务,这一次现场又增加了分拣等新的场景。
这些场景的选择并不是为了追求数量。基地内部的逻辑是,只有模型算法团队、机器人实际落地或者具体任务需要对应数据时,采集才真正有价值。正如现场交流中所说,六大领域里的任务不可能全部提前采完,单纯把数据铺满没有意义。
「不是把全国的数据都采一遍。」真正决定一份数据是否值得生产的,是机器人实际落地是否需要它。哪怕只是一个非常简单的产品或动作,只要真实落地需要这份数据,就值得采;反过来,如果没有实际模型和应用需求,再丰富的采集也很难产生价值。
这也让数据不再只是模型训练之前准备的一批原材料。随着机器人真正进入千行百业和更多家庭,实际任务持续增加,数据需求也会跟着增长。机器人遇到的问题越具体,后续需要补充的数据也会越具体。
![]()
目前,北京人形拥有超过 150 台主流机器人设备、100 余台无本体采集设备和 40 种不同构型机器人,同时配有近百台无本体虚拟设备,形成 18 万小时的年数据产能。相比单独增加某一种机器人或某一种场景,这些设备真正需要解决的是,面对不断变化的任务时,能否快速组织出相应的数据生产能力。
高质量数据如何被生产出来
18 万小时首先要解决的是数据从哪里来。北京人形采用「机器人 × 场景 × 任务 × 采集方式」的矩阵式采集,同时部署光学动作捕捉、Ego / UMI 无本体采集、真机遥操作、开放环境采集和远程遥操五种采集方式。
机器人也不再是唯一的数据生产者。除了真机直接执行任务,人也可以进入真实环境完成操作,再通过第一视角设备、骨骼提取、手部姿态识别等技术,把人类示教转化成训练素材。
由此形成的「真机 + 无本体人类示教」两条路线,可以分别覆盖机器人真实执行和人类快速示范。同一个任务还能通过不同机器人、不同场景和不同采集方式组合生产数据,这也是北京人形所说的「矩阵式采集」。
采集下来的还只是「原料」。一份原始数据需要继续经过清洗去噪、智能标注和质量质检,再进入模型训练。北京人形在其中加入自动化流水线、模型预标注和智能质检,目前数据生产效率提升 50% 以上,综合生产成本下降 30% 以上。
随着数据产能扩大,后端加工能力也必须同步 Scaling。如果前端机器人和采集设备不断增加,而清洗、标注和质检仍然高度依赖人工,新的瓶颈很快会从采集端转移到处理端。
加工完成的数据开始进入两个方向。一部分回到天工、天轶和「慧思开物」,继续支持本体和模型迭代;另一部分则以数据、平台和解决方案等方式,为产业和科研机构的模型训练、具身大脑研发提供支持。
但一次训练并不是数据生命周期的结束。模型重新装进机器人之后,还要进入真实环境验证。失败任务和长尾问题再次形成新的数据需求,重新进入针对性采集,由此形成「原料采集—数据加工—训练交付—真机验证—难题回流—重新生产」的闭环。
「风火轮」核心价值是覆盖从发现问题到重新获得能力的整个周期。数据采得快只是其中一环,加工、训练、验证和回流能否衔接起来,才决定这套系统转得有多快。
标准和合规则像这套循环下面的两条轨道。数据从来源授权开始,经过采集、标注、质检、脱敏、安全流通和追溯,不同环节都有相应规范。数据生产开始走向更大规模之后,标准决定不同地方生产的数据能不能进入同一套体系,合规则决定这些数据能不能安全持续流转。
从「1 + 6」走向 100 万小时
北京人形把目前形成的数据能力概括成「1 个唯一 + 6 个第一」。「1」指向覆盖数据采集、加工、训练、验证、回流和交付的全链路闭环;「6」则分布在工具链完备度、真实场景覆盖、机器人构型丰富度、开源数据集下载、合作网络和高质量真机数据交付等维度。
这些结果已经开始在基地之外体现出来。依托「慧思开物」开放的 RoboMIND 上线不到一年全球下载量突破 2000 万,仅最近一个月就实现翻倍;北京人形目前年数据产能达到 18 万小时,累计向外提供近 3 万小时高质量数据,70% 以上的数据产能用于服务产业和科研需求。
这意味着,北京人形的数据能力并不只是围绕自己的机器人建设。对内,数据持续进入天工、天轶和「慧思开物」,支撑本体、大小脑模型和真实场景能力迭代;对外,这套全链路能力也被用于支持产业企业和科研机构。后者不必再从采集、加工到质检重新搭建一遍数据生产链路。
这些数字放在一起,也更容易看出「1 + 6」背后的完整形态:前端有真实场景、不同机器人和多种数据入口,中间有自动化工具链,后端连接模型训练、真机验证和产业需求。数据不再散落在一次次独立项目里,而开始被组织成一套可以持续生产、加工和流转的基础设施。
这套体系也在从一个基地向更大的网络延伸。目前,北京人形的数据产业基础设施已经覆盖全国 100 多家数采厂,平台、工具链、生产流程和数据规范开始进入更大范围的数据生产体系。
对于北京人形这样的行业「国家队」而言,数据能力的价值也不只在于支撑自己的机器人。把已经跑通的工具、标准和生产体系继续向产业开放,让更多机器人企业和科研机构能够使用相对统一的数据基础设施,本身也是其参与产业建设的一部分。
![]()
这种「国家队」角色更接近基础能力的建设者,而不只是某一款机器人的提供者。具身天工和「慧思开物」可以成为内部验证场,外部产业需求则不断带来新的任务和数据类型,两者共同推动这套数据体系继续扩展。
从目前 18 万小时的年产能,到下一阶段 100 万小时高质量数据的目标,北京人形希望扩大的已经不只是一个基地的采集规模。随着数据生产网络、工具链和标准继续向外复制,真实世界里的更多任务才有可能更快进入机器人训练体系。
如果说运动会上 8.64 秒展示的是冠军天工已经具备的能力,那么从 18 万小时走向 100 万小时,扩大的则是一套面向整个具身智能产业的数据基础设施。
写在最后,对具身智能数据感兴趣的同学,不要错过北京人形旗下天工造物开源社区-RoboMIND数据集开源项目~
✦精选内容✦
![]()
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.