2026世界机器人大会展区,一块屏幕正播放擦桌子的特写。机械手指触碰桌面力度角度实时微调,但这不是机器人自主决策。屏幕旁观众头戴采集设备手持手柄遥控操作体验教机器人干活,机器人第一视角画面同步到屏幕上成为训练教材。
跟去年厂商争相展示跳多高跑多快不同,今年大会焦点让位给了那些教机器人干活的数据采集展位。一批定位为数据基础设施物理AI数据基座的专业服务商首次集中亮相,它们不造整机不训大模型,只为机器人产业提供最底层数据支撑。
现在的具身智能机器人相当于十年前的自动驾驶,机器人所需数据比自动驾驶多数个量级。真实世界物理交互数据是具身智能从看懂世界迈向改变世界的关键。截至2026年6月底全国建成启用超70家训练场在建或规划46家,但这还远远不够。
华东某训练场00后训练师正对着麦克风下达指令操纵机械臂完成抓取平移放下,一个简单动作一天重复上百次,仅零件分拣任务已采集三四万条数据。这些由视频力反馈和关节角度组成的教学素材经清洗后成为高质量数据喂给大模型。
现实中高质量数据支撑不到位机器人就永远摆脱不了遥控大玩具标签。一线数据采集师最直接感受是任务越来越难容错率越来越低。北京石景山全国最大人形机器人训练中心内,数采组组长注意到今年以来数据采集任务复杂度和质量要求都在变高。
![]()
以前练习夹取物体没夹住可以重试一两次,现在动作必须一次成功流畅自然稍有迟疑或抖动整条视频就作废。家庭场景中端盘子训练标准已从简单的抓拿放进阶为行进间盘子里东西不能洒不能晃。
需求侧变化明显,早年用ARX机械臂就能采数据,今年市场对全身控制数据兴趣上升,采集末端从夹爪升级到灵巧手,连手的大小都有要求。去年一家对数据质量要求极高的客户今年不仅复购数据采购量翻了10倍以上。
数据需求变化背后是具身智能从重展示到重训练的转变。2024年行业还在做演示Demo,2025到2026年重心已经转向量产和真实场景落地。今年6月工信部和国务院国资委联合启动专项行动,要求到2026年底形成百个以上高价值应用场景并带动万台级规模落地。
北京人形机器人创新中心数据与训练基地有150台真机40种不同构型机器人和近百台无本体虚拟设备同步采集数据,这种矩阵式采集旨在打破数据壁垒实现跨机型跨场景复用。
机器人来训练场相当于上学,从走路抓拿放这类简单任务到复杂的工厂电路板精细设备操作,训练场更像循序渐进的综合性学校而不是幼儿园。
机器人做什么取决于喂给它什么数据。机器人用旁观视角数据训练看到的是动作外在形态却无法感知执行者内在决策,而这些隐藏逻辑才是具身智能需要学习的核心。
京东云在展台一比一还原家庭场景让家政阿姨以人类第一视角整理台面,擦拭桌角的手臂动作身体姿态乃至多任务间切换节奏通过多路传感器完整记录转化为可学习数据。然而海量人类第一视角视频也有天然缺陷,视频里只有看到没法摸到。
合格抓取动作不仅需要视觉信息更需要实时力反馈分布式触觉感知和电机扭矩连续变化,头戴式摄像头无法记录这些物理交互信息。
北京人形机器人创新中心训练基地同时保留VR遥操穿戴式动捕头戴式采集虚实结合等多种方式,目前行业还没收拢到哪种方式采集质量最高能最大程度满足模型要求。
未来很可能不是单一采集方式而是综合性采集融合方案,这套结构被称为数据金字塔,最底层是人的视频和无本体采集,中间是仿真数据,塔尖是真机数据。但所有金字塔都指向同一个事实,数据严重匮乏。
![]()
目前国内真实物理交互场景合规数据仅50万小时,行业认为商业化落地需要数千万小时数据缺口超99%。
一名熟练采集员一天工作8到10小时有效数据往往只有三分之一到二分之一。更深层挑战在于物理世界复杂性,仿真环境表现优异的模型结合真实场景往往水土不服。
具身智能不是更难版本的自动驾驶而是完全不同的技术轨道,智驾对手是复杂道路,具身智能对手是整个物理世界的无序柔性多模态和长尾。这就是为什么这个领域的规模化法则没法简单复制智驾成功路径。
把纸板折成纸盒,付金珑只用两三分钟,但教会机器人用了14小时失误率高得让他一度以为这个动作教不会了。直到两周前领导发来视频,机器人折纸盒全程零人工干预动作丝滑,这是今年最有成就感的一次教学体验。
![]()
整个行业的ChatGPT时刻还要等多久。佐治亚理工学院助理教授给出参照,机器人要迎来类似GPT-3能力跃迁可能需要1亿小时高质量人类数据。当前机器人智能水平相当于10年前自动驾驶,真机数据眼下只有数十万小时年底可能到百万小时。
北京人形机器人创新中心训练基地二楼机器人正在学自己造自己,近5000平方米训练场一比一复刻工业智造等六大类30余个细分场景,插电源线搬箱子拿扫码枪,机器人在产线上反复练习,每组数据训练出的模型都将装进下一代机器人大脑。
2026年生产的人形机器人中可能有50%到70%进入数据工厂主要用于采集训练数据。真实工作场景中眼下还需要人与机器人配合且必须从容错率较高环节切入。
即便训练阶段已经把真实设备搬进场景部署到工厂后适配率也很难达到100%,真实产线出现各种特殊工况需要被发现后回流到数据管线重新训练重新部署。
![]()
目前很多AI模型在固定场景做足够采集训练成功率基本接近100%,但只要操作物品或环境稍微换一下成功率就严重下降。
当前最大瓶颈在于AI模型输入输出与真实物理世界对齐程度严重不足,虽然能做简单装配但效率跟人比还是低,每遇到新任务就要重新训练泛化能力有限,这也是机器人产品至今未在工厂家庭大规模推广的根本原因。
眼前最重要的事不是等一个时刻降临而是把数据飞轮先转起来,展示能力拿到订单扩展场景积累数据才有可能智能涌现。你觉得具身智能的ChatGPT时刻还要等多久,评论区聊聊。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.