网易首页 > 网易号 > 正文 申请入驻

具身智能的真机数采,到了分水岭

0
分享至


具身智能正在经历一次关键的瓶颈认知切换。

过去两年,行业角逐的焦点是本体,谁能造出更能跑、更能跳的机器人。但进入2026年,竞争的重心正在从硬件转向数据。大语言模型有互联网文本,自动驾驶有海量路测数据,而具身智能面对的是一个更棘手的问题:机器人需要学会操作物理世界,但物理世界的数据不会天然存在。

不是没有人在做数据。全国近两年冒出无数“数采工厂”,人通过遥操作设备操控机器人反复执行任务,把每一帧关节角度、力矩、视觉画面录下来作为训练数据。

但代价惊人:一条30秒的真机操作数据,采集成本10到15元。采集1小时要花1000元左右,凑够20万小时需要两亿元以上。而这20万小时,对于大模型预训练来说不过“沧海一粟”——V-JEPA(Video Joint Embedding Predictive Architecture)是Meta前首席AI科学家杨立昆团队提出的视频自监督学习框架,它用超过100万小时视频训练来理解物理世界规律,距离Scaling的终点还远得很。

一边是成本高到无法规模化,一边是Scaling需要的数据量近乎无底洞。具身智能行业在去年面临一个尴尬的困局:行业里缺数据的声音此起彼伏,但很少有人认真算过一笔账,用真机数采的方式填数据缺口,成本上几乎看不到出路。

行业也尝试过另一条路:仿真数据。在模拟器里让机器人反复执行任务,自动生成海量的“视觉+动作”配对数据,成本几乎为零。但这条路有它的天花板——Sim-to-Real gap,模拟器里的物理规律和真实世界始终存在偏差,训练出来的策略搬到真机上往往水土不服。仿真更适合做预验证和补充增强,但担不起主力数据的角色。

一年后的今天,行业在预训练层面的判断已经比较清晰了:人类数据正在成为主流。但这不是意味着原来主流的真机遥操作失去了价值,而是数据的分工被进一步细化。人类数据由于成本可控、采集更灵活,更有望Scaling;真机数据囿于成本等原因,则在精细微调上发挥更大作用。

成本、Scaling和一条被逐一验证的路

如果只看到成本差异,可能低估了这件事的底层逻辑。人类数据路线之所以能走到今天,是因为它或许是目前唯一一条理论上能走到终局的路。

灵初智能技术负责人陈源培对此有一个逐一的排除法论证:互联网视频数据量足够大,但“太脏了”。清洗互联网数据的成本远远大于现采。真机遥操作质量最高,但“不可能把世界上所有场景、所有物体的所有操作都搬到一个素材厂里来”。仿真数据有Sim-to-Real gap的先天问题,“同时仿真本身的Scaling也是问题”。

“看来看去,唯一一个能够Scaling的数据,其实就是人类数据。”陈源培说。

这个判断和智在无界的选择殊途同归,但两家公司对人类数据的定义并不相同。智在无界走的是纯视觉路线,用第一人称视频训练模型理解人的行为语义,不记录关节角度和触觉信号。这种方案成本极低、易于规模化,智在无界已做到20万小时规模。

但纯视频的局限在于,这种数据“缺一个duty pose信息,不能很好地恢复接触状态”,因此无法直接驱动机器人,只能用于预训练阶段的表征学习。

灵初智能选择的是,用自研的62+自由度外骨骼触觉手套采集人手操作数据,同时记录关节角度和指尖触觉信号,精度达到亚毫米级,处理后可等同于真机数据直接驱动机器人。代价是采集需要专用硬件,规模扩张速度不如纯视频路线。

把各家公司的动作放在一起看,过去一年人类数据路线的演进,有一个较为清晰的发展脉络。

  • 2024年底,由中关村学院孵化的深度机智率先提出“人类学习”(AnthroLearning)路线,主张用人类第一人称视频训练机器人理解物理世界,而非传统的遥操作或仿真。创始人陈凯出自微软亚洲研究院。此时这条路线几乎没有关注者。
  • 2025年7月,智在无界发布Being-H0,用1000小时人类第一人称视频做具身预训练。同年12月,灵初智能发布Psi-SynEngine外骨骼触觉手套数采方案,走的是主动传感的路线。几条不同的“人类数据”支线开始并行推进。
  • 2026年1月,Being-H0.5发布,人类视频规模推到近2万小时。但据智在无界BeingBeyond合伙人郑思鹏回忆,这个路线“也还不是主流”。

转折点在一个多月后到来。

  • 2026年2-3月,英伟达接连发布EgoScale和DreamDojo,分别使用了1到3万小时不等的人类视频数据。英伟达并非这条路线的最早探索者,但它的入场是一个关键的验证信号——当全球AI算力巨头开始大规模采购和训练人类视频数据,意味着这条路线不再是少数公司的实验。
  • 2026年4-5月,深度机智发布PhysBrain 1.0,灵初智能Psi-R2基于近10万小时人类数据在MolmoSpaces登顶,智在无界Being-H0.7也扩展到20万小时。多家公司的成果密集涌现。

全球范围内,这条路线也在同步推进。由前Google DeepMind研究员创立的Generalist AI在2025年底就用27万小时人类操作数据训练了GEN-0模型,首次在机器人领域观察到Scaling Law。据灵初智能方面透露,OpenAI、英伟达、Meta等也在大规模采购人类数据——各家对数据怎么用还在探索中,但方向已经明确。

当然,并非所有公司都押注人类数据路线。智元机器人今年6月发布了“具身智能数采2.0”体系并开源AGIBOT WORLD数据集,宇树科技也在4月开源了真机数据集,但它们走的是更传统的路线——以真机遥操作和仿真数据为主,更侧重本体自身的数据闭环,而非人类数据的规模化预训练。两条路线目前并行,尚未到分出高下的时候。

一年之内,人类数据路线从边缘走到了聚光灯下。英伟达的跟进是一个关键的验证信号,而多家中国公司的并行推进则为这条路线提供了多元化的早期证据——有人验证纯视觉路线,有人验证主动传感路线,各有进展。

真机数据之所以走不通Scaling,根本原因在于它是监督学习的产物。据郑思鹏分析,监督学习训练出来的模型只有“背板能力”,泛化能力很差,一旦遇到out-of-distribution的场景和任务,效果急剧下降。而人类视频天然覆盖了更广阔的动作空间分布,与预训练的逻辑天然匹配。

共识的边界:范式迁移、商业分层与资本的分水岭

数据路线的转向不是孤立事件。与之同步发生的,是具身智能模型范式从VLA向隐式世界模型的迁移。

VLA(Vision-Language-Action)在过去一年是具身行业的通用范式,本质是一套监督学习框架。但它的天花板受限于高质量真机数据的稀缺,VLA模型无法像大语言模型那样遍历所有可行的动作空间。据郑思鹏分析,真机数据能覆盖的动作空间,只占全部可行空间的“很小一部分”。

行业开始转向世界模型。但世界模型也有路线之分。

英伟达的Cosmos Policy走的是显式路线,通过预测视频的下一帧画面来预测状态变化。这个方法理论上可行,但成本极高:模型需要“关注画面中皮肤纹理、衣服褶皱等等元素”,而这些对机器人决策来说大部分是无关信息。

智在无界选择的是隐式路线(Latent World Action Model),只建模必要的状态变化,不预测完整画面。效率差异是数量级的:据郑思鹏给出的数据,同样50小时的数据量,显式训练需要约4000小时GPU,而隐式的成本大约是前者的八十分之一。

“如果扩展到20万小时去训练一个模型,显式的投入是千亿级别的。”

对具身智能来说,无论训练还是推理,成本效率始终是第一位的。

智在无界并非唯一押注隐式路线的公司。今年3月,星海图发表了LeWM隐式世界模型论文,在多个操作与导航任务上性能与基础模型相当但成本大幅降低。6月,无界动力发布MWA™隐空间世界模型,在斯坦福等机构发起的RoboCasa榜单上超越了英伟达的GR00T-N1.6。从学术界到产业界,越来越多的团队开始探索隐式路线。一场从监督学习到自监督/半监督学习的范式迁移,正在重演计算机视觉领域曾经走过的路:先有监督学习起步,然后转向自监督实现Scaling突破。

技术路线在迭代,商业化节奏的判断也在分化。

一个基本共识正在形成:2B(工业制造、物流等可控场景)比2C(家庭服务)快3到5年。

在近日由联想控股微空间、联想之星和融科资讯中心共同发起的“硅基进化论”沙龙上,宇泛智能CFO戴恺也给出了三个衡量具身智能公司落地质量的务实指标:复购率(客户愿不愿意再次买单)、ROI≥30%(替代人效要有可量化的提升)、经营性现金流(收入不能全挂在应收帐款上)。

“如果你看现在市场上很多具身智能公司,他有收入,但其实全在应收帐款上,过一段时间可能又要归集为坏帐。”

优宝特机器人创始人范永则用一个比喻来表达他对行业节奏的判断:“人形机器人现在就是一个3岁的小孩,不要指望他现在去打工挣钱。但如果你相信他是个健康的孩子,他一定能长到18岁。”

不过也有更激进的判断。云松鼠智能创始人黄骏达认为,五指灵巧手的收敛速度会比行业预期的快得多。“不是三到五年,更不是五到十年,未来两年内就能见分晓。”如果这个判断成立,操作端的瓶颈可能会比很多人预期中更早被打破。

技术路线和商业化判断的分化,最终都指向同一个问题:钱往哪流。

2026年上半年,具身智能赛道融资额达到约460亿元人民币。但仔细拆开看:其中170亿是早期轮次,而这170亿里的70%集中在头部10家公司。资本盛宴之下,资金实际高度集中。

联想之星合伙人高天垚的观察是,当前投资逻辑正在发生分化。“大家都在看,共识的东西还比较多,所以我们希望项目的差异化要突出。”

而宇树科技的IPO,则被视为行业的一个分水岭节点。据高天垚判断,宇树在二级市场“千亿问题不大”。但戴恺提出了一个微妙的反论:“人形机器人最核心的竞争力在大脑层面,但宇树目前在这方面的投入和展现出的认知,还没有到那么高的层面。”

他补充说:“从整个产业的发展来说,我希望宇树能够在资本市场取得更大的成功。但同时,估值会越来越趋于理性。”

范永则从产业链角度给出了另一个判断框架:“这个产业链很长,关键模组、本体、小脑、大脑,每一个环节都能深耕出优秀的企业。如果要做一个全栈且每个环节都强的公司,短期内很难。”他认为,未来三五年能把营收跑起来的,更可能是本体企业,因为“大脑最终要附生到本体上才有落地的市场”。

围绕数据基础设施、模型范式演进、量产落地与商业化路径,“共识与非共识”的深度思辨由此展开。

量不等于质:10万小时可能不如1000小时

数据多了,新的问题浮出水面。

据无问智科创始人刘盛翔观察,行业里大家都在喊“缺数据”,但即使把一千万小时的数据摆在面前,能不能用起来也是个大问题。

“就像英伟达的算力基座,如果没有CUDA生态,再好的GPU也用不起来。数据同理,缺的不仅是数据,更是整套的工具链和测评体系。”

他给出了一个三层框架:一套好用的物理AI数据基座,至少应该包括数据本身、配套的工具链、以及相应的测评体系。“就像人一样,要边学习边考试,边做模仿学习边做强化学习,螺旋式成长。”

这个视角把问题从“数据够不够多”推到了“数据能不能被有效利用”。行业现在面临的情况是:数据生产的瓶颈正在被人类视频路线打破,但数据“消化”的能力,清洗、标注、增强、评测还没有跟上。而后者,可能才是未来一段时间真正的瓶颈所在。

但数据量上去了,不等于问题解决了。陈源培捅破了另一层窗户纸:“10万小时的人类数据,有些时候可能还不如1000个小时。”

他举了一个例子:给素材方下发一个任务,要求采1000个任务,每个任务采100小时,凑出10万小时。同样的1000个任务,每个任务只采1小时,只有1000小时。“它们在训练上的作用是差不多等效的。”

这个反直觉的现象揭示了一个被行业忽视的问题——数据处理的难度远大于数据采集。源培详细描述了他们的数据管线有多复杂:视觉端要调SAM模型把操作者的手从画面中分割出来,再用inpainting模型把背景补上,最后调用仿真器把机器人的模型渲染贴上去;动作端要调世界模型对动作做修正,再调强化学习做策略优化。每一个环节在单次执行时都没有问题,但“全部堆上去放量的时候,每个地方都是卡点”。

他给出的优先级排序是:在数据集构建层面,任务多样性>物体多样性>场景多样性;在感知模态层面,精准3D位姿>触觉模态>2D图像特征。而这套标准本身,也还在“研发状态”。

这也解释了为什么灵初智能虽然采集了10万小时人类数据,却只从中筛选出约5417小时真机等效数据用于模型训练。数据量和数据质量不是一回事——这个判断,可能比“人类数据成为预训练主流”本身更值得行业深思。

从数据路线的全面换锚,到模型范式的隐式迁移,从商业化节奏的分层判断,到资本流向的结构性分化,具身智能行业正在经历一次深层的“重新锚定”。

真机数采仍然是精细微调阶段不可替代的黄金标准,但在预训练层面,人类数据正在成为主流。这不是一场零和博弈,而是一次行业分工的重新划定。

这些变化的发生速度,比大多数人预期的要快得多。(本文首发钛媒体APP,作者 | AGI-Signal,编辑 | 秦聪慧)

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
千里带父上海治肝癌,一番检查过后,医生悄悄把我叫到一边

千里带父上海治肝癌,一番检查过后,医生悄悄把我叫到一边

宝哥精彩赛事
2026-09-09 04:52:22
毛主席曾对尼泊尔首相说:你想把珠峰全部划归贵国?还有更好办法

毛主席曾对尼泊尔首相说:你想把珠峰全部划归贵国?还有更好办法

究竟谁主沉浮
2026-08-17 20:19:17
王晶说霸王别姬里,张丰毅完全接不住张国荣的表演?

王晶说霸王别姬里,张丰毅完全接不住张国荣的表演?

阿废冷眼观察所
2026-09-08 16:17:53
别被参数洗脑!小米 N90 性价比炸裂,但这几个短板躲不掉

别被参数洗脑!小米 N90 性价比炸裂,但这几个短板躲不掉

51qc我要汽车网
2026-09-08 15:31:59
180张梓琳陪女儿!母女仨高高瘦瘦,8岁胖妹身高160手比大人还大

180张梓琳陪女儿!母女仨高高瘦瘦,8岁胖妹身高160手比大人还大

八星人
2026-09-08 09:52:10
刚刚,GPT-Image-2.5发布!

刚刚,GPT-Image-2.5发布!

新智元
2026-09-09 06:19:30
“双手冻得通红像灼烧一样”!寿司郎员工称被要求用手捂化冻虾,公司回应:排查所有门店

“双手冻得通红像灼烧一样”!寿司郎员工称被要求用手捂化冻虾,公司回应:排查所有门店

21世纪经济报道
2026-09-08 19:35:04
马冬梅老公全程吃软饭!小马达和富婆挑战高难度姿势!

马冬梅老公全程吃软饭!小马达和富婆挑战高难度姿势!

八卦疯叔
2026-09-09 10:10:03
9月8日俄乌最新:比列茨基打脸普京

9月8日俄乌最新:比列茨基打脸普京

西楼饮月
2026-09-08 21:34:28
袁腾飞去了美国,梁宏达去了加拿大?

袁腾飞去了美国,梁宏达去了加拿大?

十柱
2026-09-06 12:32:39
郭涛的人脉不够强?儿子郭子睿考了两年北电接连失利,改读国际班

郭涛的人脉不够强?儿子郭子睿考了两年北电接连失利,改读国际班

手工制作阿歼
2026-09-09 05:59:47
iPhone电池健康68%,花450换原装电池后我彻底后悔了

iPhone电池健康68%,花450换原装电池后我彻底后悔了

小柱解说游戏
2026-09-09 03:33:57
海风:中美战区司令会晤释放的信号,台湾要听懂

海风:中美战区司令会晤释放的信号,台湾要听懂

环球网资讯
2026-09-07 00:15:11
“砰”的一声,女子喉咙被“炸伤”,满嘴是血紧急送医!上海一男孩曾因此缝了38针,千万别再这样→

“砰”的一声,女子喉咙被“炸伤”,满嘴是血紧急送医!上海一男孩曾因此缝了38针,千万别再这样→

上海女性
2026-09-07 19:11:55
阿里P8:人一旦失业,就会“扣扣搜搜”。家庭收入从去年140万降到今年50多万

阿里P8:人一旦失业,就会“扣扣搜搜”。家庭收入从去年140万降到今年50多万

蚂蚁大喇叭
2026-09-06 17:09:52
3-0杀进16强!18岁张本美和:亚运会我将参加4项目 且全部要拿冠军

3-0杀进16强!18岁张本美和:亚运会我将参加4项目 且全部要拿冠军

风过乡
2026-09-09 08:32:02
岛内风波升级,洪秀柱成功探监,马英九被判无罪,民进党大势已去

岛内风波升级,洪秀柱成功探监,马英九被判无罪,民进党大势已去

李健政观察
2026-09-09 11:37:11
国内都嫌她丑,可她是世界超模前三,井柏然的女友刘雯到底有多牛

国内都嫌她丑,可她是世界超模前三,井柏然的女友刘雯到底有多牛

嘴角上翘的弧度
2026-09-09 12:55:25
54岁演员王新昉去世,死因曝光是猝死,刚拍完剧,儿子悲痛处理后事

54岁演员王新昉去世,死因曝光是猝死,刚拍完剧,儿子悲痛处理后事

全球风情大揭秘
2026-09-09 08:31:50
女友说前男友“床上功夫”比你强,美国男子开枪杀光母子仨:16岁和7岁娃都不放过

女友说前男友“床上功夫”比你强,美国男子开枪杀光母子仨:16岁和7岁娃都不放过

江山挥笔
2026-09-09 10:57:05
2026-09-09 14:00:49
钛媒体APP incentive-icons
钛媒体APP
独立财经科技媒体
139191文章数 862574关注度
往期回顾 全部

科技要闻

AI重大突破!OpenAI称解开近百年数学难题

头条要闻

4岁男童被指摸臀 父亲发声:无法接受出具书面道歉要求

头条要闻

4岁男童被指摸臀 父亲发声:无法接受出具书面道歉要求

体育要闻

16年后再破门,被皇马放弃的少年没认输

娱乐要闻

郭麒麟最便宜贵公子争议,本人未回应

财经要闻

8月CPI同比涨0.8% PPI环比由降转涨

汽车要闻

坦克700申报信息曝光 长轴距版轴距增150mm/首搭6座

态度原创

家居
房产
时尚
本地
数码

家居要闻

2026建博会(广州) 公装联探展交流活动

房产要闻

砸388亿+首个方案出炉!三亚,又一片区要起飞!

我要是这样翻盘一次,能吹一辈子

本地新闻

宁波,中国制造的隐藏大佬

数码要闻

用户称自己的AMD Ryzen 9 9950X3D在更换主板后一小时内报废

无障碍浏览 进入关怀版