网易首页 > 网易号 > 正文 申请入驻

刷视频也能教会机器人干活!1200亿tokens人类动作预训练,误差按幂律下降

0
分享至

允中 发自 凹非寺
量子位 | 公众号 QbitAI

9月17日,Figure把Helix 2.5带进了旧金山湾区30个陌生家庭。它要收拾散落在客厅里的玩具、叠毛巾、铺床。机器人到达现场后,不再采集新数据,不更新模型权重,也不根据现场执行结果重新选择模型。

视频很容易被概括成“人形机器人‘零样本’做家务”。严格来说却并非如此。三个任务此前都在其他环境中用专门数据做过适配。Figure所说的“零样本(zero-shot)”,是指机器人第一次进入这些家庭,面对新的布局和操作对象时,不再针对当地环境和物体重新训练。

注:Figure Helix 2.5在30个此前未采集任务训练数据的湾区家庭中执行整理客厅、叠毛巾和铺床任务。这里的“零样本”指机器人面对新的家庭环境、空间布局和操作对象实例时无需现场重新训练,并不意味着模型此前未学习过这些任务;相关任务此前已使用其他环境采集的数据完成适配。来源:Figure

视频之外,Figure还公布了两组更容易被忽略的实验。

第一组直接比较是否经过Index预训练。

Figure用同一批任务专属数据训练了两套策略模型,架构、优化方式、超参数、下游数据和评估方法保持一致。一套随机初始化,另一套从Index预训练模型开始。前者在30个陌生家庭中的完整任务成功率为9%,后者达到56%

这个56%要求完整完成任务,部分完成任务的情况不得分。以收拾客厅为例,所有玩具都必须进入篮子;如果出于安全原因需要人工干预,整个执行回合直接记为失败。按照Figure披露的实验协议,两组模型之间的主要差异是——是否经过Index预训练

另一组实验转向离线评测,专门考察预训练数据规模。

Figure用Index的四档嵌套数据(nested data)子集训练模型,预训练数据总跨度为8倍;模型大小不变,下游训练方式也保持一致。每个模型再使用相同的任务数据进行微调,比较留出测试集上的机器人动作预测损失。

随着Index数据规模翻倍,损失规律下降。Figure还用较小规模实验拟合趋势,再预测最大规模模型的测试结果;官方称,预测误差只相当于整个8倍数据范围内损失变化的0.54%。

这两组实验结果很容易被囫囵理解为“Figure发现了机器人规模定律(Scaling Law)”,但它们本质上是对不同问题的回答。

第一组实验中的9%到56%说明,有没有大规模的人类行为预训练,会显著影响机器人在陌生环境中的闭环泛化。

第二组中的四档数据的损失曲线说明,当人类数据预训练规模继续扩大后,这种收益在下游机器人动作预测上呈现出可测量的随规模变化的曲线。

Figure目前没有公布1倍、2倍、4倍、8倍Index预训练分别对应多少真实家庭成功率。也就是说,预训练规模持续扩大,对闭环机器人表现会产生怎样的连续变化,这条曲线还没有公开



上:Figure在真实机器人闭环评测中,对比了未经Index预训练与经过Index预训练的模型。在其公开的多项未见任务中,Index预训练模型的成功率均明显更高;Figure在正文中将总体结果概括为完整任务成功率从9%提升至56%。这组实验回答的是:“有没有大规模人类行为预训练,会不会影响真实机器人执行结果?”
下:Figure进一步使用4档严格嵌套的Index数据,将预训练规模从1倍扩大到8倍,并在模型规模、下游训练和评估流程保持一致的情况下,观察到适配后的机器人动作预测验证损失持续下降。这组实验回答的是:“当人类数据预训练规模继续扩大,离线迁移指标是否呈现可预测的规模效应?”
两组实验并非同一条曲线。Figure目前尚未公开1倍、2倍、4倍、8倍Index预训练规模分别对应的真实机器人闭环成功率,因此不能据此推导“预训练规模扩大后,真实任务成功率按相同规律连续提升”。

恰恰是这里,让2026年的机器人预训练出现了一个比“Human Data有没有用”更具体的问题:

人类经验能不能像文本之于大模型那样,成为机器人预训练中一种可以持续扩展、并能预测下游收益的数据来源?

Dyna:人类数据的规模效应已经进入真机闭环

Figure并不是第一个观察到“人类数据越多,机器人越受益”的团队。

8月,Dyna Robotics发布Dyna-2。它把第一视角人类视频构成1000小时、1万小时、10万小时和100万小时四个严格嵌套的数据规模。更大的数据集只是在较小集合上继续增加数据,而且各来源比例保持一致,尽量排除数据分布变化对结果的干扰。

随后,Dyna把四档模型用同一套机器人后训练方法适配到14个真实机器人任务。四档模型的平均归一化得分,依次达到任务可达上限的20%、28%、45%和53%。也就是说,人类视频预训练时的规模差异,经过同样的机器人后训练以后,最终延伸到了真机闭环表现。



注:Dyna分别使用1000小时、1万小时、10万小时和100万小时第一视角人类视频进行预训练,再将四档模型用相同的机器人后训练方案适配到14个真实机器人任务。随着人类视频预训练规模扩大,14项任务的平均归一化表现依次达到任务可达上限的20%、28%、45%和53%,说明预训练阶段的规模差异在经过相同机器人后训练后,仍然延伸到了真实机器人闭环表现。这里的20%—53%是Dyna为了汇总不同任务原生指标而定义的平均归一化表现,并非任务成功率,也不能与Figure在30个陌生家庭中报告的56%完整任务成功率直接比较。

因此,更准确的技术时间线不是“Figure第一次发现人类到机器人的规模定律”。Dyna此前已经展示了更完整的跨本体、从预训练规模一路延伸到闭环真机表现的证据;Figure则把可预测的迁移规模效应明确延伸到了全身人形机器人系统上,并用30个陌生家庭让人类预训练的现实价值变得更加直观。

百万小时之外,Dyna还通过一组消融实验追问:这种规模效应究竟从哪里来?

单独预测动作时,模型随着数据增加出现严重而不稳定的过拟合。加入未来视频预测以后,39个机器人任务上的迁移表现整体改善;而当研究者进一步增加不带动作标签、只用于视频预测的人类视频时,跨本体表现才随着数据规模呈现出稳定的单调提升。

因此,单纯说“扩大人类数据规模就会持续获益”,仍然不够准确。

数据是什么,以及模型被要求从中学什么,共同决定了规模效应会不会出现。

一旦人类经验开始成为机器人预训练资产,追问自然就落到了数据来源本身:这些经验应该从哪里来?

Figure:建立一套可控的人类数据供应链

Figure在Index发布稿中把自己的判断写得很直白:

“要规模化训练真正通用的机器人,所需要的数据并不存在于来源广泛的互联网视频。”

于是它搭建了一套自己的Human Data供应链。

Index通过Creator创作者网络,让人们在真实家庭和工作场所记录任务。到8月底,Figure称平台已经收到超过1600万条视频,并累计向创作者支付1500万美元;Helix 2.5发布时,新的人类视频数据正以约35分钟/秒的速度进入Index。数据随后还要经过质量过滤、反作弊、去重、重新平衡和文本标注。


△Figure Index的数据处理流程,来源:Figure Index

注:Figure将Creator贡献者上传的真实世界视频依次经过质量过滤与标注、反作弊审查、去重和数据再平衡,最终形成用于训练Helix的数据集。与直接使用互联网公开视频不同,Index代表的是一条“主动建设人类行为数据基础设施”的路线:通过持续采集、筛选和整理,更系统地获得适合Physical AI训练的大规模Human Experience。

算力也在同步扩张。

9月初,Figure宣布与英国AI云厂商Nscale达成战略合作。该合作涉及一份初始价值35亿美元的算力承诺,未来合作规模或将扩大至60亿美元以上;双方计划基于英伟达Vera Rubin平台部署最高10万颗GPU。Figure创始人兼CEO Brett Adcock直言不讳,Helix下一阶段越来越受制于数据和算力。

这是一条资本密集,但对数据分布拥有更强控制力的路线。

某类任务不够,可以定向补;某种环境过多,可以重新平衡;长尾里缺什么,就继续组织人在现实世界里生产。

Index不只是一个不断扩大的数据集,更像是一套可以主动改变训练数据分布的基础设施

但Figure目前尚未在Helix 2.5相关材料中披露Index全量数据统一的拍摄视角构成,也没有公开完整的人类动作监督机制。现在能够确认的是,它正在以极大的规模采集、筛选和组织真实人类行为数据,而Index预训练已经显著改善了Figure自己的完整人形机器人系统。

Figure的解法,是通过专门采集和数据治理,主动塑造自己需要的训练分布。

行业同时在尝试另一种办法:不重新生产全部数据,而是提高模型从互联网公开视频中提取可迁移信号的能力

另一条路线:让模型理解互联网中的人类经验

互联网公开视频不是天然的机器人数据(Robot Data)。

视频中的镜头位置多样,人体会被遮挡,动作也没有关节控制标签,更没有机器人的本体感知、力反馈和接触状态。视频里一个人伸出手打开橱柜的几十帧,距离一台人形机器人真正需要输出的控制信号还很远。

另外一些团队没有像Figure那样采集更多专门为机器人而生的数据,而是尝试通过模型学习和表示转换,从已有视频中提取可迁移信息。

CoMo从互联网视频中学习连续的潜在运动表示,并为此前没见过的视频生成伪动作(pseudo-action),再与有限的机器人数据共同训练策略模型。“互联网视频能否转成与动作相关的监督信号”,并不是一个全新的命题。

HuRo做得更直接。它把来源和视角各异的人类视频 “机器人化”,转化成更接近机器人观察和动作分布的数据;随着这类预训练数据扩大,真实操作任务的完成度和分布外(OOD)表现继续改善。

Rhoda则绕开了显式的人类动作。它用来源广泛的互联网视频训练因果视频模型,让模型先预测世界接下来如何变化,再通过逆动力学模型把这种预测转换成机器人动作。近期的真实工业任务实验显示,更大的预训练模型和更多训练算力都能改善机器人策略,而且当机器人数据较少时,更强预训练带来的收益更明显。

这些方法虽然机制不同,却都在检验另一种可能:当原始数据离机器人分布较远时,能否通过表示学习(representation learning)、动作恢复或世界建模来弥补其中的差距。

互联网视频的确没有现成的机器人动作轨迹。但其中的人类行为、物体交互和物理世界规律,究竟有多少能够被重新编码成物理AI真正能用的经验,仍然没有定论。

亮源新创(Light Origins)则大胆地把问题又往前推了一步:数据源直接来自普遍存在的互联网人类行为视频

亮源新创:把预训练数据源推向互联网规模

亮源新创选择的不是专门为机器人训练采集的数据,也不是主要依赖第一人称人类视频,而是尝试从互联网中的第三视角人类行为视频中提取可迁移经验

互联网上已经积累了海量人类行为视频。这类数据更容易实现规模化和多样性,代价则是更大的人机域差异(domain gap):镜头并不跟随视频中的人类身体,动作可能被遮挡或剪辑,人类和机器人身体结构不同,视频里没有可以直接执行的动作标签。

根据9月21日亮源新创官网正式发布的技术博客来看,Light-O1先从视频中恢复结构化人类动作,再编码成统一的人形动作表示,与视觉、语言信息一起进行自回归预训练,最终得到一个人类动作先验(Human Action Prior)


△来源:据亮源新创技术报告整理制作

注:从机器人遥操作、UMI等机器人数据,到第一视角人类视频,再到互联网规模的第三视角人类行为视频,数据来源覆盖范围逐步扩大,同时也伴随着视角、本体和动作表示差异的增加。本图用于说明亮源新创选择的人类动作预训练数据来源位置,不代表不同数据来源之间的性能比较。

此次技术博客披露的人类动作预训练规模,从37.5亿扩展到1200亿词元(token),最大规模约对应10万小时人类动作。

Light-O1分别在第一视角人类数据、公开机器人数据和亮源新创自研人形机器人数据上进行目标域适配。随着人类动作预训练规模扩大,适配后的动作预测误差、全身姿态误差和腕部位置误差均持续下降,并呈幂律趋势。亮源新创将这一现象称为“迁移缩放定律”(Transfer Scaling Law)


△Light-O1展示人类动作预训练规模与跨本体预测误差之间的缩放关

注:亮源新创将人类动作预训练规模从37.5亿tokens扩展至1200亿tokens,并在第一视角人类数据、Unitree G1机器人以及亮源自研人形机器人数据等目标域上进行评估。实验显示,随着预训练规模扩大,动作预测误差和身体姿态预测误差在不同目标域上持续下降,呈现幂律缩放趋势。该结果基于目标域适配后的预测指标,用于衡量预训练规模与迁移效果之间的关系,并不等同于真实机器人闭环任务成功率。

人类动作先验并不是亮源新创首创;从公开的互联网视频中提取与动作相关的信号,也已经有CoMo、HuRo等近邻工作。

Light-O1这次更值得关注的,并不是“用了互联网视频”本身,而是把几件此前通常分开研究的问题放进了同一组规模实验:互联网规模的人类动作视频、结构化动作恢复、持续扩大的预训练规模,以及这些规模收益在不同机器人和人形机器人目标域适配后仍然保留下来。

至此,亮源新创首次验证了互联网规模的人类动作预训练对多本体人形机器人的迁移缩放定律

注:视频展示Light-O1当前模型在机器人平台上的任务执行能力,用于说明预训练和后续适配后的模型具备真实可执行行为。本文讨论的“迁移缩放定律”仍以留出数据上的开环评测为依据。来源:亮源新创

更值得追踪的是:如果模型真的能从距离机器人更远的数据里持续获得可迁移的动作先验,这条“Scaling”(规模效应)之路最终能走到闭环真机的哪一步?

从离线迁移到闭环表现,不同“规模效应”不是一回事

当把Figure、Dyna和亮源新创放在一起,很容易把不同层级的“Scaling”混为一谈。



注:不同团队正在探索Human Experience如何转化为机器人能力。目前公开研究已经分别展示了从人类经验规模化、跨本体迁移、真实机器人闭环表现等不同层面的证据。由于不同研究采用的数据、模型和评测协议不同,本图用于展示公开证据所在层级,不代表企业能力排名或横向比较。制图:原文作者

最基础的一层,是预训练本身能不能随着数据增加持续改善。

再往下一层,是这种改善离开人类数据域以后,能不能在机器人或人形机器人目标域中继续存在。

Figure的四档Index实验和亮源当前的核心结果,主要落在这里:更大规模的人类预训练,对应更好的下游机器人动作相关离线指标。

然后才进入真实机器人的闭环表现。

Figure用Index预训练和随机初始化的9%对56%,证明“有没有预训练”会显著改变机器人在陌生家庭里的实际执行结果;但它尚未公开Index规模每翻倍、闭环成功率如何连续变化。

Dyna则已经用四档人类视频预训练,在相同机器人后训练条件下得到20%、28%、45%、53%的平均归一化闭环得分。两套数字定义完全不同,不能横向比较。

再往下一步,才是最接近产业经济的问题:

达到相同能力时,更强的预训练究竟能少用多少新的机器人真实经验?

Figure给出了一个值得关注的信号:Helix 2.5在一个同任务比较中,只使用此前Helix 02约一半的任务专属数据,就达到相近成功水平,同时把部署范围扩展到了30个陌生家庭。

但这组比较跨了模型代际和评估条件,并不是严格控制的等性能实验,因此不能直接推导“Index普遍把机器人数据需求减半”。

Dyna用大约10分钟机器人示范就完成Bottle Cap Untwisting的实验同样有吸引力,而且表现随着人类视频预训练规模继续提升;但它依然不是一条可以直接换算“多少小时人类数据等于多少小时机器人数据”的曲线。

就目前公开证据而言,亮源新创验证到的仍主要是适配后的离线迁移。

因此,它下一步最有信息量的实验其实很明确:固定机器人适配方案,让不同人类动作预训练规模的模型逐一进入闭环;再改变机器人数据预算,看能否形成等性能曲线。

到那一步,才有条件真正讨论“互联网级人类动作”的数据经济性。

计算最终着眼处:整条数据成本链

机器人行业习惯用“小时数”描述数据规模。

一小时遥操作数据多少钱,一小时Human Video多少钱,现有的互联网视频则几乎不需要重新去采。按照这种算法,Figure看起来昂贵,互联网原生路线似乎天然便宜。

实际账本远没有这么简单。

Figure愿意为Creator创作者、采集体系、质量控制和主动数据再平衡付钱,换来的是更可控的数据分布:缺什么,就能继续生产什么。35亿美元级别的算力合作,则继续把这套数据基础设施推向更大的模型。

从互联网公开视频出发,确实省掉了重新让人执行一次任务的物理采集成本。

新的账单会出现在别处:哪些视频值得留下,人体动作能恢复到什么精度,镜头运动和遮挡如何处理,怎样把人类动作转成机器人可用的表示,以及需要多少训练算力,才能把这些嘈杂经验真正压进模型。

Dyna提供了第三种可能:并非所有视频都必须恢复出高质量动作标签,世界建模本身也可以让大量只有视觉经验的视频参与规模化学习。

所以,这场数据战未必会以“谁拥有更多视频”决胜,更不能只比较两种路线的原始采集成本。

真正要算的是整条链路。

从得到一段经验,到它最终变成机器人可以迁移、可以执行的能力,需要支付的不只有采集成本,还有表示、对齐、算力,以及最后仍然难以完全省掉的真实机器人经验。

Helix 2.5让人类经验成为一条更难忽视的规模化轴线;Dyna已经证明,这条轴有机会一路穿到真实机器人闭环;亮源新创则把实验继续推向距离机器人数据分布更远但却最为丰富的互联网级人类行为

接下来值得比较的,也许不再只是哪个公司拥有最多“小时数”。

而是机器人获得下一项能力时,整条链路还要向真实世界支付多少成本。

*本文系量子位获授权刊载,观点仅为原作者所有。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
太阳报:列维被热刺解雇,获2700万镑遣散费

太阳报:列维被热刺解雇,获2700万镑遣散费

懂球帝
2026-09-22 20:21:07
俄罗斯媒体确认了:俄罗斯总统普京所属统一俄罗斯党在俄国家杜马(议会下院)获得的席位数量,创下该党参选以来的历史最高纪录

俄罗斯媒体确认了:俄罗斯总统普京所属统一俄罗斯党在俄国家杜马(议会下院)获得的席位数量,创下该党参选以来的历史最高纪录

吉刻新闻
2026-09-22 14:00:24
菲律宾今天弹劾门槛投票!参议员单多数即可推翻,16,票定罪要求

菲律宾今天弹劾门槛投票!参议员单多数即可推翻,16,票定罪要求

晨光苏醒a
2026-09-23 12:18:34
画面不堪入目,地下人奶交易乱象,成年人躺进怀里吃奶的灰色黑产

画面不堪入目,地下人奶交易乱象,成年人躺进怀里吃奶的灰色黑产

易玄
2026-09-12 10:24:46
乌克兰简直太冤了!花了四年多的时间,硬生生把俄罗斯从一个全球超级大国打成了二流国家,解决了美西方的心头大患,可乌克兰得到了什么?

乌克兰简直太冤了!花了四年多的时间,硬生生把俄罗斯从一个全球超级大国打成了二流国家,解决了美西方的心头大患,可乌克兰得到了什么?

扶苏聊历史
2026-09-21 17:57:39
西贝门店探访:用餐高峰期,餐厅甚至空无一人

西贝门店探访:用餐高峰期,餐厅甚至空无一人

第一财经资讯
2026-09-22 17:13:03
朝鲜神秘之师险掀翻松岛+美和!日本教练:根本找不到他们的资料

朝鲜神秘之师险掀翻松岛+美和!日本教练:根本找不到他们的资料

风过乡
2026-09-23 13:21:02
官方:CCTV5+将会转播中国U23与阿联酋U23的比赛

官方:CCTV5+将会转播中国U23与阿联酋U23的比赛

懂球帝
2026-09-22 20:53:19
魔术酝酿重磅交易!4换1得杜兰特,这筹码火箭怕是要笑醒

魔术酝酿重磅交易!4换1得杜兰特,这筹码火箭怕是要笑醒

老郎体育汇
2026-09-23 12:58:07
风雨飘摇!13名华人坐船偷渡美国,挤在小船上随时侧翻,佛州近海全被抓

风雨飘摇!13名华人坐船偷渡美国,挤在小船上随时侧翻,佛州近海全被抓

华人生活网
2026-09-23 05:06:58
中国女排2-10落后时,赵勇做了个反常识决定,换下主力让替补顶?

中国女排2-10落后时,赵勇做了个反常识决定,换下主力让替补顶?

去山野间追风
2026-09-23 09:54:45
中纪委亮重拳,全国严查“逃逸式”辞职!

中纪委亮重拳,全国严查“逃逸式”辞职!

职场资深秘书
2026-09-23 12:01:48
亚运会乒乓球:0-2到11-7!莎头组合第2局反败为胜,2-0领先冲8强!

亚运会乒乓球:0-2到11-7!莎头组合第2局反败为胜,2-0领先冲8强!

刘姚尧的文字城堡
2026-09-23 13:08:23
香港知名男星19岁儿子再次登台!颜值与父母神似,妈妈台下满脸骄傲

香港知名男星19岁儿子再次登台!颜值与父母神似,妈妈台下满脸骄傲

东方不败然多多
2026-09-23 09:13:16
超20所高校宣布中秋、国庆连放13天,避免学生反复往返耗费路费、体力

超20所高校宣布中秋、国庆连放13天,避免学生反复往返耗费路费、体力

大风新闻
2026-09-13 16:45:24
闲鱼公布调查结果:老子没涉黄!

闲鱼公布调查结果:老子没涉黄!

城事堂
2026-09-23 14:45:46
一文读懂:开除党籍、开除军籍,代价到底有多大?

一文读懂:开除党籍、开除军籍,代价到底有多大?

向青春微调
2026-09-21 21:42:39
好消息!多地即将迎来2026年养老金重算补发,工龄15年补发多少?

好消息!多地即将迎来2026年养老金重算补发,工龄15年补发多少?

小彬说事
2026-09-23 09:55:19
打?奉陪到底,仙宾礁爆发激战,中方开始算账,第一个收拾波兰

打?奉陪到底,仙宾礁爆发激战,中方开始算账,第一个收拾波兰

明天后天大后天
2026-09-22 15:57:38
金建宇不幸离世,年仅28岁

金建宇不幸离世,年仅28岁

上观新闻
2026-09-23 13:07:49
2026-09-23 15:27:00
量子位 incentive-icons
量子位
追踪人工智能动态
13385文章数 176570关注度
往期回顾 全部

科技要闻

2026网易未来大会下午:AI走进现实

头条要闻

涉黑头目黄大发被判死刑立即执行 被称为"武汉高启强"

头条要闻

涉黑头目黄大发被判死刑立即执行 被称为"武汉高启强"

体育要闻

300万英镑,他们买下了一位队史传奇

娱乐要闻

梅启明被彻底除名遗产清零

财经要闻

全市场都在卷自营

汽车要闻

5.1米的启境GX7,底盘凭什么又稳又舒服?

态度原创

健康
时尚
家居
艺术
军事航空

痘痘没成熟,千万别硬挤!

消失的天后,带病复出,先赚10个亿

家居要闻

2026建博会(广州) 公装联探展交流活动

艺术要闻

五粮液新经济中心工地实景,新川第一高楼为何被“限低”?

军事要闻

韩国最新型潜艇首次披露

无障碍浏览 进入关怀版