https://arxiv.org/pdf/2501.10105
通用动作:增强具身基础模型
Universal Actions for Enhanced Embodied Foundation Models
https://arxiv.org/pdf/2501.10105
![]()
![]()
摘要
在多样化的、互联网规模的数据上进行训练,是近期大型基础模型取得成功的关键因素。然而,将同样的方法用于构建具身智能体却遇到了明显的困难。尽管有许多众包的具身数据集可供使用,但由于不同机器人的物理形态和控制接口各不相同,它们的动作空间往往呈现出显著的异质性,这给利用跨领域数据开发具身基础模型带来了巨大挑战。在本文中,我们介绍了UniAct,一种在通用动作空间中运行的新型具身基础建模框架。我们学习到的通用动作通过利用不同机器人共享的结构特征,捕获了跨多样机器人的通用原子行为,并通过消除众所周知的异质性,实现了增强的跨领域数据利用和跨形态泛化能力。这些通用动作可以通过简单地添加特定于形态的细节,高效地转换回异构的可执行命令,从而使得对新机器人的快速适应变得简单而直接。我们UniAct的0.5B参数实例,在对多种现实世界和仿真机器人的广泛评估中,达到了最先进的(SOTA)具身基础模型规模的14倍,展示了卓越的跨形态控制和适应能力,突显了采用通用动作的关键优势。项目页面:https://2toinf.github.io/UniAct/
1. 引言
在自然语言处理和计算机视觉等领域,基于海量且多样化数据源训练的基础模型已展现出显著的成功和强大的泛化能力,凸显了学习通用模型相较于专用模型的价值[1, 5, 40, 62]。受这些成功的启发,开发能够处理跨任务、跨环境和跨形态泛化的通用具身基础模型,为构建通用具身智能体提供了一条有前景的路径[8, 17, 18, 28, 31, 61, 68]。
![]()
然而,具身数据的显著异质性带来了巨大挑战[20, 49, 64]。这种异质性不仅体现在由相机位置(例如,腕部视角或第三人称视角)和环境条件(例如,光照或背景变化)差异引起的视觉差异上,更关键地,体现在动作异质性上[17, 48, 65]。1) 具有不同形态的机器人(例如,不同的自由度,或机械臂、四足机器人和汽车之间的差异)拥有完全不同的动作空间[68]。2) 此外,控制接口的多样性(例如,机械臂的末端执行器(EEF)位置控制器或速度控制器)导致动作指令具有根本不同的物理含义[49]。3) 即使动作数据采集自相同的机器人平台但由不同的人类操作者执行,人类行为的多模态性也加剧了这种异质性[14, 34, 41, 55]。因此,在不同机器人和机构间收集的具身动作数据,往往在原始物理空间(例如,末端执行器的位置和旋转)中存在于很大程度上互不相交的流形上[17, 65],这极大地复杂化了跨不同数据源的数据共享。
目前,尚无现有解决方案能充分解决动作异质性问题。大多数先前研究强制将不同的动作空间视为等价,并应用相同的离散化或归一化技术,导致产生一个潜在冲突的动作空间,其中相似的动作编码可能代表完全不同的物理含义[31, 49, 61]。虽然一些尝试试图通过简单地将所有单个动作空间聚合起来[17, 41],设计一个可物理解释的、适用于多种机器人系统的动作空间,但这需要大量的人工工程投入,并且未能发掘和利用不同具身动作空间间的内在联系,阻碍了通用具身基础模型的有效开发。
在本文中,我们介绍了UniAct(基于通用动作的具身基础模型),一种新型的具身建模框架,它构建在通用动作空间之上,而非麻烦的异构动作空间。在UniAct中学习到的通用动作,编码了可泛化于多种机器人平台的通用原子行为,而不受限于特定的形态机械结构或控制接口。例如,当正前方有目标时,不同机器人应执行相似的“前进”行为,尽管由于形态差异,它们具体的控制信号可能完全不同。这种抽象超越了特定的形态和控制约束,使其能够普遍适用于多种机器人平台,为增强跨形态数据利用和模型泛化提供了巨大潜力。从这个意义上讲,仅需最少的参数和数据,就足以将通用动作解码为特定形态的动作,因为通用的运动行为已在通用空间中被捕获,解码器只需为每个机器人平台补充一些形态细节即可,从而在部署时能够高效地适应新的机器人系统。
具体来说,UniAct采用了一个共享的视觉语言模型(VLM)[6, 32, 35, 39, 40, 72],将通用动作空间构建为一个向量量化的码本[63]。类似于一个可学习的技能库[34, 45, 55],每个码字都封装了一个足够通用的原子行为,可供不同机器人执行。这种设置充当了一个关键的信息瓶颈,驱使VLM去识别和利用不同动作空间之间共享的原始行为。这种提取方案使得行为能够有效泛化以实现跨形态控制,使我们0.5B参数规模的实例UniAct-0.5B,在广泛的任务中超越了诸如拥有70亿参数的OpenVLA [31]等大14倍的模型。推导出的通用动作,可以通过精简的异构解码器,转换为适用于各种形态的精确可执行命令。这些解码器以通用动作作为条件输入,并从其独特的观测数据中补充形态特定的特征。这使得可以根据具体需求进行灵活定制,例如,包含或排除本体感受特征,或改变相机视角的数量。通过简单地为新任务添加轻量级解码器作为新的预测头,即可实现对新的领域或机器人平台的快速适应。我们在具有挑战性的任务设置上进行的全面评估,包括大幅视角变化和训练数据中未出现过的全新机器人,都证实了UniAct卓越的可迁移性,展示了在通用动作空间而非传统的异构空间中开发具身基础模型的巨大优势。
2. 相关工作
多模态基础模型。大型语言模型(LLMs)[1, 5, 40, 62]已在多种任务中展现出卓越的能力,并表现出令人印象深刻的零样本和上下文学习能力[16]。在此基础上,通过将视觉和语言整合到一个统一的标记化空间中,大型视觉语言模型(VLMs)得以发展,并展现出出色的多模态指令跟随能力[6, 21, 32, 35, 58, 59, 72]。它们的成功主要归功于大规模的互联网预训练,这利用了来自互联网的海量且多样化的高质量数据语料库。
具身基础模型。在开发具身基础模型时,训练过程中会纳入另一个关键模态——动作(机器人可解释和执行的、可部署的控制信号,例如,末端执行器的位置/速度)。最先进的模型通常被构建为视觉-语言-动作模型(VLA)[9, 10, 18, 31, 49],将视觉和语言输入与可执行的输出相结合。然而,从不同机器人平台和实验室收集的动作标签表现出显著的异质性[30, 49, 64],阻碍了跨不同来源的有效数据共享。为了规避这一挑战,许多工作采用大规模无动作的视觉语言数据,例如领域外的人类活动[15, 24, 25],首先获得一个良好的具身VLM,然后使用来自特定机器人平台的少量动作标签将其微调为专门的VLA [3, 4, 7, 10, 12, 19, 22, 29, 36, 37, 42, 47, 66, 67, 69, 72]。虽然这些方法可以提升特定机器人在有限任务集上的样本效率,但它们面临着构建通用具身智能体的严重性能瓶颈[7, 19, 56],因为从任何单一机器人平台收集的动作数据,远不如全球范围内收集的众包数据全面[20, 30, 49]。
近期的一些工作利用丰富的异构动作标签来开发通用机器人策略,以实现跨形态控制。RT-X系列 [49]、Octo [61] 和 OpenVLA [31] 利用来自不同7自由度机器人的数据,来增强相较于在单一机器人数据源上训练的模型的泛化能力。更进一步,CrossFormer [17]、RDT [41]、π0 [8] 以及 Yang 等人 [68] 探索了来自具有完全不同机械结构机器人的数据,例如操作和导航领域的机器人,以及单臂与双臂系统之间的数据。然而,现有工作要么忽略了不同来源动作空间的异构特性,粗略地将它们视为等同而不考虑其内在冲突 [31, 49, 61];要么简单地将所有动作空间聚合在一起,未能利用不同机器人间潜在的共享共性 [8, 17, 41, 68]。
具有潜在动作空间的具身模型。我们的工作旨在提取一个通用的通用动作空间,它类似于一个潜在空间,但编码了跨各种机器人平台的通用原子控制行为和模式。一些工作在潜在空间中开发具身模型 [4, 13, 34, 45, 54, 55, 69, 70]。其中,LAPA [69]、IGOR [4] 和 LAPO [54] 通过在无动作视频上联合自监督训练逆动力学模型和正动力学模型,来开发潜在动作空间 [11]。然而,通过这种方式提取的潜在动作主要侧重于解释视频帧之间的变化,缺乏对形态的考量或与实际控制信号的直接因果联系。为了说明这为何存在问题,假设我们在机器人前方添加一个新物体,视觉输入会改变,但这与控制行为无关,理想的编码动作不应捕捉此类分散注意力的信息。BeT [55]、VQ-BeT [34] 和 QueST [45] 也通过 K-means 聚类 [43] 或向量量化 [33, 44, 63] 构建了离散的动作码本,其中码本中的每个码字编码了动作标签的一个不同聚类中心。这些工作主要关注具有单一形态类型的更简单领域,这增强了建模具有多种模式的复杂人类演示的能力,但难以处理跨不同形态的动作异质性。相比之下,我们的通用动作将来自与形态无关的语言模态的目标信息,与对实际动作信号的监督相结合,提供了一个通用且抽象的技能库,以促进跨形态共享。此外,我们的研究深入探讨了更复杂的异构环境,并开发了一个大型具身基础模型,超越了以往研究所考虑的有限范围。
3. UniAct框架
我们介绍UniAct,一个旨在通用动作空间中运行的具身基础建模框架,它擅长弥合领域差距,并促进在大规模异构数据上的训练。我们首先讨论通用动作的理想特性,然后详细讨论用于从异构跨形态数据中提取和解码通用动作的模型架构和学习方案。
3.1. 通用动作空间
理想的通用动作空间是指,所有由不同形态的异构控制信号驱动的运动,尽管其物理含义各异,都能被提炼为共享的潜在原子行为。我们将这些抽象的行为表征称为通用动作,它们在所有物理形态之间共享。
我们特别感兴趣的是探索一个离散的通用动作空间。这得益于离散表征在复杂推理、规划和预测学习中的强大能力,正如大型语言模型、视觉语言模型[1, 5, 6, 60]以及向量量化变分自编码器[52, 63]的成功所证明的那样。在本文中,我们将通用动作空间建模为,并使用一个向量量化的码本[63]来实现它,表示为:
![]()
3.2. 通用动作提取
![]()
![]()
类似于在潜在空间中进行规划 [13, 50, 51],该提取器旨在推断在观测 o o下解决给定任务 g 最相关的通用动作,从而构建与任务进展直接相关的通用动作,而不仅仅是识别有噪声的观测变化。我们采用视觉语言模型(VLM)来实现此目的,因为它具有强大的视觉-语言推理能力。此外,微调预训练的VLM也能显著提高学习通用动作时的样本效率。该提取器为跨域泛化创建了一个关键的信息瓶颈,因为不同的机器人被强制使用相同的离散码本 U 来捕获所有领域中通用且共享的原子行为。
然而,要实现这一点,不可微的 arg max 操作阻碍了梯度传播。因此,我们在训练过程中使用分类重参
![]()
数化,利用 Gumbel-Softmax 技术来促进梯度估计 [27]。具体来说,前向过程如下:
![]()
![]()
![]()
3.3. 异构解码
![]()
![]()
![]()
3.4. 训练流程
![]()
![]()
![]()
4. 实验
在本节中,我们首先描述UniAct框架的详细实现,然后介绍为回答以下问题而进行的评估实验:
通用动作能否在具有较大领域差距的多种形态上提升执行性能?
通用动作能否无缝迁移到新的、未见过的形态?
UniAct是否学习到了有意义的通用动作空间?
![]()
基线设置。我们选择了三个最先进的(SOTA)视觉-语言-动作模型,包括 Octo [61]、CrossFormer [17]、OpenVLA [31],以及一个SOTA预训练VLM模型 LAPA [69] 作为基线。Octo 和 CrossFormer 是 0.1B 参数的策略模型,OpenVLA 采用了一个70亿参数的自回归架构,使用离散动作。它们都在约100万个精心筛选的机器人演示数据上训练,这些数据消除了动作异质性,例如将所有绝对末端执行器位置预处理为相对末端执行器位置,并移除了关节位置动作。LAPA 也是一个70亿参数的模型,但它不使用动作标签,而是基于相同的机器人演示数据,通过捕捉帧间的视觉变化来构建潜在动作。为使 LAPA 能生成实际动作,需要使用动作标签对其进行进一步的微调。相比之下,UniAct-0.5B 在来自相同数据源的、相似规模的数据上训练,但并未采用此类繁琐的数据清理过程。我们将 UniAct 与基线模型进行比较,以展示其从异构数据中提取通用动作的有效性。
4.2. 主要结果
为了评估 UniAct-0.5B 的跨形态泛化能力,我们在现实世界的 WidowX 机器人 [64] 和来自 Liu 等人 [38] 的仿真 Franka 机器人上进行了“开箱即用”的评估。这两个平台都是先前工作中常用于测试通用机器人策略有效性的平台 [49, 61, 64],并且存在显著的领域差距。鉴于我们的训练数据集包含了来自这两种形态的数据,我们可以利用预训练的异构解码器头将通用动作无缝地转换回可部署的控制信号。
现实世界机器人评估。遵循 Kim 等人 [31] 的方法,我们为现实世界机器人定义了一套全面的评估任务,涵盖了泛化能力的几个维度:视觉、运动、物理、语义和语言基础。总体而言,每个模型在 190 次试验中进行评估,分布在 19 个任务上,每个任务进行 10 次试验,更多细节请参见附录 B。代表性任务和结果如图 3 所示。为了使 LAPA 适应 WidowX 机器人,我们在 Bridge [64] 数据集上对其进行了约 2000 步梯度的全量微调。UniAct-0.5B 在视觉、运动和物理泛化任务上超过了 14 倍大的 OpenVLA-7B 和 LAPA-7B。这表明从异构数据中提取通用动作在增强对视觉干扰的鲁棒性和低级控制泛化方面具有显著优势。虽然 OpenVLA 利用 7B 参数的主干网络来获得卓越的语义理解和语言基础能力,但 UniAct-0.5B 在语义泛化和语言基础任务上取得了可比的性能,凸显了其效率和有效性。
![]()
仿真评估。我们使用 LIBERO 基准测试 [38] 进行评估。值得注意的是,基线模型最初并未在仿真数据上进行训练,因此我们在 LIBERO 平台上对它们进行了微调。用于训练 UniAct 和基线模型的数据在任务、数据量和图像质量方面完全对齐。更多细节请参考附录 A。该基准测试包含五个套件中的 130 个任务:LIBERO-Spatial、-Object、-Goal、-Long 和 -90。LIBERO-90 套件包含 90 个任务,而其他四个套件各包含 10 个任务。结果如图 4 所示。UniAct-0.5B 在所有套件中都超过了基线模型,整体平均准确率有显著提升。这种优越的性能归功于 UniAct 能够弥合领域差距并提取可泛化的原子行为。通过利用来自各种领域的演示来学习通用动作,UniAct 显著提升了在 LIBERO 基准测试上的任务表现。
4.3. 对新形态的快速适应
实验设置。为了评估快速适应能力,我们在一个新的真实机器人 AIRBOT(图5)上进行了评估。我们评估了四种不同的控制器接口:相对/绝对末端执行器位置控制和相对/绝对关节位置控制。UniAct 和基线模型都未在 AIRBOT 数据上进行过预训练。我们在这个新机器人平台上收集了 100 条演示数据,涵盖了这四种不同类型的控制接口。考虑到这些控制接口之间存在显著的异质性,我们投入了大量精力来微调基线模型,并确保模型收敛符合官方要求(例如,OpenVLA 的预测准确率达到 95%)。
![]()
评估。我们使用了一个简单版本和一个困难版本的“将方块叠放在另一个方块上”任务进行了评估。结果如图5所示。UniAct-0.5B 在所有类型的控制信号上都表现出一致的强泛化能力,超过了两个基线模型。值得注意的是,UniAct-0.5B 用于微调的参数量占总模型大小的比例是最小的(4M / 500M:0.8%)。相比之下,OpenVLA 和 Octo 分别使用了其总模型大小的 1.4%(97M / 7000M)和 2%(2M / 100M)。这种高效的参数利用率突显了 UniAct 在将学到的通用动作应用于新任务和形态时的有效性和适应性,且参数空间扩展极小。
4.4. 对新解码器头的快速适应
我们进一步测试了是否可以通过将 ACT [?] 集成到 UniAct-0.5B 中来提升性能,使用更先进的解码器。我们冻结了 UniAct-0.5B,并将其适配到一个双臂 AIRBOT 机器人上,使用来自俯视图、两个腕部视角以及本体感受的观测。我们为 4 个任务各收集了 250 条演示数据,并将 UniAct-0.5B 与预训练的 LLaVa-OV-0.5B 模型进行了比较。表 1显示了 UniAct 的优越性能,验证了其预训练的有效性。此外,我们在 LIBERO 基准测试上使用 ACT 解码器对 UniAct-0.5B 进行了微调,使用了俯视图、腕部视角和本体感受。如 图 4所示,UniAct 取得了进一步的提升,展示了其与先进解码器和更丰富观测的适应性。详情请参阅附录 B.4。
![]()
4.5. 通用动作的深入分析
在本节中,我们从两个角度证明 UniAct 构建了一个有意义的通用动作空间:1) 一致的语义行为在不同形态上被编码为相同的通用动作;2) 通用动作提取器能够有效地利用不同机器人之间在通用动作空间中的这种共享结构。
通用动作的可解释性。我们人工检查了不同机器人在全部 256 个通用动作下的解码行为,观察到其中至少 40% 表现出完全的一致性。图 6表明,即使存在巨大差距,相同的通用动作在不同机器人上也能被解码回一致的行为。例如,具有不同视角的不同机器人,甚至那些经历巨大仿真到现实迁移的机器人,在给定相同通用动作的情况下,也能执行具有相似语义意义的行为。
![]()
使用通用动作进行控制。因此,我们可以通过选择一系列通用动作,直接与机器人交互以执行期望的行为。图 7清晰地展示了我们可以使用通用动作来控制机器人,而无需任何机器人学知识,例如学习复杂的前向/逆向运动学变换。这也突显了利用通用动作提取器作为动作分词器的潜力,通过在这个离散的通用动作空间中进行规划,促进未来更先进的具身基础模型的部署。
通用动作使用的统计分析。在此,我们总结了不同机器人在不同任务上的通用动作使用分布。表 2清晰地表明,对于相同任务和不同机器人,其使用分布是相似的,但对于不同任务和相同机器人,其使用分布是不同的,这表明通用动作提取器确实通过更多地关注任务进展而非形态细节,正确地利用了这些与形态无关的原子行为。
![]()
5. 结论
我们介绍了UniAct,一个创新的具身基础建模框架,它在通用动作空间中运行,以应对动作异质性的挑战。这个通用动作空间编码了跨不同具身动作空间的可共享原子行为,显著增强了跨领域数据利用,并促进了跨形态泛化,使我们0.5B参数的模型能够超越14倍大的最先进模型。此外,学到的通用动作可以通过异构解码,以最少的参数精确地转换为任何特定于形态的动作,从而允许快速适应具有不同控制接口和物理特性的新机器人。而且,我们学到的通用动作提取器还可以用作一个通用动作分词器,为构建未来大规模具身基础模型提供支持。目前,UniAct是以0.5B参数实例进行训练的,并且由于资源限制,主要在单臂机器人平台上进行评估。未来的工作将致力于将UniAct扩展到更大的模型,并将其应用扩展到更广泛的形态,包括双臂机器人甚至自动驾驶,进一步发挥其在更多机器人应用中的通用能力和有效性。
原文链接:https://arxiv.org/pdf/2501.10105
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.