嵌入式人工智能的视觉-语言-动作模型综述
A Survey on Vision-Language-Action Models for
Embodied AI
https://arxiv.org/pdf/2405.14093v6
![]()
![]()
摘要——
具身智能被广泛认为是人工智能通用性的基石,因为它涉及控制具身智能体在物理世界中执行任务。在大语言模型和视觉-语言模型成功的基础上,一类新的多模态模型——称为视觉-语言-动作模型(VLA)——应运而生,通过利用其独特的动作生成能力来处理具身AI中语言条件下的机器人任务。近年来VLA的激增使得迫切需要一篇全面的综述来把握这一快速演变的领域。为此,我们提出了首篇关于具身AI中VLA的综述。本文提供了VLA的详细分类,组织为三大研究方向。第一条主线聚焦于VLA的各个组成模块。第二条主线致力于开发基于VLA的控制策略,擅长预测低层级动作。第三条主线包括高层级任务规划器,能够将长时程任务分解为一系列子任务,从而引导VLA遵循更通用的用户指令。此外,我们对相关资源进行了广泛总结,包括数据集、模拟器和基准测试。最后,我们讨论了VLA面临的挑战,并展望了具身AI中有前景的未来方向。与本综述相关的整理库可在以下网址获取:https://github.com/yueen-ma/Awesome-VLA。
索引术语——视觉-语言-动作模型,具身智能,机器人学,多模态,大语言模型,世界模型
I. 引言
视觉-语言-动作模型(VLA)是具身智能领域中一类多模态模型,旨在处理来自视觉、语言和动作三种模态的信息。与对话式AI不同,具身AI需要控制与环境交互的物理实体,而机器人学是具身AI最突出的领域。在语言条件下的机器人任务中,策略必须具备理解语言指令、视觉感知环境并生成适当动作的能力,这需要VLA的多模态能力。该术语最近由RT-2 [1]提出。与早期的深度强化学习方法相比,VLA在复杂环境中具有更优越的通用性、灵巧性和泛化能力。因此,它们不仅适用于工厂等受控环境,也适用于家庭环境中的日常任务。
深度学习的早期发展主要由单模态模型组成。在计算机视觉(CV)中,AlexNet [2]展示了人工神经网络(ANN)的潜力。循环神经网络为众多自然语言处理(NLP)模型奠定了基础,但近年来已发生转变,Transformer [3]占据了主导地位。深度Q网络 [4]证明ANN可以成功解决强化学习(RL)问题。利用单模态模型在多个机器学习领域的进展,多模态模型如今处理广泛的任务,例如视觉问答、图像描述和文本到视频生成。
基于强化学习的传统机器人策略主要侧重于在受控环境中解决有限的任务集,例如物品抓取 [5]。然而,正如最近大语言模型(LLM)和视觉-语言模型(VLM)的趋势一样,对更多功能的多任务策略的需求日益增长。开发多任务策略具有挑战性,因为它需要学习更广泛的技能集并适应多样化的环境。此外,通过语言指令指定任务提供了一种更直观的用户-机器人界面,这需要开发语言条件下的机器人策略。
建立在大型VLM成功的基础上,视觉-语言-动作模型已展现出应对这些挑战的潜力,如图1所示。与VLM类似,VLA利用视觉基础模型作为视觉编码器,以获得当前环境状态的预训练视觉表示,例如物体类别、姿态和几何形状。VLA使用其LLM的标记嵌入来编码指令,并采用多种策略来对齐视觉和语言嵌入,包括BLIP-2 [6]和LLaVA [7]等方法。通过在机器人数据上进行微调,LLM可以充当解码器来预测动作并执行语言条件下的机器人任务。这些跨学科创新推动了VLA在具身AI中的进步——这是人工通用智能(AGI)的关键组成部分。
![]()
VLA与三条工作路线密切相关,如图2b的时间线和图3的分类法所示。一些方法聚焦于VLA的各个组成模块(§III-A),例如预训练视觉表示、动力学学习、世界模型和推理。同时,大量研究致力于低层级控制策略(§III-B)。在这一类别中,语言指令和视觉感知被输入控制策略,然后生成低层级动作——例如平移和旋转——从而使VLA成为控制策略的理想选择。相比之下,另一类模型充当高层级任务规划器,负责任务分解(§IV)。这些模型将长时程任务分解为一系列子任务,进而引导VLA朝着总体目标前进,如图4所示。当前大多数机器人系统采用这种分层框架 [8]–[10],因为高层级任务规划器可以利用高容量模型,而低层级控制策略可以专注于速度和精度,类似于分层强化学习。
![]()
![]()
![]()
为了更全面地概述具身AI的当前进展,我们提出了“VLA”的广义定义,如图2a的维恩图所示。我们将VLA定义为任何能够处理来自视觉和语言的多模态输入以生成机器人动作来完成具身任务的模型,通常遵循图1中的架构。VLA的原始概念是指将VLM适配到机器人任务的模型 [1]。类似于LLM与更通用语言模型之间的区别,我们将原始VLA称为“大型VLA”(LVLA),因为它们基于LLM或大型VLM。
相关工作。据我们所知,本综述是首个回顾VLA模型近期进展的文献,这是一个快速兴起的研究领域。以往的综述调查了具身AI的其他方面。[11]全面总结了截至2023年机器人学中的基础模型,而[12]聚焦于机器人学中的LLM。[13]考察了用于通用机器人的更近期视觉、语言和机器人基础模型。[14]专注于现实世界的机器人应用。相比之下,我们的工作强调VLA模型,从而补充和扩展了关于具身AI的现有文献。
贡献。据我们所知,本文是首篇关于具身AI领域中新兴视觉-语言-动作(VLA)模型的全面综述。
• 全面回顾。我们对具身AI中新兴的VLA模型进行了深入回顾,涵盖各个方面,包括组件、架构、训练目标、机器人任务等。
• 分类法。我们基于当前机器人系统的分层框架引入了VLA的分类法,包括两个层级:低层级控制策略和高层级任务规划器。控制策略根据指定的语言命令和感知环境执行低层级动作。任务规划器通过将长时程任务分解为子任务来为控制策略提供指导。我们还讨论了VLA的各种基本组成模块。
• 资源。我们总结了训练和评估VLA所需的必要资源,包括现实世界或模拟环境中的最新数据集和基准测试。我们还讨论了应对当前挑战的各种方法,例如数据稀缺和不一致性问题。
• 未来方向。我们概述了该领域当前的挑战和有前景的未来机遇,例如安全性、基础模型和现实世界部署。
II. 背景
具身智能是人工智能的一种独特形式,它主动与物理环境进行交互。这使其区别于其他AI模型,例如主要处理文本对话的对话式AI,或专注于文本到视频生成等任务的生成式AI模型。具身智能涵盖了广泛的具身形态,包括智能家电、智能眼镜、自动驾驶汽车等。其中,机器人是最突出的具身形态之一。
![]()
III. 视觉-语言-动作模型
A. VLA的组成模块
一系列工作聚焦于VLA模型的各个组成模块,借鉴了CV、NLP和RL领域的成功经验。我们通过具身AI的视角来介绍它们。
![]()
![]()
![]()
DINOv2 [33]提出了一种新的PVR自监督训练范式,其性能超越了MAE。它采用自蒸馏框架,教师网络和学生网络接收同一图像的不同视图,并匹配它们编码后的表示。学生网络使用SGD进行更新,而教师网络则作为学生网络的EMA进行维护。
I-JEPA [36]的动机是[39]提出的联合嵌入预测架构。它通过比较图像块嵌入来构建一个“原始”的内部世界模型。与使用裁剪图像的DINO不同,I-JEPA使用掩码图像块。此外,它与MAE不同,因为它是一种非生成式方法。
Theia [37]提出将各种视觉基础模型蒸馏到单个模型中。通过融合它们来自分割、深度、语义等方面的信息,它在需要更少数据和更小模型尺寸的同时,性能优于先前的PVR。
3) 视频表示:视频是简单的图像序列,可以通过拼接每帧的常规PVR来表示。然而,它们的多视角特性使得除上述方法之外,还能采用各种独特的表示技术,例如时间对比学习和MAE。可以从视频中提取NeRF,其中包含丰富的3D信息用于机器人学习,如F3RM [40]和3D-LLM [41]所示。最近的3D高斯泼溅(3D-GS)[42]在视觉质量和渲染速度上超越了NeRF。此外,许多视频包含音频,这可以为机器人策略提供重要线索[43]。
4) 动力学学习:动力学学习包含旨在赋予模型 f ( ⋅ ) 对前向或逆向动力学理解的目标。前向动力学涉及预测给定动作后产生的后续状态,而逆向动力学则涉及确定从先前状态到已知后续状态所需的动作:
![]()
一些方法也将这些目标构建为对打乱的状态序列进行重新排序的问题。一些前向动力学方法与PVR中使用的图像或视频预测预训练非常相似。我们在表II中对它们进行了比较。
![]()
Vi-PRoM [44]提出了三个不同的预训练目标。第一个是对比自监督学习目标,旨在区分不同视频。其余两个目标集中于监督学习任务:时间动力学学习(旨在恢复被打乱的视频帧)和使用伪标签的图像分类。通过与先前预训练方法的全面比较,Vi-PRoM证明了其在行为克隆和PPO中的有效性。
MIDAS [46]引入逆向动力学预测任务作为其预训练的一部分。其目标是训练模型从观测中预测动作,构建为运动跟随任务。这种方法增强了模型对环境转移动力学的理解。
SMART [47]提出了一种包含三个不同目标的预训练方案:前向动力学预测、逆向动力学预测和随机掩码后见控制。前向动力学预测任务涉及预测下一个潜在状态,而逆向动力学预测任务涉及预测上一个动作。在后见控制的情况下,整个控制序列作为输入提供,其中部分动作被掩码,模型被训练来恢复这些被掩码的动作。纳入前两个动力学预测任务有助于捕捉局部和短期动力学,而第三个任务则旨在捕捉全局和长期的时间依赖关系。
MaskDP [45]提出了掩码决策预测任务,其中状态和动作标记都被掩码以进行重建。这种掩码建模任务专门设计用于使模型理解前向和逆向动力学。值得注意的是,与BERT或MAE等先前的掩码建模方法相比,MaskDP直接应用于下游任务。
PACT [48]引入了一个旨在对状态-动作转移进行建模的预训练目标。它接收状态和动作序列作为输入,并自回归地预测每个状态和动作标记。这个预训练模型充当动力学模型,然后可以针对各种下游任务进行微调,例如定位、地图构建和导航。
VPT [49]提出了一种视频预训练方法,利用未标注的互联网数据来预训练Minecraft游戏的基础模型。该方法首先使用有限数量的标注数据训练一个逆向动力学模型,然后利用该模型为互联网视频标注。随后,新自动标注的数据被用于通过行为克隆训练VPT基础模型。这种方法遵循半监督模仿学习。作为该过程的结果,该模型在众多任务上展现了人类水平的表现。
GR-1 [50]引入了针对GPT风格模型的视频预测预训练。预测未来帧的能力与前向动力学学习一致,有助于更准确的动作预测。
![]()
![]()
它使具身智能体能够实现基于模型的控制和规划,因为它们可以在执行任何实际动作之前,先在想象空间中搜索最优动作序列。尽管前向动力学学习也试图预测下一个状态,但它通常被视为预训练任务或辅助损失,以增强基于RL-Transformer的动作解码器的主要机器人任务,而不是作为一个独立的模块。此外,新的具身体验可以从显式生成未来状态图像或视频的视觉世界模型中采样。
Dreamer [51]采用三个主要模块来构建潜在动力学模型:表示模型,负责将图像编码为潜在状态;转移模型,捕捉潜在状态之间的转移;以及奖励模型,预测给定状态对应的奖励。在演员-评论家框架下,Dreamer利用动作模型和价值模型,通过学到的动力学传播解析梯度,在想象中学习行为。在此基础上,DreamerV2 [52]引入了离散潜在状态空间以及改进的目标。DreamerV3 [53]将重点扩展到更广泛的领域,并使用固定的超参数。DayDreamer [54]将此方法应用于执行现实世界任务的物理机器人。
IRIS [55]采用类似GPT的自回归Transformer作为其世界模型的基础,并以VQ-VAE作为视觉编码器。随后,使用由世界模型从真实观测展开的想象轨迹来训练策略。TWM [56]也研究了Transformer在世界模型构建中的应用。
6) LLM诱导的世界模型:LLM包含了丰富的关于世界的常识知识,促使许多方法利用这些知识来改进VLA。
DECKARD [57]提示LLM生成抽象世界模型(AWM),表示为有向无环图[58]、[59],专门针对Minecraft中的物品制作任务。DECKARD在两个阶段之间迭代:在“梦想”阶段,它根据AWM采样一个子目标;在“清醒”阶段,DECKARD执行子目标并通过与游戏交互更新AWM。这种引导方法使DECKARD相比缺乏此类引导的基线方法实现了显著更快的物品制作速度。
LLM-DM [60]使用LLM以规划领域定义语言(PDDL)构建世界模型——这是LLM+P [61]未能实现的能力,因为其PDDL世界模型是手工制作的。LLM还充当接口,在生成的PDDL模型与来自语法验证器和人类专家的纠正反馈之间进行协调。最后,PDDL世界模型作为符号模拟器,辅助LLM规划器生成计划。
RAP [62]将LLM重新用作预测动作的策略和提供状态转移分布的世界模型。与先前的思维链提示方法不同,RAP结合了蒙特卡洛树搜索(MCTS)以实现结构化规划,使LLM能够逐步构建推理树。这种推理策略帮助RAP找到在探索和利用之间取得平衡的高奖励路径。Tree-Planner [63]通过仅提示LLM一次以在动作树内生成多样化路径来提高效率。
LLM-MCTS [64]基于RAP构建,但将问题设置扩展到POMDP。作为世界模型,LLM生成当前状态的初始信念;作为策略,它充当指导动作选择的启发式方法。通过利用其常识知识,LLM减少了MCTS的搜索空间,从而提高了搜索效率。
7) 视觉世界模型:与文本形式的LLM诱导世界模型不同,视觉世界模型生成未来状态的图像、视频或3D场景——与物理世界更加一致。它们还可以进一步用于生成新的轨迹。自从Sora展示了世界模拟能力[65]以来,这一方向受到越来越多的关注,如一项专门综述[66]所调查的。
Genie [67]引入了一类新的生成模型,称为生成式交互环境。它由三个主要组件组成:时空视频分词器、自回归动力学模型和潜在动作模型。在以无监督方式对未标注视频进行训练后,Genie允许用户逐帧与生成环境进行交互。因此,Genie建立了一个基础世界模型。
3D-VLA [68]提出了一个能够进行目标生成的3D世界模型。它处理视觉输入(如图像、深度图和点云),然后使用扩散模型根据用户查询生成目标状态(可以是图像或点云)。生成的目标状态随后可用于指导机器人控制。
UniSim [69]基于真实世界交互视频构建生成模型。它能够模拟高层级和低层级动作的视觉结果,然后可用作训练具身智能体的新经验。E2WM [70]甚至将现有模拟器视为世界模型,通过MCTS收集具身体验。
8) 推理:推理已成为LLM的关键能力,如思维链(CoT)方法[71]、[72]所示。在具身AI中,研究人员正在探索如何利用CoT推理来优化决策过程。
推理与高层级任务规划天然兼容,因为两者通常都发生在语言领域。ThinkBot [73]应用CoT来恢复稀疏人类指令中缺失的动作描述,从而增强指令连贯性并提高困难任务的成功率。ReAct [74]将推理轨迹和动作交错进行,其中CoT可以帮助制定动作计划、注入常识知识并处理异常,最终改善具身决策。RAT [75]将CoT与检索增强生成(RAG)相结合以减少幻觉,从而改进具身规划。Tree-Planner [63]采用思维树方法进行任务规划。
另一种范式是为低层级控制策略配备推理能力,由ECoT [76]开创。该方法训练OpenVLA [34]在预测低层级动作之前,对计划、子任务、运动和视觉特征进行具身CoT推理。通过依赖这种多步推理而非VLA的“肌肉记忆”,它在不增加机器人数据的情况下,提高了具有挑战性的泛化任务的成功率。CoT-VLA [77]为VLA引入了视觉CoT推理。
9) 策略引导:策略引导可以在测试时增强VLA性能,而无需昂贵的重新训练。V-GPS [78]基于学习到的价值函数对生成的动作进行重新排序,而RoboMonkey [79]则使用基于VLM的验证器从采样集中选择最优动作。
优势与局限。
a) PVR:尽管视频时间对比学习和文本引导的预训练方法(如CLIP)提供了图像级别的信息,但它们缺乏基于MAE的自监督学习方法所提供的像素级细节。像素级信息包含丰富的细节——包括分割掩码、物体位置和深度估计——这些通常对需要高精度的机器人操作任务更为有用,如VC-1的比较[31]所示。DINOv2通过将掩码图像建模与动量编码器及多裁剪增强相结合,同时学习像素级和图像级特征,其对下游机器人任务的有益效果在OpenVLA [34]中得到了证实。I-JEPA聚焦于表示空间中的图像块,因此比DINO等视图不变性方法更有效地捕获低层级图像特征。Theia将各种现成的视觉基础模型蒸馏到单个模型中,该模型优于独立的单个模型,如对机器人学习中大多数现有PVR的全面评估所示[37]。
b) 前向与逆向动力学:前向动力学学习通常比逆向动力学学习更具挑战性,因为预测未来状态比预测过去动作更复杂。因此,前向动力学的难度通常会带来更大的性能提升,如SMART中所示。然而,逆向动力学模型可用于为仅包含状态的数据集(如原始机器人操作视频)生成动作标签。
c) 世界模型与推理:尽管世界模型和推理方法都可以应用于低层级控制策略和高层级任务规划器,但当前的方法仍然不同。世界模型主要用于与控制策略交互,因为它们擅长在给定低层级动作的情况下生成紧邻的下一个状态。相比之下,基于CoT的推理方法侧重于任务规划,因为它们以文本形式表达思维链,使其非常适合优化基于文本的任务计划。
B. 低层级控制策略
![]()
![]()
它也可以被称为低层级策略、低层级控制器或动作基元。VLA的多样性源于各个模块和整体架构。总体架构如图1所示。本节探讨设计低层级控制策略的各种方法。表III总结了它们的技术细节。
![]()
1) 非Transformer控制策略:在采用Transformer模型之前,语言条件下机器人任务的早期控制策略在架构上差异很大。
CLIPort [28]将CLIP与Transporter网络集成,创建了双流架构。CLIP视觉编码器从RGB图像中提取“语义”信息,而Transporter网络从RGB-D图像中提取“空间”信息。CLIP句子编码器对语言指令进行编码,并指导输出 S E ( 2 ) 动作,该动作由配对的抓取和放置末端执行器位姿组成。它代表了语言条件下抓取-放置能力的早期演示。
BC-Z [80]处理两种类型的任务指令:语言指令或人类演示视频。环境以RGB图像的形式呈现给模型。然后通过FiLM层将指令嵌入和图像嵌入结合,最终生成动作。该条件策略据称对未见任务具有零样本任务泛化能力。
MCIL [81]代表了集成自由形式自然语言条件的开创性机器人策略。这与早期通常依赖任务ID或目标图像形式条件的做法形成对比。MCIL引入了利用未标注和非结构化的演示数据的能力。这是通过训练策略跟随图像或语言目标来实现的,训练数据集中有一小部分由配对的图像和语言目标组成。
HULC [82]引入了若干旨在增强机器人学习架构的技术。这些技术包括机器人学习的分层分解、多模态Transformer和离散潜在计划。Transformer学习高层级行为,将低层级局部策略和全局计划分层划分。此外,HULC结合了基于对比学习的视觉-语言语义对齐损失,以对齐视觉-语言模态。HULC++ [83]进一步集成了自监督可供性模型。该模型将HULC引导至语言指令指定的可操作区域,使其能够在该指定区域内完成任务。
UniPi [84]将决策问题视为文本条件下的视频生成问题。为了预测动作,UniPi基于给定的文本指令生成视频,并通过逆向动力学从视频帧中提取动作。这种创新的“策略即视频”公式具有多种优势,包括跨不同机器人任务的增强泛化能力,以及从互联网视频向真实机器人知识迁移的潜力。
2) 基于Transformer的控制策略:自从Transformer引入以来,控制策略已收敛到类似的基于Transformer的架构。
Interactive Language [86]提出了一种机器人系统,其中低层级控制策略可以通过语言传达的人类指令进行实时引导,从而完成长时程重排任务。这种基于语言的引导的有效性主要归功于使用了一个精心收集的数据集,该数据集包含多样化的语言指令,其规模比以往数据集大一个数量级。
Hiveformer [87]非常重视利用多视角场景观测并保留完整的观测历史用于语言条件下的策略。这种方法代表了先前系统(如CLIPort和BC-Z)的进步,这些系统仅使用当前观测。值得注意的是,Hiveformer是将Transformer架构作为其策略主干网络的早期采用者之一。
Gato [17]提出了一个能够玩Atari游戏、为图像添加标题和堆叠积木的模型,所有这些都使用单一组模型参数。这一成就得益于统一的标记化方案,协调了跨不同任务和领域的输入和输出。因此,Gato能够同时训练不同的任务。Astra [126]通过轨迹注意力优化了这种架构。
RoboCat [93]提出了一种自我改进过程,旨在使智能体能够在仅需100个演示的情况下快速适应新任务。该自我改进过程迭代地微调模型,并使用微调后的模型自我生成新数据。基于Gato模型构建,RoboCat集成了VQ-GAN图像编码器。在训练期间,RoboCat不仅预测下一个动作,还预测未来的观测。通过在模拟和现实环境中多任务、多具身形态设置下的综合实验,证明了自我改进过程的有效性。
RT-1 [95]由与BC-Z相同的团队开发,与BC-Z有相似之处,但也引入了一些关键区别。值得注意的是,RT-1采用基于更高效的EfficientNet的视觉编码器,而不是BC-Z使用的ResNet。
![]()
然而,RT-1不使用视频作为任务指令。此外,RT-1将BC-Z中的MLP动作解码器替换为Transformer解码器,生成离散化的动作。这一修改使RT-1能够关注过去的图像,相比BC-Z提升了性能。
Q-Transformer [96]通过引入自回归Q函数扩展了RT-1。与RT-1通过模仿学习学习专家轨迹不同,Q-Transformer采用Q学习方法。除了Q学习的TD误差目标外,还加入了一个保守正则化器,以确保最大值动作保持在分布内。这种方法使Q-Transformer不仅能够利用成功的演示,还能利用失败的轨迹进行学习。
RT-Trajectory [97]采用轨迹草图作为策略条件,而不是依赖语言条件或目标条件。这些轨迹草图由描绘机器人末端执行器预期轨迹的曲线组成。它们可以通过图形用户界面手动指定,从人类演示视频中提取,或由基础模型生成。RT-Trajectory的策略构建在RT-1的主干网络上,并训练以控制机械臂精确跟随轨迹草图。这种方法促进了对新物体、任务和技能的泛化,因为来自不同任务的轨迹是可迁移的。
ACT [98]构建了一个带有动作分块的条件VAE策略,要求策略预测一系列动作而不是单个动作。在推理期间,使用称为时间集成的方法对动作序列进行平均。RoboAgent [99]通过MT-ACT扩展了ACT,表明动作分块提高了时间一致性。它还引入了一种基于修复的语义增强方法。
RoboFlamingo [100]通过附加基于LSTM的策略头,将现有的Flamingo VLM适配为机器人策略。这表明预训练的VLM可以有效地迁移到语言条件下的机器人操作任务。
3) 多模态指令的控制策略:多模态指令启用了指定任务的新方式,例如通过演示、命名新物体,或通过手指或鼠标点击来指向。
VIMA [127]非常重视多模态提示和模型的泛化能力。通过引入多模态提示,与纯文本提示相比,可以制定更具体和更复杂的任务。VIMA引入了四种主要类型的任务:物体操作、视觉目标到达、新概念接地、单次视频模仿、视觉约束满足和视觉推理。这些任务通常仅使用语言提示很难甚至不可能表达。VIMA-Bench已被开发用于在四个泛化级别上进行评估:位置、新型组合、新型物体和新型任务。
MOO [94]将RT-1扩展以处理多模态提示。利用RT-1的主干网络,它引入OWL-ViT来编码提示中的图像。通过用新物体和额外的提示图像扩展RT-1数据集,MOO增强了RT-1的泛化能力。这种扩展也促进了指定目标物体的新方法,例如用手指指向和点击图形用户界面。
4) 具有3D视觉的控制策略:在我们的3D世界中,有理由认为3D视觉提供比2D图像更丰富的信息。
点云是3D视觉输入的常见表示,因为它们可以直接从RGB-D输入中导出,如DP3 [106]和3D Diffuser Actor [109]所示。体素同样已被广泛研究。VER [128]提出以由粗到细的方式将多视角图像体素化为3D单元,从而增强视觉-语言导航任务的性能。PerAct [88]通过在观测和动作空间中利用体素表示,仅用少量演示即可实现高效的任务学习。输入是由多视角RGB-D图像重建的体素地图,而输出对应于引导夹爪移动的最佳体素。RoboUniView [101]通过一种新颖的UVFormer视觉编码器从多视角图像中注入3D信息来提升性能,该编码器在3D占用任务上进行了预训练。
相比之下,Act3D [89]引入了一种连续分辨率的3D特征场,其分辨率根据当前任务自适应调整,从而解决了体素化的计算成本问题。RVT、RVT-2 [90]、[91]提出从场景点云的虚拟视角重新渲染图像,并将这些图像作为输入,而不是直接依赖3D输入。
5) 基于扩散的控制策略:基于扩散的动作生成利用了扩散模型在计算机视觉领域的成功。
Diffusion Policy [105]将机器人策略构建为DDPM。这种方法结合了多种技术,包括后退地平线控制、视觉条件和时间序列扩散Transformer。这种基于扩散的视觉运动策略的有效性体现在其擅长处理多模态动作分布、高维动作空间和训练稳定性方面。
SUDD [107]提出了一个框架,其中LLM引导数据生成,随后将过滤后的数据集蒸馏为视觉-语言-运动策略。该框架通过将LLM与一组原始机器人工具(如抓取采样器和运动规划器)组合来实现语言引导的数据生成。然后,它扩展了Diffusion Policy,通过引入基于语言的条件进行多任务学习,并促进了过滤后数据集的蒸馏。
Octo [108]引入了一种基于Transformer的扩散策略,其特点是模块化的开放式框架设计,允许从不同的任务定义编码器、观测编码器和动作解码器到Octo Transformer的灵活连接。作为最早使用OXE数据集[113]的模型之一,Octo展示了跨不同机器人和任务的正面迁移和泛化能力。
MDT [110]将计算机视觉中新引入的DiT模型适配到动作预测头。DiT最初被提出为基于Transformer的扩散模型,取代了用于视频生成的经典U-Net架构。结合两个辅助目标——掩码生成式前瞻和对比潜在对齐——MDT表现出比基于U-Net的扩散模型SUDD更好的性能。
RDT-1B [111]是一个用于双手操作的基于扩散的基础模型,同样构建在DiT之上。它通过引入跨不同机器人的统一动作格式来解决数据稀缺问题,从而能够在包含超过6K轨迹的异构多机器人数据集上进行预训练。因此,RDT扩展到12亿参数并展示了零样本泛化能力。
6) 具有3D视觉的基于扩散的控制策略:有几项工作提出了将3D视觉与基于扩散的策略相结合。DP3 [106]将3D输入引入扩散策略,从而提升了性能。同样,3D Diffuser Actor [109]与DP3共享核心思想,但在模型架构上有所不同,它将Act3D与Diffusion Policy相结合。3D-MoE [129]探索了一种高效的混合专家架构,使用整流流调度器进行基于DiT的动作扩散。
7) 用于运动规划的控制策略:运动规划涉及将运动任务分解为离散的路径点,同时满足避障和运动学限制等约束。
Language costs [85]提出了一种新颖的机器人修正方法,利用自然语言进行人在环机器人控制系统。该方法利用从人类指令生成的预测成本图,然后由运动规划器使用该图计算最优动作。该框架使用户能够通过直观的语言命令来修正目标、指定偏好或从错误中恢复。
VoxPoser [104]使用LLM和VLM创建两个表示可供性和约束的3D体素地图。它利用了LLM的编程能力和VLM的感知能力。LLM将语言指令翻译为可执行代码,调用VLM获取物体坐标。基于组合的可供性和约束地图,VoxPoser采用模型预测控制为机械臂末端执行器生成可行的轨迹。值得注意的是,VoxPoser不需要任何训练,因为它直接连接LLM和VLM进行运动规划。
RoboTAP [130]将演示分解为由夹爪张开和闭合标记的阶段。在每个阶段,RoboTAP使用TAPIR算法检测跟踪相关物体从源位姿到目标位姿的活动点。然后可以通过视觉伺服使用该路径来控制机器人。通过将这些阶段串联起来创建运动计划,从而实现少样本视觉模仿。
8) 基于点式动作的控制策略:近期研究探索了利用VLM的能力来选择或预测基于点的动作——这是构建完整VLA的一种经济高效的替代方案。
PIVOT [131]将机器人任务构建为视觉问答,利用VLM从一组视觉提议中选择最佳机器人动作。视觉提议以图像上的关键点形式进行标注。VLM被迭代提示以细化它们,直到识别出最佳选项。
RoboPoint [92]使用空间可供性预测任务来微调VLM,该任务是在图像上指向要执行动作的位置。这些2D图像上的可供性点随后使用深度图投影到3D空间,形成预测的机器人动作。
ReKep [35]是一个约束函数,将场景中的3D关键点映射到数值成本。机器人操作任务可以表示为一系列ReKep约束,这些约束由大型视觉模型和VLM生成。因此,可以通过解决约束优化问题来获得机器人动作。
9) 大型VLA:大型VLA等同于RT-2 [1]提出的原始VLA定义,如图2a所示。该术语类似于LLM与通用语言模型之间的区别,或大型VLM与通用VLM之间的区别。
RT-2 [1]致力于在机器人任务中利用大型多模态模型的能力,从PaLI-X和PaLM-E等模型中汲取灵感。该方法引入了联合微调,旨在使模型同时适应互联网规模的视觉问答(VQA)数据和机器人数据。这种训练方案增强了模型的泛化能力并带来了涌现能力。
RT-H [112]引入了一个动作层次结构,包括位于语言指令和低层级动作(平移和旋转)之间的语言运动中间预测层。这个额外层有助于改善跨不同任务的数据共享。例如,“抓取”和“倒水”语言指令都可能涉及“向上移动手臂”这个语言运动。此外,这种动作层次结构使用户能够指定修正以从失败中恢复,模型随后可以从中学习。
RT-X [113]建立在先前的RT-1和RT-2模型之上。这些模型使用新引入的开源大型数据集(名为Open X-Embodiment(OXE))进行重新训练,该数据集比先前数据集大几个数量级。由此产生的模型RT-1-X和RT-2-X均优于原始版本。
OpenVLA [34]后来被开发为RT-2-X的开源对应版本。他们还探索了高效的微调方法,包括LoRA和模型量化。OpenVLA-OFT [114]应用优化微调(OFT)方案以提高效率和性能。
TraceVLA [115]对OpenVLA进行微调以实现视觉轨迹提示,增强了时空感知能力。π0 [116]提出了一种流匹配架构,用于将VLM转换为VLA。通过在混合专家框架的基础上引入额外的动作专家,它有效地继承了VLM中的互联网规模知识,同时将其能力扩展到机器人任务。
RoboMamba [117]将昂贵的Transformer替换为具有线性推理复杂度的Mamba状态空间模型,实现了高效的机器人推理和动作能力。
SpatialVLA [118]引入了Ego3D位置编码以注入3D信息,并使用自适应动作网格表示动作,以增强泛化能力和鲁棒性。
LAPA [123]设计了首个基于潜在动作[67]的VLA无监督预训练方法。该方法采用三阶段流程从互联网规模的无标注视频中学习。首先,预训练一个VQ-VAE框架以提取图像帧之间的量化潜在动作。接下来,预训练一个VLA模型来预测这些潜在动作。最后,仅使用少量机器人数据集对模型进行微调,以将潜在动作映射到实际机器人动作。
大型VLA与扩散模型的集成也日益流行。TinyVLA [119]利用Diffusion Policy,而CogACT [120]使用DiT动作扩散模块。DexVLA [121]提出了具身课程学习,以逐步训练扩散动作专家,并结合子步骤推理来分解长时程任务。HybridVLA [122]将扩散模型与自回归范式集成,以充分利用VLM的推理能力。
视觉自回归建模(VAR)[132]结合量化视觉标记,在图像生成方面展现出优于扩散模型的性能。这表明VLA的三种模态可以在自回归范式下统一[133]。WorldVLA [124]和UniVLA [125]通过将VLA与世界模型集成来推进这一方向。它们将多模态数据量化为离散标记,形成量化多模态标记的共享词汇表。因此,所有模态都可以以自回归方式建模,不仅能够生成动作和文本,还能生成图像,从而构成一个世界模型。
LLM的一个近期趋势是通过生成调用工具API的代码来赋予它们工具使用能力[134]。Instruct2Act [103]遵循这一范式,集成视觉和动作工具,使LLM能够执行机器人任务。
优势与局限。
a) 架构:代表性的VLA架构如图5所示。FiLM被用于RT-1,因此其后续模型继承了这一机制。虽然交叉注意力在模型尺寸较小时可能提供更优的性能,但拼接更易于实现,并且在较大的模型上可以达到可比的结果[127]。量化将多模态标记统一到共享词汇表中,从而能够与世界模型集成。LLM的工具使用范式也可以应用于机器人任务。
b) 动作类型及其训练目标:大多数低层级控制策略预测末端执行器位姿的动作,同时抽象掉了生成更细粒度运动的运动规划模块。虽然这种抽象有助于更好地泛化到不同的具身形态,但也对灵巧性施加了限制。
行为克隆(BC)目标用于模仿学习,针对不同的动作类型有不同的变体。连续动作的BC目标可以写成:
![]()
![]()
c) RT系列:RT-1 [95]启发了“Robotic Transformer”模型系列。Transformer主干网络通过利用Transformer更高的容量来吸收更大的机器人数据集,从而超越了先前的RNN主干网络。在RT-1之前是BC-Z,它仅使用MLP层进行动作预测。RT-1之后出现了几项工作,每项都引入了新功能。MOO将RT-1适配为容纳多模态提示。RT-Trajectory使RT-1能够处理轨迹草图作为提示。Q-Transformer利用Q-learning训练RT-1。RT-2基于ViT和LLM,引入了与RT-1完全不同的架构。RT-X使用显著更大的数据集重新训练RT-1和RT-2,从而提升了性能。基于RT-2,RT-H [112]引入了动作层次结构以实现更好的数据共享。
d) LVLA与广义VLA:虽然LVLA可以极大地增强指令跟随能力,因为它们能更好地解析用户意图,但其训练成本和部署速度引发担忧。特别是缓慢的推理速度会显著影响动态环境中的性能,因为在推理过程中环境可能发生变化。因此,已经提出了几种提高效率的方法。TinyVLA [119]通过更小的VLM和用于机器人动作的扩散头来关注推理速度和数据效率。DeeR-VLA [102]提出通过带早退的动态推理仅部分激活模型。
e) 缩放定律:与LLM类似,缩放定律在机器人学中也被观察到[148]、[149],揭示了模型大小、数据集大小以及环境和物体多样性的重要性。该领域的进一步研究可以指导开发具有强大野外泛化能力的VLA。
IV. 任务规划器
![]()
![]()
这个过程有时被称为任务或子目标分解,与任务与运动规划(TAMP)和具身决策密切相关。当配备任务规划器时,VLA可以完成更复杂的长期任务,如图4所示。细节总结在表IV中。理想情况下,任务计划还应包含这些子任务的最优调度。
![]()
A. 单体任务规划器
单个LLM或多模态LLM(MLLM)通常可以通过采用定制框架或通过在具身数据集上进行微调来生成任务计划。我们称这些为单体模型。
1) 端到端任务规划器:与LVLA类似,任务规划器可以作为端到端的多模态LLM实现,利用其互联网规模的知识进行任务规划。
PaLM-E [10]将ViT和PaLM集成,创建了一个能够执行高层级具身推理任务的大型具身多模态语言模型。基于感知图像和高层级语言指令,PaLM-E生成一个文本计划,作为低层级机器人策略的指令。在移动操作环境中,他们使用SayCan [9]将生成的计划映射为可执行的低层级指令。当低层级策略执行动作时,PaLM-E还可以根据环境变化重新规划。以PaLM作为其主干网络,PaLM-E可以处理正常的视觉问答(VQA)任务以及额外的具身VQA任务。
EmbodiedGPT [135]引入了embodied-former,输出与任务相关的实例级特征。这是通过结合视觉编码器嵌入中的信息和LLM提供的具身规划信息来实现的。实例特征用于告知低层级策略接下来要执行的即时动作。
2) 具有3D视觉的端到端任务规划器:一些任务规划器也探索使用3D视觉。由于当前大多数MLLM处理图像作为视觉输入,它们需要进行架构更改以纳入3D视觉输入,因此它们通常是端到端模型。
LEO [136]使用两阶段训练策略将点云编码器与LLM集成:第一阶段侧重于3D视觉-语言对齐,随后是第二阶段,涉及3D视觉-语言-动作指令微调。LEO不仅在3D问答任务中表现良好,而且在操作、导航和任务规划方面也表现良好。
3D-LLM [41]将3D信息注入LLM,并使其能够执行3D任务,例如3D辅助对话和导航,使用来自点云、gradSLAM和神经体素场的特征。MultiPLY [150]是一个以物体为中心的具身LLM,它纳入了更多模态,包括音频、触觉和热感。
ShapeLLM [137]构建在新型3D视觉编码器ReCon++之上,该编码器从多视角图像和文本教师以及点云MAE中蒸馏知识。通过将ReCon++与LLaMA集成,ShapeLLM在其新提出的3D基准3D MM-Vet上提高了具身交互性能。
3) 接地任务规划器:接地任务规划涉及在生成高层级动作时考虑它们是否能够由低层级控制策略执行。
SayCan [9]是一个旨在集成高层级LLM规划器与低层级控制策略的框架。在该框架中,LLM规划器接受用户的高层级指令,并“说出”下一个最可能的低层级技能是什么,这一概念称为任务接地。低层级策略提供价值函数作为可供性函数,确定策略“能够”完成该技能的可能性,称为世界接地。通过综合考虑LLM的计划和可供性,该框架为当前状态选择最优技能。
Translated ⟨ LM ⟩ [138]采用两步过程将高层级指令转换为可执行动作。首先,利用预训练的因果LLM进行计划生成,将高层级指令分解为以自由形式语言短语表达的下一步动作。然后,由于这些短语可能无法直接映射到VirtualHome动作,使用预训练的掩码LLM进行动作翻译。该步骤涉及计算生成的动作短语与VirtualHome动作之间的相似度。翻译后的动作被附加到计划中,LLM读取更新后的计划以生成下一个动作短语。重复这两个步骤,直到形成完整计划。进一步提出了“重新提示”策略[151],以在智能体遇到前提条件错误时生成纠正动作。
![]()
B. 模块化任务规划器
在具身数据上微调端到端模型可能成本高昂,因此一些方法采用模块化设计,通过组合现成的LLM和VLM来构成任务规划器。这些方法也可以被视为遵循工具使用架构[134]。
1) 基于语言的任务规划器:基于语言的方法使用自然语言描述作为交换多模态信息的媒介,如图6a所示。
![]()
Inner Monologue [8]位于高层级命令和低层级策略之间,以实现闭环控制规划。它使用LLM为低层级策略生成语言指令,并根据从它们接收到的反馈动态更新这些指令。反馈来源多样:成功反馈、物体和场景反馈以及人类反馈。由于反馈以文本格式传达给LLM,因此无需对LLM进行额外训练。类似的方法也在ReAct [74]中使用。
LLM-Planner [140]提出了一种构建分层策略的新方法,该策略由高层级规划器和低层级规划器组成。高层级规划器利用LLM的能力生成自然语言计划,而低层级规划器将计划中的每个子目标转换为原始动作。虽然在整体架构上与先前方法有相似之处,但LLM-Planner通过引入重新规划机制来区别于它们,帮助机器人“摆脱困境”。
LID [141]引入了一种名为主动数据收集(ADG)的新型数据收集程序。ADG的一个关键方面是事后重新标注,即对不成功的轨迹重新分配标签,从而有效最大化数据的利用率,无论其成功与否。通过将所有环境输入转换为文本描述,其基于语言模型的策略展示了增强的组合泛化能力。
Socratic Models(SM)[142]提出了一个独特的框架,其中各种预训练模型可以在无需微调的情况下有效组合。该框架基于名为多模态知情提示的关键组件,促进具有不同多模态能力的模型之间的信息交换。其核心思想是利用多模态模型将非语言输入转换为语言描述,从而在语言空间内有效统一不同模态。除了在传统多模态任务中表现出色外,SM还展示了其在机器人感知和规划方面的多功能性。除了自然语言计划外,任务计划也可以以伪代码形式表示。
2) 基于代码的任务规划器:基于代码的任务规划器利用LLM的编码能力以程序形式生成任务计划。物体检测器、VLM和控制策略可以通过API调用,如图6b所示。
ProgPrompt [143]通过向LLM提供类似程序的规范(详细说明可用动作和对象)来提示,引入了一种新颖的任务规划方法。这使LLM能够以少样本方式为家务任务生成高层级计划。环境反馈可以通过程序中的断言来整合。
ChatGPT for Robotics [144]利用ChatGPT的编程能力来促进“用户参与回路”控制,这不同于传统的“工程师在回路”方法。该过程包括几个步骤:首先,定义一组API,例如物体检测API、抓取API、移动API;其次,为ChatGPT构建提示,指定环境、API功能、任务目标等;第三,迭代提示ChatGPT使用已定义的API编写能够执行任务的代码,并提供模拟和用户反馈的访问权限以评估代码质量和安全性;最后,执行ChatGPT生成的代码。在这一过程中,ChatGPT充当高层级任务规划器,动作通过对相应低层级API的函数调用来生成。
代码即策略(CaP)[145]也利用了LLM的代码编写能力。它使用GPT-3或Codex生成策略代码,然后调用感知模块和控制API。CaP在空间几何推理、对新指令的泛化以及低层级控制原语的参数化方面表现出色。通过利用GPT-4V的多模态能力,COME-robot [152]消除了CaP中对感知API的需求。这也为闭环框架内的开放式推理和自适应规划开辟了可能性,实现了诸如故障恢复和自由形式指令跟随等能力。
DEPS [146]代表“描述、解释、规划和选择”(Describe, Explain, Plan, and Select)。该方法使用LLM根据从环境收集的反馈描述来生成计划和解释失败——这一过程被称为“自我解释”,有助于重新规划。此外,DEPS引入了一个可训练的目标选择器,用于根据并行候选子目标的可实现难易程度在它们之间进行选择,这是其他高层级任务规划器经常忽略的一个关键方面。
ConceptGraphs [147]引入了一种将观测序列转换为开放词汇3D场景图的方法。使用2D分割模型从RGB图像中提取物体,并使用VLM为物体添加标注并建立物体间关系,从而形成3D场景图。该图随后可以转换为文本描述(JSON),为LLM提供实体之间丰富的语义和空间关系,用于任务规划。
优势与局限。
采用接地任务规划的单体任务规划器专注于生成可执行的计划。端到端模型与大多数LVLA共享相似的架构,并且可以在专门的具身数据上进行微调以获得更好的性能。然而,这类大型模型的训练成本可能是一个问题。相比之下,模块化任务规划器更易于部署,因为它们利用现成的LLM和VLM。基于语言的任务规划器具有无缝集成LLM和VLM的优势,因为它们被设计为在自然语言空间中操作。然而,它们通常需要额外的步骤来将生成的任务计划与低层级控制策略可接受的语言指令对齐。相反,虽然基于代码的任务规划器可能需要手动将VLM和控制策略包装在API中并提前准备清晰的文档,但它们支持代码调试并提供更大的可控性。尽管如此,它们的性能可能受到现有模型编程能力的限制。
V. 数据集与基准测试
A. 现实世界机器人数据集与基准测试
具身AI面临显著的数据稀缺问题,因为现实世界的机器人数据不像语言数据那样容易获得。收集现实世界的机器人数据集面临多重挑战。首先,采购机器人设备、搭建环境以及通过专门策略或人类遥操作收集专家数据所需的成本和时间构成了阻碍。其次,机器人的不同类型和配置在传感数据、控制模式、夹爪类型等方面引入了不一致性。最后,准确捕获物体6D姿态和重现设置仍然难以实现。我们在表V中总结了最近的机器人数据集。此外,现实世界的基准测试由于需要人工评估而更加复杂。
![]()
B. 模拟器、模拟机器人数据集与基准测试
许多研究人员诉诸模拟环境来规避现实世界的障碍并扩展数据收集过程。我们在表VI中比较了模拟器和模拟基准测试。然而,这种策略也带来了自身的挑战,其中最主要是仿真到现实的差距。当在模拟数据上训练的模型在现实世界部署中表现不佳时,就会出现这种差异。造成这种差距的因素是多方面的,包括不真实的渲染质量、物理模拟的不准确性以及以物体属性和机器人运动规划器为特征的领域偏移。例如,模拟非刚性物体(如可变形物体或液体)存在显著困难。此外,将新物体导入模拟器需要大量工作,通常涉及3D扫描和网格编辑等技术。尽管存在这些障碍,模拟环境提供了自动化评估指标,有助于研究人员一致地评估机器人模型。许多基准测试基于模拟器,因为它们可以精确重现实验设置并实现不同模型的公平比较。另一种称为“现实到仿真”的技术可以提高模拟保真度、重现失败案例或促进数字孪生的构建。
![]()
C. 自动化数据集收集
几种方法主张自动化数据集收集。RoboGen [187]采用生成式模拟范式,提出有趣的技能、模拟相应的环境,并选择最优学习方法以训练策略来获取这些技能。AutoRT [188]作为一个由LLM驱动的机器人编排器,生成任务、按可供性过滤任务,并利用自主策略或人类遥操作器来收集和评估数据。DIAL [189]专注于使用VLM增强现有数据集中的语言指令。RoboPoint [92]通过随机化3D布局、物体和相机视角程序化地生成场景。
D. 人类数据集
解决现实世界中数据稀缺问题的另一种策略是利用人类数据。由于其灵巧性和多样性,人类行为为机器人策略提供了丰富的指导[190]。然而,这种策略也带来了固有的缺点。捕捉人类手部/身体运动并将其迁移到机器人具身形态本身就很难。此外,人类数据的不一致性构成了障碍,因为一些数据可能是第一人称视角的,而另一些则是从第三人称视角捕获的。此外,过滤人类数据以提取有用信息可能非常耗费人力。这些障碍凸显了将人类数据纳入机器人学习过程的复杂性。UMI [191]提出了一种使用手持夹爪来缓解这些问题的方法。关于人类数据集更全面的比较,我们建议感兴趣的读者参考[192]。
E. 任务规划基准测试
EgoPlan-Bench [193]专注于使用人工标注对现实世界任务规划进行基准测试。PlanBench [194]、[195]全面评估任务规划能力的各个方面,例如成本最优性、计划验证和重新规划。LoTa-Bench [196]通过在模拟器中执行生成的计划并计算成功率来直接评估任务规划。具身智能体接口(EAI)[197]认为这种方法无法准确定位LLM中的问题。通过形式化基于LLM的决策任务模块的输入输出,EAI能够提供超越成功率的更细粒度指标。
F. 具身问答基准测试
如表VII总结的,具身问答(EQA)基准测试不直接评估操作和导航等机器人任务,而是针对具身AI的其他相关能力,如空间推理、物理理解以及世界知识。EQA类似于先前的视觉问答基准测试,但不同之处在于智能体在提供答案之前可以主动探索环境。EmbodiedQA [198]和IQUAD [199]是最早引入此类基准测试的工作之一。MT-EQA [200]专注于涉及多个目标的复杂问题。MP3D-EQA [201]将先前的RGB输入转换为点云,测试3D感知能力。
主动探索需要访问模拟器,限制了可使用的数据类型,例如现实世界视频。EgoVQA [202]将VQA的重点转向第一人称视频。EgoTaskQA [203]强调空间、时间和因果关系的推理。EQA-MX [204]研究多模态表达(MX),包括常规言语表达和眼神凝视、指向等非言语手势。OpenEQA [205]评估七个主要类别,包括功能推理和世界知识。
![]()
VI. 挑战与未来方向
a) 安全第一:安全在机器人学中至关重要,因为机器人直接与物理世界交互。确保机器人系统的安全性需要整合现实世界的常识。这包括纳入稳健的安全护栏、风险评估框架和人机交互协议。RLHF和“无执行评估”也可以显著降低安全风险[19]。VLA决策过程的可解释性和可扩展性对于通过错误诊断和故障排除来增强机器人安全性也至关重要。
b) 数据集与基准测试:除了§V中讨论的问题外,涵盖广泛技能、物体、具身形态和环境的全面基准测试仍有待开发。此外,需要超越成功率的指标来对VLA模型中的问题进行细粒度诊断,正如EAI [197]针对LLM所强调的那样。
c) 基础模型与泛化:面向具身AI的VLA基础模型或机器人基础模型(RFM)仍然是一个开放的研究课题,主要由于具身形态、环境和任务的多样性。许多工作已取得重大进展[111]、[116],但仍缺乏与NLP中LLM相当的泛化能力。达到这样的泛化水平非常具有挑战性,因为它需要发展许多核心AGI能力。
d) 多模态:VLA继承了与多模态模型相关的许多挑战,例如获取有用的嵌入和对齐不同模态。当前的方法,如ImageBind [206]和LanguageBind [207],分别将不同模态对齐到图像或语言嵌入空间。在统一的嵌入空间中,MLLM可以容纳多种模态并变得更加通用。然而,仅关注嵌入是否足够仍有争议。虽然超出了VLA的范围,但其他模态——如音频[43]、触觉[208]和凝视[209]——已被证明对某些具身AI应用有用。例如,使用额外的凝视网络[210]对人类凝视数据进行建模,或通过辅助损失[211]将其纳入,已被证明可以增强主策略网络的性能。这些方法表明,RL策略可以从类人视觉注意力中受益,因为人类凝视往往揭示环境中最显著的位置[212]。虽然纳入额外模态通常是有利的,但不可避免地会给模型设计带来额外的复杂性。
e) 长时程任务的框架:分层框架是目前处理长时程任务最实用的方法。然而,它增加了系统复杂性和潜在的故障点。频繁的任务执行失败可能触发重新规划,这可能导致显著的延迟。此外,单体任务规划器与LVLA共享相似的架构,因此使用两个大型模型可能冗余,并可能阻碍可扩展性。另外,虽然模块化任务规划器通常不需要训练,但它们并非即插即用:基于语言的模型可能生成控制策略无法执行的子任务,而基于代码的模型需要模块被预先手动包装在API中。因此,值得探索开发一个统一的框架,以端到端方式直接将长时程任务转换为低层级控制信号。
f) 实时响应性:与对话式AI不同,许多机器人应用需要实时决策来响应动态环境。如果推理时间无法跟上环境变化,模型可能会反复生成过时的动作。然而,当前的VLA模型——尤其是LVLA和任务规划器——面临着速度与容量之间的权衡。因此需要新的机制来达到最佳平衡。
g) 多智能体系统:协作式多智能体系统提供了分布式感知和协作式故障恢复等优势。然而,它们也面临挑战,包括有效通信、协调调度和集群异构性。在某些场景中,个体智能体可能具有冲突的目标,这进一步增加了复杂性。
h) 伦理与社会影响:机器人学一直引发各种伦理、社会和法律问题。这些包括与隐私、工作替代、决策偏见以及对社会规范和人际关系影响相关的风险。
i) 应用:目前大多数VLA专注于家庭或工业环境,但更广泛的应用是可能的,例如虚拟助手、自动驾驶汽车和农业机器人。各种具身形态也可能需要专门的VLA,包括灵巧手、无人机、四足机器人和人形机器人。一个特别重要的领域是医疗保健,包括手术机器人[213]、护理机器人[214]。医疗保健要求更高的安全和隐私标准,可能需要新颖的技术,如人在环(HITL)控制和联邦学习。此外,由于显著的领域差距,医学图像可能需要专门的视觉模型。
VII. 结论
视觉-语言-动作模型在使具身智能体能够与物理世界交互并执行用户指令方面具有巨大潜力。本文是首篇综述大型VLA及广义VLA的文献。我们的分类法从高层概述了三个主要研究方向:关键组件、控制策略和任务规划器。我们仔细分析和比较了它们的技术细节,包括模型架构、训练策略和各个模块。此外,我们强调了训练和评估VLA所需的基本资源,如数据集、模拟器和基准测试。我们希望本综述能够捕捉具身AI快速演变的格局,并激发未来的研究。
原文链接:https://arxiv.org/pdf/2405.14093v6
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.