网易首页 > 网易号 > 正文 申请入驻

迈向基于基础模型的通用机器人:综述与元分析

0
分享至

Toward General-Purpose Robots via Foundation Models:

A Survey and Meta-Analysis

迈向基于基础模型的通用机器人:综述与元分析

https://arxiv.org/pdf/2312.08782v3



摘要

构建能够在任何环境中、使用任何物体、并运用各种技能来完成多样化任务的通用机器人,一直是人工智能领域的长期目标。然而,作为一个研究群体,我们一直通过为特定任务设计、在特定数据集上训练以及在特定环境中部署,来限制大多数机器人系统。这些系统需要大量标注数据和任务特定的模型。当部署到现实世界场景时,此类系统会面临若干泛化问题,并且难以对数据分布变化保持鲁棒性。

受网络规模的大容量预训练模型(即基础模型)在自然语言处理(NLP)和计算机视觉(CV)等研究领域所展现出的令人印象深刻的开放集性能和内容生成能力的启发,我们致力于在本综述中探讨(i)如何将这些来自NLP和CV的现有基础模型应用于通用机器人领域,以及(ii)一个专属于机器人的基础模型会是什么样子。我们首先给出了基础模型在机器人领域中如何使用的通用表述,并指出了使通用机器人具有普适性的根本障碍。接着,我们建立了一个分类体系,用以讨论当前探索利用现有基础模型服务于机器人技术以及开发面向机器人定制的模型的研究工作。最后,我们讨论了利用基础模型实现通用机器人系统的关键挑战和未来有前景的研究方向。我们鼓励读者查阅我们的实时GitHub资源库,其中包含本综述中涉及的论文,以及与开发机器人基础模型相关的项目和资源库链接:https://robotics-fm-survey.github.io/。

1 概述

1.1 引言

在开发能够在不同环境中运行并适应环境、且执行多种任务的通用机器人系统方面,我们面临着诸多挑战。以往利用传统深度学习方法的机器人感知系统,通常需要大量标注数据来训练有监督学习模型[1-3];同时,为构建这些大型数据集而进行的人群标注过程仍然相当昂贵。此外,由于经典有监督学习方法的泛化能力有限,训练好的模型通常需要精心设计领域自适应技术,才能将其部署到特定场景或任务中[4, 5],而这往往又需要进一步的数据采集和标注步骤。

类似地,经典的机器人规划与控制方法通常需要对世界、智能体自身的动态以及其他智能体的行为进行仔细建模[6-8]。这些模型是为每个单独的环境或任务构建的,并且随着环境变化通常需要重新构建,这暴露了其有限的迁移能力[8];事实上,建立一个有效的模型可能要么过于昂贵,要么难以处理。尽管基于深度(强化)学习的运动规划[9, 10]和控制方法[11-14]有助于缓解这些问题,但它们仍然受到数据分布变化和泛化能力下降的困扰[15, 16]。

在与构建可泛化机器人系统所面临挑战的同时,我们注意到自然语言处理(NLP)和计算机视觉(CV)领域取得了显著进展——包括NLP领域引入的大型语言模型(LLM)[17],用于生成高保真图像和视频的扩散模型[18, 19],以及具备零样本/少样本泛化能力的大容量视觉基础模型(VFM)[20-22]、视觉语言模型(VLM)和多模态大模型(LMM)[23, 24],这些模型被统称为基础模型[25]。

这些大容量视觉和语言模型也已应用于机器人领域[26-28],有潜力赋予机器人系统开放世界感知、任务规划乃至运动控制能力。除了在机器人领域直接应用现有的视觉和/或语言基础模型外,我们还看到了开发更多机器人专用模型的巨大潜力,例如用于操作的动作模型[29, 30]、用于导航的运动规划模型[31],以及更通用的模型——能够通过视觉和语言输入生成动作,即视觉语言动作模型(VLA)[30, 32-34]。这些机器人基础模型在不同任务乃至不同本体上展现出了潜在的泛化能力。

本文的整体结构如图2所示。在第2节中,我们简要介绍了基础模型时代之前的机器人研究,并讨论了基础模型的基础知识。在第3节中,我们列举了机器人研究中的挑战,并讨论了基础模型如何可能缓解这些挑战。在第4节中,我们总结了基础模型在机器人领域的研究现状。最后,在第6节中,我们提出了可能对这一交叉研究领域产生重大影响的潜在研究方向。


尽管我们看到了视觉和语言基础模型在机器人任务中的有前景的应用,以及新型机器人基础模型的开发,但机器人领域的许多挑战仍然难以解决。从实际部署的角度来看,模型通常不可复现,缺乏跨本体的泛化能力,或者无法准确捕捉环境中什么是可行的(或可接受的)。此外,大多数出版物采用基于Transformer的架构,并侧重于物体和场景的语义感知、任务级规划或控制[30];而机器人系统中其他可能受益于跨领域泛化能力的组成部分却研究不足——例如,用于世界动力学的基础模型或能够执行符号推理的基础模型。最后,我们希望强调需要更多大规模的真实世界数据以及具备多样化机器人任务的高保真模拟器。

在本文中,我们探讨了基础模型如何作为通用机器人的潜在解决方案,旨在理解基础模型如何帮助缓解通用机器人所面临的核心挑战。我们使用“机器人基础模型”这一术语来包含两个不同的方面:(1)将现有的(主要是)视觉和语言模型应用于机器人领域,主要通过零样本学习和上下文学习;(2)利用机器人生成的数据,开发和利用机器人基础模型,特别是针对机器人任务的模型。我们总结了机器人基础模型相关论文的方法论,并对所调查论文的实验结果进行了元分析。本文主要组成部分的总结见图1。


1.2 相关综述论文

近年来,随着基础模型的普及,出现了各种关于视觉和语言基础模型的综述论文,值得提及[35-38]。这些综述论文涵盖了基础模型,包括视觉基础模型(VFM)[39, 40]、大型语言模型(LLM)[37]、视觉语言模型(VLM)[41, 42]和视觉内容生成模型(VGM)[35]。现有一些综述论文将基础模型与机器人相结合,其中最为相关的可能是[38, 43-47],但这些论文与我们的工作之间仍存在显著差异,例如:Yang等人[38]和Wang等人[44]关注的是广义定义的自主智能体,而非物理机器人;Lin等人[45]专注于用于导航的LLM;[46]中基础模型与机器人之间的联系较为有限。与[47]相比,我们提出了当前研究方法的细分解读,对实验进行了详细分析,并聚焦于基础模型如何解决通用机器人的典型挑战。与此同时,Firoozi等人[43]进行了一项关于机器人领域基础模型的综述。他们的工作和我们的工作都阐明了在机器人领域使用基础模型的机遇和挑战,并指出了进一步扩展这些模型的关键陷阱。他们的工作侧重于基础模型如何有助于提升机器人能力以及未来的挑战。相比之下,我们的综述试图将机器人能力与基础模型共同分类,以推动这些能力的发展。我们还提出了(机器人优先的)机器人基础模型与机器人领域中使用的其他基础模型之间的二分法,并对我们调查的论文进行了全面的元分析。

在本文中,我们提供了一篇综述,涵盖了应用于机器人领域的现有单模态和多模态基础模型,以及我们所知的各种机器人任务中所有形式的机器人基础模型。我们还将所调查论文的范围缩小至仅在真实物理机器人、高保真模拟环境或使用真实机器人数据集上进行实验的论文。我们相信,这样做有助于我们理解基础模型在现实世界机器人应用中的能力。

2 问题形式化与预备知识

在本节中,我们将机器人领域的基础模型总结为一个统一的问题形式化表述。我们将与机器人相关的基础模型定义为一个函数 f,该函数接收感官输入 xₜ 和上下文 c,并输出 yₜ 以完成下游机器人任务。

此处,x 表示感官输入,例如通过视觉相机获取的观测数据、文本场景描述、场景图、物体位姿和检测结果、通过麦克风获取的音频信号、触觉传感器信息等。对于多任务策略,我们需要上下文信息 c,用于表示任务规格说明[30]或关于本体的详细信息[48]。

状态 x 和上下文 c 通常分别定义为视觉观测和语言指令。然而,x 和 c 都可以是图像、视频、语言提示,或多种模态的组合。这也取决于我们如何定义环境的范围。

动作 y 可以定义为地图中目标物体的位姿、任务计划、下一状态、奖励函数,以及控制输出(如目标末端执行器位姿)。如果 y 是一个任务计划,我们通常假设该计划的底层组件可以被完美执行。然而,当底层计划未完全执行时,如何使机器人策略能够进行适当且及时的恢复,这仍然是一个开放性问题。

用于训练或提示模型 f 的数据存在若干开放性问题。在训练方面,应如何收集专家演示、离线数据或带有合适奖励函数的在线经验?在提示方面,什么样的指令和示例能够实现理想的上下文学习?模型应如何训练和微调?在接下来的章节中,我们旨在通过总结和分析现有研究工作来回答这些问题。

3 通用机器人面临的挑战

在本节中,我们总结了通用机器人系统面临的5个核心挑战,每个挑战将在以下各小节中详细阐述。尽管此前文献(第1.2节)中已讨论过类似的挑战,但本节主要聚焦于那些通过适当利用基础模型可能有望解决的挑战,且这些判断基于当前研究结果所提供的证据。我们还在本节中绘制了分类图(见图3),以便读者更方便地查阅。


3.1 泛化

机器人系统通常难以对其环境进行准确的感知和理解。计算机视觉、物体识别和语义理解方面的局限性使得机器人难以有效地与其周围环境进行交互。传统的机器人系统通常依赖于分析式的手工设计算法,这使得它们难以适应新的或未见过的情境。它们也缺乏将训练从一项任务泛化到另一项任务的能力,这进一步限制了它们在现实世界应用中的实用性。这种泛化能力还体现在规划和控制在不同任务、环境和机器人形态上的泛化方面。例如,经典运动规划器和控制器的特定超参数需要针对特定环境进行调参[49-51];基于强化学习的控制器难以跨不同任务和环境进行迁移[52-54]。此外,由于机器人硬件的差异,跨不同机器人形态迁移模型也具有挑战性[55, 56]。通过在机器人领域应用基础模型,泛化问题得到了部分解决,这将在下一节(第4节)中讨论。然而,跨不同机器人形态的泛化等进一步挑战仍然十分艰巨。

3.2 数据稀缺

数据一直是基于学习的机器人方法的基石。大规模、高质量的数据需求对于开发可靠的机器人模型至关重要。已有若干努力尝试在现实世界中收集大规模数据集,包括自动驾驶[1, 2, 57]、机器人操作轨迹[58-60]等。通过人类演示收集机器人数据是昂贵的[29]。机器人所面对的多样化任务和环境,使得在现实世界中收集充分且广泛的数据过程更加复杂。此外,由于安全方面的考虑[49],在现实世界环境中收集数据也可能存在问题。为了克服这些挑战,许多研究工作[61-66]尝试在模拟环境中生成合成数据。这些模拟提供了逼真的虚拟世界,机器人可以在其中学习并将其技能应用于现实生活场景。模拟还允许进行领域随机化,以及更新模拟器参数以更好地匹配现实世界的物理特性[49],从而帮助机器人开发通用的策略。然而,这些模拟环境仍然存在局限性,特别是在物体的多样性方面,这使得将学到的技能直接应用于现实世界情境变得困难。收集与现实世界中用于训练基础模型的互联网规模图像/文本数据规模相当的真实机器人数据尤其具有挑战性。一种有前景的方法是跨不同实验室和机器人类型进行协作数据收集[67-69],如图4所示。然而,对Open-X Embodiment数据集的深入分析揭示了其在数据类型可用性方面的某些局限性。首先,如图4a所示,用于数据收集的机器人形态是受限的;在73个数据集中,有55个专门用于单臂操作任务。只有一个数据集涉及四足运动,只有一个数据集涉及双臂任务。其次,如图4b所示,这些操作任务的主要场景类型是桌面设置,通常使用玩具厨房用具。这类物体带有固有的假设,包括刚性和可忽略的重量,这可能无法准确代表更广泛的现实世界场景。第三,如图4c所示,我们对数据收集方法的考察表明,人类专家参与占主导地位,主要通过虚拟现实(VR)或触觉设备实现。这种对人类专业知识的依赖凸显了获取高质量数据的挑战,并表明需要大量的人类监督。例如,RT-1机器人动作数据集需要17个月的收集时间,这凸显了在人类参与下积累数据所需的大量工作和时间投入。


3.3 模型与基元的需求

经典的规划和控制方法通常需要精心设计的环境和机器人模型。最优控制方法需要良好的动力学模型(即世界状态转移模型)[8, 70];运动规划需要环境地图[71]、机器人与之交互的物体状态[72]或一组预定义的运动基元[73];任务规划需要预计算的物体类别和预定义规则[74, 75]等。先前的基于学习的方法(例如模仿学习和强化学习)以端到端的方式训练策略,直接从感官输入获取控制输出[58],从而避免构建和使用模型。这些方法部分解决了依赖显式模型的问题,但它们往往难以在不同环境和任务中进行泛化。这引出了两个问题:(1)我们如何学习与模型无关且能良好泛化的策略?或者,(2)我们如何学习良好的世界模型,以便能够应用经典的基于模型的方法?我们看到最近一些工作旨在利用基础模型来解决这些问题(特别是以无模型的方式),这将在第4节中系统讨论。然而,对机器人世界模型的呼唤仍然是一个引人入胜的前沿领域,这将在第6节中讨论。

3.4 任务规格说明

理解任务规格说明并将其落实到机器人当前对世界的理解中,是获得通用智能体的关键挑战。通常,这些任务规格说明由用户提供,而用户对机器人认知和物理能力的局限性了解有限。这不仅引发了关于提供这些任务规格说明的最佳实践是什么的问题,也引发了关于如何自然且便捷地构建这些规格说明的问题。基于机器人对其自身能力的理解,理解和解决任务规格说明中的歧义性同样具有挑战性。基础模型是应对这一挑战的有前景的解决方案:任务规格说明可以表述为语言提示[26, 29, 30, 76]、目标图像[77]、策略学习的奖励函数[28, 78]等。

3.5 不确定性与安全性

在现实世界中部署机器人所面临的关键挑战之一来自环境和任务规格说明中固有的不确定性。根据来源的不同,不确定性可以分为认知不确定性(由知识不足引起)和偶然不确定性(环境中固有的噪声)。当机器人在测试分布中遇到不熟悉的情况时,认知不确定性通常表现为分布外错误。虽然采用基于学习的技术进行高风险安全关键领域的决策已促进了不确定性量化(UQ)和缓解方面的努力[79],但分布外检测、可解释性、可解读性以及对对抗性攻击的脆弱性仍然是悬而未决的挑战。不确定性量化可能成本过高,并可能导致下游任务性能次优[80]。鉴于基础模型的大规模过参数化特性,提供能够保持训练流程且对底层架构改动最小的不确定性量化方法,对于在不牺牲这些模型泛化能力的情况下实现可扩展性至关重要。设计能够对其行动提供可靠置信度估计,并进而智能地请求澄清反馈的机器人,仍然是一个未解决的挑战[81]。共形预测[82]提供了一种无需分布假设的方式,可为任何黑盒模型生成具有统计严格性的不确定性集,并已在机器人的视觉语言导航(VLN)任务中得到验证[83]。

在传统设定中,机器人领域可证明的安全性[84, 85]指的是一组控制技术,能够为机器人的安全边界提供理论保证。控制屏障函数[86]、可达性分析[87, 88]以及通过逻辑规范进行的运行时监控[89]是在有界扰动下确保机器人安全的知名技术。近期工作已探索利用这些技术来确保机器人的安全[90]。虽然这些贡献带来了安全性的提升,但解决方案往往会导致行为次优,并阻碍机器人在现实环境中的学习[91]。因此,尽管近期取得了进展,使机器人具备从经验中学习以微调其策略同时在新环境中保持安全的能力,仍然是一个悬而未决的问题。

4 当前研究方法论综述

在本节中,我们总结了当前机器人领域基础模型的研究方法论。

在第4.1节中,我们主要将机器人领域的基础模型分为两类进行讨论:机器人领域中使用的基础模型和机器人基础模型(RFM)。对于机器人领域中使用的基础模型,我们主要强调视觉和语言基础模型的零样本应用,即不进行额外的微调或训练。而在第4.2节中,我们则主要聚焦于机器人基础模型,这些方法可能使用视觉语言预训练初始化进行热启动,和/或直接在机器人数据集上训练模型。本节的详细分类见图5。


我们按照典型机器人系统(包含感知、规划和控制模块)的惯例来评述这些论文中所提出的方法。在此,我们将运动规划和控制合并为一个部分——动作生成,并将运动规划模块视为更高级别的动作生成,控制视为更低级别的动作生成。需要特别指出的是,尽管大多数工作将基础模型应用于机器人系统的不同功能模块,但我们将根据每篇论文贡献最大的模块将其归入相应类别。然而,视觉和语言基础模型的某些应用跨越了这些机器人模块,例如将这些模型在机器人中进行落地(grounding),以及从LLM和VLM生成数据。鉴于当前LLM的自回归特性,它们在处理长时程任务时常常力不从心。因此,我们还将深入探讨文献中提出的先进提示方法,以改善这一局限性并增强规划能力。我们在第4.1.4、4.1.5和4.1.6节中列出这些应用,作为分析这些工作的不同视角。

我们发现,第4.1节中的工作通常遵循模块化策略,即应用视觉和语言基础模型来服务于单一的机器人功能,例如将VLM作为开放集机器人感知模块,然后将其“插入”与运动规划器和控制器[27]协同工作。由于此类基础模型是以零样本方式应用的,因此在应用基础模型的模块与机器人系统中的其他模块之间没有梯度流动。相反,第4.2节中的工作大多遵循端到端可微分范式,这模糊了方法中典型机器人模块(如第4.1节所述;例如感知和控制[29, 92])之间的界限,有些机器人基础模型甚至提供了执行不同机器人功能的统一模型[32, 33]。

4.1 机器人领域中使用的基础模型

在本节中,我们聚焦于视觉和语言基础模型在机器人任务中的零样本应用,主要包括VLM在机器人感知中的零样本部署、LLM在任务级和运动级规划中的上下文学习,以及动作生成。

4.1.1 VFM和VLM在机器人感知中的应用

近年来,视觉和语言基础模型与基于几何和以物体为中心的世界表征的落地,推动了上下文理解方面的巨大进步,而这是机器人与现实世界交互的关键需求。我们将从不同角度全面审视VFM和VLM在机器人感知中的应用。


用于物体和场景表征的VFM、VLM

VLM在机器人中最直接的应用是利用其开放集物体识别和场景理解能力来完成机器人下游任务,包括语义建图和导航[27, 93-96]、操作[97-100]等。这些工作提出的方法具有一个共同特征:它们试图从机器人交互的物体和场景中提取语义信息(来自VLM)和空间信息(来自其他模块或传感器模态)。这些信息随后被用作场景语义地图或物体表征。

在语义建图和/或导航方面,NLMap[27]是一种开放集、可查询的场景表征,用于将LLM的任务计划落地到周围场景中。机器人首先使用基于前沿的探索方法探索环境,同时构建地图并提取类别无关的感兴趣区域,这些区域随后由VLM编码并聚合到地图中。然后,通过LLM解析自然语言指令,在场景表征地图中搜索这些物体的可用性和位置。ConceptFusion[95]从RGB-D输入和基础模型的特征构建开放集多模态3D地图,允许来自图像、音频、文本和点击交互等不同模态的查询。研究表明,ConceptFusion可应用于现实世界机器人任务,例如新物体的桌面操作和自动驾驶车辆的语义导航。类似地,CLIP-Fields[94]将场景的RGB-D图像编码为语言可查询的潜在表征,作为记忆结构中的元素,机器人策略可以灵活地检索这些元素。VLMap[93]使用LSeg[101]提取逐像素表征,然后与深度信息融合,以创建3D地图。这个语义3D地图随后被下投影以获得带有逐像素嵌入的2D地图;这些嵌入可以与LSeg的语言嵌入进行匹配,以获得2D地图的逐像素语义掩码。至于在拓扑图中应用VLM进行视觉导航,LM-Nav[96]是一个很好的例子:它使用LLM从自然语言指令中提取导航中使用的路标。这些路标描述以及图像观测,随后通过VLM落地到预构建的图中。然后,使用规划模块将机器人导航到指定的路标。

上述大多数先前工作仅利用物体和环境的2D表征。为了丰富基础模型在3D空间中的表征,F3RM[98]、GNFactor[99]和GeFF[102]通过结合(可泛化的)NeRF,将2D基础模型特征蒸馏到3D空间中。此外,GNFactor[99]还将这些蒸馏特征应用于策略学习。Act3D[103]采用了类似的方法,但通过感测的深度信息构建3D特征场。

用于状态估计和定位的VLM

除了上下文理解之外,一些方法探索了VLM的开放词汇特性用于状态估计[104, 105, 105-107]。其中两种方法,LEXIS[104]和FM-Loc[105],探索使用CLIP[23]特征执行室内定位和建图。具体而言,FM-Loc[105]利用CLIP和GPT-3提供的视觉语言落地能力来检测查询图像中的物体和房间标签,然后使用该语义信息将其与参考图像进行匹配。类似地,LEXIS[104]构建了一个实时拓扑SLAM图,其中CLIP特征与图节点相关联,实现了房间级别的场景识别。尽管这些方法展示了视觉语言特征在室内地点识别方面的潜力,但它们并未探索基础模型特征的广泛适用性。在此背景下,AnyLoc[106]探索了密集基础模型特征的特性,并将其与无监督特征聚合技术相结合,以大幅优势实现了最先进的地点识别——在任何地点、任何时间、任何视角下——展示了自监督基础模型特征在SLAM中的广泛适用性。进一步扩展,FoundLoc[107]将AnyLoc与VIO管道相结合,以执行视觉GNSS拒止环境下的定位。这项工作首次展示了VLM可以部署在资源受限的无人机(UAV)和嵌入式Jetson硬件上,用于野外状态估计。

用于交互式感知的VLM

若干工作考虑了使机器人能够利用交互式感知过程[108]的概念,用于推断关于物体属性的隐含知识,从而在下游交互式机器人学习任务中获得性能提升[55, 56, 109-116]。这种交互式感知过程通常模仿人类婴儿最初学习物理世界的方式——即通过交互,以及从对具有不同属性的物体进行物理探索性动作(如抓取、提起、放下、推挤)所产生的感官信息(触觉、听觉、视觉)中学习物体概念(如重量和硬度)的表征。其中,MOSAIC[115]利用LMM来加速获取统一的多感官物体属性表征;作者展示了其框架在零样本迁移条件下,即使在存在干扰物的情况下,在类别识别和模糊目标物体获取任务中仍具有竞争力的表现。UncOS[116]查询LVM以生成物体分割假设的分布。他们将假设转换为世界模型上的分布,并利用该分布来选择机器人的扰动动作,以实现物体分割的具身消歧。

4.1.2 LLM和VLM在任务规划中的应用

机器人领域的规划学界一直渴望拥有一个能够跨不同任务和环境进行泛化、且仅需极少演示即可完成机器人任务的模型。鉴于视觉和语言基础模型在复杂推理和上下文泛化方面已展现出的强大能力,机器人学界考虑将基础模型应用于机器人规划问题是顺理成章的。本节根据规划的粒度来组织相关工作,区分为任务级规划和运动级规划。我们将在本部分主要介绍任务级规划,而将运动规划留待下一部分与动作生成(第4.1.3节)一同介绍。

任务级规划是将一个复杂任务分解为小的可执行步骤。在此情况下,我们主要讨论智能体自主进行规划,而非例如将LLM用作解析器(如视觉语言导航[117]那样)。智能体需要通过与环境交互来采取智能的子步骤以达到目标。SayCan[26]是任务级规划的一个代表性示例:它使用LLM来规划高级任务,例如“我弄洒了饮料,你能帮忙吗?”。然后它给出具体的任务计划,如走到柜台、找到海绵等。类似地,VLP[118]旨在通过额外的文本到视频动力学模型来改进长时程规划方法。这些任务级规划方法无需担心子任务在环境中的精确执行,因为它们可以利用一组预定义/预训练的技能,然后使用LLM简单地找到合适的方式来组合技能以实现期望的目标。这一类别中还有更多论文,例如:LM-ZSP[119]将这种任务级粒度引入为可操作步骤;Text2Motion[120]使用类似思路并提高了基于语言的操作任务的成功率。先前的方法通常以文本形式生成任务计划。一些工作如ProgPrompt[121]、Code as Policy[122]、GenSim[123]等,使用LLM以代码生成的形式获得任务计划。[124]采用了不同的方法,从代码编写LLM中获取关系约束。使用代码作为高级计划的好处在于,它可以表达处理感知输出和参数化控制原语API的函数或反馈循环。此外,它可以精确描述物体的空间位置。这种改进的组合性节省了收集更多原始技能的时间。它还能根据上下文为“更快”和“向左”等模糊描述指定精确值(例如速度)。因此,由于这些优势,代码似乎比自然语言更高效、更有效的任务级规划语言。其他形式的规划技术,如以规划领域定义语言(PDDL)[125]表达高级计划,也显示出LLM在长时程任务上规划能力的显著提升,更多相关内容将在第4.1.6节讨论。

除了使用LLM直接生成计划外,它们还被用于结合外部记忆结构(如场景图)进行搜索和评估。SayPlan[126]采用3D场景图(3DSG)表示来管理广阔环境的复杂性。通过利用层次化的3DSG,LLM可以在多层住宅环境中语义搜索相关的子图,缩短规划范围,并整合经典路径规划以迭代地优化初始计划。Reasoned Explorer[127]使用LLM作为评估器,对二维无向图中的每个节点进行评分。它将该图用作地图,存储已访问点和前沿点的LLM评估。这些外部记忆和增量建图方法打破了使用LLM生成长期计划时的上下文长度限制,从而将基于LLM的导航智能体扩展到大型环境。需要注意的一点是,尽管任务级规划与物理具身无关,但在部署时确实需要落地到特定机器人的物理形态(或“形态学”)和环境;落地技术将在第4.1.4节中介绍。

4.1.3 LLM和VLM在动作生成中的应用

直接通过对现成的LLM/VLM进行提示来控制机器人可能具有挑战性,甚至可能无法实现,除非先用动作数据对这些模型进行微调。与高级机器人任务规划(其中利用LLM组合不同技能以完成任务的能力)不同,单个动作——无论是像航点这样的高级动作,还是像关节角度这样的低级动作——通常都不具有语义意义或组合性。学界正在尝试寻找合适的接口来规避这一问题。对于导航任务中的运动规划,ReasonedExplorer[127]和Not Train Dragon[128]提出了这样一种接口:使用LLM作为扩展前沿点的评估器,这些前沿点被定义为探索的潜在航点(通常在二维空间中);在这里,LLM的任务是根据给定观测与预期目标之间的相似度对前沿点进行评分。类似地,VoxPoser[129]应用VLM来获取用于运动规划的affordance函数(原论文中称为3D价值图)。

一些论文研究了使用LLM直接输出低级动作的可能性。Prompt2Walk[130]使用LLM通过从物理环境收集的少样本提示直接输出关节角度。它研究了LLM是否可以通过利用环境反馈数据(观测-动作对)进行上下文学习来充当低级控制器。SayTap[28]引入了一个新颖的概念,即利用足底接触模式作为动作表征。在该模型中,语言模型输出“0”表示无接触,“1”表示与地面接触,从而使大型语言模型(LLM)能够为四足运动任务(如跳跃和慢跑)生成零样本可执行命令。然而,这些方法对不同机器人形态的泛化能力仍然存疑,因为它们仅在四足平台上进行了测试。相比之下,机器人领域中的语言到奖励[78, 131-134]是一种比通过LLM直接生成动作更通用的方法;这些方法涉及使用LLM作为生成器,为基于强化学习的策略合成奖励函数,因此通常不受机器人具身的限制[78]。使用LLM的奖励合成方法可以生成人类难以设计的奖励,例如Eureka[78]表明它使机器人能够学习灵巧的转笔任务,而该任务在人类奖励设计下被认为是非常困难的。

4.1.4 动作落地(Action Grounding)

传统上,落地是指将抽象和上下文含义与感官信号相关联,例如识别图像中的物体[135]或识别音频中的声音[136]。这种感知模态中的“直接落地”形式已被广泛研究。然而,在机器人领域,落地扩展到了另一个关键维度:将抽象概念与可执行动作相关联。换句话说,它涉及将基础模型的输出转化为环境中有意义的改变。因此,在本综述中,我们聚焦于动作落地。

动作落地对于机器人与感官落地同样重要。为了使机器人与物理世界交互,基础模型需要一个桥梁,将其输出映射为可执行的行为,无论是显式地还是隐式地。

早期尝试将基础模型的输出或表征显式映射到机器人动作的方法[26, 48, 76, 130]相当直接。所使用的基础模型主要是大型语言模型,并且与传统机器人方法一样,它们采用了模块化概念,将机器人的初步技能进行分解。这些技能要么通过预训练策略获得,要么通过预编程脚本获得,并且整个技能库以自然语言描述给基础模型,从而允许LLM使用这些技能输出动作计划。最近在机器人抓取基础模型(如AnyGrasp[137])和其他开放知识模型(如CLIP[23]和SAM[22])方面的进展使这种方法更具吸引力。然而,它仍然需要解决两个瓶颈:首先,自然语言作为通用接口的局限性,因为自然语言所能描述的粒度是有限的。例如,如果你试图用语言描述如何用灵巧的机器人手玩翻花绳,语言可能难以准确描述。其次,如果我们希望模型泛化到不同任务,就需要更多预训练或预编程的技能,这使得扩展变得困难。

因此,研究人员正在探索不同的方法来解决这些问题。代码作为接口缓解了自然语言粒度的一些限制[121, 122],因为它可以直接描述物体用于抓取的x、y、z位置。其他新颖的接口试图直接将基础模型锚定到输出关节扭矩,从而绕开文本令牌等中间接口。一个值得注意的例子是Gato[32],它直接将模型的输出映射到Atari游戏动作空间和机械臂关节空间。Gato根据当前任务的上下文动态决定其输出格式——无论是文本、关节扭矩、按钮按下还是其他令牌。另一个相关的发展是RT-2[30],尽管它以文本形式指定了末端执行器空间,但它能够直接生成用于机器人操作器操作的可执行命令。SayTap[28]已尝试直接生成二值足底模式来控制四足运动任务。

在这种将模型落地到现实世界动作空间的想法基础上,诸如CLIP-Fields[94]、VLMap[93]和NLMaps[27]等方法将CLIP视觉和语义标签表征直接投影到3D点云上。通过将语义理解与空间信息对齐,这些方法为机器人应用创建了更具可解释性的3D地图。除了显式的3D建图之外,GLAM[138]使用强化学习通过与环境的交互来落地语言模型,表明LLM可以在文本环境中有效地充当RL智能体。此外,AutoRT[139]充当机器人车队执行任务的协调器,利用视觉语言模型[140, 141]进行场景描述,以提示LLM生成任务。

此外,研究人员正在尝试不同的接口来将基础模型的输出映射到动作。VoxPoser[129]将输出映射到3D价值图,然后使用经典优化技术计算机器人动作。这种方法为管道中的干扰增加了更多的鲁棒性,并允许模型操纵轨迹以实时添加安全约束和避开障碍物。除了价值图之外,使用约束也是实现在更多样化任务中落地的常用方法。几何约束用于计算避开障碍物并达到目标的可执行轨迹,而接触约束用于规划有力或接触密集的行为。ReKep使用关键点关系约束来表示几何约束和接触约束,将其表示为Python函数,将一组关键点映射到数值代价。每个关键点是任务特定的,并代表场景中具有语义含义的3D点。

虽然上面讨论了几种动作落地技术,但哪种方

法提供了最优解决方案尚无定论。预训练技能库在任务执行中提供了高水平的灵巧性和精度,但代价是任务多样性。相反,基于地图或基于约束的落地技术提供了更大的任务灵活性,但主要在更简单的2D夹爪拾取和放置任务上得到了验证,尚未在更灵巧、更复杂的动作上进行测试。如果我们将动作落地视为一个频谱,那么理想的接口应该在任务多样性和任务复杂性之间取得平衡,不仅在其能够执行的任务广度上表现出色,而且在这些任务的精细度上也是如此。

4.1.5 使用LLM和VGM生成数据

最近,我们见证了LLM和VGM内容生成能力的强大。利用这种能力,研究人员已开始尝试通过使用基础模型生成数据来解决数据稀缺问题。Ha等人[142]提出了一个“规模化扩展与蒸馏精简”的框架,该框架在给定自然语言指令的情况下,可以自动生成带有成功条件和语言标注的多样化机器人轨迹。Wang等人的RoboGen[143]通过在一个物理逼真的模拟环境Genesis中纳入自动动作轨迹提议,进一步增强了这种方法,从而实现潜在无限数据的生成。然而,这些方法仍然面临局限性:生成的数据在资产和机器人形态方面多样性较低,这些问题可以通过先进的模拟或硬件来改善。Wang等人的GenSim[123]提出在给定语言指令的情况下,使用LLM生成新颖的长时程任务,从而产生超过100个模拟任务,用于训练语言条件下的多任务机器人策略。该框架在模拟和现实世界中都展示了任务级泛化能力,并揭示了如何通过模拟程序将基础模型蒸馏到机器人策略中。Yu等人的ROSIE[144]使用文本引导的图像生成器修改机器人的视觉观测,在训练控制策略时进行数据增强。修改命令来自用户的语言指令,然后由开放词汇分割模型定位增强区域。RT-Trajectory[145]生成为策略网络提供条件的轨迹。轨迹生成也有助于机器人学习任务中的任务规格说明。Black等人[146]使用基于扩散的模型为操作任务的基于目标条件的强化学习策略[147]生成子目标。

4.1.6 通过提示增强规划和控制能力

Wei等人[148]提出的思维链(Chain-of-Thought)技术,迫使LLM在最终输出之外生成中间步骤。这种方法利用更宽的上下文窗口来显式地列出规划步骤,从而增强了LLM的规划能力。其有效性的根本原因在于GPT系列作为自回归解码器的特性。指令到步骤以及步骤到目标之间的语义相似性,比指令到直接输出之间的语义相似性更为显著。然而,思维链的顺序性质意味着单个错误步骤可能导致与正确最终答案之间呈指数级偏离[149]。

其他方法尝试通过在图[150]或树[151]结构中显式列出步骤来弥补这一缺陷,这些方法已展现出改进的性能。此外,诸如蒙特卡洛树搜索(MCTS)[152]和快速探索随机树(RRT)[127]等基于搜索的方法也已被探索用于增强规划能力。

此外,将目标规格说明从自然语言翻译成外部规划语言,例如规划领域定义语言(PDDL),也已被证明可以提高规划准确性[153]。最后,与开环提示风格不同,结合环境反馈的迭代提示方法为长期规划能力提供了更扎实、更精确的增强[33, 154]。

4.2 机器人基础模型(RFM)

随着包含真实机器人状态-动作对的机器人数据集日益增多,机器人基础模型(RFM)这一类模型同样变得越来越可行[30, 31, 67, 69, 155, 156]。这些模型的特点是使用机器人数据来训练它们,以解决机器人任务。在本小节中,我们总结并讨论了不同类型的RFM。

我们首先介绍能够根据单一机器人能力(例如感知、规划和控制)执行任务的RFM,这被定义为单用途机器人基础模型。例如,能够生成低级动作来控制机器人的RFM,或者能够生成更高级别运动计划的模型。随后,我们将介绍能够在多个机器人模块中执行任务的RFM,即能够执行感知、控制甚至非机器人任务的通用模型[32, 33]。

4.2.1 机器人动作生成基础模型

机器人动作基础模型可以接收原始的感官观测(例如图像或视频),并学习直接应用于机器人末端执行器的控制输出。此类别中的模型包括RT系列[29, 30, 67]、RoboCat[92]、MOO[157]等。根据论文的结果,这些模型在机器人控制任务(如操作)中表现出了泛化能力。

模仿学习模仿学习应用于机器人控制已有相当长的时间。最初,方法主要旨在模仿单一技能。利用模仿学习掌握多任务的概念(这也是本综述的焦点)随着[158, 159]的工作而出现。这种方法被称为单次模仿学习。采用各种条件来定义任务,包括机器人目标图像[158-165]、人类目标图像[16, 166, 167]、语言提示[16, 168, 169]和任务向量[170]等。最近的一项研究还调查了使用多模态输入作为任务描述符[171]。这些工作代表了这一方向的早期探索。近来,人们努力扩展这种方法,效仿大型语言模型的成功。Lynch等人[172]在数十万个带语言标注的轨迹数据集上采用行为克隆,以学习现实世界中的桌面块重排任务。Brohan等人[29]在超过13万集桌面重排片段上训练了一个大型Transformer模型,采用了更真实的设置和多样化的物体,展示了模仿学习算法在一些未见任务上的鲁棒性。RoboCat[92]和RT-X[67]使用来自多个本体的数据训练单一模型,在测试中显示出对未见本体的一定泛化能力。总体而言,这些努力主要在拾取和放置任务或其变体中取得了成功,表明存在进一步探索的巨大潜力。

规模化强化学习随着大规模机器人数据集的可用性,离线强化学习开始在开发有效的RFM中发挥重要作用。早期的规模化离线强化学习模型如QT-OPT[58]采用基于Q学习的方法,以离线方式从机器人农场收集的机器人数据中学习策略。QT-OPT的后续模型通过纳入多任务课程或预测信息将其扩展到多任务学习[15, 173, 174]。近来,随着Transformer模型的成功,基于Transformer的Q学习(Q-Transformer)也显示出其潜力[175]。PTR[176]是另一个有前景的工作,它在多任务学习环境中采用了保守Q学习(CQL)[177]。至于在线强化学习,由于探索空间巨大,大多数方法在模拟[178, 179]中训练视觉策略,然后将模型迁移到现实世界[180]。尽管如此,这一领域仍然具有挑战性,我们期待看到更多基于强化学习的机器人基础模型。

视觉和语言预训练动作基础模型的另一个方向涉及视觉或语言预训练[30, 181-187]。例如,受自监督视觉预训练强大泛化能力的启发,Radosavovic等人的MVP[184]通过掩码自编码器,在来自互联网和以自我为中心的视频数据集的真实世界图像和视频上训练视觉表征,并证明了扩展视觉预训练用于机器人学习的有效性。继这项工作之后,RPT[185]提出了使用真实机器人轨迹数据进行掩码预训练。VC-1[187]对基于视觉的预训练在策略学习中的有效性进行了全面研究。尽管这些视觉预训练方法效果显著,但[186]重新审视了其中一些方法并发现了显著的领域差距,因此提出了从头开始学习的方法。这为我们思考机器人领域中的视觉预训练提供了新的视角。

除了仅使用视觉信息外,RT-2[30]和MOO[157]使用视觉和语言预训练模型作为控制策略的主干网络。PaLM-E[33]和PALI-X[140]被用于将来自网络的知识迁移到机器人动作中。与先前方法略有不同,VRB[188]从大规模视频预训练中学习affordance函数(而非策略本身),这为我们研究RFM如何在现实世界任务中泛化提供了另一种思考方式。

与使用视觉或语言模态进行预训练的方法类似,我们也看到了利用音频[189]和触觉感知[190]等较少探索的模态进行自监督预训练。

机器人运动规划基础模型近来,我们看到了专门用于视觉导航任务中运动规划目的的RFM的兴起[31, 191, 192]。这些基础模型利用大规模异构数据的优势,在预测高级运动规划动作方面展现出了泛化能力。这些方法依赖于仅包含图像观测的粗略拓扑地图[31, 191],而非传统运动规划方法(如第3.3节所述)中所需的精确度量地图和精确定位。与应用于运动规划的视觉和语言基础模型不同,机器人运动规划基础模型仍处于相当早期的阶段。

4.2.2 通用机器人基础模型

开发通用机器人系统一直是机器人学和人工智能领域的终极目标。一些现有工作[32, 33]朝这一目标迈进了一步。Gato[32]提出了一个多模态、多任务、多本体的通用基础模型,能够玩Atari游戏、为图像添加描述、聊天、用真实机械臂堆叠积木等等——所有这些都使用相同的模型权重。与Gato类似,PaLM-E[33]也是一个用于机器人推理和规划、视觉语言任务以及纯语言任务的通用多模态基础模型。尽管尚未证明能解决我们在第2节中介绍的所有机器人任务,但Gato和PaLM-E展示了将感知和规划合并到一个单一模型中的可能性。此外,Gato和PaLM-E展示了使用相同模型解决各种看似无关任务的有前景的结果,突显了通用人工智能系统的可行性。专为机器人任务设计的PACT[193]提出了一个基于Transformer的基础模型,具有通用的预训练表征,可用于各种下游机器人任务,如定位、建图和导航。尽管我们尚未看到许多统一的机器人基础模型,但我们期望在这一特定问题上会有更多的努力。

4.3 基础模型如何帮助解决机器人领域的挑战

在第3节中,我们列出了机器人领域的五大挑战。在本节中,我们将以更有组织的方式总结基础模型——无论是视觉和语言模型还是机器人基础模型——如何帮助解决这些挑战。

所有与视觉信息相关的基础模型,如VFM、VLM和VGM,都被用于机器人领域的感知模块。另一方面,LLM更为通用,可应用于规划和控制。我们在此也列出了RFM,这些机器人基础模型通常用于规划和动作生成模块。我们在表1中总结了基础模型如何解决上述机器人挑战。从该表中我们注意到,所有基础模型在各种机器人模块的任务中都擅长泛化。此外,LLM尤其擅长任务规格说明。另一方面,RFM擅长处理动力学模型的挑战,因为大多数RFM是无模型方法。对于机器人感知,泛化能力和模型方面的挑战是耦合的,因为如果感知模型已经具有非常好的泛化能力,则无需为领域自适应或额外微调获取更多数据。此外,解决安全性挑战的需求在很大程度上是缺失的,我们将在第6节中讨论这一特定问题。


用于泛化的基础模型零样本泛化是当前基础模型最显著的特征之一。机器人领域在几乎所有方面和模块中都受益于基础模型的泛化能力。

对于第一个方面,即感知中的泛化,VLM和VFM是作为默认机器人感知模型的绝佳选择。第二个方面是任务级规划中的泛化能力,具体体现在由LLM生成的任务计划的细节上[26]。第三个方面是运动规划和控制中的泛化能力,通过利用RFM的能力来实现。

用于应对数据稀缺的基础模型基础模型在解决机器人领域的数据稀缺问题中至关重要。它们为用最少的具体数据学习和适应新任务提供了坚实的基础。例如,近期方法利用基础模型生成数据以帮助训练机器人,如机器人轨迹[142]和模拟数据[143]。这些模型擅长从少量示例中学习,使机器人能够利用有限数据快速适应新任务。从这个角度来看,解决数据稀缺问题等同于解决机器人领域的泛化能力问题。除此方面外,基础模型——尤其是LLM和VGM——可以为机器人领域生成用于训练感知模块的数据集[144](见上文第4.1.5节),以及用于任务规格说明[145]。

用于缓解模型需求的基础模型如第3.3节所述,构建或学习一个模型——无论是环境地图、世界模型还是环境动力学模型——对于解决机器人问题至关重要,尤其是在运动规划和控制方面。然而,基础模型所展现出的强大少样本/零样本泛化能力可能打破这一需求。这包括使用LLM生成任务计划[26],使用RFM学习无模型端到端控制策略[29, 175]等。

用于任务规格说明的基础模型以语言提示[26, 29, 30]、目标图像[77, 171]、人类演示任务的视频[199, 200]、奖励函数[28, 78]、粗略的轨迹草图[145]、策略草图[201]和手绘图像[202]等形式呈现的任务规格说明,已允许以更自然、更接近人类的形式进行目标规格说明。多模态基础模型不仅允许用户指定目标,还帮助通过对话解决歧义问题。最近在人机交互领域关于信任和意图识别方面的工作,为我们理解人类如何使用显式和隐式线索传达任务规格说明开辟了新的范式。尽管已取得重大进展,但近期关于LLM提示工程的研究表明,即使仅使用单一模态,生成相关输出也具有挑战性。视觉语言模型被证明尤其擅长任务规格说明,显示出解决机器人领域这一问题的潜力。扩展基于视觉语言的任务规格说明这一思想,进一步探索使用从互联网获取的图像等更自然的输入来实现多模态任务规格说明的方法。[29]通过提供一种新颖的模型类别(展现出有前景的可扩展模型属性),进一步探索了从任务无关数据中进行零样本迁移的思想。该模型将高维输入和输出(包括相机图像、指令和电机命令)编码为紧凑的令牌表征,以实现移动操作器的实时控制。

用于不确定性和安全性的基础模型尽管不确定性和安全性是机器人领域的关键问题,但使用基础模型来解决机器人领域的不确定性和安全性问题仍然研究不足。现有工作如KNOWNO[83]提出了一个用于测量和对齐基于LLM的任务规划器不确定性的框架。近期在思维链提示[203]、开放词汇学习[204]和LLM中的幻觉识别[205]方面的进展,可能为解决这些挑战开辟新的途径。

5 当前实验与评估综述

在本节中,我们总结了当前研究工作中使用的数据集、基准测试和实验。

5.1 数据集与基准测试

仅依赖于从语言和视觉数据集中学到的知识是具有局限性的。正如[206]和[115]在其关于物理接地VLM的工作中所指出的,一些概念(如摩擦力或重量)不易仅通过这些模态来学习。因此,为了使机器人智能体能够更好地理解世界,研究人员不仅正在从语言和视觉领域适配基础模型,还在推动开发大规模、多样化、多模态的机器人数据集,用于训练或微调这些基础模型。这一努力现在分为两个方向:从现实世界收集数据,又从模拟中收集数据然后迁移到现实世界。每个方向都有其优缺点。我们将在以下段落中介绍这些数据集和模拟器,并讨论它们各自的优缺点。

5.1.1 现实世界机器人数据集

现实世界的机器人数据集因其多样化的物体类别和多模态输入而极具吸引力,为训练机器人系统提供了丰富的资源,而无需进行复杂且往往不准确的物理模拟。然而,创建这些大规模数据集面临着重大挑战,主要是因为缺乏显著的“数据飞轮”效应。这种效应通过数百万互联网用户的贡献使CV和NLP等领域受益匪浅,但在机器人领域中则不那么明显。个人上传大量感官输入和相应动作序列的激励有限,这对数据采集构成了重大障碍。尽管存在这些挑战,当前的努力正集中解决这些差距。

RoboNet[207]是这一方向上一个值得注意的努力,它提供了一个跨不同机器人平台的大规模、多样化数据集,用于多机器人学习。Bridge Dataset V1[208]收集了7200小时的真实家庭厨房操作任务演示,其后续版本Bridge-V2[209]包含在24种环境中使用常见低成本机器人收集的60,096条轨迹。Language-Table[172]收集了600,000条带语言标注的轨迹——比先前可用的数据集大一个数量级。RT-1[29]包含130,000集数据,涵盖700多种任务,使用13台Google移动操作机器人组成的车队,历时17个月收集而成。虽然上述数据集代表了相对于此前实验室规模数据集的显著进步,提供了相对大量的数据,但它们仍局限于单一模态或特定的机器人任务。

为了克服这些局限性,近期的一些倡议取得了显著进展。例如,GNM[191]成功整合了六个不同的大规模导航数据集,利用基于航点的统一导航接口。近期由多个实验室合作发起的名为RT-X[67]的倡议,旨在通过使用7自由度末端执行器的位姿作为跨不同本体的通用参考,来标准化不同数据集之间的数据。为了提供更全面的数据来源,RH20T[68]收集了超过110,000集操作数据,涵盖7种本体,涉及超过140种多样的、接触密集的技能。模态包括RGB、深度、末端连杆力-扭矩、触觉、本体感觉、音频和语言指令。所有传感器均经过良好校准和同步。

在这些进展的基础上,现实世界机器人数据集的规模开始增长,尽管仍落后于互联网规模的巨量语言和视觉语料库。Hello Stretch Robot、Unitree四足机器人和开源灵巧操作器[210]等先进硬件的可获取性预计将催化这一增长。随着这些技术变得更加普及,它们很可能在机器人领域启动期望中的“数据飞轮”效应。

5.1.2 机器人模拟器

在我们等待机器人硬件广泛部署以收集海量机器人数据的同时,另一种方法是开发能够高度模拟真实世界图形和物理的模拟器。使用模拟的优势在于能够在模拟世界中部署成千上万个机器人实例,从而实现同步数据收集。

模拟器侧重于不同方面,如照片级真实感、物理真实感和人在回路交互。对于导航任务,照片级真实感模拟器至关重要。AI Habitat通过利用来自Matterport3D[211]和Gibson[212]数据集的真实扫描3D场景来解决这一问题。此外,Habitat[213]是一个允许AI智能体在各种逼真3D空间中导航并执行任务(包括物体操作)的模拟器。它具备多种传感器并处理通用3D数据集。Habitat 2.0[65]在原有基础上引入了动态场景建模、刚体物理和更高的速度。Habitat 3.0[66]进一步集成了可编程的人形角色以增强模拟体验。此外,AI2THOR模拟器[214]是另一个用于照片级真实感视觉基础模型研究的有前景的框架,如[93, 215]所示。其他模拟器,如Mujoco[61],专注于为高级操作和运动任务创建物理真实感环境。

此外,像AirSim[216]和Arrival自动驾驶赛车模拟器[50](两者均基于Unreal Engine构建)在合理的物理真实感和照片级真实感之间提供了平衡。最终,尽管上述模拟器在不同领域表现出色,但它们面临共同的挑战,如并行化问题。像Issac Gym[62]和Mujoco 3.0[217]等模拟器已尝试通过使用GPU加速来克服这些挑战,以加快数据收集过程。

尽管模拟器中数据丰富,但在其使用中存在固有挑战。首先,模拟与现实之间的领域差距使得从模拟到现实的迁移存在问题——早期工作已在寻求解决这一问题[49]。其次,环境和基础物体的多样性仍然不足。因此,为了在未来有效利用模拟,在这两个领域持续改进至关重要。

5.2 当前方法评估分析

我们对表2至表7以及图7中所列论文的实验进行了元分析,鼓励读者思考以下问题:

  1. 正在解决哪些任务?

  2. 它们是在哪些数据集或模拟器上训练的?使用哪些机器人平台进行测试?

  3. 正在使用哪些基础模型?任务解决的效果如何?

  4. 在这些方法中,哪些基础模型更常被使用?

我们总结了当前文献中关于所进行实验的几个关键趋势:

操作任务之间的关注度不均衡:对通用拾取-放置任务,特别是桌面操作和移动操作,存在显著的重点关注。这很可能是由于桌面夹爪式操作技能易于训练,且它们有潜力形成与基础模型交互的技能库。然而,对低级动作输出(如灵巧操作和运动)的广泛探索仍然缺乏。

需要改进泛化能力和鲁棒性:端到端机器人基础模型的泛化能力和鲁棒性仍有提升空间。在桌面操作中,使用基础模型在未见任务中导致性能下降21%[29, 129]至31%[30]。此外,这些模型仍需要提高对干扰的鲁棒性,在类似任务中性能下降14%[29]至18%[129]。

低级动作的探索有限:在直接输出低级动作方面仍存在空白。大多数研究聚焦于任务级规划,并利用具有预训练或预编程技能库的基础模型。然而,现有探索低级动作输出的论文[30, 32, 67]主要集中在桌面操作上,其中动作空间仅限于末端执行器的7自由度(DoF)。对于灵巧操作和运动等任务,直接输出关节角度的模型仍需更深入的研究周期。

控制频率过低,无法部署在真实机器人上当前大多数机器人控制方法都是开环的,即使是闭环方法在推理速度方面也面临限制。这些速度通常在1到10赫兹之间,对于大多数机器人任务而言被认为较低。特别是对于人形机器人运动等任务,需要约500赫兹的高频控制来实现机器人身体的稳定[218]。

缺乏统一的基准测试机器人领域在模拟、本体和任务方面的多样性导致了不同的基准测试,使得结果比较变得复杂。此外,虽然成功率常被用作主要指标,但它可能不足以评估涉及大型基础模型的现实世界任务的性能,因为仅凭成功率无法反映延迟。需要更细致的评估指标来考虑推理时间,例如计算感知成功率(CASR)[127]。

6 讨论与未来方向

6.1 剩余挑战与开放性讨论

机器人具身的落地(Grounding)尽管已有多种策略被探索来解决落地问题(如第4.1.4节所述),但该领域仍存在许多开放性挑战。首先,落地需要一个有效的媒介或接口来连接概念与机器人动作。现有接口,如采用自然语言[26, 33]和代码[121, 122]的接口,都存在局限性。虽然概念可以通过语言和代码来表达,但它们并不普遍适用于诸如灵巧身体动作等细微之处。此外,这些接口通常依赖于预定义的技能库,这些技能库不仅开发耗时,而且缺乏对新环境的泛化能力。使用奖励作为接口[78, 133, 134]可能通过动态获取技能来缓解模拟中的一些泛化问题。然而,在现实世界中训练强化学习算法既耗时又可能具有不安全性质,这引发了对该方法可行性的质疑,其有效性的现实世界验证尚未得到证实。

其次,我们需要从单一模态的落地概念(如将词语映射到含义)转向更全面的多感官模态落地。仅依赖视觉数据的方法[206]可能捕获某些物理属性,如材质、透明度和可变形性。然而,它们在理解摩擦等概念方面存在不足,这需要带有本体感觉反馈的交互数据,或者物体的气味,这需要嗅觉等其他模态才能获取。

最后,我们应该从具身角度考虑落地。同一任务可能根据机器人的具身形态需要不同的动作;例如,开门对于人形机器人和四足机器人所需的操作将截然不同。当前关于落地的研究通常强调环境适应,而对具身形态如何影响交互策略的考虑较少。

安全性与不确定性随着我们追求将真实机器人部署到工厂中与人类协同工作、提供老年人护理或在家庭和办公室中提供帮助,这些自主系统(及其驱动的基础模型)将需要更有效的安全措施。虽然正式的硬件和软件安全检查仍然适用,但利用基础模型来支持可证明的安全性分析将成为一个日益必要的研究方向。为了将机器人部署到安全关键场景,先前的工作已考虑利用Lyapunov风格的安全指数函数[88, 219, 220],试图为具有复杂动力学和外部扰动的非线性系统提供硬安全性保证(另见第3.5节)。传统上,可证明安全性文献所考虑的系统是低维的,通常需要仔细指定世界/动力学模型,需要指定初始安全集和/或集合边界距离函数,需要一些启发式方法和训练“技巧”来获得在保守性和性能之间取得平衡的有用安全价值函数,不能自然地支持多智能体场景,并且在线安全更新安全价值函数和扩展安全集方面存在挑战。Herbert等人[220]将几种技术综合到一个框架中——从而简化了计算,将安全集的更新比先前技术加快了一个或多个数量级,并将Hamilton-Jacobi可达性分析扩展到控制四旋翼的10维系统。Chen等人[88]将强化学习与HJ可达性分析相结合,从高维输入(RGB图像加上车辆状态)中学习安全价值函数,在联合优化的双演员-评论家框架内权衡面向性能的策略和面向安全的策略,用于模拟自动驾驶赛车。Tian等人[221]将HJ可达性分析整合到城市自动驾驶中多智能体交互的背景下,将问题表述为一般和Stackelberg博弈。

然而,在所有这些工作中,关于将社会可接受的安全约束和形式化保证整合到具有机器人基础模型的系统中,仍然存在开放性问题。其中一个方向是将安全表述为affordance[222]。安全的定义根据机器人的能力和社会背景而变化。安全的另一个焦点是确保机器人推断的任务规格说明与人类用户的沟通意图之间的稳健对齐。基础模型提供了一种编码海量世界知识的方式,这些知识可以作为常识先验来解码潜在的意图。近期工作通过共形预测[83]和显式约束检查[223]改进了LLM在机器人领域的应用。尽管取得了这些进展,基础模型目前缺乏对其输出相关不确定性进行推理的固有能力的支持。如果经过适当校准,基础模型中的不确定性量化可用于触发后备安全措施,如提前终止、预定义的安全机动或人在回路干预。

端到端方法与模块化方法之间是否存在二分法?人类大脑是学习和泛化功能方法的一个范例。虽然神经科学家已经识别出大脑的特定区域,如视觉皮层、体感皮层和运动皮层,但大脑表现出显著的可塑性,并能重组其功能以适应变化或脑损伤。这种灵活性表明,大脑可能是作为统一训练的结果而演化出模块化结构,结合了特定功能同时保持一般学习的能力[224, 225]。类似地,在“Bertology”中,NLP研究人员展示了训练后网络的局部部分如何能在某一领域比其他领域更加专门化。这表明大规模模型的某些模块可能高度专门化于特定功能,这些功能可以在不重新训练整个网络的情况下适应下游任务。这种迁移学习方法可以更有效地利用计算资源,并更快地适应新任务。

在机器人领域,过早地支持模块化或端到端策略架构可能会限制基础模型在机器人领域的潜力。模块化解决方案可以提供特定的归纳偏置并实现有效的任务特定性能,但它们可能无法充分利用一般学习和可迁移性的潜力。另一方面,端到端解决方案在CV和NLP的某些任务上有良好表现的历史,但它们可能无法提供适应新情况所需的灵活性。正如[226]所指出的,关于模块化与端到端之间的二分法似乎存在误解。这是因为前者属于架构范畴,而后者与优化相关——它们并非相互排斥。

关于机器人领域基础模型的架构和优化设计,我们可以专注于功能方法,而不是将其分类为模块化或端到端可微分的。机器人基础模型的目标之一是允许灵活的模块化组件,每个组件负责特定功能,并通过统一学习利用共享表征和一般学习能力。

对具身物理变化的适应性从用笔拨动电灯开关到在打石膏的断腿情况下下楼梯,人类大脑展示了多功能且适应性强的推理能力。它是一个控制感知理解、运动控制和对话能力的单一单元。对于运动控制,它能适应由于工具使用或受伤而导致的具身变化。这种适应性延伸到更深刻的转变,例如个人学习用脚绘画或使用专门假肢掌握乐器。我们希望在机器人领域构建这种交互式和适应性智能。

在之前的讨论中,我们看到了现有工作成功地将导航基础模型部署到各种机器人平台[31]上,如不同的轮式机器人和四足机器人。我们也见证了操作基础模型在不同操作器[30, 48]上的使用,这些模型可以跨不同机器人平台使用,从桌面机械臂到移动操作器。

一个关键的开放性研究问题是,机器人基础模型应如何实现跨不同物理具身的运动控制[198]。初步结果[198]显示了单一模型在不同具身中实现不同策略的可能性。

部署在家庭和办公室中的机器人策略必须对机械运动故障(如传感器故障或执行器损坏)具有鲁棒性,确保在具有挑战性的环境中持续运行。此外,机器人系统必须设计为能够适应各种工具和外设,反映人类为特定任务和物理工具使用而与不同仪器进行交互的能力。

世界模型,还是模型无关?在经典机器人学中,特别是在规划和控制问题中,通常会尝试尽可能多地建模机器人任务所需的世界信息。这通常通过利用任务的结构先验,或依赖启发式方法或简化假设来实现。当然,如果能够完美地建模世界,解决机器人问题将变得简单得多。不幸的是,由于现实世界的复杂性,机器人领域的世界建模仍然极其困难,有时甚至难以处理。因此,获得能够跨任务和环境泛化的策略仍然是一个核心问题。

本综述调查的基础模型大多采取模型无关(无模型)方法,利用大规模数据集和大规模深度学习架构的优势。一些例外试图通过直接使用LLM作为动态模型来模拟基于模型的方法。然而,这些尝试仍然受限于纯文本描述的固有局限性,并且容易出现幻觉问题,正如[127, 195]中所讨论的。许多研究人员[227]会认为,这些基础模型的数据规模化学习范式与人类和动物的学习方式仍有很大不同,后者的学习方式是极端数据高效和能量高效的。达到接近人类学习能力的联合性能和效率仍然是一个引人入胜的课题。在[227]中,LeCun认为解决这一难题的一个可能答案在于世界模型的学习——一个预测世界状态如何随着所采取行动的结果而改变的模型。

如果我们能够开发出通过严格的数学和物理建模来模拟世界表征精度的世界模型,那将使我们显著地更接近于解决和泛化机器人领域的复杂问题。这些精密且可靠的世界模型将使成熟的基于模型的方法得以应用,包括基于搜索和基于采样的规划,以及轨迹优化技术。这种方法不仅有助于解决机器人领域的规划和控制挑战,还能增强这些过程的可解释性。有人认为,追求一个具有卓越泛化能力和零样本学习能力的“基础世界模型”,有潜力成为该领域的一种范式转变的发展。并且我们已经看到,随着基于动作/语言条件视频生成[228, 229]的出现,“基础世界模型”的现实正越来越近。

新型机器人平台与多感官信息如图4以及表2至表7的元分析所示,用于部署基础模型的现有真实机器人平台主要局限于基于夹爪的单臂机器人操作器。从这些硬件系统执行的任务中可学习到的概念范围是有限的,主要是因为夹爪简单的张开和闭合动作易于用语言描述。为了使机器人达到与动物和人类相当的灵巧性和运动技能水平,或执行复杂的家务任务,基础模型必须获得对物理和 household 概念的更深入理解。这种学习需要更广泛的信息来源,例如多样化的传感器(包括嗅觉、触觉和热传感器),以及更复杂的数据,如来自高自由度机器人平台的本体感觉数据。

当前的灵巧操作器,例如Shadow Hand [230],价格极其昂贵且容易频繁故障,因此主要在模拟中进行实验。此外,触觉传感器在应用上仍然有限,通常仅限于指尖,如[231]所示,或仅提供低分辨率,如在机器人毛衣[232]中所观察到的。最近的进展已开始探索用于人形手部的全手高分辨率触觉感知[233]。

此外,由于大部分数据收集仍然通过人类演示进行,能够实现更精确和高效数据采集的平台,如ALOHA [234]、AirExo [235]和Leap Hands [210],正日益受到欢迎。因此,我们认为不仅是在软件创新方面,而且在硬件方面仍有重大贡献尚待做出。这些进展对于提供更丰富的数据收集,从而扩展机器人基础模型的概念空间至关重要。

持续学习持续学习广义上指的是在动态和变化的环境中学习和适应的能力。具体来说,它指的是能够随着时间推移,学习和适应底层训练数据分布以及不断变化的学习目标的学习算法。

持续学习具有挑战性,因为神经网络模型常常遭受灾难性遗忘,导致模型在先前任务上的整体性能显著下降。一种缓解灾难性遗忘导致性能下降的朴素解决方案是定期使用收集到的整个数据集重新训练模型,这通常使模型能够避免遗忘问题,因为该过程同时包含了旧数据和新数据。然而,这种方法需要大量的计算和内存资源。相比之下,仅在新任务或当前数据上进行训练或微调,而不重新访问先前数据,资源消耗较少,但由于模型倾向于覆盖先前学到的信息,会导致灾难性遗忘。这种遗忘可归因于旧数据和新数据之间的任务干扰、数据分布随时间演变产生的概念漂移,以及模型规模带来的表达能力限制。

此外,随着模型容量的增加,在不断扩展的数据语料库上持续重新训练变得愈发不可行。近期在视觉和语言持续学习方面的工作[236-239]提出了各种解决方案,但实现可应用于机器人领域的有效持续学习仍然是一个具有挑战性的目标。对于持续学习而言,大规模预训练基础模型目前面临上述挑战甚至更多,主要是因为它们庞大的规模使得重新训练更加困难。具体到机器人应用,持续学习对于机器人学习策略在不同环境中的可部署性至关重要,但它仍然是一个在很大程度上未被探索的领域。尽管近期一些工作研究了持续学习的各种子课题[240]——例如增量学习[241]、快速运动适应[242]、人在回路学习[243, 244]——但这些解决方案通常为单一任务/平台设计,且尚未考虑基础模型。

我们需要在机器学习基本原理和实际实时系统考虑基础上设计的持续学习算法。一些开放的研究问题和可行的方法是:(1) 在最新数据上微调时混合不同比例的先前数据分布以缓解灾难性遗忘[245];(2) 从先前分布或课程中开发高效原型以学习新任务[246]用于任务推理;(3) 提高在线学习算法的训练稳定性和样本效率[247, 248];(4) 识别将大容量模型无缝整合到控制框架中的原则性方法(可能通过分层学习[249-251]/快慢控制[252])以实现实时推理。

标准化与可复现性机器人学界需要鼓励标准化和可复现的研究实践,以确保已发表的发现能够被他人验证和比较。为了实现大规模的可复现性,我们需要弥合模拟环境与真实硬件之间的差距,并提高机器学习模型的可迁移性。Homerobot [100] 是朝着同时实现开放词汇拾取和放置任务的模拟和硬件平台迈出的有希望的一步。然而,我们需要建立标准化的任务定义和 affordance 来处理不同的机器人形态,从而实现更高效的模型开发。

模拟还是现实世界数据收集通往机器人基础模型的道路可能是多样化的。实现这一目标的一种方法是通过大规模的现实世界收集数据[67, 253]。然而,另一种方法是通过模拟数据并缩小模拟到现实的差距[254]。模拟的优势在于提供理论上无限量的数据,训练机器人学习策略时无需担心安全问题,以及通过并行化实现潜在的高效训练。在模拟上的大规模训练也已在机器人策略学习[255]和感知模型[256]中显示出良好的泛化能力。然而,构建现实世界的孪生版本也面临各种挑战。我们期待看到这两种方法在机器人基础模型方面的潜力。

面向工业场景的可部署性前述小节的讨论主要集中在学术环境,但机器人基础模型在改造非结构化工业环境(如建筑、石油和天然气、太阳能农场、矿山和农业)方面具有巨大潜力(见图8)。这些环境是动态的、大规模的,并且可能缺乏先验地图或外部通信(例如,可能无法使用GPS)。此外,危险材料、物理约束(如背景噪声)和有限的可见性(如口罩和头盔)构成了显著的人机交互挑战,在这些环境中必须解决这些新出现的问题。


基础模型有望通过使机器人能够在严苛的户外环境中导航和巡检,同时支持包括自动化数据分析[257]、用于可操作洞察的自然语言处理[258]、自动化文档编制、工地活动识别[259]、现场作业优化[260]和安全违规检测[261]在内的应用,从而彻底改变工业运营。例如,ConceptFusion[262]和Open-Fusion[263]实现了开放集多模态3D建图能力,这对于预定义物体类别不可用的动态变化的工业环境具有潜在价值。这些进展可以使机器人在非结构化环境中实现更灵活和自适应的性能。

然而,在工业环境中部署这些模型带来了独特的挑战。确保安全性和风险意识以满足严格的工业安全标准至关重要。工业机器人通常必须适应动态障碍物和情境、变化的地面条件、不平坦的坡度和天气条件,同时保持对潜在危险(包括重型机械)的感知,所有这些都必须由基础模型来管理。例如,在建筑环境中,由于项目持续开发,机器人必须在不断变化的场地中导航,同时做出安全关键的决策[264]。在采矿中,此类基础模型必须应对恶劣条件,包括低能见度、多变地形、高粉尘水平和不稳定表面[265]。这些现实世界环境的变异性意味着部署到此类环境中的基础模型必须在分布外条件下运行,这增加了不安全决策和错误输出的风险。例如,ConceptGraphs[194]可以利用3D场景图提供一个表示此类环境各个方面的框架,而受PlayFusion[266]启发的方法(使用非结构化/无引导的机器人交互数据的语言标注)有可能支持机器人获取与机械交互所需的技能。

由于现场可能存在网络限制和延迟,部署还需要边缘计算。这些移动机器人也受到计算资源的约束,需运行和收集数据以进行实时监控。模型量化[267]、蒸馏[268]和基于师生框架[269, 270]等技术有助于解决这些限制,不过在模型大小与性能之间取得平衡仍然是一个持续的挑战。

6.2 总结

在本综述论文中,我们基于两大类别分析了当前关于机器人领域基础模型的研究工作:(1)将基础模型应用于机器人任务的工作,以及(2)尝试利用机器人数据为机器人任务开发机器人基础模型的工作。我们梳理了这些论文的方法论和实验,并基于这些研究工作提供了分析和见解。此外,我们特别涵盖了这些基础模型如何帮助解决机器人领域常见挑战的内容。最后,我们讨论了尚未被基础模型解决的机器人领域剩余挑战,以及其他有前景的研究方向。

元分析表格

以下是针对第5.2节中提出问题的详细分析回答。我们按主题分类列出所有表格:操作任务见表2,灵巧操作见表3,移动操作见表4,运动任务见表5,导航任务见表6,多任务学习见表7。




原文链接:https://arxiv.org/pdf/2312.08782v3

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
记者拿副驾夺机质问爱尔兰主帅:你支持的人为何想杀以色列乘客?

记者拿副驾夺机质问爱尔兰主帅:你支持的人为何想杀以色列乘客?

桂系007
2026-10-04 16:54:08
iPhone 18 Pro Max彻底翻车,苹果社死了

iPhone 18 Pro Max彻底翻车,苹果社死了

李东阳朋友圈
2026-10-05 16:21:15
9月销量出炉,又是“一米穿五界”!网友:余承东不必尴尬,华为乾崑ADS车型已经遍地开花

9月销量出炉,又是“一米穿五界”!网友:余承东不必尴尬,华为乾崑ADS车型已经遍地开花

大白聊IT
2026-10-02 22:29:11
贾乃亮带甜馨迪拜出游!甜馨长到认不出!和贾乃亮搞怪自拍

贾乃亮带甜馨迪拜出游!甜馨长到认不出!和贾乃亮搞怪自拍

喜欢历史的阿繁
2026-10-05 00:15:37
王心凌的健身照绝了!这个状态,谁敢想她都44岁了?

王心凌的健身照绝了!这个状态,谁敢想她都44岁了?

小方说跑步
2026-10-03 19:20:06
中网16强对阵出炉,2-1,2-0,斯瓦泰克晋级,郑钦文下轮对手确定

中网16强对阵出炉,2-1,2-0,斯瓦泰克晋级,郑钦文下轮对手确定

南海浪花
2026-10-05 17:32:19
爱奇艺独播,38集年代刑侦大剧来袭!全演技派阵容,又有好剧追了

爱奇艺独播,38集年代刑侦大剧来袭!全演技派阵容,又有好剧追了

乡野小珥
2026-10-05 02:08:54
百年无解历史难题:为何百万大军无人割据?毛主席的智慧全是人性

百年无解历史难题:为何百万大军无人割据?毛主席的智慧全是人性

听雪禅
2026-10-05 16:40:07
太心酸了!42岁著名女歌手江苏走穴,宾客只顾吃席没人搭理

太心酸了!42岁著名女歌手江苏走穴,宾客只顾吃席没人搭理

小徐讲八卦
2026-02-12 12:13:20
开国上将晚年坦言:别再骂李德无能,草地分兵他救了红军

开国上将晚年坦言:别再骂李德无能,草地分兵他救了红军

利刃说史
2026-10-05 13:00:00
“滚回你们自己的国家!”日本42万穆斯林遭仇恨,风向彻底变了

“滚回你们自己的国家!”日本42万穆斯林遭仇恨,风向彻底变了

风流女汉
2026-06-15 15:52:33
饶颖:赵忠祥与我发生关系7年,他的特殊性癖,让我身心受到伤害

饶颖:赵忠祥与我发生关系7年,他的特殊性癖,让我身心受到伤害

林轻吟
2026-09-19 16:09:02
除了房子越来越不值钱外,2026年我国还将迎来4大“贬值潮”!

除了房子越来越不值钱外,2026年我国还将迎来4大“贬值潮”!

职场资深秘书
2026-10-05 11:38:09
54岁藤原纪香,从未活在美颜滤镜里

54岁藤原纪香,从未活在美颜滤镜里

草莓解说体育
2026-09-15 06:46:01
红薯正大量上市!研究发现:糖尿病吃一次红薯,等于给血糖添堵?

红薯正大量上市!研究发现:糖尿病吃一次红薯,等于给血糖添堵?

王医生健康讲坛
2026-10-05 20:40:06
港圈金牌经纪人霍汶希杂志同框女儿,干爹谢霆锋成焦点,亲生爸爸成最大问号

港圈金牌经纪人霍汶希杂志同框女儿,干爹谢霆锋成焦点,亲生爸爸成最大问号

草莓解说体育
2026-10-05 05:55:36
44岁姚笛独自在杭州豪宅家中煮泡面,眼神中难掩落寞

44岁姚笛独自在杭州豪宅家中煮泡面,眼神中难掩落寞

追影客栈
2026-10-03 16:08:17
最高法:回村定居的退休人员,有权重修祖宅或申请宅基地建房

最高法:回村定居的退休人员,有权重修祖宅或申请宅基地建房

智慧生活笔记
2026-10-01 09:54:07
19岁李嫣跟老爸聚餐!手不离烟动作熟练,170cm身材干瘪太像王菲

19岁李嫣跟老爸聚餐!手不离烟动作熟练,170cm身材干瘪太像王菲

一娱三分地
2025-08-14 13:28:27
笑死!北京会惩罚每一个过度规划的游客,网友:兵马俑都没你能走

笑死!北京会惩罚每一个过度规划的游客,网友:兵马俑都没你能走

夜深爱杂谈
2026-10-01 20:22:18
2026-10-05 22:43:00
CreateAMind incentive-icons
CreateAMind
CreateAMind.agi.top
1610文章数 21关注度
往期回顾 全部

科技要闻

2026年诺奖:三名科学家因光遗传学获奖

头条要闻

高市早苗新内阁遭"当头一棒":日农相丑闻被披露遭围攻

头条要闻

高市早苗新内阁遭"当头一棒":日农相丑闻被披露遭围攻

体育要闻

30天30队·热:扬尼斯、阿德巴约与克雷

娱乐要闻

蔡康永回应漏洞百出,太平轮旧事被扒

财经要闻

零跑声明切割!蔡康永两面人身份被抵制

汽车要闻

方程豹9月热销破4万 首款皮卡鲨鱼将于四季度上市

态度原创

游戏
亲子
教育
时尚
艺术

知名R18游戏《兰斯》新作全年龄版 男主见女人就亲

亲子要闻

今天我们来玩一个锻炼反应能力的小游戏

教育要闻

聪明的父母,大多是“农民思维”

帆布鞋,今年这样穿酷极了!

艺术要闻

北京出生,现年81岁!建筑大师参选日本市长职位

无障碍浏览 进入关怀版