网易首页 > 网易号 > 正文 申请入驻

面向真实世界智能体的具身基础模型

0
分享至

HY-具身-0.5:面向真实世界智能体的具身基础模型

HY-Embodied-0.5: Embodied Foundation Models for Real-World Agents

https://arxiv.org/pdf/2604.07430



摘要

我们推出HY-Embodied-0.5,这是一系列专为现实世界具身智能体设计的基础模型。为弥合通用视觉语言模型(VLM)与具身智能体需求之间的差距,我们的模型旨在增强具身智能所需的核心能力:空间与时间视觉感知,以及用于预测、交互和规划的高级具身推理。

HY-Embodied-0.5套件包含两个主要版本:一个专为边缘部署设计的高效模型,拥有20亿激活参数;另一个面向复杂推理的强大模型,拥有320亿激活参数。为了支撑具身任务所需的细粒度视觉感知,我们采用混合Transformer(MoT)架构以实现模态特定的计算。通过引入潜在令牌,该设计有效增强了模型的感知表征。为了提升推理能力,我们引入了一种迭代式、自我演进的训练后范式。此外,我们采用策略内蒸馏(on-policy distillation),将大模型的先进能力迁移至较小的版本,从而最大化紧凑模型的性能潜力。

在涵盖视觉感知、空间推理和具身理解的22项基准测试中进行的广泛评估,证明了我们方法的有效性。我们的MoT-2B模型在16项基准测试上超越了同等规模的最先进模型,而320亿参数的版本则达到了与Gemini 3.0 Pro等前沿模型相当的性能。在下游机器人控制实验中,我们利用强大的VLM基础训练了一个有效的视觉-语言-动作(VLA)模型,在现实世界的实物评估中取得了令人信服的结果。代码和模型已在 https://github.com/Tencent-Hunyuan/HY-Embodied开源。


1 引言

智能体(Yao等,2023;Park等,2023;Yang等,2024a;Xie等,2024)已在大语言模型(LLMs)(Google,2025;OpenAI,2025;Anthropic,2025;DeepSeek-AI等,2024)革命性进步的推动下,成为解决问题(Lu等,2024)和工作流自动化(Yang等,2024a;Wu等,2024b)的基础范式。这些智能体在从编程(Yang等,2024a)、个人助理(Wu等,2024b)到科学研究(Lu等,2024)等 diverse 应用中发挥着日益关键的作用。将智能体扩展到物理环境自然成为一个有前景的下一前沿。尽管视觉语言模型(VLMs)(Liu等,2023;Bai等,2023)近年来取得了实质性进展,但开发能够在物理和具身场景中无缝感知、推理和行动的VLM仍然是一个重大挑战。为了构建鲁棒的现实世界智能体,当前的VLM需要在两个主要维度上取得重大进展:(1)细粒度视觉感知:精确的细粒度视觉感知是理解物理世界并为具体行动做出明智决策的基本前提。然而,现有的VLM在捕捉物理基础所需的细节方面仍存在显著不足。(2)具身预测、交互与规划:主流VLM主要是在静态的、网络规模的数据集上训练的,在通用场景中表现出色,但针对具身环境的优化不足,缺乏在物理世界中进行动态预测、交互和规划所必需的行动导向能力。

在本报告中,我们介绍HY-Embodied-0.5,这是一系列专为现实世界智能体构建的基础模型。受将数字智能转化为物理智能这一目标的驱动,我们基于VLM范式(Liu等,2023)构建这些模型。我们相信,具身VLM独特地弥合了LLM智能体与物理智能体之间的鸿沟,使得大型语言和多模态模型的广泛开放世界知识能够被充分利用于现实世界任务。HY-Embodied-0.5系列实例化了两个主要版本:一个为实时响应和边缘部署优化的高效多模态混合Transformer(MoT)(Liang等,2024)模型(20亿激活 / 40亿总参数),以及一个为处理复杂视觉感知和具身推理任务而设计的强大混合专家(MoE)(Shazeer等,2017)模型(320亿激活 / 4070亿总参数)。通过在模型架构、数据整理和训练策略上的创新,我们系统地增强了模型在视觉感知和具身任务两方面的能力。我们的模型在广泛的感知和具身基准测试中取得了最先进的性能,其实际有效性在下游机器人控制任务中得到了验证。

评估在推动 HY-Embodied-0.5 的开发中发挥着核心作用。为了全面评估模型在视觉感知和具身任务中的能力,我们构建了一个包含 22 个公共基准测试的评估套件,涵盖视觉感知、空间推理和具身理解。我们的 HY-Embodied-0.5-MoT-2B 在 22 个基准测试中的 16 个上,相较于同等规模的通用型和专用型具身 VLM,取得了最佳性能。它在全部 22 个基准测试上的平均得分为 58.0%,分别超过了激活参数更多的通用型 VLM Qwen3-VL-4B (Bai 等,2025) 和专用型具身 VLM RoboBrain2.5-4B (Tan 等,2026) 达 10.2% 和 8.6%。值得注意的是,我们的具身模型在通用 VLM 理解任务上也达到了与广泛使用的开源模型 Qwen3.5 相当的性能,表明我们的模型兼具强大的泛化能力和强大的具身任务能力。我们最强大的 HY-Embodied-0.5-MoE-A32B 模型在 22 个基准测试上的平均得分为 67.0%,超越了前沿模型 Gemini 3.0 Pro (63.6%) (Google,2025)。这些结果有力地验证了我们在训练策略、数据构建和架构设计方面的有效性。

本报告对 HY-Embodied-0.5 进行了全面介绍。报告其余部分结构如下:第 2 节详细说明模型架构及其背后的设计原理。第 3 节介绍预训练阶段的数据构建细节、训练方案和训练策略。第 4 节详细阐述全面的训练后流程,涵盖 SFT 和 RL 阶段的数据设计原则与训练策略,以及迭代式训练后过程和大模型到小模型蒸馏的具体细节。第 5 节呈现全面的定量和定性结果,验证 HY-Embodied-0.5 在各种视觉感知和具身任务上的优越性能。第 6 节介绍我们将基础 VLM 应用于下游机器人控制任务的实践,展示我们的 VLA 模型在现实世界控制场景中的强大效果。

2 模型架构

HY-Embodied-0.5 建立在通用的 VLM 范式之上,其架构包含一个视觉编码器和一个大型语言模型。为了增强模型的视觉感知能力,我们针对边缘版本(即 HY-Embodied-0.5-MoT-2B)引入了若干架构改进,使其在更好理解视觉输入的同时,实现视觉与语言能力之间更优的平衡。

首先,我们训练了一个高效且强大的、针对边缘设备部署优化的原生分辨率视觉Transformer(ViT)(Dosovitskiy 等,2020;Dehghani 等,2023)。作为 HY-ViT 系列(Hunyuan Vision Team 等,2025)的高级迭代版本,该模型原生支持任意分辨率输入,并通过从更大的内部模型中蒸馏知识,在轻量化的参数规模下实现了准确、鲁棒的感知。其次,我们采用了混合Transformer(Mixture-of-Transformers)架构(Liang 等,2024)以实现模态自适应计算。通过专门为视觉分支引入非共享参数,我们显著提升了视觉性能,同时减轻了因大量视觉训练而常导致的语言能力退化。我们进一步为视觉组件设计了独立的完整注意力机制,并应用了辅助视觉监督,以促进更好的视觉建模。最后,受潜在思维(Zelikman 等,2024;Pfau 等,2024)和视觉寄存器(Darcet 等,2023)近期进展的启发,我们在每个视觉输入序列的末尾附加了专用的视觉潜在令牌。通过专门设计的监督,这些令牌进一步提升了模型的整体感知能力。整体架构如图2所示。


2.1 HY-ViT 2.0:高效的原生分辨率视觉编码器

ViT 模型是将 LLM 适应多模态场景的基础构建块。它将视觉输入投影到语言嵌入空间,使 LLM 能够无缝处理视觉和文本输入。HY-Embodied-0.5 中使用的 ViT 模型是 HY-ViT 的升级版本。在原生支持任意分辨率输入的基础上,HY-ViT 2.0 使用了更大规模的预训练数据,引入了一个小型 LLM 来提供语言监督信号,并整合了视觉重建监督,以确保输入到 LLM 的视觉信号信息损失最小。为确保在边缘设备上的实时性能,我们为 HY-Embodied-0.5 配备了一个 4 亿参数的 ViT 模型,并通过从更强大的内部 ViT 进行蒸馏来训练它,这有助于我们的模型获得高效且准确的视觉表征。此外,我们还训练了一个更大版本的 ViT,以生成既能用于理解又能用于重建的离散视觉表征。该表征的码本大小为 2k,并将每 8×8 的图像块压缩为单个离散码。我们使用这种离散表征来监督模型视觉令牌的输出。更多细节见第2.2节。

2.2 使用混合Transformer的模态自适应计算

自适应计算架构已在大型语言模型(LLM)和视觉语言模型(VLM)中得到广泛应用,通常通过混合专家(MoE)和混合Transformer(MoT)策略,在计算效率与性能之间实现了有效平衡。我们将 MoT 架构融入我们的模型。通过为语言令牌和视觉令牌引入非共享参数,我们提升了视觉建模能力,同时减轻了因大量视觉训练导致的模型固有语言能力退化。我们发现这一策略对小规模边缘模型尤为有效,因为它使原本有限的总参数量翻倍,同时对训练和推理效率的影响微乎其微。具体而言,在多模态训练开始之前,我们复制了语言模型的前馈网络(FFN)和 QKV 参数,并使用预训练 LLM 的权重来初始化这些复制的参数。在前向传播过程中,ViT 输出的所有视觉令牌均使用这组复制的参数进行计算,而文本令牌则使用原有的文本特定参数进行计算。

除了采用MoT架构之外,我们还做了进一步的改进,以更好地建模视觉输入。如图3所示,我们为视觉令牌和文本令牌设计了不同的注意力掩码模式。由于视觉数据缺乏语言序列所具有的单向性特征,我们发现双向注意力更有利于视觉建模,而在使用MoT架构时,这一点变得更加自然。此外,考虑到多模态数据中超过一半的令牌是视觉令牌,我们引入了一个视觉下一码预测任务,以更好地优化MoT中的视觉分支并提供更强的监督信号。具体来说,使用来自较大ViT的离散视觉表征作为监督,我们在视觉分支的LLM输出特征上应用一个MLP模块,来预测下一个图像块的离散码(见图2中的视觉损失)。这些设计使MoT能够实现更好的视觉建模,有效提升了模型的整体视觉能力和在细粒度感知任务上的表现。


2.3 连接视觉与语言的视觉潜在令牌

受潜在思维(Zelikman等,2024;Pfau等,2024)和视觉寄存器(Darcet等,2023)近期进展的启发,我们发现,在每个视觉元素(例如,一张图像或一个视频帧)末尾附加一个可学习的视觉潜在令牌,有利于提升小型VLM的能力。此外,在预训练阶段,我们使用来自大型ViT的全局特征来监督该令牌的输出特征,这进一步提升了模型性能(见图2中的全局损失)。我们观察到,这个视觉潜在令牌有效地连接了视觉和文本内容。对其功能更直观的理解可参见图12的可视化结果。

3 预训练

基于HY大型语言模型(Hunyuan-1.8B,Tencent Hunyuan Team,2025),我们的训练流程从训练的最初阶段就融入了对物理世界的理解。具体来说,在初始的大规模预训练阶段,我们引入了一个多样且广泛的视觉感知数据语料库——涵盖2D和3D视觉定位、深度估计和图像分割。这种早期的融入从根本上增强了模型感知和解读复杂物理环境的能力。在此之后,一个有针对性的中期训练阶段将模型的能力与下游具身需求对齐。通过将丰富的具身和空间数据集与通用领域数据混合,我们有效增强了模型的空间认知能力以及在现实世界智能体应用中的复杂推理能力。

3.1 预训练数据

我们整理了一套多样化且高质量的视觉语言数据集,以构成我们的预训练和中期训练混合数据。具体来说,数据组成整合了低级视觉感知数据,以及专为具身任务和空间认知构建的专用数据集。为构建整体训练语料库,这些专门的、领域特定的数据源与大规模通用理解数据直接结合。

3.1.1 视觉感知数据

全场景检测(Omni-Detection)。我们整理了一个包含2D和3D检测数据的全场景检测数据集,以增强模型的视觉定位和物体识别能力。源图像来自大规模数据集,包括OpenImages (Kuznetsova等,2020)、Objects365 (Shao等,2019)、RefCOCO (Yu等,2016)、SA-1B (Kirillov等,2023)等。对于具有高质量标注的样本,我们直接将现有标签转换为统一的检测格式。对于无标注数据或标注质量较低的数据,我们采用自动标注流程:首先利用VLM识别物体,然后结合SAM (Carion等,2025)与VLM定位来确定其坐标。随后部署一个更强的VLM教师模型来验证这些生成标注的准确性。检测任务涵盖物体标记以及2D和3D边界框预测。我们共获得6200万条全场景检测数据。在我们的实现中,所有坐标均归一化为0到1000的整数,并以固定输出格式表示。

深度估计(Depth Estimation)。深度估计,包括绝对深度和相对深度,是具身VLM感知物理环境的关键渠道。我们从大规模室内外3D数据集以及自动驾驶语料库中获取基于传感器的真实值,以基于特定图像坐标构建问答对。为确保数据质量,我们的点采样策略明确排除了位于物体边界、无穷远处或物理不一致区域内的像素。为促进跨不同来源的有效数据融合,我们归一化了所有图像的相机焦距,从而标准化了深度测量的尺度。除绝对度量深度外,我们还基于现实世界距离生成了大量相对深度数据,以增强模型全面的空间理解。此过程产生了一个包含约3600万个样本的专用数据集。

分割(Segmentation)。对于语义分割,我们从SA-1B数据集 (Kirillov等,2023) 中获取高分辨率、高质量的分割图。鉴于SA-1B标注密集且高度详细,我们应用了过滤流程来移除过小、过大以及高度碎片化的物体掩码。在获得精炼的二进制掩码矩阵后,我们采用PaliGemma (Beyer等,2024) 建立的方法论。具体来说,我们扩展了分词器词汇表以编码这些掩码,将其转换为格式化的、适用于VLM预测的结构化问答对。该流程产生约500万个分割样本,旨在增强模型的细粒度视觉感知和边缘感知能力。

指向与计数(Pointing and Counting)。物体指向和计数对于VLM来说是公认的具有挑战性的任务,常常导致枚举错误和空间幻觉。然而,精确的点级感知对于细粒度的具身操作至关重要。为明确强化模型的全面物体理解能力,我们制定了一个专门的、高难度的指向与计数数据集。具体来说,我们从开源数据集如Pixmo-Points (Deitke等,2025) 中获取真实点标注。为确保足够的任务复杂度,我们有意识地从中筛选和选择了包含高密度目标物体的场景。我们获得了约1100万条物体计数和指向数据用于训练。

3.1.2 以具身为核心的数据

为了构建具身数据集,我们整合了开源标注数据以及在现实环境中记录的自视角机器人操作序列。为系统性地满足物理智能体的操作需求,我们将数据组织成一个三层级结构:具身感知、语义理解以及高级规划与操作。感知层级建立基础的空间和物理意识;语义层级将视觉输入与上下文推理相连接;规划层级则为序列决策和动作执行提供监督。

视觉定位(Grounding)。视觉定位为具身执行提供了基础的空间指导。在大规模感知预训练的基础上,我们纳入了与物理操作直接对齐的场景。该数据集整合自开源数据集,包括 Molmo (Deitke 等,2025)、RoboPoint (Yuan 等,2024) 和 RefSpatial (Zhou 等,2025),以及我们内部的标注数据。定义的任务涵盖点级物体定位、边界框预测和指代表达理解。在数据筛选和标注过程中,我们分离出对具身操作至关重要的元素,例如目标交互物体和机器人操作器本身。这种有针对性的选择明确强化了模型在操作环境中的空间识别能力。

可供性(Affordance)。可供性预测将视觉定位与用户指令相结合,要求更高层次的任务理解。我们从已有的可供性基准测试中获取训练数据,包括 RoboAfford (Hao 等,2025) 和 ShareRobot (Tan 等,2026)。此外,我们重新利用了现有具身定位数据的一个子集。具体来说,我们采用 VLM 生成上下文适当的用户指令,直接将原始的空间定位标注与这些生成的操作命令配对。

轨迹(Trajectory)。轨迹预测对于具身任务中的内部规划至关重要;然而,此类数据的效用受到路径点密度和空间精度等因素的制约。我们从开源数据集中获取标注的轨迹数据,包括 MolmoAct (Lee 等,2025)、ShareRobot (Tan 等,2026) 和 FSD (Yuan 等,2025)。此外,我们通过采用追踪模型 cotracker3 (Karaev 等,2025) 来追踪机械臂或智能体的位置,从大规模具身操作视频片段 (Wu 等,2024a;O'Neill 等,2024;Khazatsky 等,2024) 中提取实际运动轨迹。对于这些提取的轨迹,我们保留视频的第一帧作为问答对的视觉输入。然后,将提取的序列下采样至最多 15 个路径点,并可视地绘制在图像上。最后,我们部署一个更强的 VLM 评判器来评估这些绘制轨迹的准确性,并据此筛选数据。

理解(Understanding)。具身理解是 VLM 多层次能力的综合体现,涵盖基础空间认知、任务状态评估、规划策略制定以及图像内标注的解读。我们从开源数据集中获取大量问答数据,包括 Robo2VLM (Chen 等,2025)、RoboVQA (Sermanet 等,2024)、RoboRefit (Lu 等,2023) 和 RoboInter-VQA (Li 等,2026)。为构建最终的理解数据集,我们严格依据数据质量和标注准确性对这些原始问答对进行筛选。

规划(Planning)。具身规划要求模型评估当前执行状态并理解目标任务目标。为构建此数据集,我们使用 VLM 对机器人操作视频片段 (Wu 等,2024a;Bu 等,2025;Wu 等,2025) 中的主要任务进行标注。然后,我们对这些视频进行时间分割,以提取后续动作的真实标签。将得到的分段格式化为查询-响应对,提示模型预测未来的动作序列。此外,我们在用户指令中明确定义任务约束,以增强模型的指令跟随能力。最后,我们使用来自 RoboVQA (Sermanet 等,2024) 和 RoboInter (Li 等,2026) 等数据集的开源规划问答对来补充这些生成的序列。

推理(Reasoning)。为将模型能力扩展到标准操作指令之外,我们在现实世界的具身环境中构建了一个复杂的内部推理数据集。该语料库专门针对需要长时程推理的场景。问题范围包括动作排序、多图像动作理解、未来状态预测、视觉谜题解决和直观物理推理。

3.1.3 以空间为核心的数据

以空间为核心的数据侧重于从视觉观测中理解和推理三维环境。与强调智能体-环境交互的以具身为核心的数据不同,以空间为核心的数据针对的是感知几何结构、建立视觉对应关系以及推理空间关系的基础能力。我们将以空间为核心的数据分为五类:对应关系、几何、配置、测量和动态。原始数据来源于 ScanNet (Dai 等,2017)、ScanNet++ (Yeshwanth 等,2023)、ARKitScenes (Baruch 等,2021) 以及我们自行收集的数据。

对应关系(Correspondence)。对应关系数据建立不同视角、不同帧或不同表征空间(例如,2D 到 3D)之间视觉元素的关联。这种能力是多视角理解的基础,并作为下游空间推理任务的基础。我们的对应关系数据包含两种主要形式:(1)跨帧点匹配,识别时间相邻帧之间的对应点,公式化为基于坐标和基于视觉标记的问答对;(2)2D-3D 实例映射,将图像空间中的 2D 边界框与场景表示中的 3D 实例标识符相关联。我们利用已定位的 RGB-D 序列,其中相机内参和外参可实现坐标系间的精确投影。数据生成流程首先计算采样帧的可见性信息,然后生成使用显式坐标或叠加在图像上的视觉点标记来查询点对应关系的问答对。

几何(Geometry)。几何数据捕捉场景的三维结构,包括深度关系和空间范围。我们专注于深度感知任务,这些任务要求理解相对于相机视点的相对和绝对距离。几何数据包括:(1)深度估计,模型预测由坐标或视觉标记指示的特定点的深度;(2)深度比较,模型判断两个指示点中哪一个离相机更近或更远。两种表述形式——基于坐标和基于视觉点标记——都被纳入,以评估不同的输入模态。该流程采样具有足够深度差异(通常 >0.3米)的点对,以确保标注明确无误。

配置(Configuration)。配置数据涉及场景中物体的空间排列和关系。此类别涵盖静态空间理解,不涉及明确的度量测量。我们生成了四种类型的配置问答对:(1)物体计数,查询特定类别或类别组合的实例数量;(2)相对距离识别,确定候选集中哪个物体最接近参考物体;(3)相对方向确定,识别目标物体相对于观察者位置和朝向的方向关系(左、右、前、后);(4)距离排序,按与参考物体的接近程度对多个物体进行排序。数据来源于 3D 边界框标注和实例分割。对于相对方向任务,我们在 2D 地平面计算观察者前向向量与查询向量之间的夹角,并过滤排除角度差异不明确的模糊情况。

测量(Measurement)。测量数据要求对空间量进行精确的度量估计。与侧重于相对关系的配置数据不同,测量任务需要以物理单位输出数值。我们包含三种测量类型:(1)物体尺寸估计,预测物体的最长维度(以厘米为单位),源自定向 3D 边界框的最大轴长度;(2)绝对距离计算,测量两个物体之间的欧氏距离(以米为单位),计算为其 3D 边界框之间的最小距离;(3)房间尺寸估计,预测总建筑面积(以平方米为单位)。这些任务从具有校准 3D 重建的场景中生成,确保了度量准确性。我们应用过滤来排除距离任务中距离过近的物体对(<0.2米),并将尺寸查询限制为具有唯一实例的物体以避免歧义。

动态(Dynamics)。动态数据捕捉空间环境中的运动和时间变化,包括相机自身运动(ego-motion)和物体运动。对于相机动态,我们生成描述帧间空间变换的数据,包括相对旋转和平移模式。该流程首先计算帧到帧的几何关系并将其存储为结构化格式,然后生成查询相机运动特征的问答对。对于物体动态,我们利用视频序列中的密集 3D 点轨迹,标注包含 3D 坐标、可见性标志和相机外参。问答对使用基于坐标或基于视觉标记的表述来查询物体运动模式。

3.1.4 通用理解数据

我们整合了大量的内部通用 VLM 数据,以建立模型的基础推理和理解能力。这个多样化的语料库被系统地分类,以针对几个核心领域:通用语义(例如,图像描述和世界知识)、STEM 能力(例如,数学、编码和科学推理)、细粒度视觉解析(例如,文档理解、图表和 OCR)、复杂问题解决(例如,逻辑推理、多轮对话、多图像上下文和复杂指令跟随)以及智能体操作(例如,GUI 导航)。为优化学习进程,我们根据规模和标注质量将这些通用数据集划分为两个不同的子集,分别分配给预训练和中期训练阶段。在这两个训练阶段中,这些广泛领域的数据集都与专门的具身语料库联合训练,确保在具备先进的物理世界能力的同时,保持稳健的基础性能。

3.2 训练方案

如图4所示,我们的训练方案分为两个连续阶段。


第一阶段是大规模预训练,模型在包含超过6000亿个令牌的海量多模态语料库上进行优化,以建立基础的视觉-语言对齐。

在此阶段之后,模型进入专门的中期训练阶段。在第二阶段,模型在约2500万个数据样本的精心配比的混合数据上进行训练,该混合数据无缝整合了前述的具身、空间和通用理解数据集。

预训练。在此阶段,训练语料包含 3890 亿个通用理解数据令牌和 2360 亿个具身与感知数据令牌。在后者中,空间和机器人数据占 43%,视觉感知数据占其余部分。我们将具有同质模式的大规模数据分配到该预训练阶段,而将更细粒度的数据保留给中期训练阶段。我们设置基础学习率为 5e-5,ViT 学习率为 5e-6,权重衰减为 1e-4,全局批量大小为 256。训练样本根据每个问答对的长度打包,最大上下文长度为 32k 个令牌。ViT、MoT 模块和视觉潜在令牌的参数均可训练。ViT 和视觉令牌的梯度每五步更新一次。


具身-空间中期训练。在具身-空间中期训练阶段,我们引入了更高质量、更复杂的具身和空间数据,涵盖约 3000 万个实例。我们以 12:5:3 的比例混合通用理解、具身和空间数据,并统一所有提示模板和坐标格式。在此阶段,我们应用了针对不同变体的数据策略:对于 MoT-2B 模型,我们使用长推理链和短推理链的混合,通过 \think 和 \no think 令牌(遵循 Qwen3-VL)加以区分;相反,对于 MoE-32B 模型,我们仅使用短链数据,以专注于具身微调。在训练期间,我们保留了预训练阶段的序列打包方法和初始学习率,同时引入了余弦学习率衰减。我们冻结所有 ViT 参数,仅更新 HY-Embodied-0.5 模块。

3.3 训练策略

基于我们的混合Transformer(MoT)设计,我们采用了视觉损失、全局损失和标准 LLM 损失,分别用于监督视觉令牌、潜在令牌和语言令牌。对于视觉下一码预测任务,我们在视觉分支的预测对数上应用交叉熵损失。设 Nv 表示视觉令牌的数量,p_i 为第 i 个令牌的预测概率分布,zi 为由教师 ViT 生成的目标离散码。视觉损失公式如下:





4 训练后(Post-training) 4.1 监督微调(Supervised Fine-tuning) 4.1.1 数据构建

在监督微调(SFT)阶段,我们侧重于强化模型的长链推理能力。我们从前述的空间、具身和通用数据源以及更多内部推理数据中,抽取了一部分高复杂性、多步骤问题的子集。对于这些样本,我们通过人-模型协作流程构建了思维链(CoT)(Wei等,2022)轨迹。随后,由一个LLM在多个维度上对生成的CoT进行评估,包括推理质量、逻辑正确性和序列重复性。我们还验证了最终推导答案的精确匹配准确率。该流程产生了约10万个冷启动CoT样本,用于训练MoT-2B和MoE-A32B变体。

4.1.2 训练方案

在冷启动SFT阶段,我们继续使用标准的交叉熵损失来优化模型。然而,与预训练和中期训练阶段不同,我们明确禁用了序列打包。每个训练样本被单独处理,以隔离并强调每个数据条目独立的推理链。在整个训练过程中,我们保持基础学习率为5e-5。

4.2 强化学习(Reinforcement Learning) 4.2.1 数据构建

对于强化学习,我们根据当前模型能力动态构建训练数据,而不是依赖于固定的数据集。我们维护了一个涵盖多种具身能力的大规模候选池,在每个RL轮次中,使用最新模型对该池进行多样本评估。在所有尝试中均被正确解决的样本被视为过于简单而被丢弃,而在所有尝试中均失败的样本则被视为过难而被移除。我们只保留部分成功的样本,因为这些样本位于模型当前能力边界附近,通常能为策略改进提供最有价值的学习信号。

为避免RL过度优化到具身能力的某个狭窄子集,我们进一步在不同能力维度(包括感知、预测、交互和规划)上平衡所选数据。每个RL阶段在最新构建的5万个样本集上进行训练。随着模型的改进,这一流程不断刷新有效的训练分布,形成一个简单的、能力自适应的课程,从而稳定优化过程并支持具身推理的持续提升。

4.2.2 奖励设计

具身模型强化学习的一个关键挑战在于,目标输出高度异构,涵盖几何定位、轨迹预测、离散决策、连续估计和开放式推理。因此,单一的统一奖励函数是不够的。
在我们的RL阶段,我们采用了一种任务感知的奖励设计,即根据每个样本目标输出的结构为其分配奖励函数:

我们的原则是:只要目标输出能够可靠解析,就使用确定性的、结构感知的奖励;仅在确定性评估不足时才求助于LLM评判器。


对于具有明确几何结构的任务,我们使用基于几何相似性的稠密奖励,而非精确匹配。具体来说,定位任务通过基于重叠度或距离的度量来评估,例如IoU、匈牙利匹配的IoU、归一化点距离和Chamfer距离,这些为定位和细粒度感知提供了分级监督。对于轨迹预测和规划任务,我们同样使用基于路径感知的奖励,这些奖励基于序列或曲线相似性,例如基于DTW和Fréchet距离的分数,并可选择结合端点一致性项。这些奖励在具身环境中非常重要,因为部分空间或时间上的正确性应与完全失败区分开来。

对于具有离散或强约束格式的输出,我们使用较轻量级的类精确匹配奖励。这包括多项选择预测、二元判断、计数和其他结构化答案任务。当目标是序列性的但离散时,例如排序,我们则使用基于序列相似性的部分信用奖励,例如归一化最长公共子序列。对于连续估计任务,我们采用随相对误差平滑衰减的回归式奖励,这比硬阈值准确率提供了更丰富的信息。

最后,对于那些无法仅靠规则稳健判断正确性的开放式具身推理任务,我们使用基于LLM的评判器作为备选方案:


总的来说,我们的奖励设计遵循一个简单的原则:奖励结构应与输出结构相匹配。在部分正确性有意义的地方使用稠密的几何奖励和回归式奖励,在答案空间明确的地方使用精确匹配,而基于LLM的判断则保留给真正的开放式案例。我们发现这种混合设计对于在多样化的具身能力上稳定RL至关重要。




4.3 通过迭代训练演进深度思考

虽然RL直接提升了任务奖励,但它并不一定能保证高质量的推理轨迹。在具身任务中,正确的答案可能源于截然不同的内部过程,从连贯的空间推理到不稳定的捷径不一而足。为了进一步提升推理的深度和一致性,我们引入了一种基于拒绝采样微调(RFT)的迭代式自我演进训练范式。

从RL之后的最新模型检查点开始,我们在一个精心整理的数据池上进行多样本rollout,并使用与RL中奖励函数一致的标准离线评估采样响应。然后,我们仅保留那些在部分(但非全部)rollout中被正确解决的样本。这种过滤移除了已饱和的样本以及仍然遥不可及的样本,将重点集中在模型当前可学习的前沿。在这些保留的样本中,我们进一步使用更强的教师模型对推理轨迹的质量进行评分,仅保留那些思维质量超过预定义阈值的样本。在实践中,这一过程将大约100万个候选示例过滤为约30万个高质量轨迹,用于后续的SFT阶段。

RFT的作用与RL是互补的。RL对于探索是有效的,因为它通过奖励驱动的搜索帮助模型发现更好的行为,但其监督是间接和相对的。而RFT则通过选择高质量的成功轨迹并训练模型去重现它们,将这些发现转化为明确的正面监督。从这个意义上说,RL扩展了能力前沿,而RFT则将最新发现的最佳推理模式巩固为更稳定的行为。

因此,我们在整个训练后过程中交替进行RL和RFT。在每个循环中,RL通过在线优化改进模型,而RFT则通过监督式精炼来提炼由此产生的高质量推理轨迹。这种迭代过程逐渐将偶然的成功转化为可靠的能力,我们发现这对于在具身模型中培养深度思考尤为有效。

4.4 大模型到小模型的同策略蒸馏

尽管大型HY-Embodied-0.5模型展现出显著更强的具身推理能力,但我们的实际部署目标是紧凑型模型。因此,我们引入了一个大模型到小模型的同策略蒸馏阶段,以将教师的推理行为迁移到学生模型中。此阶段的目标不仅仅是模型压缩,而是在更小的容量预算下,尽可能多地保留教师的具身能力和思维风格。

关键观察在于,推理能力不仅体现在最终输出中,还体现在生成过程中令牌级的延续分布上。因此,在教师生成的响应上进行的标准离线蒸馏是不够的,因为它只让学生接触到教师的轨迹,而并未在学生自身的解码状态上对其进行监督。为解决此问题,我们采用了一种同策略蒸馏策略:学生首先 rollout 自己的响应



这种设计允许学生在其自身策略所诱导的状态上精确地向教师学习,而这些状态正是其错误实际发生的地方。与传统的离线蒸馏相比,这大大减少了训练与推理之间的不匹配,并传递了比单纯模仿最终答案更丰富的信号。在我们的设置中,这一点尤为重要,因为大模型通过RL和RFT获得的能力分布在整个推理过程中,而不仅仅是集中在最终答案中。

OPD也很自然地契合了我们的训练后流程。RL扩展了大模型的能力前沿,RFT巩固了新发现的高质量推理轨迹,而OPD随后将这些精炼后的行为迁移到紧凑模型中。从这个意义上说,OPD充当了从大模型中的能力发现到小模型中的能力部署之间的最终桥梁,使得发布的紧凑模型能够继承教师模型大部分的具身推理能力。

5 评估

5.1 HY-Embodied-0.5 MoT-2B 的结果

评估设置。我们在涵盖视觉感知、具身理解和空间理解的22个基准测试组成的综合套件上评估HY-Embodied-0.5 MoT-2B。为了评估基础的视觉和多模态能力,我们使用了CV-Bench (Tong等,2024) 和DA-2K (Yang等,2024b)。超越基础感知,模型的物理和几何推理能力通过专注于3D空间理解和多视图几何的基准测试进行测试,包括3DSRBench (Ma等,2025)、EmbSpatial-Bench (Du等,2024)、RoboSpatial-Home (Song等,2025)、All-Angles Bench (Yeh等,2026)、MindCube (Yin等,2025) 和MMSI-Bench (Yang等,2025b)。我们进一步使用RefSpatial-Bench (Zhou等,2025)、SAT (Ray等,2024)、SIBench-mini (Yu等,2025)、SITE-Bench (Wang等,2025)、ViewSpatial (Li等,2025)、VSIBench (Yang等,2025a) 和Where2Place (Yuan等,2024) 评估其情境环境感知和空间定位能力。最后,为衡量具身智能体能力(涵盖可供性识别、轨迹预测和复杂任务规划),模型在ERQA (Team等,2025)、RoboBench-MCQ (Luo等,2025)、RoboBench-Planning (Luo等,2025)、ShareRobot (Ji等,2025)-Affordance and Trajectory 和Ego-Plan2 (Qiu等,2024) 上进行了评估。除非另有说明,我们报告的是所有评估样本的微平均得分。对于几个具有特定任务协议的基准测试,我们遵循其相应指标:3DSRBench和SAT使用循环准确率评估,ShareRobot-Bench-Affordance使用mIoU评估,ShareRobot-Bench-Trajectory使用1-DFD评估,其中DFD表示动态Fréchet距离。由于较低的DFD表示更好的轨迹相似性,我们报告1 − DFD,以便在所有基准测试中较高的值一致地表示更好的性能。我们对A32B模型使用相同的评估设置,以便不同模型规模的结果具有直接可比性。

基线与报告协议。我们将HY-Embodied-0.5 MoT-2B与代表性的通用型和专用型具身VLM进行比较,包括Qwen3-VL (Bai等,2025)、RoboBrain (Tan等,2026) 和MiMo-Embodied (Xiaomi Embodied Intelligence Team,2025)。对于Qwen系列,我们使用Qwen3-VL作为主要基线,而非Qwen3.5-VL。在我们的评估设置中,我们观察到Qwen3.5-VL经常产生过度重复的输出,这可能导致过长的思维序列并显著降低评估结果。为减少这种特定模式不稳定性带来的影响并使比较更稳健,对于所有基线模型,我们报告其思维模式和非思维模式中较好的结果。相比之下,对于HY-Embodied-0.5 MoT-2B,我们报告其在思维模式下的结果。这使得比较相对于我们的模型而言是保守的。

主要结果。表1总结了HY-Embodied-0.5 MoT-2B的基准测试结果。总体而言,我们的模型在22个基准测试中的16个上取得了最佳性能,并在另外4个基准测试上排名第二,在广泛的具身任务中展现出强劲且一致的表现。


在三个评估类别中,HY-Embodied-0.5 MoT-2B展现出均衡的能力分布。它在视觉感知基准测试上取得了领先结果,表明所提出的视觉架构为下游具身推理提供了坚实的基础。在具身理解任务上,该模型也表现出竞争力,并在感知、定位和结构化决策方面显示出明显优势,同时在规划和轨迹密集型基准测试上也保持了竞争力。其最显著的优势体现在空间理解基准测试上,它在大多数任务上持续优于竞争模型。这种强大的空间性能表明,HY-Embodied-0.5 MoT-2B已经发展出特别有效的细粒度空间推理能力,这是现实世界具身智能体的关键要求。

另一个值得注意的观察结果是,尽管HY-Embodied-0.5 MoT-2B尺寸紧凑,但它仍然保持了高度的竞争力。与更大的基线模型相比,我们的2B模型在大多数基准测试上仍然取得了更优性能,这表明性能提升不仅仅来自于规模,还来自于我们在架构、数据构建和训练后方面以具身为核心的设计。总体而言,这些结果表明HY-Embodied-0.5 MoT-2B在紧凑的模型尺寸和具身能力之间实现了良好的平衡,使其成为现实世界智能体部署的强大边缘模型。

通用基准测试结果。为评估我们模型的通用视觉理解能力,我们在多个领域对其进行了测试。这些领域包括通用视觉知识和幻觉缓解(RealWorldQA (xAi, 2024),Hallusion-Bench (Guan等,2024))、感知与推理(BLINK (Fu等,2024),CharXiv-RQ (Wang等,2024))以及文档解析和以文本为中心的视觉问答(DocVQA (Mathew等,2021),OCRBench (Liu等,2024),TextVQA (Singh等,2019))。在图7中,我们将HY-Embodied-0.5 MoT-2B与两个尺寸匹配的通用VLM(即Qwen3-VL-2B-Thinking和InternVL 3.5-2B)在这些基准测试上进行了比较。结果表明,虽然HY-Embodied-0.5 MoT-2B在具身和空间理解方面表现出色,但它在通用视觉任务上也取得了与尺寸匹配的通用VLM相当的性能。


5.2 HY-Embodied-0.5 MoE-A32B 的结果

我们使用上述相同的基准测试方法,将HY-Embodied-0.5 MoE A32B与几个最先进的视觉智能体进行了比较,包括Kimi K2.5 (Kimi Team,2026)、Seed 2.0 (Bytedance Seed,2025)、Gemini 3.0 Pro (Google,2025) 和Qwen 3.5 A17B (Qwen Team,2026)。对于Gemini 3.0 Pro和Seed 2.0,评估是通过其官方API在思维模式下进行的。结果总结在表2中。在22个基准测试中,HY-Embodied-0.5 MoE A32B在7个任务(32%)中取得第一名,在6个任务(27%)中取得第二名,总体得分为67.0,分别超过Gemini 3.0 Pro 3.4分(对比63.6)、Seed 2.0 0.8分(对比66.2)、Qwen 3.5 A17B 0.9分(对比66.1)和Kimi K2.5 5.9分(对比61.1)。


5.3 分析

在本小节中,我们对HY-Embodied-0.5模型进行了详细分析。我们首先展示了涉及视觉感知和具身环境的关键任务的定性结果。然后,利用我们的混合链架构,我们展示了思维链过程,以证明模型在长链模式下的测试时扩展能力。最后,我们通过MoT架构的效率评估和视觉潜在令牌的注意力可视化来验证我们的设计选择。

视觉感知任务的定性结果。依托我们大规模、高质量的视觉和具身感知数据集以及全面的空间识别数据,我们的模型在基础视觉任务中展现出稳健的能力。如图8所示,在深度估计场景中——包括从指定点到相机的绝对距离以及跨多个视角物体间的直接距离——与基线模型如开源模型Qwen3 VL、专有模型Seed2.0 VL和具身专用模型RoboBrain-2.5相比,我们的模型产生的预测显著更接近真实值(GT)。此外,在视觉定位任务中,该模型表现出高精度,在边界框检测、点级定位和区域级描述中都能提供准确结果。值得注意的是,对于复杂的计数任务,我们的模型有效地利用了视觉思维链(CoT)推理过程。通过在推理阶段依次识别并为每个目标物体分配精确的空间坐标,它逻辑地推导出准确的最终答案。总的来说,这些结果突显了我们的模型在低级视觉感知方面的卓越能力,这为它在复杂具身环境中的优越性能奠定了坚实的基础。


具身任务的定性结果。受益于训练中使用的大量且多样化的具身和空间理解数据,我们的模型在具身任务的多个层次上展现出全面且高度准确的性能,具体包括具身感知(定位)、场景理解和任务规划。如图9所示,在定位任务中,该模型展现出精确的定位能力,能够在各种杂乱的机器人环境中成功输出特定目标物体(例如,一个锅、一个橙子、一个篮子和一个红星)的准确边界框坐标。对于场景理解,该模型被证明善于解析复杂的3D空间关系。它能通过基于物体相对位置正确识别物体(例如,在其他方块之间定位一个绿色立方体)并验证多个物体之间复杂的空间陈述,来准确回答问题。此外,在任务规划场景中,该模型展示了强大的序列推理能力。给定一个高层次目标和一个已完成步骤的历史,它能准确地推断出逻辑上的下一步动作——无论是涉及确定西红柿在不同容器间的顺序放置,还是推断多步骤超市拣选任务中的下一步操作。更多可视化见附录。


思维链(CoT)示意图。依托我们高效、科学设计的多阶段具身训练后流程,我们的模型展现出卓越的长链推理能力。如图10所示,我们展示了HY-Embodied-0.5 MoT-2B和A32B两种变体通过强大的思维链(CoT)过程解决复杂视觉和具身挑战的深厚能力。在具身推理任务中,模型并非简单地猜测最终动作,而是逐步系统地分析空间关系和可供性——例如,评估不同机器人轨迹在操作物体时的正确性,或确定解开背包时的精确交互点。值得注意的是, 过程揭示出高级的自我反思和纠正能力(例如,明确地暂停并用“等等,不对……”这样的短语重新考虑结构细节)。此外,在空间和通用推理场景中,CoT机制使模型能够进行复杂的视角转换(从多视角图像推断未见过的环境)、基于视频帧的序列导航规划,以及精细的3D几何推导(匹配多面体零件)。这些结果表明,在面对复杂的多步骤问题时,我们的模型会参与一个透明、逻辑性强且高度可靠的认知过程。


HY-Embodied-0.5 MoT 的效率。所提出的混合令牌(MoT)架构展现出非常理想的特性,在训练期间实现了更快的收敛和更低的最终损失,同时在推理期间几乎不引入额外开销。为确保公平比较,两个模型均使用相同的训练数据、初始化方法和超参数进行训练。对于推理评估,我们通过将输入图像令牌固定为576个、生成输出令牌固定为100个来模拟实际现实场景。如图11所示,我们展示了有无MoT结构的训练损失曲线,以及实际的总推理时间和理论FLOPs。训练曲线清晰地显示了MoT的效率,并且在推理期间,MoT架构产生的结果非常接近于Dense-2B基线。此外,我们提供了预填充(prefill)和解码(decode)阶段的详细时间分解。由于在实际场景中解码过程占主导地位,MoT结构引入的总体额外时间开销可以忽略不计。


视觉潜在令牌的注意力可视化。视觉潜在令牌充当了视觉全注意力与语言因果注意力之间的连接。为了证明这一点,我们在图12中提供了对视觉令牌的注意力图和对文本令牌的注意力可视化。从图中可以观察到,视觉注意力图精确定位了显著物体、高度具体的物体部件(例如薯片罐的右端或抽屉的把手)以及与场景上下文相关的关键空间区域。同时,语言注意力权重强烈集中于核心语义实体、状态描述(例如“关闭的”)、空间关系(例如“靠着”、“在旁边”)和行动导向的指令(例如“抓取”)。这表明,视觉潜在令牌通过提取细粒度的、具有语义意义的视觉特征,并将其与相应的语言概念明确对齐,有效地弥合了模态鸿沟。因此,我们的模型展现出将复杂的视觉观测和具身可供性定位到自然语言中的强大能力,验证了我们潜在令牌设计在跨模态理解和推理中的有效性。


6 机器人控制结果

在 HY-Embodied-0.5-MoT-2B 基础模型的 MoT 架构之上,我们遵循 π0/π0.5 的结构设计扩展了动作专家模块,从而得到了用于现实场景机器人控制实验的视觉-语言-动作(VLA)模型。为了更好地释放 VLA 在真实机器人任务上的潜力,我们首先使用 5000 小时的 UMI 数据对网络进行微调。由于此阶段的所有训练数据均来自 UMI,网络在此过程中未接触过任何特定的机器人形态。我们在 32 张 GPU 上使用每张 GPU 批量大小为 32 的设置,共计进行 20 万次迭代。

随后,我们使用真实机器人数据在以下三个任务上进行监督微调(SFT),并进行部署评估。根据每个任务的难度,收集的演示数据量从 300 到 700 个回合不等。作为基线,π0 和 π0.5 在相同条件下使用相同的真实机器人数据(数据量和训练迭代次数均相同)进行 SFT。

机器人实验设置和结果如图 13 所示。如图所示,与 π0 和 π0.5 基线相比,我们的 HY-Embodied-0.5 VLA 模型在所有三个评估的现实任务中都展现出稳健且极具竞争力的性能。对于“精密插入包装”任务,HY-Embodied-0.5 达到了 85% 的成功率,与 π0.5 的性能相当,并超过了 π0(80%)。在“餐具堆叠”任务中,我们的模型达到了 80% 的成功率,相较于 π0 的 60% 有显著提升,并与 π0.5 的 85% 成功率保持竞争力。最值得注意的是,在“杯子悬挂”任务中——鉴于基线的表现,这似乎是最具挑战性的任务——HY-Embodied-0.5 展现出卓越的控制能力,达到了 75% 的成功率。这相比于 π0(45%)和 π0.5(50%)都有显著的提升。

这些令人信服的结果表明,在广泛的 5000 小时 UMI 数据集上的初始微调,加上底层的 MoT 架构,成功地赋予了模型丰富且可泛化的表示,这些表示在监督微调后能够有效地迁移到复杂的、特定于形态的操作任务中。


7 结论

在本报告中,我们提出了 HY-Embodied-0.5,一个为现实世界具身任务设计的强大的基础视觉语言模型。HY-Embodied-0.5 代表了在弥合通用 VLM 与现实世界智能体动态需求之间差距方面迈出的关键一步。通过开创性的模态自适应混合Transformer(MoT)架构以及视觉潜在令牌,该模型实现了物理基础所需的细粒度空间和视觉感知。此外,其具身训练后流程成功地将深度、复杂的推理能力压缩到一个高效的、专为边缘部署设计的 20 亿参数变体中。最终,该模型套件在 22 个具有挑战性的基准测试上取得的最先进性能,以及其在现实世界机器人操作任务中的稳健执行,证明了 HY-Embodied-0.5 有效地将广泛的数字智能转化为有形的物理世界能力。我们的目标是进一步探索并弥合语言模型与动作模型之间的差距,最终训练出一个更有利于复杂现实世界应用的真实世界大脑。

原文链接:https://arxiv.org/pdf/2604.07430

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
被执行死刑的巫鸿明、白应苍出镜

被执行死刑的巫鸿明、白应苍出镜

极目新闻
2026-10-05 09:08:22
钾含量高的8种菜,建议中老年人入秋要常吃,腿脚有劲,精神足!

钾含量高的8种菜,建议中老年人入秋要常吃,腿脚有劲,精神足!

美食店主
2026-10-05 08:15:22
奉劝所有人,这个冬天一定要做好心理准备

奉劝所有人,这个冬天一定要做好心理准备

扶苏聊历史
2026-10-05 14:12:48
英国国防参谋长曾言:俄罗斯如今的军事实力比任何时候都要强大

英国国防参谋长曾言:俄罗斯如今的军事实力比任何时候都要强大

起喜电影
2026-10-04 15:18:16
奶浆开袋即食,却宣称手工现做!一组照片实拍野人先生后厨,实锤预制底料引热议,网友:冰淇淋店应该拉一头活奶牛来挤牛奶吗?

奶浆开袋即食,却宣称手工现做!一组照片实拍野人先生后厨,实锤预制底料引热议,网友:冰淇淋店应该拉一头活奶牛来挤牛奶吗?

火山詩话
2026-10-04 10:30:16
“这跟内衣有啥区别?”中学女儿的外出穿搭,让母亲绷不住了

“这跟内衣有啥区别?”中学女儿的外出穿搭,让母亲绷不住了

世界圈
2026-09-22 15:46:08
这下彻底完了!判刑后许家印老底被挖,原来毁掉他的不是恒大爆雷

这下彻底完了!判刑后许家印老底被挖,原来毁掉他的不是恒大爆雷

观史搜寻着
2026-08-26 16:41:49
大冷门!日本冠军0-3被横扫,国乒名将1-3出局,王楚钦退赛副作用

大冷门!日本冠军0-3被横扫,国乒名将1-3出局,王楚钦退赛副作用

林子说事
2026-10-05 00:38:43
伤仲永!30岁前热刺天才1年无球可踢:业余队训练 巅峰身价1亿

伤仲永!30岁前热刺天才1年无球可踢:业余队训练 巅峰身价1亿

新英体育
2026-10-05 09:58:47
“这种我直接打飞!”女儿拍护照一直张嘴,挑衅感满满溢出屏幕

“这种我直接打飞!”女儿拍护照一直张嘴,挑衅感满满溢出屏幕

世界圈
2026-10-02 21:01:38
狂轰9小时!基辅命脉全瘫,北约东翼告急,普京霸气嘲讽“小丑”

狂轰9小时!基辅命脉全瘫,北约东翼告急,普京霸气嘲讽“小丑”

涵豆说娱
2026-10-01 10:50:53
古特雷斯临走前说大实话,当众撕开两大强国遮羞布,整整憋了九年

古特雷斯临走前说大实话,当众撕开两大强国遮羞布,整整憋了九年

莹莹的历史说
2026-08-29 02:32:14
如果中国人的低工资是一种优势,那谁最希望我们永远低工资?

如果中国人的低工资是一种优势,那谁最希望我们永远低工资?

熊倌儿
2026-09-19 10:48:32
韩媒:李在明呼吁韩朝打破“对抗循环”

韩媒:李在明呼吁韩朝打破“对抗循环”

参考消息
2026-10-05 21:05:04
时隔九年回归,预售破2000万,这部游改电影明日上映

时隔九年回归,预售破2000万,这部游改电影明日上映

灰度测试中
2026-10-04 22:33:47
美国人知道了:贸易战之后,不会再有中国外的大规模工业化国家了

美国人知道了:贸易战之后,不会再有中国外的大规模工业化国家了

牛锅巴小钒
2026-09-24 05:06:10
24岁女子连吃2小时自助被送急诊,胃被撑大,吐不出来也无法正常排便,开刀取出3斤重残渣……医生提醒:管住嘴!

24岁女子连吃2小时自助被送急诊,胃被撑大,吐不出来也无法正常排便,开刀取出3斤重残渣……医生提醒:管住嘴!

南方都市报
2026-10-03 12:39:48
毛主席说“你不可授上将”,杨成武为啥笑了?

毛主席说“你不可授上将”,杨成武为啥笑了?

纪史行者
2026-10-04 05:55:10
一夜输光几十万,打工小伙喝下整瓶百草枯:被伤透的妻子选择放弃治疗

一夜输光几十万,打工小伙喝下整瓶百草枯:被伤透的妻子选择放弃治疗

民生故事会
2026-09-05 23:23:10
浙江体育局副局长朱启南:小孩姐和严子怡都是校园体育发掘

浙江体育局副局长朱启南:小孩姐和严子怡都是校园体育发掘

懂球帝
2026-10-04 21:21:28
2026-10-05 21:51:00
CreateAMind incentive-icons
CreateAMind
CreateAMind.agi.top
1610文章数 21关注度
往期回顾 全部

科技要闻

2026年诺奖:三名科学家因光遗传学获奖

头条要闻

缅北电诈头目在中国临刑前对着镜头叫嚣:狼生来要吃肉

头条要闻

缅北电诈头目在中国临刑前对着镜头叫嚣:狼生来要吃肉

体育要闻

30天30队·热:扬尼斯、阿德巴约与克雷

娱乐要闻

蔡康永回应漏洞百出,太平轮旧事被扒

财经要闻

零跑声明切割!蔡康永两面人身份被抵制

汽车要闻

方程豹9月热销破4万 首款皮卡鲨鱼将于四季度上市

态度原创

本地
艺术
房产
游戏
军事航空

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

艺术要闻

吴冠中 大英博物馆展过的香港夜,1024万!

房产要闻

保利大爆发,冲到榜一!海南楼市前三季度,热销榜出炉!

大塚明夫希望Konami能继续开发《合金装备》系列

军事要闻

俄军连续4天轰炸基辅大桥

无障碍浏览 进入关怀版