网易首页 > 网易号 > 正文 申请入驻

中国物理AI大突破:PhysBrain 1.5登顶全球开源榜一,空间智能与GPT-6 Astra并驾齐驱

0
分享至

  • 允中 发自 凹非寺
    量子位 | 公众号QbitAI

物理AI,正在成为2026年全球人工智能最关键的赛道,也是未来之争。

大模型用了三年时间把“会说话、会思考、会工作”推到极致,但当行业开始追问“模型能不能走进真实世界、能不能动手”时,一扇新的大门被推开。

Google DeepMind于2026年7月30日发布Gemini Robotics 2,基于Gemini 3.5 Flash的“具身推理”大脑ER 2,试图让机器人“边看视频边想下一步”。近期,OpenAI GPT-6引发行业热议,推理、编程与多模态理解能力再度突破,把通用智能的天花板又推高了一截。

而Robocurve的一次实验,又将“大语言模型是否能在真实世界中行动”这个问题摆在了台前。该实验将GPT-6 Astra部署在真实机械臂上,在20次“积木放入碗”任务里,GPT-6 Astra完成19次,而Claude Fable 5.1仅完成8次。

这次实验表明,基座模型能力大幅提升之后,也可以在具身任务上取得可观的表现。



但顶尖大语言模型在具身操作上仍有鸿沟。Robocurve同一套测试的另一面很说明问题:在“蓝色拼图块对位插入凹槽”这种毫米级精细任务上,GPT-6 Astra的成功率从95%掉到10%。

大模型积累的通用理解,可以跨越“看懂”到“粗动作”的鸿沟,却仍在“精细接触、精准插入”面前止步。

这正是全行业共同的瓶颈,也是后来者真正的机会窗口。

就在这个关口,一家从北京海淀中关村走出来的中国公司——深度机智,交出了自己的答卷。

2026年9月9日,深度机智正式发布物理基座模型PhysBrain 1.5,在28项公开基准上取得72.5的综合均分,位居参评开源模型首位,与头部闭源模型GPT-6 Astra(73.3)、Gemini 3.6 Flash(73.0)的差距,已收窄到1分以内。

它没有去和巨头比拼参数规模,也没有去追逐各类技术热点,而是用一条“人类学习”的技术路线,把物理智能基础模型能力作为核心战略方向持续深耕。

GPT-6 Astra的机械臂实验恰恰印证了,把基础模型做扎实,才是决定物理智能上限的关键变量,这正是深度机智长期践行的方向。

PhysBrain 1.5是深度机智在这一战略方向上持续投入的阶段性成果。



在28项基准测评中,PhysBrain 1.5取得14项开源第一,10项位列开源第二。

它不是在某一个单项上刷出了高分,而是在空间理解、动作生成、未来状态预测的完整能力链条上,全线跻身开源模型前列。

这意味着PhysBrain 1.5提供的不只是“更聪明的感知”,而是机器人从理解环境到执行任务的系统性基础能力。

PhysBrain 1.5全面开源,技术报告、2B与8B模型权重、评测工具包,全部向社区开放,让更多全球开发者基于同一套基座,共同探索物理智能的下一步。

Project Page: https://deepcybo-physai.github.io/PhysBrain-1.5
Hugging Face: https://huggingface.co/collections/DeepCybo/physbrain-15
Evaluation Kit: https://github.com/DeepCybo-PhysAI/PhysBrainEvalKit

开源第一,比肩顶尖闭源:中国物理AI基座模型站上全球前沿

物理基座模型的评测向来是件难事。评估PhysBrain 1.5的,是一组28项公开基准,按五大能力维度组织——视觉空间感知、空间与多视角理解、具身认知与规划、空间指向与可供性、视觉轨迹推理。

在这套多维测试中,PhysBrain 1.5-8B拿下72.5的综合均分,排开源阵营第一。

从结果上看,PhysBrain 1.5-8B以72.5的综合均分拿下开源模型榜首,并在28项中的14项取得开源最佳,10项位列开源模型第二;相较当前最强开源对手Hy-Embodied-VLM-1.0(66.0)高出约6.5分,较RynnBrain 1.1(63.1)高出9.4分。

更受关注的是其整体水位:72.5分这一成绩,与GPT-6 Astra(73.3)、Gemini 3.6 Flash(73.0)的差距已收窄到1分以内。在具身智能的核心能力上,深度机智已经与全球最前沿的闭源模型站在同一水位线上。



分项成绩同样能说明问题。

在RoboSpatial-Home空间理解取得73.9分,意味着模型能够在真实场景中准确理解物体之间的空间关系,这是机器人在真实环境中操作的前提。

Part-Affordance可操作部位识别拿下84.0分,说明模型不仅能理解“物体是什么”,更理解“这个物体的哪个部位可以被操作、应该怎么操作”,这是从“识别”走向“交互”的关键一步。

RoboRefit视觉目标定位获得89.8分,则表示模型能够在复杂场景中精准找到并锁定目标物体,为后续动作执行提供了可靠的视觉锚点。

这些成绩说明了PhysBrain 1.5的领先并非局部优势,而是一种覆盖感知、空间、推理、规划与定位的系统性能力领先。这也标志着具身基座模型的竞争,正在从单项能力的较量,进入系统能力的对决。

比8B榜首成绩更值得注意的,是PhysBrain 1.5并没有只做一个“大版本”。

深度机智同步开放了PhysBrain 1.5-2B与PhysBrain 1.5-8B两档参数规模。在项目页最新公布的同一套28项测试中,PhysBrain 1.5-2B取得66.6分。

按照官方评测规则,2B版本仅作为参考,不参与开源排名;但如果只比较数值,它的综合得分已经超过表中所有其他非PhysBrain开源参评模型,包括30A3B规模的Hy-Embodied-VLM-1.0(66.0)、8B的Embodied-R1.5(64.9)和9B的RynnBrain 1.1(63.1)。

这让2B版本呈现出另一种价值:它不是8B模型的“展示性缩小版”,而是在显著降低参数规模之后,仍然保留了相当完整的具身理解能力。

对于开发者而言,这意味着更低的试用、部署和二次开发门槛;对于PhysBrain而言,则意味着同一技术路线开始同时覆盖“性能上限”和“轻量可用”两个方向。



HF社区用户在线进行模型demo测试,

demo网址:https://huggingface.co/spaces/hugging-apps/physbrain1-5-8b-demo

两个版本现均已上线Hugging Face,为社区验证与下游部署提供入口(https://huggingface.co/collections/DeepCybo/physbrain-15)。

在上线仅3天时间内,PhysBrian 1.5就获得了超过3k的下载量,为全球开发者社区提供了媲美顶尖闭源模型的物理智能基座能力。

从人类经验到物理智能循环:Ego360与Physical Loop的理念闭环

72.5分是一个数字成绩,但在数字之外更值得讨论的,是PhysBrain 1.5选择的“路径”——被深度机智称为“Physical Loop”物理智能循环的统一架构。

深度机智把物理智能的本质归纳为一个循环:观察世界、理解空间与任务、判断动作后果、执行、再依据新的观察修正下一步,即Physical Loop。

真正的物理智能,不是单点能力的堆砌,而是这个闭环能够连续、稳定地运转,并根据反馈自我修正。

因此PhysBrain 1.5将“观察世界—理解空间与任务—判断动作后果—执行—反馈修正”这五步原本分散在不同模型里的能力,重新组织进了同一个基座模型。

过去,物理AI系统普遍是“理解模型+动作模型+预测模型”拼接,拼接意味着每个子模型都要单独训练、单独调优。

深度机智的判断是:要做出能“在世界中行动并自我修正”的底座,必须先回到这个闭环本身,把能力重新组织起来。PhysBrain 1.5,正是围绕这一闭环重建模型本身。

模型如何学会这个循环?如果训练数据只告诉模型“世界长什么样”,却没有保留下“人在什么情境下采取什么动作,以及动作之后世界发生了什么变化”,那么再统一的模型,也很难真正学到物理交互的规律。

这正是深度机智把“人类经验”放在数据起点上的原因。

深度机智认为,人类经验天然地嵌入这一循环:个体在真实世界里不断感知情境、产生意图、采取行动,并根据结果调整后续行为;人类的智能,正是在这种反复交互与修正中逐步生长出来的。

团队在论文中写得很直白:“物理感知的预训练监督,完全来自人类交互视频”。在深度机智的技术路线里,人类经验是物理智能循环的第一性来源。

支撑这一技术判断的,是深度机智构建的Ego360人类全景真实数据体系

它通过全景视频记录任务执行时的周围环境,并同步保留全身姿态、手部运动与任务级语音,使一段交互不再只是孤立的“动作片段”,同时还具有更连续的任务、动作与状态变化上下文。

这种连续性很重要。模型不需要学习“手应该往哪里动”,还需要知道当前处于什么情境、为什么要执行这一步,以及任务推进后环境如何变化。

这也是人类交互视频相对于碎片化操作数据更核心的价值。



前不久在WAIC 2026(2026世界人工智能大会暨人工智能全球治理高级别会议)的具身智能空间交互论坛上,深度机智创始人陈凯博士就以《人类学习范式:物理通用智能远征的起点》为题,公开系统阐述了以人类真实交互经验支撑物理通用智能的技术判断,并展示了围绕全景人类数据展开的实践进展。

9月10日,国家数据局党组书记、局长刘烈宏主持召开具身智能座谈会。深度机智受邀出席,并展示了人类全景真实数据与情境数采(In Context Data Collection)范式。

能够参与这场闭门座谈,既是对深度机智数据路径的认可,也意味着一家企业的技术选择,上升为行业基础设施层面的参考坐标。

从2025年12月提出情境数采范式,到2026年7月全景数采范式的迭代,深度机智在半年多时间里完成了数据采集能力的迭代,并同步推进大规模人类真实数据采集与模型驱动的全自动标注管线。

PhysBrain 1.5进一步将人类交互视频真正纳入Physical Loop的预训练框架,这条路线开始从判断和理念,变为大规模数据运营和模型能力。



2026年7月,深度机智创始人陈凯在WAIC论坛发布全景数采方案

理解、动作、预测:一个基座里的三大能力

如果说Physical Loop回答的是“物理智能应该如何运转”,那么PhysBrain 1.5接下来解决的,就是“这些能力如何在一个模型里被共同学习”。

具体来说,它基于开源基础模型,将语言回答、空间坐标、动作轨迹、未来画面与深度预测,全部纳入同一套训练框架,不需要为每种能力单独搭建模块或设计专门的输出层,让模型在“看懂世界”“生成动作”和“预判结果”之间形成内在一致性,而非松散拼接。

由此,具身理解、动作生成与未来状态预测,不再是三个彼此独立的模型,而能够在Physical Loop中彼此约束、协同演进。



一是具身理解:知道“此刻发生了什么”

PhysBrain 1.5保留了VLM图像与视频理解的接口,通过具身监督为其注入物理感知能力。训练数据覆盖基础视觉空间感知、3D与多视角空间理解、具身认知推理与规划、空间指向与可供性,以及视觉轨迹推理,五大能力。

这意味着模型不仅“看到”画面,还带着空间结构、物理常识和任务意图去理解场景。它输出的不只是语言描述,还包括结构化的空间坐标与轨迹目标,这些正是后续动作生成所需的关键锚点。



二是动作生成,指向的是“接下来该怎么做”

PhysBrain 1.5模型通过Human-as-Humanoid管线,从人类视频中学习手腕的运动方式,将其转化为机器人可以执行的动作。给定当前画面、任务指令和之前的动作历史,模型能够直接生成接下来一系列的动作步骤。

更重要的是,这套动作能力不绑定特定机器人,同一份模型可以适配不同形态、不同控制频率的机器人,无需为每台机器单独训练。



三是未来状态预测:预见“做完之后会发生什么”

PhysBrain 1.5在给定当前画面与任务指令后,可以预测1秒后的物理状态,并同时输出三种模态:RGB图像、深度图和机器人掩码。

这三者空间对齐、彼此关联,共同描述一个完整的未来场景。这种“先想象结果、再采取行动”的能力,让模型在闭环中拥有了前瞻与纠错的依据,动作尚未执行,它已能预判环境将如何变化。



三项能力被纳入同一个模型、同一套训练框架,不再各自独立。理解提供场景证据,动作生成延续物理交互,未来预测给出前瞻信号,三者互为输入、互相约束,共同支撑Physical Loop的连续运转。

这也标志着物理智能的构建方式,正在从“拼装专用模块”走向“训练统一基座”。

Human-as-Humanoid:人类动作进入模型,再走向机器人

PhysBrain 1.5还有一个很容易被忽略的关键问题:人类视频中的动作,究竟如何变成模型能够学习、机器人能够使用的动作表示?

这里连接人类数据与动作模型的,正是深度机智此前提出的Human-as-Humanoid框架。

在PhysBrain 1.5的训练过程中,团队通过Human-as-Humanoid的转换框架,实现人类行为数据从“可观看的记录”到“可训练的资源”的转化,让人类行为数据成为动作建模可持续、可规模化的燃料来源。

这正是human-centric data进入action modeling的关键桥梁。

而在此前的Human-as-Humanoid研究中,这条转换链路已经进一步延伸到自研的60自由度拟人体机器人Prime U上,对“人的动作经验能否迁移到机器人”进行了真机验证。

在研究中,其原始示范吞吐量达到传统遥操作的4.8至7.2倍,并在部分任务上实现了从人类数据到真机执行的零样本迁移,模型不必看到特定机器人本体的示范,就能在该本体上执行相应任务。



从这里再回看深度机智的全栈布局,它的逻辑就变得清晰:Ego360持续积累人类经验,PhysBrain基座模型以这些数据不断拓展能力边界,Human-as-Humanoid承担人类动作与机器人动作空间之间的转换,Prime系列本体则在真实交互中提供验证与反馈。

数据、大脑与本体,被组织在同一条主线上持续演进。这意味着深度机智已经独立完成了“从模型能力到本体验证”的完整闭环。

这种全栈能力,不仅意味着更快的迭代速度和更低的协同成本,更意味着一种系统性的壁垒。

提前一年的路线定力:当全球共识追上深度机智的判断

回看这场竞赛,多数参与者默认了一个隐含前提:物理智能是“大模型顺手能做好的延伸”,先把语言能力推到极致,再给模型接上动作输出,问题便解决了。

GPT-6 Astra的机械臂实验让我们看到了通用基础模型的提升,可以转化为物理行动能力,但其在精细操作上的局限同样说明,仅靠语言模型的通用能力并不足够,物理智能需要专门的基础模型。

这侧面印证了深度机智一直以来的战略判断:物理基座模型不是短期风口,而是一项需要长期投入的布局,先想清楚“物理智能究竟该从哪里长出来”,再让数据、模型与本体围绕这一长期目标持续组织、协同推进。

把时间线往回拨一年。2025年10月10日,深度机智就发布了《源于人,超越人》技术路线图,明确把“人类学习”作为物理通用智能的核心研发路径,并围绕“以人类数据为起点、以动作为中心建模、身体为AI设计”三大战略,开展数据、模型、本体全栈布局。

在深度机智的逻辑里,物理智能不可能靠把互联网文本“翻译”成动作获得。人是在真实世界里,通过一遍遍“看见—尝试—被反馈修正”长出操作能力的,人类是物理智能最好的老师。

当时,行业对“用人类第一视角数据训基座模型”远未形成共识;而2026年PI、NVIDIA、Dyna乃至学术界的集体转向,恰恰在一年后验证了深度机智一年前的判断“人类经验是物理智能的第一性来源”。深度机智不是这一趋势的追随者,而是它的先发者。

这种先发,不只是判断上的领先,更是工程上的积累。回看PhysBrain的迭代节奏,2026年3月27日PhysBrain 1.0在中关村论坛发布,2026年9月9日PhysBrain 1.5跟进,半年一次的高频迭代,意味着这家公司正一步步把路线图走实,建立起稳定的研发闭环与工程能力。



Google DeepMind的Gemini Robotics、Physical Intelligence的π系列、Figure AI、NVIDIA Cosmos 3……全球头部机构正沿不同路径加速布局,物理智能的研发投入显著提速。

深度机智在人类学习路线上的早期布局所形成的先发积累,与数据、模型、本体全栈协同的系统能力相结合,正在成为全球物理智能竞争中一项难以复制的关键优势。

扛起行业发展重任的“黑马”

全球开源第一,只是PhysBrain 1.5在这一时间点上交出的成绩单。背后更值得关注的,是它在物理AI这一仍处早期的赛道上展示出来的三种能力:

一是架构的统一性。

深度机智把“理解、动作、预测”收进同一个自回归主干,让物理智能循环真正在模型内部闭环,而不是靠多个子模型拼接;

二是数据路线的差异化。

深度机智率先以大模型方法论,把人类第一视角数据作为物理常识来源,在行业里推进了稀缺的数据基建;

三是工程落地的全栈性。

深度机智从Ego360数采、PhysBrain基座、Prime系列本体到Human-as-Humanoid转换框架,每一环都自己把控。

物理智能的终局,不是一个会回答的模型,而是一个能在真实世界里感知、行动并不断自我修正的闭环。

PhysBrain 1.5清晰地标志着:在全球物理AI基础模型的竞争中,中国团队已经凭借人类学习路线与全栈布局,走到了全球竞争的第一梯队。

对行业而言,这是一个全面推动中国物理AI进步的里程碑。

*本文系量子位获授权刊载,观点仅为原作者所有。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
中美日离婚率差距:美国2.4‰,日本23.5%,中国让人意外

中美日离婚率差距:美国2.4‰,日本23.5%,中国让人意外

陈博世财经
2026-09-13 09:53:23
当年在美军舰艇上用中文喊话警告中国海军的华裔女兵郑浩儿,原本指望靠这次行动立下军功,可她后来的真实境遇却成了一场闹剧

当年在美军舰艇上用中文喊话警告中国海军的华裔女兵郑浩儿,原本指望靠这次行动立下军功,可她后来的真实境遇却成了一场闹剧

人生录
2026-09-14 00:05:21
魏应彪拜会四川省委书记王晓晖、省长施小琳

魏应彪拜会四川省委书记王晓晖、省长施小琳

看航空
2026-09-14 11:53:02
数千人伤亡 24小时内58次空袭 也门冲突快速升级

数千人伤亡 24小时内58次空袭 也门冲突快速升级

国际在线
2026-09-14 07:26:26
跟队:恩佐是让对手恨得牙痒痒的球员,他证明了自己的价值

跟队:恩佐是让对手恨得牙痒痒的球员,他证明了自己的价值

懂球帝
2026-09-14 10:30:14
敬一丹离世仅12小时,私生活被扒底朝天,原来她和肖晓琳处境一样

敬一丹离世仅12小时,私生活被扒底朝天,原来她和肖晓琳处境一样

做一个合格的吃瓜群众
2026-09-13 21:37:48
女篮世界杯最终排名出炉!美国登顶夺冠中国第7:日本第12捷克第15

女篮世界杯最终排名出炉!美国登顶夺冠中国第7:日本第12捷克第15

篮球快餐车
2026-09-14 05:53:52
《纸牌屋》道出实情:大佬并不看重你的才干、魄力与眼光。想要被当成自己人,不靠立下功劳,而是靠这两条不会当众讲明的生存潜规则

《纸牌屋》道出实情:大佬并不看重你的才干、魄力与眼光。想要被当成自己人,不靠立下功劳,而是靠这两条不会当众讲明的生存潜规则

心理观察局
2026-08-25 06:46:08
大二女生“偷母亲5000元交学费”后续:亲妈报案后被亲戚追着骂,撤诉却不是因为醒悟

大二女生“偷母亲5000元交学费”后续:亲妈报案后被亲戚追着骂,撤诉却不是因为醒悟

妍妍教育日记
2026-09-13 09:10:24
彭小苒因直播服装存在走光风险工作室正式致歉

彭小苒因直播服装存在走光风险工作室正式致歉

全球风情大揭秘
2026-09-14 09:32:18
事发上海!男子开车送女儿上班后迟迟未归,手机无法接通,妻子急疯!警方疾驰40公里拦截救人

事发上海!男子开车送女儿上班后迟迟未归,手机无法接通,妻子急疯!警方疾驰40公里拦截救人

新民晚报
2026-09-14 09:06:13
中国财政真实现状!不是政府没钱,是整个赚钱模式变天了

中国财政真实现状!不是政府没钱,是整个赚钱模式变天了

牛锅巴小钒
2026-09-14 07:13:19
中国女排抵达日本!全队无精打采,首战菲律宾,卫冕阻力仍是泰国

中国女排抵达日本!全队无精打采,首战菲律宾,卫冕阻力仍是泰国

跑者排球视角
2026-09-13 22:42:42
好消息!2026中秋不调休,国庆放假有变,早了解早准备

好消息!2026中秋不调休,国庆放假有变,早了解早准备

小谈食刻美食
2026-09-14 09:22:19
刘翔之前,2011年退役的姚明找上海体育局把编制清零,拿自主择业补偿走人,后来买上海男篮、当选篮协主席,人事关系早切干净…

刘翔之前,2011年退役的姚明找上海体育局把编制清零,拿自主择业补偿走人,后来买上海男篮、当选篮协主席,人事关系早切干净…

犀利辣椒
2026-09-14 06:22:07
22岁侄子扛行李送19岁叔叔上大学,叔叔:爸爸今年70岁了,在家忙着收玉米,让亲侄子送更放心

22岁侄子扛行李送19岁叔叔上大学,叔叔:爸爸今年70岁了,在家忙着收玉米,让亲侄子送更放心

潇湘晨报
2026-09-14 12:15:09
亚运男篮八强定6席!中国男篮赢4分获1号位,韩国17分大胜日本

亚运男篮八强定6席!中国男篮赢4分获1号位,韩国17分大胜日本

乒烧泳球
2026-09-13 20:08:07
你发的日常动态,正在泄露政治倾向和信仰

你发的日常动态,正在泄露政治倾向和信仰

报错免疫体
2026-09-13 04:42:52
拒绝!火箭不允许任何人穿13号!!!

拒绝!火箭不允许任何人穿13号!!!

柚子说球
2026-09-13 16:12:03
托雷斯跨界破纪录!重拳出击惊呆众人,退役后身材更胜球员时期

托雷斯跨界破纪录!重拳出击惊呆众人,退役后身材更胜球员时期

星耀国际足坛
2026-09-13 22:39:21
2026-09-14 14:07:00
量子位 incentive-icons
量子位
追踪人工智能动态
13308文章数 176561关注度
往期回顾 全部

科技要闻

记者问AI要不要踩刹车,特朗普先想到中国

头条要闻

伊朗总统被指大声质问革命卫队总司令:为何向商船开火

头条要闻

伊朗总统被指大声质问革命卫队总司令:为何向商船开火

体育要闻

兹维列夫,从三十年0冠到一百天2冠

娱乐要闻

敬一丹去世仅1天,蔡磊因2个举动,实现口碑暴增

财经要闻

继房子茅台后 中产的第3个"神话"破灭了

汽车要闻

全新配色和新样式轮毂 乐道L80星光设计套装限时惊喜价10080元

态度原创

房产
教育
手机
家居
旅游

房产要闻

别再等了!广州改善好房,正在进入“卖一套少一套”时代

教育要闻

同学们都很迷茫,肯定是题目出错了

手机要闻

曝一加16触控参数再升级,多项指标号称“行业最高”

家居要闻

2026建博会(广州) 公装联探展交流活动

旅游要闻

18 位海外嘉宾受聘上海旅游节入境观察员,以国际视野讲述上海故事

无障碍浏览 进入关怀版