网易首页 > 网易号 > 正文 申请入驻

看懂不等于做对:VA-Bench测出大模型空间智能的执行断层

0
分享至



大模型已经越来越会「看懂」空间:它能判断物体在机械臂哪一侧,也能识别该操作哪个目标、理解任务怎么做。但如果真的把机械臂交给它,问题会变得更具体:该移动多少毫米?当前视角够不够?抓空以后,又该怎么调整?

VA-Bench 测试了 12 个主要多模态模型。表现最好的几组模型,在目标识别与定位(TL)上达到100%,操作语义理解(MS)也达到99.6%—100%;但完整任务成功率只有约一半:Qwen3.8-max、Opus-5 和 GPT-5.6-sol 分别为53.93%、52.86%和 51.55%。

目标找对了,任务也看懂了,为什么真正动起来以后,还是只有大约一半能成功?对于这些情况来说,模型真的「理解」了空间吗?

这正是 VA-Bench 想测的问题。



  • 论文标题: VABench: Measuring Embodied Spatial Intelligence through Visual Demonstrations, Active Perception, and Metric Control
  • 论文链接:https://arxiv.org/pdf/2609.19554
  • 项目主页:https://github.com/zhangzhongbo2213/VABench
  • Huggingface paper: https://huggingface.co/papers/2609.19554

空间智能,不能只停在「答对」

很多空间推理 Benchmark 已经能评估深度、距离、三维关系和多视角理解,但通常由评测者提前决定「模型看什么、回答什么」。真正进入机器人环境后,模型还要自己判断当前信息是否足够;如果不够,就决定缺什么、该从哪里继续观察。新的视觉证据补齐后,再把空间判断落到具体动作,并根据执行结果决定是否修正。

因此,真正面向物理行动的空间智能,不应该止步于回答一个已经定义好的空间问题。围绕这一点,我们提出了VA-Bench(Vision-Action Benchmark),把空间智能放进一个完整的闭环:

Observe → Reason → Act → Revise,即「观察 → 推理 → 行动 → 修正」。



图 1:VA-Bench 与传统空间评测的对比。

VA-Bench 要求模型真正进入机器人与环境的交互过程。测试前,模型观看成功示范视频,理解任务怎么做,但不会获得物体坐标、专家轨迹或精确动作参数;测试中,它可以主动切换视角,但会消耗交互步数,必须在继续观察和开始行动之间做出取舍。

最后,空间判断还必须真正落到动作上。模型需要直接给出具体的移动距离和旋转角度,并决定什么时候打开或闭合夹爪。



图 2:主动观察与执行过程示例。

14 类任务,280 个基础场景

VA-Bench 包含14 类机器人操作任务,其中有11 类单臂任务和 3 类双臂任务,每类 20 个经过物理验证的场景,共 280 个基础场景。

此外还设置了几何迁移和长时序组合测试,进一步追问:换一个空间布局,模型还能重新判断怎么做吗?会做若干独立操作,又是否意味着能够把它们稳定地串成更长的任务?



表 1:VA-Bench 基础任务设置。

目标找对了,为什么还是做不对

从整体结果看,表现最好的几组模型完整任务成功率只有约一半,但子任务完成率达到65.9%—68.6%。这说明很多失败并不是模型完全不知道怎么做,而是已经完成了其中不少步骤,却没能把整个任务稳定做完。

进一步拆解模型的执行过程,当前的困难主要集中在三个环节:从目标识别到精细空间执行、从错误发现到在线修正,以及从单臂操作到双臂协同。



图 3:VA-Bench 的主要实验结果。

找到目标,不等于能精确移动到目标。

前三的模型在目标识别与定位(TL)上全部达到100%,在操作语义理解(MS)上也达到99.6%—100%。但到了更精细的空间执行阶段,例如接触前的细粒度分析(FG)、与目标之间的空间关系判断(SR)等,成绩开始明显下降。

一个模型完全可能准确找到一个瓶子,却在夹爪还没有下降到合适高度时提前闭合;也可能理解「需要把物体放进容器」,却无法稳定判断物体与容器之间精确的高度、深度和接触位置。

会发现错误,也不等于能及时改回来。

Qwen3.8-max、GPT-5.6-sol 和 Opus-5 在错误发现(ED)上的得分分别达到73.6%、70.8%和 69.9%,但到了真正的在线修正(OC),三者分别只有46.7%、27.3%和 32.4%。模型已经越来越能发现「哪里不对」,但还不擅长把新的观察迅速转化成有效修正。

一只机械臂已经不容易,两只更难。

当任务从单臂进一步进入双臂协同时,这种困难又被进一步放大。Qwen3.8-max 在单臂任务上的平均成功率达到65.61%,但双臂任务只有11.11%;Opus-5 从64.09%降至 11.67%。



表 2:单臂、双臂及整体任务成功率。

这类任务的难点并不只是「多控制一只机械臂」。模型还需要判断哪只机械臂负责哪个物体、两只机械臂之间应该保持怎样的相对位置,以及不同动作应该按什么顺序衔接。任何一个环节的空间判断出现偏差,都可能让后续动作无法继续。

多给几个视角,就能解决问题吗

如果直接把更多视角一次性提供给模型,是不是就不需要主动观察了?为此,VA-Bench 设置了一组对照实验:一种情况下,模型每次只看到当前视角,但可以根据当前任务需要主动切换观察方向;另一种情况下,模型直接获得5 个固定视角,但不能继续自主选择新的观察位置。



表 3:主动观察与固定五个视角的结果对比。

结果非常一致:4 个模型在失去主动观察能力以后,成功率全部下降。

主动观察真正重要的地方,可能并不是让模型单纯地「多看」,而是让它知道自己还缺什么,以及下一眼应该去哪里找答案。

换个布局、拉长任务,能力还剩多少

几何迁移测试保持任务目标和操作流程不变,只改变物体形状、容器或空间布局。Qwen3.8-max 的成功率从77.86%降至 67.86%,GPT-5.6-sol 则从80.00%降至 47.86%。

模型知道一种操作怎么完成,并不意味着进入新的空间布局后,还能重新建立正确的空间关系。



表 4:几何迁移与长时序组合测试结果。

类似的问题在更长的执行过程中被进一步放大。VA-Bench 设置了一个五个物体的长时序组合任务,Qwen3.8-max 最终完成了61/100 次物体放置,GPT-5.6-sol 完成了53/100 次。

有的模型能够完成不少中间步骤,但整个任务却没有任何模型完整完成过一次。会做几个独立操作,不代表模型就能在长任务中持续稳定执行。

从「看懂」走向真正的空间智能

VA-Bench 看到的不是简单的「会」或「不会」,而是一系列更具体的能力边界:模型可以找到目标,却未必能精确移动到目标;可以发现错误,却未必能及时修正;可以获得更多画面,却未必知道当前最需要看哪里;可以完成几个独立步骤,却未必能稳定完成更长的任务。

今天的多模态大模型已经越来越会「看懂」物理世界,但从理解到可靠行动之间,仍然存在明显距离。

VA-Bench 想做的,就是把这段距离测出来。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
尴尬了!原定26桌婚宴突来36桌:山东新娘学生家长全家赴宴,10桌缺口让主家酒店总管,集体懵圈

尴尬了!原定26桌婚宴突来36桌:山东新娘学生家长全家赴宴,10桌缺口让主家酒店总管,集体懵圈

火山詩话
2026-10-06 08:31:34
中网前3种子全出局!高芙0-2爆冷首输梅尔滕斯 无缘八强创生涯最差

中网前3种子全出局!高芙0-2爆冷首输梅尔滕斯 无缘八强创生涯最差

醉卧浮生
2026-10-07 16:25:49
染红后微笑离场!前国脚怒批韦世豪:不顾集体利益 惯犯 永远改不了

染红后微笑离场!前国脚怒批韦世豪:不顾集体利益 惯犯 永远改不了

风过乡
2026-10-07 08:23:48
约10万士兵出现溃退!莫斯科全城加强戒备,俄军战壕实情曝光

约10万士兵出现溃退!莫斯科全城加强戒备,俄军战壕实情曝光

影孖看世界
2026-10-06 21:13:22
完美谢幕!39岁梅西正式结束21年国家队生涯,赛后告别:想一辈子留在国家队,但是时候了

完美谢幕!39岁梅西正式结束21年国家队生涯,赛后告别:想一辈子留在国家队,但是时候了

封面新闻
2026-10-07 11:30:44
大结局来了!欧某某踢到铁板,身份被扒、全网社死:逼哭空姐的那一跪,终于反噬到自己身上

大结局来了!欧某某踢到铁板,身份被扒、全网社死:逼哭空姐的那一跪,终于反噬到自己身上

秋风妃
2026-10-06 22:06:46
时隔3年重返中网八强!6届大满贯冠军斯瓦泰克2-0横扫10号种子

时隔3年重返中网八强!6届大满贯冠军斯瓦泰克2-0横扫10号种子

醉卧浮生
2026-10-07 14:46:09
“你该继续贫困!”女生每天一杯瑞幸被举报,公务员都没这么奢侈

“你该继续贫困!”女生每天一杯瑞幸被举报,公务员都没这么奢侈

番外行
2026-10-05 20:54:27
被记者拦车采访,葡萄牙主帅热苏斯回应C罗长文声明:我没什么可说的;葡媒:热苏斯团队已提前知晓C罗声明,且认为内容可以接受

被记者拦车采访,葡萄牙主帅热苏斯回应C罗长文声明:我没什么可说的;葡媒:热苏斯团队已提前知晓C罗声明,且认为内容可以接受

大风新闻
2026-10-07 14:06:14
战火升级、巴土入局 中东“同室操戈”何时休?

战火升级、巴土入局 中东“同室操戈”何时休?

看看新闻Knews
2026-10-07 00:01:32
郑钦文苦战再取中网胜利,排名持续攀升:“我感觉所有人都想击败我”

郑钦文苦战再取中网胜利,排名持续攀升:“我感觉所有人都想击败我”

寒律
2026-10-07 11:40:31
1000赛9连败!周杰伦现场观战,张之臻遭逆转止步上海大师赛首轮

1000赛9连败!周杰伦现场观战,张之臻遭逆转止步上海大师赛首轮

全景体育V
2026-10-07 17:01:03
号称世界第一的华西医院到底有多强?输了两天液,发现医生一直在骂同行

号称世界第一的华西医院到底有多强?输了两天液,发现医生一直在骂同行

华庭讲美食
2026-10-06 12:20:28
不可思议啊!网传江苏夫妻教数学物理五年收入340万,还清房贷车贷,目标300万躺平

不可思议啊!网传江苏夫妻教数学物理五年收入340万,还清房贷车贷,目标300万躺平

火山詩话
2026-10-06 07:37:59
一觉醒来,我的导师获得诺奖了!河南一高校副教授发文恭喜,称导师在科学研究中非常严谨,对学生也十分真诚,去年曾来学校进行指导

一觉醒来,我的导师获得诺奖了!河南一高校副教授发文恭喜,称导师在科学研究中非常严谨,对学生也十分真诚,去年曾来学校进行指导

极目新闻
2026-10-07 01:50:11
国庆高速数据彻底打脸!油电大势已定,再也回不去了

国庆高速数据彻底打脸!油电大势已定,再也回不去了

华庭讲美食
2026-10-06 02:59:29
中国航发动力:铸就航空“中国心”,五家上市公司协同发展谱新篇

中国航发动力:铸就航空“中国心”,五家上市公司协同发展谱新篇

终南听雨
2026-10-07 17:10:17
再见了康辉,再见了李梓萌,再见了朱迅,央视主持迎来疯狂大洗牌

再见了康辉,再见了李梓萌,再见了朱迅,央视主持迎来疯狂大洗牌

大眼妹妹
2026-10-06 22:31:58
拔出萝卜带出泥!王皓风波再次升级,报警竟意外将半个饭圈拉下水

拔出萝卜带出泥!王皓风波再次升级,报警竟意外将半个饭圈拉下水

棠棣分享
2026-10-07 07:40:16
刚刚,诺贝尔物理奖爆冷!82岁狂人一人独揽,凿穿南极冰川

刚刚,诺贝尔物理奖爆冷!82岁狂人一人独揽,凿穿南极冰川

新智元
2026-10-06 18:52:40
2026-10-07 18:48:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14143文章数 142744关注度
往期回顾 全部

科技要闻

诺贝尔化学奖揭晓,两位科学家摘得大奖

头条要闻

地雷风波升级 金与正强硬发声:就是野兽也都不能进出

头条要闻

地雷风波升级 金与正强硬发声:就是野兽也都不能进出

体育要闻

从骑马舞到开口全中文 德约在北京不止七冠

娱乐要闻

吴奇隆举旗活动取消,不赚钱也守立场

财经要闻

谷歌签下科技史上最大核能协议

汽车要闻

智能化再提升 2027款东风标致、东风雪铁龙新车更人性化了

态度原创

时尚
亲子
艺术
公开课
军事航空

赫本的小黑裤,裤装界的气质王者

亲子要闻

宝蓝和叔叔玩过家家扮演大人,叔叔藏起来吃零食不让宝蓝找到

艺术要闻

颜真卿随手写的三件草稿,看着歪歪扭扭,却被评价:水平在《兰亭序》之上!

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

外舰跟监遵义舰 结果自己先"趴窝"了

无障碍浏览 进入关怀版