网易首页 > 网易号 > 正文 申请入驻

看懂不等于做对:VA-Bench测出大模型空间智能的执行断层

0
分享至



大模型已经越来越会「看懂」空间:它能判断物体在机械臂哪一侧,也能识别该操作哪个目标、理解任务怎么做。但如果真的把机械臂交给它,问题会变得更具体:该移动多少毫米?当前视角够不够?抓空以后,又该怎么调整?

VA-Bench 测试了 12 个主要多模态模型。表现最好的几组模型,在目标识别与定位(TL)上达到100%,操作语义理解(MS)也达到99.6%—100%;但完整任务成功率只有约一半:Qwen3.8-max、Opus-5 和 GPT-5.6-sol 分别为53.93%、52.86%和 51.55%。

目标找对了,任务也看懂了,为什么真正动起来以后,还是只有大约一半能成功?对于这些情况来说,模型真的「理解」了空间吗?

这正是 VA-Bench 想测的问题。



  • 论文标题: VABench: Measuring Embodied Spatial Intelligence through Visual Demonstrations, Active Perception, and Metric Control
  • 论文链接:https://arxiv.org/pdf/2609.19554
  • 项目主页:https://github.com/zhangzhongbo2213/VABench
  • Huggingface paper: https://huggingface.co/papers/2609.19554

空间智能,不能只停在「答对」

很多空间推理 Benchmark 已经能评估深度、距离、三维关系和多视角理解,但通常由评测者提前决定「模型看什么、回答什么」。真正进入机器人环境后,模型还要自己判断当前信息是否足够;如果不够,就决定缺什么、该从哪里继续观察。新的视觉证据补齐后,再把空间判断落到具体动作,并根据执行结果决定是否修正。

因此,真正面向物理行动的空间智能,不应该止步于回答一个已经定义好的空间问题。围绕这一点,我们提出了VA-Bench(Vision-Action Benchmark),把空间智能放进一个完整的闭环:

Observe → Reason → Act → Revise,即「观察 → 推理 → 行动 → 修正」。



图 1:VA-Bench 与传统空间评测的对比。

VA-Bench 要求模型真正进入机器人与环境的交互过程。测试前,模型观看成功示范视频,理解任务怎么做,但不会获得物体坐标、专家轨迹或精确动作参数;测试中,它可以主动切换视角,但会消耗交互步数,必须在继续观察和开始行动之间做出取舍。

最后,空间判断还必须真正落到动作上。模型需要直接给出具体的移动距离和旋转角度,并决定什么时候打开或闭合夹爪。



图 2:主动观察与执行过程示例。

14 类任务,280 个基础场景

VA-Bench 包含14 类机器人操作任务,其中有11 类单臂任务和 3 类双臂任务,每类 20 个经过物理验证的场景,共 280 个基础场景。

此外还设置了几何迁移和长时序组合测试,进一步追问:换一个空间布局,模型还能重新判断怎么做吗?会做若干独立操作,又是否意味着能够把它们稳定地串成更长的任务?



表 1:VA-Bench 基础任务设置。

目标找对了,为什么还是做不对

从整体结果看,表现最好的几组模型完整任务成功率只有约一半,但子任务完成率达到65.9%—68.6%。这说明很多失败并不是模型完全不知道怎么做,而是已经完成了其中不少步骤,却没能把整个任务稳定做完。

进一步拆解模型的执行过程,当前的困难主要集中在三个环节:从目标识别到精细空间执行、从错误发现到在线修正,以及从单臂操作到双臂协同。



图 3:VA-Bench 的主要实验结果。

找到目标,不等于能精确移动到目标。

前三的模型在目标识别与定位(TL)上全部达到100%,在操作语义理解(MS)上也达到99.6%—100%。但到了更精细的空间执行阶段,例如接触前的细粒度分析(FG)、与目标之间的空间关系判断(SR)等,成绩开始明显下降。

一个模型完全可能准确找到一个瓶子,却在夹爪还没有下降到合适高度时提前闭合;也可能理解「需要把物体放进容器」,却无法稳定判断物体与容器之间精确的高度、深度和接触位置。

会发现错误,也不等于能及时改回来。

Qwen3.8-max、GPT-5.6-sol 和 Opus-5 在错误发现(ED)上的得分分别达到73.6%、70.8%和 69.9%,但到了真正的在线修正(OC),三者分别只有46.7%、27.3%和 32.4%。模型已经越来越能发现「哪里不对」,但还不擅长把新的观察迅速转化成有效修正。

一只机械臂已经不容易,两只更难。

当任务从单臂进一步进入双臂协同时,这种困难又被进一步放大。Qwen3.8-max 在单臂任务上的平均成功率达到65.61%,但双臂任务只有11.11%;Opus-5 从64.09%降至 11.67%。



表 2:单臂、双臂及整体任务成功率。

这类任务的难点并不只是「多控制一只机械臂」。模型还需要判断哪只机械臂负责哪个物体、两只机械臂之间应该保持怎样的相对位置,以及不同动作应该按什么顺序衔接。任何一个环节的空间判断出现偏差,都可能让后续动作无法继续。

多给几个视角,就能解决问题吗

如果直接把更多视角一次性提供给模型,是不是就不需要主动观察了?为此,VA-Bench 设置了一组对照实验:一种情况下,模型每次只看到当前视角,但可以根据当前任务需要主动切换观察方向;另一种情况下,模型直接获得5 个固定视角,但不能继续自主选择新的观察位置。



表 3:主动观察与固定五个视角的结果对比。

结果非常一致:4 个模型在失去主动观察能力以后,成功率全部下降。

主动观察真正重要的地方,可能并不是让模型单纯地「多看」,而是让它知道自己还缺什么,以及下一眼应该去哪里找答案。

换个布局、拉长任务,能力还剩多少

几何迁移测试保持任务目标和操作流程不变,只改变物体形状、容器或空间布局。Qwen3.8-max 的成功率从77.86%降至 67.86%,GPT-5.6-sol 则从80.00%降至 47.86%。

模型知道一种操作怎么完成,并不意味着进入新的空间布局后,还能重新建立正确的空间关系。



表 4:几何迁移与长时序组合测试结果。

类似的问题在更长的执行过程中被进一步放大。VA-Bench 设置了一个五个物体的长时序组合任务,Qwen3.8-max 最终完成了61/100 次物体放置,GPT-5.6-sol 完成了53/100 次。

有的模型能够完成不少中间步骤,但整个任务却没有任何模型完整完成过一次。会做几个独立操作,不代表模型就能在长任务中持续稳定执行。

从「看懂」走向真正的空间智能

VA-Bench 看到的不是简单的「会」或「不会」,而是一系列更具体的能力边界:模型可以找到目标,却未必能精确移动到目标;可以发现错误,却未必能及时修正;可以获得更多画面,却未必知道当前最需要看哪里;可以完成几个独立步骤,却未必能稳定完成更长的任务。

今天的多模态大模型已经越来越会「看懂」物理世界,但从理解到可靠行动之间,仍然存在明显距离。

VA-Bench 想做的,就是把这段距离测出来。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
凌晨在北京离世?同时和8个男友恩爱?75岁刘晓庆私生活谣言离谱

凌晨在北京离世?同时和8个男友恩爱?75岁刘晓庆私生活谣言离谱

秋姐居
2026-10-07 09:42:47
山东舰升级改造接近尾声,即将解锁歼35,国产四航母未来都将用上五代机

山东舰升级改造接近尾声,即将解锁歼35,国产四航母未来都将用上五代机

军武吐槽君
2026-10-07 16:18:37
除了喝酒,刘欢还有一个生活习惯,让他从 104 斤胖到快 200 斤!

除了喝酒,刘欢还有一个生活习惯,让他从 104 斤胖到快 200 斤!

荆楚寰宇文枢
2026-10-05 23:34:48
最亲华的欧洲领导人也要凉了,学默克尔每年访华,突然就翻车了

最亲华的欧洲领导人也要凉了,学默克尔每年访华,突然就翻车了

健身狂人
2026-10-07 06:27:29
专家发现:老人若从不喝牛奶,比起喝牛奶的人,身体会有 5 种区别

专家发现:老人若从不喝牛奶,比起喝牛奶的人,身体会有 5 种区别

路医生健康科普
2026-10-07 09:25:03
不查不知道 一查吓一跳,身价千万独居北京的王曼昱,私底下有多

不查不知道 一查吓一跳,身价千万独居北京的王曼昱,私底下有多

兵鉴史
2026-10-07 16:58:04
WTT中国大满贯捷报:男单爆冷!日乒主力遭4连杀!亚运冠军一轮游

WTT中国大满贯捷报:男单爆冷!日乒主力遭4连杀!亚运冠军一轮游

北纬的咖啡豆
2026-10-07 09:32:12
手握重兵也白搭!缅北“副总司令”昆明落网,中国法律不会惯着

手握重兵也白搭!缅北“副总司令”昆明落网,中国法律不会惯着

爱意随风起呀
2026-10-06 17:08:00
彼得森23+3+3无缘今日最佳!对不起,你碰到不讲理的勇士11号秀了

彼得森23+3+3无缘今日最佳!对不起,你碰到不讲理的勇士11号秀了

微评体育圈
2026-10-07 12:36:04
宏远晚报!大外即将到位,胡明轩喊话挑战上海,杜锋爱将闯下大祸!

宏远晚报!大外即将到位,胡明轩喊话挑战上海,杜锋爱将闯下大祸!

体坛卡卡说
2026-10-07 19:05:39
俄乌停火,中国买单?特朗普演都不演了,欧乌的请求要让中国应下

俄乌停火,中国买单?特朗普演都不演了,欧乌的请求要让中国应下

顾蔡卫
2026-10-06 10:50:31
水均益晒14岁龙凤胎,国外读书花销大,全靠他一人在北京赚钱养家

水均益晒14岁龙凤胎,国外读书花销大,全靠他一人在北京赚钱养家

梦想的旅途照进现实
2026-10-07 15:22:40
多名游客无视“不要踩踏”提示进入桂林阳朔一农田拍照,当地:已接到反馈,会协调处理

多名游客无视“不要踩踏”提示进入桂林阳朔一农田拍照,当地:已接到反馈,会协调处理

潇湘晨报
2026-10-07 13:07:11
好人没好报?蔡天凤案曝最无耻一幕!开水煮、轮流上、仅冰山一角

好人没好报?蔡天凤案曝最无耻一幕!开水煮、轮流上、仅冰山一角

青杉依旧啊啊
2026-10-05 10:25:32
特朗普:对伊朗的军事行动 “必须收尾了”,唯一要考虑的问题是以哪种方式收尾,是以柔和的方式或是强硬的方式

特朗普:对伊朗的军事行动 “必须收尾了”,唯一要考虑的问题是以哪种方式收尾,是以柔和的方式或是强硬的方式

极目新闻
2026-10-07 16:43:06
凌晨3点踹开房门!缅北四大家族以为来谈条件,10分钟后全部戴铐

凌晨3点踹开房门!缅北四大家族以为来谈条件,10分钟后全部戴铐

水泥土的搞笑
2026-10-07 16:25:17
号称世界第一的华西医院到底有多强?输了两天液,发现医生一直在骂同行

号称世界第一的华西医院到底有多强?输了两天液,发现医生一直在骂同行

华庭讲美食
2026-10-06 12:20:28
确认了!印度要申办奥运会!

确认了!印度要申办奥运会!

五星体育
2026-10-07 16:21:43
杀疯了!上市首日暴涨近十倍之后连跌6天蒸发70%,入场的全部被套?

杀疯了!上市首日暴涨近十倍之后连跌6天蒸发70%,入场的全部被套?

趋势清风侠
2026-10-07 17:17:02
珠海游客怒了!一盘皮皮虾480元,游客自费800元投流,曝光珠海一家海鲜大排档,网友:就在海洲路,出名了

珠海游客怒了!一盘皮皮虾480元,游客自费800元投流,曝光珠海一家海鲜大排档,网友:就在海洲路,出名了

火山詩话
2026-10-05 06:35:30
2026-10-07 20:12:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14143文章数 142744关注度
往期回顾 全部

科技要闻

诺贝尔化学奖揭晓,两位科学家摘得大奖

头条要闻

男子带妻子和10岁娃爬山走野路 用手机照亮半夜没走出

头条要闻

男子带妻子和10岁娃爬山走野路 用手机照亮半夜没走出

体育要闻

从骑马舞到开口全中文 德约在北京不止七冠

娱乐要闻

蔡康永风波再升级!这次谁也救不了他

财经要闻

谷歌签下科技史上最大核能协议

汽车要闻

智能化再提升 2027款东风标致、东风雪铁龙新车更人性化了

态度原创

健康
艺术
手机
游戏
公开课

刷酸祛痘,为什么有人翻车?

艺术要闻

吴冠中 84岁画的风筝,358.4万港元!

手机要闻

还得是苹果!iPhone Duo 强制 APP 适配,不适配直接下架,安卓办不到

《守望先锋》第5赛季推出Doctrine,黑影转支援、路霸重做

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版