网易首页 > 网易号 > 正文 申请入驻

Fable5仅做对3.5%!大模型会看图,但还没有主动视觉

0
分享至





视频链接:https://mp.weixin.qq.com/s/d0dmowGeef3z3UO12BYMqg



01|视觉,为什么是一条闭环?

人类看图时,不会先在大脑中拍下一张「截图」,再闭眼推理。思考过程会不断引导我们的目光:找到一个线索,形成一个假设,再回到图像里验证它。

这套闭环有长期的心理学基础。经典著作《眼动与视觉》(1967)发现,同一幅画在不同问题下会引发截然不同的眼动轨迹:观看并非由图像单向决定,任务目标和中间假设会持续重定向注视。《视觉与视觉意识的感觉—运动理论》(2001)进一步把「看见」理解为掌握视觉输入如何随观察行为而变化;《自然行为中的眼动》(2005)则表明,人们在真实任务中会按需回看环境。《破解视觉知觉的「真正」谜题:作为外部记忆的世界》(1992)将这种策略概括为把外部世界当作可以反复查询的「外部记忆」,而不是把所有细节一次性存入大脑。

这种能力和真实应用息息相关。车间工作需要在一桌相似的零件中找到目标、检查差异;医生要在整张影像中逐区搜索并统计可疑病灶;旅行者要沿地图跨过一个个岔路,持续确认自己仍在正确路径上。每一次新发现都会改变下一次查看的区域,下一次观察又会反过来修正判断;只看懂大意远远不够。



基于以上动机,我们发布了 ActiveVision——一个专门测量这种「主动观察」能力的视觉推理基准。ActiveVision 包含 17 个任务和 3 类能力:

● 全局扫描(distributed scanning):在整张图里找全、数全

● 顺序追踪(sequential traversal):沿一条结构一步步走到底

● 属性迁移(visual attribute transfer):跨区域记住并比较细微视觉属性

ActiveVision 的三类任务也直接对应心理学中已知的基础视觉操作。《视觉数量辨别》(1949)和《为什么少量与大量目标的计数方式不同?》(1994)表明,少量目标可以被快速「瞬时计数」,数量增加后则需要逐项扫描;《曲线追踪:空间关系知觉的一种可能的基本操作》(1986)将沿轮廓追踪视为串行的注意过程;《视觉工作记忆对特征及其组合的容量》(1997)说明,跨区域比较受到视觉工作记忆容量限制,需要在目标与参照之间反复切换。《视觉程序》(1984)进一步指出,这类基础操作需要由注意力逐步执行。ActiveVision 将这些经典实验中的基础操作转化为可以直接测量模型的三类任务。



图 1|主动观察的真实应用与 ActiveVision 任务设计。

02|一道接近 9 倍的鸿沟

评测结果很明确:在没有使用外部工具的情况下,GPT-5.5 在所有模型中取得最高分 10.6%(9/85);而 3 位人类参与者的平均准确率为 96.1%(94.1%~97.6%)。两者之间存在接近 9 倍的差距。

即使是这个最高分模型,也在 17 个任务中的 11 个上拿到 0 分。



图 2|纯 CoT 模型与人类的准确率对比:最高分模型与人类仍相差近 9 倍。

提高推理强度也无法缩短差距。GPT-5.5 从不思考、直接回答,到使用最高推理强度,每题成本增长了超过两个数量级,其准确率仅从 2.4% 提升到 10.6%;Fable 5 在最高推理强度下的准确率只有 3.5%,反而在更低推理强度时达到 5.9%。

「还想得不够久」解释不了这些结果。更直接的迹象是,正确的视觉证据没有被稳定地带回推理过程。

从错误模式看,问题也很一致:全局扫描时漏数,顺序追踪时从起点直接猜终点,属性迁移时用语言先验替代真正的跨区域比较。模型能生成一段听起来合理的解释,却无法稳定完成「获取证据—保存中间状态—回到图像验证」的闭环。

模型看到了图,却未能持续观察其中的物体。



图 3|纯 CoT 模型的准确率与每题成本。

03|给它代码,能不能替它看?

那如果给模型代码、裁图、测量和其他视觉工具呢?

我们把同一套题交给 3 个工具型 Coding Agent 进行测试,得到的分数明显上升:Fable 5 + Claude Code 为 50.6%,GPT-5.5 + Codex 为 37.6%,Opus 4.8 + Claude Code 为 24.7%。不过,和人类的 96.1% 相比,仍有很大差距。

Agent 擅长把「看」改写成「算」:通过阈值分割、连通域、路径追踪等方法拆分题目,试图解决它们。不过,一旦真实纹理导致分割结果破碎,或追踪器在交叉处串线,Agent 往往无法察觉这些工具输出错误。

而且,这些提升并不均匀。3 个 Agent 在容易通过裁图、模板匹配或几何测量解决的属性迁移任务上达到了 43%~66%;到了必须准确穿过交叉点、持续跟踪方向和当前位置的顺序追踪任务,Codex 只做对 1/25,Opus 4.8 只做对 3/25,而 Fable 5 也只有 10/25。工具只有在「看」能被可靠地改写成一套计算时,才真正有效。

瓶颈没有消失,只是从「看图」转移到了「检查自己有没有看错」。

而且,使用 Agent 的代价不小:每题平均花费 12~15 分钟,API 等价成本达到 2.74~7.63 美元;人类平均约 34 秒,且不依赖任何工具即可完成。

工具会计算,但不会替你保持注视。





图 4|工具型 Agent 成绩与典型失败案例。

04|怎样造出一场「看不完就答不对」的考试?

为了避免结论依赖几张手工挑选的「刁钻图」,ActiveVision 的每道题都先由确定性程序生成:位置、形状、曲线、拓扑和标准答案全部已知;再用 GPT-image-2 将其重绘成照片级场景,同时保持决定答案的结构不变。这样,每个任务都可以从新种子继续生成,答案精确、可复现,又不会让模型靠熟悉的卡通模板取巧。

例如,闭合区域可以变成航拍视角下的田野与河流,箭头链可以变成由脚印连接的彩色石块,曲线可以变成漂流木上的绳索。生成器负责把已知结构「翻译」成材质、光照和纹理;解题者却必须反过来从像素中恢复全局结构。

同时,为了避免模型看一次图就记住全部内容、不再看图,ActiveVision 中的所有元素均出现在连续采样的任意位置,形状逐题重新生成,路线沿随机曲线展开。模型无法依赖网格坐标、命名形状或固定路径,只能在推理过程中反复回到图像,逐步寻找、追踪并核验视觉证据,而不能只看一眼、压缩成摘要后直接作答。

ActiveVision 把重点放在感知能否持续参与推理;描述一张图只是起点。

  • 论文:https://arxiv.org/abs/2607.16165
  • AlphaXiv:https://www.alphaxiv.org/abs/2607.16165
  • 项目主页:https://activevision.dev
  • 数据集:https://huggingface.co/datasets/activevisionai/ActiveVision
  • 评测代码:https://github.com/saccharomycetes/ActiveVision



图 5|ActiveVision 数据生成流程:确定性程序、精确答案与真实照片重绘。

作者介绍

张家瑞是南加州大学计算机科学博士生,由 Willie Neiswanger 教授指导。本科毕业于清华大学,研究方向包括多模态感知与推理及 AI-for-Science。主页:https://saccharomycetes.github.io/

陶沐孜是南加州大学计算机科学博士生,师从马学喆教授。本科毕业于上海交通大学 ACM 班,研究方向包括多模态学习、理解与生成,关注多模态模型的细粒度视觉感知与生成能力。主页:https://muzi-tao.github.io/

王上上是南加州大学计算机科学博士生,由 Willie Neiswanger 教授指导。本科及硕士毕业于上海科技大学。研究兴趣包括大语言模型推理、后训练、强化学习以及 AI-for-Science。主页:https://shangshang-wang.github.io/

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
快讯!李在明政府回应了!

快讯!李在明政府回应了!

故事终将光明磊落
2026-09-04 12:48:09
罗体:麦克托米奈将于下周二在利物浦市接受心脏手术

罗体:麦克托米奈将于下周二在利物浦市接受心脏手术

懂球帝
2026-09-04 17:40:05
曝景甜与孙宇晨闹掰的真相:男方设局想套牢她,5000万美金是房款

曝景甜与孙宇晨闹掰的真相:男方设局想套牢她,5000万美金是房款

生命之泉的奥秘
2026-08-29 20:53:20
俄专家警告:称霸世界250年的美国,撞上如今中国,罕见慌了!

俄专家警告:称霸世界250年的美国,撞上如今中国,罕见慌了!

军机Nova
2026-09-03 00:22:12
随着中国女篮61-94美国,产生6个不争的事实,女篮扛旗人表现糟糕

随着中国女篮61-94美国,产生6个不争的事实,女篮扛旗人表现糟糕

南海浪花
2026-09-04 22:14:49
钱小豪自曝私生活,63岁独守广东豪宅,十年无性婚姻,叹生活无聊

钱小豪自曝私生活,63岁独守广东豪宅,十年无性婚姻,叹生活无聊

风月得自难寻
2026-09-05 00:44:31
最高院:微信交易后对方更改了微信号和昵称,如何证明是同一人?

最高院:微信交易后对方更改了微信号和昵称,如何证明是同一人?

周军律师聊案子
2026-09-04 11:39:37
蔡国庆每月给弟弟蔡军发2万工资,发了20年,一共480万,条件就一个:在家全职照顾得阿尔茨海默症的母亲

蔡国庆每月给弟弟蔡军发2万工资,发了20年,一共480万,条件就一个:在家全职照顾得阿尔茨海默症的母亲

LULU生活家
2026-09-02 19:51:47
全球首款乙肝治愈药物,正在申请中国上市

全球首款乙肝治愈药物,正在申请中国上市

第一财经资讯
2026-09-04 23:19:52
护照丢失,无缘世界杯!李月汝再次发声,态度明确,宫鲁鸣回应了

护照丢失,无缘世界杯!李月汝再次发声,态度明确,宫鲁鸣回应了

萌兰聊个球
2026-09-04 07:26:22
小司机兵败如山倒!塞尔比单杆64分清台,4-0夺赛点,147先生冲4强创纪录?

小司机兵败如山倒!塞尔比单杆64分清台,4-0夺赛点,147先生冲4强创纪录?

刘姚尧的文字城堡
2026-09-04 21:43:46
造谣抹黑中国,阿根廷官员被要求向国会解释

造谣抹黑中国,阿根廷官员被要求向国会解释

环球网资讯
2026-09-04 06:53:47
女性长期使用情趣用品,身体可能出现哪些不适?不少人缺乏认知

女性长期使用情趣用品,身体可能出现哪些不适?不少人缺乏认知

看世界的人
2026-08-07 09:22:50
郑某(31岁,中国籍)自曝杀人动机:两人曾恋爱,受害学生威胁要向校方公开关系,害怕因此失去教职工作

郑某(31岁,中国籍)自曝杀人动机:两人曾恋爱,受害学生威胁要向校方公开关系,害怕因此失去教职工作

南方都市报
2026-09-04 13:09:04
国家医保局:灵活就业人员等参加职工医保将更便利

国家医保局:灵活就业人员等参加职工医保将更便利

界面新闻
2026-09-04 10:26:15
美国母子经历平行时空?一只2008年北京奥运杯,11年后竟离奇复裂,网友晒出相似经历...

美国母子经历平行时空?一只2008年北京奥运杯,11年后竟离奇复裂,网友晒出相似经历...

北美省钱快报
2026-09-02 04:42:09
被当街扒裤的女子回应了:她是女主播,打她的女人找不到老公了,怀疑她是小三

被当街扒裤的女子回应了:她是女主播,打她的女人找不到老公了,怀疑她是小三

汉史趣闻
2026-09-02 18:57:28
莆田失联人员家属:凌晨山体滑坡掩埋房屋,九旬外婆和六旬舅舅失联,应急局:救援人员已全部投入救援中

莆田失联人员家属:凌晨山体滑坡掩埋房屋,九旬外婆和六旬舅舅失联,应急局:救援人员已全部投入救援中

极目新闻
2026-09-04 22:56:21
亚运会中国体育代表团名单公布 36名奥运冠军领衔出战

亚运会中国体育代表团名单公布 36名奥运冠军领衔出战

新京报
2026-09-04 11:00:04
知名演员(白某,36岁)宣布破产:不敢买咖啡,甚至想接雨水洗澡

知名演员(白某,36岁)宣布破产:不敢买咖啡,甚至想接雨水洗澡

黎兜兜
2026-09-04 23:09:27
2026-09-05 02:12:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13921文章数 142729关注度
往期回顾 全部

科技要闻

OpenAI深夜王炸!GPT-6 Astra来了

头条要闻

莆田凌晨山体滑坡掩埋房屋 居民:外婆和舅舅失联

头条要闻

莆田凌晨山体滑坡掩埋房屋 居民:外婆和舅舅失联

体育要闻

小卡来去10首轮,快船7年彩礼一场空

娱乐要闻

古天乐公司欠债1.49亿

财经要闻

姚洋:刺激消费要守住两个“大西瓜”

汽车要闻

搭载天枢领航Ultra 长安启源Q06预售14.79万元起

态度原创

本地
教育
亲子
数码
公开课

本地新闻

扒完小作文,富豪们私藏的度假胜地有多绝

教育要闻

小学下发通知,家长会要求穿白上衣、黑裤或过膝长裙,不得穿吊带等随意服饰,学校回应

亲子要闻

孩子为什么不愿意跟你说心里话

数码要闻

首发玄戒O3!卢伟冰回应小米18 Fold定价:一万多起步 和苹果比肯定物超所值

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版