网易首页 > 网易号 > 正文 申请入驻

Fable5仅做对3.5%!大模型会看图,但还没有主动视觉

0
分享至





视频链接:https://mp.weixin.qq.com/s/d0dmowGeef3z3UO12BYMqg



01|视觉,为什么是一条闭环?

人类看图时,不会先在大脑中拍下一张「截图」,再闭眼推理。思考过程会不断引导我们的目光:找到一个线索,形成一个假设,再回到图像里验证它。

这套闭环有长期的心理学基础。经典著作《眼动与视觉》(1967)发现,同一幅画在不同问题下会引发截然不同的眼动轨迹:观看并非由图像单向决定,任务目标和中间假设会持续重定向注视。《视觉与视觉意识的感觉—运动理论》(2001)进一步把「看见」理解为掌握视觉输入如何随观察行为而变化;《自然行为中的眼动》(2005)则表明,人们在真实任务中会按需回看环境。《破解视觉知觉的「真正」谜题:作为外部记忆的世界》(1992)将这种策略概括为把外部世界当作可以反复查询的「外部记忆」,而不是把所有细节一次性存入大脑。

这种能力和真实应用息息相关。车间工作需要在一桌相似的零件中找到目标、检查差异;医生要在整张影像中逐区搜索并统计可疑病灶;旅行者要沿地图跨过一个个岔路,持续确认自己仍在正确路径上。每一次新发现都会改变下一次查看的区域,下一次观察又会反过来修正判断;只看懂大意远远不够。



基于以上动机,我们发布了 ActiveVision——一个专门测量这种「主动观察」能力的视觉推理基准。ActiveVision 包含 17 个任务和 3 类能力:

● 全局扫描(distributed scanning):在整张图里找全、数全

● 顺序追踪(sequential traversal):沿一条结构一步步走到底

● 属性迁移(visual attribute transfer):跨区域记住并比较细微视觉属性

ActiveVision 的三类任务也直接对应心理学中已知的基础视觉操作。《视觉数量辨别》(1949)和《为什么少量与大量目标的计数方式不同?》(1994)表明,少量目标可以被快速「瞬时计数」,数量增加后则需要逐项扫描;《曲线追踪:空间关系知觉的一种可能的基本操作》(1986)将沿轮廓追踪视为串行的注意过程;《视觉工作记忆对特征及其组合的容量》(1997)说明,跨区域比较受到视觉工作记忆容量限制,需要在目标与参照之间反复切换。《视觉程序》(1984)进一步指出,这类基础操作需要由注意力逐步执行。ActiveVision 将这些经典实验中的基础操作转化为可以直接测量模型的三类任务。



图 1|主动观察的真实应用与 ActiveVision 任务设计。

02|一道接近 9 倍的鸿沟

评测结果很明确:在没有使用外部工具的情况下,GPT-5.5 在所有模型中取得最高分 10.6%(9/85);而 3 位人类参与者的平均准确率为 96.1%(94.1%~97.6%)。两者之间存在接近 9 倍的差距。

即使是这个最高分模型,也在 17 个任务中的 11 个上拿到 0 分。



图 2|纯 CoT 模型与人类的准确率对比:最高分模型与人类仍相差近 9 倍。

提高推理强度也无法缩短差距。GPT-5.5 从不思考、直接回答,到使用最高推理强度,每题成本增长了超过两个数量级,其准确率仅从 2.4% 提升到 10.6%;Fable 5 在最高推理强度下的准确率只有 3.5%,反而在更低推理强度时达到 5.9%。

「还想得不够久」解释不了这些结果。更直接的迹象是,正确的视觉证据没有被稳定地带回推理过程。

从错误模式看,问题也很一致:全局扫描时漏数,顺序追踪时从起点直接猜终点,属性迁移时用语言先验替代真正的跨区域比较。模型能生成一段听起来合理的解释,却无法稳定完成「获取证据—保存中间状态—回到图像验证」的闭环。

模型看到了图,却未能持续观察其中的物体。



图 3|纯 CoT 模型的准确率与每题成本。

03|给它代码,能不能替它看?

那如果给模型代码、裁图、测量和其他视觉工具呢?

我们把同一套题交给 3 个工具型 Coding Agent 进行测试,得到的分数明显上升:Fable 5 + Claude Code 为 50.6%,GPT-5.5 + Codex 为 37.6%,Opus 4.8 + Claude Code 为 24.7%。不过,和人类的 96.1% 相比,仍有很大差距。

Agent 擅长把「看」改写成「算」:通过阈值分割、连通域、路径追踪等方法拆分题目,试图解决它们。不过,一旦真实纹理导致分割结果破碎,或追踪器在交叉处串线,Agent 往往无法察觉这些工具输出错误。

而且,这些提升并不均匀。3 个 Agent 在容易通过裁图、模板匹配或几何测量解决的属性迁移任务上达到了 43%~66%;到了必须准确穿过交叉点、持续跟踪方向和当前位置的顺序追踪任务,Codex 只做对 1/25,Opus 4.8 只做对 3/25,而 Fable 5 也只有 10/25。工具只有在「看」能被可靠地改写成一套计算时,才真正有效。

瓶颈没有消失,只是从「看图」转移到了「检查自己有没有看错」。

而且,使用 Agent 的代价不小:每题平均花费 12~15 分钟,API 等价成本达到 2.74~7.63 美元;人类平均约 34 秒,且不依赖任何工具即可完成。

工具会计算,但不会替你保持注视。





图 4|工具型 Agent 成绩与典型失败案例。

04|怎样造出一场「看不完就答不对」的考试?

为了避免结论依赖几张手工挑选的「刁钻图」,ActiveVision 的每道题都先由确定性程序生成:位置、形状、曲线、拓扑和标准答案全部已知;再用 GPT-image-2 将其重绘成照片级场景,同时保持决定答案的结构不变。这样,每个任务都可以从新种子继续生成,答案精确、可复现,又不会让模型靠熟悉的卡通模板取巧。

例如,闭合区域可以变成航拍视角下的田野与河流,箭头链可以变成由脚印连接的彩色石块,曲线可以变成漂流木上的绳索。生成器负责把已知结构「翻译」成材质、光照和纹理;解题者却必须反过来从像素中恢复全局结构。

同时,为了避免模型看一次图就记住全部内容、不再看图,ActiveVision 中的所有元素均出现在连续采样的任意位置,形状逐题重新生成,路线沿随机曲线展开。模型无法依赖网格坐标、命名形状或固定路径,只能在推理过程中反复回到图像,逐步寻找、追踪并核验视觉证据,而不能只看一眼、压缩成摘要后直接作答。

ActiveVision 把重点放在感知能否持续参与推理;描述一张图只是起点。

  • 论文:https://arxiv.org/abs/2607.16165
  • AlphaXiv:https://www.alphaxiv.org/abs/2607.16165
  • 项目主页:https://activevision.dev
  • 数据集:https://huggingface.co/datasets/activevisionai/ActiveVision
  • 评测代码:https://github.com/saccharomycetes/ActiveVision



图 5|ActiveVision 数据生成流程:确定性程序、精确答案与真实照片重绘。

作者介绍

张家瑞是南加州大学计算机科学博士生,由 Willie Neiswanger 教授指导。本科毕业于清华大学,研究方向包括多模态感知与推理及 AI-for-Science。主页:https://saccharomycetes.github.io/

陶沐孜是南加州大学计算机科学博士生,师从马学喆教授。本科毕业于上海交通大学 ACM 班,研究方向包括多模态学习、理解与生成,关注多模态模型的细粒度视觉感知与生成能力。主页:https://muzi-tao.github.io/

王上上是南加州大学计算机科学博士生,由 Willie Neiswanger 教授指导。本科及硕士毕业于上海科技大学。研究兴趣包括大语言模型推理、后训练、强化学习以及 AI-for-Science。主页:https://shangshang-wang.github.io/

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
他接受纪律审查和监察调查

他接受纪律审查和监察调查

锡望
2026-09-04 11:50:20
千万不要给孩子这种暗示:他会深信不疑的,并用一生时间去验证

千万不要给孩子这种暗示:他会深信不疑的,并用一生时间去验证

户外阿毽
2026-09-03 13:17:36
景甜确实有天使般的面孔,魔鬼般的身材

景甜确实有天使般的面孔,魔鬼般的身材

小椰的奶奶
2026-09-04 03:46:54
埃尔多安必须明白,中俄都无法容忍,上合组织混进“第二个印度”

埃尔多安必须明白,中俄都无法容忍,上合组织混进“第二个印度”

王姐懒人家常菜
2026-09-04 10:04:39
中国女篮一场惨败,为何无人骂宫鲁鸣?实力差距太大+球迷早有预判

中国女篮一场惨败,为何无人骂宫鲁鸣?实力差距太大+球迷早有预判

老嗮说体育
2026-09-05 02:16:55
霸气!郑钦文击球遭干扰后训斥观众 中文怒吼:不要喊 全场瞬间安静

霸气!郑钦文击球遭干扰后训斥观众 中文怒吼:不要喊 全场瞬间安静

我爱英超
2026-09-04 07:43:43
你在飞机上遇见过哪些奇葩?网友:下次所有旅客排队一人给他一大嘴巴子

你在飞机上遇见过哪些奇葩?网友:下次所有旅客排队一人给他一大嘴巴子

带你感受人间冷暖
2026-09-05 00:05:20
玄学提醒:如果一个人还在穿着10年前的衣服,只说明几个问题

玄学提醒:如果一个人还在穿着10年前的衣服,只说明几个问题

木言观
2026-08-01 13:58:35
不止 20 万买名额!国羽塌方式风波背后:冠军掌权,潜规则如何演变成体系困局

不止 20 万买名额!国羽塌方式风波背后:冠军掌权,潜规则如何演变成体系困局

小兰看体育
2026-09-05 00:05:04
不查不知道,一查吓一跳!何九华富二代身份曝光,难怪和王鸥恋爱

不查不知道,一查吓一跳!何九华富二代身份曝光,难怪和王鸥恋爱

元宝课堂
2026-09-02 16:54:40
“牙膏第一股”高层大换血,上半年净亏468万

“牙膏第一股”高层大换血,上半年净亏468万

观察者网
2026-09-04 18:54:35
“蒋介石的日记不能信?”研究者说:谁会在私人日记里骂遍所有人,只为了骗后人?

“蒋介石的日记不能信?”研究者说:谁会在私人日记里骂遍所有人,只为了骗后人?

苏格拉高
2026-09-03 07:41:51
苹果iOS 27新增“iPhone接力”功能,两部手机可共用同一号码

苹果iOS 27新增“iPhone接力”功能,两部手机可共用同一号码

IT之家
2026-09-03 06:54:17
彻底劝退普通人!iPhone 18 Pro Max看着无敌,其实只适合2类人

彻底劝退普通人!iPhone 18 Pro Max看着无敌,其实只适合2类人

时尚的弄潮
2026-09-04 10:14:41
公安再三提醒!家里没现金也不安全,这3样东西最容易被偷

公安再三提醒!家里没现金也不安全,这3样东西最容易被偷

椰青美食分享
2026-09-04 11:42:34
婚后发现老公还在自慰,我问他为什么,答案让我重新思考婚姻

婚后发现老公还在自慰,我问他为什么,答案让我重新思考婚姻

山野纪事2
2026-09-04 18:35:07
河南省13个市新一届市委书记当选(附简历)

河南省13个市新一届市委书记当选(附简历)

新浪财经
2026-09-04 22:46:44
物业起诉你欠物业费?法官问为啥不交,记住用这三句话回答

物业起诉你欠物业费?法官问为啥不交,记住用这三句话回答

小鹿姐姐情感说
2026-09-02 00:13:46
男子给爱车贴膜忘记去掉图片水印,取车时看到满车字母懵了;老板:特意找了技术好的师傅来贴复杂图案

男子给爱车贴膜忘记去掉图片水印,取车时看到满车字母懵了;老板:特意找了技术好的师傅来贴复杂图案

浙江卫视
2026-09-03 14:13:05
女教授知三当三旧照曝出:小眼大脸长相老实,花10年瓦解导师家庭

女教授知三当三旧照曝出:小眼大脸长相老实,花10年瓦解导师家庭

触摸史迹
2026-09-05 00:57:38
2026-09-05 03:07:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13921文章数 142729关注度
往期回顾 全部

科技要闻

OpenAI深夜王炸!GPT-6 Astra来了

头条要闻

莆田凌晨山体滑坡掩埋房屋 居民:外婆和舅舅失联

头条要闻

莆田凌晨山体滑坡掩埋房屋 居民:外婆和舅舅失联

体育要闻

小卡来去10首轮,快船7年彩礼一场空

娱乐要闻

古天乐公司欠债1.49亿

财经要闻

姚洋:刺激消费要守住两个“大西瓜”

汽车要闻

搭载天枢领航Ultra 长安启源Q06预售14.79万元起

态度原创

艺术
家居
旅游
本地
手机

艺术要闻

吴柳、郑柳、林风柳,各有各的“柳”氓!

家居要闻

2026建博会(广州) 公装联探展交流活动

旅游要闻

不负天赐好地方,知子罗的落寞与温柔,读懂岁月变迁!

本地新闻

扒完小作文,富豪们私藏的度假胜地有多绝

手机要闻

荣耀MagicOS 11充电体验大升级:兼容PPS快充、新增自定义充电上限

无障碍浏览 进入关怀版