网易首页 > 网易号 > 正文 申请入驻

何恺明团队新作:给大模型加上“视觉记忆”,AGI基准测试从40分升到100分

0
分享至



同一个大模型,仅仅换了一套“看世界”和“记东西”的方式,成绩就能相差 60 分。

近日,MIT 电气工程与计算机科学系副教授、Google DeepMind 杰出科学家何恺明团队发表论文《VISTA:面向交互世界推理的视觉框架》。研究团队没有训练新的基础模型,而是在现有多模态模型外增加了一套视觉交互与记忆框架。

结果显示,接入 VISTA 后,模型在 ARC-AGI-3 的 25 个公开游戏中分数显著提升。Claude Opus 5 的得分从 40.68 分直接提升至 100 分,GPT-5.6 Sol 则从 13.33 分提升至 99 分,两个模型最终都顺利完成了全部公开关卡。


(来源:Arxiv)

作为一套面向多模态 Agent 的视觉交互框架,VISTA 主要解决两个看似基础、却长期影响 Agent 表现的问题:模型如何直接观察视觉环境,以及在长周期的连续交互中,如何保存并重新调用过去的信息。

ARC-AGI-3 是今年 3 月推出的一套 AGI 基准测试,由 ARC Prize 基金会主导,延续了 Keras 创始人 François Chollet 提出的 ARC 系列思路,主要考察模型面对陌生任务时的适应和推理能力。

与此前以静态图形题为主的 ARC 不同,ARC-AGI-3 把测试放进了动态交互环境。参与者进入一个从未见过的像素小游戏后,没有操作说明,也不会被直接告知目标,只能通过不断尝试,观察环境变化,逐步摸清规则并完成任务。


图|ARC-AGI-3 中的部分交互式游戏环境。(来源:ARC Prize)

这套测试不仅看是否通关,也会参考人类首次试玩时的表现,衡量智能体完成任务所需的环境操作次数。它希望测试的是一种更接近“流体智能”的能力:当现成知识无法直接给出答案时,系统能否通过有限的观察和试错快速理解陌生环境。今年 3 月测试发布时,前沿 AI 系统整体表现仍然很低;半年后,公开测试集已被多种 Agent 系统推进到接近满分甚至满分。

给模型一双“眼睛”和一本相册

VISTA 做的第一件事很简单,就是让模型直接“看“”画面。

ARC-AGI-3 的游戏本质上是一个 64×64 的彩色网格。此前提供给语言模型的最小接口,会把这些颜色逐格转换成数字,最终变成一长串文本。虽然信息本身没有丢失,但一个原本一眼就能看出位置、边界和形状的二维画面,就这样被拆成了 4096 个数字。

VISTA 把这一过程倒了回来。它直接将游戏画面以 PNG 图像交给多模态模型,让模型在视觉空间中判断物体在哪里、彼此是什么关系,再决定下一步操作。研究团队还专门比较了不同的信息呈现方式:同一个游戏既可以变成数字文本,也可以保持原本的二维画面,甚至还能重新渲染成三维场景。底层规则没有改变,改变的只是模型“看见”这个世界的方式。


(来源:VISTA 项目主页)

这种改动看起来并不复杂,但效果很明显。在论文的消融实验中,仅仅从数字文本改成直接看图,GPT-5.6 Sol 的得分就从 13.33 分提高到 47.32 分。

直接看图还有一个额外好处,更省上下文。论文估算,一个 64×64 的数字网格如果完整转成文本,大约需要 4000 个 Token;而同一画面以图像形式输入时,只需要约 300 个图像 Token。换句话说,把二维画面强行翻译成几千个数字,不仅让空间关系更难理解,也会挤占模型原本可以用于推理的上下文预算。

研究团队还发现,单纯把上下文窗口做得更大,并不会继续提高成绩。VISTA 默认使用约 20 万 Token 的上下文;当窗口扩大到约 78 万 Token 后,模型消耗的 Token 大幅增加,但成绩没有随之提升。相比把所有历史信息一直堆在上下文里,更有效的方式,是把原始信息保存下来,需要时再主动调取。

而这正是 VISTA 的第二个核心设计:无损视觉记忆(Lossless visual memory)。

一场 ARC-AGI-3 游戏可能持续数百次操作。模型第一次碰到某个机关时,往往并不知道这个变化意味着什么;直到几十步之后出现新的线索,才可能意识到自己需要重新检查当时的画面。如果早期画面已经被截断,或者只留下几句文字摘要,其中很多细节就再也找不回来了。

因此,VISTA 会把环境返回的每一帧画面按照时间顺序完整保存下来,包括一次动作触发的中间动画帧。模型不需要始终把这些图片塞在当前上下文里,而是在需要时主动调用 “inspect”,重新翻出几十步甚至上百步以前的画面;它也可以同时调出多张历史图片进行比较,或者放大其中某个区域。如果需要确认非常细微的差别,还可以通过 “read_pixels” 直接读取具体位置的像素信息。

研究团队把这种机制称为一种“显式注意力”。普通上下文里的记忆更接近于“希望模型还记得”,VISTA 则给了模型一套主动查档案的工具。它可以明确决定什么时候回看、回看哪一帧,以及具体查看画面的哪个位置。

这种机制放到游戏里就很好理解。比如模型点击一个橙色方块后,发现画面发生了变化,但一时无法判断其中的规律。它可以重新调出操作前后的几帧图像并排比较,观察哪些元素消失、哪些位置发生改变,再根据这些视觉证据修正自己的判断。

除此之外,VISTA 还给模型准备了两份很简单的文字笔记。`GUIDE.md` 用来记录已经比较确定的游戏规则,`WORKING.md` 则更像一张草稿纸,保存当前关卡的状态、正在验证的假设以及下一步计划。当一轮上下文快要用完时,模型可以先把关键进展写进笔记,再开启新的上下文继续游戏,而此前保存的历史画面和笔记仍然可以继续调用。

于是,VISTA 最终形成了一套相对完整的循环。模型先观察当前画面,根据已有信息形成判断,执行一次操作,再根据环境反馈修正对游戏规则的理解。如果发现线索不足,它还可以随时回看过去,而不是只能依赖当前上下文里的残余信息。


图|VISTA 的 Agent 工作循环。(来源:VISTA 项目主页)

消融实验也显示,真正拉开差距的正是这种“可以回头看”的能力。加入直接视觉输入和笔记后,GPT-5.6 Sol 的成绩已经提高到 70 分左右;当无损视觉记忆和主动回看能力加入之后,得分进一步跃升到 94 分以上,最终在加入精确像素读取后达到 99 分。

这组结果指向的其实是一种不同的 Agent 设计思路——与其不断扩大上下文窗口,让模型把所有经历始终“记在脑子里”,不如把原始经历完整地保存在外部,在真正需要的时候再把对应的信息找回来。VISTA 本身没有训练新的基础模型,也没有针对每一个游戏预先编写规则,它改变的只是模型观察、保存和重新调用信息的方式。

连续三次把 ARC 拉回视觉问题

其实,VISTA 并不是何恺明团队第一次尝试从视觉角度重新审视 ARC。

去年11月,团队发表了题为《ARC Is a Vision Problem!》的论文,首次提出 VARC。彼时 ARC 的主流解法高度依赖纯大语言模型,将二维网格矩阵翻译成数字、纯文本或代码脚本,再交由 LLM 去归纳其中的转换规律。何恺明团队采取了另一条路线,把 ARC 直接视为一个纯粹的“图像到图像”的视觉转换问题,仅使用一个约 1900万 参数的小型 Vision Transformer 从零训练。最终,VARC 在 ARC-1 基准上拿到了 60.4% 的准确率,追平了许多规模远大于它的大模型方案。


(来源:VARC 论文)

今年团队推出的第二项工作《Natural Image Pretraining Improves Abstract Reasoning》,则将这一思路向前推进了一步。团队发现,视觉模型此前在 ImageNet 这类自然图像数据集上学到的能力,即便表面上只是“认猫看狗”,与 ARC 抽象的彩色方格相距甚远,却能切实提升后续的抽象推理能力。

其深层原因在于,自然图像的预训练让模型形成了关于物体、边缘、前景与背景以及空间结构等视觉先验。引入这一先验后,Nat-ARC 的单模型在 ARC-1 上的得分提高到了 63.4%,组合多个模型后进一步达到 70.2%。

而到了 VISTA,研究的问题再次发生了延伸。前两项工作主要讨论“模型该如何从静态视觉中学习抽象规则”,VISTA 则开始直面动态的交互世界:画面在实时变化,过去的信息会转瞬即逝,Agent 必须通过不断试错、记忆、回看,再决定下一步行动。在这一过程中,视觉不再仅仅是一种输入格式,而是真正变成了整个闭环推理循环的一部分。

论文还将同一套框架迁移到了更多复杂环境中。将 ARC 游戏重新渲染为具有三维透视关系的场景后,VISTA 依然取得了 84.12分;在包含34款浏览器游戏的 GameWorld、AI GameStore,以及静态视觉推理基准 BabyVision 上,它的表现也普遍超越了使用同款基座模型但采用默认接口的版本。在 BabyVision 的测试中,仅仅是赋予模型主动放大局部细节的能力,其准确率就从 41.0% 直接提升到了 63.2%。

满分之后,Agent 到底该怎么测?

不过,这块“100 分”的成绩牌仍有一个重要前提,VISTA 刷满的是 ARC-AGI-3 的 25 个公开游戏。它还不能完全证明面对真正陌生任务时,模型也具备同样的泛化能力。

另一方面,在 VISTA 之前,ARC-AGI-3 公开集上已经出现过满分或接近满分的方案。不同的是,此前不少系统依赖程序合成,让大模型为具体游戏构建可运行的“世界模型”,再在模拟环境中验证规则和规划动作;VISTA 没有为每个游戏单独编写模拟器,而是直接让通用多模态模型观察、回看和理解视觉环境。

研究团队也指出,由于这些公开游戏早于 Claude Opus 5 和 GPT-5.6 Sol 发布,无法完全排除相关题目进入训练数据的可能。真正更严格的泛化能力,还需要尚未公开的私有测试集进一步检验。

但 VISTA 更值得关注的地方,也许并不只在于这张满分成绩单。它进一步暴露出 Agent 时代一个越来越重要的问题:我们测到的,究竟是模型本身的能力,还是整套系统的能力?

进入 Agent 阶段后,模型之外的感知接口、记忆机制、工具调用和上下文管理都会直接影响最终表现。VISTA 没有改变模型参数,却大幅提升了成绩,说明排行榜上的“模型能力”正在越来越多地由模型与外部系统共同决定。

这个变化在真实世界里会更加明显。无论是浏览器、电脑,还是未来的机器人,环境都不会主动把信息整理成适合模型理解的形式。智能体必须持续观察、记住关键状态,并在需要时重新调取过去的信息。

因此,VISTA 提出的其实是一条不同于继续扩大模型规模的路径。当基础模型能力逐渐增强后,如何让模型更好地看见、记住并理解外部世界,也可能成为下一阶段 Agent 能力提升的重要来源。

1. https://arxiv.org/abs/2610.02200

2. https://vista-research.github.io/

3. https://arcprize.org/blog/arc-agi-3-launch

4. https://arcprize.org/arc-agi/3

5. https://arcprize.org/competitions/2026/arc-agi-3

6. https://arcprize.org/leaderboard/community

7. https://arcprize.org/leaderboard

8. https://arxiv.org/abs/2511.14761

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
以色列:严禁拥有伊朗、伊拉克、黎巴嫩、阿曼、巴基斯坦、卡塔尔和沙特等27国单一或双重国籍的机组人员执飞或搭乘赴以航班

以色列:严禁拥有伊朗、伊拉克、黎巴嫩、阿曼、巴基斯坦、卡塔尔和沙特等27国单一或双重国籍的机组人员执飞或搭乘赴以航班

第一财经资讯
2026-10-05 09:08:21
轰6K飞行员霸气应对外机抵近:我就是界碑 我不退

轰6K飞行员霸气应对外机抵近:我就是界碑 我不退

看看新闻Knews
2026-10-04 23:55:56
国家安全部提醒:超10万份孕妇血样被偷运出境

国家安全部提醒:超10万份孕妇血样被偷运出境

闪电新闻
2026-10-05 12:08:50
时隔两年进中网16强!郑钦文2-1力克18号种子 首盘抢七险胜

时隔两年进中网16强!郑钦文2-1力克18号种子 首盘抢七险胜

醉卧浮生
2026-10-05 17:10:17
63岁刘欢病逝,戳穿最残酷的医疗真相:治病的金钱上限,只有100万…

63岁刘欢病逝,戳穿最残酷的医疗真相:治病的金钱上限,只有100万…

犀利强哥
2026-10-05 06:58:57
账号已在日本的蔡康永连累的不只罗永浩,还有一个押上赌注的女人

账号已在日本的蔡康永连累的不只罗永浩,还有一个押上赌注的女人

青辉
2026-10-05 15:48:48
孙千一口黄牙坐在CELINE秀场头排,旁边人牙白得反光,她愣是没贴片

孙千一口黄牙坐在CELINE秀场头排,旁边人牙白得反光,她愣是没贴片

西楼知趣杂谈
2026-10-04 17:52:11
金山花开海上格桑花进入最佳观赏期,持续到10月15日

金山花开海上格桑花进入最佳观赏期,持续到10月15日

文汇报
2026-10-05 18:24:05
罗永浩傻眼了,采访蔡康永的视频还有下半段没有放出,到底还放不放?

罗永浩傻眼了,采访蔡康永的视频还有下半段没有放出,到底还放不放?

蜜桔娱乐
2026-10-05 15:35:24
C罗尴尬处境曝光!热苏斯敞开大门,11月重返国家队OR彻底退出

C罗尴尬处境曝光!热苏斯敞开大门,11月重返国家队OR彻底退出

奥拜尔
2026-10-05 15:38:14
颐和园人员经费五年超15亿,人均绩效最高近14万元/年

颐和园人员经费五年超15亿,人均绩效最高近14万元/年

马小白
2026-10-05 11:05:59
缅北明家,给中国人起了个蔑称

缅北明家,给中国人起了个蔑称

极目新闻
2026-10-05 18:27:38
新加坡牵头20国,在联合国大会抛出提案,想给中美AI“立规矩”?

新加坡牵头20国,在联合国大会抛出提案,想给中美AI“立规矩”?

策前论
2026-10-04 18:08:07
真没想到!逼空姐下跪的那个人,东航直接把名字甩出来了:欧某某,照片也被网友扒出来了

真没想到!逼空姐下跪的那个人,东航直接把名字甩出来了:欧某某,照片也被网友扒出来了

火山詩话
2026-10-04 19:12:28
让领导先走,以色列斩杀哈马斯加沙最大头目

让领导先走,以色列斩杀哈马斯加沙最大头目

神不隆通
2026-10-05 12:35:28
成都3片回锅肉卖105元:老板说“就赚20块”,网友算完账沉默了!

成都3片回锅肉卖105元:老板说“就赚20块”,网友算完账沉默了!

大稻网络科技
2026-10-04 15:59:45
官方证实:鲍军峰在昆明落网

官方证实:鲍军峰在昆明落网

黄河新闻网吕梁
2026-10-05 15:33:58
新娘婚礼前两天被马蜂蜇伤,嘴唇肿胀自嘲“像蛤蟆精”,当事人:连夜就医,婚礼如期举行

新娘婚礼前两天被马蜂蜇伤,嘴唇肿胀自嘲“像蛤蟆精”,当事人:连夜就医,婚礼如期举行

极目新闻
2026-10-05 14:00:13
空姐被逼下跪后续!欧某某的面相、T恤被网友吐槽:真是求锤得锤自作自受

空姐被逼下跪后续!欧某某的面相、T恤被网友吐槽:真是求锤得锤自作自受

王老师你还好吗
2026-10-05 14:48:03
李在明:必须彻底收回亲日财产,让“亲日就能三代富,独立运动就三代穷”这样的话永不出现

李在明:必须彻底收回亲日财产,让“亲日就能三代富,独立运动就三代穷”这样的话永不出现

扬子晚报
2026-10-05 14:58:19
2026-10-05 19:52:49
DeepTech深科技 incentive-icons
DeepTech深科技
麻省理工科技评论独家合作
17341文章数 515225关注度
往期回顾 全部

科技要闻

2026年诺奖:三名科学家因光遗传学获奖

头条要闻

明珍珍被执行死刑前画面披露 接受采访神情淡定露微笑

头条要闻

明珍珍被执行死刑前画面披露 接受采访神情淡定露微笑

体育要闻

30天30队·热:扬尼斯、阿德巴约与克雷

娱乐要闻

胡歌现身游本昌遗体告别仪式

财经要闻

零跑声明切割!蔡康永两面人身份被抵制

汽车要闻

方程豹9月热销破4万 首款皮卡鲨鱼将于四季度上市

态度原创

房产
家居
教育
时尚
本地

房产要闻

保利大爆发,冲到榜一!海南楼市前三季度,热销榜出炉!

家居要闻

2026建博会(广州) 公装联探展交流活动

教育要闻

优秀班主任的4个绝招,这样做更容易走近孩子

像珊瑚一样生长:Balenciaga 的新生态

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

无障碍浏览 进入关怀版