网易首页 > 网易号 > 正文 申请入驻

何恺明团队新作:看猫片就能学会ARC挑战

0
分享至

克雷西 发自 凹非寺
量子位 | 公众号QbitAI

教会AI做ARC抽象推理题的,竟然是猫猫?



何恺明团队最新论文提出了NAT-ARC,一套纯视觉的ARC解题方案。

它不靠LLM,用ImageNet上的猫狗花草做预训练,让模型学会「看」,再迁移到抽象格子推理上。

结果,NAT-ARC表现最好的单模型在ARC-1上跑出了63.4%的pass@2分数,集成后达到70.2%。



这是纯视觉方案首次逼近专用LLM系统的水平。

ARC,公认最难的AI视觉智力测验之一,给你几个彩色格子的输入输出示例,让你推断背后隐藏的变换规则,再应用到新格子上。

过去的主流解法清一色把格子翻译成文字或符号,交给LLM推理。

这篇论文偏不,甚至预训练阶段连ARC格子都没用上。

模型看真实世界学来的视觉能力,就水灵灵地迁移到了完全抽象的彩色格子推理上。

ARC赛道,视觉方案崛起

ARC全称Abstraction and Reasoning Corpus,由Keras之父François Chollet在2019年提出。

ARC里每道题的格式很统一,一块最大30×30的二维格子,最多10种颜色,题目给2到5组输入输出示例,挑战者需要从示例中推断出隐藏的变换规则,再把这条规则应用到一个全新的输入格子上,预测它的输出。



这些问题听起来像看图找规律的儿童智力题,但ARC对AI来说极难。

一方面,每道题的变化规则都不一样,没有固定模板可背。

还有就是数据量极少,两三个示例就要归纳出抽象规则,并且精确执行。

这种组合让ARC成了测量AI抽象推理能力的标杆。

目前ARC赛道上占据统治地位的几乎全是大语言模型方案,这些方案的共同思路都是把格子翻译成文本或符号序列,交给语言模型处理。



视觉路线后来才开始崛起。

一批研究者走了一条完全不同的路,他们不把格子翻译成文字,改成了用视觉模型直接处理格子图像。

其中最重要的一步来自同一个MIT团队提出的VARC,这个方法把ARC重新定义为条件图生图翻译任务,用19M参数的视觉模型跑到54%。



LoopViT在这个框架上加入循环推理机制,18M参数达到65.8%。

Loop-OWM用视频预训练模型做few-shot,10.6M参数达到68.5%。

这些模型的参数量比LLM方案小了几个数量级,但效果已经开始追平。



但视觉路线依然有一个结构性短板。

LLM之所以能在ARC上越做越好,核心原因之一是它们通过海量语料预训练,积累下了通用能力,模型越大、预训练越充分,在下游任务上的scaling就越明显。

而多数视觉ARC方案的模型从随机初始化开始训练,没有吃到预训练的红利。

在此基础上,NAT-ARC的目标就是给视觉路线补上预训练这一步,试着打通它的scaling瓶颈。

看完猫猫,挑战ARC

NAT-ARC的核心思路,是在VARC的视觉流程前面插入一步ImageNet MAE预训练。

MAE,Masked Autoencoder,是何恺明在FAIR时期2022年提出的自监督视觉预训练方法。

其训练过程,是把一张图片遮住大部分区域,让模型从剩下的碎片里把原图复原出来。

通过这个任务,模型就可以理解物体的形状、结构和空间关系。



NAT-ARC的做法是把MAE在ImageNet(包含约130万张猫狗花草等自然图像的数据集)上训出来的encoder权重直接拿来初始化视觉编码器,decoder则从随机初始化开始训练。

整个流程分三步。


  • 第一步,用ImageNet上的MAE预训练encoder;

  • 第二步,在ARC训练集上离线训练整个编解码器;

  • 第三步,在测试时对每道题单独做LoRA微调。

微调阶段,每道题只有2到5组示范对,模型用这几组示范试图从中“学会”这道题的规则。

有个细节值得注意,NAT-ARC直接用了MAE的公开checkpoint,没有额外花一分钱预训练。

不过,这个checkpoint原本是为更大尺寸的ImageNet图片设计的,而ARC格子只有64×64像素,尺寸差异很大。

为了适配,NAT-ARC丢弃了原始的patch embedding和位置编码,只保留backbone权重,换成2D RoPE作为位置编码。

简单说,NAT-ARC只保留了MAE在ImageNet上学到的视觉特征提取能力,而把与ImageNet图像尺寸绑定的空间感知部分全部丢掉,用更灵活的方式重新学习。



但为什么看猫狗照片学到的东西,能帮到抽象格子推理?

论文用注意力可视化给出了一条线索。

研究人员把三种初始化方式(无预训练、ImageNet MAE预训练和ARC风格格子MAE预训练)的模型放在同一道ARC题前,观察它们在还没开始训练ARC之前的注意力分布。

结果很明显,随机初始化的模型注意力均匀分散,毫无重点;而ImageNet预训练过的模型已经能区分前景和背景,注意力自动聚焦到格子中有意义的图案区域上。

这个模型从来没见过ARC格子,它在ImageNet上学到的「把物体从背景里认出来」的能力,在ARC格子上天然生效了。



研究人员进一步做了任务级拆解。

他们筛出了15道预训练后显著提升的ARC题目,手动标注后发现这些题集中在两类任务上。

其中6道属于match-and-copy,模型需要识别出匹配的对象、颜色或图案,再把对应的结构复制到输出中;

另外6道属于connected-component reasoning,模型需要识别、填充或重新着色空间上连通的区域。

这两类能力恰好对应自然图像里的视觉先验。



在ImageNet上看猫学到的「把猫从草地背景里分出来」,到了ARC里变成了「把这块连通的彩色区域从格子里认出来」。

视觉世界和抽象世界的底层逻辑,在物体分组、图案匹配、区域分割这些操作上,原来共享同一套表征。

从猫猫中来,到猫猫中去

NAT-ARC最终在ARC-1上的成绩如下。

表现最好的单模型采用huge尺度,参数量0.6B,pass@2成绩达到63.4±0.7%。

集成时,研究人员把三种不同预训练策略(无预训练、ImageNet MAE预训练、ARC风格格子MAE预训练)分别训出的模型池化在一起做多数投票,拿到70.2±0.6% pass@2,总参数量约2B。

作为参照,专门针对ARC微调的The ARChitects拿到71.6%,用的是8B的语言模型。

视觉路线用四分之一的参数量,打到了专用LLM系统的城下。



数字之外,这篇论文最重要的一个发现,就是预训练打通了视觉路线的scaling瓶颈。

没有预训练时,模型越大效果反而越差;加上预训练后,scaling才开始代理正收益。

先看训练曲线。在离线训练阶段,用了ImageNet预训练的模型收敛速度明显更快,在base、large、huge三个尺度上都是如此,最终精度也更高。



但最有意思的发现藏在scaling曲线里。

没有预训练时,模型从base到large性能还能涨,但从large到huge反而掉点了。

模型变大,效果变差,这在深度学习里不是常见现象,说明ARC这个任务的数据量实在太少,模型容量增长带来的不是更强的泛化而是过拟合。

而加上ImageNet预训练后,scaling曲线变得健康了,base、large、huge三个尺度一路向上,模型越大效果越好。



论文里最酷的一个实验是一个可视化验证。

研究人员训了一个autoencoder,把ImageNet图像映射到一个60×60、10种颜色的离散格子表示上,相当于把一张猫片「翻译」成了ARC格子。

然后,他们用NAT-ARC对这个格子执行ARC变换,旋转180°、加一圈蓝色边框,再解码回像素。

结果,猫确实被转了,边框也确实加上了。这个从猫猫里训练出的模型,又在任务里回到了猫猫之中。



这个实验把「自然图像和ARC格子共享同一套表征空间」从统计数字变成了可视化证据。

在ARC格子上学会的变换规则,可以直接应用到自然图像的潜在表示上,反过来也一样。

抽象规则和视觉表征之间的连接,是这两个世界本来就有的。

作者简介

论文一作Xiaoman Delores Ding,MIT CSAIL成员,来自何恺明组。

她同时也是VARC的一作,这篇NAT-ARC相当于在自己上一篇工作的基础上继续往前推。

其余作者包括胡珂雅(Keya Hu),是何恺明首批女弟子之一,本科毕业于上海交通大学。

还有Katelyn Gan和Victor Yin,同样来自MIT,两人都是本科生,且均在CSAIL担任student researcher。

通讯作者何恺明不必多说,他是ResNet和MAE的作者,从这两个工作几乎可以串起近十年视觉AI的主线。

他从进入MIT后持续产出视觉基础工作,这篇论文用的正是他自己四年前提出的MAE作为预训练工具,等于用自己的旧武器打通了一条新路。

VARC已被CVPR 2026接收,NAT-ARC是它的直接后续。

这个团队连续两篇论文坚持纯视觉路线解ARC,在LLM大行其道的赛道上,它们正在用实验数据不断突破视觉路线的天花板。

论文地址:
https://eccv.ecva.net/virtual/2026/poster/5527

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
套现146亿后跑路新加坡就能万事大吉?国家新规重拳出击:只要钱还在中国赚,拿了绿卡也照样得补税!申通前老板如意算盘,这下彻底落空了

套现146亿后跑路新加坡就能万事大吉?国家新规重拳出击:只要钱还在中国赚,拿了绿卡也照样得补税!申通前老板如意算盘,这下彻底落空了

人生录
2026-08-16 00:05:13
港圈流传着一种说法:刘嘉玲回香港组的局,王菲从不推脱。那英曾直言,阿菲这人谁约都难请,唯独刘嘉玲一喊就到。周星驰更典型

港圈流传着一种说法:刘嘉玲回香港组的局,王菲从不推脱。那英曾直言,阿菲这人谁约都难请,唯独刘嘉玲一喊就到。周星驰更典型

背包旅行
2026-09-09 18:38:20
高血脂多半是睡出来的?医生:血脂偏高的人,晚上睡觉牢记5不要

高血脂多半是睡出来的?医生:血脂偏高的人,晚上睡觉牢记5不要

芹姐说生活
2026-09-29 22:02:32
穿衣自由还是博眼球?孙千活动造型引发网友两极讨论

穿衣自由还是博眼球?孙千活动造型引发网友两极讨论

星Xin辰大海
2026-09-28 15:54:20
俄称乌“火烈鸟”导弹袭击莫斯科,基辅多处设施遭俄打击

俄称乌“火烈鸟”导弹袭击莫斯科,基辅多处设施遭俄打击

参考消息
2026-09-30 13:42:17
克洛普回应德国队"不够白"争论:这是"彻头彻尾的胡说八道"

克洛普回应德国队"不够白"争论:这是"彻头彻尾的胡说八道"

元气满分吖
2026-10-01 18:22:16
是谁举报那英唱《弯弯的月亮》?

是谁举报那英唱《弯弯的月亮》?

二湘空间
2026-09-30 08:00:20
陈浩民妻子用网红“雅典娜”事件,给孩子做安全教育

陈浩民妻子用网红“雅典娜”事件,给孩子做安全教育

韩小娱
2026-10-01 10:21:46
北京国安再拔头筹!被外媒评为国内最受欢迎球队,与皇马曼联同榜

北京国安再拔头筹!被外媒评为国内最受欢迎球队,与皇马曼联同榜

体坛鉴春秋
2026-10-01 20:50:36
都说英国早就没落,已经凉透了,凭啥还敢硬刚大俄

都说英国早就没落,已经凉透了,凭啥还敢硬刚大俄

寰球经纬所
2026-09-04 16:31:23
王平河:核桃为义断指(7/9)

王平河:核桃为义断指(7/9)

金昔
2026-10-01 15:25:29
索尼PS+10月会免被喷史上最差!没一个能玩的

索尼PS+10月会免被喷史上最差!没一个能玩的

游民星空
2026-10-01 12:44:13
金庸的4个孩子:大儿子19岁自缢,二儿子盗窃被抓,大女儿5岁失聪

金庸的4个孩子:大儿子19岁自缢,二儿子盗窃被抓,大女儿5岁失聪

猪小艳吖
2026-10-01 07:56:49
亚运逆转头号种子!王曦雨:首盘0-5时想到郑钦文 好榜样给我力量

亚运逆转头号种子!王曦雨:首盘0-5时想到郑钦文 好榜样给我力量

我爱英超
2026-10-01 21:23:35
封疆大吏蒋超良被判死缓:身家7.46亿,曾与许家印深度合作

封疆大吏蒋超良被判死缓:身家7.46亿,曾与许家印深度合作

一点沸
2026-08-28 19:43:46
空气炸锅的第一批受害者,已经出现了!

空气炸锅的第一批受害者,已经出现了!

丁香生活研究所
2026-09-27 12:03:58
普京签署法令限制俄公民携带现金出境

普京签署法令限制俄公民携带现金出境

名人苟或
2026-10-01 14:36:16
阿努廷访华4天走3城!弃用中泰一家亲,改口称中泰是兄弟姐妹

阿努廷访华4天走3城!弃用中泰一家亲,改口称中泰是兄弟姐妹

飘逸的云朵
2026-09-10 06:22:28
梅克被抢后!广东队拒绝签下莫兰德,NBA空间型中锋驰援亚帅?

梅克被抢后!广东队拒绝签下莫兰德,NBA空间型中锋驰援亚帅?

绯雨儿
2026-10-01 15:42:41
正本清源!前央视主持人阿丘不存在冒用国家行业组织品牌等行为

正本清源!前央视主持人阿丘不存在冒用国家行业组织品牌等行为

声情专递
2026-10-01 20:21:50
2026-10-02 02:52:49
量子位 incentive-icons
量子位
追踪人工智能动态
13429文章数 176574关注度
往期回顾 全部

科技要闻

5999元起!华为Mate 90系列发布

头条要闻

桂林市文促会深夜发布致歉信:向阿丘诚恳致歉

头条要闻

桂林市文促会深夜发布致歉信:向阿丘诚恳致歉

体育要闻

“今天的表现,我们可以昂首离开球场”

娱乐要闻

奚梦瑶晒四太豪礼!22只龙凤镯近300万

财经要闻

智谱发上亿Token 能挽回开发者信任吗?

汽车要闻

2027款极氪001将于明年一季度上市 现款猎装同步推新配色

态度原创

教育
亲子
健康
旅游
公开课

教育要闻

河北工业大学保研933人:最猛的不是计算机,是学物理的

亲子要闻

重新拥抱亲密:产后妈妈的温柔复兴之路

刷酸祛痘,为什么有人翻车?

旅游要闻

藏在黔北的小城湄潭,名字藏着古人的浪漫,读懂才知山水诗意!

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版