网易首页 > 网易号 > 正文 申请入驻

Metan:让AI学会改进"改进自己的方法",而不只是改进答案

0
分享至


你有没有想过,一个会自我改进的AI系统,最大的风险其实不是它改得不够好,而是它改得太"自由"了,改到把自己改坏了?

这听起来有点像那种老掉牙的科幻情节:机器人开始修改自己的程序,结果失控了。但在真实的AI研究里,这是一个非常具体、非常工程化的难题。研究者们发现,几乎所有让AI系统"自己改进自己"的方案,最后都被迫留一手,必须冻结住系统里的某一部分,不让它被修改,否则整个系统就会不稳定,甚至崩掉。

这就好比你想装修自己家的房子,你可以换家具、刷墙、改布局,但你不能把承重墙拆了,因为一旦承重墙动了,整栋房子都可能塌。如果没有这条底线,后果是什么?你可能今天觉得这样改更好,明天又觉得那样改更好,系统在不断的自我修改中失去参照,越改越乱,最后谁也不知道它现在到底是什么样子,能不能用。

但问题是,如果你永远不让承重墙动,你的"自我改进"能力就被锁死在一个很浅的层次上。用论文里的说法,这些系统实现的"元层级深度"大概只有2.5层。什么叫元层级深度?简单说,如果一个系统能修改自己的答案,这算1层;如果它还能修改"生成答案的方法",这算2层;如果它连"修改方法的方法"都能改,那才是3层、4层……层数越深,系统反思和进化的能力理论上就越强。但现实中,大多数系统卡在2到3层之间就上不去了,因为再往上,就得动那个不能动的"承重墙"。

这篇来自明尼苏达大学和首尔大学团队的论文,提出了一个叫Metan的系统,试图彻底绕开这个两难。它的思路挺巧妙的:既然承重墙不能动,那就别去改承重墙本身,而是让承重墙"看到"的东西越来越多。

一个从不变的操作,却能越挖越深

Metan的核心是一个叫Ω(读作"欧米伽")的东西。

Ω:一个固定不变的、由大语言模型驱动的操作,它的任务是"读取下面这层系统运行时留下的痕迹,连同产生这些痕迹的代码,然后写出改进这套系统的新代码"。

这个Ω自始至终都不会被修改,它就是那道"承重墙"。但Metan的聪明之处在于,它没有去动这道墙,而是不断地把墙"喂"给它自己上一次工作的产物,让它一层层往上叠。第一次运行,Ω看到的是最底层求解器留下的痕迹;第二次运行,Ω不仅看到求解器的痕迹,还看到了自己上一次写的代码;第三次运行,它看到的信息又比第二次多了一层。

这就好比一个老师在批改学生作业。第一次批改,老师只能看到学生这次考卷上的错题。但如果这个老师同时还能看到自己上次给学生的批注和建议,他就能判断:"上次我让他多做基础题,这个方法对不对?"到了第三次,老师甚至能回头看看自己最早的建议是不是走了弯路,及时纠正。如果老师每次批改都是从零开始,不记得自己之前说过什么,那他就永远只能一遍遍重复同样的诊断,永远发现不了"我上次给的建议其实是错的"这种更高层次的问题。这正是论文里强调的关键差异:普通的自我修正循环只能看到"发生了什么",而Metan的Ω能看到"是什么导致了这件事发生"。

因为Ω这个操作本身从来不变,它就不可能把自己搞坏,系统的稳定性有了保障。而因为它每次接收的输入都在变大变丰富,每一层都能站在比上一层更高的位置去思考问题。深度不是提前设定好的,系统会一直往上叠,直到Ω发现"改不动了"为止,这时候就自然停止。

一个具体的例子:从崩溃到修复的四层进化

论文里举了个特别生动的例子,来自CO-Bench这个包含36个NP难组合优化问题的测试集。

有个任务叫"分配问题",第一层求解器写了一段代码,导入了scipy.optimize这个库来解题。可问题是,运行环境里根本没装scipy,程序直接崩溃,得分是0分。

如果是传统的那种"自我反思、重试"式循环,它会怎么做?它大概会反复尝试各种基于scipy的写法变体,因为它看到的只是"这次崩溃了",却看不到"为什么每次都崩溃"背后那个更深的规律。

但Metan的第二层Ω不一样。它一次性看了全部36个任务的运行记录,发现好几个任务都因为类似的依赖库缺失问题失败了。于是它写出了一条新的策略提示:"不要用scipy,这里给你一个校验工具函数",还附带了一个可复用的代码库函数。第二层求解器重新用纯代码实现了匈牙利算法,得分直接冲到1.0分。

事情本可以到这里就结束,但接下来更有意思。第三层Ω登场,它不光看到第二层的运行痕迹,还看到了第二层写的那段代码本身。它觉得"应该做更详尽的分析",于是加了一条"进行详尽法律分析"式的严格指令,结果这条指令反而把整体表现从0.807拖低到了0.773,虽然它附带的辅助函数是好的。

再往上,第四层Ω出场,它同时看到了前两层的代码和最新的运行结果,判断出问题不在辅助函数,而在第三层加的那条过度严格的指令上,于是把指令撤回,但保留了有用的辅助函数,分数最终恢复到了0.833。

这个过程特别像一个团队的项目复盘会。第一次开会,大家发现方案A行不通,提出方案B。第二次开会,有人觉得"要不要再加个更严格的检查流程",结果这个新流程反而拖慢了效率。第三次开会,如果只有"这次结果不好"这个信息,你很难判断到底是哪个环节出的问题。但如果这次开会有人把上一次的会议记录和当时提出的具体方案都摆出来对比,你就能精准定位:"是那条新流程的问题,不是原来的方案有问题",然后精准地把那一步撤回去,而不是把整个方案推翻重来。如果没有这种"带着历史决策记录去复盘"的能力,团队很可能因为一次判断失误,把之前所有有效的积累也一起丢掉。

这个案例其实揭示了Metan里一个很重要的机制,叫回滚。

回滚:更深层的Ω发现某个较浅层加入的策略反而拖累了整体表现时,主动把这条策略撤销,同时保留其中真正有用的部分。

论文的实验发现一个特别干脆的信号:回滚这个行为,在第二层里完全不存在,发生率是0%,但一到第三层,立刻跳到超过30%的比例。这说明"纠错"这个角色,不是系统天生就有的,而是只有当系统积累了足够的历史信息之后,才第一次有能力去做的事情。

策略和战术的乘法效应

除了纵向的深度积累,Metan还有一个横向的设计,叫作分层条件传递。

每一层在向下传递信息时,都会带上从上层继承来的"策略上下文",下层再基于这个上下文生成自己的具体指导。论文用一个数学上的说法解释了这样做的好处:假设每一层能表现出k种不同的行为方式,如果各层互相独立、不传递条件,那么整个系统能表现出的组合方式数量大概是各层k值相加;但如果每一层都基于上一层传下来的策略去调整自己,组合数量就变成各层k值相乘。用论文里的具体数字,四层深度、每层3种行为的情况下,独立模式能组合出9种可能,而有条件传递的模式能组合出27种可能。

这就像一个连锁餐厅的总部和分店关系。如果总部只是给每个分店发一份统一的标准菜单,不管分店所在地区的具体情况,那分店能做的调整非常有限,顶多是在几个固定选项里挑一个。但如果总部先根据"这是南方城市"这个大方向定下一个基调,分店再根据这个基调,结合本地口味做具体调整,那整个连锁体系能呈现出的差异化组合就会指数级增长。当然,这种灵活性也有代价,如果总部这次给的大方向本身判断错了,所有分店都会跟着受影响,这就是论文里讲的"层间干扰"问题。而Metan解决这个问题的办法,正是让更深的层能回头审视浅层的判断是否合理,该纠正就纠正。

进化式档案搜索:不把所有希望寄托在一条链上

单纯让Ω一层层往上叠,还有个隐患:万一某一层的Ω"想岔了",生成了一段很糟糕的代码,那整条改进链就断在这里了,即便换一个不同的思路本可能继续往上走。

为了解决这个脆弱性,Metan引入了进化式档案搜索机制。

进化式档案:系统同时维护多条并行发展的改进链条,每一轮从这些链条中挑选表现好的、以及被扩展次数较少的链条作为"父代",让Ω从这些父代出发,生成多个不同的"子代"改进方向,持续积累成一个不断扩大的候选池。

这套机制的效果体现在一个很直观的指标上,叫"档案最优"和"单链最优"之间的差距。档案最优是让不同的任务,各自去匹配表现最好的那条链条计算出的平均分;单链最优则是硬性要求所有任务都用同一条链条得出的分数。论文的数据显示,在CO-Bench这个基准上,两者之间存在0.06到0.07的差距,这个差距正是"允许不同任务采用不同策略"带来的额外收益。

这有点像高考志愿填报,如果一个学生必须用同一份复习计划应对语文、数学、英语三门课,效果肯定不如针对每门课单独定制复习策略。允许"因课制宜",整体成绩自然会更高,但代价是需要维护更多套并行的方案,消耗更多时间和精力去追踪管理。

实验结果:八个基准测试,全面领先

论文在两个不同的大模型底座上,也就是Gemma 4 31B-IT和GPT-5.2,分别测试了Metan,对比的是两个此前较有代表性的自我改进系统,Godel Agent和OpenEvolve。

Godel Agent:一个让AI代理直接修改自己源代码的系统,理论上能实现无限深度的自我修改,但为了防止系统崩溃,它必须硬性冻结一部分核心机制,比如它的动作调用接口。

OpenEvolve:一种进化式程序搜索系统,维护一批候选程序,通过变异和选择来逐步优化,但它的搜索循环本身是固定的,不会自我进化。

以下是几个核心基准上的对比数据。

在CO-Bench(36个NP难组合优化问题)上,Gemma底座下Metan的档案最优分数达到0.851,而OpenEvolve是0.814,Godel Agent只有0.451。在GPT-5.2底座下,这个差距进一步拉大,Metan达到0.870,比OpenEvolve的0.702高出0.168分。

在ARC-AGI-2这个专门设计用来"抗记忆"的抽象推理测试集上,差距变得不是量级上的,而是有和无的区别。这个基准的设计初衷就是让AI不能靠"记住某种技巧"来蒙混过关,只能靠真正抽象出新的规律才能解题。在这个测试上,OpenEvolve得分0.003,Godel Agent得分0.054,基本等于零,而Metan达到了0.331。

在LawBench中文法律条文的罪名预测任务上,Metan的档案最优是0.815,比Godel Agent的0.775高出0.040,比OpenEvolve的0.745高出0.070。

数学发现类基准AlphaEvolve Math上,Metan达到0.869(Gemma底座)和0.917(GPT-5.2底座),都明显领先两个基线系统。

值得一提的是,论文特别指出,Metan在ARC-AGI-2上的表现说明,这个基准原本被设计出来就是要"骗过"那些靠记忆套路解题的系统,而Metan能在这上面拿到分数,恰恰证明它的收益来自更高层次的抽象学习能力,而不是简单的技巧记忆。

一层拆开一层做的事:角色自动分化

论文里有个特别有意思的发现,就是即便Ω的提示模板从头到尾都没告诉任何一层"你应该负责什么角色",不同深度的层还是自发地演化出了不同的功能分工。

在偏向代码类的基准测试上(比如CO-Bench、AlphaEvolve Math),第二层大多是些通用的战术性工具函数,比如模拟退火算法、局部搜索算法这些放到哪个任务上都能用的东西。第三层开始转向针对具体任务类型的专门策略,同时也是层间冲突开始出现的地方。到第四层、第五层,系统的主要工作变成纠错和精细调整,不再重新设计整套方案。

而在偏向文本类的基准测试上(比如症状分类、法律条文分类),因为可操作的对象只有一段提示词,系统的每一层都是在提示工程的空间里打磨,始终没有跳出这个范围。

这个现象让我想到一个团队随着规模扩大自然出现的分工演变。团队刚成立的时候,大家做的事情都差不多,谁有空就上手干。团队做大了以后,自然会有人专门负责打基础工具、有人专门盯着某个业务线的细节问题、还会出现专门负责"纠正上一轮决策失误"的复盘角色。这种分工不是谁提前设计好流程图强制安排的,而是随着团队积累的经验和信息量增多,自然涌现出来的结果。如果团队一开始就人为规定每个人只能做固定的一件事,反而可能限制了这种基于实际情况自发调整的灵活性。

哪里管用,哪里不管用

论文也很诚实地指出了Metan的局限场景。

在AlgoTune这个算法加速基准上,带内部迭代能力的"多轮agentic"版本反而表现不如单轮的"single-shot"版本。原因是这个基准里的种子代码本身已经是经过预先优化的内核实现,Ω额外加进去的策略性提示,反而把本来已经很紧凑的代码搞得更受限制了。论文追查发现,主要的性能损失集中在两个FFT快速傅里叶变换相关的任务上。

这就像给一个已经打磨得很精细的瑞士军刀又硬塞进去几个额外的附加工具,结果反而让它变得笨重,不如原来简洁好用。当系统本身已经接近某种局部最优,而你继续给它加"建议",这些建议可能不是帮忙,而是添乱。

另外在SWE-Bench这样一个代码修复基准上,由于种子方案本身已经足够强,档案里表现最好的候选者始终就是最初的第0代方案,Ω从来没有被真正激活过。

论文对此的解释是,Ω的价值取决于两个条件同时满足:种子方案和理论上限之间要有足够的提升空间,同时任务的失败模式要足够多样化,能让不同层次去挖掘不同角度的问题。CO-Bench之所以受益最大,正是因为它包含36种截然不同的NP难问题,失败方式五花八门;而AlgoTune、SWE-Bench这类种子已经很强、问题相对单一的场景,自然就没什么施展空间。

拆解开来看,收益到底来自哪里

论文做了一系列消融实验,专门去拆解Metan的收益到底来自哪个部件。

结果显示,如果去掉层与层之间传递的那一小段策略上下文字符串,Gemma底座在CO-Bench上的分数会从0.845掉到0.751,损失0.094分,这占了整个递归收益的大约72%。

如果去掉代码库注入机制,分数从0.845掉到0.825,损失0.020分,占比大约15%。

如果直接去掉多层递归结构,变成单层改进,分数从0.845掉到0.714,损失0.131分。这个结果在GPT-5.2底座上也重复出现,在CO-Bench上损失0.080分,在AlphaEvolve Math上损失0.158分。

这个数据分布让人有点意外。原本可能会以为,让每一层都能写出实际可调用的代码函数,才是这套系统最厉害的部分。但实验证明,真正贡献大头的,反而是那条看起来最朴素的"策略上下文传递"机制,也就是各层之间传的那一小段说明性文字。这提示我们,有时候系统真正的瓶颈不是能力工具够不够丰富,而是信息传递的通路是不是打通了。

写在后面

读完这篇论文,我印象最深的不是分数领先了多少,而是那个回滚行为在深度2完全为零、深度3突然跳到30%以上的数据。

这个细节挺打动人的,因为它说明"能纠正自己的错误"这件事,不是靠喊口号就能实现的能力,而是必须先有"看到自己上一次决策的完整记录"这个前提条件,才能真正长出来。很多我们平时说的"反思能力""自我批评能力",其实底层逻辑也是一样的,没有历史信息的完整留存,反思就只是嘴上说说,落不了地。

还有一个地方值得琢磨,论文特意提到当前的实验设计里,底层求解器和顶层的Ω用的是同一个模型。这是为了做干净的对照实验,把"深度带来的收益"和"模型能力本身更强带来的收益"分开。但这也留下一个很现实的问题:如果真的拿一个更聪明的模型专门去当Ω,让它站在一堆相对弱的求解器上面进行统筹改进,收益会不会指数级放大?论文自己也承认这是还没验证的方向。

这让我想到公司里常见的一种组织设计问题:你到底应该把最聪明的人放在一线干活,还是放在制定方法论、指导别人怎么干活的位置上?这篇论文至少证明了一件事,给"负责改进流程的人"更多历史信息去参考,比给"具体执行的人"更多算力,可能是性价比更高的一条路。

Q&A

Q1:Metan是什么?

A:Metan是一个让AI系统自我改进的框架,核心是一个固定不变的元操作Ω,它反复读取自己之前生成的代码和运行记录,逐层构建出越来越深的改进层级,深度由收敛情况自动决定,而不是提前设定。

Q2:Metan和之前的Godel Agent、OpenEvolve有什么区别?

A:Godel Agent让AI直接修改自己源代码,但必须冻结部分核心机制以防崩溃;OpenEvolve用固定不变的进化搜索循环去优化候选程序。Metan则是让改进操作本身永远不变,只让它接收的信息越叠越多,从而既保证稳定又能实现更深层次的自我改进。

Q3:Metan在哪些任务上表现最突出?

A:在ARC-AGI-2这种专门设计来防止靠记忆套路解题的抽象推理测试上,Metan是唯一拿到有效分数的系统,得分0.331,而两个对比系统几乎为零。在CO-Bench组合优化和数学发现类基准上,Metan领先幅度也很明显。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
马斯克告诉前女友“他需要在内战爆发前拥有一大群孩子”,曾出价4000万美元让她签署保密协议

马斯克告诉前女友“他需要在内战爆发前拥有一大群孩子”,曾出价4000万美元让她签署保密协议

金融界
2026-09-09 10:09:32
教育部部长怀进鹏发文,教育或将大洗牌,网友:缩短学制 普及高中

教育部部长怀进鹏发文,教育或将大洗牌,网友:缩短学制 普及高中

混沌录
2026-09-09 10:11:27
突然宣布二胎,高调晒出照片,热搜炸了:你俩居然还没离婚?

突然宣布二胎,高调晒出照片,热搜炸了:你俩居然还没离婚?

LULU生活家
2026-08-28 20:08:31
美国首次承认:伊朗有能力用导弹攻击美国航母

美国首次承认:伊朗有能力用导弹攻击美国航母

看看新闻Knews
2026-09-09 18:47:58
伊朗:打死或俘虏美军奖3万美元,美国被驱逐已成事实,不得进入波斯湾、阿曼湾和霍尔木兹海峡!海湾国家对美国的愤怒已达最高点

伊朗:打死或俘虏美军奖3万美元,美国被驱逐已成事实,不得进入波斯湾、阿曼湾和霍尔木兹海峡!海湾国家对美国的愤怒已达最高点

每日经济新闻
2026-09-08 17:31:09
28岁《亢奋》女星脱到只剩内裤,新广告却强调“不赌生死不碰政治”

28岁《亢奋》女星脱到只剩内裤,新广告却强调“不赌生死不碰政治”

影视情报室
2026-09-10 00:26:57
斯科尔斯:切尔西无法争冠,他们在放恩佐走这件事上太讲情面

斯科尔斯:切尔西无法争冠,他们在放恩佐走这件事上太讲情面

懂球帝
2026-09-09 21:40:29
4款iPhone被称为“钉子户”,再用5年也不慌

4款iPhone被称为“钉子户”,再用5年也不慌

小蜜情感说
2026-09-07 04:13:48
嘴硬被打脸!撒谎被查尔斯当场抓包,哈里梅根这次彻底沦为笑柄!

嘴硬被打脸!撒谎被查尔斯当场抓包,哈里梅根这次彻底沦为笑柄!

白露文娱志
2026-09-09 16:15:44
宁德时代突然刷屏,午后股价翻红!股民:重大利好,要拉了

宁德时代突然刷屏,午后股价翻红!股民:重大利好,要拉了

金石随笔
2026-09-09 16:18:02
火化工作人员说出大实话:人死后,骨灰根本不需要保存!

火化工作人员说出大实话:人死后,骨灰根本不需要保存!

阿甘天天传
2026-09-04 11:54:49
一旦中国财政赤字货币化:对普通人意味着什么?

一旦中国财政赤字货币化:对普通人意味着什么?

生命可以承受之轻
2026-08-13 14:06:02
公开场合,菲律宾防长故意让我国下不来台,我外交部回应亮了

公开场合,菲律宾防长故意让我国下不来台,我外交部回应亮了

DS北风
2026-09-09 19:22:04
孙宇晨破防,全网实名批量投诉,他无法接受别人提孙割这个名字

孙宇晨破防,全网实名批量投诉,他无法接受别人提孙割这个名字

芊手若
2026-09-01 15:06:19
保守估计,黄智贤高峰期在大陆平台每年能赚100—300万人民币

保守估计,黄智贤高峰期在大陆平台每年能赚100—300万人民币

金牛传声
2026-09-09 12:34:41
消息称钉钉创始人无招回归阿里!阿里回应

消息称钉钉创始人无招回归阿里!阿里回应

鞭牛士
2026-09-09 19:00:26
摩尔线程三天暴跌27%,总市值蒸发2600亿:一场合法的资本收割,散户为何必输无疑!

摩尔线程三天暴跌27%,总市值蒸发2600亿:一场合法的资本收割,散户为何必输无疑!

清流财记
2026-09-09 22:31:51
西安电子科大入学考试数学难度大引热议 有人38分全校排188名 学校曾称目的是为选拔提供依据

西安电子科大入学考试数学难度大引热议 有人38分全校排188名 学校曾称目的是为选拔提供依据

红星新闻
2026-09-09 13:37:52
王晶说霸王别姬里,张丰毅完全接不住张国荣的表演?

王晶说霸王别姬里,张丰毅完全接不住张国荣的表演?

阿废冷眼观察所
2026-09-08 16:17:53
联合国儿童基金会回应“停捐后遭催捐”事件:视频中提及的公益机构并非联合国儿童基金会

联合国儿童基金会回应“停捐后遭催捐”事件:视频中提及的公益机构并非联合国儿童基金会

大风新闻
2026-09-09 10:42:04
2026-09-10 01:27:00
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
9809文章数 568关注度
往期回顾 全部

科技要闻

AI重大突破!OpenAI称解开近百年数学难题

头条要闻

男子资助女生5年后停止 遭质问"快打过来 不然曝光你"

头条要闻

男子资助女生5年后停止 遭质问"快打过来 不然曝光你"

体育要闻

16年后再破门,被皇马放弃的少年没认输

娱乐要闻

郭德纲的商业版图,藏着不知道的真相

财经要闻

知情人士证实DeepSeek备战科创板IPO

汽车要闻

腾势Z9GT易三方闪充尊越型32.98万元上市

态度原创

亲子
手机
健康
时尚
游戏

亲子要闻

太阳从西边出来了?女儿主动想学外语

手机要闻

荣旗科技:公司参与了苹果折叠屏手机VC散热的检测环节

中风康复为何像“抽丝剥茧”?

女人不管多大,都可以看看这些“条纹T恤”,非常减龄又简约

《怪物猎人:荒野》登陆Switch2 全新怪物登场!

无障碍浏览 进入关怀版