网易首页 > 网易号 > 正文 申请入驻

给AI装个"临时脚手架",比换个更聪明的AI更有效

0
分享至


你有没有遇到过这种事:给同一个人不同的工具,他做事的效果天差地别。

一个厨艺不错的师傅,扔给他一堆散装食材和一口生锈的锅,做出来的菜可能还不如一个新手用全套设备、按标准流程操作。厨艺重要,但灶台、刀具、菜谱这些"外部装备"同样重要,甚至有时候更重要。

这篇论文讲的就是AI世界里的"灶台问题"。

**一个被忽视的事实:AI能力不完全取决于模型本身**

现在大家谈AI进步,说的都是模型参数从多少亿涨到多少亿,训练数据从多少T涨到多少T。但研究者们发现一件更微妙的事:把同一个AI大模型放进不同的"工作框架"里,它表现出来的能力可以差出一大截。

这个"工作框架"在专业圈子里叫做智能体协调壳,英文是agent harness。

**智能体协调壳**:就是包裹在AI模型外面的一套运行机制,决定AI要记住哪些历史信息、怎么拆解任务、能调用哪些工具、遇到问题怎么重试和纠错。

打个比方,同一个大厨,在装备齐全、动线合理的中央厨房里能同时炒十道菜,换到一个没有冰箱、灶台还漏气的小作坊里,可能连一道菜都做不好。厨师的手艺没变,变的是他所处的"操作环境"。AI也是一样,模型的推理能力没变,但如果协调壳设计得糟糕,比如记忆管理混乱、任务拆解不合理、工具调用不顺畅,再强的模型也发挥不出应有水平。

这篇论文的团队来自新加坡国立大学LV-Lab,他们做了一件挺大胆的事:训练了一个专门用来"造工作框架"的AI,取名JIT-Agent。它的任务不是回答问题,也不是写代码,而是根据你手头的具体任务,现场生成一套最适合这个任务的协调壳,然后把这套壳套在任何一个现成的大模型外面,让它干活。

**灵光一闻的起点:提前造好的框架,总是差一口气**

在JIT-Agent出现之前,业界已经有不少人在研究怎么优化这套协调壳。但他们大多遵循一种叫做"预先构建"的思路。

**预先构建**(Ahead-of-Time,简称AOT):先花大量时间和数据,打磨出一套"通用型"协调壳,希望它能应付未来各种各样的任务。

这条路子听起来挺合理,毕竟"磨刀不误砍柴工"。但问题也在这里:不同任务需要的"刀"根本不是一种刀。

论文里举了几个例子。做大范围信息搜索的任务,最好能同时开多条线索并行查证,像撒网捕鱼;做命令行终端操作的任务,反而适合精简的单线程循环,一步一步来,一多就乱;做深度研究类的任务,需要一个能装下大量检索证据的工作记忆区;而处理代码仓库类的任务,则天然需要一套文件系统来存补丁、测试结果和运行痕迹。

如果不管任务类型,硬要用一套"万能框架"去套所有情况,会发生什么?

就像给所有厨子发同一套厨具包,不管你是要炸油条还是熬慢炖汤。炸油条的师傅嫌锅太深不好控温,熬汤的师傅嫌灶火太猛容易糊底。表面上大家都有"厨具",实际上没人真正好用。

研究团队的判断是:合适的协调壳不仅跟任务领域有关,甚至跟每一个具体案例的细节都有关。想靠一套预先优化好的框架应付所有未来的任务,本质上是在赌"下一个任务长得像我练过的那些"。

于是他们提出了另一条路:**即时构建**。

**即时构建**(Just-in-Time,简称JIT):不预先固定一套框架,而是在接到具体任务的那一刻,现场生成一套专门为这个任务定制的协调壳。

这个思路换个说法就是"模型即协调壳":用一个训练好的元智能体(也就是JIT-Agent),在你需要它的瞬间,给你现场攒出一套合身的工作流程,再把普通的大模型塞进去执行。

**四个积木块搭出所有协调壳**

要让AI现场生成一套可执行的工作框架,不能天马行空地自由发挥,得有规矩。研究团队定了一套统一协议,把任何一个协调壳都拆解成四个模块。

第一个模块叫记忆模块,负责决定哪些历史交互信息要保留、以什么形式呈现给AI。

第二个模块叫规划模块,负责把当前的任务状态转化成下一步该干什么的具体指令。

第三个模块叫动作模块,负责把指令真正落地成一次工具调用或者最终输出,同时更新内部状态。

第四个模块叫能力编排模块,负责从一大堆可用的工具和技能里,挑出这一步真正需要暴露给AI的那几个。

这四个模块按照记忆到规划再到能力编排最后到动作的顺序串联,组成一整套闭环执行流程。

这套设计的巧妙之处在于,它把原本五花八门、写法各异的各种协调壳,统一成了一种"标准接口下的自由组合"。就像乐高积木,不管你想搭城堡还是搭赛车,零件的接口规格是统一的,变化的只是组合方式。

研究团队还专门搭建了一个叫HarnessFactory的代码库,里面用这套统一协议重新实现了13种业界已有的经典协调壳设计,比如大家熟悉的ReAct循环、还有更复杂的递归多智能体架构ROMA。这13个"样板"构成了一个种子库,后续训练全靠它们提供多样化的参考素材。

这里要澄清一个容易误解的地方:JIT-Agent生成的协调壳,规模确实比不上Claude Code、Codex这些成熟的商业级智能体运行时。研究团队自己在论文里坦率地说,这不是要复刻一整套工业级系统,而是想证明一件更基础的事:即便是紧凑的、现场生成的协调壳,也能带来实实在在的能力提升。

**三段式训练:先学着抄,再学着改,最后学着超越**

光有积木和图纸还不够,得让JIT-Agent真正学会"现场搭房子"这件事。研究团队设计了三个训练阶段,层层递进。

第一阶段叫定制化学习。

这一步的做法是找一个比JIT-Agent更强的"老师"模型,让它根据具体任务、协议规则、还有从种子库里抽出的三个参考样板,生成一份针对这个任务量身定制的协调壳。只有通过了协议校验和实际执行检验的生成结果,才会被留下来当作学习素材。

光靠模仿老师还不够,因为符合规范的协调壳之间,效果、速度、成本都可能差很多。所以团队又加了一层偏好学习:同一个任务下,如果一个协调壳比另一个奖励更高,同时速度和成本都不吃亏,那就把它标记为"更优选择",让JIT-Agent学会区分好坏,不只是学会"能跑"。

这就像教一个刚出师的厨子,不能只教他"这道菜能吃就行",还要教他"哪种做法更省时省料味道还更好"。如果只满足于能吃,厨子永远停留在及格线,永远学不会精进。

第二阶段叫故障修复学习。

第一阶段生成的协调壳不是每次都能顺利跑起来,有的会遇到编译错误、接口不匹配、运行时报错等各种问题。研究团队没有把这些失败案例直接扔掉,而是让老师模型对着失败案例和诊断报告,提出具体的修改方案,一步步把坏掉的协调壳修好。他们只保留在两轮修复以内就能修好的案例,专门训练JIT-Agent处理那种"差一口气就能跑通"的常见故障。

这个设计其实很贴近真实场景。想象一下修水管的师傅,大多数上门维修都不是把整套管道系统推倒重来,而是找到具体漏水的那一个接口,拧紧或者换个垫圈就解决了。如果每次故障都要求推倒重建,成本高得离谱,现场根本没法用。JIT-Agent学的正是这种"小修小补,快速止损"的本领。

第三阶段是整篇论文里最有意思的部分,叫演化式群体解耦策略优化。

**演化式群体解耦策略优化**(Evo-GDPO):一种让JIT-Agent在真实运行中不断自我提升的强化学习方法,核心思路是让新生成的协调壳去和历史最强记录比拼,只有真正超越现有最佳水平,同时不损失效率的设计才会被留下来。

具体做法是这样的:每一轮训练,系统会先从当前的"协调壳档案库"里挑出针对某个任务表现最好的那个版本,当作参照基准。然后让JIT-Agent同时生成好几个候选方案,拿去跑一遍真实任务,分别记录下奖励得分、耗时、花费这三项指标。

这里有个细节设计得很巧,效率方面的加分只有在候选方案的效果不输给基准时才会生效。换句话说,如果一个方案跑得更快但答案质量下降了,系统不会因为它"快"就给它加分。这就避免了AI学歪,专门去投机取巧地牺牲质量换速度。

这个机制让我想起体育竞技里的达标赛制。选手要打破纪录,前提是先达到及格线以上,单纯跑得快但摔倒了,不算破纪录。如果没有这道"及格线"的约束,系统很可能学会一种讨巧的策略,靠偷工减料换来的"高效率",实际上是在拿任务质量做交换。

跑完之后,系统会把奖励、速度、成本这三个信号分别标准化,再按权重合并,权重设计上明确让"任务效果"这一项的权重高于速度和成本的总和。这保证了整个演化过程始终以任务质量为第一优先级,速度和成本只是锦上添花的加分项。

经过这三段训练,JIT-Agent就具备了三种核心能力:接到新任务能现场造出合适的协调壳,造出来的壳出问题时能自己诊断修复,并且随着执行经验积累能不断进化出更强的版本。研究团队把这三种能力的组合叫做"协调壳智能"。

**实测效果:效率AI也能打出王牌表现**

理论说得再漂亮,最终还是要看数据。

研究团队把JIT-Agent分别套在GLM-5.2和DeepSeek-V4-Flash两个开源大模型外面,在九个不同类型的智能体测评基准上做了测试,涵盖深度研究、日常办公、复杂规划、多应用协同这四大类场景。

结果相当亮眼。装上JIT-Agent的DeepSeek-V4-Flash,在DeepSearchQA这个测试深度搜索能力的基准上,超过了商业闭源模型GPT-5.6,领先9.1分;在OdysseyBench这个考验多应用工作流协同的基准上,领先4.3分。而本来就比较强的GLM-5.2装上JIT-Agent之后,提升幅度最高能到20.2分。

九个基准综合下来,GLM-5.2的平均分从74.1涨到81.8,涨了7.7分;DeepSeek-V4-Flash的平均分从66.7涨到75.5,涨了8.8分。涨幅最大的场景出现在需要长时间维持状态、追踪多重约束的任务里,比如DeepSeek-V4-Flash在购物规划任务上从59.1分直接跳到83.9分,涨了24.8分。

这组数字背后的意思是,同一个模型,只是换了一套"工作方法",在某些任务上的表现能提升接近三分之一。这已经不是锦上添花的小优化了。

更值得琢磨的是成本这一块。研究团队把JIT-Agent生成的协调壳,拿去和市面上五套成熟的智能体运行时(包括Claude Code、Codex、OpenCode等)做了严格的控制实验,固定住底层大模型不变,只换协调壳。

结果显示,JIT-Agent在六个backbone与基准的组合里,四个拿到了最高分,并且在所有六个组合里都是消耗token和花费最低的。以DeepSeek-V4-Flash跑xBench-DS任务为例,token消耗从52.7万降到21.2万,费用从0.075美元降到0.039美元,而分数反而从78分涨到82分。

这说明JIT-Agent的优势不是靠"多想多算"堆出来的,而是真的更精准地组织了执行流程。这就好比两个人去超市买同样一份清单,一个人东逛西逛来回折返,花了一小时才买齐;另一个人提前规划好动线,二十分钟搞定,东西一样不少。多走的那四十分钟,不是因为超市变大了,是因为路线设计得差。

**流动的记忆:让经验在任务之间传下去**

JIT-Agent还支持一种叫流式推理的运作模式,这一点挺有意思。

正常情况下,每接到一个新任务,JIT-Agent都是独立生成协调壳,做完就扔,下一个任务重新来一遍,这叫静态推理。而流式推理不一样,它会把每次任务执行的反馈结果,记录进一个持续更新的协调壳档案库里,下一个任务来的时候可以直接检索这个档案库里表现最好的版本作为参考起点。

研究团队在购物规划、旅行规划、办公自动化这三个连续任务流上做了对比实验。结果是,流式版本在所有三个场景里,最终的累计准确率都超过了静态版本。而且伴随的耗费token数量和调用工具次数,跟静态版本基本处于同一量级,并没有靠"烧更多资源"换来的准确率提升。

这就好比一个新员工刚入职,第一周处理每个客户投诉都要从零摸索;但如果公司有个持续更新的案例库,记录着"上次遇到类似投诉,哪种处理方式效果最好",员工处理起来会越来越顺手,而且不需要额外加班加点,只是经验在悄悄积累。

论文里可视化展示了几个JIT-Agent实际生成的协调壳案例,挺有意思。

比如一个叫Palimpsest的案例,任务是从联系人卡片里筛选信息、排除某个人、排序、生成表格、发邮件。JIT-Agent给这个任务生成的协调壳,把整个流程组织成一张有依赖关系的任务图,前置步骤没完成,后面的步骤不会启动,而且中间产物会被存进一个专门的仓库,供后续步骤直接调取,不用重新翻聊天记录去拼凑。

另一个叫Trapdoor的案例,任务是一道需要多跳推理的身份识别题,线索横跨历史引语、大学合并事件、回忆录、学术论文这些完全不相关的领域。这种任务的不确定性太高,提前定好一张任务图反而会让AI过早锁死一条错误的调查方向。所以JIT-Agent给它生成的协调壳完全不同,采用的是动态分解规划,还专门造出了一个"委托"能力,让主流程可以随时开一个临时的子智能体去专门查某条线索,查完带着答案回来,主流程继续往下走。

同一个生成器,面对两个不同结构的任务,给出了两套完全不一样的设计方案,一个用严格的依赖图执行,一个用弹性的递归委托执行。这个对比本身就很说明问题:所谓"协调壳智能",不是记住了一套固定模板去套用,而是真正理解了任务结构,再据此现场设计执行方式。

**写在后面**

读完这篇论文,我印象最深的其实不是那些性能提升的数字,而是团队敢于把"造框架"这件事本身也变成一个可以训练、可以优化的对象。

我们通常习惯把AI能力提升想象成一件事:让底层模型更聪明。但这篇论文提醒我们,还有另一条完全不同的路径:让"驾驭模型的方式"本身变得更聪明。这两条路径不是互相排斥的,而是正交的,可以同时叠加。一个不那么强的模型,配上一套聪明的协调壳,能打败一个更强但用了糟糕框架的模型。

还有一个细节值得单独说一说。论文里提到,那些效率提升最大的案例,往往token消耗反而是下降的。这跟很多人对"AI变强需要更多算力"的直觉是相反的。JIT-Agent的提升不是靠让AI多想多算,而是靠让它别在不必要的地方浪费思考。这某种程度上也在提示一件事:很多所谓的"复杂任务处理能力不足",本质上不是模型脑子不够用,是它被放进了一个让它没法把脑子用在对地方的环境里。

这篇论文还留了一个没有完全展开的问题:如果协调壳可以被AI现场生成和演化,那么未来的基础模型,会不会干脆把"设计自己的执行环境"这件事,内化成自己的一种天生能力,而不再需要一个外部的JIT-Agent来帮它搭台子?那时候,模型和它的工作方式之间的边界,会变得越来越模糊。

Q&A

Q1:JIT-Agent是什么?

A:JIT-Agent是新加坡国立大学LV-Lab团队训练的一个元智能体模型,它的核心能力是根据具体任务现场生成定制化的智能体协调壳,再把这套协调壳套在任意一个现成的大模型外面,帮助它更好地完成任务。

Q2:JIT-Agent生成的协调壳真的比人工设计的框架更好用吗?

A:在受控对比实验中,JIT-Agent在多数场景下的任务表现优于Claude Code、Codex、OpenCode等成熟商业智能体框架,同时token消耗和费用都是最低的,平均能省下36%左右的成本。

Q3:使用JIT-Agent需要重新训练底层大模型吗?

A:不需要。JIT-Agent只是在推理时为任务生成一套外部的工作流程,底层大模型的参数保持冻结不变,它对DeepSeek、Qwen、Mimo等多个不同规模的模型家族都能带来一致的提升。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
后续,小女儿发声:去安徽找过父亲,给他买的衣和鞋不收

后续,小女儿发声:去安徽找过父亲,给他买的衣和鞋不收

阿凫爱吐槽
2026-09-09 15:13:43
心理学:雄性越是主动献殷勤越是拼命展示价值,越说明他对这场博弈心知肚明,当他突然不再表演了,不是放弃了而是雌性已经上钩了

心理学:雄性越是主动献殷勤越是拼命展示价值,越说明他对这场博弈心知肚明,当他突然不再表演了,不是放弃了而是雌性已经上钩了

心理观察局
2026-09-09 07:13:06
创纪录之战!谢尔顿3-2终结阿卡大满贯18连胜,3年后再进美网四强

创纪录之战!谢尔顿3-2终结阿卡大满贯18连胜,3年后再进美网四强

全景体育V
2026-09-09 15:38:13
两性关系:一个女人主动跟你说来例假了,其实是在告诉你这三句话

两性关系:一个女人主动跟你说来例假了,其实是在告诉你这三句话

周哥一影视
2026-09-09 04:34:13
预警来了!今天傍晚以前,请注意防范!

预警来了!今天傍晚以前,请注意防范!

上海长宁
2026-09-09 10:57:31
“这孩子能上小学就算高学历!”一家五口火了:黄毛的爷爷,满背的奶奶!

“这孩子能上小学就算高学历!”一家五口火了:黄毛的爷爷,满背的奶奶!

林林先生
2026-09-05 06:25:06
“你不借钱,我就把视频交纪委去!”四川女员工敲诈局长,结果亮了

“你不借钱,我就把视频交纪委去!”四川女员工敲诈局长,结果亮了

听心堂
2026-09-09 08:48:32
风波过后深挖资本!郭德纲的商业版图,藏着很多人不知道的真相

风波过后深挖资本!郭德纲的商业版图,藏着很多人不知道的真相

春天来了啊
2026-09-09 15:06:43
心理学:当你有了一定的洞察力之后,一定要学会闭嘴。老天给你过人的悟性,是为了让你摆脱困局,而不是让你去参与别人的因果

心理学:当你有了一定的洞察力之后,一定要学会闭嘴。老天给你过人的悟性,是为了让你摆脱困局,而不是让你去参与别人的因果

心理观察局
2026-09-07 07:04:13
霸权失效!中俄亮出王牌,6700万吨原油流向中国,人民币成功破局

霸权失效!中俄亮出王牌,6700万吨原油流向中国,人民币成功破局

不甜的李子
2026-09-09 14:16:36
极度看衰!今晚23点30,郑钦文冲美网四强,赛前官方胜率更新

极度看衰!今晚23点30,郑钦文冲美网四强,赛前官方胜率更新

体育见习官
2026-09-09 11:41:17
九大代言品牌集体发声祝贺!郑钦文商业价值一路暴涨

九大代言品牌集体发声祝贺!郑钦文商业价值一路暴涨

喜欢历史的阿繁
2026-09-09 06:56:12
最近,央国企的“关系户”们,都在瑟瑟发抖

最近,央国企的“关系户”们,都在瑟瑟发抖

细说职场
2026-09-09 15:05:24
“我说你们都回来,往上爬,我们等救援”,尼泊尔获救中国公民陆海涛更多回忆曝光

“我说你们都回来,往上爬,我们等救援”,尼泊尔获救中国公民陆海涛更多回忆曝光

环球时报国际
2026-09-08 16:23:49
天涯老网友泪目:当年遇上的全是神仙,如今网络再也回不去了!

天涯老网友泪目:当年遇上的全是神仙,如今网络再也回不去了!

夜深爱杂谈
2026-09-08 21:09:05
菲律宾电影有多敢拍?尺度炸裂,后劲上头,看完直接失眠

菲律宾电影有多敢拍?尺度炸裂,后劲上头,看完直接失眠

小椰的奶奶
2026-08-29 07:27:27
《悉达多》早就道破:认知低的人,在意的是情绪价值;认知高的人,在意的是精神价值,情绪价值可以哄骗,精神价值只能共鸣

《悉达多》早就道破:认知低的人,在意的是情绪价值;认知高的人,在意的是精神价值,情绪价值可以哄骗,精神价值只能共鸣

心理观察局
2026-09-09 07:13:13
最高院:提供 “口交” “肛交”等进入式性服务,是否属卖淫行为?

最高院:提供 “口交” “肛交”等进入式性服务,是否属卖淫行为?

周军律师聊案子
2026-04-21 09:50:16
华为新机官宣:9月9日,正式首销!

华为新机官宣:9月9日,正式首销!

科技堡垒
2026-09-08 11:16:59
调查发现:每天都喝酒,多数到了68岁以后,身体或变成这样?

调查发现:每天都喝酒,多数到了68岁以后,身体或变成这样?

路医生健康科普
2026-09-09 13:10:51
2026-09-09 16:55:00
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
9789文章数 568关注度
往期回顾 全部

科技要闻

AI重大突破!OpenAI称解开近百年数学难题

头条要闻

柬埔寨诈骗窝点内部照片流出:有带手术室的医院、电椅

头条要闻

柬埔寨诈骗窝点内部照片流出:有带手术室的医院、电椅

体育要闻

16年后再破门,被皇马放弃的少年没认输

娱乐要闻

郭德纲的商业版图,藏着不知道的真相

财经要闻

8月CPI同比涨0.8% PPI环比由降转涨

汽车要闻

魏牌全新蓝山申报信息曝光 方盒子造型 5/6座可选

态度原创

游戏
房产
手机
公开课
军事航空

《时之笛RE》大妖精胸部惨遭削弱 玩家:不露不买!

房产要闻

砸388亿+首个方案出炉!三亚,又一片区要起飞!

手机要闻

荣耀Magic9系列官宣9月28日发布

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

停止互袭首都3天后 俄乌猛烈交火

无障碍浏览 进入关怀版