智猩猩AI整理
编辑:林夕
8月26日,新加坡国立大学颜水成团队在arXiv发布论文《JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution》。
![]()
这次,他们把目光放在了Agent背后的工作系统上。
团队训练了一个27B模型JIT-Agent,不直接完成任务,而是根据具体任务,为基础模型生成一套专属的Harness,决定任务该怎么规划、记忆什么、调用哪些工具,以及如何执行。
这套Harness并不是生成一次就结束。JIT-Agent会对其进行验证、修复和测试,表现更好的Harness还会被保留下来,进入后续演化。
论文实验显示,JIT-Agent能够显著提升多个基础模型在Agent任务上的表现。在部分基准测试中,增强后的DeepSeek-V4-Flash甚至超过了GPT-5.6;与此同时,自动生成的Harness还能减少Token消耗和API成本。
这项工作也把Agent竞争带到了一个新的变量上:Harness本身,也可以成为被训练和优化的对象。
01
Prompt已经不够了,
AI开始自己造Harness
JIT-Agent生成的是一套完整的harness,不是一段提示词。
论文把harness拆成四个模块:memory(记忆)、planning(规划)、action(行动)、capability-orchestration(能力编排,负责编排工具与技能)。
它需要自己决定任务信息怎么保存、任务应该怎么规划、下一步采取什么行动,以及什么时候调用什么工具和技能。
![]()
JIT-Agent 方法总览:输入任务,输出定制的 harness 配置
02
一个27B模型,
开始给其他模型当“架构师”
模型基于Qwen3.6-27B 训练,正式名称为JIT-Agent-27B。
论文把这一路线称为harness的即时合成(just-in-time synthesis)。
论文采用代码承载harness的表示,JIT-Agent生成的是结构化、可执行的模块,不是一段自由文本,也不是提示词。
生成时,它接收四样输入:任务说明、固定的四模块协议、可执行工具与技能注册表、从档案库检索到的少量历史harness。
四个模块在运行时按memory → planning → capability-orchestration → action的顺序协同。
先决定保留什么历史、怎么压缩上下文;再形成局部规划;随后编排可用工具与技能;最后推进控制循环、发出动作。
每个输出都要过一道协议验证器,验证失败时,验证器返回结构化诊断报告,涵盖编译错误、接口不匹配、工具调用失败与运行时异常。
JIT-Agent据此生成修补,最多修复两轮,两轮内仍不可执行的候选被丢弃。
通过的harness交给冻结的骨干模型执行,轨迹与评估结果(奖励、延迟、成本)进入下一步训练或写回档案库。
训练分三个阶段,对应三个目标:定制、修复、进化。
第一阶段学定制,用更强的教师模型按任务合成harness,配监督微调与偏好学习,让JIT-Agent学会把任务直接映射到合规的harness。
第二阶段学修复,把第一阶段的失败生成连同诊断报告收集成训练数据,让模型学会在修复历史上生成有效的修补。
第三阶段学进化,方法叫Evo-GDPO(进化式组解耦策略优化)。
![]()
训练与自进化流程:从种子库出发,任务执行后把 "配置—任务—性能" 三元组写回档案库
它一次采样一组候选harness,只有超越档案库中现任最佳的候选才获得额外奖励,奖励、延迟、成本三个通道分别归一化后加权合并。
档案库按保守规则更新:候选必须匹配或超过当前奖励前沿,并严格改进奖励、延迟或成本中的至少一项,才会被写入。
部署时生成器保持冻结,档案库随任务继续累积——这就是测试时的harness进化。
训练从一个含13个代表性harness的种子库开始。
库中包括ReAct、Plan-and-Execute、ReSum、Flash-Searcher、General Agentic Memory (GAM)、MemoBrain、AggAgent。
以及OAgent、AgentFold、HiAgent、DeepAgent、ROMA、AOrchestra等近年发表的agent框架。
![]()
不同任务生成不同Harness:JIT-Agent会根据任务需求动态调整Harness内部结构
03
模型参数不变,
换个Harness就能涨20.2分
研究团队在多个Agent基准上测试JIT-Agent,覆盖DeepSeek V4、Mimo-V2.5、Qwen3.6等模型家族,并重点测试了GLM-5.2和DeepSeek-V4-Flash。
对比对象包括固定harness以及现有的agent系统。
实验要回答的问题很简单:模型参数完全不变,只换harness,agent能力能提升多少?
结果并非所有模型都明显上涨,但整体趋势明确:固定harness换成JIT生成的harness后,多项agent任务都有提升。
在DeepSearchQA测试中,DeepSeek-V4-Flash接入JIT-Agent后,相比GPT-5.6高出9.1分;在PinchBench上领先8.7分,在OdysseyBench上领先4.3分。
而在本身已经很强的GLM-5.2上,JIT-Agent带来的提升最高达到20.2分,其中DeepPlanning-Travel任务的成绩从62.8提升至83.0。
![]()
不同基础模型与任务上的性能对比
论文还做了第二类对比:骨干模型固定,把harness换成Claude Code、Codex、OpenCode、Hermes、NanoBot等现有运行时,与JIT-Agent生成的结果同台比较。
六个受控设置里,JIT生成的harness在四个中拿到最高分;六个设置中,它的token消耗与API成本全部最低。
成本优势明显:相对每个设置中最便宜的固定harness,单案例成本降低14.9%到54.1%,平均降36.0%。
不同Harness运行时的性能、Token消耗与API成本对比
![]()
两处未拿第一的设置值得单独看。
DeepSeek-V4-Flash在AgentIF上落后Claude Code 3.1分,但成本低15%。
Qwen3.6-Flash在DeepSearchQA上落后NanoBot 3.9分,但成本低约52%。
![]()
成本—性能对比(DeepSearchQA 与 AgentIF-Oneday)
合在一起,结论是JIT生成的harness与多年人工迭代的成熟运行时性能基本相当,优势主要在效率。
这也解释了论文的表述:与成熟运行时"性能相当、成本更优",而不是全面超越。
如果把视线从单个任务拉回到整体表现,JIT-Agent的优势会更加清晰。
论文在9个Agent基准、18组模型—任务匹配上进行了系统评估。结果显示,在替换为JIT生成的Harness后,多个基础模型的整体表现都有明显提升。
其中,GLM-5.2的九项基准平均分从74.1提升至81.8,增加7.7分;DeepSeek-V4-Flash则从66.7提升至75.5,增加8.8分。
JIT-Agent在九项Agent基准测试中的主要结果
![]()
论文还通过受控对比进一步验证harness的作用:固定骨干模型,在相同模型上直接比较ReAct与JIT-generated harness。
在固定骨干、对比ReAct与JIT-generated harness的实验中,24组直接匹配对比全部实现提升,平均提升7.6分。
![]()
ReAct与JIT-generated Harness的受控对比
静态与流式两种推理模式也有对比。流式推理把经验跨任务携带,在连续任务上累计精度更高。
![]()
静态与流式推理模式对比
04
Harness,
正在成为Agent的新变量
JIT-Agent出现的时间点值得注意,过去谈agent,关注点集中在模型和工具;最近harness越来越多地成为行业关键词。
Claude Code、Codex、OpenCode等coding agent背后,都有越来越复杂的工具调用、上下文管理、权限控制、执行循环和状态管理。
本质上,它们都在把模型怎么工作这件事做得更复杂。
8月13日,DeepSeek发布并开源了 DeepSeek Harness(dsh)v0.1,官方公式写作 "Model + Harness = Agent",与JIT-Agent论文处于同一周期。
这些信号指向同一个判断,agent的能力不只在模型里,也在模型外面的那套系统里。
JIT-Agent在此基础上又迈了一步,让AI自己设计这套系统。
关注+星标,获取AI前沿进展与开源一线动态
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.