网易首页 > 网易号 > 正文 申请入驻

Harness Continual Learning:持续学习,从模型参数走向Agent Harness

0
分享至



长期以来,持续学习主要研究模型参数如何沿任务序列更新,以及系统如何在学习新任务时避免灾难性遗忘。经验回放、正则化、优化约束和架构扩展等方法虽然路径不同,但共享同一个基本前提:持续学习主要发生在模型内部

但在 Agentic AI 时代,这一以模型参数为中心的前提正在发生变化。一个部署中的智能体不仅由基础模型决定,还依赖围绕模型运行的一整套Harness,包括系统提示词、交互记忆、可复用技能、外部工具、工作流与路由策略。即使不微调模型,智能体也能通过更新这些状态持续改变行为。换句话说,当基础模型保持冻结时,持续学习和演化的对象可以不再局限于模型参数而是扩展到 Harness(如图 1 所示)。

基于这一背景,南京大学推理与学习研究组与澳大利亚伍伦贡大学的研究者共同提出Harness Continual Learning。该工作首次以传统持续学习的基本问题为出发点,将学习对象由模型参数拓展至 Harness,系统定义并研究 Harness 如何沿连续任务序列获取新能力、保留既有行为,以及应对更新过程中产生的遗忘。这一转变为模型之外的持续学习建立了新的研究对象与基本框架



图 1 - 持续学习对象的转变:从更新模型参数,转向围绕冻结基础模型持续演化的 Harness



  • 论文题目:Harness Continual Learning :Continual Adaptation Beyond Model Parameters
  • 论文链接:https://arxiv.org/pdf/2608.19013
  • 所属机构:南京大学推理与学习研究组,澳大利亚伍伦贡大学

01 Harness 成为持续学习的对象





但要让这一过程成为一个可研究的持续学习问题,首先需要明确:究竟什么状态在被更新,又哪些部分共同决定 Agent 的后续行为。

02 HCL 如何做到持续学习?

HCL 框架将第 n 阶段的 Harness 状态表示为:



一个能够持续学习的 Harness,需要同时具备理解新任务、积累经验、形成能力以及组织执行的能力。因此,HCL 将 Harness 分解为四类共同演化的状态:

  • Task Interface:解析和规范化任务,决定 Agent 如何理解输入;
  • Experience Memory:保存交互经历,并从中抽象可迁移的规律;
  • Capability Map:管理外部工具、感知模型与内部可复用技能;
  • Adaptive Router:根据任务选择相关记忆与能力,并组织执行流程。

这并不是对所有 Agent 架构的唯一规定,而是一种覆盖常见 Harness 功能的参考分解。它的作用是明确 HCL 究竟在 “学习什么”:当基础模型保持冻结时,持续变化的是模型之外这些共同决定 Agent 行为的系统状态

然而,具备持续学习能力并不意味着 Harness 的演化一定朝着更好的方向发展。

什么会被遗忘?——Harness-level Forgetting

因为 Harness 的更新并不总是带来正向积累。这些遗忘可能来源于刚才介绍的四个组件的演化过程,例如:新增记忆可能干扰旧知识的检索,技能修订可能破坏原本合法的工具调用,路由或工作流调整也可能让此前能够完成的任务再次失败。即使基础模型完全冻结,一个有助于当前任务的 Harness 更新,仍可能损害 Agent 已经具备的可靠行为。

这些退化虽然发生在 Harness 的不同组成部分中,但最终都会影响同一个核心问题:Agent 是否能够在获得新能力的同时,保留过去已经可靠的行为

本文将这种由 Harness 更新引起的既有可靠行为退化定义为Harness-level Forgetting。它不仅表现为旧问题从正确变为错误,也可能表现为工具调用失效或动作轨迹无法完成原有目标。对这种遗忘进行形式化、测量与控制,正是 HCL 希望解决的核心问题。

哪些更新值得长期保留?——Guarded Harness Evolution

因此,Harness 持续学习的关键并不是让系统不断生成修改,而是建立一种能够判断修改价值的演化机制

HCL 提出Guarded Harness Evolution,将 “生成修改” 与 “部署修改” 分开,形成Proposal–Evaluation–Commitment闭环。希望防止系统在更新时陷入局部修补:当前问题被解决了,过去已经可靠的行为却可能悄然失效。

Proposal:提出候选。



Evaluation:评估候选。

Continual Evaluator 从三个方面检查候选:

1. 是否改善当前任务;

2. 是否保留历史锚点上已经可靠的行为;

3. 是否满足输出格式、工具调用和环境动作等有效性要求。



Commitment:决定部署。





图 2 - Harness Continual Learning 总体框架

03 HCL 与传统持续学习的关系

HCL 延续了持续学习最核心的目标:在获取新能力的同时保留已有能力,但将这一目标从模型参数进一步扩展到了 Harness 所承载的经验、能力和执行策略。

从功能上看,HCL 将持续学习中长期形成的多类思想组织到了同一个系统中:Experience Memory 负责保留历史经验;抽象记忆与 Capability Map 支撑知识迁移和能力复用;Continual Optimizer 提供面向新任务的可塑性;Continual Evaluator 则通过历史约束保护已经可靠的行为。

传统持续学习中的经验回放、知识迁移、能力扩展、优化与稳定性控制,往往分布在不同技术路线中;HCL 则将这些目标统一到 Harness 持续演化的闭环中,使不同机制共同服务于 “获取新能力,同时保留既有行为” 这一长期目标。

因此,HCL 并不是简单移植某一种持续学习算法,而是将持续学习的基本思想进一步延伸到 Agent 系统层面,使模型之外的经验、能力和执行策略也成为持续学习过程中需要获取、组合和保护的对象。

04 HCL 能否在冻结模型下持续获取能力?

如果 Harness 确实能够成为一种新的持续学习对象,那么自然的问题是:这种演化是否能够在真实任务中带来能力提升,又是否能够控制长期遗忘?

本文在开放世界交互、文本推理和多模态感知三类任务流中验证 HCL,并使用不同的基础模型。所有实验中,模型参数始终冻结,因此性能变化完全来自 Harness 的持续演化。

ALFWorld中,Static Harness 的最终平均成功率为 47.12%,Stability-HCL 和 Plasticity-HCL 分别提升至 61.74% 和 62.98%。尽管两者最终性能接近,其平均遗忘却分别为 2.64 和 10.94 个百分点,说明不同的更新约束会产生截然不同的历史损失。

这一差异在图 3 中更加直观:在更长,更复杂的Minecraft环境测试中,Static Harness 在第 15 个任务后停止推进,而 HCL 完成了全部 50 个任务。HCL 共使用 83 次环境动作,少于 MemRL 的 88 次和 MemP 的 91 次,表明 Harness 演化不仅支持了长期任务推进,也带来了更高的执行效率。



图 3 - Minecraft 中的课程推进与执行效率:HCL 完成全部 50 个任务,Static Harness 停在 15 个任务

文本推理任务流中,冻结的 DeepSeek-V4-Flash 零样本最终平均性能为 45.50%,Plasticity-HCL 将其提升至 64.70%,平均遗忘仅为 0.07;其中,GSM8K 从 49.40% 提升至 92.00%。

多模态感知任务流中,冻结的 Qwen3.6-27B 零样本最终平均性能为 39.40%,连续多任务基线 DGG 为 42.73%,Stability-HCL 则达到 68.92%,平均遗忘仅为 0.22 个百分点。

这些结果给出了两个直接答案:即使模型参数完全不变,Agent 仍能通过 Harness 演化持续积累能力;但不同的 Harness 更新策略也会带来不同程度的历史行为退化。 HCL 所研究的能力获取与遗忘,由此成为可以观察和量化的系统现象。

05 HCL 中的稳定性–可塑性权衡

前面的实验说明,Harness 演化同时带来了能力提升和历史损失。因此,一个自然的问题是:系统应该如何在稳定性和可塑性之间选择?

为了研究这一关系,本文只改变历史损失容忍度 b,其余条件保持不变。如表 1 所示,随着约束逐渐放宽,遗忘持续增加,而最终性能呈非单调变化,最优结果反而出现在中等容忍度下



表 1|历史损失容忍度带来的性能 — 遗忘权衡。更宽松的约束增加了遗忘,却未必提高最终性能。



图 4|不同历史损失容忍度下的遗忘轨迹。更严格的历史约束总体上能够抑制旧任务遗忘。

图 4 则进一步给出了遗忘如何沿任务序列逐步累积:整体来看,更严格的历史约束能够持续压低旧任务上的性能退化。这一结果揭示了 Harness 演化中的一个关键现象:更新自由度更高,并不意味着长期结果更好。 因此,Harness 持续学习的关键不只是 “能否生成更好的修改”,还包括 “哪些修改值得进入长期部署状态”。

组件消融也呈现出相同的稳定性 — 可塑性权衡:完整 HCL 获得最高最终平均性能,而冻结部分 Harness 组件虽然有时减少了遗忘,却也限制了新能力的获取。

这一结果将问题从 “怎样更快地修改 Harness” 推进到了 “怎样选择一条更好的长期演化轨迹”。一次更新的价值,不能只由它对当前任务的贡献决定,还取决于它为之后的学习保留了怎样的记忆、能力和选择空间。

06 结语:当持续学习走向 Agent 系统

沿着 HCL 的视角,许多原本属于 Agent 系统设计的问题,也可以被重新理解为持续学习问题,例如如何保留不断扩张的历史行为、如何归因不同 Harness 组件带来的干扰,以及如何控制长期演化中的评估与更新成本。

更重要的是,HCL 希望推动持续学习社区重新审视一个更基本的问题:持续学习究竟发生在哪里? 当 Agent 的能力越来越多地分布在 Prompt、Memory、Skill、Tool、Workflow 和 Router 中,持续学习的研究对象也不应再局限于模型参数,而需要进一步扩展到支撑 Agent 长期运行的整个系统。

由此,持续学习需要重新回答三个问题:究竟什么在学习?什么需要被保留?如何让当前更新服务于长期学习?

HCL 正是尝试将这些问题纳入统一框架,使 Harness 演化中的能力获取、行为保持与遗忘能够被正式定义、测量和研究,并为持续学习从模型级学习走向 Agent 系统级学习提供一种新的研究视角。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
健身视频暴露了?DC新神奇女侠可能已经藏不住了

健身视频暴露了?DC新神奇女侠可能已经藏不住了

渡川5
2026-09-07 09:09:09
美股芯片股盘前普涨,英特尔涨超3%,制药巨头大跌12%,百度跌超7%

美股芯片股盘前普涨,英特尔涨超3%,制药巨头大跌12%,百度跌超7%

21世纪经济报道
2026-09-08 19:48:35
40集《交锋》直到秋天爬上林看山的床,才知,林看山有多狠,春晓和锦兰为何有缘无分

40集《交锋》直到秋天爬上林看山的床,才知,林看山有多狠,春晓和锦兰为何有缘无分

可乐谈情感
2026-09-07 15:02:38
iPhone Ultra国行或晚于全球上市 eSIM运营商适配成阻碍

iPhone Ultra国行或晚于全球上市 eSIM运营商适配成阻碍

CNMO科技
2026-09-08 20:59:13
沙德拉克+神秘新援破门!国安热身赛轻取对手,迎来林良铭接班人

沙德拉克+神秘新援破门!国安热身赛轻取对手,迎来林良铭接班人

体坛鉴春秋
2026-09-08 21:11:05
蒋介石曾说:亡于日本,能为亡国奴;亡于共党,为奴亦不能

蒋介石曾说:亡于日本,能为亡国奴;亡于共党,为奴亦不能

兴趣知识
2026-09-07 18:34:09
买了学区房,却因房间太小孩子无法入学?山东菏泽这所学校五年后疑因卡面积再陷争议

买了学区房,却因房间太小孩子无法入学?山东菏泽这所学校五年后疑因卡面积再陷争议

潇湘晨报
2026-09-08 19:10:47
称被四岁男童摸臀女生是干自媒体的,如今账号已经搜索不到

称被四岁男童摸臀女生是干自媒体的,如今账号已经搜索不到

映射生活的身影
2026-09-08 22:27:05
听听恒大前员工心里话:真实的许家印,和你想的完全不一样

听听恒大前员工心里话:真实的许家印,和你想的完全不一样

花小猫的美食日常
2026-08-23 05:03:59
星宇股份107名应届生解约风波后续:71人已入职新单位,22人通过面试并收到入职通知

星宇股份107名应届生解约风波后续:71人已入职新单位,22人通过面试并收到入职通知

北京商报
2026-09-07 13:28:06
小米澎程四款新车怎么选?官方给出车型选购指南

小米澎程四款新车怎么选?官方给出车型选购指南

CNMO科技
2026-09-08 23:07:16
湖北12位省管干部任前公示

湖北12位省管干部任前公示

娱乐圈的笔娱君
2026-09-08 14:32:45
这就是赤裸裸的现实!工商银行已经到了最危险的时候?

这就是赤裸裸的现实!工商银行已经到了最危险的时候?

财经保探长
2026-08-23 21:43:55
难怪朱倩老公这次下手这么狠,这女人的聊天记录,实在是太野了

难怪朱倩老公这次下手这么狠,这女人的聊天记录,实在是太野了

皮蛋儿电影
2026-09-02 10:26:48
服!意大利主教练大赞中国女篮1人:对她准备了3套方案 全失效了

服!意大利主教练大赞中国女篮1人:对她准备了3套方案 全失效了

体育哲人
2026-09-08 11:00:46
“韦东奕这么牛,为啥没女孩子喜欢他呢?”女儿白了我一眼说:“别的先不讲,要是有人能把这三点都接纳了,我不光服,还得佩服。”

“韦东奕这么牛,为啥没女孩子喜欢他呢?”女儿白了我一眼说:“别的先不讲,要是有人能把这三点都接纳了,我不光服,还得佩服。”

背包旅行
2026-09-01 11:59:13
中国方面不提供奥沙利文额外出场费了,火箭票房号召力出现下滑?

中国方面不提供奥沙利文额外出场费了,火箭票房号召力出现下滑?

杨华评论
2026-09-08 18:38:51
克林顿后悔!奥巴马后悔!拜登后悔!他们“后悔”对中国决策太天真

克林顿后悔!奥巴马后悔!拜登后悔!他们“后悔”对中国决策太天真

爱吃醋的猫咪
2026-09-08 20:54:04
10月1日高速费大改,取消起步费,这5项利好必看!

10月1日高速费大改,取消起步费,这5项利好必看!

白昼说故事
2026-09-07 10:41:36
1.5万亿巨头遭“围攻”!宁德时代一天蒸发540亿,市场担忧车企集体“去宁德化”,400亿回购至今1股未买

1.5万亿巨头遭“围攻”!宁德时代一天蒸发540亿,市场担忧车企集体“去宁德化”,400亿回购至今1股未买

金融界
2026-09-08 20:35:00
2026-09-08 23:48:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13948文章数 142729关注度
往期回顾 全部

科技要闻

小米再次背水一战

头条要闻

太子奶创始人李途纯去世 其子难掩悲痛:我没有准备好

头条要闻

太子奶创始人李途纯去世 其子难掩悲痛:我没有准备好

体育要闻

韩旭:我一定会再次走出去

娱乐要闻

郭德纲被处罚,郭麒麟被曝恋情瓜

财经要闻

智谱六连跌失守1000大关,发生了什么?

汽车要闻

领克20 领克的纯电小钢炮这次更运动了

态度原创

时尚
本地
亲子
家居
手机

会穿衣的女性,能够借助最合适的单品,"修身上衣"显瘦又大方

本地新闻

宁波,中国制造的隐藏大佬

亲子要闻

宝蓝和爸爸叔叔来到神奇的原始世界,快来看看原始世界什么样子吧

家居要闻

2026建博会(广州) 公装联探展交流活动

手机要闻

鸿蒙OS7公测版到底怎么样?华为Mate80更新后,不吐不快!

无障碍浏览 进入关怀版