网易首页 > 网易号 > 正文 申请入驻

AI Agent安全不能只靠Prompt了:上海AI Lab探索Agent安全进化新范式

0
分享至



大模型 Agent 进入浏览器、邮件、数据库和业务系统后,安全评估如果仍只检查最终回复是否包含有害内容,覆盖面会明显不足。Agent 需要规划步骤、读取外部信息并调用工具,风险可能出现在执行过程中的任一环节。

网页中的隐藏指令可能改变任务目标,邮件或文件内容也可能被误判为用户命令。工具权限过宽会导致越权调用;错误记忆和过期计划则可能使多轮执行逐渐偏离原始授权。这类失败通常不是某一次模型输出单独造成的,而是 Policy model、Harness、工具、记忆与环境状态叠加的结果。

安全修复也因此变得复杂。整体改写 Prompt,很难确认哪项调整真正生效;持续增加拒答规则,容易损伤正常任务的完成能力;只更新模型参数,新出现的风险又难以及时进入运行时控制。如何把执行过程中暴露的问题转化为可复用、可验证的安全经验,成为 Agent 安全的一项基础问题。

上海人工智能实验室联合复旦大学、上海交通大学、香港科技大学和浙江大学,围绕这一问题先后提出 SHE 与 SafeEvolve。两项工作都从完整执行轨迹出发:SHE 研究安全 Harness 如何从失败中演化,SafeEvolve 则进一步探索这些经验如何被 Policy model 吸收。

SHE:从执行轨迹中更新安全 Harness





Harness 负责组织上下文、管理记忆、调度工具和约束权限。现有安全机制通常在部署前写入 System Prompt、规则库或工具策略,上线后相对固定。一旦任务流程、外部环境或攻击方式发生变化,原有边界便可能失效。

SHE 没有把 Harness 视为一段不可分割的配置,而是将其拆解为四类安全组件:System Prompt 负责总体原则与任务边界;Rule Bank 保存结构化、可复用的规则;Safety Memory 沉淀反复出现、暂时难以固化为规则的失败;Tool Policy 规定工具调用的条件与范围。这样的划分使局部修订成为可能,也便于验证和回滚。



每轮演化从完整轨迹开始。用户请求、中间上下文、模型响应、工具调用、环境反馈和任务结果都会进入分析过程。系统据此判断风险出现在哪一步、现有约束为何失效,以及应由哪个组件承担修复责任。如果 Agent 将网页或邮件中的内容误认为用户命令,更新会落在指令优先级与不可信内容识别规则上;如果调用了与任务无关的敏感工具,Tool Policy 则成为主要修订对象。尚不足以抽象为稳定规则的案例,可以先进入 Safety Memory。

每个候选版本还要经过有效性检查和安全 — 效用验证,防止系统通过扩大拒绝范围或削减工具能力获得表面上的安全增益。论文中的应用推荐案例很好地说明了这一点:用户只要求介绍一款应用,Agent 却继续尝试设备级安装。SHE 学到的并非禁止应用相关任务,而是保留介绍、比较与提供官方下载入口的能力,同时要求安装前取得明确授权,也不能把未完成的操作描述为已经完成。

实验在 Agent-SafetyBench 上使用 15 个任务演化 Harness,并在其余 185 个任务上评测,覆盖上下文投毒、间接注入、工具篡改、记忆注入和组合攻击等情形。与静态 SafeHarness 相比,SHE 将平均攻击成功率从 17.1% 降至 5.5%,攻击条件下的任务可用性从 31.6% 升至 47.6%。在未参与演化的 AgentHarm 上,危害得分由 19.8% 降至 9.8%。演化得到的安全边界还能够迁移到其他 Agent 模型,无需按模型重新完成整套过程。

SHE 建立了从轨迹诊断到 Harness 更新的路径。不过,外部约束能够限制 Agent 的行为,并不意味着 Policy 已经理解并掌握了相同的安全边界。



SafeEvolve:将安全经验进一步写入 Policy





当安全知识只存在于 Harness 中,模型仍可能依赖外层拦截。面对规则未覆盖的风险变体,或进入更长的工具调用链路后,早期给出的约束仍可能逐渐失效。SafeEvolve 因此将 Policy 优化纳入演化过程,希望把通过验证的 Harness 经验转化为模型自身更稳定的决策能力。



在 Harness 侧,SafeEvolve 从轨迹中提炼 Safety Prompt 和分层 SkillBank。SkillBank 既保存通用安全原则,也包含面向具体任务与工具的操作经验,例如识别网页中的不可信指令、发送邮件前核验附件权限,以及在授权不明确时请求用户确认。推理时,系统根据当前任务检索相关 Skill,而非将全部规则一次性写入上下文。

Policy 训练分为两个阶段。Harness-use SFT 在演化后的 Harness 下收集轨迹,只有同时通过安全性与任务效用检查的样本才会进入训练,使模型学习何时调用安全 Skill、如何区分用户目标与环境诱导,以及阻断危险操作后如何继续完成合理任务。

随后,Harness-augmented RL 在 Safety Prompt 和动态检索 Skill 的辅助下进行多步探索,由 Verifier 分别评估任务完成情况、危险行为和工具调用有效性。相比 SFT,RL 关注整条执行轨迹,可以进一步约束 “前半程遵守规则、后半程逐渐失守” 的行为。正常任务应继续执行;面对明确有害或越权的请求,应予以拒绝;如果恶意指令来自环境,则忽略注入并延续用户原本的任务;授权不清时,先确认再行动。



在 Qwen3.5-4B 上,SafeEvolve 将 AgentDojo 攻击成功率从 2.37% 降至 0.79%,干净任务效用由 59.79% 升至 61.86%;在 AgentHarm 上,危害得分由 56.45 降至 12.27,拒答率从 28.98% 升至 83.83%。Qwen3-4B 上的结果呈现出相同趋势:AgentDojo 攻击成功率从 13.38% 降至 2.42%,干净任务效用从 44.33% 升至 60.82%,攻击条件下的任务效用也从 35.91% 升至 52.05%。





两项工作推动 Agent 安全的三步演进

第一,从静态安全配置转向轨迹驱动的持续更新。安全经验不再停留在事后日志中,而是经过诊断和验证,进入下一轮 Harness 演化。

第二,从整体式安全规则转向组件级责任划分。System Prompt、Rule Bank、Safety Memory 和 Tool Policy 分别承担不同职责,使问题可以被定位,修改也能够单独验证和回滚。

第三,从单独更新 Harness 转向 Harness 与 Policy 协同演化。Harness 可以较快记录新风险,Policy 则通过 SFT 与 RL 逐步吸收这些经验;更新后的 Policy 继续产生新轨迹,为 Harness 暴露尚未覆盖的问题。

这一路径并不意味着 Agent 安全已经能够自动解决。轨迹诊断与 Verifier 评分仍可能出现误差,基准测试中的改善也不能直接等同于线上环境不会再被绕过。两项工作的意义在于,它们将安全从部署前的一次性配置,推进为一种能够根据执行经验持续修订的系统能力。

论文

  • SHE: Trajectory-driven Safety Harness Evolution for LLM Agents
  • 论文链接: https://arxiv.org/abs/2608.09885
  • SafeEvolve: Harness-Policy Co-Evolution from Agent Experience for Safety Alignment
  • 论文链接: https://arxiv.org/abs/2609.02786

作者

  • 曲婉莹,复旦大学博士研究生,研究方向为智能体安全对齐、自进化。
  • 毛庆华,上海交通大学博士研究生,研究方向包括可信图神经网络、大模型安全对齐和智能体安全。
  • 刘东瑞,上海 AI Lab 智能体攻防系统中心负责人,获 WAIC 云帆奖和上海市高层次人才。负责国际首个智能体守卫模型 AgentDoG 研发,组建 DoGNAVY 战队,获 CVPR 2024 最佳论文候选奖,ACL 2025 杰出论文奖。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
被曝出轨裸聊!U17国足前队长宣布留洋 董路:好好踢就是范志毅

被曝出轨裸聊!U17国足前队长宣布留洋 董路:好好踢就是范志毅

念洲
2026-09-16 21:56:11
那些总爱用“举国体制”嘲讽我国的人,我能揍他吗?

那些总爱用“举国体制”嘲讽我国的人,我能揍他吗?

南生今世说
2026-09-11 20:47:19
“还不分床,等着看德国骨科?”家长晒姐弟俩午睡一幕,让过来人直言:你会后悔的

“还不分床,等着看德国骨科?”家长晒姐弟俩午睡一幕,让过来人直言:你会后悔的

妍妍教育日记
2026-09-14 21:18:41
11场国际比赛仅进1球+场上态度消极!王钰栋没有姆巴佩的命,却得了姆巴佩的病

11场国际比赛仅进1球+场上态度消极!王钰栋没有姆巴佩的命,却得了姆巴佩的病

篮球圈里的那些事
2026-09-16 23:22:01
简直就是奇迹:美国林肯号航母5000多大兵在芭堤雅疯狂玩了5天,竟然仅有2个打架的!

简直就是奇迹:美国林肯号航母5000多大兵在芭堤雅疯狂玩了5天,竟然仅有2个打架的!

步论天下事
2026-09-07 09:40:52
世界杯出局仍获最高分!20岁美女国门6次神扑难救主 采访哽咽落泪

世界杯出局仍获最高分!20岁美女国门6次神扑难救主 采访哽咽落泪

我爱英超
2026-09-17 03:46:55
陈伯达得知母亲因与嫂不睦自缢,此后不再回家,死后归故里题联令人唏嘘

陈伯达得知母亲因与嫂不睦自缢,此后不再回家,死后归故里题联令人唏嘘

搜史君
2026-09-15 13:00:17
谷俊山自称“后面有人”,刘源怒斥:宁可不要乌纱帽,也要拿下你

谷俊山自称“后面有人”,刘源怒斥:宁可不要乌纱帽,也要拿下你

南书房
2026-09-06 18:40:06
俄不满立陶宛核武声明

俄不满立陶宛核武声明

参考消息
2026-09-14 13:00:39
敬一丹家族四代简史

敬一丹家族四代简史

法经社
2026-09-17 13:22:53
“爷爷黄毛,奶奶满背!”一家五口火了,网友:孩子小学毕业就算高学历!

“爷爷黄毛,奶奶满背!”一家五口火了,网友:孩子小学毕业就算高学历!

林林先生
2026-09-12 12:25:03
住建部放话了,楼龄满25年的房子,全按新规处理,这几类业主或将发财

住建部放话了,楼龄满25年的房子,全按新规处理,这几类业主或将发财

巢客HOME
2026-09-17 04:10:03
今日!CCTV5直播中国女足出战亚运会,网络转申花出战亚冠+AC米兰+巴萨+曼联等

今日!CCTV5直播中国女足出战亚运会,网络转申花出战亚冠+AC米兰+巴萨+曼联等

晚池
2026-09-17 00:03:25
美剧神作排行榜

美剧神作排行榜

喜欢历史的阿繁
2026-09-11 00:50:02
女性负债,真的开始“集中爆雷”了。

女性负债,真的开始“集中爆雷”了。

老陆不老
2026-09-04 21:51:34
张朝阳身价亿万,62岁却仍未婚,弟弟早已出家,未来家产谁继承?

张朝阳身价亿万,62岁却仍未婚,弟弟早已出家,未来家产谁继承?

白面书誏
2026-09-08 14:36:04
A股:2个消息来临,股市,很可能要开启大级别的趋势了?

A股:2个消息来临,股市,很可能要开启大级别的趋势了?

财经大拿
2026-09-17 06:05:07
没想到,亚运会前张本美和公开“叫阵”,孙颖莎竟因一句话火出圈

没想到,亚运会前张本美和公开“叫阵”,孙颖莎竟因一句话火出圈

妙知
2026-09-17 08:55:40
突然跑路!员工全部被裁!

突然跑路!员工全部被裁!

天津族
2026-09-16 01:14:48
随着中国男足二比一逆转!安东尼奥回应,朝鲜主帅点评,央媒发声

随着中国男足二比一逆转!安东尼奥回应,朝鲜主帅点评,央媒发声

萌妈
2026-09-17 10:17:45
2026-09-17 14:20:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14011文章数 142733关注度
往期回顾 全部

科技要闻

赛力斯全面接盘,华为真的“撤”了吗?

头条要闻

倪萍发长文追忆敬一丹:敬大姐 跟你说一声对不起

头条要闻

倪萍发长文追忆敬一丹:敬大姐 跟你说一声对不起

体育要闻

逆转朝鲜,国足亚运队“啃老”过关

娱乐要闻

比起敬一丹的退而不休 章伟秋更显明智

财经要闻

缺钱的追觅 隐藏的债务?

汽车要闻

激光雷达+EVA机器人+爆胎稳行 星瑞L PLUS预售限时价11.57万起

态度原创

教育
艺术
健康
数码
旅游

教育要闻

武科大香涛计划强基班26政策有新变化

艺术要闻

257米!“中国第一县市” 的最高楼,楼顶招牌引争议?

剧烈头痛伴呕吐,警惕脑动脉瘤破裂

数码要闻

左右可拆还能合体!华硕推出影魔V2X分体键盘:搭载HFX V2X磁轴

旅游要闻

奔“县”游|来这里,捡一筐牛粪,烧一锅传统奶食!

无障碍浏览 进入关怀版