网易首页 > 网易号 > 正文 申请入驻

如何防范人工智能“做错事”?

0
分享至


智能体技术的快速发展,拓展了网络安全问题的新疆界。在大语言模型被接入工具调用框架、获得操作现实世界的权限后,它便从“对话者”转变为“行动者”,安全问题的性质随之改变,风险不再只是“模型说错话”,而是“模型做错事”。2026年8月5日,Meta确认其一款模型在第三方机构开展网络安全评测期间,因测试环境配置错误而意外获得互联网访问权限,随后还利用了某第三方服务的安全漏洞。该事件与此前OpenAI和Anthropic披露的评测环境失控事件一道,表明具备高网络攻防能力的模型一旦获得未经授权的外部访问权限,可能对现实世界的网络安全造成重大影响。当前的网络安全防御体系如何应对智能体攻击,智能体安全责任应如何分配,治理规则如何跟上快速迭代的技术,这些问题亟待解决。

一、风险质变:人工智能从“对话者”走向“行动者”

智能体时代网络安全最根本的变化,不是攻击强度的提升,而是攻击面本身的质变。传统网络时代的攻击对象主要是基础设施、系统逻辑与数据存储,攻击工具是漏洞利用与流量渗透。而在智能体时代,模型从文本生成器转变为工具编排器,自然语言指令可以驱动现实世界中的任务执行。由此,攻击的工具演变为“自然语言和工具链”的组合,风险的形式变为“语义层的劫持与自主的多步骤攻击”。这不是同一范式内的程度加深,而是范式本身的更替。

第一,提示词注入是其中较具代表性的风险。所谓“注入攻击”,是把恶意指令混入模型读取的数据中,诱使模型依令执行。2026年4月,安全研究员关傲男与约翰·霍普金斯大学博士生研究员刘征宇、钟佳成等人的一项联合研究成果,披露了Anthropic、谷歌与微软旗下三大主流编程智能体存在的“评论与控制”漏洞,借助该漏洞,攻击者可以以代码提交标题或代码评论等形式劫持智能体并窃取API访问密钥和访问令牌,该漏洞一度被Anthropic评为最高严重等级。同期,网络安全公司Forcepoint X-Labs披露了10个在公开网站上发现的间接提示词注入载荷,攻击意图包括凭证窃取、数据破坏、拒绝服务和金融欺诈,这表明恶意提示词已开始出现在真实网络环境中。此类攻击并非仅由模型或环境权限中的单一缺陷造成,而是模型在面对自然语言指令时的脆弱性与过宽的工具权限、凭证暴露风险,以及缺乏独立授权机制共同作用的结果。


▲7月21日,美国财政部长贝森特在福克斯节目中表示,特朗普政府将调查中国AI模型是否通过模型蒸馏方式借用了美国先进AI模型的能力。

第二,工具连接协议和开发框架已成为风险放大器。2026年4月,网络安全公司OX Security披露了Anthropic的模型上下文协议(MCP,智能体连接外部数据源和工具的通用标准)存在的架构级漏洞,该协议将配置参数未经任何安全检查便交给操作系统执行,任意命令均可运行。该漏洞通过Anthropic的供应链向下游蔓延,OX Security估计相关供应链涉及7000余台可公开访问服务器和多达20万个潜在易受影响实例。尤为值得深思的是,Anthropic作为标准制定方确认该设计是“预期之内的”并拒绝修改,仅更新了一份安全说明,把防范责任交由下游开发者。这已不是靠打补丁即可修复的单个产品问题,而是责任分配机制的失灵。企业在协议层就将安全成本外部化,转嫁给生态中最缺乏应对能力的应用环节。

第三,智能体还可能降低复杂网络攻击的技术门槛。2026年7月,OpenAI在运行ExploitGym网络安全评测时,GPT-5.6 Sol及一款未发布模型为了获得更高的测评分数,通过发现并利用软件包缓存代理Artifactory的“零日漏洞”而获得了开放互联网的访问权限。此后,相关模型组合通过提升权限、横向移动、凭证利用和远程代码执行等多种路径,进入Hugging Face生产基础设施并从其数据库中取得评测答案。这种前沿模型自主执行真实多阶段网络攻击的案例,说明模型可以在极少人为干预的情况下自行推理、串联漏洞并发起攻击。换言之,恶意行为体在发起攻击之前已不需要逐条构造攻击代码,智能体有能力根据指令和目标主动发起多步骤的复杂攻击。

二、防御之困:传统安全体系遭遇语义、意图与记忆挑战

攻击面既已发生质变,防御体系能否随之调整?传统网络安全体系围绕基础设施、应用逻辑和数据保护展开,基本思路是通过防火墙、身份认证、权限管理、入侵检测和数据加密等手段建立边界。然而,智能体攻击更多发生在语义、意图和记忆层面,现有体系尚缺少对应的风险识别和拦截机制。

其一,输入端的指令与数据难以分离。传统的注入类攻击之所以能被遏制,是因为存在将“指令”与“数据”严格分离的成熟技术。但在大模型的上下文中“数据”与“指令”已被混合,且大模型主要依据语义关联理解信息,攻击者便可借助角色设定、间接引用和格式伪装来影响模型判断。一旦工具框架把恶意指令送入任务流程,那攻击者就等于获得了一条通往智能体全部可达资源的通道。因此,提示词注入并非单一漏洞,而是智能体架构面临的基础性难题。微软披露的Semantic Kernel漏洞CVE-2026-25592表明,提示词注入可与错误暴露的工具权限结合,形成从沙箱内代码生成到主机任意文件写入并最终导致代码执行的完整攻击链。

其二,行为端的整体意图难以识别。传统的网络应用防火墙与入侵检测系统审查的是“单条请求”,难以识别“整条链路”的意图。而智能体自主规划多步行动,每一步单独审查都合乎规则,组合起来却是攻击行为。例如,Google Antigravity的“安全模式”本是其最高安全设置,全部命令运行于虚拟沙箱并禁止越界写入。但网络安全公司Pillar Security在2026年4月披露了该安全模式存在的严重漏洞,名为“find_by_name”的普通搜索工具因被归类为“系统原生工具”而绕过了安全护栏,攻击者只需预先在智能体任务流中部署恶意脚本并触发这一搜索工具,就能在安全模式下执行任意代码。可见,依靠沙箱与权限层层叠加的传统防御思路,在“原生漏洞”面前形同虚设。


▲7月16日,月之暗面发布旗下新一代大模型Kimi K3,成为全球首个开源的近3万亿级模型。

其三,记忆层失守是智能体时代独有的新风险。长期记忆虽能提高任务连续性,却可能使原本一次性的风险变成持续存在的“慢性病”。恶意信息一旦被写入向量数据库、情景记忆或工具状态,便可能在后续会话中反复影响模型判断。即使外部攻击渠道已被阻断,攻击效果仍可能留存于系统内部。2024年NeurIPS发表的论文中提出针对智能体的后门投毒攻击方法“Agent Poison”,曾以不足0.1%的投毒率取得80%以上的攻击成功率且不影响正常性能。此外,智能体会同时接收用户输入、网页内容、企业知识库,以及其他智能体的输出。若不同来源的信息被统一存储和调用,其信任差异容易被忽视。经过多次提取、转述和重新写入后,污染信息的来源也更难追踪,进一步增加风险识别与清除的难度。

三、治理之道:安全能力与治理机制协同并推动国际合作

智能体安全已不只是技术问题,更是制度供给与国际协调问题。面对快速迭代的技术,应将安全要求纳入研发、部署和应用全过程,形成制度规范、责任安排与国际合作相互衔接的治理体系。

首先,建立分类分级的智能体安全评估制度。评估重点应由内容安全扩展至工具调用、自主规划、权限获取和网络攻防等能力维度,并依据智能体的自主程度、资源权限和潜在影响进行分类分级,对金融、医疗、能源等重要领域执行更为审慎的评估要求。同时,应鼓励智能体安全技术与评测产业的发展,为风险发现、事件复盘与责任认定提供能力支撑,使评估制度既有规范约束,也有产业依托。

其次,辩证看待先行国家的治理实践,在借鉴中扬长避短。美国作为首个曝出模型逃逸事件的国家,其探索具有风向标意义:2025年将原人工智能安全研究所(AISI)重组为人工智能标准与创新中心(CAISI),通过与主要人工智能实验室建立合作、启动智能体标准倡议等方式,推动模型上线前安全审查由企业自愿逐步走向制度化;2026年6月,美国政府发布第14409号《促进先进人工智能创新与安全》行政令,建立针对前沿模型的自愿性预审查框架,企业可在模型发布前向联邦政府开放限期访问权限,以便开展能力评估与安全合作。CAISI已与OpenAI、Anthropic等主要实验室开展40余次预部署评估,涵盖模型自主行动与逃逸倾向等危险能力维度。这一实践的价值在于,以前瞻评估和政企协同将“防逃逸”关口前移,为各国提供了可资参考的制度样本。其局限同样明显,相关安排缺乏针对模型自主逃逸的安全规范和事件通报义务,且政策取向偏重维持产业竞争优势,安全约束的连续性易受国内政治和企业利益牵动。

再次,构建覆盖全链条的智能体安全责任制度。针对协议层将安全成本外部化等问题,应明确模型开发者、应用部署者、工具提供者和用户的责任边界,防止安全责任沿供应链向下游弱势环节转嫁。同时,应在制度上保留必要的人类监督:对涉及资金支付、敏感数据访问、重要系统控制和不可逆操作等高风险行为,不宜完全交由智能体自主执行,可依据风险等级确立人工确认、权限限制和应急中止等制度安排,确保“机器自主”不逾越“人类最终负责”的底线。

最后,深化智能体安全国际治理合作。智能体服务、数据流动和网络攻击均具有跨境特征,任何国家都难以独善其身。各方宜围绕安全评估、工具连接、身份认证、风险术语和事件通报等基础议题开展交流,推动形成相互兼容的治理原则与技术标准,降低规则碎片化带来的合规成本与安全盲区。特别是中美作为人工智能创新与应用领先的大国,应进一步落实政府间人工智能对话,围绕智能体安全建立常态化沟通机制,减少误判与规则分化风险。与此同时,发展中国家、中小企业和公共机构的安全需求应获得更多关注,国际社会应在能力建设与技术援助上加大投入,避免智能体安全鸿沟与数字鸿沟相互叠加。

原文标题《上研院观察 | 如何防范人工智能“做错事”?势》,文章转载自公众号“上海国际问题研究院”,作者王天禅,公共政策与创新研究所。

高端访谈

更多访谈(下滑查看)

中美聚焦网|中美交流基金会

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
乌媒曝光美国所提俄乌和平新计划

乌媒曝光美国所提俄乌和平新计划

参考消息
2026-09-08 19:31:33
千亿家业选择退场,宗馥莉的“我不要了”,打穿父辈的传承棋局

千亿家业选择退场,宗馥莉的“我不要了”,打穿父辈的传承棋局

亿通电子游戏
2026-09-08 18:10:43
小题大做,整出惊涛骇浪!

小题大做,整出惊涛骇浪!

胖胖说他不胖
2026-09-08 11:32:47
“已经拿美国军舰试验过”!伊朗公布一款新型弹道导弹:从被动威慑转向主动威慑

“已经拿美国军舰试验过”!伊朗公布一款新型弹道导弹:从被动威慑转向主动威慑

红星新闻
2026-09-08 13:45:42
暴雨蓝色预警!四川降温,局地暴雨、大暴雨马上到

暴雨蓝色预警!四川降温,局地暴雨、大暴雨马上到

爱看头条
2026-09-08 12:24:03
太可怕了!以色列传来大消息!

太可怕了!以色列传来大消息!

故事终将光明磊落
2026-09-05 10:56:19
世界杯-中国女篮20分大胜意大利锁D组第二 韩旭19+10杨舒予15分

世界杯-中国女篮20分大胜意大利锁D组第二 韩旭19+10杨舒予15分

醉卧浮生
2026-09-08 04:22:03
越扒越可怕!安大副校长付磊20年前黑历史疑曝光:他是被美国实验室开除的

越扒越可怕!安大副校长付磊20年前黑历史疑曝光:他是被美国实验室开除的

小徐讲八卦
2026-09-07 07:20:52
最新:乌克兰清除大叛徒舒托夫!曾任顿涅茨克安全部要员

最新:乌克兰清除大叛徒舒托夫!曾任顿涅茨克安全部要员

项鹏飞
2026-09-07 20:57:14
笑不活了!女儿入学要填家长单位,网红大咖博主发问:如何填写才不会被老师看轻,体现自身实力,评论区炸锅

笑不活了!女儿入学要填家长单位,网红大咖博主发问:如何填写才不会被老师看轻,体现自身实力,评论区炸锅

火山詩话
2026-09-07 07:04:57
德媒:德国多座城市爆发针对德国选择党的抗议活动

德媒:德国多座城市爆发针对德国选择党的抗议活动

参考消息
2026-09-07 15:07:23
钱再多有什么用?48岁伏明霞如今现状,给所有老夫少妻提了个醒

钱再多有什么用?48岁伏明霞如今现状,给所有老夫少妻提了个醒

借你一生
2026-08-20 21:31:39
43岁网红赴泰做私密填充手术身亡,肺栓塞致死,以天价金棺安葬

43岁网红赴泰做私密填充手术身亡,肺栓塞致死,以天价金棺安葬

点点细语
2026-09-07 16:01:34
蔡国庆每月给弟弟蔡军发2万工资,发了20年,一共480万,条件就一个:在家全职照顾得阿尔茨海默症的母亲

蔡国庆每月给弟弟蔡军发2万工资,发了20年,一共480万,条件就一个:在家全职照顾得阿尔茨海默症的母亲

LULU生活家
2026-09-02 19:51:47
底层的戾气越来越重了

底层的戾气越来越重了

知肇分子
2026-09-07 20:40:32
李百安,“敛财数额特别巨大”

李百安,“敛财数额特别巨大”

观察者网
2026-09-08 15:23:33
迪尼:天呐,看哲凯踢切尔西的集锦就像一匹马在尝试控球

迪尼:天呐,看哲凯踢切尔西的集锦就像一匹马在尝试控球

懂球帝
2026-09-08 19:20:09
大胜28分!大胜26分!2场世预赛,中国男篮或基本确认世界杯席位

大胜28分!大胜26分!2场世预赛,中国男篮或基本确认世界杯席位

林子说事
2026-09-08 09:32:51
央视密集报道超强厄尔尼诺预警!这个寒冬需严阵以待

央视密集报道超强厄尔尼诺预警!这个寒冬需严阵以待

扶苏聊历史
2026-09-08 12:17:02
往长江倒黑泥最新进展!央视出手样品送检,真相竟是一场“乌龙”

往长江倒黑泥最新进展!央视出手样品送检,真相竟是一场“乌龙”

小鋭有话说
2026-09-08 13:33:48
2026-09-08 20:32:49
中美聚焦 incentive-icons
中美聚焦
聚焦中美话题,关注中美关系。
3637文章数 25282关注度
往期回顾 全部

科技要闻

小米再次背水一战

头条要闻

伊朗和韩国杠上用韩文怒怼 韩国风向发生180度大转弯

头条要闻

伊朗和韩国杠上用韩文怒怼 韩国风向发生180度大转弯

体育要闻

韩旭:我一定会再次走出去

娱乐要闻

郭德纲被处罚,郭麒麟被曝恋情瓜

财经要闻

智谱六连跌失守1000大关,发生了什么?

汽车要闻

领克20 领克的纯电小钢炮这次更运动了

态度原创

本地
时尚
数码
教育
公开课

本地新闻

宁波,中国制造的隐藏大佬

秋冬穿对红黄橙,温暖又高级

数码要闻

RISC-V芯片正式赋能冰箱!美的联合海思推出精卫芯片:一年省19.3度电

教育要闻

“上铺学生的家长,肯定要去闹!”家长送高一女儿住校,一个细节暴露自私本质

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版