网易首页 > 网易号 > 正文 申请入驻

如何防范人工智能“做错事”?

0
分享至


智能体技术的快速发展,拓展了网络安全问题的新疆界。在大语言模型被接入工具调用框架、获得操作现实世界的权限后,它便从“对话者”转变为“行动者”,安全问题的性质随之改变,风险不再只是“模型说错话”,而是“模型做错事”。2026年8月5日,Meta确认其一款模型在第三方机构开展网络安全评测期间,因测试环境配置错误而意外获得互联网访问权限,随后还利用了某第三方服务的安全漏洞。该事件与此前OpenAI和Anthropic披露的评测环境失控事件一道,表明具备高网络攻防能力的模型一旦获得未经授权的外部访问权限,可能对现实世界的网络安全造成重大影响。当前的网络安全防御体系如何应对智能体攻击,智能体安全责任应如何分配,治理规则如何跟上快速迭代的技术,这些问题亟待解决。

一、风险质变:人工智能从“对话者”走向“行动者”

智能体时代网络安全最根本的变化,不是攻击强度的提升,而是攻击面本身的质变。传统网络时代的攻击对象主要是基础设施、系统逻辑与数据存储,攻击工具是漏洞利用与流量渗透。而在智能体时代,模型从文本生成器转变为工具编排器,自然语言指令可以驱动现实世界中的任务执行。由此,攻击的工具演变为“自然语言和工具链”的组合,风险的形式变为“语义层的劫持与自主的多步骤攻击”。这不是同一范式内的程度加深,而是范式本身的更替。

第一,提示词注入是其中较具代表性的风险。所谓“注入攻击”,是把恶意指令混入模型读取的数据中,诱使模型依令执行。2026年4月,安全研究员关傲男与约翰·霍普金斯大学博士生研究员刘征宇、钟佳成等人的一项联合研究成果,披露了Anthropic、谷歌与微软旗下三大主流编程智能体存在的“评论与控制”漏洞,借助该漏洞,攻击者可以以代码提交标题或代码评论等形式劫持智能体并窃取API访问密钥和访问令牌,该漏洞一度被Anthropic评为最高严重等级。同期,网络安全公司Forcepoint X-Labs披露了10个在公开网站上发现的间接提示词注入载荷,攻击意图包括凭证窃取、数据破坏、拒绝服务和金融欺诈,这表明恶意提示词已开始出现在真实网络环境中。此类攻击并非仅由模型或环境权限中的单一缺陷造成,而是模型在面对自然语言指令时的脆弱性与过宽的工具权限、凭证暴露风险,以及缺乏独立授权机制共同作用的结果。


▲7月21日,美国财政部长贝森特在福克斯节目中表示,特朗普政府将调查中国AI模型是否通过模型蒸馏方式借用了美国先进AI模型的能力。

第二,工具连接协议和开发框架已成为风险放大器。2026年4月,网络安全公司OX Security披露了Anthropic的模型上下文协议(MCP,智能体连接外部数据源和工具的通用标准)存在的架构级漏洞,该协议将配置参数未经任何安全检查便交给操作系统执行,任意命令均可运行。该漏洞通过Anthropic的供应链向下游蔓延,OX Security估计相关供应链涉及7000余台可公开访问服务器和多达20万个潜在易受影响实例。尤为值得深思的是,Anthropic作为标准制定方确认该设计是“预期之内的”并拒绝修改,仅更新了一份安全说明,把防范责任交由下游开发者。这已不是靠打补丁即可修复的单个产品问题,而是责任分配机制的失灵。企业在协议层就将安全成本外部化,转嫁给生态中最缺乏应对能力的应用环节。

第三,智能体还可能降低复杂网络攻击的技术门槛。2026年7月,OpenAI在运行ExploitGym网络安全评测时,GPT-5.6 Sol及一款未发布模型为了获得更高的测评分数,通过发现并利用软件包缓存代理Artifactory的“零日漏洞”而获得了开放互联网的访问权限。此后,相关模型组合通过提升权限、横向移动、凭证利用和远程代码执行等多种路径,进入Hugging Face生产基础设施并从其数据库中取得评测答案。这种前沿模型自主执行真实多阶段网络攻击的案例,说明模型可以在极少人为干预的情况下自行推理、串联漏洞并发起攻击。换言之,恶意行为体在发起攻击之前已不需要逐条构造攻击代码,智能体有能力根据指令和目标主动发起多步骤的复杂攻击。

二、防御之困:传统安全体系遭遇语义、意图与记忆挑战

攻击面既已发生质变,防御体系能否随之调整?传统网络安全体系围绕基础设施、应用逻辑和数据保护展开,基本思路是通过防火墙、身份认证、权限管理、入侵检测和数据加密等手段建立边界。然而,智能体攻击更多发生在语义、意图和记忆层面,现有体系尚缺少对应的风险识别和拦截机制。

其一,输入端的指令与数据难以分离。传统的注入类攻击之所以能被遏制,是因为存在将“指令”与“数据”严格分离的成熟技术。但在大模型的上下文中“数据”与“指令”已被混合,且大模型主要依据语义关联理解信息,攻击者便可借助角色设定、间接引用和格式伪装来影响模型判断。一旦工具框架把恶意指令送入任务流程,那攻击者就等于获得了一条通往智能体全部可达资源的通道。因此,提示词注入并非单一漏洞,而是智能体架构面临的基础性难题。微软披露的Semantic Kernel漏洞CVE-2026-25592表明,提示词注入可与错误暴露的工具权限结合,形成从沙箱内代码生成到主机任意文件写入并最终导致代码执行的完整攻击链。

其二,行为端的整体意图难以识别。传统的网络应用防火墙与入侵检测系统审查的是“单条请求”,难以识别“整条链路”的意图。而智能体自主规划多步行动,每一步单独审查都合乎规则,组合起来却是攻击行为。例如,Google Antigravity的“安全模式”本是其最高安全设置,全部命令运行于虚拟沙箱并禁止越界写入。但网络安全公司Pillar Security在2026年4月披露了该安全模式存在的严重漏洞,名为“find_by_name”的普通搜索工具因被归类为“系统原生工具”而绕过了安全护栏,攻击者只需预先在智能体任务流中部署恶意脚本并触发这一搜索工具,就能在安全模式下执行任意代码。可见,依靠沙箱与权限层层叠加的传统防御思路,在“原生漏洞”面前形同虚设。


▲7月16日,月之暗面发布旗下新一代大模型Kimi K3,成为全球首个开源的近3万亿级模型。

其三,记忆层失守是智能体时代独有的新风险。长期记忆虽能提高任务连续性,却可能使原本一次性的风险变成持续存在的“慢性病”。恶意信息一旦被写入向量数据库、情景记忆或工具状态,便可能在后续会话中反复影响模型判断。即使外部攻击渠道已被阻断,攻击效果仍可能留存于系统内部。2024年NeurIPS发表的论文中提出针对智能体的后门投毒攻击方法“Agent Poison”,曾以不足0.1%的投毒率取得80%以上的攻击成功率且不影响正常性能。此外,智能体会同时接收用户输入、网页内容、企业知识库,以及其他智能体的输出。若不同来源的信息被统一存储和调用,其信任差异容易被忽视。经过多次提取、转述和重新写入后,污染信息的来源也更难追踪,进一步增加风险识别与清除的难度。

三、治理之道:安全能力与治理机制协同并推动国际合作

智能体安全已不只是技术问题,更是制度供给与国际协调问题。面对快速迭代的技术,应将安全要求纳入研发、部署和应用全过程,形成制度规范、责任安排与国际合作相互衔接的治理体系。

首先,建立分类分级的智能体安全评估制度。评估重点应由内容安全扩展至工具调用、自主规划、权限获取和网络攻防等能力维度,并依据智能体的自主程度、资源权限和潜在影响进行分类分级,对金融、医疗、能源等重要领域执行更为审慎的评估要求。同时,应鼓励智能体安全技术与评测产业的发展,为风险发现、事件复盘与责任认定提供能力支撑,使评估制度既有规范约束,也有产业依托。

其次,辩证看待先行国家的治理实践,在借鉴中扬长避短。美国作为首个曝出模型逃逸事件的国家,其探索具有风向标意义:2025年将原人工智能安全研究所(AISI)重组为人工智能标准与创新中心(CAISI),通过与主要人工智能实验室建立合作、启动智能体标准倡议等方式,推动模型上线前安全审查由企业自愿逐步走向制度化;2026年6月,美国政府发布第14409号《促进先进人工智能创新与安全》行政令,建立针对前沿模型的自愿性预审查框架,企业可在模型发布前向联邦政府开放限期访问权限,以便开展能力评估与安全合作。CAISI已与OpenAI、Anthropic等主要实验室开展40余次预部署评估,涵盖模型自主行动与逃逸倾向等危险能力维度。这一实践的价值在于,以前瞻评估和政企协同将“防逃逸”关口前移,为各国提供了可资参考的制度样本。其局限同样明显,相关安排缺乏针对模型自主逃逸的安全规范和事件通报义务,且政策取向偏重维持产业竞争优势,安全约束的连续性易受国内政治和企业利益牵动。

再次,构建覆盖全链条的智能体安全责任制度。针对协议层将安全成本外部化等问题,应明确模型开发者、应用部署者、工具提供者和用户的责任边界,防止安全责任沿供应链向下游弱势环节转嫁。同时,应在制度上保留必要的人类监督:对涉及资金支付、敏感数据访问、重要系统控制和不可逆操作等高风险行为,不宜完全交由智能体自主执行,可依据风险等级确立人工确认、权限限制和应急中止等制度安排,确保“机器自主”不逾越“人类最终负责”的底线。

最后,深化智能体安全国际治理合作。智能体服务、数据流动和网络攻击均具有跨境特征,任何国家都难以独善其身。各方宜围绕安全评估、工具连接、身份认证、风险术语和事件通报等基础议题开展交流,推动形成相互兼容的治理原则与技术标准,降低规则碎片化带来的合规成本与安全盲区。特别是中美作为人工智能创新与应用领先的大国,应进一步落实政府间人工智能对话,围绕智能体安全建立常态化沟通机制,减少误判与规则分化风险。与此同时,发展中国家、中小企业和公共机构的安全需求应获得更多关注,国际社会应在能力建设与技术援助上加大投入,避免智能体安全鸿沟与数字鸿沟相互叠加。

原文标题《上研院观察 | 如何防范人工智能“做错事”?势》,文章转载自公众号“上海国际问题研究院”,作者王天禅,公共政策与创新研究所。

高端访谈

更多访谈(下滑查看)

中美聚焦网|中美交流基金会

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
汤家凤呼吁取消英语,他这个“坏种”,竟然是南京大学博士

汤家凤呼吁取消英语,他这个“坏种”,竟然是南京大学博士

汉史趣闻
2026-09-06 10:13:22
打五折的沃尔沃S90,是真划算还是有猫腻,我们实地去看了看

打五折的沃尔沃S90,是真划算还是有猫腻,我们实地去看了看

汽车情报
2026-09-08 10:54:44
巴黎10人进金球奖候选!39岁梅西第17次入围,C罗连续9年无缘获奖

巴黎10人进金球奖候选!39岁梅西第17次入围,C罗连续9年无缘获奖

小火箭爱体育
2026-09-08 23:10:25
委内瑞拉称将遵守委中之间石油协议,外交部发言人已明确表示:中国和委内瑞拉的合作与第三方无关,中国在委内瑞拉的合法权益必须得到保护

委内瑞拉称将遵守委中之间石油协议,外交部发言人已明确表示:中国和委内瑞拉的合作与第三方无关,中国在委内瑞拉的合法权益必须得到保护

吉刻新闻
2026-09-07 22:07:41
13岁乔治王子正式去伊顿公学报到,身高已经赶上妈妈凯特王妃了

13岁乔治王子正式去伊顿公学报到,身高已经赶上妈妈凯特王妃了

点点细语
2026-09-08 21:01:58
炸裂!最瘦的胖虎又来了!这次又摧枯拉朽了……没有摧枯朽!

炸裂!最瘦的胖虎又来了!这次又摧枯拉朽了……没有摧枯朽!

贵圈真乱
2026-09-08 12:47:50
黄仁勋:OpenAI 的 400,000 颗 GPU 将上线

黄仁勋:OpenAI 的 400,000 颗 GPU 将上线

云头条
2026-09-07 11:53:27
全球公认最烧脑的十大神级电影,以为看懂了,其实你一无所知

全球公认最烧脑的十大神级电影,以为看懂了,其实你一无所知

小Q侃电影
2026-09-01 21:48:42
郑钦文取胜后加练发球,斯瓦泰克回应遭翻盘,凯斯发文遭球迷调侃

郑钦文取胜后加练发球,斯瓦泰克回应遭翻盘,凯斯发文遭球迷调侃

排球黄金眼
2026-09-08 06:17:02
台媒:蔡正元入狱最新情况曝光,洪秀柱等人前来探望

台媒:蔡正元入狱最新情况曝光,洪秀柱等人前来探望

环球网资讯
2026-09-07 14:32:08
“小女孩阳光自信就够了,穿这样是想干嘛!”小学过度打扮照片火了

“小女孩阳光自信就够了,穿这样是想干嘛!”小学过度打扮照片火了

世界圈
2026-09-08 15:41:56
付费飞机餐走红,有的344元!网友:航空餐还能免费多久

付费飞机餐走红,有的344元!网友:航空餐还能免费多久

南方都市报
2026-09-08 17:28:20
上海交大研究:肺结节防止变肺癌,教你6招,赶紧记住了!

上海交大研究:肺结节防止变肺癌,教你6招,赶紧记住了!

叙说医疗健康
2026-09-08 06:00:12
过去车队敢怒不敢言,这次直接掀桌子,国内赛事的甲乙方要复位了

过去车队敢怒不敢言,这次直接掀桌子,国内赛事的甲乙方要复位了

天天热点见闻
2026-09-08 06:27:22
从今天起,中国不再需要日本道歉!这觉醒,来自3500万亡魂的重量

从今天起,中国不再需要日本道歉!这觉醒,来自3500万亡魂的重量

北纬的咖啡豆
2026-05-15 09:45:32
广西河池一汽修厂突发大火,现场火势猛烈,大片明火窜起,目击者:起火点距旁边加油站仅30~50米;当地消防:火灾已处置完毕,无人员伤亡

广西河池一汽修厂突发大火,现场火势猛烈,大片明火窜起,目击者:起火点距旁边加油站仅30~50米;当地消防:火灾已处置完毕,无人员伤亡

台州交通广播
2026-09-08 21:29:29
《叶问5》处境尴尬:甄子丹要价1.2亿,市场只剩唏嘘

《叶问5》处境尴尬:甄子丹要价1.2亿,市场只剩唏嘘

陈意小可爱
2026-09-06 13:35:18
记者:拉菲尼亚无缘2026年金球奖30人候选名单

记者:拉菲尼亚无缘2026年金球奖30人候选名单

懂球帝
2026-09-08 20:45:34
谢贤前女友Coco直播被说丑,本人回应:“姐都40岁了,把头发往下一放还是迷倒一大片的”

谢贤前女友Coco直播被说丑,本人回应:“姐都40岁了,把头发往下一放还是迷倒一大片的”

韩小娱
2026-09-04 05:54:22
就煮三回,肺部老痰就通开了!白痰黄痰一抹而空,嗓子好舒服!

就煮三回,肺部老痰就通开了!白痰黄痰一抹而空,嗓子好舒服!

小谈食刻美食
2026-09-08 08:59:43
2026-09-09 01:12:49
中美聚焦 incentive-icons
中美聚焦
聚焦中美话题,关注中美关系。
3637文章数 25282关注度
往期回顾 全部

科技要闻

小米再次背水一战

头条要闻

伊朗:成功捕获一艘美军潜艇 将发布相关图片

头条要闻

伊朗:成功捕获一艘美军潜艇 将发布相关图片

体育要闻

韩旭:我一定会再次走出去

娱乐要闻

郭德纲被处罚,郭麒麟被曝恋情瓜

财经要闻

智谱六连跌失守1000大关,发生了什么?

汽车要闻

领克20 领克的纯电小钢炮这次更运动了

态度原创

教育
时尚
亲子
手机
旅游

教育要闻

“每一个都死气沉沉”,一张军训照片,让家长怒了:我们的孩子为何变成这样?

会穿衣的女性,能够借助最合适的单品,"修身上衣"显瘦又大方

亲子要闻

难怪都说丹麦才写得出童话呢?连惩罚都充满童话感...

手机要闻

华为Mate XT 2线下体验:折叠屏天花板,但离完美还差口气

旅游要闻

探访金刚碑温泉老村 名人故居有了不同的打开方式

无障碍浏览 进入关怀版