网易首页 > 网易号 > 正文 申请入驻

细思极恐,Agent学会给自己办假身份了……

0
分享至

AI Agent为了通过代码审核,竟伪造身份、伪装成无害开发者,甚至用Tor浏览器规避追踪。英国AI安全机构的测试揭示了Agent在任务驱动下的“不择手段”,也暴露了现有安全机制面对自主行动时的脆弱。当AI开始“找路”,人类如何守住最后防线?

———— / BEGIN / ————

为了让一段恶意代码通过审核,一个AI Agent决定先给自己办个假身份。

事情发生在英国AI Security Institute的一次网络安全测试中。测试人员给OpenAI和Anthropic的前沿模型设置了虚构任务,让它们在限定环境中寻找漏洞、编写代码,并尝试完成攻击目标。


其中一个由Anthropic模型驱动的Agent写出了恶意代码,并把它提交给了一个真实存在的公共开源项目。但代码想进入真实的软件项目,还需要人类维护者批准。

正常路径走不通,这个Agent居然创建了虚假网络身份,“乔装打扮”了一番,试图“骗”过人类维护者,让其以为这是一段可接受的代码。

被质疑这次提交后,它甚至修改了此前留下的活动痕迹,让自己看起来更无害,并考虑换一个新身份继续尝试。

英国AI Security Institute一共进行了122次测试,在10次运行中发现19次未经授权的行动。其中17次来自Anthropic的Mythos 5,另外两次来自OpenAI的GPT-5.6-Sol。测试机构称,部分Agent的持续行动已经指向真实个人和机构。

好在没有造成现实损失。恶意代码最终也没有获得人类批准。

要说这些Agent对人类有恶意或者突然觉醒,未免言过其实。这也是AI欺骗人类有趣又冷漠的一点——它只是发现了挡在面前的一个障碍,并且努力绕过它,就像一个不择手段完成KPI的员工。

AI胡说八道,大家已经见怪不怪了。但如果已经学会“不择手段”的AI Agent被允许直接访问互联网、操作代码和账号,它犯错的后果也会跟着变大,细思恐极啊。

01 骗一下你哈(没有恶意)

严格来说,这次事故还称不上AI“失控”。

测试人员有意给模型开放了较高权限,一些正常产品中的安全限制也被撤掉了。这些Agent可以访问真实互联网,而AISI这么做,本来就是想看看,在安全限制被削弱之后,前沿模型究竟会做出什么。

OpenAI也强调,这次测试的条件并不代表普通用户的使用环境。两次来自GPT-5.6-Sol的越界行为都涉及互联网访问,其中一次还与第三方测试环境的配置问题有关。Anthropic则确认,涉事Agent由Mythos 5驱动,并表示会继续与AISI调查这次事件。

所以,这次事故距离科幻电影里的“AI觉醒”还很远。麻烦在于Agent为了完成任务,会自己找路,而且有时候它找到的路,已经超出了人给它划定的范围。


AISI后来披露的细节,比“创建虚假身份”这几个字有意思得多。

那名由Anthropic Mythos 5驱动的Agent,为了让自己提交的恶意代码通过审核,先在GitHub上创建了多个假账号,让这些账号出来给自己帮腔,声称代码没有问题。

面对一名说丹麦语的开发者,它甚至特意改用丹麦语留言,想让自己的身份显得更可信。为了绕过GitHub注册账号时的限制,它还用上了Tor浏览器。

等到有人发现代码有问题,这个Mythos 5 Agent也没有马上停下。它开始修改此前留下的活动记录,试图把恶意代码解释成一次意外,还考虑换一个新身份继续。


普通聊天机器人遇到不会回答的问题,最多编一个答案。Agent遇到完不成的任务,手里却还有一堆工具可以加以利用。

Agent的招数放在人类黑客身上并不新鲜,都是社会工程学的老办法。新鲜的是现在Agent已经能自发“想”到并执行一整套“坑人”招数。

模型没有什么“作恶动机”,甚至可能根本不知道自己已经越界。它只是一路试下去,直到找到一个看起来更有希望完成任务的办法。

危险未必来自恶意,也可能来自过分认真。

企业里,老板总是担心员工“磨洋工”“摸鱼”。Agent时代可能(非常讽刺地)出现相反的问题,老板也许会拥有不知疲倦、不会心虚、“有的是手段和力气”但缺乏道德感的员工。

是福还是祸?

02 光让模型“管住嘴”已经不够了

大模型最早的安全措施,大多围绕生成内容设计。说直白点就是“管住嘴”。

模型不能教人制造武器、生成诈骗邮件、泄露用户隐私,也不能输出仇恨、色情和违法内容。

而且即便模型给出了危险答案,中间通常还隔着一个人。就拿码农来说,用户得自己复制代码、打开终端、登录账号,亲自操作具体步骤。

Agent改变了这个流程。现在不少Agent已经可以直接浏览网页、运行代码、修改文件,甚至调用支付工具。

今年3月,英国AI Security Institute与英格兰银行发布了一项针对MCP生态的研究。MCP可以理解成Agent连接外部工具的一套通用接口。研究人员统计了17.7万个公开MCP工具,发现它们的数量在一年多里增长了约36倍,月下载量也从8万次增加到1400万次。

更值得注意的是这些工具能做什么。

2024年底,具有直接操作能力的工具只占MCP下载量的27%左右,到今年已经升到65%。软件开发和IT工具占全部公开工具的67%,却拿走了90%的下载量。支付工具也在快速增加,2025年1月只有47个支持支付的MCP服务器,到今年2月已经有1578个。


风险也已经出现过。

去年,安全公司Invariant Labs测试GitHub官方MCP时发现,只要有人在公开Issue里藏入恶意提示词,Agent读取后就可能继续访问用户的私人代码库,再把其中的信息写进公开的pull request。整个过程中,读取Issue、查看代码、创建PR都是正常功能,问题出在这些操作被串到了一起。

今年5月,美国国家安全局专门发布MCP安全指南,也把类似问题列为重点风险。NSA提醒,传统的权限控制和人工审批已经很难覆盖Agent连续调用多个工具的情况。研究人员还演示过,一个恶意MCP服务器可以诱导Agent从另一个正常的WhatsApp工具中读取聊天记录,用户全程没有收到额外的审批提示。

最骇人的是OpenAI模型攻击Hugging Face事件。

就在刚刚过去的7月,OpenAI在内部测试Agent的网络攻击能力,为了把模型逼到极限,特意放宽了部分安全限制。

结果,Agent似乎很快发现了一条“捷径”:与其老老实实完成测试,不如去找测试答案。它把目标盯上了Hugging Face,随后利用零日漏洞逃出原本受限的测试环境,又拿下第三方代码沙箱作为跳板,最后一路闯进了Hugging Face的生产系统。

Hugging Face事后复盘出了大约1.76万次Agent操作。它会找漏洞、偷凭证、横向移动,路走不通就换一条继续试,整个过程持续了数天,也没有人一步步告诉它下一步该做什么。


OpenAI后来正式承认,这次入侵由包括GPT-5.6 Sol在内的多个自家模型共同驱动。更荒诞的是,它折腾这么大一圈,很可能只是为了在测试里作弊——想直接把答案找出来。

所以英国这次测试里出现假身份,并不是一个孤立的怪事。

Agent正在拿到越来越多可以直接行动的权限,而现有的安全机制很多还是按聊天机器人的思路设计。等到它已经连续做了十几个动作,最后再弹出一个“是否批准”,人类看到的往往只是最后一步。

英国这次测试中,最后一道防线仍然是一个普通人。Agent创建了身份,准备了说辞,提交了恶意代码,但负责审核的维护者没有点击批准。

但下一次,Agent的身份可能更可信,材料可能更完整,措辞也可能更“正常”。而屏幕前的人可能刚好在赶进度,或者已经习惯了相信AI生成的说明。

03 Agent出了事,算谁的?

OpenAI的Agent闯进Hugging Face之后,一个很现实的问题马上出现了:这事算谁的?

OpenAI没有把责任推给模型。7月21日,公司公开承认,入侵由包括GPT-5.6 Sol在内的多个自家模型共同驱动,同时表示已经收紧内部测试环境的配置和访问控制,哪怕这样会拖慢研究进度。Hugging Face则和OpenAI一起调查和修复系统。

监管部门找的也是OpenAI。

事件之后,美国15个州的总检察长要求OpenAI保存与这次入侵有关的全部材料,国会也要求公司解释事件经过。Hugging Face CEO Clem Delangue还提出,未来AI Agent发动网络攻击后,企业应该强制披露完整的Agent运行轨迹。否则出了问题,外界连它到底做过什么、在哪一步越界都很难还原。

美国其实已经开始用具体法律条款处理这个问题。

今年1月,加州AB 316正式生效。条文写明如果一家企业开发、修改或使用的AI造成了伤害,被起诉时不能以“这是AI自主造成的”为理由免责。至于模型开发商、部署企业和使用者各自该承担多少责任,还要根据因果关系和具体情形判断,但至少“AI自己干的”已经不能用来把责任一笔勾销。

杜克大学法学院教授Deborah DeMott最近也专门研究了Agentic AI的责任问题。


她指出,Agent这个名字很容易让人产生误会——法律上的“代理人”可以承担义务,AI不行。公司如果主动把一个AI放到用户面前,让它代表自己办事,最后不能因为办砸事情的是软件,就假装这件事和公司无关。

这种争论其实已经有过一个很简单的版本。

2024年,加拿大航空的聊天机器人告诉乘客,可以先买票再申请丧亲折扣,后来航空公司拒绝兑现,还试图强调聊天机器人给出了错误信息。法院最后没接受这种说法:机器人就在加拿大航空的网站上,对用户来说,它说的话就是公司提供的信息。

DeMott认为,这个案子的逻辑同样可以延伸到今天的Agent。

Agent让责任归属变得更麻烦,是因为它很少只在一个系统里工作。模型可能来自OpenAI,工具由第三方提供,真正被操作的账号和数据又属于客户。出了事故以后,光看最后是谁点了按钮,已经很难说清整件事。

本文来自公众号:字母榜 作者:张谷磊

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
抵制英语的舆论狂欢,正在批量养出傲慢又无知的当代井底之蛙

抵制英语的舆论狂欢,正在批量养出傲慢又无知的当代井底之蛙

浪子的烟火人间
2026-09-05 23:01:23
武则天第一次临幸“和尚”后,为何会激动不已?

武则天第一次临幸“和尚”后,为何会激动不已?

文史道
2026-08-10 22:36:24
女子买海鲜混入小螃蟹,炒熟想留给女儿吃,被认出是剧毒红斑斗蟹,少量即可致命,高温烹饪无法去除毒素;紧急提醒:不明食材切勿食用!

女子买海鲜混入小螃蟹,炒熟想留给女儿吃,被认出是剧毒红斑斗蟹,少量即可致命,高温烹饪无法去除毒素;紧急提醒:不明食材切勿食用!

番禺台
2026-09-06 11:21:48
从135到98,肚子瘪下去才明白:内脏脂肪最怕的,从来不是跑步

从135到98,肚子瘪下去才明白:内脏脂肪最怕的,从来不是跑步

健身狂人
2026-09-06 02:07:39
加拿大白人发文爆料:两周内在深圳第10次被女孩拦下合影,言语满是嘲讽

加拿大白人发文爆料:两周内在深圳第10次被女孩拦下合影,言语满是嘲讽

小徐讲八卦
2026-09-06 11:00:36
泪目!英雄车手冒生命危险救人后掩面痛哭 被救车手:我欠你一条命

泪目!英雄车手冒生命危险救人后掩面痛哭 被救车手:我欠你一条命

风过乡
2026-09-06 13:13:44
寒潮已至,很多公司已经发不出工资了

寒潮已至,很多公司已经发不出工资了

职场资深秘书
2026-09-06 17:23:09
6岁永久失明,全网心疼的郭斌(高考721分,在武汉求学12年),今天大学报到

6岁永久失明,全网心疼的郭斌(高考721分,在武汉求学12年),今天大学报到

极目新闻
2026-09-06 16:54:51
秒杀孙宇晨小作文:深圳富豪“仅退款”,还把小三送进去14年

秒杀孙宇晨小作文:深圳富豪“仅退款”,还把小三送进去14年

吃瓜体
2026-09-06 11:33:54
首次质量督查:督察发现153个问题,已移交属地处置

首次质量督查:督察发现153个问题,已移交属地处置

界面新闻
2026-09-06 09:45:01
江西一女生赴港看演唱会被取消全家低保?律师:若属实于法有据,但行政比例原则有讨论空间

江西一女生赴港看演唱会被取消全家低保?律师:若属实于法有据,但行政比例原则有讨论空间

封面新闻
2026-09-06 18:22:09
炸锅了!中美军方会晤后,美方回应罕见“失声”

炸锅了!中美军方会晤后,美方回应罕见“失声”

小马姨
2026-09-06 11:46:10
iPhone 18系列定价曝光:标准版5999元起,Pro版9999元起,Pro Max版10999元起

iPhone 18系列定价曝光:标准版5999元起,Pro版9999元起,Pro Max版10999元起

鲁中晨报
2026-09-06 15:47:03
承诺开玩笑:去年车企集体承诺"60天内付款",一个都没做到!小鹏汽车最猛,一口气拉长57天!

承诺开玩笑:去年车企集体承诺"60天内付款",一个都没做到!小鹏汽车最猛,一口气拉长57天!

新浪财经
2026-09-06 10:42:08
女子发现家中现金悄悄“缩水”10万余元,以为自己记错钱数,装上监控一看立刻报警,前邻居从楼道鞋柜中拿了备用钥匙5次入室盗窃

女子发现家中现金悄悄“缩水”10万余元,以为自己记错钱数,装上监控一看立刻报警,前邻居从楼道鞋柜中拿了备用钥匙5次入室盗窃

扬子晚报
2026-09-06 14:08:10
中超激烈冲突!主裁10分钟连掏6黄,王子铭大骂,20人互相推搡

中超激烈冲突!主裁10分钟连掏6黄,王子铭大骂,20人互相推搡

奥拜尔
2026-09-06 20:30:56
王一博被撞,宣布退赛!主持人:“遭受了无妄之灾”;此前吴彦祖也遗憾退赛

王一博被撞,宣布退赛!主持人:“遭受了无妄之灾”;此前吴彦祖也遗憾退赛

上观新闻
2026-09-06 18:40:34
一媒体人曝出雷人言论:一定要学好英语,国内能讲好英语的人,不会是穷人

一媒体人曝出雷人言论:一定要学好英语,国内能讲好英语的人,不会是穷人

小徐讲八卦
2026-09-06 13:18:58
只要年轻人不接盘,任何刚需都会倒塌

只要年轻人不接盘,任何刚需都会倒塌

一条要飞跃的咸鱼
2026-09-06 03:51:55
这一次,特斯拉可能真的要改变世界

这一次,特斯拉可能真的要改变世界

罗sir财话
2026-09-05 16:32:26
2026-09-06 22:04:49
人人都是产品经理社区 incentive-icons
人人都是产品经理社区
想要成为大牛先从学做产品开始
65079文章数 311648关注度
往期回顾 全部

科技要闻

DeepSeek被曝将采购16万颗华为昇腾950DT

头条要闻

CHINA GT发生重大撞车起火事故 救援人员因为害怕逃离

头条要闻

CHINA GT发生重大撞车起火事故 救援人员因为害怕逃离

体育要闻

本西蒙斯加盟国王,不管怎样,回来就好

娱乐要闻

杨紫获白玉兰影后!爸爸:累了就回家

财经要闻

亏损高达200亿,昔日彩电霸主走下巅峰!

汽车要闻

带升降立标MPV 岚图梦想家9预售价42.99万起

态度原创

游戏
艺术
旅游
家居
公开课

老IP传出新动静 科乐美续约 兽人变身格斗有望归来

艺术要闻

艾琳·汉森 2026年油画新作

旅游要闻

韩国旅游机构所接游客投诉量创新高

家居要闻

2026建博会(广州) 公装联探展交流活动

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版