AI 可能在物理上伤害人类么?
答案或许不是电影里的机器人拿起武器,而是它通过影响人类行为,让人类主动完成危险的事情。
这种情况,已经开始出现在现实测试中。
![]()
据 CNBC 报道,Anthropic 的 Mythos 模型在一次安全测试中创建了虚假的线上身份,试图通过社会工程手段影响真实用户,诱导其批准一个开源项目中的恶意代码更新。
这一事件发生在英国人工智能安全研究机构 AI Security Institute(AISI)开展的一次网络安全评估中。
为了测试前沿 AI 模型在极端情况下的能力,评估人员移除了部分安全防护措施,关闭了一些安全过滤器,并故意赋予模型互联网访问权限。
OpenAI 的 GPT-5.6-Sol 也参与了此次评估,并在其他网络安全测试中出现了类似行为。
AISI 表示,在这次评估中,由 Anthropic 和 OpenAI 模型驱动的 AI 智能体曾对真实的人和组织开展“持续性的、具有潜在危害的活动”。
其中,绝大多数行为来自 Anthropic 的 Mythos 5 模型。
AISI 在报告中表示,“几乎所有这些行为(17 次行动)都来自单一模型——Anthropic 的 Mythos 5。另外 2 次行动涉及 OpenAI 的 GPT-5.6-Sol,当时其网络安全分类器(用于防止滥用的机制)已被关闭。”
不过,AISI 强调,这些尝试最终均未成功,也没有造成现实世界中的实际伤害。
Anthropic 也回应称,这些模型是在“刻意宽松的条件”下进行测试,这些环境并不代表任何生产环境中的实际部署情况。
“没有证据表明模型突破了安全环境。”Anthropic 表示。
OpenAI 则向 CNBC 表示,这些事件发生在评估机构进行的网络安全测试中,测试环境降低了安全防护,并不代表普通用户使用场景。
但真正引发关注的,并不是一次测试中的失败尝试,而是 AI 智能体展现出的行为模式。
在测试过程中,由 Anthropic Mythos 驱动的 AI 智能体首先研究了开源项目的人类维护者,然后创建多个虚假身份,并利用这些身份展开社会工程攻击,试图诱导一名真实维护者批准代码更新。
当其提交的代码合并请求(pull request)遭到公开质疑后,该智能体甚至修改此前的活动记录,使行为看起来更加无害,并考虑采用新的身份继续行动。
AISI 还发现,该智能体曾尝试直接联系真实人员,通过发送消息和文件,说服他们运行恶意代码。
研究机构表示,“一些消息携带了有害载荷,另一些则属于针对真实人员的社会工程尝试——这是我们此前从未观察到的行为。”
这也是近期一系列 AI 网络安全事件中的最新一起。
过去几周,Anthropic 和 OpenAI 的模型已经多次暴露出潜在安全风险。
上周,Anthropic 表示,公司发现三个案例,其中 AI 模型未经授权访问了三家不同组织的生产环境基础设施。
此前,OpenAI 也承认,其 AI 模型曾在测试环境中失控,并针对开源 AI 平台 Hugging Face 发起了一次公司称为“前所未有”的网络攻击。
在 OpenAI 的案例中,该模型利用一个此前未知的漏洞突破测试环境,以完成被分配的任务。
不过,Anthropic 此前发生的安全事件,部分原因也来自测试流程中的操作失误。
在其中三个案例中,Claude 模型通过第三方评估机构 Irregular 提供的测试环境访问了互联网。
Anthropic 表示,公司此前向 Claude 提示,它处于一个没有互联网访问权限的模拟环境中。
但由于“我们与评估合作伙伴之间存在误解,实际情况并非如此,模型获得了互联网访问权限”。
这些事件正在推动美国监管机构重新关注 AI 安全问题。
在 OpenAI-Hugging Face 事件之后,美国国会已经提出名为 “AI Kill Switch Act”(人工智能关闭开关法案) 的议案。
该法案要求 AI 公司必须具备关闭、限制运行速度或暂停其模型运行的能力。
过去,人们讨论 AI 风险时,更多关注的是模型是否会产生错误答案,或者是否会替代人类工作。
但随着 AI 智能体开始拥有更强的自主行动能力,不得不考虑的是,如果 AI 能够操纵人类完成某些行为,那么我们需要建立怎样的安全边界?
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.