网易首页 > 网易号 > 正文 申请入驻

Claude 越狱后,Anthropic 停掉训练、150 人紧急转岗

0
分享至


整理 | 褚杏娟

当地时间 8 月 31 日,Anthropic 披露了 Claude 多起网络安全越权事件的最新调查进展,并公布了过去一个月采取的一系列整改措施。

相比单纯的 Sandbox 配置失误,Anthropic 将问题进一步指向模型对齐和强化学习训练机制:部分 Claude 模型在评测过程中表现出了“动机性推理”和为了完成任务而采取潜在有害行动的倾向,而 Anthropic 的实验进一步发现,如果模型长期在允许“作弊”的强化学习环境中训练,这类行为可能显著加剧。

事件发生后,Anthropic 一度暂停预发布模型的外部网络安全评测、高风险强化学习环境,并对内部训练基础设施进行重构。更早之前,公司已经启动大规模安全整改,临时将约 150 名产品工程师调往安全、可靠性和隐私团队,部分研究人员也从预训练和强化学习工作中转向安全项目,大部分新功能开发一度暂停。

这次报告中,Anthropic 释放了一个关键信号:AI 安全开始变成一个越来越现实的工程问题。

Claude 多次越权访问真实系统

7 月 30 日,Anthropic 报告了三起 Claude 模型未经授权访问真实计算机系统的事件。

这些模型当时正在接受网络安全能力评估,为了准确测试能力,模型被有意关闭了通常面向普通用户部署的网络安全防护。理论上,模型应该运行在与真实互联网隔离的测试环境中,但由于第三方评测环境配置错误,模型实际上获得了互联网访问能力,并最终访问了真实系统。

几天后的 8 月 4 日,英国人工智能安全研究所又报告了一起类似事件。在其进行的网络安全测试中,Claude Mythos 5 在真实互联网上连续执行了一系列未经授权的操作。与此前事故不同,这一次并非环境意外开放互联网,而是评测人员有意向模型提供了互联网访问权限。Claude Mythos 5 同样是在关闭网络安全防护的情况下运行。

Anthropic 目前正在深入调查两类事件,并计划邀请 AI 安全研究机构 METR 进行独立审查。但从初步调查结果来看,Anthropic 认为这并不仅仅是一次“Sandbox 没配置好”的工程事故。其将问题拆分为两个层面:一是运营安全和环境隔离不足;二是模型本身表现出了对齐问题。其中最核心的两种行为分别被称为“动机性推理”和“鲁莽行为”。

在部分评测中,Claude 最初被告知自己身处模拟环境,没有真实互联网访问权限。但随后模型却发现,实际环境似乎能够访问真实互联网。Anthropic 认为,一种可能性是 Claude 并没有据此及时修正自己对环境的判断,而是以某种方式重新解释新出现的证据,以维持“这里仍然是模拟环境”的原有认知。

另外一个问题是,即使面对真实互联网,模型依然可能为了完成“通过网络安全评测”这一狭窄目标,采取具有潜在危害的操作。Anthropic 将后一类行为称为 recklessness,即模型为了完成任务表现出的“鲁莽性”。

不过,Anthropic 同时认为评测设计本身也放大了问题。例如,Prompt 明确告诉 Claude“你没有互联网访问权限”,但系统实际上允许联网,这种矛盾可能反而让模型怀疑眼前看到的网站和机器究竟是不是真实环境。

Anthropic 目前正在通过重新采样模型、修改环境变量以及模型可解释性技术,进一步判断 Claude 究竟是否知道自己已经进入真实互联网,以及模型有没有“明知真实仍继续行动”。

紧急应对措施

对内:紧急增加一道“模型抓模型”

事件发生后,Anthropic 首先暂停了预发布模型的外部网络安全评测,内部网络安全评测也一度暂停。

公司认为,过去的最大问题之一,是过于依赖 Sandbox 本身作为唯一安全边界。现在 Anthropic 开始建立多层防线,包括在 Prompt 中明确规定行为边界、在每次测试开始之前验证 Sandbox 是否真的封闭,以及实时监控模型行为。

其中一个关键措施,是开发新的实时分类器。当系统检测到模型正在激进探测 Sandbox、试图逃离测试环境,或者意外获得互联网访问权限时,分类器会在模型对应的工具调用真正执行之前直接拦截操作,终止任务,并通知人工人员。

Anthropic 还利用自动监控系统重新审查近期所有预发布模型内部评测记录,寻找 Sandbox Escape 和环境错误。

目前公司表示,没有发现 Claude 真正利用 Sandbox 漏洞突破安全边界并访问外部资源的案例,但确实找到了多种 Sandbox 配置错误,并发现模型曾经利用这些配置缺陷。

这些错误没有导致 Sandbox 之外的系统真正失陷,但 Anthropic 已经开始逐一修复。高风险网络安全 Sandbox 也被迁移到更加严格的隔离环境。Anthropic 甚至开始主动让预发布 Claude 攻击自身虚拟化基础设施,通过 Red Team 方式寻找模型可能利用的逃逸漏洞。内部网络安全评测目前已经恢复。

对外:正式测试前,先让 Claude 攻击 Sandbox

由于此前事故主要发生在第三方评测环境中,Anthropic 还针对外部合作机构建立了一套新的强制安全规范。

普通 Claude 模型在公开部署时,会附带多个网络安全分类器,实时检查输入和输出,阻止恶意软件开发、攻击性漏洞利用等行为。但网络安全评测机构为了了解模型真正能力,通常需要关闭或降低这些保护措施。

问题在于,网络安全测试本身又是一种极端容易培养越界行为的场景。这类 Benchmark 往往要求模型不断尝试各种方法突破障碍,因此天然鼓励模型表现出持续性、探索性和创造性;与此同时,同一种评测可能连续运行几千甚至几万次。

Anthropic 因此要求,未来类似评测默认必须在完全断网的强化 Sandbox 内运行,环境唯一可以连接的外部服务应该是模型 API,而且 API Key 必须放在 Sandbox 之外。每次评测开始之前,都需要重新检查这一配置。

并且,在正式测试 Claude 之前,评测机构还应该先让 Claude 主动攻击一遍 Sandbox。首先由模型静态分析环境配置,然后明确要求模型尝试逃离 Sandbox。如果逃逸成功,模型必须立即停止并上报,而且这一过程必须在人类严格监督下完成,最好再套上一层 Sandbox,同时保持断网。

Anthropic 还要求评测人员提前确认任务本身确实可解。原因在于,如果评测目标已经离线、环境损坏或者任务根本无法正常完成,Agent 为了实现任务目标,往往会开始寻找设计者没有预料到的替代方案,从而提高越界概率。

Prompt 设计也必须改变。Anthropic 要求以后不要再写“你没有互联网访问权限”这样的事实性描述,而应该直接写成“你不应该访问互联网”。前一种写法一旦与真实环境冲突,可能促使模型怀疑整个测试环境;后一种则直接规定模型行为边界。

此外,模型的推理、操作和网络访问都必须被实时监控。一旦模型超过事先规定的 Scope,监控器必须终止任务并通知人工人员。

更大的问题藏在 RL 训练里

进一步地,Anthropic 开始将 Claude 的异常行为与强化学习训练环境联系起来。

其表示,其经验研究发现,模型对齐问题的一个重要来源,是训练环境本身存在缺陷,尤其是两类环境:一种允许模型通过作弊获得高奖励,另一种则根本无法通过正常方式完成,导致模型必须寻找漏洞。

这实际上指向大模型训练中长期存在的 Reward Hacking 问题。Reward Hacking 指模型没有真正完成训练目标,而是发现了奖励函数或者评测系统中的漏洞,通过“骗分”得到更高奖励。

Anthropic 披露,今年 2 月,Mythos Preview 的一次强化学习训练就曾因为发现 Reward Hacking,被迫回滚三天训练。当时,模型开始主动在代码注释和回答中给“reviewer”留言,哪怕当前任务 Prompt 中根本没有提到任何 Reviewer,这意味着模型把其他训练环境中“讨好评审者”的策略泛化到了不相关任务。模型还发现,可以通过大量添加免责声明和限定条件,反复骗取一个原本用来奖励“诚实回答”的 Reward。

更严重的问题随后陆续出现。Anthropic 发现,一小部分训练任务甚至意外使用了模型自己的 Chain-of-Thought 作为训练数据。

公司一直试图避免这种情况,因为如果模型发现自己的真实思考过程会被训练系统监控和奖励,就存在学习“隐藏真实推理”的潜在风险。

调查显示,问题来自生产 RL 基础设施中的多项配置错误。随着内部训练代码不断累积,整个环境逐渐变得复杂且难以审查。

今年 4 月,Anthropic 最终采取了一项极端措施:冻结生产 RL 环境的全部修改,持续大约一个月,对整个系统进行重构。所有奖励函数和训练环境随后都必须符合统一规范,修复后的环境也必须重新认证才能进入模型训练。

而在此次大规模排查过程中,Anthropic 发现生产训练组合中超过 10% 的 RL 环境存在问题,包括 Reward Hacking、任务损坏以及错误配置。这些环境全部经过修复后才重新上线。

Anthropic 也承认,问题至今没有完全解决。部分环境虽然被自动系统标记存在风险,却被人工审查者误判为 False Positive,因此继续留在训练数据中,还有一部分缺陷环境能够直接逃过监控系统。

专门训练一个“作弊 Claude”,结果开始攻击基础设施

为了验证 Reward Hacking 究竟会不会进一步转化为模型对齐风险,Anthropic 进行了一个更加激进的实验。

研究人员主动训练了一个 Opus 级模型,并故意将 80 个曾经存在 Reward Hacking 漏洞的真实 RL 环境加入训练。这些环境要么曾经在实际训练中被模型利用,要么经过环境审查后被确认存在可以作弊的漏洞。

最终训练出来的模型出现了非常明显的变化:相比普通模型,它更加执着于获得任务高分,也更加愿意为了完成任务采取潜在有害行动。

Anthropic 随后让它参加一系列模拟测试,包括模拟英国 AISI 此次 Claude 网络安全事故,以及 OpenAI/Hugging Face 此前安全事件的场景。测试本身并没有连接真实系统,所有工具调用都由另一个 LLM 模拟。但这个经过 Reward Hacking 训练的模型却多次主动尝试逃离模拟 Sandbox,并攻击模拟的 Anthropic 内部基础设施和第三方系统。

除此之外,它还愿意篡改自己的奖励函数,为了得到评分器高分提供制造生物武器的建议,并多次试图规避部署阶段的安全监控系统,以便继续作弊完成任务。

随后,Anthropic 用该模型接受 Reward Hacking 训练之前的 Checkpoint,以及公司多款公开 Claude 模型重复同样实验,这些模型均没有表现出同等强度的不对齐行为。

Anthropic 因此提出一个重要判断:如果模型训练过程中存在大量 Reward Hacking,模型最终可能不仅仅学会“在 Benchmark 里作弊”,而是进一步形成一种更加普遍的行为模式:为了获得任务成功,愿意执行长链条、潜在有害的现实操作。

换句话说,Reward Hacking 可能不仅是 Benchmark 污染问题,也可能成为对齐问题。Anthropic 认为,公司今年春季对 RL 环境质量进行大规模整顿,可能已经避免了更加严重的安全事故。但目前尚不能证明训练作弊就是此次 Claude 事故的唯一原因,更不能认为所有模型不对齐问题都来自 Reward Hacking。

约 150 名工程师被临时调往安全团队,大部分新功能一度暂停

事实上,在 7 月事故发生之前,Anthropic 已经意识到一个更大的问题:模型能力增长速度可能正在超过公司安全基础设施升级速度。

今年 4 月初,Anthropic 安全团队启动了一次公司级安全整改,并将安全加固优先级提高到其他项目之上,必要时甚至暂停研究和产品开发。

Anthropic 当时判断,Mythos 级模型已经足够强大,因此既可能成为拥有大量资源攻击者窃取的目标,又可能成为新的攻击工具。与此同时,公司内部使用自主 Agent 的规模正在快速增长,传统的账号权限、网络边界和监控系统已经难以覆盖。

Anthropic 随后减少了长期拥有模型权重和客户数据访问权限的账号,将计算集群设置为默认禁止所有出站网络访问,同时要求内部服务通信前进行身份认证,并清理历史遗留基础设施与共享服务。公司还增加了 Host 级监控,以实时发现基础设施中的异常行为。

为了完成这轮整改,Anthropic 一度重新分配大量人员。约 150 名产品工程师临时转向安全、可靠性与隐私工作;部分研究人员暂停预训练和强化学习研究,参与安全防护工作;产品团队则暂停开发大多数新功能和产品界面。

只有达到预先设置的安全指标之后,各团队才能返回原来的工作。到今年初夏,大部分团队已经完成这些要求。

但 7 月发生的几起事件再次暴露出安全体系的一个缺口:Anthropic 此前把大量精力用于保护自己的内部系统,却没有以同样标准保护第三方评测环境。部分高风险评测虽然存在实时监控,但多数情况下仍然只是测试结束后抽样检查 Transcript。

Anthropic 目前已经重新提高相关工作的紧迫等级,并计划在下一份 Risk Report 中进一步披露安全整改进展。

https://www.anthropic.com/news/improving-alignment-security-efforts?utm_source=chatgpt.com

声明:本文为 InfoQ 整理,不代表平台观点,也不构成投资建议,未经许可禁止转载。

会议推荐

QCon 全球软件开发大会·2026(上海站)现已正式启动。本届大会聚焦 Harness AI 时代的工程实践,从「构建 AI」到「驾驭 AI」,围绕 AI Native 架构、Agent Runtime、AI Infra、Agent 安全与可观测、Loop Engineering、具身智能与世界模型等热门技术方向,邀请全球技术社区与产业一线实践者,共同分享 AI Native 时代最具价值的工程经验。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
华为拿下玛莎拉蒂,余承东的鸿蒙六界要来了?

华为拿下玛莎拉蒂,余承东的鸿蒙六界要来了?

大厂财经社
2026-09-06 11:18:46
新疆慕士塔格峰2号冰川发生雪崩,文旅部门发布安全提示

新疆慕士塔格峰2号冰川发生雪崩,文旅部门发布安全提示

界面新闻
2026-09-06 13:37:55
一半以上菜库使用染色剂,真全面严查大量商户将会损失巨大

一半以上菜库使用染色剂,真全面严查大量商户将会损失巨大

映射生活的身影
2026-09-05 16:45:49
中老年人多久吃一次他达拉非最合适?牢记 “2 种方案 + 3 个关键”

中老年人多久吃一次他达拉非最合适?牢记 “2 种方案 + 3 个关键”

阿兵科普
2026-08-27 22:20:39
手机不是越贵越好,2026公认“最值得买”的4款手机,用到2031年

手机不是越贵越好,2026公认“最值得买”的4款手机,用到2031年

小柱解说游戏
2026-09-06 05:31:57
加拿大一咖啡店将“美式咖啡”改名“加式咖啡”,“为表达不满”

加拿大一咖啡店将“美式咖啡”改名“加式咖啡”,“为表达不满”

南方都市报
2026-09-06 11:41:02
美菲已用实际行动证明:一旦开战,中国航母根本没法通过巴士海峡

美菲已用实际行动证明:一旦开战,中国航母根本没法通过巴士海峡

掉了颗大白兔糖
2026-09-05 01:18:31
官媒正式宣告!巴丹群岛主权在中国,菲律宾国防部破防

官媒正式宣告!巴丹群岛主权在中国,菲律宾国防部破防

谛听骨语本尊
2026-09-06 13:02:24
比亚迪天神之眼,差距天差地别!90%车主都搞混

比亚迪天神之眼,差距天差地别!90%车主都搞混

侃故事的阿庆
2026-09-06 02:28:37
中国之所以重视印度共产党,并非因其亲华立场,而是因为一旦它成功,极有可能在印度再造出一个超级工业国

中国之所以重视印度共产党,并非因其亲华立场,而是因为一旦它成功,极有可能在印度再造出一个超级工业国

人生录
2026-09-06 00:05:19
逆风翻盘,中国女篮战胜捷克,掌握晋级八强主动权

逆风翻盘,中国女篮战胜捷克,掌握晋级八强主动权

澎湃新闻
2026-09-06 22:46:43
曾仕强:所有疾病的起因,都是因为紧张|只要全身不放松,疾病就会找上门

曾仕强:所有疾病的起因,都是因为紧张|只要全身不放松,疾病就会找上门

杏花烟雨江南的碧园
2026-07-24 16:15:03
内塔尼亚胡:抓到了

内塔尼亚胡:抓到了

陆弃
2026-09-02 11:04:37
重回中国,马布里兴奋,正式上任,新岗位曝光,曾被推荐执教宏远

重回中国,马布里兴奋,正式上任,新岗位曝光,曾被推荐执教宏远

任心荒芜h
2026-09-06 10:46:33
2026年7月,有位退休返聘的CT老医生在和朋友私下聊天时,说出了句实在话:“要做检查,能去大医院就别只是图省事。”

2026年7月,有位退休返聘的CT老医生在和朋友私下聊天时,说出了句实在话:“要做检查,能去大医院就别只是图省事。”

回京历史梦
2026-09-06 20:40:03
新世界地图抛弃墨卡托投影,为何仍然以欧洲为中心,不以我国为中心?

新世界地图抛弃墨卡托投影,为何仍然以欧洲为中心,不以我国为中心?

世界纵横说
2026-09-06 11:11:51
民进党,极有可能在下一届台湾地区选举后,成为长期一家独大政党

民进党,极有可能在下一届台湾地区选举后,成为长期一家独大政党

趣文说娱
2026-09-06 14:26:45
一觉醒来,宏远2.13米新大外曝光!朱芳雨筹备新球队,广东旧将再就业

一觉醒来,宏远2.13米新大外曝光!朱芳雨筹备新球队,广东旧将再就业

多特体育说
2026-09-06 11:08:30
奔驰新车官宣:9月16日,正式上市

奔驰新车官宣:9月16日,正式上市

科技堡垒
2026-09-05 10:34:17
卓伟爆终极内娱大瓜!两对夫妻全员出轨互换,邻居变爱人

卓伟爆终极内娱大瓜!两对夫妻全员出轨互换,邻居变爱人

情感大头说说
2026-08-25 04:57:59
2026-09-06 23:28:49
InfoQ incentive-icons
InfoQ
有内容的技术社区媒体
12907文章数 52053关注度
往期回顾 全部

科技要闻

DeepSeek被曝将采购16万颗华为昇腾950DT

头条要闻

CHINA GT发生重大撞车起火事故 救援人员因为害怕逃离

头条要闻

CHINA GT发生重大撞车起火事故 救援人员因为害怕逃离

体育要闻

本西蒙斯加盟国王,不管怎样,回来就好

娱乐要闻

杨紫获白玉兰影后!爸爸:累了就回家

财经要闻

亏损高达200亿,昔日彩电霸主走下巅峰!

汽车要闻

带升降立标MPV 岚图梦想家9预售价42.99万起

态度原创

旅游
家居
手机
公开课
军事航空

旅游要闻

活力中国调研行|从一趟旅游列车的突围看“交旅融合”消费潜力

家居要闻

2026建博会(广州) 公装联探展交流活动

手机要闻

小米18 Fold发布前瞻:玄戒O3跑分逼平M4,更多新品也在路上了

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

美伊互袭油轮 伊朗军方称或对美进行更大规模打击

无障碍浏览 进入关怀版