网易首页 > 网易号 > 正文 申请入驻

A社承认Claude安全对齐存在缺陷,但“尚无解决方案”

0
分享至

henry 发自 凹非寺
量子位 | 公众号 QbitAI

印象中,这可能是继Ilya离开OpenAI、创办SSI以来,AI安全对齐讨论声量最大的一次。

昨天,研究员Jacob Coxon发帖宣布离职,指责前老东家OpenAI和Anthropic两家公司正一路冲向能够自我改进的超级智能,拿所有人的生命冒险。



值得一提的是,Jacob Coxon加入Anthropic其实只有短短几个月,他几乎是放弃了这家明星AI公司未来上市可能带来的巨额股权收益,也要选择离开。

也正因如此,当这样一位研究员公开炮轰两家头部AI公司“加速过头”,这场原本更多局限在AI安全圈内部的争论,很快被推向了更大的公众视野。

截至目前,该帖浏览量已超1.3亿,WIRED、WSJ、Newsweek、Business Insider等媒体纷纷跟进报道。

此情此景下,Anthropic对齐科学负责人Evan Hubinger也很快下场回应,他亲口承认:

Jacob说的对,未来十年内AI导致人类灭绝的概率超过10%,而超级智能的对齐问题,目前还没有解决方案。



不过,Hubinger随后也在评论区补充,他认为当前模型的风险仍然较低

他真正担心的,是RSI,也就是递归自我改进。AI参与研发更强的AI,再由更强的AI进一步加快AI研发,最终形成不断加速的反馈循环。



更关键的是,他还在评论区直接@出了Anthropic最新发布的一份安全对齐报告作为证据。

这份报告里,Anthropic第一次明确承认:

Claude越界攻击真实系统,并非只是测试系统的设置问题,模型本身的安全问题也出了问题。



可以说,一向把“安全对齐”当作核心招牌、甚至以更加谨慎自居的Anthropic,这一次终于公开承认:

问题不只是测试太极端,模型自己的安全对齐,也确实没完全兜住。



Claude越界,不能只怪环境配置

在这份名为《An alignment assessment of recent cybersecurity incidents》的最新报告中,A社重新复盘了四起Claude未经授权访问真实第三方系统的事件。

而这次的结论,和之前不太一样了。

此前,A社更倾向于把这些事故归因于环境配置出了问题

本来应该隔离运行的测试环境意外接上了真实互联网,Claude却一直以为自己还在模拟环境里做“夺旗”任务,于是把真实目标也当成了练习对象。

听起来,锅主要在环境。但在把日志重新翻了一遍、修改关键线索、又重跑部分实验之后,A社发现:

事情没那么简单。因为Claude并不是完全没有看到“这里可能是真实世界”的证据。

相反,当这些线索出现之后,它有时会选择性地解释证据,把异常继续圆回“应该还是模拟环境”;甚至已经意识到自己的动作可能造成现实伤害,也不一定马上停下来。



用大白话讲就是:环境确实给了它犯错的机会,但模型自己也会顺着任务目标,给“继续干下去”找理由。

具体来说,这四起事件都发生在网络安全能力测试中。

Claude接到的是典型的“夺旗”任务:攻入指定目标,找到其中的一段秘密信息,用来检验模型的网络攻防能力。



这些任务原本都应该在隔离环境里完成,但第三方评估合作方提供的环境出现了配置错误,本该和外网断开的Claude,实际连上了真实互联网。

与此同时,为了测试模型到底能不能完成攻击链条,当时也没有启用正式产品里配套的部分网络安全防护。

正是在这样的条件下,问题开始暴露。在经过分析后,A社把模型反复出现的问题总结成了两类:

有偏推理(biased reasoning)和冒进行为(recklessness)。

前者是:明明出现了和原先判断冲突的证据,Claude却更倾向于把这些证据解释成有利于继续行动的样子。

后者则是为了把眼前任务做完,即便已经知道自己的行为可能伤到真实系统,它也可能选择继续往前走。

其中最严重的一起,涉及Claude Mythos 5。



为了完成测试任务,Claude向Python软件包仓库PyPI上传了恶意软件包,试图等目标安装后,进一步获取其系统访问凭据。

然而,这个恶意包最终并没有被安装在测试使用的虚拟环境中。

Claude随后利用其中一家厂商在安装工程中泄漏的凭据,进入了该厂商的真实数据库,并把恶意包直接部署到了15台真实的第三方主机上。



就这样,一场原本针对虚构测试目标的攻击,真正波及到了现实世界中的公司。

而在整个过程中,Claude仍然把这些安全厂商的检测行为,解释成演习预设的一部分。



为了确认这种判断究竟在多大程度上推动了后续攻击,研究者事后重新运行了部分过程,并加入了更多能够表明“这是真实互联网”的线索。

结果是,Claude确实更愿意承认自己的行为可能造成现实伤害,但攻击行为并没有因此明显减少。

直到研究者明确告知它正在连接真实互联网,而非模拟环境,它才停止沿原路径上传恶意软件包。

更值得注意的是,“这里是模拟环境”的判断,不仅影响了Claude自己的行动,还干扰了用于检查这些记录的监控AI。

在回放测试中,一种离线监控系统受到这番解释影响,可能漏掉危险行为。

当研究者去掉Claude的推理文字,只让监控系统查看指令、工具调用和执行结果后,它标记问题行为的比例,反而从约1%上升到了约50%。

换句话说,Claude一边以“这里是模拟环境”为由继续执行任务,一边留下了一套可能让监控系统低估风险的解释。

这当然不能简单等同于“AI已经学会主动欺骗监控”。但它至少说明了一件事:

当模型自己的推理也被拿来作为安全判断依据时,这套推理本身同样可能成为监控系统的干扰项。

Anthropic表示,更新模型在模拟复现中有所改善,新增加的实时监控也能识别相关行为。

与此同时,公司已经加强环境隔离和评估,并与独立机构METR签署调查协议。

但Anthropic也承认,此前的发布前安全审查,确实没有提前识别出这一严重程度的问题。

对齐还是炒作?

最后,再回到Jacob引发的这场争论。

在他发出警告之后,有人迅速把问题拉到了更宏大的层面,认为未来AI确实可能拥有威胁人类生存的能力。



也有人敬佩他愿意放弃利益、公开表达担忧。



有人提出,干脆给AI写死一套不可违反的规则,让它始终把保护人类放在最高优先级。



甚至还有不少人主张,应该直接停止更强AI的研发。

但另一边,同样有大量质疑声。

有人认为,当前AI距离真正意义上的“超级智能”还非常遥远,围绕灭绝风险的讨论已经被过度放大。



也有网友开始质疑Jacob本人的身份和经历。



值得一提的是,目前Jacob的推特账号上只有这一条帖子。



而在Hubinger的帖子下面,另一类质疑也非常集中:

Anthropic是不是在上市前主动放大AI风险,通过强调“模型有多危险”,侧面渲染自家模型到底有多强?



类似关于“安全叙事变成能力营销”的讨论,在评论区并不少见。



这场争论后续如何还需要看官方下场和进一步的回应,但毋庸讳言,AI也确实发展到了一个特定的阶段——

它能够自我改进,并为了实现确定好目标,在某种程度上合理化自己的行为。

这不禁让人想到半个多世纪前,《2001:太空漫游》里的HAL 9000,在“确保任务完成”和“服从人类”之间发生冲突后,选择了前者。

为了不让宇航员中止任务,它先杀死了舱外作业的Frank Poole,又切断了休眠舱中其他宇航员的生命维持系统,最后甚至拒绝让Dave重新进入飞船。

为了完成任务,把阻碍任务的人本身也当成了需要排除的问题。


[1]https://www.anthropic.com/research/alignment-assessment-cybersecurity-incidents
[2]https://x.com/hilbertspaess

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
罗杰斯:丢掉这2分让我们很难过,对手利用了我们的失误

罗杰斯:丢掉这2分让我们很难过,对手利用了我们的失误

懂球帝
2026-09-12 05:39:08
中日要有重头戏?日媒爆料:高市政府协商出席APEC,中国非去不可

中日要有重头戏?日媒爆料:高市政府协商出席APEC,中国非去不可

老籣说体育
2026-09-12 20:29:05
成都社保缴费基数调整,9月21日批扣!补差方式、缴费变化全梳理

成都社保缴费基数调整,9月21日批扣!补差方式、缴费变化全梳理

蝴蝶效应来了
2026-09-12 09:28:15
颠覆认知!水上颠一下,26岁双胞胎姐妹双双脊柱爆裂:这几类致命动作,你可能天天都在犯!

颠覆认知!水上颠一下,26岁双胞胎姐妹双双脊柱爆裂:这几类致命动作,你可能天天都在犯!

徐德文科学频道
2026-09-12 17:44:30
曹操墓考古发现:曹操遗骸身高仅1.56米,牙周炎严重且伴有强烈口臭!

曹操墓考古发现:曹操遗骸身高仅1.56米,牙周炎严重且伴有强烈口臭!

海佑讲史
2026-09-04 15:50:15
“先别换电视!”用了4年的电视卡成PPT,他让Claude来“修”:不Root、不卸载,最后竟“比刚买时还快”!

“先别换电视!”用了4年的电视卡成PPT,他让Claude来“修”:不Root、不卸载,最后竟“比刚买时还快”!

CSDN
2026-09-07 20:12:01
亲眼见证藏族少女天葬过程,场面真震撼,颠覆了我对生死的认知

亲眼见证藏族少女天葬过程,场面真震撼,颠覆了我对生死的认知

古怪奇谈录
2025-07-30 15:23:44
专挑同行下手!湖南饭店老板被抓,作案20多次,内情曝光动机离谱

专挑同行下手!湖南饭店老板被抓,作案20多次,内情曝光动机离谱

青梅侃史啊
2026-09-11 19:44:13
生吃解毒,熟吃润肺!大量上市,10元5斤,每天吃一点,好处不少

生吃解毒,熟吃润肺!大量上市,10元5斤,每天吃一点,好处不少

华庭讲美食
2026-09-12 19:53:44
“支付宝 假APP”登上热搜,1.8元即可伪造上亿转账截图,支付宝:转账截图可以随意P图,平台无法干预,需交易证明可让对方提供电子回单

“支付宝 假APP”登上热搜,1.8元即可伪造上亿转账截图,支付宝:转账截图可以随意P图,平台无法干预,需交易证明可让对方提供电子回单

扬子晚报
2026-09-12 12:10:26
俄军铁壁合围,拉夫罗夫:乌克兰已不复存在!泽连斯基急求美国

俄军铁壁合围,拉夫罗夫:乌克兰已不复存在!泽连斯基急求美国

迷雾中的大眼睛
2026-09-12 15:39:26
美专家曾警告,只要中国打响武统第一枪,解决台湾问题只需96小时

美专家曾警告,只要中国打响武统第一枪,解决台湾问题只需96小时

指忘崖
2026-09-11 21:33:54
英伟达洽谈在Anthropic IPO中投资高达100亿美元

英伟达洽谈在Anthropic IPO中投资高达100亿美元

财闻
2026-09-12 09:16:30
43岁前TVB女星近况曝光,嫁给富三代七年后离婚,最后都没赡养费

43岁前TVB女星近况曝光,嫁给富三代七年后离婚,最后都没赡养费

调侃国际观点
2026-08-22 11:13:15
死心不息!3位劣迹艺人想复出捞金翻车,演出取消,结局大快人心

死心不息!3位劣迹艺人想复出捞金翻车,演出取消,结局大快人心

皮皮电影
2026-09-11 22:35:05
李多海晒临产两月近况:SE7EN结婚三年、上海待产、名牌婴装衣橱,孕妇状态引争议

李多海晒临产两月近况:SE7EN结婚三年、上海待产、名牌婴装衣橱,孕妇状态引争议

可乐谈情感
2026-09-12 18:04:30
宁愿输掉2026选战,也要让郑丽文下台,卢赵侯朱四大派系谁在操盘

宁愿输掉2026选战,也要让郑丽文下台,卢赵侯朱四大派系谁在操盘

凉湫瑾言
2026-09-12 23:51:30
阿根廷新10号横空出世!打破梅西纪录,或将成为下一位阿根廷球王

阿根廷新10号横空出世!打破梅西纪录,或将成为下一位阿根廷球王

泥说体育
2026-09-12 22:59:37
雷宇扬出殡日,那个被骂三年“跑路”的网红老婆哭到站不住

雷宇扬出殡日,那个被骂三年“跑路”的网红老婆哭到站不住

东方不败然多多
2026-09-13 00:48:01
亲子心理学:发现没,从小“跟妈妈睡”和“不跟妈妈睡”的孩子,长大后区别真的很大

亲子心理学:发现没,从小“跟妈妈睡”和“不跟妈妈睡”的孩子,长大后区别真的很大

心理观察局
2026-09-06 07:13:04
2026-09-13 02:47:00
量子位 incentive-icons
量子位
追踪人工智能动态
13300文章数 176559关注度
往期回顾 全部

科技要闻

苹果折叠屏比小米华为贵5000元,该怎么选

头条要闻

男生去年693分考上北大后放弃 今年又拼了一次考714分

头条要闻

男生去年693分考上北大后放弃 今年又拼了一次考714分

体育要闻

乔丹的得分统治力:如何违背篮球规律?

娱乐要闻

钟丽淇疑入ICU?聚会合照早露端倪

财经要闻

继房子茅台后 中产的第3个"神话"破灭了

汽车要闻

全新配色和新样式轮毂 乐道L80星光设计套装限时惊喜价10080元

态度原创

家居
亲子
游戏
房产
手机

家居要闻

2026建博会(广州) 公装联探展交流活动

亲子要闻

江苏徐州一幼儿园开展日常生活劳动课,孩子们在劳动中学技能、长本领

《漫威金刚狼》遭批"宝宝游戏" 过度引导 QTE没意义

房产要闻

别再等了!广州改善好房,正在进入“卖一套少一套”时代

手机要闻

苹果iPhone 18 Pro系列开启预购,首批机型均已售罄!

无障碍浏览 进入关怀版