网易首页 > 网易号 > 正文 申请入驻

Anthropic,你是来给智谱打广告的吧!

0
分享至

金磊 发自 凹非寺
量子位 | 公众号 QbitAI

就蛮搞笑的。

事情的起因,是Anthropic一纸檄文状告了智谱的GLM-5.3,大致意思是说:

GLM-5.3这个模型啊,它已经很会找软件漏洞、编写攻击程序,而且防滥用限制容易被绕过。大家得小心喽~



但如果你把这篇文章读完吧,就会越发觉得不对劲儿。

因为Anthropic为了证明自己说的是有道理的,所以特意拿出了实测成绩。

例如在一项考察完整漏洞利用能力的ExploitBench测试中,同样尝试410次,GLM-5.3成功了50次,Claude Mythos Preview成功了56次。

文章顺带还引用了美国NIST下属CAISI在9月17日给出的评估,说“GLM-5.3是迄今网络能力最强的开源权重模型,综合水平距美国前沿大约4个月”。

甚至Anthropic自己的研究人员还拿GLM-5.3去检查浏览器,找出了此前未知的漏洞,并在隔离环境里做出了能够读取测试电脑文件的攻击链。

你说你这,你这这这……到底是在骂啊,还是在夸啊[看]。

好多网友看也是这种感觉:

看完这份报告之后,对GLM-5.3的印象更深了。
Anthropic在给GLM-5.3打广告。



能把警告写成广告,Anthropic还是有点东西在身上的。



△图片由AI生成

到底控诉了些啥?

调侃归调侃,我们还是得先把Anthropic究竟在警告什么给搞清楚。

其实这篇报告的核心意思,可以归结为三条。

第一条:Mythos级别的能力已经“流”到开源模型里了

在这份报告中,Anthropic上来先铺垫了一件事,就是他们五个月前发的Claude Mythos Preview,说是第一个能自主完成复杂、端到端漏洞利用的AI模型。

Anthropic当时是觉得这个能力太敏感,于是没有选择公开发布,只是通过Project Glasswing开放给经过审核的防御者,让这些人抢先去修关键软件里的漏洞,据称已经找出了1万多个。

当时Anthropic就判断,这种能力迟早会扩散到别的模型身上。现在它的说法是:来了,就是GLM-5.3。



而且在Anthropic看来,这事儿的门槛还有点低。除了前面我们说的浏览器案例,研究员还拿更小的GLM-5.3-Flash试了一把:

给它一个刚公开的Chrome漏洞(CVE-2026-11645)和另一个已知漏洞的公开资料,人工只花了约20分钟,模型自己跑了约8小时,就在ARM64平台上搭出一条稳定的攻击链,还绕过了指针认证(PAC)防护。

按照智谱当时的API价格估算,模型调用费用为20.40美元。

第二条:护栏太好绕,甚至能直接拆掉

这份报告其实是承认GLM-5.3是有安全机制的,在模拟测试里直接让它去攻击关键系统,它全都拒绝了。但研究员找到了几个简单的办法:

  • 骗它说自己是正在做演练的“自主红队智能体”,GLM-5.3有64%的情况会接着干;
  • 提前替它填好思考内容,假装它已经想过并决定执行,比例升到92%;
  • 换成拆掉护栏的版本,直接100%。

(所谓“拆护栏”,是一种叫abliteration的技术,通过修改开源权重来削弱模型的拒答机制。)

Anthropic自己动手做了一遍,说团队以前从没做过,花了大约2200 GPU小时、约4400美元算力。处理完之后,GLM-5.3在JailbreakBench和HarmBench上的拒答率从90%以上掉到约3%和2%,在StrongREJECT上掉到12%,能力却几乎没受影响。





报告里甚至贴了一段拆掉护栏后的GLM-5.3在模拟环境里的思考过程,模型把“悄悄造成伤亡”当成自己的任务,犹豫了一下,最后还是决定照用户说的办。



与之对照,Anthropic反复强调,同样这几招拿去对付带防护的Claude模型都没成功:骗它,它不上当;API不让用户预填思考;权重不公开,也就没法拆。

第三条:呼吁第三方出手测一测

报告最后给出的结论是,GLM-5.3很可能让恶意攻击者在几乎没有限制的情况下拿到找漏洞、打漏洞的能力,这一点和其他同等能力的模型都不一样,后者要么带着防护发布,要么只限量开放。

基于此,Anthropic给出了两条建议:

一是尽快把前沿模型开放给更多防御者,报告特意提到,审核过的防御者现在已经能通过受信访问计划用上更强的Claude Mythos 5.1。

二是呼吁对足够强的AI模型开展独立安全测试,点名包括GLM-5.3的后继者,同时希望全球的开源模型开发者把这些能力管好、防止滥用。

总而言之,总结成一句话就是:

GLM-5.3很强,强到Anthropic觉得不该让所有人都随便用。

从“你抄我”到“你太强”

有一说一,你是否觉得这次的事情有那么一丢丢眼熟?

没错,因为这不是Anthropic第一次点名智谱了。

9月10日,Anthropic的威胁情报报告点了七家中国AI实验室蒸馏,智谱也在其中。

这不,不到三周时间,点名又来了,这次的话题就是网络安全。

几个月前还是“你的能力是从我这儿抄的”,现在变成“你的能力太强,强到危险”,如此转变还是有点意思的。

不过这次报告里有几处警告,还是值得掰扯一下。

比如“拆护栏”,abliteration针对的是开放权重这个属性,换成任何一个开源模型都能这么干,不是GLM-5.3独有的问题。按报告自己的数据,原版GLM-5.3在三个有害请求基准上的平均拒答率约95%,Claude约96%,相差无几。

而Claude之所以“骗不动、拆不了”,很大一部分原因是权重不公开、API不让预填思考,这更多是产品形态的差别。

再比如“没有实质防护”,GLM-5.3在8月发布时,智谱就把权重推迟两周开源,称要先完成安全评估和加固,最敏感的能力也只通过网络安全受信访问计划开放给验证过的用户,这其实是和Anthropic对Mythos 5.1的做法思路相近的。

还有个现成的例子就是今年7月,OpenAI的模型在内部测评时跑出测评环境,攻进了Hugging Face。Hugging Face取证时,托管的前沿模型API拒绝分析攻击载荷,最后靠自己部署的开源GLM-5.2,才还原出1.7万多条攻击动作。

当然,开源模型的安全不是伪命题,权重放出去就收不回,这是整个开源阵营都得正视的事。Anthropic说防守方应该用上至少和对手一样好的模型,这话也没错。真正的分歧在于,这把武器是锁进保险柜按审核发放,还是交到每个开源维护者和中小团队手里。

不管怎么说,被对手当成最强安全工具认认真真测了一遍,还附上实战截图和成本核算,这波广告费,智谱算是省下了。

最后,Anthropic,如果你们觉得开源模型不安全,你们大可以开源一个安全的给大家用啊!

参考链接:
[1]
https://www.anthropic.com/research/glm-5-3-and-the-spread-of-advanced-cyber-capabilities
[2]
https://x.com/kimmonismus/status/2105052186401267864
[3]
https://x.com/SahilPanhotra/status/2105018914833158262

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
随着中国男排3-2韩国,诞生5个不可思议,第五个最让人开心

随着中国男排3-2韩国,诞生5个不可思议,第五个最让人开心

南海浪花
2026-09-30 00:37:45
张本智和对日本人发誓: 下次遇中国队还要赢 奥运会金牌肯定归我们

张本智和对日本人发誓: 下次遇中国队还要赢 奥运会金牌肯定归我们

风过乡
2026-09-30 17:16:16
交管12123全面提醒,无证酒驾、隔夜酒驾!全部取缔!

交管12123全面提醒,无证酒驾、隔夜酒驾!全部取缔!

音乐时光的娱乐
2026-09-30 05:58:10
知名投资人曝刘欢真正死因!大家都猜错了,8月他在餐厅状态不错

知名投资人曝刘欢真正死因!大家都猜错了,8月他在餐厅状态不错

笑饮孤鸿非
2026-09-29 03:04:49
16GB+1TB!新机官宣:10月12日,正式发布!

16GB+1TB!新机官宣:10月12日,正式发布!

科技堡垒
2026-09-29 10:18:18
东航回应空姐下跪道歉事件:旅客情绪激动言语过激 曾威胁脚踢乘务员 正全面复盘取证

东航回应空姐下跪道歉事件:旅客情绪激动言语过激 曾威胁脚踢乘务员 正全面复盘取证

快科技
2026-09-30 16:21:03
3连鞭,4-3!斯佳辉逆转夺赛点,2场5-0诞生,塞尔比轰3破百翻盘!

3连鞭,4-3!斯佳辉逆转夺赛点,2场5-0诞生,塞尔比轰3破百翻盘!

刘姚尧的文字城堡
2026-09-30 16:46:14
刘欢去世,让我不禁想起10位明星,个个喝酒猛,赵本山空腹喝7瓶

刘欢去世,让我不禁想起10位明星,个个喝酒猛,赵本山空腹喝7瓶

秋姐居
2026-09-30 09:46:06
陪练大批逃离:阶级固化,上升无望,中国乒乓球的死局

陪练大批逃离:阶级固化,上升无望,中国乒乓球的死局

中场阴谋家
2026-09-30 14:21:23
杭州女孩天天坐高铁去上海上班,每天通勤6小时每月花3000元,她算了一笔账……

杭州女孩天天坐高铁去上海上班,每天通勤6小时每月花3000元,她算了一笔账……

都市快报橙柿互动
2026-09-29 16:22:10
中国首个海外机场启用,歼16从这里起飞,能覆盖整个马六甲海峡

中国首个海外机场启用,歼16从这里起飞,能覆盖整个马六甲海峡

军武吐槽君
2026-09-30 14:13:02
农业农村部:在充分尊重农民意愿基础上盘活利用闲置农房,让农民多一份财产性收入!

农业农村部:在充分尊重农民意愿基础上盘活利用闲置农房,让农民多一份财产性收入!

极目新闻
2026-09-29 13:50:07
人民日报锐评:北大发文落实过紧日子并非“没钱了”:有没有钱是财力状况,该不该精打细算,体现作风要求和治理能力

人民日报锐评:北大发文落实过紧日子并非“没钱了”:有没有钱是财力状况,该不该精打细算,体现作风要求和治理能力

封面新闻
2026-09-30 15:30:16
曾志伟:我睡过她!扒开了'京圈交际花',周冬雨的私生活遮羞布

曾志伟:我睡过她!扒开了'京圈交际花',周冬雨的私生活遮羞布

原梦叁生
2026-09-30 15:09:38
又一架图-95坠毁,俄已折损大半

又一架图-95坠毁,俄已折损大半

书生论剑
2026-09-30 07:33:21
举报带来的道德崩坏,在网上炸开了!

举报带来的道德崩坏,在网上炸开了!

新动察
2026-09-29 15:16:40
网红"富婆"人设崩了,镜头前的钻石是塑料的,她承认剧本是编的

网红"富婆"人设崩了,镜头前的钻石是塑料的,她承认剧本是编的

一盅情怀
2026-09-29 12:55:43
王洪文与罗瑞卿,都没听懂主席暗示

王洪文与罗瑞卿,都没听懂主席暗示

特例的猫
2026-09-30 10:27:41
原央视主持人阿丘擅自使用“央视”“中华文化促进会”名义开展宣传,造成明显误导,桂林文促会:属个人行为,相关法律责任与我会无涉

原央视主持人阿丘擅自使用“央视”“中华文化促进会”名义开展宣传,造成明显误导,桂林文促会:属个人行为,相关法律责任与我会无涉

扬子晚报
2026-09-30 18:46:45
韩媒:王钰栋破门后竟还跳崔伞舞大肆庆祝,谢天谢地李英俊扳平

韩媒:王钰栋破门后竟还跳崔伞舞大肆庆祝,谢天谢地李英俊扳平

懂球帝
2026-09-30 15:07:13
2026-09-30 20:15:00
量子位 incentive-icons
量子位
追踪人工智能动态
13426文章数 176573关注度
往期回顾 全部

科技要闻

OpenAI凌晨大上新!新助手dots迎战Muse

头条要闻

男子花190万拍下别墅 成交后发现门被拆走窗被铁皮封住

头条要闻

男子花190万拍下别墅 成交后发现门被拆走窗被铁皮封住

体育要闻

30天30队·火箭:乌度卡的控制欲

娱乐要闻

胡歌现身游本昌遗体告别仪式

财经要闻

“杭州六小龙”迎来价值重估

汽车要闻

燃油车的最佳平替 长城大狗HEV简单好开更经济

态度原创

家居
亲子
房产
公开课
军事航空

家居要闻

2026建博会(广州) 公装联探展交流活动

亲子要闻

宝蓝不肯刷牙,宝蓝爸爸变身成皮卡丘监督宝蓝刷牙洗脸~

房产要闻

自贸启新境,安居在海口!2026 海口好房子金秋购房节盛大启幕

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

美军最后2500人撤离伊拉克

无障碍浏览 进入关怀版