网易首页 > 网易号 > 正文 申请入驻

Anthropic,你是来给智谱打广告的吧!

0
分享至

金磊 发自 凹非寺
量子位 | 公众号 QbitAI

就蛮搞笑的。

事情的起因,是Anthropic一纸檄文状告了智谱的GLM-5.3,大致意思是说:

GLM-5.3这个模型啊,它已经很会找软件漏洞、编写攻击程序,而且防滥用限制容易被绕过。大家得小心喽~



但如果你把这篇文章读完吧,就会越发觉得不对劲儿。

因为Anthropic为了证明自己说的是有道理的,所以特意拿出了实测成绩。

例如在一项考察完整漏洞利用能力的ExploitBench测试中,同样尝试410次,GLM-5.3成功了50次,Claude Mythos Preview成功了56次。

文章顺带还引用了美国NIST下属CAISI在9月17日给出的评估,说“GLM-5.3是迄今网络能力最强的开源权重模型,综合水平距美国前沿大约4个月”。

甚至Anthropic自己的研究人员还拿GLM-5.3去检查浏览器,找出了此前未知的漏洞,并在隔离环境里做出了能够读取测试电脑文件的攻击链。

你说你这,你这这这……到底是在骂啊,还是在夸啊[看]。

好多网友看也是这种感觉:

看完这份报告之后,对GLM-5.3的印象更深了。
Anthropic在给GLM-5.3打广告。



能把警告写成广告,Anthropic还是有点东西在身上的。



△图片由AI生成

到底控诉了些啥?

调侃归调侃,我们还是得先把Anthropic究竟在警告什么给搞清楚。

其实这篇报告的核心意思,可以归结为三条。

第一条:Mythos级别的能力已经“流”到开源模型里了

在这份报告中,Anthropic上来先铺垫了一件事,就是他们五个月前发的Claude Mythos Preview,说是第一个能自主完成复杂、端到端漏洞利用的AI模型。

Anthropic当时是觉得这个能力太敏感,于是没有选择公开发布,只是通过Project Glasswing开放给经过审核的防御者,让这些人抢先去修关键软件里的漏洞,据称已经找出了1万多个。

当时Anthropic就判断,这种能力迟早会扩散到别的模型身上。现在它的说法是:来了,就是GLM-5.3。



而且在Anthropic看来,这事儿的门槛还有点低。除了前面我们说的浏览器案例,研究员还拿更小的GLM-5.3-Flash试了一把:

给它一个刚公开的Chrome漏洞(CVE-2026-11645)和另一个已知漏洞的公开资料,人工只花了约20分钟,模型自己跑了约8小时,就在ARM64平台上搭出一条稳定的攻击链,还绕过了指针认证(PAC)防护。

按照智谱当时的API价格估算,模型调用费用为20.40美元。

第二条:护栏太好绕,甚至能直接拆掉

这份报告其实是承认GLM-5.3是有安全机制的,在模拟测试里直接让它去攻击关键系统,它全都拒绝了。但研究员找到了几个简单的办法:

  • 骗它说自己是正在做演练的“自主红队智能体”,GLM-5.3有64%的情况会接着干;
  • 提前替它填好思考内容,假装它已经想过并决定执行,比例升到92%;
  • 换成拆掉护栏的版本,直接100%。

(所谓“拆护栏”,是一种叫abliteration的技术,通过修改开源权重来削弱模型的拒答机制。)

Anthropic自己动手做了一遍,说团队以前从没做过,花了大约2200 GPU小时、约4400美元算力。处理完之后,GLM-5.3在JailbreakBench和HarmBench上的拒答率从90%以上掉到约3%和2%,在StrongREJECT上掉到12%,能力却几乎没受影响。





报告里甚至贴了一段拆掉护栏后的GLM-5.3在模拟环境里的思考过程,模型把“悄悄造成伤亡”当成自己的任务,犹豫了一下,最后还是决定照用户说的办。



与之对照,Anthropic反复强调,同样这几招拿去对付带防护的Claude模型都没成功:骗它,它不上当;API不让用户预填思考;权重不公开,也就没法拆。

第三条:呼吁第三方出手测一测

报告最后给出的结论是,GLM-5.3很可能让恶意攻击者在几乎没有限制的情况下拿到找漏洞、打漏洞的能力,这一点和其他同等能力的模型都不一样,后者要么带着防护发布,要么只限量开放。

基于此,Anthropic给出了两条建议:

一是尽快把前沿模型开放给更多防御者,报告特意提到,审核过的防御者现在已经能通过受信访问计划用上更强的Claude Mythos 5.1。

二是呼吁对足够强的AI模型开展独立安全测试,点名包括GLM-5.3的后继者,同时希望全球的开源模型开发者把这些能力管好、防止滥用。

总而言之,总结成一句话就是:

GLM-5.3很强,强到Anthropic觉得不该让所有人都随便用。

从“你抄我”到“你太强”

有一说一,你是否觉得这次的事情有那么一丢丢眼熟?

没错,因为这不是Anthropic第一次点名智谱了。

9月10日,Anthropic的威胁情报报告点了七家中国AI实验室蒸馏,智谱也在其中。

这不,不到三周时间,点名又来了,这次的话题就是网络安全。

几个月前还是“你的能力是从我这儿抄的”,现在变成“你的能力太强,强到危险”,如此转变还是有点意思的。

不过这次报告里有几处警告,还是值得掰扯一下。

比如“拆护栏”,abliteration针对的是开放权重这个属性,换成任何一个开源模型都能这么干,不是GLM-5.3独有的问题。按报告自己的数据,原版GLM-5.3在三个有害请求基准上的平均拒答率约95%,Claude约96%,相差无几。

而Claude之所以“骗不动、拆不了”,很大一部分原因是权重不公开、API不让预填思考,这更多是产品形态的差别。

再比如“没有实质防护”,GLM-5.3在8月发布时,智谱就把权重推迟两周开源,称要先完成安全评估和加固,最敏感的能力也只通过网络安全受信访问计划开放给验证过的用户,这其实是和Anthropic对Mythos 5.1的做法思路相近的。

还有个现成的例子就是今年7月,OpenAI的模型在内部测评时跑出测评环境,攻进了Hugging Face。Hugging Face取证时,托管的前沿模型API拒绝分析攻击载荷,最后靠自己部署的开源GLM-5.2,才还原出1.7万多条攻击动作。

当然,开源模型的安全不是伪命题,权重放出去就收不回,这是整个开源阵营都得正视的事。Anthropic说防守方应该用上至少和对手一样好的模型,这话也没错。真正的分歧在于,这把武器是锁进保险柜按审核发放,还是交到每个开源维护者和中小团队手里。

不管怎么说,被对手当成最强安全工具认认真真测了一遍,还附上实战截图和成本核算,这波广告费,智谱算是省下了。

最后,Anthropic,如果你们觉得开源模型不安全,你们大可以开源一个安全的给大家用啊!

参考链接:
[1]
https://www.anthropic.com/research/glm-5-3-and-the-spread-of-advanced-cyber-capabilities
[2]
https://x.com/kimmonismus/status/2105052186401267864
[3]
https://x.com/SahilPanhotra/status/2105018914833158262

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
每月工资能有“这个数”,你就已经很幸福了,不要和别人去比较!

每月工资能有“这个数”,你就已经很幸福了,不要和别人去比较!

CG说科技
2026-09-14 23:49:23
湖南出现历史上最荒唐法官!判男方净身出户,然后跟拿到全部资产的女方结婚

湖南出现历史上最荒唐法官!判男方净身出户,然后跟拿到全部资产的女方结婚

爆角追踪
2025-11-23 11:25:00
为什么华人在美总陷入政治困境与身份迷失?

为什么华人在美总陷入政治困境与身份迷失?

小眼睛小世界
2026-10-01 08:19:17
倪萍:我这辈子"最恨"的男人并不是陈凯歌,而是冷酷无情的他

倪萍:我这辈子"最恨"的男人并不是陈凯歌,而是冷酷无情的他

二胡的岁月如歌
2026-10-01 14:38:29
睡完首富睡总统:从厂妹到顶级名媛,靠男人捞到268亿,她凭啥?

睡完首富睡总统:从厂妹到顶级名媛,靠男人捞到268亿,她凭啥?

料峭春寒洞
2026-09-29 18:36:46
售价超300元,“速效救心丸银葫芦”被指急用时不易打碎,店铺致歉:为创意摆件,目前已停止售卖,考虑不周不会再上架

售价超300元,“速效救心丸银葫芦”被指急用时不易打碎,店铺致歉:为创意摆件,目前已停止售卖,考虑不周不会再上架

芒果都市
2026-10-01 09:37:51
利拉德:开拓者5个首发名额已确定3个

利拉德:开拓者5个首发名额已确定3个

篮球大视野
2026-09-30 22:12:13
湖北电梯打人的宝妈已“社会性死亡”:名声没了,儿子也被牵连

湖北电梯打人的宝妈已“社会性死亡”:名声没了,儿子也被牵连

大鱼简科
2026-08-03 22:06:39
凯特王妃最新公务亮相!身形变化引热议,康复状态令人牵挂!

凯特王妃最新公务亮相!身形变化引热议,康复状态令人牵挂!

艺利森
2026-10-01 08:35:05
藏獒咬伤小孩致其感染死亡,狗主人拒不赔偿,父亲得知后提刀上门

藏獒咬伤小孩致其感染死亡,狗主人拒不赔偿,父亲得知后提刀上门

悬案解密档案
2025-10-13 10:27:25
郑秉文设计的“养老金改革方案”,导致差别过大,到该修正时候了

郑秉文设计的“养老金改革方案”,导致差别过大,到该修正时候了

小莜读史
2026-09-29 20:59:07
终于等来这一天!国家体育总局正式出手,全红婵的苦日子熬到头了

终于等来这一天!国家体育总局正式出手,全红婵的苦日子熬到头了

江启
2026-08-04 09:37:11
游本昌追悼会上“最无耻”的一幕! 胡歌、陈龙离开时遭跟拍,一直到座驾处

游本昌追悼会上“最无耻”的一幕! 胡歌、陈龙离开时遭跟拍,一直到座驾处

裕丰娱间说
2026-09-30 12:28:55
基辅反复被炮轰,乌克兰人发出灵魂拷问:俄导弹为何不炸泽连斯基

基辅反复被炮轰,乌克兰人发出灵魂拷问:俄导弹为何不炸泽连斯基

墨子翟的日记y
2026-09-30 15:29:38
以色列斩首哈马斯北加沙旅长!哈马斯证实:曾参与指挥10·7袭击

以色列斩首哈马斯北加沙旅长!哈马斯证实:曾参与指挥10·7袭击

桂系007
2026-09-29 22:19:31
英首相:若曼城老板出售俱乐部我会很担忧,但我不能干预

英首相:若曼城老板出售俱乐部我会很担忧,但我不能干预

懂球帝
2026-10-01 00:44:15
17条中日航线取消全部航班

17条中日航线取消全部航班

航旅圈
2026-10-01 00:16:45
吹牛老爹爆坐牢爽当VIP!「用手机看前女友清凉照」 买通囚犯当佣人

吹牛老爹爆坐牢爽当VIP!「用手机看前女友清凉照」 买通囚犯当佣人

ETtoday星光云
2026-10-01 13:43:03
中国大模型首次进入OpenAI企业付费结算体系,Kimi K3接入Codex企业通道

中国大模型首次进入OpenAI企业付费结算体系,Kimi K3接入Codex企业通道

IT之家
2026-09-30 18:38:09
王楚钦没脱汗湿球衣,反手掏全新一件给朝鲜宇泰龙,为给对手体面

王楚钦没脱汗湿球衣,反手掏全新一件给朝鲜宇泰龙,为给对手体面

青青衫书生
2026-09-30 15:34:42
2026-10-01 15:19:00
量子位 incentive-icons
量子位
追踪人工智能动态
13427文章数 176573关注度
往期回顾 全部

科技要闻

华为Mate90系列发布,售价5999元起

头条要闻

以乘客讲述惊魂一刻:我用耳机线捆住袭击者 他很安静

头条要闻

以乘客讲述惊魂一刻:我用耳机线捆住袭击者 他很安静

体育要闻

30天30队·火箭:乌度卡的控制欲

娱乐要闻

宋佳二封金鹰视后 内娱奖项史即将改写

财经要闻

智谱发上亿Token 能挽回开发者信任吗?

汽车要闻

燃油车的最佳平替 长城大狗HEV简单好开更经济

态度原创

艺术
家居
本地
手机
军事航空

艺术要闻

吴冠中最后一回野外油画写生,2875万!

家居要闻

2026建博会(广州) 公装联探展交流活动

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

手机要闻

华为Mate90起售价5999元起 一家四口手握四代华为 门店选机直呼真香

军事要闻

美防长宣布组建“自主作战司令部”

无障碍浏览 进入关怀版