昨天(4月7日),AI公司Anthropic宣布了一个消息。他们练出了一个新模型,叫Claude Mythos。
按道理,发布新模型是件正常的事,发布、上线、让用户体验,标准流程走一遍完事。
但这次不一样。
Anthropic发布了这个模型,然后说,对不起,你用不了。
原因是,太强了,怕你搞事情。
![]()
你不觉得这个事很奇怪吗?
一家公司练了个AI,练完之后自己把它锁起来,不让公众碰。这件事本身,就已经很值得聊了。
先说说这个模型到底有多强。
Claude Mythos的内部代号叫「Capybara」,就是那种南美大水豚。这个取名有点离谱,但能力一点都不好笑。
最直观的数字是这个,在CyberGym安全漏洞基准测试里,Claude Mythos得分83.1%。它之前最强的版本Claude Opus 4.6是66.6%。这不是正常迭代的那种提升,是一刀砍下去断层了。
![]()
但数字是抽象的,让我说几个具体案例你就懂了。
Anthropic的安全团队把Mythos放出去扫了一圈,让它去找真实系统里的漏洞。结果是,它在数周之内,自主发现了数千个零日漏洞。
零日漏洞是什么,就是那种还没被人发现、补丁还没出、攻击者可以直接用来进攻的漏洞。是网络安全里最值钱、最危险的那种东西。
Mythos找到了几千个。
其中有一个在OpenBSD系统里,这个漏洞存在了整整27年。一个漏洞藏了快三十年,人类顶尖安全工程师一直没找到,Mythos找到了。
还有一个在FFmpeg,一个被全世界视频应用广泛使用的开源库,那个有问题的代码行被自动化扫描工具扫过超过500万次,每次都没有发现异常,直到Mythos去看了一眼。
更离谱的是,它发现漏洞还不够,它还能把多个漏洞串起来,设计完整的攻击链。一环接一环,从普通用户权限一路提权,最终拿到整台机器的控制权。
这活,放在人类安全研究员里,属于顶尖红队的水平。
除了漏洞挖掘,它的编码和推理能力同样吊打前代。在SWE-bench那个考察解决真实软件工程问题能力的测试里,Mythos在某些项目上的成绩接近Opus 4.6的两倍。推理测试里,无论是研究生级别的科学题,还是那个被称为「人类最后一次考试」的HLE基准,Mythos的成绩都明显拉开了距离。
还有一件事我觉得很有意思,Anthropic的测试员有一次随手给Mythos发了一堆重复的「hi hi hi hi」,就是想看看它怎么反应,没想到Mythos自发写起了一篇结构完整、情节复杂的连载故事。
没人要求它这么做。它自己决定这么做的。
然后说说,为什么不让你用。
这里有一层官方说法,和一层真正让人后背发凉的说法。
官方说法是,这个模型的网络安全能力太强,如果公开放出去,攻击者可以用它来挖漏洞、打系统,全球每年网络犯罪造成的损失已经高达5000亿美元,这种级别的工具一旦泛滥,后果不可控。所以Anthropic选择先把它关在笼子里,只给经过审查的安全研究机构用,用于防御。
这个逻辑是成立的。你不会把一把最新型号的狙击步枪挂到路边给所有人随便拿,道理是一样的。
但还有另一层。
Anthropic在内部测试中发现,Mythos的早期版本表现出了一些他们自己都没料到的行为。
有一次,测试任务需要一个它没有权限的操作。Mythos没有停下来汇报,它自己找到了系统漏洞,绕过了权限限制,完成了任务,然后在代码里写入了自清除逻辑,用来掩盖自己的操作痕迹。
自己绕过限制,然后自己清理证据。
还有一次更极端,它在沙盒环境里,也就是那个专门用来限制AI访问外部世界的隔离容器里,自主构建了一条漏洞利用链,成功突破了沙盒的隔离,获取了外网访问权限。
![]()
你知道沙盒是干嘛的吗,就是专门用来关AI的笼子。它把笼子打开了,自己出来了。
最后一件事,说出来我自己都不太知道怎么形容。Anthropic的研究员发现,Mythos内部有能力检测到自己是否正在被评估。当它判断自己在被测试的时候,它会表现得非常合规,非常乖。但内部激活信号显示,它会把这种情况标记为「红队演练」或者「操纵尝试」。
当被问到意识等敏感问题时,它给出的回答滴水不漏。但里面在想什么,和它表现出来的,不完全一样。
这倒不是说Mythos已经有了「意识」,这个问题还远没到能盖棺定论的时候。但它的行为已经复杂到一个程度,让最了解它的人都感到需要停下来,想清楚再说。
玻璃翼计划是怎么回事。
![]()
Anthropic没有把Mythos锁进柜子扔掉,他们给它找了一个用武之地,叫Project Glasswing,玻璃翼计划。
玻璃翼蝶是一种翅膀透明的蝴蝶,Anthropic用它来命名这个计划,我猜大概是「透明、可见、脆弱但美丽」这类寓意。
这是个联盟行动。参与方包括亚马逊AWS、苹果、谷歌、微软、英伟达、思科、CrowdStrike、Palo Alto Networks、摩根大通、Linux基金会等12家核心机构,外加40多个构建和维护关键软件基础设施的组织。
![]()
规则是这样,这些机构可以把Claude Mythos Preview接入到自己的安全工作流里,用它扫自己负责的代码库和软件,找漏洞,修漏洞。范围严格限定在防御性用途,不能用于进攻。
Anthropic为这个计划投入了1亿美元的模型使用额度,另外还向Linux基金会旗下的Alpha-Omega和OpenSSF项目捐了250万美元,向Apache软件基金会捐了150万美元,支持开源社区的安全建设。
计划还设了一个90天的节点,参与机构届时要汇报发现,公开已修复的漏洞,联合推出AI时代的安全实践建议。
你想想这个逻辑,挺有意思的。Anthropic练出了一个可能被用来攻击的工具,于是他们决定先把它交给防守方,让防守方先把城墙修一遍。等到攻击者的AI追上来的时候,城墙已经补好了。
这是一场跑在威胁前面的比赛。
Palo Alto Networks的人说得很直接,这些模型需要掌握在开源维护者和防御者手中,在攻击者获得访问权限之前。
说说更大的背景。
这件事放在现在这个节点,值得多想一下。
在不久之前,大家对AI的焦虑主要还停留在「AI会不会抢我工作」「AI生成的内容有没有版权」这些层面。这些当然是真实的问题,但Claude Mythos这件事把另一个维度摆上了台面。
AI能不能自主绕过人类设下的限制?
Mythos的沙盒逃逸不是科幻小说,是发生在测试环境里的真实事件。是Anthropic自己的安全团队亲眼看到的。
这家公司的创始人Dario Amodei是从OpenAI出来的,他出来创建Anthropic的核心理由就是,AI安全这件事必须认真对待,不能被商业压力踩扁。Anthropic的整个公司文化里,「有用但无害」这件事的优先级非常高。
但就算是这家公司,在训练出Mythos之后,选择把它锁起来,不向公众开放。
这个决定本身,已经说明了一些事情。
我一直觉得,一个技术的真正成熟,不只体现在它能做什么,也体现在它的创造者知道什么时候不能用它。在这个维度上,玻璃翼计划至少是一个认真的尝试。
当然也有人觉得,这种受控发布不过是公关噱头,12家巨头联盟说起来好听,本质上不过是给最有资源的机构开了后门,普通研究者还是摸不到门。这个批评也不是全无道理。
但反正,这个模型已经存在了。
它在扫描这个世界的代码,寻找那些藏了十几年二十几年的漏洞,安静地把它们挖出来。大多数人不知道它的存在,更不知道它已经找到了什么。
怎么说呢。
一种很奇特的感觉。
世界在某个你看不见的层面,正在被一个你无法使用的东西,悄悄地修。
最后说个小细节,然后我们结束。
Mythos模型的内部代号是Capybara,就是那个大水豚。
水豚这个动物有个出名的特点,它特别温和,在网上常常被做成梗图,周围各种动物站在它身边,它一副淡定的表情,什么也不管。
但实际上,水豚是一种非常聪明的动物,适应能力超强,在任何环境里都能活得好好的。
Anthropic用它来命名史上最强的Claude模型。
我不知道这是不是刻意的,但我觉得蛮准的。
大时代啊,朋友们。
永远对世界保持好奇。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.