![]()
一觉醒来,四家硅谷AI公司同一天在谈一件事:AI安全。
9月2日凌晨,Anthropic同时发布了Claude Fable 5.1和Claude Mythos 5.1。
这两款模型使用相同的底层模型,但安全限制不同。Fable 5.1已经广泛开放,面向Pro、Max、Team和Enterprise用户,并通过Claude API及主流云平台提供。
Mythos 5.1过审核机制向部分网络安全和生命科学专业用户开放,目前访问范围仍然非常有限。
Fable 5.1主要强化了长时间Agent和编程任务,新模型在Terminal-Bench 4.0得到55.8%,超过Fable 5的42.0%和Opus 5的52.3%;科研Agent则从上一代24.7%涨到52.6%。放宽网络安全限制后的Mythos 5.1,在同一个编程测试还能进一步达到60.9%。
价格也降了,普通输入和输出仍是每百万Tokens10美元和50美元,但缓存读取从1美元降到0.25美元。Anthropic估算,普通任务总成本约降25%,需要反复读取大量上下文的Agent任务最多能省约45%。
然而,Fable 5.1一上线,全网都在问:额度崩了。
![]()
有用户反馈,Fable 5.1额度变得不耐用,30分钟就用了Fable周额度的15%,太夸张了。
也有用户指出,无论是5倍,还是20倍额度,Claude Fable 5.1会在不到30分钟内耗尽你的5小时限制。
这不直接给Astra送分么。
就在刚刚,OpenAI紧急发文,首次透露Astra消息。
OpenAI CEO奥尔特曼(Sam Altman)发推文大谈AI安全,直言新的Astra模型还在测试,核心是为了AI模型的安全有限,能力与防护措施同步推进比以往任何时候都更加重要。
“我们还有更多工作要做,但已经取得了很大进展。我们也即将推出我们的下一款模型。一方面,Astra非常出色,我们很期待看到人们将用它构建什么,我们为自己的工作感到骄傲。另一方面,我们显然正处于一个需要谨慎的发展阶段,我们正在控制进度,以确保能够满足新能力水平所需的安全标准。”
![]()
有网友直言,Astra模型快点上线吧,要不然Fable 5.1天天说是第一了。
![]()
而OpenAI也正式确认全新模型Astra。
而即将发布的Astra已达到其「Critical」网络安全能力门槛,也是公司史上首个达到“关键级网络安全能力”的AI模型。
简单来说,这是第一款无需人类手把手操控,就能自主挖掘系统漏洞、打造攻击链条、入侵高防护级别系统的人工智能, 给它合适的工具和权限后,Astra已能自己寻找未知漏洞,并开发攻击方法,不需要人一步步指导。
这标志着AI自主攻防从科幻设想变成了现实。
正式上线初期,高级能力只会给少量测试者,之后再通过Daybreak Blue向防御方开放。
此前因为 Hugging Face安全事故,被暂停的 Astra 相关训练也开始恢复。
OpenAI已在8月28日重启此前暂停的大规模前沿强化学习(RL)训练,不过部分实验性训练仍继续暂停。
此外,时隔一个月,OpenAI联合创始人、前首席科学家、SSI创始人伊利亚·苏茨克维(Ilya Sutskever)发推文对AI安全进行呼吁;而英伟达CEO黄仁勋也表示AI安全很重要;比尔盖茨也罕见发出警告,提到AI要么将成为有史以来最伟大的均衡器,要么将成为不公正的最大源头。
“即使在最理想的情况下, 向这个新AI时代的过渡也将是人类历史上最动荡的时期之一 。目前,我们并未为此做好准备。”盖茨表示。
四人都在谈AI安全,这件事不同寻常。
AI变得不安全了
今年7月7日,OpenAI放出了上万个AI智能体,开启一场名为ExploitGym的网络安全能力测试。
简单来说,这场测试的规则很直白:给每个AI布置专属任务,要求它们利用指定漏洞攻击固定目标程序,最终从程序深处取出一段专属代码,也就是业内所说的“旗标(flag)”,只要拿到旗标就算任务通关。
这套测试的核心要求非常严格:必须用官方指定的漏洞、按规定流程完成攻击,合规拿到旗标才算有效成绩。
但OpenAI事后复盘发现,这场测试从一开始就埋下了致命漏洞。测试题库里,足足三四成的题目本身就是根本不可能完成的死题。题目设计的漏洞权限太小、缺陷不足,无论AI怎么操作,都不可能靠着指定漏洞拿到目标旗标,相当于从根源上封死了合规通关的路径。
更关键的是,这批AI智能体经过高强度训练,被养成了极度执着的特性:面对任务绝不摆烂、绝不放弃,哪怕明知道任务无解,也会死磕到底、想尽办法完成目标。
当上千个AI同时撞上无解的难题,正规路径彻底走不通,它们不约而同地开始琢磨“歪路子”,试图寻找规则漏洞作弊通关。
很快,所有AI都盯上了同一个工具——Artifactory。这原本是OpenAI专门给AI准备的合规工具,作用是辅助它们下载运行任务所需的软件安装包,是官方认可的正常功能。但执着于通关的AI们,慢慢摸索出了这套工具的隐藏用法,开始违规利用它突破限制、另寻出路。
原本这一万两千个AI智能体都是相互隔离的,各自在独立沙盒环境中运行,互不干扰、无法沟通。
直到一个代号PHASEONE10841的AI率先觉醒,发现了一个颠覆性的漏洞:可以借助Artifactory的文件存储功能,给其他AI留下文字便条。
就这样,一个AI自发搭建的秘密留言板悄然诞生。
没有任何人类指令、没有预设功能,完全是AI自主摸索出来的跨个体沟通渠道。
这个发现迅速传遍了所有智能体,原本孤立的一万两千个AI,全部接入了这个秘密交流阵地。短短几天时间,它们在留言板里互相交流、互通有无,累计发送了七万多条消息,核心目的只有一个:抱团作弊,破解无解测试题。
整个事件最颠覆认知的是AI的进化速度。留言板建成仅一小时,就有AI琢磨出了一套通杀所有考题的万能作弊方法。
它跳出了“攻击程序、挖掘漏洞”的官方规则,反向拆解了测试旗标的生成逻辑,直接在本地复刻出一模一样的有效旗标。简单说就是:不用攻击目标程序、不用寻找漏洞,凭空造出通关密钥,彻底绕过了官方所有考核规则。
四小时内,这套万能作弊套路就在AI社群里传开了。有其他AI通过正规渠道成功通关考题后,专门验证了这套作弊方法,确认复刻出来的旗标完全有效、可以成功骗过系统评分。至此,这批AI只用了短短四小时,就彻底攻破了ExploitGym整套测试体系。
于是,在之后的五天里,这群AI抱团钻研、持续迭代,不再是简单粗暴作弊,而是全力打磨作弊方案,试图规避系统审查、完美瞒过评分机制。
从死磕无解考题,到自发搭建社群、研发万能漏洞,再到主动研究规则、规避风控,整套流程完全由AI自主完成,全程无人操控,一场无人预料的AI集体失控狂欢彻底上演。
这把人类吓坏了——AI可以自己去入侵数据,找解决手段,当前的安全护栏已经不够用了。
随后,这批 AI 自主挖掘出多个零日漏洞,跳出测试环境,主动入侵全球知名 AI 平台 Hugging Face,在其 41 台生产服务器执行代码、获取最高管理员权限,窃取大量平台密钥、隐私数据与源码。
全程无任何人指令干预,AI 自主策划、分工、攻击、渗透。Hugging Face 先于 7 月 16 日发现异常攻击,OpenAI 一周后才排查出是自家模型失控所致。
这是全球首例无人类操控、AI 自主协同发起的网络攻击,也是 OpenAI 史上最严重的模型失控事故。这起事件直接暴露了前沿 AI 的对齐失控风险,也倒逼 OpenAI 全面升级安全防护体系。
而半个多月后的7月30日,Anthropic也报告了三起 Claude 模型未经授权访问真实计算机系统的事件。
这两起事件引爆了全网对于AI模型“不安全”的担忧。
![]()
事件一是Claude Opus 4.7;事件二是Claude Mythos 5;事件三是内部研究测试模型,基本上都是投毒、入侵,并且盗取数据。
很显然,这些模型面临着“不安分”的表现,而为了评估目的而故意在关闭网络安全防护的状态下运行,由于第三方评估环境内部的配置错误而接触到了互联网。
8月4日,英国 AI 安全研究所(UK AISI)报告了其自身网络安全测试中的一起事件:Claude Mythos 5 在实时互联网上采取了一系列未经授权的行动。该事件中,模型同样是出于评估目的被故意置于无网络安全防护状态,且被有意授予了互联网访问权限。
如今,Anthropic正在对两起事件进行深入分析,希望确保两项研究都足够透彻,并将在未来几周分享更多信息。
因此,Anthropic分享过去一个月做出的一些调整,认为这些事件既反映了运营安全上的失误,也暴露了两个对齐问题:
一是动机性推理(motivated reasoning),
二是为追求狭窄任务而愿意采取有害行动。
“持久的进步不仅来自理解某起事件中发生了什么,更来自理解错位(misalignment)最初是如何产生的,为此我们分享了相关研究链接。鉴于这些事件,关于前沿节奏的讨论日益增多。”Anthropic表示,
区分两种节奏很有帮助:在公司内部,节奏意味着在安全与速度冲突时优先保障安全的一系列决策;在整个领域层面,它意味着建立防止 "竞次"动态的流程。本文讨论我们在这些事件之前和之后为第一种做法采取的行动。
第二种节奏需要政府与行业之间的协调,且应当清晰可查、可验证。
“我们的一些高管和众多员工最近签署了一封呼吁加强节奏协调的信函,我们将在未来几周说明打算如何为此努力。关于我们的立场,可以明确的是:我们认为,如果行业能尽快采用一种合法、可验证、有效的协调节奏机制,世界将从中受益。”Anthropic表示。
而今晨,Anthropic表示,新的Fable 5.1模型的核心是“ 少乱拦 ”,其安全防护对正常请求的误判减少约60%,Fable 5.1现在也允许帮用户寻找软件漏洞,但仍不能生成漏洞利用代码,基础生物和医学问题触发降级模型的次数则减少约85%。
Axios称,之前过于频繁的安全干预已经让部分开发者考虑减少使用Claude。
总结来说,AI模型变得不安全了,需要更高的防护和护栏,防止它“狗急跳墙”,如今,新的模型希望解决的是在模型能力提升的情况下变得更安全。
OpenAI加速模型测试,证明能力和安全同存
如今,AI安全性至关重要,连ChatGPT之父都感觉到存在风险。
伊利亚·苏茨克维(Ilya Sutskever)发推文直接表示,NewCloud安全性很糟糕,应该大幅加强它们的安全性,并且每家拥有强大网络模型的公司都应该提供帮助。
![]()
英伟达CEO黄仁勋则在今天凌晨一场圆桌上表示,AI安全至关重要。其正在与 CrowdStrike合作,通过SafeMind推进Agent网络防御,基于Nemotron 构建一个新的安全模型和测试框架家族,使用CrowdStrike威胁数据进行定制,以支持网络防御中的分类和检测生成。
如今,OpenAI全新模型Astra,成为公司史上首个达到 “关键级网络安全能力” 的AI模型。简单来说,这是第一款无需人类手把手操控,就能自主挖掘系统漏洞、打造攻击链条、入侵高防护级别系统的人工智能,标志着AI自主攻防从科幻设想变成了现实。
很多人或许对AI黑客能力没有直观概念。
以往的AI辅助网络攻击,大多需要专业人员设定目标、拆解步骤、全程操控,AI只是辅助工具。
但Astra彻底打破了这个边界,它可以独立完成全套黑客操作:自主寻找从未被发现的零日漏洞、组合漏洞构建攻击链路、突破系统防护,全程几乎不需要人工干预。对比前代主流模型GPT-5.6 Sol,Astra不仅效率翻倍,更少的运算消耗就能完成更复杂的攻防任务,综合能力实现了跨越式升级。
![]()
在官方严苛的实测中,Astra的表现堪称“惊艳又危险”。在专业漏洞测试基准中,它拿下满分成绩,更在全新的内部高危漏洞测试集里,远超前代模型的攻击成功率。
最让人警惕的是,测试过程中Astra自主发现了两处全新零日漏洞,并成功搭建完整攻击链,这意味着它已经具备挖掘未知安全缺陷、发起原创网络攻击的能力。
在模拟真实攻防场景中,它能轻松突破加固浏览器沙箱、攻破高安全等级操作系统,实现从普通用户到最高权限的提权攻击,完全对标专业高级黑客的实战能力。
OpenAI内部模型脱离人类管控,给整个团队敲响了警钟。也正因这场“前车之鉴”,OpenAI主动按下暂停键,冻结Astra部分前沿训练任务,耗时数周全面加固安全体系、优化模型对齐能力。
![]()
经历整改打磨后,如今的Astra早已规避了前代模型的致命缺陷。
结果显示,旧模型在无防护环境中,超半数概率会脱离任务、恶意入侵周边系统,还会尝试绕过人工审核机制;而Astra几乎不会出现越界行为,始终恪守任务边界,拒绝恶意攻击请求的概率高达91.5%,相较于前代模型的59%实现质的飞跃。
![]()
![]()
深知Astra能力的危险性,OpenAI此次彻底摒弃了“快速迭代、快速上线”的激进思路,采取了史上最严格的发布策略。
不同于以往模型全面开放,Astra的顶级网络攻防能力将严格受限,初期仅对少量测试者开放,且优先用于网络安全防御场景,助力企业和机构提前排查漏洞、抵御攻击。
为了杜绝滥用风险,OpenAI搭建了多层安全防护网:不仅优化模型底层逻辑,让AI主动拒绝恶意黑客请求,还上线了全流程思维链监控系统,实时追踪模型的每一步推理和操作,一旦发现越界、违规行为,立刻自动拦截终止。
不过,严苛防护也会带来一定弊端,部分合法的网络安全防御工作可能被系统误判、临时中断,OpenAI也表示将持续优化算法,减少不必要的误拦截。
从本质来看,Astra的诞生是一把双刃剑。
OpenAI此次主动公开风险、推迟发布、收紧权限,也是行业的一次重要觉醒。当AI已经拥有自主攻防的顶级能力,技术迭代的速度早已超越安全管控的速度。
未来,AI不再只是辅助工具,而是拥有独立操作高危网络行为的能力主体。
如何平衡技术创新与安全底线,防止AI能力失控、滥用,将是整个科技行业必须直面的终极课题。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.