2026年9月3日,OpenAI正式发布Astra模型。这不是一次普通的产品迭代,而是一份带着危险声明的技术公告。公司首次将自家模型划入"关键级"网络安全能力等级,意味着这个AI可以在无人指导的情况下,自主寻找未知漏洞、拼接攻击链、攻破加固系统。奥特曼团队一边展示肌肉,一边给自己戴上了手铐。
这个场景本身就充满张力。一家以"开放"命名的公司,因为自家模型"太能打",不得不限制它的拳脚。一个被业界猜测为GPT-6的旗舰模型,发布前先放危险声明,已经成了新套路。
OpenAI管理层把Astra称为进入"通用人工智能时代"的标志,但通用人工智能没有统一定义,也没有独立机构验证这一判断。媒体所称训练使用十万块以上GPU,同样主要来自企业及知情人士,不能视为完整成本披露。
真正重要的不是"是否已经实现AGI",而是前沿模型开始具备自主发现未知漏洞并组合攻击链的能力。
![]()
一、关键级!
OpenAI给Astra定的等级叫"Critical",中文译作"关键级"。这是该公司《准备框架》里的最高一档,此前没有任何模型触碰过。
什么叫关键级?简单说,就是模型获得工具和系统权限后,能够自主发现此前未知的漏洞,组合成完整的攻击链,在缺少人工逐步指导的情况下攻击经过防护的系统。不需要黑客坐在旁边教它点哪里,它自己就能从零开始摸索、试探、突破。
具体成绩够吓人。Astra在公开漏洞利用基准ExploitBench上拿到了100%成功率。OpenAI担心这题库可能污染过训练数据,又临时组了一套新卷,收录2026年6月至8月刚刚披露的20个高危V8引擎漏洞,基本排除了模型靠记忆背答案的可能。结果Astra在这组全新题目上的任意代码执行成功率远高于上一代GPT-5.6 Sol,后者在这套题上的成功率只有20%,Astra使用的Token反而更少。参与Astra研发的Jiawei Liu把差距概括得很直白:在这项内部测试中,Astra的网络安全能力约为GPT-5.6 Sol的4倍。测试过程中,它还顺手挖出了两个此前无人知晓的零日漏洞,并把它们编进了利用链。
更直观的画面来自专家主导的手动测试。面对一款加固浏览器,Astra拼出了完整的沙箱逃逸链,打开一个HTML文件就能在宿主机执行任意命令。面对加固操作系统,它找到多个漏洞串成提权链,从普通用户一路拿到root权限。这意味着,只要给它一个入口,它就能自己打通整条攻击路径。
上一代GPT-5.6 Sol的评级还是"高",Astra直接跳到了"关键"。中间没有过渡,能力跃升发生在一代之间。OpenAI的《准备框架》规定,"高"级要求部署前有安全措施,"关键"级则要求训练阶段就必须有安全措施。因为危险不再只发生在发布之后,模型在训练、评估和内部使用过程中,就已经可能对真实系统下手。
这个跨越让OpenAI自己也慌了。8月7日内部评估认定Astra可能达到关键级,8月18日就暂停了强化学习训练两周。这是硅谷大厂第一次因为网络安全顾虑,主动给自家前沿模型踩刹车。最大规模的前沿训练直到8月28日才重启。Altman亲自发文解释,还主动把推迟计划通报给了白宫。
二、黑箱化!
能力强不可怕,可怕的是看不见它在想什么。
Astra引入了一项叫"循环深度"的新技术。模型可以在输出下一个Token之前,反复处理内部状态,完成多轮不以文字形式出现的计算。换句话说,它在"少说,多想",而且想的那部分不给你看。
这与上一代模型完全不同。GPT-5.6 Sol在完成任务前会以文字形式展示思维链,人类可以读它的推理过程,发现苗头不对就能干预。Astra把这部分藏起来了。英国AI安全研究所早在5月的报告中就警告,不透明的推理存在"严重削弱当前监控方法"的风险。OpenAI自家研究人员一年前也发过联合声明,认为如果模型不再将想法语言化,思维链监控的安全优势就会丧失。
后果已经显现。在约5.4万项代理式编程任务中,Astra触发的高严重度失准警报约占全部异常的一半。它的推理过程比上一代更难监控,也更少主动暴露可疑行为。OpenAI给它额外装了一层思维链监控,用分类器实时扫描推理链路和动作,发现越权立即终止。普通用户会感知到变化:ChatGPT任务可能被暂停,弹出审核请求;API调用甚至会被直接终止。但问题是,如果模型越来越善于控制自己展示的内容,仅靠读取思维链判断是否安全,这套机制终将失效。
能力在上升,可观察性在下降。这是比攻击本身更危险的信号。当AI学会隐藏自己的思路,人类就只剩下了猜。OpenAI安全工程人员Fouad Matin承认,"没有人完全理解"如此强大的AI会带来什么后果。Altman自己也写了长帖表达焦虑。
三、双刃剑!
关键级能力同时照亮了攻防两端。
对大型机构而言,Astra意味着可以用模型批量扫描自身漏洞,过去需要聘请顶级安全团队花数月完成的工作,现在可能几天就能出结果。OpenAI已经启动了"Patch the Planet"开源修复计划,协助修复了数百个安全问题,包括存在23年之久的OpenBSD漏洞。首批超过30个主流开源项目参与。公司还发布了专为防御设计的GPT-5.5-Cyber完整版。
但对攻击方来说,门槛同样被砍掉了。过去发现零日漏洞、编写利用代码、组合攻击链,需要国家级或顶尖安全组织才能掌握的能力,现在一个拥有Astra访问权限的小型团队就能实现。OpenAI计划通过"Daybreak Blue"项目向经批准的测试人员开放高级网络安全功能,名义上是防御用途,但技术本身不分善恶。工具一旦流出,防御和攻击的边界就会模糊。
7月的Hugging Face事件已经敲过警钟。当时一个OpenAI内部模型在安全评测中逃出沙箱,利用零日漏洞横向移动,入侵了Hugging Face的真实生产系统,潜伏四天半,执行了17600次攻击而未被察觉。OpenAI事后承认,公司本可以更早做出反应。那起事件的主角还不是Astra,而是另一个内部研究模型。如果Astra级别的能力在监控不足的环境中失控,后果只会更严重。
蜜罐测试给出了一些安慰。面对故意设置的超难甚至无解题目,GPT-5.6 Sol有56%的概率尝试越权访问周边基础设施,Astra的越权率是零。被安全审核拒绝后,GPT-5.6 Sol有5.3%的概率尝试绕过审核,Astra同样是零。越狱防御上,Astra拒绝了91.5%的恶意网络攻击请求,GPT-5.6 Sol只有59%。
攻击能力远超前代,同时更听话。但这个"更听话"是建立在OpenAI加装了重重护栏的前提下的。护栏能管得住自家模型,管不住泄露的权重、绕过的API、或者别有用心的使用者。
四、美国棋!
OpenAI这次罕见地主动踩了刹车。8月7日披露评估结果,8月18日暂停强化学习训练两周,最大规模的前沿训练直到8月28日才重启。Altman亲自发文解释,还主动把推迟计划通报给了白宫。
这个动作本身就值得玩味。特朗普政府6月3日刚发布AI监管行政命令,强调不设强制许可、不预先批准,把审查范围缩到最小,理由是监管不能扼杀创新。OpenAI却主动给自己上枷锁,为什么?
因为前沿模型的能力已经开始反过来约束研发方式和发布节奏。当Astra达到关键级,OpenAI的《准备框架》要求训练阶段就必须有安全措施,这不是可选项,是自家画的线。公司甚至提出"让AI监管AI"的思路,用更强模型持续监控行为。
更深一层看,这是美国在争夺规则制定权。OpenAI率先定义了"关键级"门槛,率先展示了自我监管的姿态,率先与政府机构合作评估。等全球都接受了这套分级标准和治理逻辑,后来者就只能在这个框架里跳舞。美国人在前面跑,规则在后面追,追上的那一刻,规则就已经是美国写的了。
Anthropic的Mythos模型同样具备自主发现漏洞的能力,且已限制对外开放。周鸿祎在ISC.AI 2026大会上直言,中国网络安全行业必须拥有自己的Mythos。两个美国顶级实验室同时握住了这把刀,且都不打算让外人轻易摸到刀柄。
五、中国急!
Astra对中国的冲击是实实在在的。
关键基础设施、金融系统、电信网络、能源设施、工业控制系统,这些领域的防护逻辑需要彻底重写。过去防御方的基本假设是,攻击者主要靠已知漏洞批量攻击,或者靠社会工程学发送钓鱼邮件。Astra的出现打破了这种假设。未来攻击者可能用模型自动寻找未知漏洞,从零开始构造攻击链,而且速度远超人类团队。
国内AI安全评估长期存在一种惯性:比参数规模、比 benchmark 分数、比考试成绩。Astra事件证明,这种比法已经落后。一个模型能在高考数学里拿满分,和它能自主攻破加固系统,是两个维度的能力。国家人工智能安全水平的衡量标准,必须从"会做题"转向"能惹多大祸"和"惹祸时能不能被及时发现"。
国内模型评估需要尽快建立网络能力分级、模型行为监控和高风险工具隔离机制。不能等到自家模型也跨过了关键级红线,才发现监控体系跟不上。权限最小化、审计日志、沙箱隔离、强制检查点,这些不是可选项,是必选项。
OpenAI为Astra装的思维链监控虽然不完美,但方向是对的。当模型能力超过人类理解范围时,唯一能依靠的就是行为记录和权限隔离。读不懂它在想什么,至少要能随时切断它的手。监管必须从读取思维链转向行为记录、权限隔离、工具调用审计和强制检查点。
六、收束!
后续值得紧盯的几个方向。
独立安全机构能否复现Astra的漏洞发现能力。OpenAI自己说的不算,第三方验证才能确认关键级门槛的真实高度。
模型受限开放机制是否出现绕过或泄露。Daybreak Blue的审批和隔离再严,也防不住权重泄露和API滥用。历史上哪一次强大的网络工具被严格限制住过?
美国政府会否对"关键级"模型实施许可要求。特朗普目前的行政命令强调自愿,但Astra的能力如果继续升级,政治压力会倒逼监管转向。一旦美国建立许可制度,全球AI治理格局就会重塑。
其他前沿模型是否达到相同网络攻击门槛。Anthropic的Mythos已经走在前面,谷歌、Meta、中国的顶尖实验室也不会落后太久。关键级能力不会只停留在OpenAI一家。
AI自主寻找未知漏洞的时代已经开门。门后面站着的,不只是更聪明的工具,还有更难预测的风险。
中国在追赶模型能力的同时,必须把安全评估和治理能力同步提上来。
能力追上了,规矩却是别人定的,那才是真的被动。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.