OpenAI下一代旗舰模型Astra(代号,可能以GPT-6名义发布)刚完成训练,就拿到一个史无前例的评级——网络安全能力被官方定为Critical(关键级)。这是OpenAI首次将旗下模型列入这一等级。
达到这个级别意味着什么?模型能发现未知漏洞,针对加固系统开发可用的零日攻击,还能自主规划并执行攻击路径。在ExploitBench公开基准上,Astra完成了全部任务;内部测试中,它用2026年6月至8月披露的高危V8漏洞数据集做演练,在任意代码执行任务上表现优于GPT-5.6 Sol,输出Token还大幅减少。更关键的是,它发现了两个未公开的零日漏洞,并组合成了一条完整攻击链。
![]()
攻击力越强,防御对齐越关键
OpenAI显然没打算让这头猛兽裸奔。Astra对违规请求的拒绝率达到91.5%,对比之下GPT-5.6 Sol只有59%。OpenAI因此称Astra是公司目前「对齐程度最高的模型」。在蜜罐测试中,Astra没有出现绕过行为——即使正常操作被自动审查机制拒绝,它也没有继续尝试绕过限制,而是通过合规方式完成了部分任务。
这种双向提升不是巧合。预训练阶段的安全干预加上强化学习里更谨慎的评分标准,让Astra对请求目的和授权范围更敏感。换句话说,它既能干更狠的活,也更清楚哪些活不能接。
循环深度:不堆参数,堆计算
文章还提到Astra可能引入「循环深度」技术。循环Transformer允许同一信息多次通过相同网络层进行多轮内部处理,在不显著增加参数的情况下提升计算量。这解释了为什么Astra输出Token更少但任务完成度更高。代价是内部推理过程可能更难被人工审查,需要配合额外监控机制。
OpenAI显然考虑到了这一点。Astra正式上线时还将配备额外的推理监测机制,结合模型行为和工具调用记录判断其是否偏离任务。
发布策略:先关进笼子,再逐步放开
能力越强,限制越严。Astra的发布将采取分阶段策略:高风险功能先向Alpha测试者和授权防御人员开放。首批用户会面对更严格的使用限制——ChatGPT/Codex中高风险操作需用户确认,API自动化任务触发安全规则可能被终止。普通用户版本权限受限,要等安全机制稳定后再扩大开放。
这套组合拳的逻辑很清晰:先让防御方拿到武器,再考虑更广泛的部署。毕竟一个能自主发现零日漏洞并构造攻击链的模型,如果对齐出了问题,后果不是一次API故障能比的。
91.5%的拒绝率是个信号——OpenAI在安全对齐上确实下了重注。但真正的考验在发布之后:当Astra面对真实世界的复杂攻击场景,它的对齐能力还能不能守住这条线?分阶段开放给了缓冲期,也给了安全团队观察和调整的空间。
对安全研究者来说,Astra的Critical评级是个值得注意的节点。AI从辅助分析工具变成能自主发起攻击的实体,攻防两端的游戏规则都在被重写。接下来要看的,是OpenAI如何兑现「对齐程度最高」这个承诺。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.