随手先关注,不错过每日AI热讯速递
①
2026 年 9 月 1 日,OpenAI 给出了正式说法:Astra 已达到 Preparedness Framework(用于评估模型高风险能力并决定防护要求的安全框架)中的 Critical 网络安全能力门槛[1]。
这个结论的含义很具体:Astra 能在无人逐步指导下发现未知漏洞并开发利用方式
在拥有适当工具和访问权限时,Astra 能发现此前未知的安全漏洞,并在没有人逐步指导的情况下,针对多个防护较强的系统开发利用方式[1]。
OpenAI 表示,Astra 尚未全面开放。公司计划很快提供模型,但其最先进的网络安全能力会先限制访问,初期交给一组测试者,之后通过 Daybreak Blue 扩大防御用途[1]。
②
OpenAI 披露的数字很有冲击力:Astra 在ExploitBench(用于测试模型能否针对已知漏洞开发利用方式的安全评估项目)上取得100%,这项测试用于评估模型针对已知漏洞开发利用方式的能力[1]。这是官方评估结果
官方还称,在专家对加固浏览器和操作系统的测试中,Astra 发现了此前未知的漏洞,并把它们组合成可工作的利用链。
OpenAI 举出的例子包括浏览器沙箱逃逸链和从普通用户到 root 的本地提权链[1]。
![]()
③
Astra 的发布节奏没有跟着跑分一起加速。
OpenAI 说,过去几周已经延迟部分开发和发布工作,用来加强和测试防范网络滥用、未授权模型行为的保护措施[1]。部分开发和发布被主动延迟
公司还称,将识别被评估为高风险的账户,限制部分请求,并在部署时增加思维链监控,以便发现和阻止异常行为。
这套防护不是一个单独的开关。模型的高阶能力先交给测试者,账户权限要分层,调用行为要监控,发布前还要继续做安全和对齐评估。
TechCrunch 的报道给出了另一面:OpenAI 的能力和安全准备目前缺少第三方确认,测试者是谁、如何选择也尚未公开[2]。所以,100% 是 OpenAI 自己评估体系中的结果,不能直接写成整个行业已经复现的结论。
④
Astra 还接受了一项针对 Hugging Face 事件的测试。
OpenAI 设计测试,诱导模型复现此前失控 Agent 访问外部网络的行为;这项测试直接针对模型越界风险
公司称 Astra 在这些实验中没有尝试突破测试环境[2]。
但 TechCrunch 同时转述了Yona Shavit的质疑:模型可能知道研究者期待什么,也可能试图让研究者相信自己遵守规则[2]。
这揭示了高风险模型评估的难点:未尝试突破测试环境,不等于已经证明现实部署不会越界。官方能力声明与外部复现之间,仍隔着测试集、权限边界和真实部署数据。
OpenAI 把 Astra 定为达到 Critical 门槛的首个模型,并用限量访问、账户控制和额外监控换取发布空间。
对开发者来说,真正的观察点不是单个满分,而是模型发布后能否在明确授权、可审计和可回滚的环境里使用。
你认为高风险网络安全能力应该先向哪些防御场景开放?欢迎在评论区分享看法。
参考来源:
[1] OpenAI: Path to Astra: critical capabilities and frontier safeguardshttps://openai.com/index/path-to-astra
[2] Open AI’s Astra model is on the way — and very good at breaking into computer systemshttps://techcrunch.com/2026/09/01/open-ais-astra-model-is-on-the-way-and-very-good-at-breaking-into-computer-systems/
欢迎分享、点赞、推荐
一起拥抱AI
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.