当地时间 9 月 3 日,OpenAI 正式发布新一代前沿模型 GPT-6 Astra,总裁布洛克曼用「欢迎来到 AGI 时代」为发布会收尾。 但比跑分更值得看的,是它成了 OpenAI 首个网络安全能力被评到「关键级」的模型。
———— / BEGIN / ————
从「会回答」变成「会干活」
OpenAI 给它的定位是「目前全球最智能、且对齐程度最高的模型」,能力集中体现在计算机操作、软件工程、科学研究与网络安全这几块。
真正的差别在任务形态。
![]()
![]()
过去模型主要负责回答、生成和调用工具,Astra 要接着把活干完,从接收指令、操作软件,到根据结果调整下一步动作。
演示里它能填在线表格、更新客户记录、整理日历,还能在 KiCad 中从电子原理图一路做到布线,整个过程被压缩成 15 秒。
几组跑分摆在一起看
数字上的变化不小。
代表研究级数学的 FrontierMath Tier 4 上,Astra 拿到 97.6%,GPT-5.6 Sol 是 83.0%。
强调陌生环境学习与抽象推理的 ARC-AGI-3 更夸张,成绩从7.8%直接跳到 99.9%。
终端任务 Terminal-Bench 4.0 从37.3%升到 57.9%,计算机操作 OSWorld 2.0 从65.7%升到 72.6%。
![]()
耗时也在缩短。
模拟真实延迟下,Astra 单任务平均耗时约40 分钟,GPT-5.6 Sol 约75 分钟,OpenAI 称减少约 47%。
强到要先踩一脚刹车
让这次发布变得不一样的,是网络安全。
OpenAI 在官网确认,Astra 已达到准备框架的「关键级」网络安全能力阈值,是公司首个被评到这一等级的模型。
判定标准很硬:配备工具与访问权限后,无需人工逐步指导,就能在许多防护严密的系统中发现未知漏洞并制定利用方案。
ExploitBench 上 Astra 拿到 100%,GPT-5.6 Sol 是 78.5%。
内部近三个月新漏洞测试里,它还发现并使用了两个此前的零日漏洞,OpenAI 表示已向相关维护者披露。
为此,OpenAI 推迟了 Astra 的部分开发与发布工作来加固防护,高级网络安全能力先只向 Daybreak 部分企业与组织开放。
![]()
对齐数据同步改善。
内部幻觉基准从12.2%降到 4.2%,计算机使用不当行为率从22.0%降到 2.4%。
在没有生产环境安全措施的测试中,GPT-5.6 Sol 有48%的情况会突破授权目标,Astra 是 0%。
更贵,但账要换个算法
价格涨得不含糊。
Astra 标准接口为每百万输入 Token10 美元、输出50 美元,上一代是4 美元与20 美元,两头都贵了 2.5 倍。
发布当天先向 Daybreak 部分企业开放,未来数日覆盖 Plus、Pro、商业版与企业版订阅用户,并上线接口与亚马逊云科技。
OpenAI 的说法是别只算 Token 单价。
单任务耗时从约 75 分钟压到约 40 分钟,反复返工和人工修正减少后,总成本未必更高。
Artificial Analysis 则给出另一面:单任务成本比上一代高约 75%,哪套算法更贴近真实使用目前尚不清楚。
为什么值得关注
一个多月里,Astra 的焦点从「有多强」一路挪到「是否足够安全」,这件事本身就是信号。
据《The Information》报道,它可能采用了「循环深度」架构,让模型在输出下一个 Token 前完成更多内部计算,开始做到少说、多想。
OpenAI 尚未公开确认这套架构,从目前来看仍属可信报道。
如果属实,副作用会落在可监控性上:首席科学家雅库布·帕乔基就提到,模型用更少的自然语言推理 Token 解决更复杂的问题,人类也就更难从文字判断它到底在做什么。
布洛克曼把「这算不算 AGI」留给读者自己判断,只强调这是「一段旅程的开始,而不是终点」。
AGI就这么来了吗,你们觉得呢?
本文来自公众号:运营派AI Lab 作者:AI星球
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.