网易首页 > 网易号 > 正文 申请入驻

GPT-6 突然降临!100000 块 GPU 炼出 Astra;OpenAI 宣告 AGI 来到

0
分享至


2026 年 9 月 4 日,OpenAI 发布新一代旗舰模型 GPT-6 Astra。


此次发布另一个受到关注的焦点,是 OpenAI 总裁 Greg Brockman 对 AGI 的表态。


在媒体吹风会上,OpenAI 总裁 Greg Brockman 承认,AGI,也就是通用人工智能,本身仍然是一个“模糊、灰色的概念”,但他认为,未来人们回头看时,可能会把 Astra 视为 AGI 到来的一个节点。

“我认为,现在我们已经进入 AGI 时代,并不是不合理的。”Brockman 表示。

当被问及 OpenAI 是否正式宣布已经实现 AGI 时,Brockman 并没有给出这一结论。

Brockman 表示,AGI 已经不再与 OpenAI 此前和微软协议中的某个合同触发条件绑定,而更多成为一种“使命或精神层面的概念”。

Brockman 称,是否认为 Astra 已经达到 AGI,可以由每个人自行判断;就他个人而言,他认为“已经到了”,但这只是一个开始。

媒体吹风会最后,Brockman 说道:“欢迎来到 AGI 时代。”


OpenAI 研究人员 Aidan Clark 表示,Astra 首次在得州 Stargate 基础设施上使用超过 10 万块 GPU 进行预训练,同时也是 OpenAI 首个在训练过程中大量使用前代模型参与监督的模型。

这是 OpenAI 至今规模最大的一次模型训练。

相比 GPT-5.6 Sol,Astra 在科学研究、CAD、桌面软件操作和网络安全等专项任务上的能力有较大提升。


不过,在目前竞争最激烈的编程能力上,Astra 并没有与其他头部模型拉开明显差距

编程得分升至 74.1%,但没有坐稳第一

在 DeepSWE v1.1 Agent 编程测试中,Astra 得分达到 74.1%,高于 GPT-5.6 Sol 的 70.8%。


不过,这一成绩并没有形成明确领先。

Meta 此前公布,Muse Spark 1.3 在最高推理设置下取得 75.4%;公开的 DeepSWE 排行榜中,Gemini 3.8 Flash 和 Claude Opus 5 的成绩也在 74% 左右。


DeepSWE v1.1 一共包含 113 项任务,Astra 与 Muse Spark 1.3 相差 1.3 个百分点,实际大致只对应一到两个任务。不同结果的误差范围也存在重叠,因此目前很难仅凭这一项测试判断哪款模型拥有绝对领先的编程能力。

OpenAI 自己公布的对比图没有纳入 Muse,同时采用了 Fable 5.1 的 67.4% 成绩,因此 Astra 在官方图表中的领先幅度,要比放到更广泛的同类模型中比较时更大。

ARC-AGI-3 得分 98.6%

相比编程测试,Astra 在其他专项任务上的提升幅度更大。

其中最突出的是 ARC-AGI-3,Astra 得分达到 98.6%。

不过,这一成绩需要结合测试方式来看。

OpenAI 在测试 Astra 时使用了 Responses API Harness,可以在多轮任务之间保留推理信息,并通过 Compaction 管理长上下文。

OpenAI 此前已经展示过,即使不改变底层模型,仅调整 Agent 系统和运行方式,也可能大幅提高 ARC-AGI-3 的成绩。

因此,这项 98.6% 的结果反映的是 Astra 与 OpenAI Agent 系统结合后的整体表现,而不能简单理解为基础模型本身取得了 98.6%。

Astra 在 FrontierMath Tier 4 上还取得了 97.6% 的成绩。


这一结果覆盖了 Tier 4 共 43 道题中的 41 道私有题目。负责运行 FrontierMath 的 Epoch AI 表示,OpenAI 为该 benchmark 的开发提供了资金,同时拥有其中部分内容的独家访问权限,因此这一背景也需要纳入对成绩的判断。

CAD 重建得分达到 95.9%

在 BenchCAD Vision2Code 测试中,Astra 得分达到 95.9%。

BenchCAD 要求模型根据渲染图重建 CAD 程序,并根据生成的 3D 模型与原始模型之间的几何重合程度进行评分。

在包含 1000 个 CAD 文件的 Vision2Code 子集中,Astra 配合 Python 工具得分为 95.9%,Fable 5.1 为 84.3%,GPT-5.6 Sol 为 83.3%。

OpenAI 同时指出,Claude 的测试使用了经过修改的评测设置,因此不同模型之间不能完全直接比较。

但仅与 GPT-5.6 Sol 相比,Astra 在这一任务上的提升幅度依然较大。

在 Terminal-Bench Science 科学 Agent 测试中,Astra 得分达到 64.6%。


该测试要求 Agent 使用命令行完成来自 5 个科学领域的 70 项研究任务。Anthropic 此前公布 Fable 5.1 的成绩为 52.6%,而现有公开排行榜中,Opus 5 的最高成绩约为 30%。

OpenAI 和 Anthropic 都在尝试将模型从回答科学问题,推进到直接参与科研工作流程。

Codex 开始解决长任务中的“上下文丢失”

对于开发者来说,Astra 在 Codex 中一个更实际的变化,是处理超过上下文窗口的长任务。

目前 Codex 主要依赖 Compaction,将此前的工作压缩成摘要,为后续任务腾出上下文空间。

这种方式可能会丢掉后续仍然需要的重要细节,例如此前某个修复为什么失败、哪些测试已经执行过,或者用户在任务开始时提出过哪些要求。

Astra 可以跨上下文窗口保存笔记,并重新搜索此前的消息和工具输出,而不是完全依赖压缩后的摘要。

这一功能目前仍处于实验阶段,需要通过 config.toml 手动开启。OpenAI 表示,未来数周内计划将其变成 Astra 在 Codex 中的默认功能。

Astra 还可以在向用户提出问题后,继续执行那些不依赖用户回答的工作,而不是因为一个待确认问题让整个任务停下来。

OpenAI 展示了 Astra 操作 KiCad、Excel、Blender 和 Power BI,同时还展示了浏览器表单填写和网站 QA 等任务。

在 OSWorld V2-Offline 桌面应用测试中,Astra 得分达到 72.6%,高于 GPT-5.6 Sol 的 65.7%;平均完成一项任务所需时间则从约 75 分钟缩短至 40 分钟。

Anthropic 此前公布 Fable 5.1 在 OSWorld 上取得 77.9%,但 Anthropic 同时表示,其使用的是不同版本的 OSWorld,因此不应该与此前公布的成绩直接比较。

OpenAI 还调整了 Codex 的 Harness。在 Mind2Web 测试中,Astra 配合新的 Harness 后,完成任务的速度达到目前 Sol 版本 Codex 的 1.9 倍。

API 输入 10 美元,输出 50 美元

Astra 上线 API 后,每 100 万输入 Token 收费 10 美元,每 100 万输出 Token 收费 50 美元。

这一价格约为 GPT-5.6 Sol 当前促销价格的 2.5 倍,与 Anthropic Fable 5.1 的定价相同。

相比之下,Muse 的标准价格为每 100 万输入 Token 1.25 美元、输出 Token 4.25 美元;Google Gemini 3.8 Flash 的首发价格为输入 0.75 美元、输出 3.75 美元。

不过,更高的 Token 单价并不一定完成一项任务的最终费用更高。如果模型能够以更少步骤完成任务,同时减少重试,总成本仍有可能下降。

OpenAI 表示,在多项评测和合作伙伴测试中,Astra 完成任务所消耗的 Token 更少。

Brockman 对此表示:“真正重要的是完成一项任务的价格。”

网络安全能力达到 Critical 级别

Astra 的另一项重要变化来自网络安全能力。


OpenAI 表示,Astra 已经跨过其 Preparedness Framework 中的 Critical 网络安全能力门槛,成为 OpenAI 首个达到这一等级的模型。此前 OpenAI 已因为 Astra 可能达到这一等级而收紧测试和访问限制。

在 OpenAI 的测试中,Astra 已经能够针对经过加固的浏览器和操作系统开发漏洞利用程序。

在使用近期 V8 漏洞进行测试时,Astra 还发现了两个此前未知的漏洞。OpenAI 表示,正在向相关软件维护者披露这些漏洞。

不过,OpenAI 强调,其公布的高级网络安全测试成绩反映的是获得 Daybreak Blue 权限后的 Astra,而不是普通用户默认能够使用的生产版本。

在 ExploitGym 测试中,Astra 得分为 42.4%,GPT-5.6 Sol 为 30.3%。


但此次 OpenAI 取消了通常存在的 6 小时时间限制,因此这一成绩不能简单与此前结果横向比较。

在 ExploitBench 上,两款模型的成绩均达到 100%。

通过普通方式使用 Astra 的用户,将无法直接使用部分高级网络安全能力,包括部分漏洞发现任务。

OpenAI 首先会向经过审核的安全防御人员提供限制更少的访问权限,并计划通过 Daybreak Blue 在未来数周扩大开放范围。

Daybreak Blue 并不是一个单独的 Astra 模型,也不是特殊推理模式,而是一套面向获得授权的防御性网络安全工作的访问机制。

对于 API 用户,一旦网络安全安全检查被触发,任务会直接停止,而不是暂停并等待批准。

OpenAI 的 Mia Glaese 还提醒,可信访问项目之外的用户,在进行网络安全工作时可能遇到速度下降、暂停或任务被拦截的情况,有时甚至可能影响与网络安全无关的任务。

“在发布初期,用户应该预期会出现这种情况。”她表示。

模型更强,但也更难监控

OpenAI 将 Astra 称为其“最对齐”的模型。

在一项内部测试中,当模型面对本身无法完成的任务时,Astra 擅自超出授权目标范围的比例为 0%,而 GPT-5.6 Sol 为 48.2%。

不过,OpenAI 同时说明,对比中的旧模型是在“没有生产环境安全防护”的情况下运行,因此两组数字不能直接比较。

与此同时,OpenAI 还披露,Astra 的书面推理过程比 Sol 更难监控。

在专门设计用于诱导模型规避监控的评估中,Astra 的可监控性有所下降。OpenAI认为,这可能部分因为 Astra 在简单任务中对是否写出完整推理拥有更大的控制权,同时完成任务所需要显式写出的推理步骤也更少。

OpenAI 首席科学家 Jakub Pachocki 表示:“智能水平的提升,并不保证对齐能力也会同步提升。”

他还表示,如果 OpenAI 无法重新获得足够的信心,确保未来模型仍然能够被有效监控,将暂停继续扩大模型规模。

首批向 Daybreak 企业客户开放

Astra 发布后不会立即向所有用户开放。

首批使用者是已经通过 OpenAI Daybreak 项目获得访问权限的企业客户。

OpenAI 表示,未来数日内,Astra 将陆续向 ChatGPT Plus、Pro、Business 和 Enterprise 用户开放,同时进入 OpenAI API 和 AWS。


其中,Pro、Business 和 Enterprise 用户还将获得 GPT-6 Astra Pro 的访问权限。符合条件的 API 客户则可以在 Zero Data Retention 模式下使用 Astra。

与 GPT-5.6 一次推出 Luna、Terra 和 Sol 多档型号不同,OpenAI 目前没有公布 GPT-6 的其他版本,现阶段产品线只有 Astra 和 Astra Pro。

云头条声明:如以上内容有误或侵犯到你公司、机构、单位或个人权益,请联系我们说明理由,我们会配合,无条件删除处理。



特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
恩里克:输球的教练就不该接受采访;足球有时候就是无法解释

恩里克:输球的教练就不该接受采访;足球有时候就是无法解释

懂球帝
2026-09-05 06:10:08
欧豪也没想到,自己29岁的绯闻女友孙千,会因美貌在外网口碑暴涨

欧豪也没想到,自己29岁的绯闻女友孙千,会因美貌在外网口碑暴涨

林轻吟
2026-09-04 16:36:42
演员黄渤发生意外

演员黄渤发生意外

做一个合格的吃瓜群众
2026-09-04 06:58:38
陈勇任上被查

陈勇任上被查

北疆新闻
2026-09-05 11:44:22
方媛好能忍!郭富城本人满脸皱纹,还有老年斑,个子不高像小老头

方媛好能忍!郭富城本人满脸皱纹,还有老年斑,个子不高像小老头

瞎说娱乐
2026-08-22 16:07:15
2000美元起售、折叠痕却没消掉!iPhone Ultra被嘲「终极身份象征」:苹果努力了这么久,还是败给了物理规律

2000美元起售、折叠痕却没消掉!iPhone Ultra被嘲「终极身份象征」:苹果努力了这么久,还是败给了物理规律

泡泡网
2026-09-03 10:59:09
死磕张子宇,其余11人都是配角!球迷喊话宫鲁鸣:不能为了她牺牲全队打法

死磕张子宇,其余11人都是配角!球迷喊话宫鲁鸣:不能为了她牺牲全队打法

弄月公子
2026-09-05 12:33:38
雷军把芯片直接镶进邀请函!博主晒图网友酸了:太羡慕了

雷军把芯片直接镶进邀请函!博主晒图网友酸了:太羡慕了

齐鲁壹点
2026-09-03 15:41:15
美媒:并非轰-20,中国洲际隐身轰炸机,正接受测试,航程、载弹量或超美国B-2

美媒:并非轰-20,中国洲际隐身轰炸机,正接受测试,航程、载弹量或超美国B-2

蓝星杂谈
2026-09-05 11:00:41
美媒:中国首架洲际航程隐形轰炸机正在测试

美媒:中国首架洲际航程隐形轰炸机正在测试

自在天高
2026-09-05 10:44:44
112名球员选GOAT:詹姆斯49票险胜乔丹,8名前队友倒戈

112名球员选GOAT:詹姆斯49票险胜乔丹,8名前队友倒戈

热血体育社
2026-09-04 20:34:19
电车20年内必被淘汰?戳中了新能源最不敢面对的财政死穴

电车20年内必被淘汰?戳中了新能源最不敢面对的财政死穴

民间胡扯老哥
2026-09-03 06:36:08
随着吉达国民5-0,利雅得新月2-0,沙特联最新积分榜出炉

随着吉达国民5-0,利雅得新月2-0,沙特联最新积分榜出炉

侧身凌空斩
2026-09-05 05:37:49
哈登一个人5次!50+三双盘点:威少3次第二,东契奇约基奇60+三双

哈登一个人5次!50+三双盘点:威少3次第二,东契奇约基奇60+三双

无术不学
2026-09-05 11:33:16
奉劝所有人,今年冬天务必做好准备!厄尔尼诺现象持续到2027年2月底的可能性目前已接近100%!

奉劝所有人,今年冬天务必做好准备!厄尔尼诺现象持续到2027年2月底的可能性目前已接近100%!

扶苏聊历史
2026-09-04 16:54:19
世界上断送国家命运的六大决策:1、俄罗斯卖掉阿拉斯加,2、乌克兰主动放弃核武器,3、伊朗霍梅尼回国,推翻巴列维政权

世界上断送国家命运的六大决策:1、俄罗斯卖掉阿拉斯加,2、乌克兰主动放弃核武器,3、伊朗霍梅尼回国,推翻巴列维政权

扶苏聊历史
2026-09-02 18:25:39
昆汀《杀死比尔:血色全传》内地首映,275分钟一刀未剪

昆汀《杀死比尔:血色全传》内地首映,275分钟一刀未剪

IT之家
2026-09-04 12:18:41
“眼神都拉丝了!”家长晒母子互动视频,引全网不适:儿大不避母的结果

“眼神都拉丝了!”家长晒母子互动视频,引全网不适:儿大不避母的结果

妍妍教育日记
2026-08-31 23:54:51
普京谈是否打击英国军事目标

普京谈是否打击英国军事目标

参考消息
2026-09-02 14:16:13
内娱的审美该醒醒了,张子枫林允一起参加活动,一个干瘪一个饱满

内娱的审美该醒醒了,张子枫林允一起参加活动,一个干瘪一个饱满

小椰的奶奶
2026-09-04 16:41:42
2026-09-05 13:28:49
云头条 incentive-icons
云头条
引领科技变革,连接技术与商业。
21494文章数 27361关注度
往期回顾 全部

科技要闻

华为何庭波,再次更新韬定律论文

头条要闻

牛弹琴:164国赞成只有美国1票反对 世界地图要变了

头条要闻

牛弹琴:164国赞成只有美国1票反对 世界地图要变了

体育要闻

小卡来去10首轮,快船7年彩礼一场空

娱乐要闻

她曾被名导抛弃,凭《生逢其时》翻红

财经要闻

姚洋:刺激消费要守住两个“大西瓜”

汽车要闻

全新第四代博越Li‑HEV系列 怎么开都省

态度原创

数码
家居
游戏
亲子
公开课

数码要闻

七彩虹灵创K16游戏本新增128G + 4T版本,39999元

家居要闻

2026建博会(广州) 公装联探展交流活动

《莎拉的黑店》1.0版10月23日推出 回合制策略管理

亲子要闻

“我的玩具我做主”,幼儿园老师教小朋友学会拒绝,“被别的小朋友抢玩具,要学会保护”

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版