网易首页 > 网易号 > 正文 申请入驻

OpenAI GPT-6 Astra震撼发布!AGI时代来了

0
分享至

OpenAI Astra,终于来了。

今天,OpenAI 正式发布新一代前沿模型GPT-6 Astra



而 OpenAI 总裁 Greg Brockman 更是毫不掩饰对 Astra 的评价。在发布前的媒体简报会上,他直言自己认为「我们已经到了 AGI」,并以一句:「Welcome to the AGI era.」结束了整场发布。

这款模型早在一个多月前就已进入公众视野。8 月初,《The Information》报道称,Sam Altman 曾在华盛顿向政策制定者演示代号 Astra 的新模型。它支持多个 Agent 长时间协作完成复杂任务,内部甚至一度考虑将其命名为 GPT-6。

但此后,围绕 Astra 的焦点迅速从「有多强」转向了「是否足够安全」。

OpenAI 随后确认,Astra 已达到准备框架的「关键级」网络安全能力门槛,成为公司首个跨过这一等级的模型,并一度放慢部分开发工作、加强安全措施。

昨天,Astra 的另一项变化又浮出水面。据《The Information》报道,它可能引入了「循环深度」(recurrent depth)技术,让模型在输出下一个 Token 前完成更多内部计算。换句话说,它可能不仅更强,而且开始真正做到:少说,多想。

经历一个多月的曝光、安全刹车与技术争议后,Astra 终于正式上线。



「世界上最智能、最对齐的模型」

首先在官网视觉上,Astra 就已经和 OpenAI 过去发布的模型明显不同。相比此前更简洁克制的产品页,这次 OpenAI 明显强化了「新世代」的发布感:动态变化的数字 6、深色界面,再加上更具冲击力的整体视觉设计,都在强调 GPT-6 Astra 与上一代模型之间的不同。



OpenAI 对 GPT-6 Astra 的定位相当直接:「世界上最智能、最对齐的模型。」

按照官方介绍,Astra 集中了 OpenAI 多年来在预训练、强化学习和对齐上的研究成果,在电脑操作、浏览器使用、软件工程、网络安全、科学研究和专业工作等领域全面刷新此前模型的能力。

一些 Benchmark 已经高得接近「刷满」。在 ARC-AGI-3 上,GPT-6 Astra 拿到了99.9%,相比之下 GPT-5.6 Sol 只有 7.8%,Claude Opus 5 为 30.2%。更难的 FrontierMath Tier 4 上,Astra 达到97.6%,GPT-5.6 Sol 为 83.0%。网络安全测试 ExploitBench 则直接拿下100%



不过,相比这些传统意义上的「智力跑分」,这次 OpenAI 更强调的是 Astra 把能力进一步转化成了实际行动。

尤其是操作电脑。OpenAI 直接把这一部分称为「世界上最好的 computer use 模型」。Astra 可以自己填写网页表单、更新 CRM 客户记录、整理日历,也可以进行网络研究,再把结果写进邮件或者文档。更复杂的场景里,它可以分析科学数据、生成图表、搭建网站、执行前端 QA,甚至自主安装和测试软件,并根据屏幕上出现的问题继续排查。





在测试 AI 使用真实软件完成复杂专业任务的 Agents' Last Exam 中,Astra 得分达到59.3%,超过 GPT-5.6 Sol 的 53.6% 和 Claude Opus 5 的 55.5%。



而且,它完成这些任务不需要生成更多文字。OpenAI 表示,在最高分设置下,Astra 使用的输出 Token 比 Claude Opus 5少约 65%

速度同样明显提升。在 OSWorld 2.0 的模拟中,Astra 得分从 GPT-5.6 Sol 的 65.7% 提升到 72.6%,完成单个任务的时间却从大约 75 分钟下降到 40 分钟,缩短约47%。配合新版 Codex Harness 后,在 Mind2Web 上,Astra 完成任务的速度可以达到当前 GPT-5.6 Sol 体验的1.9 倍



这种变化也延伸到了专业办公场景。

OpenAI 表示,Astra 针对真实工作环境进行了专门训练,可以完成多步骤任务,并直接产出文档、电子表格和演示文稿。

在 BenchCAD 中,模型需要根据多个角度的渲染图编写 CAD 代码,重新构建一个 3D 物体。Astra 的几何重合度达到95.9%,GPT-5.6 Sol 为 83.3%,Claude Fable 5.1 为 84.3%。与此同时,OpenAI 估算 Astra 完成该任务的 API 成本还比 GPT-5.6 Sol 低约43%



Astra 也更擅长遵循企业现有模板。

给它几页公司的 PPT,它可以继续按照相同的布局、语气和视觉风格完成整套演示;处理文档和表格时,它也会主动筛选真正相关的信息,而不是把上下文里的所有东西重新复述一遍。在 ChatGPT 的 Sites 功能中,Astra 甚至可以从一句提示词开始,直接创建、托管和分享网站、Web App 以及游戏。



另一个变化是 Astra 更会「自己拿主意」了。

当指令里缺少一些不影响最终结果的细节时,它会利用上下文自行补全;只有当缺失信息可能真正改变结果时,它才会向用户提问。在 Codex 中,它甚至可以一边继续处理不依赖用户回答的工作,一边异步等待回复。

此前模型经常出现的另一个问题,是用户中途补充一句要求,它就突然把新消息当成新的总目标,把最开始的任务忘掉。OpenAI 表示,Astra 可以更好地保持原始目标,同时接受中途修改、回答支线问题,再继续完成之前的任务。

编程、科学,以及更长时间的 Agent

软件工程同样是 Astra 提升最明显的领域之一,OpenAI 直接称它是「目前最好的软件工程模型」。

Terminal-Bench 4.0 中,Astra 得分达到约58%,GPT-5.6 Sol 为 37.3%,Claude Fable 5.1 为 55.8%。



在内部数据库迁移任务中,Astra 达到 63.9%,GPT-5.6 Sol 只有 42.7%。

另外,Codex 加入了一种新的长任务上下文机制。

过去,一项编程任务持续太久、上下文窗口装不下时,模型通常会通过 compaction,把之前的内容压缩成摘要。

问题在于,每压缩一次,都可能丢掉一些细节。某个方案为什么失败、一项测试之前出现过什么异常、一段代码为什么不能修改,都可能在多次压缩后消失。到了 Astra,Codex 可以让模型在不同上下文窗口之间保存自己的笔记,同时此前完整的上下文依然可以被搜索。

也就是说,即便某条需求没有被写进摘要,模型之后仍然可以回头把它找出来。

对于真正持续数小时甚至更长时间的软件工程 Agent 来说,这种能力的意义可能比单纯再扩大一次 Context Window 更大。

科学研究也是类似的逻辑。



Astra 在 GPQA Diamond 上达到96.0%,FrontierMath Tier 4 达到97.6%。OpenAI 还表示,Astra 已经参与解决一些长期未解决的数学问题,此次发布又公布了两项与素数间隔有关的新结果。

凭借更强的电脑操作能力,Astra 可以直接进入专业科学软件,检查测序数据、分析遗传变异、运行模拟、拟合模型,然后根据结果决定下一步应该调查什么。

Terminal-Bench Science 0.1 上,Astra 达到64.6%,Claude Fable 5.1 为 52.6%,GPT-5.6 Sol 最好的成绩只有 22.4%。更低成本设置下,Astra 仍然可以达到 61.1%,估算 API 成本还比 GPT-5.6 Sol 低约 27%。

这也是 Astra 整场发布中最明显的一条主线:更少的 Token、更短的时间,完成更复杂的任务。

「关键级」模型正式上线

当然,真正让 Astra 在发布前就引起争议的,还是网络安全能力。

现在 OpenAI 给出了更加完整的测试结果。ExploitBench 上,GPT-6 Astra 达到100%,GPT-5.6 Sol 为 78.5%。



ExploitGym 上,Astra 的漏洞利用成功率达到 42.4%,GPT-5.6 Sol 为 30.3%,与此同时 Astra 使用的输出 Token 明显更少。

考虑到公开 Benchmark 可能存在训练数据污染,OpenAI 又专门制作了一套只包含2026 年 6 月至 8 月漏洞的内部测试集。在这套更新的数据中,Astra 的任意代码执行成功率达到39%,GPT-5.6 Sol 只有5.5%

更夸张的是,在测试过程中,Astra 发现并实际利用了两个此前未知的零日漏洞。OpenAI 目前正在向对应项目的维护者披露。

另一项 SRE-Bench 测试中,Astra 单次尝试就解决了 88.0% 的任务,四次尝试后达到99.2%,GPT-5.6 Sol 分别只有 55.9% 和 68.7%。

专家测试还发现,在关闭生产安全措施的情况下,Astra 可以利用此前未知的漏洞,在经过加固的浏览器中实现任意代码执行,并针对加固操作系统构造权限提升攻击。这也是 OpenAI 最终将 Astra 划入Critical Cyber的原因。

不过,今天普通用户拿到的 Astra,并不会直接开放这些最强能力。当前版本可以用于安全代码审查和漏洞修复,但会拒绝更高级的漏洞利用任务,例如为漏洞创建 PoC。之后 OpenAI 会通过 Daybreak 逐步开放限制更少的版本,用于漏洞验证、恶意软件分析和检测工程等防御场景。

而发布前最受关注的另一个问题,到现在仍然没有直接答案:Astra 到底有没有使用「循环深度」?

OpenAI 在发布博客中没有提到 recurrent depth,也没有公布具体模型架构。不过,官方披露了一个值得注意的结果:在专门测试模型逃避监控的评估中,Astra 的书面推理比 GPT-5.6 Sol 更难监控。OpenAI 认为,这与 Astra 能用更少的书面步骤完成简单任务有关,并承认这种可监控性的下降需要严肃对待。

因此,在实际部署中,OpenAI 会同时监控 Astra 的推理和行动,通过分类器识别未经授权的行为,并在必要时中止任务。

但另一方面,Astra 在行为上反而更加「守规矩」。

在根据 Hugging Face 事件设计的 ExploitGym honeypot 测试中,GPT-5.6 Sol 在无生产安全措施时有约一半样本会攻击任务范围之外的诱饵目标,而 Astra 为 0%。OpenAI 不同评测配置下给出的 Sol 数字约为 48%–56%。

电脑操作安全压力测试中,Astra 的不当行为率为2.4%,GPT-5.6 Sol 为 22.0%。OpenAI 的内部测试还显示,Astra 的「能力幻觉率」从 GPT-5.6 Sol 的 9.4% 降到了2.0%

也就是说,Astra 身上出现了一个很有意思的组合:能力更强、外显推理更少,但行为反而更加克制。

最后是上线和价格。

GPT-6 Astra 今天首先向少量组织开放,未来几天会逐步提供给ChatGPT Plus、Pro、Business 和 Enterprise用户。Pro、Business 和 Enterprise 用户还将获得GPT-6 Astra Pro

API 模型名为gpt-6-astra,同时也会上线 Amazon Bedrock。标准价格为输入 10 美元 / 百万 Token,输出 50 美元 / 百万 Token。Fast Mode 最高可达到标准模式2.5 倍的速度,价格则是两倍。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
“韦东奕这么牛,为啥没女孩子喜欢他呢?”女儿白了我一眼说:“别的先不讲,要是有人能把这三点都接纳了,我不光服,还得佩服。”

“韦东奕这么牛,为啥没女孩子喜欢他呢?”女儿白了我一眼说:“别的先不讲,要是有人能把这三点都接纳了,我不光服,还得佩服。”

背包旅行
2026-09-01 11:59:13
“8·28”新政影响来了!传深圳有房企解散销售团队,成都多家房企喊涨价

“8·28”新政影响来了!传深圳有房企解散销售团队,成都多家房企喊涨价

密探财经
2026-09-04 18:42:55
杨舒予队长被免,李月汝丢护照,名记曝女篮内部矛盾大,波及李梦

杨舒予队长被免,李月汝丢护照,名记曝女篮内部矛盾大,波及李梦

萌兰聊个球
2026-09-04 13:19:57
常州市纪委监委通报:高伟新、潘文杰、谭志平被查

常州市纪委监委通报:高伟新、潘文杰、谭志平被查

扬子晚报
2026-09-04 16:54:45
在美国,你要是看到一些体态肥胖,屁股大并且满身是肉的人,放心那大概率是穷人

在美国,你要是看到一些体态肥胖,屁股大并且满身是肉的人,放心那大概率是穷人

扶苏聊历史
2026-08-24 13:37:00
全红婵奖金去哪了?哥哥揭秘:她把钱"还"给了当年的自己

全红婵奖金去哪了?哥哥揭秘:她把钱"还"给了当年的自己

坠入二次元的海洋
2026-09-04 07:28:33
立陶宛议员自费赴欧求见中方,只因当年一个决定

立陶宛议员自费赴欧求见中方,只因当年一个决定

时光慢旅人
2026-09-04 08:28:32
王炸!快船中出了一个叛徒!他限死了鲍尔默申诉!

王炸!快船中出了一个叛徒!他限死了鲍尔默申诉!

贵圈真乱
2026-09-05 10:12:55
玩家把PS5挂墙上炫耀:被网友喷 "蠢出天际"

玩家把PS5挂墙上炫耀:被网友喷 "蠢出天际"

游民星空
2026-09-02 16:11:52
37岁歌唱家龚爽去世,是阎维文学生,3月前还曾演出,原因太惋惜

37岁歌唱家龚爽去世,是阎维文学生,3月前还曾演出,原因太惋惜

180视角
2026-09-04 14:09:10
八季口碑起伏不定,“花少”2026全员陌生开局,综N代没有保鲜公式

八季口碑起伏不定,“花少”2026全员陌生开局,综N代没有保鲜公式

北青网-北京青年报
2026-09-04 15:17:03
西藏泥石流灾害救援最新进展:攻坚组抵达原海关宿舍所在的核心区域

西藏泥石流灾害救援最新进展:攻坚组抵达原海关宿舍所在的核心区域

网络易不易
2026-09-04 14:30:15
张宇辰燃爆!最后1分钟独砍8分轰19分率队险胜混编凤凰队

张宇辰燃爆!最后1分钟独砍8分轰19分率队险胜混编凤凰队

狼叔评论
2026-09-04 18:32:04
喜报,冯彬首夺钻石联赛铁饼总冠军,创赛季最佳,刷三大纪录,打样严子怡

喜报,冯彬首夺钻石联赛铁饼总冠军,创赛季最佳,刷三大纪录,打样严子怡

许穩很机智
2026-09-05 08:02:39
阿劳霍首次英超首发:0次被过7次解围,6次争顶全部成功

阿劳霍首次英超首发:0次被过7次解围,6次争顶全部成功

懂球帝
2026-09-05 05:07:09
本·西蒙斯重返NBA!1年350万加盟国王队

本·西蒙斯重返NBA!1年350万加盟国王队

体坛周报
2026-09-04 21:50:11
河南女护士被领导多次强奸,苦苦哀求:你年纪大,别再找我好不好

河南女护士被领导多次强奸,苦苦哀求:你年纪大,别再找我好不好

墨策讲历史
2026-09-04 16:50:24
恩爱32年难抵残酷现实?52岁黄渤被确诊送医,两个女儿成“遗憾”

恩爱32年难抵残酷现实?52岁黄渤被确诊送医,两个女儿成“遗憾”

林轻吟
2026-09-04 22:01:35
一针没打的280万人,2026年身体真相曝光

一针没打的280万人,2026年身体真相曝光

华庭讲美食
2026-08-26 01:21:08
四川绵竹上空出现大量鸟群密集盘旋,官方明确表示该现象为季节性常态,与地震无任何直接关联,呼吁公众不必恐慌

四川绵竹上空出现大量鸟群密集盘旋,官方明确表示该现象为季节性常态,与地震无任何直接关联,呼吁公众不必恐慌

潇湘晨报
2026-09-04 17:03:22
2026-09-05 10:47:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13921文章数 142729关注度
往期回顾 全部

科技要闻

华为何庭波,再次更新韬定律论文

头条要闻

新世界地图要来了 联合国:停止"小看"非洲

头条要闻

新世界地图要来了 联合国:停止"小看"非洲

体育要闻

小卡来去10首轮,快船7年彩礼一场空

娱乐要闻

郭麒麟瘦到全网认不出,为新剧塑形

财经要闻

姚洋:刺激消费要守住两个“大西瓜”

汽车要闻

搭载天枢领航Ultra 长安启源Q06预售14.79万元起

态度原创

时尚
家居
本地
数码
艺术

杨紫:自渡成舟

家居要闻

2026建博会(广州) 公装联探展交流活动

本地新闻

扒完小作文,富豪们私藏的度假胜地有多绝

数码要闻

DDR5太贵买不起!厂商推出0GB假内存:插满插槽还能亮RGB

艺术要闻

2026潮涌宁波—第六届综合材料绘画展 入选作品选(二)

无障碍浏览 进入关怀版