北京时间9月4日凌晨,OpenAI把GPT-6 Astra发出来了。距离Anthropic发Claude Fable 5.1,正好两天。
Sam Altman的推文里有一句话我觉得挺值得单独拎出来看的:「It took us some extra time to ensure that we could meet the safety and alignment standards required for this capability level, but we think you'll find it worth the wait.」
![]()
翻译一下就是,我们晚了,但值得。这半年OpenAI被Anthropic压着打,GPT-5.5、GPT-5.6发一个比一个,年化收入5月还被反超了。所以这次Astra出来,我第一反应倒不是吓哭,是OpenAI终于有一个能跟Anthropic放在同一张表上、而且大部分行赢的模型了。
发布本身挺狼狈,博客先被人从官网挖出来又撤下,官方链接一度打不开,发布前几个小时ChatGPT、Claude、Grok还同时宕机了一波。Greg Brockman那句「Welcome to the AGI era」倒是很快传开了。
先说订阅用户最关心的:Plus、Pro、Business、Enterprise几天内都能用上,用量算在现有订阅额度里,细节在第五节。下面是官方发布页和X上的东西,官方页在这:
https://openai.com/index/gpt-6-astra/
一、AGI似乎真的来了?
OpenAI这次开头就甩了三个接近满分的数:
FrontierMath Tier 4(v2)97.6%。这是目前最难的数学评测集,Fable 5就已经是87.8%,Opus 5是73.2%,GPT-5.6 Sol是80.5%(Sol是OpenAI两个月前发的上一代旗舰,官方脚注说ChatGPT聊天里那个Sol跟API和Codex里的还不是同一个版本,表里用的是后者)。有意思的是官方表里Fable 5.1这行写的是78.0%,比Fable 5还低,官方没解释,我也不太确定是什么原因。
配着这个分数,OpenAI又放了两个素数间隙的新结果:孪生素数间隙的上界,十几年前被压到246,前不久Julia Stadlmann改进到240,Astra直接推到了186;另一个是大间隙问题里一个80多年没动过的项,被它改进了。证明和精简版的思维链都挂在发布页上,能自己去看。
ARC-AGI-3 99.9%。这个数对比一下就知道有多夸张:GPT-5.6 Sol只有7.8%,Opus 5是30.2%,Fable 5和5.1没有公开分数。不过脚注里写了,这个分数是用OpenAI自己的Responses API harness跑的(harness就是模型外面那层工具和流程),改了两个设置,他们说不是专门针对ARC-AGI-3调的。VentureBeat提了一嘴,前阵子NVIDIA用Opus 5套个自己的harness也把ARC-AGI-3公开集做到了100%,所以这个分数看看就好,harness的贡献可能比模型本身大。
ExploitBench 100%。把已知漏洞变成可用的攻击代码的评测,GPT-5.6 Sol是78.5%,Opus 5是70%。这个数字就是第六节那堆限制的来源。
二、真正重要的编程类任务,倒也没全赢
这是我最关心的一张表,直接放官方原图:
![]()
逐行看一下:
Terminal-Bench 4.0,Astra 57.9%,Fable 5.1 55.8%,Opus 5 52.3%,Sol 37.3%。赢了,但赢得不多,2个百分点。
DeepSWE v1.1,Astra 74.1%,Fable 5.1 67.4%。看起来差距挺大,但同一行里Gemini 3.8 Flash是73.8%,Opus 5是73.7%,Fable 5是69.9%。所以这行Astra只是比Fable 5.1多,比其他几个基本持平。
FrontierCode 1.1,Extended和Main两个子集,Astra分别是64.5%和53.3%,Fable 5是64.9%和53.5%,都比Astra高,Opus 5的Main也是53.4%。这行OpenAI自己表格里就没赢。
Artificial Analysis的Coding Agent Index,Astra 67.0,Fable 5 67.2,Opus 5 68.1。也没赢。
内部的数据库迁移任务,Astra 63.9%,Fable 5.1 57.8%,这个是OpenAI自己的题,参考意义一般。
所以官方说的「best model for software engineering to date」,按他们自己的表,我的理解是:终端类agent任务确实领先了,但纯写代码改代码的评测上,Claude这一家的几个模型跟它是咬着的,谁高谁低看你挑哪个benchmark。The New Stack那篇的副标题就直接写了「does not clearly lead the coding pack」。
OpenAI这次很聪明的一点是,每张图都改成了横轴API成本、纵轴分数的画法:
![]()
Terminal-Bench 4.0这张,Astra的星星在左上角,Fable 5.1的方块在右边。官方图注说,Astra拿到57.9%那个点的估算成本,比Fable 5.1拿55.8%那个点低63%,比Sol低9%。定价明明差不多,成本能差这么多,主要是Astra输出token少。这个我没法验证,等推送到账号了自己跑一遍看token消耗吧。
三、电脑操控太猛了
官方给Astra的定位是「world's best computer use model」,官推那条宣传片的文案是「Anything you can do on a computer, Astra can do for you. Fast.」,几个小时就1100万次观看:
![]()
这块的数据也确实是全表里最好看的一块:
OSWorld 2.0(离线子集),Astra 72.6%,Sol 65.7%,Opus 5 70.2%。分数之外还有个时间数据,Astra平均每个任务40分钟,Sol要75分钟,快了47%。Anthropic自己给Fable 5.1报过77.9%,但官方脚注说那个用的是不同版本的OSWorld和改过的评分方式,不能直接比。
Agents' Last Exam,在真实软件里做财务建模、工程、媒体制作这种专业任务,Astra 59.3%,Opus 5 55.5%,Sol 53.6%,Fable 5 48.7%。官方还补了一句,最高分设置下Astra的输出token比Opus 5少65%。
ScreenSpot-Pro(不带工具的屏幕元素定位),Astra 92.7%,Sol 76.9%,Fable 5是87.3%,脚注说这个数其实是Mythos跑的(就是安全措施更少的那版Fable)。
AutomationBench,Astra 41.4%,Fable 5.1 31.4%,Sol只有18.1%。
数字之外,发布页上挂了十几段演示视频,我把几段扒下来转成了GIF,都是官方原片压缩的,看个意思:
![]()
这是在KiCad里画PCB电路板,把原理图布成可以拿去生产的板子,官方说这是15秒的浓缩回放。电路板布线是电子工程师手工做的活,也是硬件设计流程里最常见的卡点之一。
![]()
Excel建模竞赛题,4倍速。这个我看的时候有点意外,它是真的在Excel界面里一格一格操作,不是生成个文件丢给你。
![]()
Power BI做仪表盘。
![]()
给OpenAI自己的官网做前端QA,边点边记bug到Linear里,这段是实时速度。
![]()
汽车变速箱的运动仿真,3D的那种。
![]()
Blender里建了个房子,导进Unreal Engine 5做成能走进去的场景,这段原片20秒,我只截了前6秒,不然压不进公众号的10MB。
![]()
然后是一组生活任务:找儿科医生、租房、预约DMV、低碳零食、幼儿园分析,官方给这组配的说法是「faster than you can」,演示页上挂着人类基准时间和模型时间的对比。这组是给ChatGPT普通用户看的,跟前面那些工程演示不是一个受众。
![]()
这张是官方放的Sol和Astra做个人求职网站的对比,左边Sol右边Astra。
![]()
还有一个能直接玩的卡丁车游戏(Pietro Schirano做的,用ChatGPT的Sites功能托管),我点进去开了一局,键盘WASD开车,空格漂移,完整的3圈8人赛。
看这些演示的时候我心情挺复杂的。我们最近一直在做和优化huashu-mac这个skill,让agent去操控那些没有API的Mac原生app,截窗口、点按钮、探测哪个app能自动化,前后折腾了好几轮。现在看,模型的更新把这事碾压过去了。之前很多人跟AI配合的方式还是AI负责智力劳动,我帮AI干苦活,去不同的软件里测试、截图、把浏览器的报错复制粘贴回去。现在特么的,看起来这部分苦力活也没必要了。也许真正重要的是该给GPT-6配台Mac了,前段时间不是传OpenAI在疯狂采购Mac mini吗,8月底的报道说是几万台Mac mini和Mac Studio,专门用来训练电脑操作的agent,Anthropic走的是在AWS上租Mac mini的路子。现在回头看,那批机器就是为这个准备的。
Dan Shipper(Every的CEO,他们家每次新模型都出vibe check)说电脑操作这块他用的词是「wild」,它能连续几小时在复杂的app里干活,Every那期Fable 5.1的评测视频,初剪就是Astra做的。
四、科学和其他
Terminal-Bench Science 0.1,用终端和代码完成科研工作流(分析数据、跑模拟、拟合模型),Astra 64.6%,Fable 5.1 52.6%,Sol只有22.4%。成本曲线也是同一个画法:
![]()
GPQA Diamond 96.0%,Sol 94.6%,Gemini 3.8 Flash 95.3%,Fable 5.1 93.7%,这个评测基本饱和了,大家都在95上下。
BenchCAD(看多视角渲染图反推CAD代码),Astra 95.9%,Sol 83.3%,Fable 5.1 84.3%(脚注说Claude的分用的是Anthropic自己改过的评测设置)。
长上下文,MRCR v2 8-needle,512K到1M区间Astra 96.3%,Sol 73.8%,这个提升挺大的。
输的地方也列一下:Humanity's Last Exam(带工具),Astra 57.2%,Fable 5.1 65.0%,Fable 5 63.8%,Opus 5 63.6%,全输。Artificial Analysis的Intelligence Index,Astra 61.2,Fable 5.1 65.7,Opus 5 63.1,也输。这两行都在官方表里,OpenAI没藏。另外生命科学那三项(LifeSciBench、GeneBench Pro、MedChemBench)表里根本没有Claude,脚注说是因为Fable 5和5.1拒答了大部分题目。
![]()
五、订阅用户能拿到什么
ChatGPT:先给一小批组织,几天内推给所有Plus、Pro、Business、Enterprise用户,用量算在现有订阅额度里,不够可以另买credits。Pro、Business、Enterprise还能用GPT-6 Astra Pro。企业版默认是关的,要管理员手动开。
API:模型名gpt-6-astra,同时上了Amazon Bedrock。定价每百万token输入10美元、输出50美元,跟Claude Fable 5.1一模一样;GPT-5.6 Sol是5美元和30美元,所以输入贵一倍,输出贵六成多。Fast mode速度2.5倍、价格2倍。
Codex:这次有个我很想试的功能。以前上下文窗口满了靠compaction(把前面的对话压成一段摘要),压一次丢一点细节,比如某个修复为什么失败。Astra在Codex里可以跨上下文窗口记笔记,旧窗口的内容还能被搜索,不用反复压成一段摘要。现在是实验功能,要在config.toml里手动开,官方说几周内会变成Astra的默认行为。另外它在Codex里可以异步提问,问完不等你回答继续干不依赖答案的部分,你不回它就按合理假设走,涉及重大决定的才等你。
ChatGPT里的Sites:Astra可以直接从一句prompt创建、托管、分享网站和网页游戏,上面那个卡丁车就是这么来的。
六、网络安全这块被锁了一半
Astra是OpenAI第一个触发Preparedness Framework里Critical网络安全阈值的模型。官方页写得很直白:在没有生产环境防护的情况下,它能利用未知漏洞在加固过的浏览器里实现任意代码执行,能给加固过的操作系统写提权攻击代码。在那套V8漏洞评测里,它自己发现并用上了两个零日漏洞,OpenAI说已经在向维护者披露。
所以今天发布的这版Astra,会拒绝写漏洞利用的proof-of-concept(就是证明这个漏洞真能被打穿的那段代码),安全代码审查、打补丁这种可以做。API里如果触发安全检查,任务直接停,不是暂停等你确认。更松的权限走OpenAI Daybreak项目,先给一批经过审核的防御方,几周内逐步放开。
对齐这块有个数字我觉得挺有意思:OpenAI用之前Hugging Face那次事件(agent越权入侵的那次,8月OpenAI在Black Hat上自己披露的)做了个新评测,看模型碰到做不完的任务会不会越出授权范围,GPT-5.6 Sol不带防护时48%的情况会越界,Astra是0%。同时他们也承认,Astra的思维链比Sol更难监控,因为它在简单任务上写的推理步骤更少,这个他们说是「take the decline seriously」。
七、X上的第一波评价
Dan Shipper那条我觉得是目前最有信息量的,Every提前拿到模型测了一阵:
![]()
他的结论我概括一下:写作是他试过最好的模型,slop很少,好控制;电脑操作wild;3D游戏和可视化一句话能出很好的东西;但爱把事情做复杂,你要一个简单界面它给你堆一堆标签按钮,什么都想做成landing page。图里截不下的后面还有一句「Fable 5.1 still gets my biggest tasks」,大项目还是给Fable。
![]()
Theo(t3.gg)说他用了几周,「the smartest model ever released」「a taste of AGI」,底下Patrick Gerrits回他:你不是天天发Fable 5.1怎么提升你产出的吗,那时候怎么不用Astra。
The Rundown那条汇总推下面有个回复我看到的时候有点想笑:「love a chart where fable 5.1 exists purely to get dunked on in someone else's launch post」。顺便说一句,那条汇总推发得比官方还早一个多小时,里面ARC-AGI-3写的是98.6%,是禁令解除前的旧数,线上页现在是99.9%。
最后
AGI是不是真来了,或者什么是特么的AGI估计还要争论不停的。
但OpenAI切切实实的回来了,电脑操作和科研这两块是真领先,编程是咬着的,OpenAI似乎在不同的方向上找到了突破Anthropic和开源模型为啥的局面。
很可惜还暂时不能用,我手上OpenAI送的6个月Pro会员还在嗷嗷待哺呢!
![]()
等Astra推到我的账号,我会拿手上正在跑的几个项目实测一遍,特别是Codex那个跨窗口记笔记的功能,到时候再写。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.