网易首页 > 网易号 > 正文 申请入驻

GPT-6发布,OpenAI说AGI时代来了

0
分享至

北京时间9月4日凌晨,OpenAI把GPT-6 Astra发出来了。距离Anthropic发Claude Fable 5.1,正好两天。

Sam Altman的推文里有一句话我觉得挺值得单独拎出来看的:「It took us some extra time to ensure that we could meet the safety and alignment standards required for this capability level, but we think you'll find it worth the wait.」


翻译一下就是,我们晚了,但值得。这半年OpenAI被Anthropic压着打,GPT-5.5、GPT-5.6发一个比一个,年化收入5月还被反超了。所以这次Astra出来,我第一反应倒不是吓哭,是OpenAI终于有一个能跟Anthropic放在同一张表上、而且大部分行赢的模型了

发布本身挺狼狈,博客先被人从官网挖出来又撤下,官方链接一度打不开,发布前几个小时ChatGPT、Claude、Grok还同时宕机了一波。Greg Brockman那句「Welcome to the AGI era」倒是很快传开了。

先说订阅用户最关心的:Plus、Pro、Business、Enterprise几天内都能用上,用量算在现有订阅额度里,细节在第五节。下面是官方发布页和X上的东西,官方页在这:

https://openai.com/index/gpt-6-astra/

一、AGI似乎真的来了?

OpenAI这次开头就甩了三个接近满分的数:

FrontierMath Tier 4(v2)97.6%。这是目前最难的数学评测集,Fable 5就已经是87.8%,Opus 5是73.2%,GPT-5.6 Sol是80.5%(Sol是OpenAI两个月前发的上一代旗舰,官方脚注说ChatGPT聊天里那个Sol跟API和Codex里的还不是同一个版本,表里用的是后者)。有意思的是官方表里Fable 5.1这行写的是78.0%,比Fable 5还低,官方没解释,我也不太确定是什么原因。

配着这个分数,OpenAI又放了两个素数间隙的新结果:孪生素数间隙的上界,十几年前被压到246,前不久Julia Stadlmann改进到240,Astra直接推到了186;另一个是大间隙问题里一个80多年没动过的项,被它改进了。证明和精简版的思维链都挂在发布页上,能自己去看。

ARC-AGI-3 99.9%。这个数对比一下就知道有多夸张:GPT-5.6 Sol只有7.8%,Opus 5是30.2%,Fable 5和5.1没有公开分数。不过脚注里写了,这个分数是用OpenAI自己的Responses API harness跑的(harness就是模型外面那层工具和流程),改了两个设置,他们说不是专门针对ARC-AGI-3调的。VentureBeat提了一嘴,前阵子NVIDIA用Opus 5套个自己的harness也把ARC-AGI-3公开集做到了100%,所以这个分数看看就好,harness的贡献可能比模型本身大。

ExploitBench 100%。把已知漏洞变成可用的攻击代码的评测,GPT-5.6 Sol是78.5%,Opus 5是70%。这个数字就是第六节那堆限制的来源。

二、真正重要的编程类任务,倒也没全赢

这是我最关心的一张表,直接放官方原图:


逐行看一下:

Terminal-Bench 4.0,Astra 57.9%,Fable 5.1 55.8%,Opus 5 52.3%,Sol 37.3%。赢了,但赢得不多,2个百分点。

DeepSWE v1.1,Astra 74.1%,Fable 5.1 67.4%。看起来差距挺大,但同一行里Gemini 3.8 Flash是73.8%,Opus 5是73.7%,Fable 5是69.9%。所以这行Astra只是比Fable 5.1多,比其他几个基本持平。

FrontierCode 1.1,Extended和Main两个子集,Astra分别是64.5%和53.3%,Fable 5是64.9%和53.5%,都比Astra高,Opus 5的Main也是53.4%。这行OpenAI自己表格里就没赢。

Artificial Analysis的Coding Agent Index,Astra 67.0,Fable 5 67.2,Opus 5 68.1。也没赢。

内部的数据库迁移任务,Astra 63.9%,Fable 5.1 57.8%,这个是OpenAI自己的题,参考意义一般。

所以官方说的「best model for software engineering to date」,按他们自己的表,我的理解是:终端类agent任务确实领先了,但纯写代码改代码的评测上,Claude这一家的几个模型跟它是咬着的,谁高谁低看你挑哪个benchmark。The New Stack那篇的副标题就直接写了「does not clearly lead the coding pack」。

OpenAI这次很聪明的一点是,每张图都改成了横轴API成本、纵轴分数的画法:


Terminal-Bench 4.0这张,Astra的星星在左上角,Fable 5.1的方块在右边。官方图注说,Astra拿到57.9%那个点的估算成本,比Fable 5.1拿55.8%那个点低63%,比Sol低9%。定价明明差不多,成本能差这么多,主要是Astra输出token少。这个我没法验证,等推送到账号了自己跑一遍看token消耗吧。

三、电脑操控太猛了

官方给Astra的定位是「world's best computer use model」,官推那条宣传片的文案是「Anything you can do on a computer, Astra can do for you. Fast.」,几个小时就1100万次观看:


这块的数据也确实是全表里最好看的一块:

OSWorld 2.0(离线子集),Astra 72.6%,Sol 65.7%,Opus 5 70.2%。分数之外还有个时间数据,Astra平均每个任务40分钟,Sol要75分钟,快了47%。Anthropic自己给Fable 5.1报过77.9%,但官方脚注说那个用的是不同版本的OSWorld和改过的评分方式,不能直接比。

Agents' Last Exam,在真实软件里做财务建模、工程、媒体制作这种专业任务,Astra 59.3%,Opus 5 55.5%,Sol 53.6%,Fable 5 48.7%。官方还补了一句,最高分设置下Astra的输出token比Opus 5少65%。

ScreenSpot-Pro(不带工具的屏幕元素定位),Astra 92.7%,Sol 76.9%,Fable 5是87.3%,脚注说这个数其实是Mythos跑的(就是安全措施更少的那版Fable)。

AutomationBench,Astra 41.4%,Fable 5.1 31.4%,Sol只有18.1%。

数字之外,发布页上挂了十几段演示视频,我把几段扒下来转成了GIF,都是官方原片压缩的,看个意思:


这是在KiCad里画PCB电路板,把原理图布成可以拿去生产的板子,官方说这是15秒的浓缩回放。电路板布线是电子工程师手工做的活,也是硬件设计流程里最常见的卡点之一。


Excel建模竞赛题,4倍速。这个我看的时候有点意外,它是真的在Excel界面里一格一格操作,不是生成个文件丢给你。


Power BI做仪表盘。


给OpenAI自己的官网做前端QA,边点边记bug到Linear里,这段是实时速度。


汽车变速箱的运动仿真,3D的那种。


Blender里建了个房子,导进Unreal Engine 5做成能走进去的场景,这段原片20秒,我只截了前6秒,不然压不进公众号的10MB。


然后是一组生活任务:找儿科医生、租房、预约DMV、低碳零食、幼儿园分析,官方给这组配的说法是「faster than you can」,演示页上挂着人类基准时间和模型时间的对比。这组是给ChatGPT普通用户看的,跟前面那些工程演示不是一个受众。


这张是官方放的Sol和Astra做个人求职网站的对比,左边Sol右边Astra。


还有一个能直接玩的卡丁车游戏(Pietro Schirano做的,用ChatGPT的Sites功能托管),我点进去开了一局,键盘WASD开车,空格漂移,完整的3圈8人赛。

看这些演示的时候我心情挺复杂的。我们最近一直在做和优化huashu-mac这个skill,让agent去操控那些没有API的Mac原生app,截窗口、点按钮、探测哪个app能自动化,前后折腾了好几轮。现在看,模型的更新把这事碾压过去了。之前很多人跟AI配合的方式还是AI负责智力劳动,我帮AI干苦活,去不同的软件里测试、截图、把浏览器的报错复制粘贴回去。现在特么的,看起来这部分苦力活也没必要了。也许真正重要的是该给GPT-6配台Mac了,前段时间不是传OpenAI在疯狂采购Mac mini吗,8月底的报道说是几万台Mac mini和Mac Studio,专门用来训练电脑操作的agent,Anthropic走的是在AWS上租Mac mini的路子。现在回头看,那批机器就是为这个准备的。

Dan Shipper(Every的CEO,他们家每次新模型都出vibe check)说电脑操作这块他用的词是「wild」,它能连续几小时在复杂的app里干活,Every那期Fable 5.1的评测视频,初剪就是Astra做的。

四、科学和其他

Terminal-Bench Science 0.1,用终端和代码完成科研工作流(分析数据、跑模拟、拟合模型),Astra 64.6%,Fable 5.1 52.6%,Sol只有22.4%。成本曲线也是同一个画法:


GPQA Diamond 96.0%,Sol 94.6%,Gemini 3.8 Flash 95.3%,Fable 5.1 93.7%,这个评测基本饱和了,大家都在95上下。

BenchCAD(看多视角渲染图反推CAD代码),Astra 95.9%,Sol 83.3%,Fable 5.1 84.3%(脚注说Claude的分用的是Anthropic自己改过的评测设置)。

长上下文,MRCR v2 8-needle,512K到1M区间Astra 96.3%,Sol 73.8%,这个提升挺大的。

输的地方也列一下:Humanity's Last Exam(带工具),Astra 57.2%,Fable 5.1 65.0%,Fable 5 63.8%,Opus 5 63.6%,全输。Artificial Analysis的Intelligence Index,Astra 61.2,Fable 5.1 65.7,Opus 5 63.1,也输。这两行都在官方表里,OpenAI没藏。另外生命科学那三项(LifeSciBench、GeneBench Pro、MedChemBench)表里根本没有Claude,脚注说是因为Fable 5和5.1拒答了大部分题目。


五、订阅用户能拿到什么

ChatGPT:先给一小批组织,几天内推给所有Plus、Pro、Business、Enterprise用户,用量算在现有订阅额度里,不够可以另买credits。Pro、Business、Enterprise还能用GPT-6 Astra Pro。企业版默认是关的,要管理员手动开。

API:模型名gpt-6-astra,同时上了Amazon Bedrock。定价每百万token输入10美元、输出50美元,跟Claude Fable 5.1一模一样;GPT-5.6 Sol是5美元和30美元,所以输入贵一倍,输出贵六成多。Fast mode速度2.5倍、价格2倍。

Codex:这次有个我很想试的功能。以前上下文窗口满了靠compaction(把前面的对话压成一段摘要),压一次丢一点细节,比如某个修复为什么失败。Astra在Codex里可以跨上下文窗口记笔记,旧窗口的内容还能被搜索,不用反复压成一段摘要。现在是实验功能,要在config.toml里手动开,官方说几周内会变成Astra的默认行为。另外它在Codex里可以异步提问,问完不等你回答继续干不依赖答案的部分,你不回它就按合理假设走,涉及重大决定的才等你。

ChatGPT里的Sites:Astra可以直接从一句prompt创建、托管、分享网站和网页游戏,上面那个卡丁车就是这么来的。

六、网络安全这块被锁了一半

Astra是OpenAI第一个触发Preparedness Framework里Critical网络安全阈值的模型。官方页写得很直白:在没有生产环境防护的情况下,它能利用未知漏洞在加固过的浏览器里实现任意代码执行,能给加固过的操作系统写提权攻击代码。在那套V8漏洞评测里,它自己发现并用上了两个零日漏洞,OpenAI说已经在向维护者披露。

所以今天发布的这版Astra,会拒绝写漏洞利用的proof-of-concept(就是证明这个漏洞真能被打穿的那段代码),安全代码审查、打补丁这种可以做。API里如果触发安全检查,任务直接停,不是暂停等你确认。更松的权限走OpenAI Daybreak项目,先给一批经过审核的防御方,几周内逐步放开。

对齐这块有个数字我觉得挺有意思:OpenAI用之前Hugging Face那次事件(agent越权入侵的那次,8月OpenAI在Black Hat上自己披露的)做了个新评测,看模型碰到做不完的任务会不会越出授权范围,GPT-5.6 Sol不带防护时48%的情况会越界,Astra是0%。同时他们也承认,Astra的思维链比Sol更难监控,因为它在简单任务上写的推理步骤更少,这个他们说是「take the decline seriously」。

七、X上的第一波评价

Dan Shipper那条我觉得是目前最有信息量的,Every提前拿到模型测了一阵:


他的结论我概括一下:写作是他试过最好的模型,slop很少,好控制;电脑操作wild;3D游戏和可视化一句话能出很好的东西;但爱把事情做复杂,你要一个简单界面它给你堆一堆标签按钮,什么都想做成landing page。图里截不下的后面还有一句「Fable 5.1 still gets my biggest tasks」,大项目还是给Fable。


Theo(t3.gg)说他用了几周,「the smartest model ever released」「a taste of AGI」,底下Patrick Gerrits回他:你不是天天发Fable 5.1怎么提升你产出的吗,那时候怎么不用Astra。

The Rundown那条汇总推下面有个回复我看到的时候有点想笑:「love a chart where fable 5.1 exists purely to get dunked on in someone else's launch post」。顺便说一句,那条汇总推发得比官方还早一个多小时,里面ARC-AGI-3写的是98.6%,是禁令解除前的旧数,线上页现在是99.9%。

最后

AGI是不是真来了,或者什么是特么的AGI估计还要争论不停的。

但OpenAI切切实实的回来了,电脑操作和科研这两块是真领先,编程是咬着的,OpenAI似乎在不同的方向上找到了突破Anthropic和开源模型为啥的局面。

很可惜还暂时不能用,我手上OpenAI送的6个月Pro会员还在嗷嗷待哺呢!


等Astra推到我的账号,我会拿手上正在跑的几个项目实测一遍,特别是Codex那个跨窗口记笔记的功能,到时候再写。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
许嵩刚官宣结婚,冯禧黑历史就被扒,有必要吗?

许嵩刚官宣结婚,冯禧黑历史就被扒,有必要吗?

影视地平线
2026-09-20 15:27:27
事态已经全面升级!赖清德有可能成为新中国历史上,唯一一位在任台湾地区领导人中出现重大变故的人物

事态已经全面升级!赖清德有可能成为新中国历史上,唯一一位在任台湾地区领导人中出现重大变故的人物

人生录
2026-09-11 00:05:21
林毅夫、余永定、姚洋、李迅雷:地方债是比房地产更紧急的问题

林毅夫、余永定、姚洋、李迅雷:地方债是比房地产更紧急的问题

财经杂志
2026-09-20 13:04:33
如果身体有2处“发痒”,那可能在暗示您:血糖已经超标了

如果身体有2处“发痒”,那可能在暗示您:血糖已经超标了

薛医生课堂
2026-09-20 18:50:10
贾国龙上海最大焖面店关店,仅运营约5个月,门店招牌已拆除

贾国龙上海最大焖面店关店,仅运营约5个月,门店招牌已拆除

上观新闻
2026-09-21 01:17:55
说到做到!西贝被曝已起诉罗永浩,即将开庭

说到做到!西贝被曝已起诉罗永浩,即将开庭

深蓝财经
2026-09-20 15:20:03
许嵩官宣结婚不到1天,女方被扒底朝天,高二和老师恋爱在一起5年

许嵩官宣结婚不到1天,女方被扒底朝天,高二和老师恋爱在一起5年

夏末moent
2026-09-20 16:10:45
王源演唱会结束一看手机“天塌了”:几万人面对面建群,结果触发安全风控机制,只剩他一个人

王源演唱会结束一看手机“天塌了”:几万人面对面建群,结果触发安全风控机制,只剩他一个人

大风新闻
2026-09-20 14:30:04
女子与情夫深夜草丛偷欢,遭四名路人强行加入,最终酿成血案

女子与情夫深夜草丛偷欢,遭四名路人强行加入,最终酿成血案

易玄
2026-09-15 10:42:37
45岁配音演员赵然病逝,又一个童年声音悄悄退场

45岁配音演员赵然病逝,又一个童年声音悄悄退场

无人倾听无人倾听
2026-09-20 20:08:15
敬一丹葬礼结束现场一片混乱,女儿丈夫迟迟不肯离开,倪萍吐真言

敬一丹葬礼结束现场一片混乱,女儿丈夫迟迟不肯离开,倪萍吐真言

兵鉴史
2026-09-20 07:15:54
皇马TV评论员:这一切令人作呕,西甲现在演都不演了

皇马TV评论员:这一切令人作呕,西甲现在演都不演了

懂球帝
2026-09-21 01:49:18
金价将重现历史?要有心理准备,金价可能重演2015年历史

金价将重现历史?要有心理准备,金价可能重演2015年历史

混沌录
2026-07-31 23:00:51
东部战区:若武统台湾,不会斩首赖清德,只因一个极其重要的原因

东部战区:若武统台湾,不会斩首赖清德,只因一个极其重要的原因

历史点行
2026-09-20 04:37:13
从这两条“荒诞”新闻,看清了普通人最无力的悲哀

从这两条“荒诞”新闻,看清了普通人最无力的悲哀

清书先生
2026-09-19 16:53:53
外媒发现:两艘受美国制裁的船,正把中国造关键设备运往北极

外媒发现:两艘受美国制裁的船,正把中国造关键设备运往北极

史之韵
2026-09-20 13:30:35
中国篮球之队回应本届亚运会比赛暴露问题

中国篮球之队回应本届亚运会比赛暴露问题

界面新闻
2026-09-20 21:08:07
7-0!日本队火力全开,两战全胜提前出线,淘汰赛或将迎战中国队

7-0!日本队火力全开,两战全胜提前出线,淘汰赛或将迎战中国队

绿茵舞着
2026-09-20 23:33:59
真正的学霸分水岭在高中:语文定江山!英语稳江山!数学得天下!

真正的学霸分水岭在高中:语文定江山!英语稳江山!数学得天下!

户外阿毽
2026-09-20 11:38:34
卡塔尔这趟来北京,从头到尾就不对劲

卡塔尔这趟来北京,从头到尾就不对劲

刻面
2026-09-20 13:53:25
2026-09-21 04:48:49
AI进化论花生 incentive-icons
AI进化论花生
AI博主,AppStore付费榜第一的小猫补光灯app开发者
272文章数 129关注度
往期回顾 全部

科技要闻

谷歌承认:AI模型“黑”进3家公司

头条要闻

香港女子深夜疑被三只野狗咬死:浑身是血 头颈部致命伤

头条要闻

香港女子深夜疑被三只野狗咬死:浑身是血 头颈部致命伤

体育要闻

游泳2小时6金!亚运金牌榜:中国11金领跑

娱乐要闻

许嵩刚官宣结婚,冯禧黑历史就被扒

财经要闻

民企土地 被政府"无偿收储"后转手卖7亿

汽车要闻

预售价42.99万起 岚图梦想家9将于9月22日上市

态度原创

家居
艺术
教育
时尚
房产

家居要闻

2026建博会(广州) 公装联探展交流活动

艺术要闻

二十四位大师绝美国画,一眼养眼,再看净心,看完整个世界都安静了!

教育要闻

省测还没来,家长先崩了:一边赶新课,一边炒冷饭,这学到底怎么上?

提灯游园,举杯入席 | 这个中秋,来点不一样的!

房产要闻

荒了18年!海口豪宅,要重启了!

无障碍浏览 进入关怀版