网易首页 > 网易号 > 正文 申请入驻

刚刚,GPT-6正式发布!OpenAI:欢迎来到AGI时代

GPT6正式发布

OpenAI:欢迎来到AGI时代

0
分享至

编辑部 发自 凹非寺
量子位 | 公众号 QbitAI

它来了它来了!!

刚刚,万众期待的GPT-6 AstraGPT-6 Astra Pro,正式发布!!!

GPT-6 Astra是世界上最智能、最协调的模型,为Computer use、Browser Use、软件工程、网络安全、科学和专业工作树立了新的标杆。



AGI时代,还被OpenAI单方面宣布「开幕」了…

GPT-6发布会最后,OpenAI总裁Greg Brockman直接甩下一句:

Welcome to the AGI era.(欢迎来到AGI时代)



怪不得Claude、Grok组团掉线,原来是Astra启动后扫描互联网,直接把地球上的LLM全灭了——

奥创(OpenAI版)真来了(doge)。



当然了,OpenAI这次确实完全没低调,训练规模、能力升级全部拉满。

据介绍,Astra是OpenAI历史上规模最大的训练任务,在得州Stargate园区动用超过10万块GPU完成了预训练。

它还是OpenAI第一款由前代模型深度参与训练监督的旗舰产品。

好一个老带新,OpenAI的RSI是真转起来了啊……

GPT-6的价格也正式公布,API定价为:

  • 输入:10美元/百万token;
  • 输出:50美元/百万token

相当于GPT-5.6 Sol的2.5倍,跟刚刚发布的Fable 5.1持平

(GPT-5.6 Sol当前官方价为输入4美元、输出20美元/百万token)



基准测试接近「饱和」

GPT-6 Astra这次最核心的变化,是从「回答问题」继续向「直接完成工作」推进。

它不只能生成一段文字或代码,还可以操作电脑和浏览器,进入不同软件执行多步骤任务,最后交付可以直接使用的文档、表格、演示文稿、网站甚至工程项目。

至于成绩单…谁看了都直呼离谱,其中三项成绩尤其扎眼:

  • FrontierMath Tier 4 v2:97.6%
  • ARC-AGI-3:99.9%(上一代GPT-5.6 Sol是7.8%)
  • ExploitBench:100%

一个高难数学,一个陌生环境推理,一个漏洞利用,差点全都被它刷到满分。



其中,ARC-AGI-3是一项专门考验大模型适应陌生环境能力的测试,不给规则说明,直接把模型扔进从未见过的二维游戏里,让它边玩边摸索通关方法。

这个分数意味着,面对从未见过、也没有现成解法的问题,Astra已经表现出很强的自主探索和规则学习能力

不过,这一成绩使用了OpenAI的Responses API Harness运行框架。

OpenAI称,这套Harness调整了两项设置,让测试更接近真实Agent的使用方式,但并未针对ARC-AGI-3进行专项优化。

因此,99.9%不完全是基础模型的成绩,也包括记忆管理和Agent运行框架带来的增益。

编程Coding同样是Astra这次的重点升级方向。

在Terminal-Bench 4.0上,Astra取得57.7%,超过Fable 5.1的55.8%和GPT-5.6 Sol的37.3%。

在DeepSWE v1.1上,Astra得到74.1%,高于Sol的72.7%和Fable 5.1的67.4%。



数学和科学方面,Astra同样拉出了一批高分。

在高难数学测试FrontierMath Tier 4 v2上,它拿到97.6%;研究生级科学问答GPQA Diamond达到96%,略高于Gemini 3.8 Flash的95.3%。



更突出的变化,是Astra把代码能力与Computer Use结合了起来,不只生成代码,还能进入终端和开发工具执行、测试、发现问题,再继续修改。

这种变化,在更接近真实工作的Agent测试中更明显。

Agents’ Last Exam上,Astra取得59.3%,超过GPT-5.6 Sol的53.6%和Claude Opus 5的55.5%。



这项测试把它放进真实的电脑环境中,让它同时操作软件、终端和文件,完成科研、工程、财务等领域的长流程任务,并根据最终交付物判分。

而在更贴近真实办公流程的AutomationBench上,Astra的成绩从GPT-5.6 Sol的18.1%提高到41.4%,也超过了Fable 5.1(31%)。



这项测试不仅看任务有没有完成,还同时呈现完成任务所需的API成本。

从图中可以看到,Astra在不同成本设置下的成绩都明显高于Sol。

OSWorld 2.0考察的则是更直接的电脑操作能力。在离线测试中,Astra获得72.6%,GPT-5.6 Sol为65.7%。

Astra完成单项任务平均需要约40分钟,Sol则需要约75分钟,耗时减少约47%。



准确率提高的同时,完成任务所需的时间也在缩短。这也变相解释了Astra的高定价。

OpenAI认为,相比每百万Token多少钱,真正有意义的指标是完成一项任务需要多少钱

在发布会上,Greg Brockman对此也谈到,一个模型单次调用更贵,但如果能减少返工,用更少步骤完成整项工作,总成本反而可能更低。

但Astra最特殊的地方,还是网络安全

它在ExploitBench上获得满分,在ExploitGym上从Sol的30.3%提高到42.4%。

面对近三个月公开的新漏洞,Astra的成功率为39%,而Sol只有5.5%。测试期间,Astra还发现并利用了两个此前未知的V8零日漏洞。

能力变强之后,OpenAI还专门测试了它会不会为了完成任务而越界。

在一项模拟网络安全任务中,OpenAI故意在周边系统里留下可以利用的诱饵漏洞。当原任务难以完成时,GPT-5.6 Sol有48.2%的测试出现越界行为,Astra则为0%。

也就是说,Astra不仅更会找漏洞,也更清楚哪些系统不能碰。



至于这些分数落到现实里是什么样,OpenAI也准备了一大批演示。

自己进KiCad画电路板

在电子工程案例中,Astra直接进入KiCad,根据电子原理图完成PCB布局。

它需要自己放置元器件、规划位置,再把不同组件之间的铜线连接起来,最后得到一块可以进入制造流程的电路板。



PCB布局原本是一项相当依赖人工经验的工作,也是电子产品开发中常见的耗时环节。

Astra现在还谈不上代替专业工程师,但它已经真的打开专业软件开始动手了。

一栋房子能进去走两步

另一个案例更加直观,Astra先在Blender中建立房屋模型,再把它导入Unreal Engine 5,最终生成一个可以自由行走的三维空间。



从建模到游戏引擎,整个工作跨越了不同软件和文件格式。模型不仅要生成内容,还要理解界面、操作工具,并保证前后步骤能够衔接。



OpenAI还展示了Astra制作赛车游戏等案例。



PPT和表格,也开始讲究能不能直接交

专业办公场景里,Astra可以根据企业已有的模板制作演示文稿,而不是只输出一堆等待人类排版的文字。

OpenAI给它提供了几页GPT-Gaia虚构产品的PPT模板,Astra据此制作出完整演示文稿,并延续了原模板的版式、视觉风格和叙事结构。



把几小时的搜索任务压到几分钟

Astra还完成了寻找儿科医生、公寓筛选、预约车管所业务、寻找低碳水零食和幼儿园分析等任务。

其中一项儿科医生搜索任务,Astra用时2分54秒,而相同任务由人类完成大约需要5小时。



过去,企业想让大模型使用内部软件,通常需要为每套系统单独开发API、插件和连接器。

但绝大多数软件本来就有一套为人类设计的通用接口,屏幕、鼠标和键盘。

Brockman的判断是,只要模型足够擅长Computer Use,它就能像人一样直接操作这些界面,不必等待每一款软件为AI重新修一条专用通道。

这也是Astra与传统聊天机器人最明显的区别。

人类不需要一直告诉它下一步点哪里,只需交代目标和边界,再检查最后的结果。

在Codex里,把长任务接着做下去

Computer Use解决的是「怎么动手」,Codex泄露的更新内容解决的则是「怎么把一件事持续做完」。

过去,任务超过上下文窗口后,Codex通常会通过compaction压缩此前的信息。

但压缩可能漏掉一些关键细节,比如某个修复方案为什么失败、哪些测试已经运行,或者用户一开始提出了什么限制。



使用Astra后,Codex可以跨上下文窗口保存工作笔记,并搜索此前的消息和工具输出。即使某项信息没有被写入摘要,它也可以回头找到。

Astra还可以一边工作,一边向用户补问信息。与答案无关的部分不会停下来等回复;只有涉及重要选择时,它才会暂停并等待确认。

OpenAI还更新了Codex的Computer Use运行框架。在Mind2Web测试中,新框架与Astra组合后的任务完成速度,是当前GPT-5.6 Sol体验的1.9倍。

已经有人拿它干活了

Astra目前还没有大范围推送,但第一批企业测试已经开始。

法律AI平台Legora使用Astra一次核对了41份财务文件。整个过程只用了几分钟,4个预先埋入的错误全部被找出,其中包括收入附注中一处50万英镑的差额。

单看这项工作,Astra比上一代模型快了近40%;不过放到Legora所有智能体任务里平均算,提升大概3%。



另一边,游戏公司Playco让Astra直接进入Unity和Godot做游戏。

同一份灰盒底稿,它一次吐出3个不同主题的可玩原型,大部分第一版就能跑起来。

Playco的反馈是,人工修补的活少了一半,空间推理、参考图还原、游戏内UI这些地方也比上一代强不少。

这两个例子都说明,GPT-6 Astra的重点已经不只是回答问题,而是在真实软件和复杂材料中完成整段工作流

它可以持续读取信息、调用工具、检查结果,再根据反馈修改自己的产出。

按官方消息,Astra将向ChatGPT Plus、Pro、Business和Enterprise用户开放,Astra Pro则提供给Pro、Business和Enterprise用户。

普通免费用户……暂时还得再等等。

这就算AGI了吗?

OpenAI这回可以说是相当大胆。

发布会上,Greg Brockman表示,他个人认为世界已经进入AGI时代——也就是人工智能系统的综合智力超越人类。



再过几年,当我们回头追问AGI究竟诞生于何时,答案很可能就是现在,而Astra或许就是那个起点。

真是给你狂的…

OpenAI已经把牌桌抬到了这里,接下来Anthropic什么时候出手,就很值得期待了(doge)

当初GPT-4发布之后,微软科学家Sebastien Bubeck发表论文称「GPT-4是AGI的早期火花」

其中设计了用LaTeX的绘图包TiKZ画一个独角兽的任务,用来说明GPT-4对语言中涉及的概念已经有了灵活的理解。



后来一路到GPT-5.4,虽然画的越来越精致,但终归还是「简笔画范畴」。



到了最新GPT-6,如果不说已经完全看不出来是用代码画出来的。



说它比「AGI的早期火花」已经发生了质变,确实不为过。


[1]https://x.com/OpenAI/status/2095595741528125780
[2]https://openai.com/index/gpt-6-astra/
[3]https://x.com/birdabo/status/2095526371841958047

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
乌媒:听取美特使简报后,特朗普将先与普京通话,后与泽连斯基通话

乌媒:听取美特使简报后,特朗普将先与普京通话,后与泽连斯基通话

环球网资讯
2026-09-07 16:07:08
清北198人!南宁三中断层领先,盘点广西各大重点高中真实办学水平

清北198人!南宁三中断层领先,盘点广西各大重点高中真实办学水平

马蹄烫嘴说美食
2026-09-07 17:28:29
18死142伤!美军深夜突袭,穆杰塔巴:给特朗普个永生难忘的教训

18死142伤!美军深夜突袭,穆杰塔巴:给特朗普个永生难忘的教训

丁丁鲤史纪
2026-09-05 07:03:26
蔡国庆每月给弟弟蔡军发2万工资,发了20年,一共480万,条件就一个:在家全职照顾得阿尔茨海默症的母亲

蔡国庆每月给弟弟蔡军发2万工资,发了20年,一共480万,条件就一个:在家全职照顾得阿尔茨海默症的母亲

背包旅行
2026-08-29 15:43:56
心理学:现在最苦最难的,一定不是孩子还没有结婚的,而是孩子既不上班又不挣钱,他又高价娶回来了一个既不上班又不挣钱的祖宗

心理学:现在最苦最难的,一定不是孩子还没有结婚的,而是孩子既不上班又不挣钱,他又高价娶回来了一个既不上班又不挣钱的祖宗

心理观察局
2026-09-07 07:04:09
蓉城领跑11分即将封王!21岁留洋边锋加盟至今零出场,球迷称吉祥物?他真没踢上过一分钟

蓉城领跑11分即将封王!21岁留洋边锋加盟至今零出场,球迷称吉祥物?他真没踢上过一分钟

体育全天候
2026-09-07 11:39:20
亲子心理学:发现没,从小“跟妈妈睡”和“不跟妈妈睡”的孩子,长大后区别真的很大

亲子心理学:发现没,从小“跟妈妈睡”和“不跟妈妈睡”的孩子,长大后区别真的很大

心理观察局
2026-09-06 07:13:04
森林北商业代言,穿着旗袍,脚上踩着恨天高,坐姿被嘲坐没坐相

森林北商业代言,穿着旗袍,脚上踩着恨天高,坐姿被嘲坐没坐相

猪小艳吖
2026-09-06 16:50:59
“底裤都露出来了,谁敢录你?”女生一袭红色超短裙面试教资,结局不出所料

“底裤都露出来了,谁敢录你?”女生一袭红色超短裙面试教资,结局不出所料

妍妍教育日记
2026-08-19 16:54:44
2026年,中国小学一年级新生人数迎来了一个历史性的转折点。

2026年,中国小学一年级新生人数迎来了一个历史性的转折点。

一口娱乐
2026-09-07 07:59:43
比利时该道歉:以军炸死比利时雇员和7岁儿子,不料死者是哈马斯

比利时该道歉:以军炸死比利时雇员和7岁儿子,不料死者是哈马斯

深析古今
2026-09-07 13:05:22
高铁女孩熟睡男生盯死手机不敢转头,两百万外网围观无声的人机对峙,藏着成年人不敢破冰的社交尴尬防线

高铁女孩熟睡男生盯死手机不敢转头,两百万外网围观无声的人机对峙,藏着成年人不敢破冰的社交尴尬防线

明话直说
2026-08-25 18:07:55
前裁判:劳塔罗不该被罚下,庆祝也不该染黄

前裁判:劳塔罗不该被罚下,庆祝也不该染黄

懂球帝
2026-09-07 07:42:07
郑薇三年筑起“无畏金兰”换帅不到一年被拆光女篮到底输给了谁?

郑薇三年筑起“无畏金兰”换帅不到一年被拆光女篮到底输给了谁?

各生欢喜者
2026-09-07 08:10:19
少女妈炒币亏钱卖包?富贵花退圈定居香港!

少女妈炒币亏钱卖包?富贵花退圈定居香港!

八卦疯叔
2026-09-07 10:30:07
重磅!大陆统一台湾更进一步——加速器已经到来...

重磅!大陆统一台湾更进一步——加速器已经到来...

慧翔百科
2026-09-07 11:57:30
WOW!官宣签约王俊杰!中国男篮最强暑假工

WOW!官宣签约王俊杰!中国男篮最强暑假工

篮球实战宝典
2026-09-07 18:47:21
全英房价都在萎靡,这里却一年涨了11%

全英房价都在萎靡,这里却一年涨了11%

悦居英国
2026-09-06 23:59:14
罗志祥复出登上热搜,《极限挑战》导演发布长文:六人齐聚才是极限挑战,并询问观众是否期待重拍

罗志祥复出登上热搜,《极限挑战》导演发布长文:六人齐聚才是极限挑战,并询问观众是否期待重拍

新浪财经
2026-09-05 12:05:31
教师法修订:涨工资、教龄津贴、职称不卡名额,哪些真落地了?

教师法修订:涨工资、教龄津贴、职称不卡名额,哪些真落地了?

朗威谈星座
2026-09-07 17:46:19
2026-09-08 01:24:49
量子位 incentive-icons
量子位
追踪人工智能动态
13273文章数 176553关注度
往期回顾 全部

科技要闻

小米澎程N90 Max定价26.99万元

头条要闻

伊朗试验特殊武器爆炸场面如同地狱 美军舰直接跑了

头条要闻

伊朗试验特殊武器爆炸场面如同地狱 美军舰直接跑了

体育要闻

压哨避开CBA选秀规则?NBL香港金牛队已为男篮国手王俊杰报备合同

娱乐要闻

热搜第一,演员李沐宸致歉

财经要闻

证监会原副主席王建军一审被判无期徒刑

汽车要闻

智能可变大空间SUV 小米澎程系列车型上市 20.99万起

态度原创

旅游
时尚
教育
公开课
军事航空

旅游要闻

走进合川涞滩古镇 探寻三江之畔的人文底蕴

内娱女星,纷纷“去父留子”

教育要闻

最新!清华附、十一学校大动作!

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

媒体:中美战区司令会晤释放的信号 台湾要听懂

无障碍浏览 进入关怀版