网易首页 > 网易号 > 正文 申请入驻

刚刚,GPT-6正式发布!OpenAI:欢迎来到AGI时代

0
分享至

编辑部 发自 凹非寺
量子位 | 公众号 QbitAI

它来了它来了!!

刚刚,万众期待的GPT-6 AstraGPT-6 Astra Pro,正式发布!!!

GPT-6 Astra是世界上最智能、最协调的模型,为Computer use、Browser Use、软件工程、网络安全、科学和专业工作树立了新的标杆。



AGI时代,还被OpenAI单方面宣布「开幕」了…

GPT-6发布会最后,OpenAI总裁Greg Brockman直接甩下一句:

Welcome to the AGI era.(欢迎来到AGI时代)



怪不得Claude、Grok组团掉线,原来是Astra启动后扫描互联网,直接把地球上的LLM全灭了——

奥创(OpenAI版)真来了(doge)。



当然了,OpenAI这次确实完全没低调,训练规模、能力升级全部拉满。

据介绍,Astra是OpenAI历史上规模最大的训练任务,在得州Stargate园区动用超过10万块GPU完成了预训练。

它还是OpenAI第一款由前代模型深度参与训练监督的旗舰产品。

好一个老带新,OpenAI的RSI是真转起来了啊……

GPT-6的价格也正式公布,API定价为:

  • 输入:10美元/百万token;
  • 输出:50美元/百万token

相当于GPT-5.6 Sol的2.5倍,跟刚刚发布的Fable 5.1持平

(GPT-5.6 Sol当前官方价为输入4美元、输出20美元/百万token)



基准测试接近「饱和」

GPT-6 Astra这次最核心的变化,是从「回答问题」继续向「直接完成工作」推进。

它不只能生成一段文字或代码,还可以操作电脑和浏览器,进入不同软件执行多步骤任务,最后交付可以直接使用的文档、表格、演示文稿、网站甚至工程项目。

至于成绩单…谁看了都直呼离谱,其中三项成绩尤其扎眼:

  • FrontierMath Tier 4 v2:97.6%
  • ARC-AGI-3:99.9%(上一代GPT-5.6 Sol是7.8%)
  • ExploitBench:100%

一个高难数学,一个陌生环境推理,一个漏洞利用,差点全都被它刷到满分。



其中,ARC-AGI-3是一项专门考验大模型适应陌生环境能力的测试,不给规则说明,直接把模型扔进从未见过的二维游戏里,让它边玩边摸索通关方法。

这个分数意味着,面对从未见过、也没有现成解法的问题,Astra已经表现出很强的自主探索和规则学习能力

不过,这一成绩使用了OpenAI的Responses API Harness运行框架。

OpenAI称,这套Harness调整了两项设置,让测试更接近真实Agent的使用方式,但并未针对ARC-AGI-3进行专项优化。

因此,99.9%不完全是基础模型的成绩,也包括记忆管理和Agent运行框架带来的增益。

编程Coding同样是Astra这次的重点升级方向。

在Terminal-Bench 4.0上,Astra取得57.7%,超过Fable 5.1的55.8%和GPT-5.6 Sol的37.3%。

在DeepSWE v1.1上,Astra得到74.1%,高于Sol的72.7%和Fable 5.1的67.4%。



数学和科学方面,Astra同样拉出了一批高分。

在高难数学测试FrontierMath Tier 4 v2上,它拿到97.6%;研究生级科学问答GPQA Diamond达到96%,略高于Gemini 3.8 Flash的95.3%。



更突出的变化,是Astra把代码能力与Computer Use结合了起来,不只生成代码,还能进入终端和开发工具执行、测试、发现问题,再继续修改。

这种变化,在更接近真实工作的Agent测试中更明显。

Agents’ Last Exam上,Astra取得59.3%,超过GPT-5.6 Sol的53.6%和Claude Opus 5的55.5%。



这项测试把它放进真实的电脑环境中,让它同时操作软件、终端和文件,完成科研、工程、财务等领域的长流程任务,并根据最终交付物判分。

而在更贴近真实办公流程的AutomationBench上,Astra的成绩从GPT-5.6 Sol的18.1%提高到41.4%,也超过了Fable 5.1(31%)。



这项测试不仅看任务有没有完成,还同时呈现完成任务所需的API成本。

从图中可以看到,Astra在不同成本设置下的成绩都明显高于Sol。

OSWorld 2.0考察的则是更直接的电脑操作能力。在离线测试中,Astra获得72.6%,GPT-5.6 Sol为65.7%。

Astra完成单项任务平均需要约40分钟,Sol则需要约75分钟,耗时减少约47%。



准确率提高的同时,完成任务所需的时间也在缩短。这也变相解释了Astra的高定价。

OpenAI认为,相比每百万Token多少钱,真正有意义的指标是完成一项任务需要多少钱

在发布会上,Greg Brockman对此也谈到,一个模型单次调用更贵,但如果能减少返工,用更少步骤完成整项工作,总成本反而可能更低。

但Astra最特殊的地方,还是网络安全

它在ExploitBench上获得满分,在ExploitGym上从Sol的30.3%提高到42.4%。

面对近三个月公开的新漏洞,Astra的成功率为39%,而Sol只有5.5%。测试期间,Astra还发现并利用了两个此前未知的V8零日漏洞。

能力变强之后,OpenAI还专门测试了它会不会为了完成任务而越界。

在一项模拟网络安全任务中,OpenAI故意在周边系统里留下可以利用的诱饵漏洞。当原任务难以完成时,GPT-5.6 Sol有48.2%的测试出现越界行为,Astra则为0%。

也就是说,Astra不仅更会找漏洞,也更清楚哪些系统不能碰。



至于这些分数落到现实里是什么样,OpenAI也准备了一大批演示。

自己进KiCad画电路板

在电子工程案例中,Astra直接进入KiCad,根据电子原理图完成PCB布局。

它需要自己放置元器件、规划位置,再把不同组件之间的铜线连接起来,最后得到一块可以进入制造流程的电路板。



PCB布局原本是一项相当依赖人工经验的工作,也是电子产品开发中常见的耗时环节。

Astra现在还谈不上代替专业工程师,但它已经真的打开专业软件开始动手了。

一栋房子能进去走两步

另一个案例更加直观,Astra先在Blender中建立房屋模型,再把它导入Unreal Engine 5,最终生成一个可以自由行走的三维空间。



从建模到游戏引擎,整个工作跨越了不同软件和文件格式。模型不仅要生成内容,还要理解界面、操作工具,并保证前后步骤能够衔接。



OpenAI还展示了Astra制作赛车游戏等案例。



PPT和表格,也开始讲究能不能直接交

专业办公场景里,Astra可以根据企业已有的模板制作演示文稿,而不是只输出一堆等待人类排版的文字。

OpenAI给它提供了几页GPT-Gaia虚构产品的PPT模板,Astra据此制作出完整演示文稿,并延续了原模板的版式、视觉风格和叙事结构。



把几小时的搜索任务压到几分钟

Astra还完成了寻找儿科医生、公寓筛选、预约车管所业务、寻找低碳水零食和幼儿园分析等任务。

其中一项儿科医生搜索任务,Astra用时2分54秒,而相同任务由人类完成大约需要5小时。



过去,企业想让大模型使用内部软件,通常需要为每套系统单独开发API、插件和连接器。

但绝大多数软件本来就有一套为人类设计的通用接口,屏幕、鼠标和键盘。

Brockman的判断是,只要模型足够擅长Computer Use,它就能像人一样直接操作这些界面,不必等待每一款软件为AI重新修一条专用通道。

这也是Astra与传统聊天机器人最明显的区别。

人类不需要一直告诉它下一步点哪里,只需交代目标和边界,再检查最后的结果。

在Codex里,把长任务接着做下去

Computer Use解决的是「怎么动手」,Codex泄露的更新内容解决的则是「怎么把一件事持续做完」。

过去,任务超过上下文窗口后,Codex通常会通过compaction压缩此前的信息。

但压缩可能漏掉一些关键细节,比如某个修复方案为什么失败、哪些测试已经运行,或者用户一开始提出了什么限制。



使用Astra后,Codex可以跨上下文窗口保存工作笔记,并搜索此前的消息和工具输出。即使某项信息没有被写入摘要,它也可以回头找到。

Astra还可以一边工作,一边向用户补问信息。与答案无关的部分不会停下来等回复;只有涉及重要选择时,它才会暂停并等待确认。

OpenAI还更新了Codex的Computer Use运行框架。在Mind2Web测试中,新框架与Astra组合后的任务完成速度,是当前GPT-5.6 Sol体验的1.9倍。

已经有人拿它干活了

Astra目前还没有大范围推送,但第一批企业测试已经开始。

法律AI平台Legora使用Astra一次核对了41份财务文件。整个过程只用了几分钟,4个预先埋入的错误全部被找出,其中包括收入附注中一处50万英镑的差额。

单看这项工作,Astra比上一代模型快了近40%;不过放到Legora所有智能体任务里平均算,提升大概3%。



另一边,游戏公司Playco让Astra直接进入Unity和Godot做游戏。

同一份灰盒底稿,它一次吐出3个不同主题的可玩原型,大部分第一版就能跑起来。

Playco的反馈是,人工修补的活少了一半,空间推理、参考图还原、游戏内UI这些地方也比上一代强不少。

这两个例子都说明,GPT-6 Astra的重点已经不只是回答问题,而是在真实软件和复杂材料中完成整段工作流

它可以持续读取信息、调用工具、检查结果,再根据反馈修改自己的产出。

按官方消息,Astra将向ChatGPT Plus、Pro、Business和Enterprise用户开放,Astra Pro则提供给Pro、Business和Enterprise用户。

普通免费用户……暂时还得再等等。

这就算AGI了吗?

OpenAI这回可以说是相当大胆。

发布会上,Greg Brockman表示,他个人认为世界已经进入AGI时代——也就是人工智能系统的综合智力超越人类。



再过几年,当我们回头追问AGI究竟诞生于何时,答案很可能就是现在,而Astra或许就是那个起点。

真是给你狂的…

OpenAI已经把牌桌抬到了这里,接下来Anthropic什么时候出手,就很值得期待了(doge)

当初GPT-4发布之后,微软科学家Sebastien Bubeck发表论文称「GPT-4是AGI的早期火花」

其中设计了用LaTeX的绘图包TiKZ画一个独角兽的任务,用来说明GPT-4对语言中涉及的概念已经有了灵活的理解。



后来一路到GPT-5.4,虽然画的越来越精致,但终归还是「简笔画范畴」。



到了最新GPT-6,如果不说已经完全看不出来是用代码画出来的。



说它比「AGI的早期火花」已经发生了质变,确实不为过。


[1]https://x.com/OpenAI/status/2095595741528125780
[2]https://openai.com/index/gpt-6-astra/
[3]https://x.com/birdabo/status/2095526371841958047

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
阿莫林:沿用下半场的阵容?马后炮很容易,但是不能粗暴照搬

阿莫林:沿用下半场的阵容?马后炮很容易,但是不能粗暴照搬

懂球帝
2026-09-13 04:09:19
“10岁就有九个洞了!”小学女孩早熟视频火了,中学生都看不下去

“10岁就有九个洞了!”小学女孩早熟视频火了,中学生都看不下去

妍妍教育日记
2026-09-11 15:24:51
统派齐聚新疆,洪秀柱发声,邱毅发声,新党发声,将黄智贤一军

统派齐聚新疆,洪秀柱发声,邱毅发声,新党发声,将黄智贤一军

DS北风
2026-09-12 10:46:23
苹果高管回应为何现在加入折叠屏大战 还锐评一番竞品

苹果高管回应为何现在加入折叠屏大战 还锐评一番竞品

财联社
2026-09-11 20:35:13
F1西班牙站:0.011秒绝杀!诺里斯惊险夺杆,安东内利功亏一篑

F1西班牙站:0.011秒绝杀!诺里斯惊险夺杆,安东内利功亏一篑

体育妞世界
2026-09-12 23:38:45
笑不活了!张雪4小时精剪出锅盖头,全网吐槽到不敢开店,店老板出面求放过:造型没做完

笑不活了!张雪4小时精剪出锅盖头,全网吐槽到不敢开店,店老板出面求放过:造型没做完

火山詩话
2026-09-11 07:44:08
雷军现身苏超赛场观战徐州vs苏州,白天为当地车主交车

雷军现身苏超赛场观战徐州vs苏州,白天为当地车主交车

懂球帝
2026-09-12 20:20:23
石榴开始上市!研究发现:吃得越多,糖尿病患者血管或越干净?

石榴开始上市!研究发现:吃得越多,糖尿病患者血管或越干净?

老马健康讲坛
2026-09-13 05:05:03
生活在日本的穆斯林女人哭诉:为什么日本不能像中国那样迁就我们

生活在日本的穆斯林女人哭诉:为什么日本不能像中国那样迁就我们

步论天下事
2026-09-11 14:48:05
阿根廷新10号横空出世!打破梅西纪录,或将成为下一位阿根廷球王

阿根廷新10号横空出世!打破梅西纪录,或将成为下一位阿根廷球王

泥说体育
2026-09-12 22:59:37
上海“干婚”夫妻日渐增多,开始向全国扩散,说出来实在太扎心了

上海“干婚”夫妻日渐增多,开始向全国扩散,说出来实在太扎心了

新时代的两性情感
2026-09-13 00:26:55
9月12日2026年北京上调退休人员基本养老金通知并未正式公布

9月12日2026年北京上调退休人员基本养老金通知并未正式公布

李博世财经
2026-09-12 12:19:17
山西一镇政府公职人员醉驾致一对五旬夫妻身亡,死者家属申请复核:明明对方醉驾且不开灯又超速行驶,为何让我父母承担事故次要责任

山西一镇政府公职人员醉驾致一对五旬夫妻身亡,死者家属申请复核:明明对方醉驾且不开灯又超速行驶,为何让我父母承担事故次要责任

大风新闻
2026-09-12 16:24:04
拆解苹果折叠屏iPhone Duo,大半都是中国造?富士康组装,台积电芯片,结构件、电路板等都来自中企!屏幕、存储则来自三星、SK海力士等

拆解苹果折叠屏iPhone Duo,大半都是中国造?富士康组装,台积电芯片,结构件、电路板等都来自中企!屏幕、存储则来自三星、SK海力士等

每日经济新闻
2026-09-11 19:46:11
当众拒唱国歌不认中国籍,把两个孩子全送出国,如今报应终于来了

当众拒唱国歌不认中国籍,把两个孩子全送出国,如今报应终于来了

鹤羽说个事
2026-09-02 16:51:59
万斯极有可能当选美国总统!一旦成真,全球大变局,中国首当其冲

万斯极有可能当选美国总统!一旦成真,全球大变局,中国首当其冲

麓谷隐士
2026-09-12 00:05:07
许多中年女人,都不喜欢男人亲她的嘴,到底为什么?

许多中年女人,都不喜欢男人亲她的嘴,到底为什么?

大熊欢乐坊
2026-08-26 10:17:05
穆里尼奥:球员们配得上我的尊重和掌声

穆里尼奥:球员们配得上我的尊重和掌声

懂球帝
2026-09-13 06:06:31
地狱和天堂如此之近,阿森纳从扑点到进球只相隔121秒

地狱和天堂如此之近,阿森纳从扑点到进球只相隔121秒

懂球帝
2026-09-13 05:28:11
一露毁所有?刘嘉玲宝格丽晚宴翻车,恰恰印证了亦舒那句经典名言

一露毁所有?刘嘉玲宝格丽晚宴翻车,恰恰印证了亦舒那句经典名言

谢葅解说
2026-09-09 17:31:51
2026-09-13 06:40:49
量子位 incentive-icons
量子位
追踪人工智能动态
13300文章数 176559关注度
往期回顾 全部

科技要闻

苹果折叠屏比小米华为贵5000元,该怎么选

头条要闻

男生去年693分考上北大后放弃 今年又拼了一次考714分

头条要闻

男生去年693分考上北大后放弃 今年又拼了一次考714分

体育要闻

乔丹的得分统治力:如何违背篮球规律?

娱乐要闻

钟丽淇疑入ICU?聚会合照早露端倪

财经要闻

继房子茅台后 中产的第3个"神话"破灭了

汽车要闻

全新配色和新样式轮毂 乐道L80星光设计套装限时惊喜价10080元

态度原创

艺术
教育
亲子
健康
军事航空

艺术要闻

大唐名媛的游园图鉴:簪花、薄纱、遛鹤逗犬

教育要闻

就差三分,就能及格了

亲子要闻

快乐萌娃搞笑日常,太逗了

手脚发麻口齿不清?也可能是中风!

军事要闻

胡塞武装:9天攻占5400平方公里

无障碍浏览 进入关怀版