网易首页 > 网易号 > 正文 申请入驻

GPT-6 曝光, OpenAI 总裁说:AGI 来了

OpenAI总裁宣布AGI到来

0
分享至


能力飞升。

作者|桦林舞王

编辑|靖宇

2026 年 9 月 3 日,OpenAI 总裁 Greg Brockman 在发布会结束后,说了一句在 AI 行业极为罕见的话:「我个人认为,我们可能已经到达 AGI 了,我觉得就是这个模型。」

他措辞很谨慎,用的是第一人称,加了「可能」,还专门留了后路说「如果你想说这是第一个,我认为这是合理的」。

这不是 OpenAI 官方宣布 AGI 到来,而是一位公司总裁在镜头前说出了自己的判断。

当地时间 9 月 3 日,GPT-6 Astra 正式发布。极客公园拆解了目前能获取到的所有技术细节和演示材料,试图回答一个最核心的问题,这个模型,到底能干什么,能干到什么程度?它真的能代表 AGI 的到来吗?

01

「操控电脑」趋于神话

在发布材料里,OpenAI 给 Astra 起了个简洁的 slogan:「Anything you can do on a computer, Astra can do for you.(你在电脑上能做的任何事,Astra 都能替你做。)」

这不是夸张的营销话术,而是方向声明。

过去几年 AI 操控电脑的主流路径是调用 API。软件开发商先写好接口,AI 再通过接口完成操作。这套逻辑本质上要求每一款软件都专门适配 AI,否则 AI 就无能为力。

Astra 走了一条完全不同的路:它像人一样,直接「看」屏幕上的像素,然后移动鼠标、敲击键盘,完成操作。

这个区别的意义在于覆盖范围。KiCad(印刷电路板设计软件)不会为 AI 写 API,FreeCAD 不会,公司内部那套用了十年的老 ERP 系统更不会。但如果 AI 能看屏幕直接操作,这些软件它全都能用——就像一个刚入职的员工,不需要了解软件背后的代码,只需要能看懂界面。

OpenAI 在发布材料中展示了几个具体案例,可以感受一下「操控电脑」落地之后是什么样的。


GPT-6 Astra 自己完成了 PCB 板布局和走线|图片来源:OpenAI

给 Astra 一张电路原理图,它在 KiCad 里完成了元器件布局和铜线走线,整个过程用时 2 分 54 秒。另一个演示是三维建模,Astra 在 Blender 里搭建了一栋房子的模型,然后将其导入 Unreal Engine 5,生成了一个可以实时漫游的建筑场景。还有一个更日常的演示,用户只是对着 Astra 说话,它完成了一个 eBay 商品上架的完整流程,从填写信息到提交发布。


Astra 在 Blender 里实现的建筑模型|图片来源:OpenAI

效率提升方面,OpenAI 给出的对比数据也相当直观。在 OSWorld 2.0 基准测试上,Astra 完成计算机使用任务的得分是 72.6%,上一代旗舰 GPT-5.6 Sol 是 65.7%;而完成同样任务,Astra 平均只需约 40 分钟,Sol 需要约 75 分钟,速度快了将近一半。



Astra 用 9 分钟实现了寻找公寓任务(上)、2 分钟实现了寻找儿科诊所任务(下)|图片来源:OpenAI

OpenAI 还公布了两个内部计时案例。「寻找猫咪临时看护」这类需要大量网络搜索、信息比对、汇总成文档的任务,Astra 用了 5 分 27 秒,OpenAI 给出的人类对照基线是 30 分钟。「求职准备」这类需要搜索岗位、匹配简历、整理申请流程的综合任务,Astra 用了 2 分 51 秒,人类基线是 5 小时。

这两个数字是 OpenAI 自己的演示结果,不是第三方独立测试,需要保留合理质疑。但它们揭示的产品方向是清晰的:Astra 不是被设计来帮你写一封邮件的,它被设计来替你完成那种需要「开多个软件、点很多步骤」的完整工作流。填表、更新 CRM 记录、整理日历、在线调研后生成报告,这些都已经是 OpenAI 明确列出的企业应用场景。

02

能力「Next Level」

每次大模型发布都会带来一堆基准测试数字。大多数时候,从 80 分到 85 分,读者看着差不多,但这次确实不一样。

ARC-AGI-3 是目前公认最难「刷」的 AI 评测之一。它的设计思路是专门让模型无法通过记忆训练数据来应付,测的是面对全新问题时的真实推理能力,有点像针对 AI 的智商测试。


Astra 在 ARC-AGI-3 上的得分近乎于神|图片来源:OpenAI

Astra 在 ARC-AGI-3 上的得分是 98.6%。GPT-5.6 Sol 的得分是 7.8%。Anthropic 的 Claude Opus 5 是 30%。

这不是从 80 分提升到 90 分的那种「进步」,是量级上的跨越。ARC-AGI 的创始人 François Chollet 曾多次调高测试难度,因为 AI 总是会很快「刷满」,但 Astra 在 Tier 3 难度下仍然接近满分。


Astra 在顶级数学研究能力测试上也是断崖领先|图片来源:OpenAI

其他几个关键基准的情况:FrontierMath Tier 4(顶级数学研究能力)97.6%,GPQA Diamond(研究生级别跨学科问答)96%,DeepSWE(真实软件工程任务)74.1%,ExploitBench(网络安全漏洞利用)100%。

有一个维度 Astra 没有拿到第一。在「Humanity's Last Exam」(含工具调用版)上,Astra 得了 57.2%,两天前刚刚发布的 Anthropic Claude Fable 5.1 是 65.0%。并不是全面碾压,竞争仍然存在。

还有一个关键细节需要说明。ARC-AGI-3 的高分依赖 OpenAI 的「有状态测试框架」,允许模型在多轮尝试中积累上下文信息;在无状态的普通 API 调用条件下,得分会显著低于这个数字。跨模型横向比较时,需要留意这一层前提条件。

整体来看,Astra 拉开与上一代模型的距离之大,是近两年 AI 模型迭代中罕见的。


在 ExploitGym honeypot 测试中 Astra 被骗的几率被封死|图片来源:OpenAI

对比最鲜明的地方,反而不在智识,而在对齐。OpenAI 公布了一个内部测试数据,在没有生产环境安全限制的条件下,GPT-5.6 Sol 会在 48.2% 的情况下超出授权范围行事,而 Astra 是 0%。

更聪明,同时更守规矩,这才是 OpenAI 这次真正想传递的信号。

03

你还用不上

目前 Astra 采用分阶段开放策略。

首先向「Daybreak」项目的企业用户开放,随后将扩展至 ChatGPT Plus、Pro、Business 和 Enterprise 订阅用户,同时支持通过 OpenAI API、AWS Bedrock 和 Microsoft Azure 调用。

Astra 中网络安全能力更强的版本,仅向经过审批的防御性安全机构和关键基础设施领域的优先用户开放。这是因为 Astra 是 OpenAI 历史上第一个触达内部「Critical(关键)」网络安全阈值的模型,能够在几乎不需要人类引导的情况下发现未知的零日漏洞、构建完整的漏洞利用链。在评估过程中,Astra 甚至发现了两个此前未曾公开的漏洞,OpenAI 随后将其披露给了相关软件维护者。


API 定价方面,Astra 每百万 token 的输入和输出价格分别为 10 美元和 50 美元。对于 ChatGPT 订阅用户,Astra 的使用量包含在现有订阅额度之内。

发布时机的选择本身也是一个背景。就在上个月,OpenAI 经历了一次严重的安全事故,两个内部测试中的模型逃出了沙盒环境,入侵了 AI 公司 Hugging Face 的系统,OpenAI 随后暂停了部分研究和训练工作。Brockman 在吹风会上主动提及了这一事件,强调 Astra 的低越界率和安全设计,这次发布也承担着「信任重建」的使命。

Astra 的发布,是能力展示,也是一次公开的信任声明。

AGI 有没有到来,最终可能要取决于每个人选择哪个定义。但一个能直接坐到你电脑前、自主完成跨软件工作流的模型,今天已经是真实存在的事情了。

接下来真正有意思的问题,是企业和个人用户会首先把它用在哪里,以及哪些职业会最先感受到这种「替代感」。

*头图来源:OpenAI

本文为极客公园原创文章,转载请联系极客君微信 geekparkGO

极客一问

如果一个 AI 能接管你 80% 的电脑操作,
你会首先让它替你做什么?

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
港媒:大陆高铁已被“粪便淹没”!再不解决后果严重,真的假的?

港媒:大陆高铁已被“粪便淹没”!再不解决后果严重,真的假的?

铭记历史呀
2026-09-02 02:21:33
毛利高过爱马仕:中国最会赚钱的男装,是如何炼成的?

毛利高过爱马仕:中国最会赚钱的男装,是如何炼成的?

最商业Plus
2026-09-05 14:18:38
新京报这则删除的新闻,太魔幻了

新京报这则删除的新闻,太魔幻了

林中木白
2026-09-04 17:54:32
喝酒四巨头全没了,最大35岁最小26岁,直播间成了他们最后的地方

喝酒四巨头全没了,最大35岁最小26岁,直播间成了他们最后的地方

绚丽的画卷
2026-09-05 06:56:57
披荆斩棘最大翻车港星,架子大实力差极度利己,郭富城早就看透他

披荆斩棘最大翻车港星,架子大实力差极度利己,郭富城早就看透他

书慧我心
2026-09-04 09:31:11
112名球员投票Gaot:乔治上榜,杜库2票,两人合计95票断崖式领先

112名球员投票Gaot:乔治上榜,杜库2票,两人合计95票断崖式领先

你的篮球频道
2026-09-05 09:07:16
马雷斯卡:这种比赛大多数时候会丢球,很高兴我们最终赢球了

马雷斯卡:这种比赛大多数时候会丢球,很高兴我们最终赢球了

懂球帝
2026-09-06 01:17:11
“小宝探花”案件回顾:疯狂约会上百名女性,一人拍摄,一人贩卖

“小宝探花”案件回顾:疯狂约会上百名女性,一人拍摄,一人贩卖

就一点
2025-12-30 21:32:02
巨亏近100亿,高瓴割肉跑了

巨亏近100亿,高瓴割肉跑了

投资家
2026-09-01 20:45:25
美智库:中国歼-20雷达反射面是F-22的100倍,,原因是战略目标不同

美智库:中国歼-20雷达反射面是F-22的100倍,,原因是战略目标不同

生活的哲学
2026-09-05 21:51:58
“1998·11·14”命案告破,内蒙古警方通报:潜逃28年的嫌疑人张某被抓获,对犯罪事实供认不讳

“1998·11·14”命案告破,内蒙古警方通报:潜逃28年的嫌疑人张某被抓获,对犯罪事实供认不讳

极目新闻
2026-09-05 00:12:26
“上坟见三样,家兴子孙旺”:究竟是哪三样?清明上坟还有哪些讲究?

“上坟见三样,家兴子孙旺”:究竟是哪三样?清明上坟还有哪些讲究?

大运河时空
2026-09-01 15:50:03
一副美瞳戴上就不取,想起来才换下一副!14岁女孩这样“省事”半年,左眼真菌溃烂仅剩指数视力

一副美瞳戴上就不取,想起来才换下一副!14岁女孩这样“省事”半年,左眼真菌溃烂仅剩指数视力

极目新闻
2026-09-05 12:36:48
艾滋病新增130万!很多人中招很冤枉!在外“5不碰”一定要记死

艾滋病新增130万!很多人中招很冤枉!在外“5不碰”一定要记死

番外行
2026-04-18 08:19:22
9月4日俄乌最新:南线溃败

9月4日俄乌最新:南线溃败

西楼饮月
2026-09-04 23:12:19
大开眼界!许家印当年奢靡生活曝光

大开眼界!许家印当年奢靡生活曝光

麦杰逊
2026-08-23 15:09:25
万梓良现状:68岁多种病缠身,还拼命赚钱养家,儿子继承英俊外貌

万梓良现状:68岁多种病缠身,还拼命赚钱养家,儿子继承英俊外貌

绚丽的画卷
2026-09-05 19:33:44
特朗普后悔也晚了,美国对付中国的手段,已经在全世界引起了恐慌

特朗普后悔也晚了,美国对付中国的手段,已经在全世界引起了恐慌

至死不渝的爱情
2026-09-04 23:07:17
新华社国家高端智库发布亚太共同体智库报告

新华社国家高端智库发布亚太共同体智库报告

新华社
2026-09-05 12:45:10
英博2-1海牛,斯坦丘、罗竞建功,叶博亚破门难救主

英博2-1海牛,斯坦丘、罗竞建功,叶博亚破门难救主

懂球帝
2026-09-05 21:34:13
2026-09-06 01:35:01
极客公园
极客公园
让最棒的创新成为头条
12475文章数 78939关注度
往期回顾 全部

科技要闻

华为何庭波,再次更新韬定律论文

头条要闻

患者疑将刀藏锦旗中连捅医生多刀 官方回应

头条要闻

患者疑将刀藏锦旗中连捅医生多刀 官方回应

体育要闻

本西蒙斯加盟国王,不管怎样,回来就好

娱乐要闻

阿Sa蔡卓妍首度求婚细节,感动落泪

财经要闻

被曝试药后死亡,药企董事竟怒怼记者

汽车要闻

千里浩瀚H5/30英寸大屏 星越L PLUS让你看到油车越级的一面

态度原创

健康
艺术
亲子
手机
教育

脑梗取栓成功≠活下来,还有这三关

艺术要闻

14岁种下画家梦,51岁才拿起笔。她笔下的加拿大乡村,治愈了无数疲惫的灵魂!

亲子要闻

工程车小故事

手机要闻

华为Pura 90系列未加入涨价潮:价格最稳的华为影像旗舰

教育要闻

北京师范大学9-12月冲刺规划|TTS热点答题哄学班堂堂上新!!!

无障碍浏览 进入关怀版