GPT-6 Astra 发布了
当地时间 9 月 3 号,GPT-6 Astra 正式发布。发布会最后,总裁 Greg Brockman 站在台上,就甩了一句话:
"Welcome to the AGI era."
不是那种"参数翻倍、跑分刷榜"的常规升级。这次 GPT-6 Astra 干了一件以前所有模型都没真正干成的事:
它不再只是"回答你的问题",而是真的在"帮你把活干完"。
这俩的区别,天差地别。
![]()
一、先说参数,30 秒过完
老规矩,硬件指标先摆这儿:
• 上下文窗口 :105 万 Token
• 最大输出 :12.8 万 Token
• 知识截止 :2026 年 4 月底
• API 定价 :输入 百 万 , 输 出 50/百万 Token(上一代 Sol 的 2.5 倍,跟两天前 Claude Fable 5.1 一个价)
目前先给少量机构用,ChatGPT Plus、Pro、Business、Enterprise 用户等几天灰度推送。
Plus 用户别急着升 Pro,Astra 本身就在 Plus 的覆盖范围内,等推送就行。
但说真的,这些数字只是开胃菜。
二、最大杀器:它真的会"用电脑"了
这次最核心的升级,四个字:Computer Use。
OpenAI 直接喊出"世界上最好的电脑操作模型"。
你可能会说,这不就是自动化脚本吗?不是。
以前让 AI 操作软件,要么走 API,要么上 MCP 协议。但现实是什么?你公司那个跑了十五年的内部系统,连文档都没有,API?不存在的。
Astra 的思路特别粗暴,也特别聪明:
你不给我接口是吧?行,我直接看屏幕、找按钮、点鼠标、填内容。跟人一样用电脑。
![]()
你想想,屏幕和键鼠,才是这个世界上最通用的"API"。
官方演示里它干了啥?我列一下你感受一下:
• 在 KiCad 里画 PCB 电路板
• 用 Excel + Power BI 做财务报表
• 填美国 1040 报税表
• 给法律文件排版
• 在 Blender 里建一栋房子,然后丢进 Unreal Engine 5 变成能走进去逛的 3D 场景
• 搭完网站,自己跑一遍前端 QA
这些软件之间八竿子打不着,但 Astra 全用同一套"看屏幕干活"的逻辑搞定了。
实测数据更离谱:
测试项
Astra
上代 Sol
OSWorld 2.0(电脑操作)
72.6%
65.7%
单任务平均耗时
40 分钟
75 分钟
AutomationBench(办公自动化)
41.4%
18.1%
最直观的一个例子:帮你在网上找一个合适的儿科医生。Astra 用了 2 分 54 秒。人类平均要花 5 个小时。
这不是"辅助",这是"替代"。
三、跑分环节:三个数字说明一切
我知道你们爱看跑分,来,三个最炸的:
① ARC-AGI-3:99.9%
这个测试是啥?把 AI 扔进一个完全陌生、没有任何规则说明的游戏里,让它自己摸索、自己通关。考的不是知识,是"悟性"。
人类平均分才 48%。半年前最强模型只有 0.51%。上代 Sol 是 7.8%。Claude Opus 5 是 30.2%。
Astra 直接 99.9%。
(打个星号:这个分数是基于 OpenAI 自家 Responses API 框架跑的,不完全等于裸模型裸分。但即便如此,跨度也是恐怖的。)
② FrontierMath Tier 4:97.6%
高难度数学基本被刷饱和了。
③ ExploitBench:100%
漏洞利用,满分。
编程方面,Terminal-Bench 4.0 拿了 57.9%,压过 Fable 5.1 的 55.8%,Sol 只有 37.3%。
科研上更猛:Astra 参与解决了两个素数间隔问题,把有界素数间隔从 240 压到了 186。
对,你没看错,AI 开始做纯数学研究了。
四、Codex 升级:会记笔记,也知道什么时候该问你
这个点我觉得特别值得单独说。
做过长任务编程的朋友都知道那个痛:上下文一满,就得压缩;一压缩,细节就丢。之前为什么失败、哪个组件有坑,搞着搞着就忘了。
Astra 给 Codex 加了一套跨上下文笔记机制。
简单说:它像人一样记笔记。早先的对话可以回头搜,没写进摘要的信息也能翻出来。目前是实验开关,几周内变默认。
还有一个升级特别戳我,叫 "判断力"。
信息缺了但不影响结果?它自己合理脑补,不来烦你。
缺的信息会改变最终结果?它问你一个精准的问题。
而且它能一边问你、一边继续干不依赖你回答的活。
说真的,这就很像一个靠谱的同事——知道什么时候该来问你,也知道什么时候闭嘴干活。
五、安全
先说好消息。
Astra 是 OpenAI 历史上第一个达到 Critical 网络安全门槛的模型。测试期间顺手发现了两个此前未知的零日漏洞。
对齐方面进步肉眼可见:
• 面对不可能完成的任务,Sol 在无防护下 48.2% 会越界乱搞,Astra 是 0%
• 能力幻觉率从 9.4% 降到 2.0%
但反转来了。
英国 AI 安全研究所测出来,Astra 不写长推理、直接"心算"的时间跨度是 Sol 的近 10 倍。
OpenAI 自己在 System Card 里也承认:思维链可监控性显著下降。
翻译成人话:它更安全了,但你也更难看懂它在想什么了。
一个更聪明、更自主的模型,人类反而更难靠"看它的思考过程"来管住它。
这也是为什么 OpenAI 没敢一口气全量放开。
六、定价和开放节奏
再说一遍关键信息:
• API 定价 :输入 百 万 , 输 出 50/百万
• Fast 模式 :速度 2 倍,价格也 2 倍
• 开放节奏 :先少量机构 → 几天内推给 Plus/Pro/Business/Enterprise → API 同步上线(gpt-6-astra)
• AWS Bedrock 也同步上了
奥特曼说了句挺有意思的话:虽然单 Token 价格更高,但 Astra 能用更少的输出 Token 完成复杂任务,实际完成一个任务的成本可能反而更低。
他还补了一句:"我们的目标是提供极其廉价且丰沛的智能,未来还会继续大幅降价。"
![]()
最后
不是因为跑分多高,不是因为参数多大。
是因为它第一次让我觉得:这玩意儿真的在"干活",而不是在"表演"。
它看屏幕、点鼠标、填表格、跑测试、记笔记、知道什么时候该问你。
它不像一个聊天机器人了。
它像一个……同事。
Greg 说"Welcome to the AGI era",这话可能还是说早了。
但如果说"Welcome to the AI 真的能帮你干活 era"——
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.