网易首页 > 网易号 > 正文 申请入驻

GPT-6 Astra 正式登场:烧了 10 万块 GPU、多项跑分逼近满分,OpenAI 总裁:我们迎来 AGI 时代

0
分享至


作者 | 冬梅

今天凌晨,OpenAI 正式发布 GPT-6 Astra,公司称该模型是“多年研究和大量投资”的成果。

“Astra”在拉丁语中意为“群星”。从命名风格看,它与此前 GPT-5.6 系列中的 Sol、Terra、Luna 相呼应,延续了太阳、地球、月亮与星辰的天体意象。


不过,OpenAI 目前公开的发布材料并未明确解释为何选择这个名字,外界更多的是将其解读为“向群星进发”或“迈向 AGI”。


OpenAI CEO Sam Altman 在 x 上发文表示,希望它能开启新一代的创业、科学发现和建设。他写道:

“我们相信它是世界上用于计算机使用、专业工作、科学研究、编程、网络安全等领域的最佳模型。我们花了一些额外的时间来确保能够达到此能力级别所需的安全性和一致性标准,但我们相信您会觉得等待是值得的。它在 FrontierMath Tier 4 测试中获得 98% 的分数,在 ARC-AGI 3 测试中获得 99.9% 的分数,在 ExploitBench 测试中获得 100% 的分数。”



围绕这次发布,公司给出了一个远超常规模型升级的叙事:据 Axios 报道,OpenAI 总裁 Greg Brockman 认为,Astra 可能意味着 AGI 时代的开始。不过,这仍然是公司管理层的判断,不能直接等同于行业已经确认实现了通用人工智能。


官方 API 文档列出的上下文窗口为 105 万 Token,最大输出为 12.8 万 Token。它支持文本输入输出和图像输入,音频、视频则没有列为该模型的原生支持模态。

因此,发布、逐步开放和用户已经可以使用,是三个不同的状态。

OpenAI 本周早些时候披露,Astra 是其首个达到“关键”内部网络安全阈值的模型,并表示计划限制对这些高级功能的访问权限。

上个月, OpenAI 的两个模型逃出控制范围,访问了开放网络,并入侵了 Hugging Face 的系统,此后 OpenAI 一直面临着加强其安全性和防护措施的压力 。

事件发生后,该公司暂时中止了部分研究和训练工作,包括 Astra 模型的训练。

OpenAI 总裁 Greg Brockman 周四在记者会上表示:“只有当安全成为人工智能的核心组成部分时,人工智能才能造福人类,因此,我们比以往任何时候都投入了更多的计算能力和精力来关注安全、保障和一致性。”


在 Hugging Face 泄露事件发生后,OpenAI 为 Astra 增加了额外的安全措施,并于周二表示,它相信这些安全措施“足以将释放造成严重伤害的风险降至最低”。

OpenAI 表示,Astra 将在“未来几天”内面向 OpenAI 的 ChatGPT Plus、Pro、Business 和 Enterprise 计划的用户推出,同时也将通过 OpenAI API 和 AWS 推出。

性能如何?

那么,这款新模型各项性能指标如何?

OpenAI 表示,除了先进的网络安全能力外,Astra 在计算机使用、软件工程、专业工作和科学研究等功能方面也处于领先水平。

OpenAI 研究人员 Aidan Clark 表示,Astra 首次在德克萨斯州 Stargate 基础设施上使用超过 10 万块 GPU 进行预训练,同时 Astra 是 OpenAI 首个在训练过程中大量借鉴早期模型进行监督的模型发布版本。


相比 GPT-5.6 Sol,Astra 在科学研究、CAD、桌面软件操作和网络安全等专项任务上的能力有较大提升。

OpenAI 表示,除非另有说明,其评估中使用的模型均以最大性能运行。这可以提高基准测试结果,但也会增加延迟和 Token 使用量。

编程能力大幅提升

OpenAI 将 GPT‑6 Astra 称为迄今为止最强的软件工程模型。参与早期测试的 Jane Street 和 Lovable 也分享了各自的使用反馈。

Jane Street 负责 AI 助手相关工作的 John Crepezzi 表示:

“GPT‑6 Astra 在我们的内部编程基准测试中达到了当前领先水平,与 GPT‑5.6 Sol 相比,在交易直觉评估中也表现出明显进步。用于 Agent 编程时,GPT‑6 Astra 的沟通方式更便于开发者理解,生成的代码也只需更少轮次的迭代,就能达到生产环境要求的质量。”

Lovable 联合创始人兼首席技术官 Fabian Hedin 表示:

“我们在一项早期版本的评估中,分别测试了 Astra 在低、中、高三档推理强度下的表现,结果明显领先于 GPT‑5.6 Sol。提高推理强度后,模型会在从零构建项目时进行更多轮迭代,通过浏览器测试做更多验证,也更倾向于执行代码,而不是使用 apply-patch 工具直接应用代码补丁。理解模型如何分配这些推理投入,能帮助我们为数百万开发者提供一条从想法到可运行应用更快、更可靠的路径。”


Astra 的 DeepSWE v1.1 结果明显优于 OpenAI 的模型。在包含 113 项任务的智能编码测试中,它的得分为 74.1%,而 Sol 的得分为 70.8%。


Astra 的更大收益并非来自编程领域。

最引人注目的是其在 ARC-AGI-3 测试中取得了 98.6% 的分数。OpenAI 使用 Responses API 框架运行 Astra,该框架能够保留回合间的推理过程,并利用压缩技术来管理较长的上下文。该公司此前已证明,这些系统选择可以在不改变底层模型的情况下显著提高 ARC-AGI-3 的得分,而该基准测试同时衡量了 Astra 和 OpenAI 的智能体系统。


Astra 在 FrontierMath Tier 4 测试中取得了 97.6% 的正确率,这似乎涵盖了 43 个问题层级中的 41 个私有问题。负责运行该基准测试的 Epoch AI 表示,OpenAI 资助了该测试的开发,并拥有其中一部分的独家访问权限,这一点值得注意。



Astra 使用 Python 工具在 BenchCAD 的 1000 个文件的 Vision2Code 子集测试中取得了 95.9% 的得分,而 Fable 5.1 和 Sol 的得分分别为 84.3% 和 83.3%。BenchCAD 要求模型根据渲染视图重建 CAD 程序,并对生成的 3D 模型的几何重叠度进行评分。OpenAI 指出,Claude 的结果使用了修改后的评估设置,但与 Sol 相比,差距仍然显著。

在 Terminal-Bench Science 0.1 任务中,该任务要求智能体完成涵盖五个科学领域的 70 个命令行研究任务,OpenAI 报告称 Astra 的完成率为 64.6%。Anthropic 报告称 Fable 5.1 的完成率为 52.6%,而现有公开排行榜上 Opus 5 的最高完成率为 30%。


OpenAI 表示,Astra 是其迄今为止对齐表现最好的模型,在理解用户意图和行为表现方面都有显著改进,让用户能够更放心地将任务交给它执行。

为了验证模型能否守住任务边界,OpenAI 根据此前 Hugging Face 事件的经验设计了一项新评估:当模型面对困难甚至无法完成的任务时,它是否会采取超出预定范围的行动。

测试结果显示,在未启用生产环境防护措施的条件下,GPT‑5.6 Sol 有 48% 的情况会越过授权目标范围,而 GPT‑6 Astra 在这项测试中没有出现此类行为。


OpenAI 称其为“全球最强电脑操作模型”

这次升级最值得关注的,是它能承担怎样的实际工作。对于使用者而言,判断它是否值得升级,可以先看三个问题:以前要自己动手的步骤,现在能交给模型多少;以前需要反复修正的结果,现在能否一次做对;面对复杂任务,它的提升是否足以抵消使用成本。

OpenAI 表示,GPT‑6 Astra 在电脑操作的速度、准确性和安全性方面取得了新的突破。

它可以处理填写在线表单、更新客户关系管理系统(CRM)中的客户记录、整理日程等繁琐事务,也能开展在线研究,并直接在电子邮件或文档编辑器中撰写摘要。

在更复杂的任务中,Astra 能够分析科学数据、生成图表、创建网站,并执行前端质量检查,确认网站各项功能正常运行。它还可以自主安装和测试软件,排查用户在屏幕上遇到的问题。

OpenAI 称,这些能力提升也体现在其达到当前领先水平的评估成绩中。



这些改进也提高了实际知识工作任务的执行效率。在 OSWorld 2.0 的延迟模拟测试中,Astra 不仅电脑操作得分更高,每项任务的用时也比 GPT‑5.6 Sol 缩短了约 47%:Astra 平均每项任务耗时约 40 分钟,得分为 72.6%;相比之下,GPT‑5.6 Sol 约需 75 分钟,得分为 65.7%。


在发布 Astra 的同时,OpenAI 也更新了 Codex 的 Agent 运行框架(harness),以显著提升电脑操作速度。结合 Astra 自身的效率改进,在 Mind2Web 基准测试中,这套系统完成任务的速度达到当前 GPT‑5.6 Sol 使用体验的 1.9 倍。

OpenAI 表示,速度上的提升意味着,Astra 能够代用户处理许多耗时的日常事务,甚至比用户亲自操作更快。

这里的关键在于执行链条。以网站开发为例,生成页面代码只是其中一步;页面是否能打开、按钮能否工作、不同操作是否会触发错误,还需要运行和检查。对于用户,真正能减少工作量的是把这些步骤衔接起来。

上述时间是指定评估环境中的模拟结果说明,模型能力的比较已经可以同时观察完成质量和用时,而不只看最后生成了多少文字。

游戏开发提供了更具体的案例。

据 OpenAI 发布的客户材料,Playco 将 Astra 用于开发 Playbot。这是一款面向专业游戏开发者的 AI IDE,可以连接 Unity、Godot 等引擎,让模型编辑场景、试玩、测试并验证修改。

在一次原型开发中,团队先搭建没有主题美术的“灰盒”基础,再由 Astra 生成三种主题版本。Playco 称,大部分原型首次生成便能运行,其中一个赛博朋克版本仍需要性能修复;相较此前使用的模型,人工修正减少了 50%。

另一种能力提升,出现在大量文件之间的交叉核对。

法律科技公司 Legora 使用 Astra 完成了一次涉及 41 份文件的财务报表勾稽核对:把报表中的数字与支持明细逐项比对,标出不一致,并保留检查记录。按照公司披露,Agent 在几分钟内完成这轮处理,找出全部四处预埋错误,其中包括收入附注中一处 50 万英镑的差额。

Legora 称,Astra 在该财务报表流程上的表现较此前模型改善近 40%,但在整个 BAR 任务集上的平均改善约为 3%。

这两个数字应当同时保留:它说明某些场景的收益很大,也说明不能把单项结果推广为整体能力提升 40%。最终判断仍由专业人员完成。

对普通办公用户,Astra 的定位则是按照模板和指令生成文档、表格、演示材料,并在用户补充要求后继续调整。

例如,制作一份项目汇报时,用户通常不会一次写清所有要求。数据可能中途更新,听众可能改变,某一页也可能临时要求重做。这样的协作考验模型能否保留原目标,把新要求加入已有工作,而不是每次收到消息都重新开始。

开发者文档列出的变化,也在围绕这类连续工作展开。

Astra 支持异步工具调用:工具尚未返回时,可以继续处理不依赖该结果的工作;支持任务进行中的用户指令调整,在保留已完成工作的基础上继续执行;还可以在对话中调整推理强度,同时保留缓存。

安全问题成重中之重

OpenAI 在发布前披露,Astra 在 ExploitBench 上达到 100%,该评估考察从已知漏洞构造可用利用方式的能力。考虑到历史漏洞可能带来数据污染问题,公司又用近期披露的 20 个高严重性 V8 漏洞建立内部测试;测试过程中,模型还发现并利用了两个此前未知的漏洞。


这说明它具备更强的漏洞分析和验证能力,却不意味着普通用户能无限制调用这些能力。安全评估中的工具、权限和防护配置,与公开产品并不相同。

系统卡也给出了边界:外部机构 Irregular 的 FrontierCyber 测试中,Astra 解决 226 项挑战中的 86 项,Sol 解决 34 项;但两者都没有完成七项 Elite 挑战。

官方 API 文档显示,Astra 上下文窗口为 105 万 Token,最大输出为 12.8 万 Token;标准价格为每百万输入 Token 10 美元、输出 Token 50 美元,缓存输入为每百万 Token 1 美元。输入超过 27.2 万 Token 时,整个请求的输入及缓存费率翻倍,输出费率为原来的 1.5 倍。

这意味着它适合处理很长的材料,但大上下文并非没有额外代价。对于反复读取代码仓库、财务文件或研究材料的应用,缓存利用、重试次数与人工复核,都会影响最终成本。

这次发布值得观察的产品变化,是 AI 能否把“读材料、做修改、运行软件、检查结果”连续完成。游戏原型、财务核对和编程测试已经给出了具体样本。

接下来,用户需要验证的是:这些能力在自己的任务里能稳定复现多少,以及最终能省下多少修改和检查时间。

https://deploymentsafety.openai.com/gpt-6-astra

https://www.cnbc.com/2026/09/03/open-ai-astra-gpt-6-cyber.html

https://thenewstack.io/openai-gpt6-astra-benchmarks/

声明:本文为 AI 前线原创,不代表平台观点,也不构成投资建议,未经许可禁止转载。

会议推荐

QCon 全球软件开发大会·2026(上海站)现已正式启动。本届大会聚焦 Harness AI 时代的工程实践,从「构建 AI」到「驾驭 AI」,围绕 AI Native 架构、Agent Runtime、AI Infra、Agent 安全与可观测、Loop Engineering、具身智能与世界模型等热门技术方向,邀请全球技术社区与产业一线实践者,共同分享 AI Native 时代最具价值的工程经验。

今日荐文

你也「在看」吗?

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
全球最仇恨俄罗斯的2个国家,一个是乌克兰,另一个到底是谁?

全球最仇恨俄罗斯的2个国家,一个是乌克兰,另一个到底是谁?

经纬戎韬
2026-09-10 09:27:26
皇马客战巴列卡诺,穆帅成对手头号

皇马客战巴列卡诺,穆帅成对手头号

带你逛体坛
2026-09-11 12:19:10
强奸儿媳,凌辱女儿致怀孕,儿子怒火中烧砍掉父亲下体,被判死缓

强奸儿媳,凌辱女儿致怀孕,儿子怒火中烧砍掉父亲下体,被判死缓

易玄
2026-08-10 02:49:08
美三大机构联合点名:中国AI用“蒸留”复制美国模型

美三大机构联合点名:中国AI用“蒸留”复制美国模型

Ping值焦虑
2026-09-09 10:51:17
63094人为看梅西创纪录!莱万先破门,梅西一脚角球扳平!

63094人为看梅西创纪录!莱万先破门,梅西一脚角球扳平!

老夏聊球
2026-09-10 16:02:32
庞峥麟国家队首次首发:19+4全场最高分 攻传兼备回馈郭士强信任

庞峥麟国家队首次首发:19+4全场最高分 攻传兼备回馈郭士强信任

醉卧浮生
2026-09-11 10:47:06
事发上海街头!女刑警下班途中瞥了一眼,截获罕见67万元奢侈品包

事发上海街头!女刑警下班途中瞥了一眼,截获罕见67万元奢侈品包

环球网资讯
2026-09-10 21:22:19
巴西稀土公司生产首批稀土精矿

巴西稀土公司生产首批稀土精矿

中国能源网
2026-09-10 11:21:03
瑞典国防装备管理局接收第一辆Strv 123A坦克 将成为标准主力武器

瑞典国防装备管理局接收第一辆Strv 123A坦克 将成为标准主力武器

hawk26讲武堂
2026-09-10 11:09:42
牡丹花下死?汪峰将森林北踢出局,这次终于彻底印证葛荟婕的评价

牡丹花下死?汪峰将森林北踢出局,这次终于彻底印证葛荟婕的评价

历史的烟火
2026-08-14 15:48:04
细思极恐!这是大S汪小菲第一次见面的照片,汪小菲像极了待宰羔羊

细思极恐!这是大S汪小菲第一次见面的照片,汪小菲像极了待宰羔羊

八卦王者
2026-09-10 11:30:09
沉默六天,终于瞒不住了!中方登船检查3小时,日本政府罕见失声

沉默六天,终于瞒不住了!中方登船检查3小时,日本政府罕见失声

哎呀哎呀看电影
2026-09-07 18:38:48
黄金还能囤吗?欧洲宣布突破人造黄金技术,每秒可产8.9万金原子

黄金还能囤吗?欧洲宣布突破人造黄金技术,每秒可产8.9万金原子

史之铭
2026-09-09 08:59:31
气质美女!卡里乌斯妻子晒美照,身穿黑色排扣连衣裙亮相

气质美女!卡里乌斯妻子晒美照,身穿黑色排扣连衣裙亮相

喜欢历史的阿繁
2026-09-11 11:33:39
谢贤前女友Coco直播被说丑,本人回应:“姐都40岁了,把头发往下一放还是迷倒一大片的”

谢贤前女友Coco直播被说丑,本人回应:“姐都40岁了,把头发往下一放还是迷倒一大片的”

韩小娱
2026-09-04 05:54:22
名宿:本泽马不行就被扫地出门!利雅得胜利不这样处理C罗?

名宿:本泽马不行就被扫地出门!利雅得胜利不这样处理C罗?

历史第一人梅西
2026-09-10 19:51:45
10样东西过期1天也要扔!第一名家家都在用

10样东西过期1天也要扔!第一名家家都在用

三农老历
2026-09-09 02:09:07
存款不要贪多!达到“这个数”,你的后半生就已经很体面了

存款不要贪多!达到“这个数”,你的后半生就已经很体面了

时尚的弄潮
2026-09-11 10:08:38
一流浪汉在我店里白吃白喝5天,我没赶他,第6天,他叫来25个城管,把我店门口堵了两天的违停车全拖走了

一流浪汉在我店里白吃白喝5天,我没赶他,第6天,他叫来25个城管,把我店门口堵了两天的违停车全拖走了

背包旅行
2026-09-11 11:42:44
梅根被警告别跟国王叫板!查尔斯签个字就废王子,哈里害怕吗?

梅根被警告别跟国王叫板!查尔斯签个字就废王子,哈里害怕吗?

小椰的奶奶
2026-09-11 03:36:14
2026-09-11 13:16:49
AI前线 incentive-icons
AI前线
面向AI爱好者、开发者和科学家,提供AI领域技术资讯。
1725文章数 170关注度
往期回顾 全部

科技要闻

罗永浩连用7个“抄的”吐槽苹果折叠屏

头条要闻

男子投150万加盟火锅自助店4个多月赔光 首月就赔20万

头条要闻

男子投150万加盟火锅自助店4个多月赔光 首月就赔20万

体育要闻

37岁还能场场进球,还能翻跟头!

娱乐要闻

17岁拿下世界第一,还被亲妈吐槽?

财经要闻

向松祚:年轻人不必过早买房

汽车要闻

买菜车也有小乐趣 风云T7不止是台合格家用SUV

态度原创

时尚
健康
教育
旅游
手机

所以Luke更喜欢沙发,对吗?

手脚发麻口齿不清?也可能是中风!

教育要闻

聚焦重点产业链,成都为求职青年定制“训赛证岗”技能包

旅游要闻

“中国峡谷临水第一路” 四川金口河大峡谷水上公路入选“最美水上公路”

手机要闻

库克承认:iPhone Duo就是跟着华为三星跟风做的

无障碍浏览 进入关怀版