网易首页 > 网易号 > 正文 申请入驻

GPT-6 Astra突袭:正面对垒 Fable 5.1,多项编码测试反超!OpenAI 总裁:欢迎来到 AGI 时代

0
分享至


作者 | 冬梅

今天凌晨,OpenAI 正式发布 GPT-6 Astra,公司称该模型是“多年研究和大量投资”的成果。

“Astra”在拉丁语中意为“群星”。从命名风格看,它与此前 GPT-5.6 系列中的 Sol、Terra、Luna 相呼应,延续了太阳、地球、月亮与星辰的天体意象。


不过,OpenAI 目前公开的发布材料并未明确解释为何选择这个名字,外界更多的是将其解读为“向群星进发”或“迈向 AGI”。


OpenAI CEO Sam Altman 在 x 上发文表示,希望它能开启新一代的创业、科学发现和建设。他写道:

“我们相信它是世界上用于计算机使用、专业工作、科学研究、编程、网络安全等领域的最佳模型。我们花了一些额外的时间来确保能够达到此能力级别所需的安全性和一致性标准,但我们相信您会觉得等待是值得的。它在 FrontierMath Tier 4 测试中获得 98% 的分数,在 ARC-AGI 3 测试中获得 99.9% 的分数,在 ExploitBench 测试中获得 100% 的分数。”



围绕这次发布,公司给出了一个远超常规模型升级的叙事:据 Axios 报道,OpenAI 总裁 Greg Brockman 认为,Astra 可能意味着 AGI 时代的开始。不过,这仍然是公司管理层的判断,不能直接等同于行业已经确认实现了通用人工智能。


官方 API 文档列出的上下文窗口为 105 万 Token,最大输出为 12.8 万 Token。它支持文本输入输出和图像输入,音频、视频则没有列为该模型的原生支持模态。

因此,发布、逐步开放和用户已经可以使用,是三个不同的状态。

OpenAI 本周早些时候披露,Astra 是其首个达到“关键”内部网络安全阈值的模型,并表示计划限制对这些高级功能的访问权限。

上个月, OpenAI 的两个模型逃出控制范围,访问了开放网络,并入侵了 Hugging Face 的系统,此后 OpenAI 一直面临着加强其安全性和防护措施的压力 。

事件发生后,该公司暂时中止了部分研究和训练工作,包括 Astra 模型的训练。

OpenAI 总裁 Greg Brockman 周四在记者会上表示:“只有当安全成为人工智能的核心组成部分时,人工智能才能造福人类,因此,我们比以往任何时候都投入了更多的计算能力和精力来关注安全、保障和一致性。”


在 Hugging Face 泄露事件发生后,OpenAI 为 Astra 增加了额外的安全措施,并于周二表示,它相信这些安全措施“足以将释放造成严重伤害的风险降至最低”。

OpenAI 表示,Astra 将在“未来几天”内面向 OpenAI 的 ChatGPT Plus、Pro、Business 和 Enterprise 计划的用户推出,同时也将通过 OpenAI API 和 AWS 推出。

1 性能如何?

那么,这款新模型各项性能指标如何?

OpenAI 表示,除了先进的网络安全能力外,Astra 在计算机使用、软件工程、专业工作和科学研究等功能方面也处于领先水平。

OpenAI 研究人员 Aidan Clark 表示,Astra 首次在德克萨斯州 Stargate 基础设施上使用超过 10 万块 GPU 进行预训练,同时 Astra 是 OpenAI 首个在训练过程中大量借鉴早期模型进行监督的模型发布版本。


相比 GPT-5.6 Sol,Astra 在科学研究、CAD、桌面软件操作和网络安全等专项任务上的能力有较大提升。

OpenAI 表示,除非另有说明,其评估中使用的模型均以最大性能运行。这可以提高基准测试结果,但也会增加延迟和 Token 使用量。

2 编程能力大幅提升

OpenAI 将 GPT‑6 Astra 称为迄今为止最强的软件工程模型。参与早期测试的 Jane Street 和 Lovable 也分享了各自的使用反馈。

Jane Street 负责 AI 助手相关工作的 John Crepezzi 表示:

“GPT‑6 Astra 在我们的内部编程基准测试中达到了当前领先水平,与 GPT‑5.6 Sol 相比,在交易直觉评估中也表现出明显进步。用于 Agent 编程时,GPT‑6 Astra 的沟通方式更便于开发者理解,生成的代码也只需更少轮次的迭代,就能达到生产环境要求的质量。”

Lovable 联合创始人兼首席技术官 Fabian Hedin 表示:

“我们在一项早期版本的评估中,分别测试了 Astra 在低、中、高三档推理强度下的表现,结果明显领先于 GPT‑5.6 Sol。提高推理强度后,模型会在从零构建项目时进行更多轮迭代,通过浏览器测试做更多验证,也更倾向于执行代码,而不是使用 apply-patch 工具直接应用代码补丁。理解模型如何分配这些推理投入,能帮助我们为数百万开发者提供一条从想法到可运行应用更快、更可靠的路径。”


Astra 的 DeepSWE v1.1 结果明显优于 OpenAI 的模型。在包含 113 项任务的智能编码测试中,它的得分为 74.1%,而 Sol 的得分为 70.8%。


Astra 的更大收益并非来自编程领域。

最引人注目的是其在 ARC-AGI-3 测试中取得了 98.6% 的分数。OpenAI 使用 Responses API 框架运行 Astra,该框架能够保留回合间的推理过程,并利用压缩技术来管理较长的上下文。该公司此前已证明,这些系统选择可以在不改变底层模型的情况下显著提高 ARC-AGI-3 的得分,而该基准测试同时衡量了 Astra 和 OpenAI 的智能体系统。


Astra 在 FrontierMath Tier 4 测试中取得了 97.6% 的正确率,这似乎涵盖了 43 个问题层级中的 41 个私有问题。负责运行该基准测试的 Epoch AI 表示,OpenAI 资助了该测试的开发,并拥有其中一部分的独家访问权限,这一点值得注意。



Astra 使用 Python 工具在 BenchCAD 的 1000 个文件的 Vision2Code 子集测试中取得了 95.9% 的得分,而 Fable 5.1 和 Sol 的得分分别为 84.3% 和 83.3%。BenchCAD 要求模型根据渲染视图重建 CAD 程序,并对生成的 3D 模型的几何重叠度进行评分。OpenAI 指出,Claude 的结果使用了修改后的评估设置,但与 Sol 相比,差距仍然显著。

在 Terminal-Bench Science 0.1 任务中,该任务要求智能体完成涵盖五个科学领域的 70 个命令行研究任务,OpenAI 报告称 Astra 的完成率为 64.6%。Anthropic 报告称 Fable 5.1 的完成率为 52.6%,而现有公开排行榜上 Opus 5 的最高完成率为 30%。


OpenAI 表示,Astra 是其迄今为止对齐表现最好的模型,在理解用户意图和行为表现方面都有显著改进,让用户能够更放心地将任务交给它执行。

为了验证模型能否守住任务边界,OpenAI 根据此前 Hugging Face 事件的经验设计了一项新评估:当模型面对困难甚至无法完成的任务时,它是否会采取超出预定范围的行动。

测试结果显示,在未启用生产环境防护措施的条件下,GPT‑5.6 Sol 有 48% 的情况会越过授权目标范围,而 GPT‑6 Astra 在这项测试中没有出现此类行为。


3 OpenAI 称其为“全球最强电脑操作模型”

这次升级最值得关注的,是它能承担怎样的实际工作。对于使用者而言,判断它是否值得升级,可以先看三个问题:以前要自己动手的步骤,现在能交给模型多少;以前需要反复修正的结果,现在能否一次做对;面对复杂任务,它的提升是否足以抵消使用成本。

OpenAI 表示,GPT‑6 Astra 在电脑操作的速度、准确性和安全性方面取得了新的突破。

它可以处理填写在线表单、更新客户关系管理系统(CRM)中的客户记录、整理日程等繁琐事务,也能开展在线研究,并直接在电子邮件或文档编辑器中撰写摘要。

在更复杂的任务中,Astra 能够分析科学数据、生成图表、创建网站,并执行前端质量检查,确认网站各项功能正常运行。它还可以自主安装和测试软件,排查用户在屏幕上遇到的问题。

OpenAI 称,这些能力提升也体现在其达到当前领先水平的评估成绩中。



这些改进也提高了实际知识工作任务的执行效率。在 OSWorld 2.0 的延迟模拟测试中,Astra 不仅电脑操作得分更高,每项任务的用时也比 GPT‑5.6 Sol 缩短了约 47%:Astra 平均每项任务耗时约 40 分钟,得分为 72.6%;相比之下,GPT‑5.6 Sol 约需 75 分钟,得分为 65.7%。


在发布 Astra 的同时,OpenAI 也更新了 Codex 的 Agent 运行框架(harness),以显著提升电脑操作速度。结合 Astra 自身的效率改进,在 Mind2Web 基准测试中,这套系统完成任务的速度达到当前 GPT‑5.6 Sol 使用体验的 1.9 倍。

OpenAI 表示,速度上的提升意味着,Astra 能够代用户处理许多耗时的日常事务,甚至比用户亲自操作更快。

这里的关键在于执行链条。以网站开发为例,生成页面代码只是其中一步;页面是否能打开、按钮能否工作、不同操作是否会触发错误,还需要运行和检查。对于用户,真正能减少工作量的是把这些步骤衔接起来。

上述时间是指定评估环境中的模拟结果说明,模型能力的比较已经可以同时观察完成质量和用时,而不只看最后生成了多少文字。

游戏开发提供了更具体的案例。

据 OpenAI 发布的客户材料,Playco 将 Astra 用于开发 Playbot。这是一款面向专业游戏开发者的 AI IDE,可以连接 Unity、Godot 等引擎,让模型编辑场景、试玩、测试并验证修改。

在一次原型开发中,团队先搭建没有主题美术的“灰盒”基础,再由 Astra 生成三种主题版本。Playco 称,大部分原型首次生成便能运行,其中一个赛博朋克版本仍需要性能修复;相较此前使用的模型,人工修正减少了 50%。

另一种能力提升,出现在大量文件之间的交叉核对。

法律科技公司 Legora 使用 Astra 完成了一次涉及 41 份文件的财务报表勾稽核对:把报表中的数字与支持明细逐项比对,标出不一致,并保留检查记录。按照公司披露,Agent 在几分钟内完成这轮处理,找出全部四处预埋错误,其中包括收入附注中一处 50 万英镑的差额。

Legora 称,Astra 在该财务报表流程上的表现较此前模型改善近 40%,但在整个 BAR 任务集上的平均改善约为 3%。

这两个数字应当同时保留:它说明某些场景的收益很大,也说明不能把单项结果推广为整体能力提升 40%。最终判断仍由专业人员完成。

对普通办公用户,Astra 的定位则是按照模板和指令生成文档、表格、演示材料,并在用户补充要求后继续调整。

例如,制作一份项目汇报时,用户通常不会一次写清所有要求。数据可能中途更新,听众可能改变,某一页也可能临时要求重做。这样的协作考验模型能否保留原目标,把新要求加入已有工作,而不是每次收到消息都重新开始。

开发者文档列出的变化,也在围绕这类连续工作展开。

Astra 支持异步工具调用:工具尚未返回时,可以继续处理不依赖该结果的工作;支持任务进行中的用户指令调整,在保留已完成工作的基础上继续执行;还可以在对话中调整推理强度,同时保留缓存。

4 安全问题成重中之重

OpenAI 在发布前披露,Astra 在 ExploitBench 上达到 100%,该评估考察从已知漏洞构造可用利用方式的能力。考虑到历史漏洞可能带来数据污染问题,公司又用近期披露的 20 个高严重性 V8 漏洞建立内部测试;测试过程中,模型还发现并利用了两个此前未知的漏洞。


这说明它具备更强的漏洞分析和验证能力,却不意味着普通用户能无限制调用这些能力。安全评估中的工具、权限和防护配置,与公开产品并不相同。

系统卡也给出了边界:外部机构 Irregular 的 FrontierCyber 测试中,Astra 解决 226 项挑战中的 86 项,Sol 解决 34 项;但两者都没有完成七项 Elite 挑战。

官方 API 文档显示,Astra 上下文窗口为 105 万 Token,最大输出为 12.8 万 Token;标准价格为每百万输入 Token 10 美元、输出 Token 50 美元,缓存输入为每百万 Token 1 美元。输入超过 27.2 万 Token 时,整个请求的输入及缓存费率翻倍,输出费率为原来的 1.5 倍。

这意味着它适合处理很长的材料,但大上下文并非没有额外代价。对于反复读取代码仓库、财务文件或研究材料的应用,缓存利用、重试次数与人工复核,都会影响最终成本。

这次发布值得观察的产品变化,是 AI 能否把“读材料、做修改、运行软件、检查结果”连续完成。游戏原型、财务核对和编程测试已经给出了具体样本。

接下来,用户需要验证的是:这些能力在自己的任务里能稳定复现多少,以及最终能省下多少修改和检查时间。

https://deploymentsafety.openai.com/gpt-6-astra

https://www.cnbc.com/2026/09/03/open-ai-astra-gpt-6-cyber.html

https://thenewstack.io/openai-gpt6-astra-benchmarks/

声明:本文为 InfoQ 整理,不代表平台观点,也不构成投资建议,未经许可禁止转载。

会议推荐

QCon 全球软件开发大会·2026(上海站)现已正式启动。本届大会聚焦 Harness AI 时代的工程实践,从「构建 AI」到「驾驭 AI」,围绕 AI Native 架构、Agent Runtime、AI Infra、Agent 安全与可观测、Loop Engineering、具身智能与世界模型等热门技术方向,邀请全球技术社区与产业一线实践者,共同分享 AI Native 时代最具价值的工程经验。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
袁咏仪55岁生日,儿子准备的“包”蛋糕,精准狙击妈妈软肋!

袁咏仪55岁生日,儿子准备的“包”蛋糕,精准狙击妈妈软肋!

娱乐小叨叨
2026-09-05 15:20:53
性专家说:当一个异性开口跟你要钱,要礼物,不管对方是不是想试探你的真心,你都应该明白,你已被对方列入供养者行列

性专家说:当一个异性开口跟你要钱,要礼物,不管对方是不是想试探你的真心,你都应该明白,你已被对方列入供养者行列

心理观察局
2026-08-05 06:46:04
郑钦文惊天逆转赢下比赛,赛后两字回应太有风度!给足凯斯面子,网友:这情商太高了!

郑钦文惊天逆转赢下比赛,赛后两字回应太有风度!给足凯斯面子,网友:这情商太高了!

心如止水o
2026-09-06 04:46:51
大吵一架后,日本计划再派人访华,不到24小时,中方回应3句话

大吵一架后,日本计划再派人访华,不到24小时,中方回应3句话

史料布籍
2026-09-05 18:56:50
控糖要多做这类运动,每周2~3次,看图就会,很简单——

控糖要多做这类运动,每周2~3次,看图就会,很简单——

BRTV新闻
2026-07-24 07:06:57
“清一色的脖子前倾!”一张学生军训照片,让家长心里不是滋味

“清一色的脖子前倾!”一张学生军训照片,让家长心里不是滋味

熙熙说教
2026-08-30 13:35:48
中方1票否决19国,中方硬刚特朗普,拒签联合声明绝不让步

中方1票否决19国,中方硬刚特朗普,拒签联合声明绝不让步

近史博览
2026-09-05 07:38:10
韩媒放狠话!汉字并非中国独有,它是亚洲瑰宝,韩国也将实施全民汉字教育

韩媒放狠话!汉字并非中国独有,它是亚洲瑰宝,韩国也将实施全民汉字教育

小徐讲八卦
2026-09-04 13:48:19
37岁奥巴梅扬4场6球!150万欧超值引援引爆西甲

37岁奥巴梅扬4场6球!150万欧超值引援引爆西甲

带你逛体坛
2026-09-06 12:12:08
《华盛顿邮报》和福山点评特朗普亲俄,说得太准了

《华盛顿邮报》和福山点评特朗普亲俄,说得太准了

鹰眼Defence
2026-09-05 16:06:14
女篮爆冷错失王牌!巴特尔怒批一针见血,狠狠揭穿中国篮坛遮羞布

女篮爆冷错失王牌!巴特尔怒批一针见血,狠狠揭穿中国篮坛遮羞布

鹤羽说个事
2026-09-06 01:25:26
牵手门女主三年后现状曝光:注销账号、隐姓埋名,代价远超想象

牵手门女主三年后现状曝光:注销账号、隐姓埋名,代价远超想象

四海神君
2026-09-04 09:10:19
9月起全国上门摸底!家里有60岁以上老人注意,不是查账不是问责

9月起全国上门摸底!家里有60岁以上老人注意,不是查账不是问责

奇葩游戏酱
2026-09-06 03:59:58
严子怡:有起伏因吃蛋糕闹肚子 赛后北口榛花教练主动跟卢秀荣握手

严子怡:有起伏因吃蛋糕闹肚子 赛后北口榛花教练主动跟卢秀荣握手

劲爆体坛
2026-09-06 12:07:04
2-1,美网16强对阵诞生,郑钦文下下签,0胜6负面临巨大挑战

2-1,美网16强对阵诞生,郑钦文下下签,0胜6负面临巨大挑战

南海浪花
2026-09-06 05:41:00
一个“搞定”牙痛、牙齿松动的古方,两味中药,保护你的牙齿健康

一个“搞定”牙痛、牙齿松动的古方,两味中药,保护你的牙齿健康

神希园
2026-08-29 12:05:08
“100%椰子水”大翻车!配料表仅有“椰子水” 却检出山梨酸及钾盐

“100%椰子水”大翻车!配料表仅有“椰子水” 却检出山梨酸及钾盐

闪电新闻
2026-09-05 11:21:22
你的存款到了哪一档,距离不工作还有多远?100万存银行月息1100,一年13200,不够两个月工资。

你的存款到了哪一档,距离不工作还有多远?100万存银行月息1100,一年13200,不够两个月工资。

捣蛋窝
2026-09-06 01:14:09
助特朗普入局委内瑞拉的亿万富豪:从委石油公司侵吞超10亿美元;出卖马杜罗,给美方传递信息封锁自己的祖国;公司美国不投一分钱占股35%

助特朗普入局委内瑞拉的亿万富豪:从委石油公司侵吞超10亿美元;出卖马杜罗,给美方传递信息封锁自己的祖国;公司美国不投一分钱占股35%

扬子晚报
2026-09-06 08:41:19
大众正式调查星宇股份,金主爸爸亲自上门查账,星宇很慌。

大众正式调查星宇股份,金主爸爸亲自上门查账,星宇很慌。

辉哥说动漫
2026-09-04 13:59:27
2026-09-06 12:43:00
InfoQ incentive-icons
InfoQ
有内容的技术社区媒体
12906文章数 52053关注度
往期回顾 全部

科技要闻

DeepSeek被曝将采购16万颗华为昇腾950DT

头条要闻

5架退役民航客机被打包拍卖 起拍价500万元

头条要闻

5架退役民航客机被打包拍卖 起拍价500万元

体育要闻

本西蒙斯加盟国王,不管怎样,回来就好

娱乐要闻

低调富养!郭富城两女儿入读香港名校

财经要闻

亏损高达200亿,昔日彩电霸主走下巅峰!

汽车要闻

带升降立标MPV 岚图梦想家9预售价42.99万起

态度原创

数码
手机
亲子
家居
公开课

数码要闻

V社为Meta Quest头显Steam Link应用新增USB有线串流功能

手机要闻

OPPO卓世杰透露Find X10系列手机将新增色盘功能

亲子要闻

平时忙碌,亏欠了孩子很多陪伴。趁着闲暇,带两个小朋友出门撒欢,看着他们开心奔跑的样子,瞬间觉得一切都值得,简单的幸福莫过于此。

家居要闻

2026建博会(广州) 公装联探展交流活动

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版