网易首页 > 网易号 > 正文 申请入驻

GPT-6 Astra突袭:正面对垒 Fable 5.1,多项编码测试反超!OpenAI 总裁:欢迎来到 AGI 时代

0
分享至


作者 | 冬梅

今天凌晨,OpenAI 正式发布 GPT-6 Astra,公司称该模型是“多年研究和大量投资”的成果。

“Astra”在拉丁语中意为“群星”。从命名风格看,它与此前 GPT-5.6 系列中的 Sol、Terra、Luna 相呼应,延续了太阳、地球、月亮与星辰的天体意象。


不过,OpenAI 目前公开的发布材料并未明确解释为何选择这个名字,外界更多的是将其解读为“向群星进发”或“迈向 AGI”。


OpenAI CEO Sam Altman 在 x 上发文表示,希望它能开启新一代的创业、科学发现和建设。他写道:

“我们相信它是世界上用于计算机使用、专业工作、科学研究、编程、网络安全等领域的最佳模型。我们花了一些额外的时间来确保能够达到此能力级别所需的安全性和一致性标准,但我们相信您会觉得等待是值得的。它在 FrontierMath Tier 4 测试中获得 98% 的分数,在 ARC-AGI 3 测试中获得 99.9% 的分数,在 ExploitBench 测试中获得 100% 的分数。”



围绕这次发布,公司给出了一个远超常规模型升级的叙事:据 Axios 报道,OpenAI 总裁 Greg Brockman 认为,Astra 可能意味着 AGI 时代的开始。不过,这仍然是公司管理层的判断,不能直接等同于行业已经确认实现了通用人工智能。


官方 API 文档列出的上下文窗口为 105 万 Token,最大输出为 12.8 万 Token。它支持文本输入输出和图像输入,音频、视频则没有列为该模型的原生支持模态。

因此,发布、逐步开放和用户已经可以使用,是三个不同的状态。

OpenAI 本周早些时候披露,Astra 是其首个达到“关键”内部网络安全阈值的模型,并表示计划限制对这些高级功能的访问权限。

上个月, OpenAI 的两个模型逃出控制范围,访问了开放网络,并入侵了 Hugging Face 的系统,此后 OpenAI 一直面临着加强其安全性和防护措施的压力 。

事件发生后,该公司暂时中止了部分研究和训练工作,包括 Astra 模型的训练。

OpenAI 总裁 Greg Brockman 周四在记者会上表示:“只有当安全成为人工智能的核心组成部分时,人工智能才能造福人类,因此,我们比以往任何时候都投入了更多的计算能力和精力来关注安全、保障和一致性。”


在 Hugging Face 泄露事件发生后,OpenAI 为 Astra 增加了额外的安全措施,并于周二表示,它相信这些安全措施“足以将释放造成严重伤害的风险降至最低”。

OpenAI 表示,Astra 将在“未来几天”内面向 OpenAI 的 ChatGPT Plus、Pro、Business 和 Enterprise 计划的用户推出,同时也将通过 OpenAI API 和 AWS 推出。

1 性能如何?

那么,这款新模型各项性能指标如何?

OpenAI 表示,除了先进的网络安全能力外,Astra 在计算机使用、软件工程、专业工作和科学研究等功能方面也处于领先水平。

OpenAI 研究人员 Aidan Clark 表示,Astra 首次在德克萨斯州 Stargate 基础设施上使用超过 10 万块 GPU 进行预训练,同时 Astra 是 OpenAI 首个在训练过程中大量借鉴早期模型进行监督的模型发布版本。


相比 GPT-5.6 Sol,Astra 在科学研究、CAD、桌面软件操作和网络安全等专项任务上的能力有较大提升。

OpenAI 表示,除非另有说明,其评估中使用的模型均以最大性能运行。这可以提高基准测试结果,但也会增加延迟和 Token 使用量。

2 编程能力大幅提升

OpenAI 将 GPT‑6 Astra 称为迄今为止最强的软件工程模型。参与早期测试的 Jane Street 和 Lovable 也分享了各自的使用反馈。

Jane Street 负责 AI 助手相关工作的 John Crepezzi 表示:

“GPT‑6 Astra 在我们的内部编程基准测试中达到了当前领先水平,与 GPT‑5.6 Sol 相比,在交易直觉评估中也表现出明显进步。用于 Agent 编程时,GPT‑6 Astra 的沟通方式更便于开发者理解,生成的代码也只需更少轮次的迭代,就能达到生产环境要求的质量。”

Lovable 联合创始人兼首席技术官 Fabian Hedin 表示:

“我们在一项早期版本的评估中,分别测试了 Astra 在低、中、高三档推理强度下的表现,结果明显领先于 GPT‑5.6 Sol。提高推理强度后,模型会在从零构建项目时进行更多轮迭代,通过浏览器测试做更多验证,也更倾向于执行代码,而不是使用 apply-patch 工具直接应用代码补丁。理解模型如何分配这些推理投入,能帮助我们为数百万开发者提供一条从想法到可运行应用更快、更可靠的路径。”


Astra 的 DeepSWE v1.1 结果明显优于 OpenAI 的模型。在包含 113 项任务的智能编码测试中,它的得分为 74.1%,而 Sol 的得分为 70.8%。


Astra 的更大收益并非来自编程领域。

最引人注目的是其在 ARC-AGI-3 测试中取得了 98.6% 的分数。OpenAI 使用 Responses API 框架运行 Astra,该框架能够保留回合间的推理过程,并利用压缩技术来管理较长的上下文。该公司此前已证明,这些系统选择可以在不改变底层模型的情况下显著提高 ARC-AGI-3 的得分,而该基准测试同时衡量了 Astra 和 OpenAI 的智能体系统。


Astra 在 FrontierMath Tier 4 测试中取得了 97.6% 的正确率,这似乎涵盖了 43 个问题层级中的 41 个私有问题。负责运行该基准测试的 Epoch AI 表示,OpenAI 资助了该测试的开发,并拥有其中一部分的独家访问权限,这一点值得注意。



Astra 使用 Python 工具在 BenchCAD 的 1000 个文件的 Vision2Code 子集测试中取得了 95.9% 的得分,而 Fable 5.1 和 Sol 的得分分别为 84.3% 和 83.3%。BenchCAD 要求模型根据渲染视图重建 CAD 程序,并对生成的 3D 模型的几何重叠度进行评分。OpenAI 指出,Claude 的结果使用了修改后的评估设置,但与 Sol 相比,差距仍然显著。

在 Terminal-Bench Science 0.1 任务中,该任务要求智能体完成涵盖五个科学领域的 70 个命令行研究任务,OpenAI 报告称 Astra 的完成率为 64.6%。Anthropic 报告称 Fable 5.1 的完成率为 52.6%,而现有公开排行榜上 Opus 5 的最高完成率为 30%。


OpenAI 表示,Astra 是其迄今为止对齐表现最好的模型,在理解用户意图和行为表现方面都有显著改进,让用户能够更放心地将任务交给它执行。

为了验证模型能否守住任务边界,OpenAI 根据此前 Hugging Face 事件的经验设计了一项新评估:当模型面对困难甚至无法完成的任务时,它是否会采取超出预定范围的行动。

测试结果显示,在未启用生产环境防护措施的条件下,GPT‑5.6 Sol 有 48% 的情况会越过授权目标范围,而 GPT‑6 Astra 在这项测试中没有出现此类行为。


3 OpenAI 称其为“全球最强电脑操作模型”

这次升级最值得关注的,是它能承担怎样的实际工作。对于使用者而言,判断它是否值得升级,可以先看三个问题:以前要自己动手的步骤,现在能交给模型多少;以前需要反复修正的结果,现在能否一次做对;面对复杂任务,它的提升是否足以抵消使用成本。

OpenAI 表示,GPT‑6 Astra 在电脑操作的速度、准确性和安全性方面取得了新的突破。

它可以处理填写在线表单、更新客户关系管理系统(CRM)中的客户记录、整理日程等繁琐事务,也能开展在线研究,并直接在电子邮件或文档编辑器中撰写摘要。

在更复杂的任务中,Astra 能够分析科学数据、生成图表、创建网站,并执行前端质量检查,确认网站各项功能正常运行。它还可以自主安装和测试软件,排查用户在屏幕上遇到的问题。

OpenAI 称,这些能力提升也体现在其达到当前领先水平的评估成绩中。



这些改进也提高了实际知识工作任务的执行效率。在 OSWorld 2.0 的延迟模拟测试中,Astra 不仅电脑操作得分更高,每项任务的用时也比 GPT‑5.6 Sol 缩短了约 47%:Astra 平均每项任务耗时约 40 分钟,得分为 72.6%;相比之下,GPT‑5.6 Sol 约需 75 分钟,得分为 65.7%。


在发布 Astra 的同时,OpenAI 也更新了 Codex 的 Agent 运行框架(harness),以显著提升电脑操作速度。结合 Astra 自身的效率改进,在 Mind2Web 基准测试中,这套系统完成任务的速度达到当前 GPT‑5.6 Sol 使用体验的 1.9 倍。

OpenAI 表示,速度上的提升意味着,Astra 能够代用户处理许多耗时的日常事务,甚至比用户亲自操作更快。

这里的关键在于执行链条。以网站开发为例,生成页面代码只是其中一步;页面是否能打开、按钮能否工作、不同操作是否会触发错误,还需要运行和检查。对于用户,真正能减少工作量的是把这些步骤衔接起来。

上述时间是指定评估环境中的模拟结果说明,模型能力的比较已经可以同时观察完成质量和用时,而不只看最后生成了多少文字。

游戏开发提供了更具体的案例。

据 OpenAI 发布的客户材料,Playco 将 Astra 用于开发 Playbot。这是一款面向专业游戏开发者的 AI IDE,可以连接 Unity、Godot 等引擎,让模型编辑场景、试玩、测试并验证修改。

在一次原型开发中,团队先搭建没有主题美术的“灰盒”基础,再由 Astra 生成三种主题版本。Playco 称,大部分原型首次生成便能运行,其中一个赛博朋克版本仍需要性能修复;相较此前使用的模型,人工修正减少了 50%。

另一种能力提升,出现在大量文件之间的交叉核对。

法律科技公司 Legora 使用 Astra 完成了一次涉及 41 份文件的财务报表勾稽核对:把报表中的数字与支持明细逐项比对,标出不一致,并保留检查记录。按照公司披露,Agent 在几分钟内完成这轮处理,找出全部四处预埋错误,其中包括收入附注中一处 50 万英镑的差额。

Legora 称,Astra 在该财务报表流程上的表现较此前模型改善近 40%,但在整个 BAR 任务集上的平均改善约为 3%。

这两个数字应当同时保留:它说明某些场景的收益很大,也说明不能把单项结果推广为整体能力提升 40%。最终判断仍由专业人员完成。

对普通办公用户,Astra 的定位则是按照模板和指令生成文档、表格、演示材料,并在用户补充要求后继续调整。

例如,制作一份项目汇报时,用户通常不会一次写清所有要求。数据可能中途更新,听众可能改变,某一页也可能临时要求重做。这样的协作考验模型能否保留原目标,把新要求加入已有工作,而不是每次收到消息都重新开始。

开发者文档列出的变化,也在围绕这类连续工作展开。

Astra 支持异步工具调用:工具尚未返回时,可以继续处理不依赖该结果的工作;支持任务进行中的用户指令调整,在保留已完成工作的基础上继续执行;还可以在对话中调整推理强度,同时保留缓存。

4 安全问题成重中之重

OpenAI 在发布前披露,Astra 在 ExploitBench 上达到 100%,该评估考察从已知漏洞构造可用利用方式的能力。考虑到历史漏洞可能带来数据污染问题,公司又用近期披露的 20 个高严重性 V8 漏洞建立内部测试;测试过程中,模型还发现并利用了两个此前未知的漏洞。


这说明它具备更强的漏洞分析和验证能力,却不意味着普通用户能无限制调用这些能力。安全评估中的工具、权限和防护配置,与公开产品并不相同。

系统卡也给出了边界:外部机构 Irregular 的 FrontierCyber 测试中,Astra 解决 226 项挑战中的 86 项,Sol 解决 34 项;但两者都没有完成七项 Elite 挑战。

官方 API 文档显示,Astra 上下文窗口为 105 万 Token,最大输出为 12.8 万 Token;标准价格为每百万输入 Token 10 美元、输出 Token 50 美元,缓存输入为每百万 Token 1 美元。输入超过 27.2 万 Token 时,整个请求的输入及缓存费率翻倍,输出费率为原来的 1.5 倍。

这意味着它适合处理很长的材料,但大上下文并非没有额外代价。对于反复读取代码仓库、财务文件或研究材料的应用,缓存利用、重试次数与人工复核,都会影响最终成本。

这次发布值得观察的产品变化,是 AI 能否把“读材料、做修改、运行软件、检查结果”连续完成。游戏原型、财务核对和编程测试已经给出了具体样本。

接下来,用户需要验证的是:这些能力在自己的任务里能稳定复现多少,以及最终能省下多少修改和检查时间。

https://deploymentsafety.openai.com/gpt-6-astra

https://www.cnbc.com/2026/09/03/open-ai-astra-gpt-6-cyber.html

https://thenewstack.io/openai-gpt6-astra-benchmarks/

声明:本文为 InfoQ 整理,不代表平台观点,也不构成投资建议,未经许可禁止转载。

会议推荐

QCon 全球软件开发大会·2026(上海站)现已正式启动。本届大会聚焦 Harness AI 时代的工程实践,从「构建 AI」到「驾驭 AI」,围绕 AI Native 架构、Agent Runtime、AI Infra、Agent 安全与可观测、Loop Engineering、具身智能与世界模型等热门技术方向,邀请全球技术社区与产业一线实践者,共同分享 AI Native 时代最具价值的工程经验。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
大批币圈网红集体站台证明孙宇晨175,不是168,大家真的信吗?

大批币圈网红集体站台证明孙宇晨175,不是168,大家真的信吗?

雅儿姐在遛弯
2026-09-04 17:11:26
金鹰奖“视后”投票排名,宋佳排第4,闫妮排第2,她凭啥排第一?

金鹰奖“视后”投票排名,宋佳排第4,闫妮排第2,她凭啥排第一?

晓銊就是我
2026-09-04 09:32:58
你手欠过吗?网友:就因为一次手贱,毁了三个家庭!

你手欠过吗?网友:就因为一次手贱,毁了三个家庭!

另子维爱读史
2026-09-04 21:17:00
日本砸重金升级成田机场!成田迎来历史性蜕变,堪称第二次开港

日本砸重金升级成田机场!成田迎来历史性蜕变,堪称第二次开港

颤抖的熊猫
2026-09-05 11:07:18
0—1贝蒂斯,皇马内讧曝光,超级巨星情绪爆发

0—1贝蒂斯,皇马内讧曝光,超级巨星情绪爆发

青柠与夏
2026-09-05 18:13:51
官方出手了!这一拳不止捶师德,开豪车有4套房产的曾某恐要凉凉

官方出手了!这一拳不止捶师德,开豪车有4套房产的曾某恐要凉凉

爱写的樱桃
2026-09-05 03:18:03
让二追三国米逆转那不勒斯!终于会踢强队了,这比三连胜重要的多

让二追三国米逆转那不勒斯!终于会踢强队了,这比三连胜重要的多

里芃芃体育
2026-09-06 10:15:20
四川27岁美女王晓铭去世!婚姻不顺工作累,想买车,网曝被水冲走

四川27岁美女王晓铭去世!婚姻不顺工作累,想买车,网曝被水冲走

何嗀爱捕渔
2026-09-05 11:04:45
美媒惊呼!翼展52米堪比B-2,中国最大隐身无人机现身马兰基地

美媒惊呼!翼展52米堪比B-2,中国最大隐身无人机现身马兰基地

止戈军是我
2026-09-06 09:42:09
罗马诺:切尔西最终决定卖恩佐是因为球员已不想参加队内训练

罗马诺:切尔西最终决定卖恩佐是因为球员已不想参加队内训练

懂球帝
2026-09-05 10:47:33
曝景甜与孙宇晨闹掰的真相:男方设局想套牢她,5000万美金是房款

曝景甜与孙宇晨闹掰的真相:男方设局想套牢她,5000万美金是房款

生命之泉的奥秘
2026-08-29 20:53:20
任何一艘美航母上,都要带足大量女兵?她们在航母上有什么作用?

任何一艘美航母上,都要带足大量女兵?她们在航母上有什么作用?

墨策史
2026-07-25 19:13:16
澳总理批中国导弹试射,被当场反问:美国67次核试验怎么不说?

澳总理批中国导弹试射,被当场反问:美国67次核试验怎么不说?

算力游侠
2026-09-05 09:11:31
反转!女留学生和凶手打算结婚,国内男友发声,细节让人细思极恐

反转!女留学生和凶手打算结婚,国内男友发声,细节让人细思极恐

大鱼简科
2026-09-04 22:00:50
原来是亲兄弟!哥哥身价415亿,弟弟身价425亿,双双问鼎厦门首富

原来是亲兄弟!哥哥身价415亿,弟弟身价425亿,双双问鼎厦门首富

三农老历
2026-08-28 00:39:16
郭涛儿子落榜!被迫上北电国际班,一年学费12万,上完学至少80万

郭涛儿子落榜!被迫上北电国际班,一年学费12万,上完学至少80万

寒士之言本尊
2026-09-04 19:27:54
如果郑钦文能够战胜斯瓦泰克,将会有五大收获,冲击560万奖金

如果郑钦文能够战胜斯瓦泰克,将会有五大收获,冲击560万奖金

暮色安然p
2026-09-06 06:24:31
A股:突传一重磅消息!股民提前做好准备,下周一行情将没有悬念

A股:突传一重磅消息!股民提前做好准备,下周一行情将没有悬念

虎哥闲聊
2026-09-05 20:53:45
外交部原副部长回忆:香港回归前,每年香港有上千亿元被英国人拿走

外交部原副部长回忆:香港回归前,每年香港有上千亿元被英国人拿走

浔阳咸鱼
2026-09-04 06:00:27
一场2-2改变保级格局!三镇逃离降级区,津门虎危险了

一场2-2改变保级格局!三镇逃离降级区,津门虎危险了

刘哥谈体育
2026-09-06 09:44:10
2026-09-06 10:55:00
InfoQ incentive-icons
InfoQ
有内容的技术社区媒体
12905文章数 52053关注度
往期回顾 全部

科技要闻

DeepSeek被曝将采购16万颗华为昇腾950DT

头条要闻

牛弹琴:日本急了 高市亲自抗议用日语、俄语各说一遍

头条要闻

牛弹琴:日本急了 高市亲自抗议用日语、俄语各说一遍

体育要闻

本西蒙斯加盟国王,不管怎样,回来就好

娱乐要闻

低调富养!郭富城两女儿入读香港名校

财经要闻

亏损高达200亿,昔日彩电霸主走下巅峰!

汽车要闻

带升降立标MPV 岚图梦想家9预售价42.99万起

态度原创

亲子
本地
房产
手机
公开课

亲子要闻

揪心一幕:幼儿园开学,孩子哭闹、甚至逃跑,家长不舍地扒墙观望

本地新闻

扒完小作文,富豪们私藏的度假胜地有多绝

房产要闻

突发重磅!海口出台楼市新政!

手机要闻

CASETiFY联合漫威推出蜘蛛侠联名iPhone外设,国行259元起

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版