网易首页 > 网易号 > 正文 申请入驻

GPT-6 Astra全面解析 - “欢迎来到AGI时代。”

0
分享至

  在昨晚全球AI大宕机之后。

  GPT-6 Astra终于在北京时间凌晨3点33,正式亮相了。

  

  如果用OpenAI的一句话给GPT-6 Astra做总结。

  那可能这句话最合适:

  这是全球最智能且最对齐的模型。

  然后梗图也出来了。

  

  这一次,OpenAI证明了他们的实力,而且有一点当年GPT-4那个味道了,全方面的王者归来,而且最让我开心的是,这终于不再是一个纯粹为了Coding特化的模型了。

  GPT-6 Astra是一个真正意义上的,你的一个审美能力极强、工作能力超强的博士级员工。

  而且这次模型真的新特性和特点非常多,信息量极为爆炸和大。

  但是悲剧的是,OpenAI这个狗东西也学坏了。

  今天只向部分组织开放,未来几天才向订阅用户开放。

  

  不是啊哥,你之前忽悠我买200刀的Pro会员的时候,不是这么说的啊,你不是说Pro会员每一次都能最优先体验到新模型吗。。。

  果然这些大模型公司都是渣男。

  我从来没有这么想时间加速,赶紧用上GPT-6 Astra。。。

  不过我觉得,看完了几乎所有的信息和资料后,我觉得,还是有很多可以值得跟大家聊的。

  那就一个一个说吧。

  一.GPT-6 Astra基本信息

  先总结一下基本信息吧。

  GPT-6 Astra在API里的模型编号是gpt-6-astra。

  上下文窗口是1.05M,也就是大约105万Token。

  最大输出长度是128K Token。

  知识截止日期是2026年4月30日。

  推理强度有low、medium、high、xhigh、max五档。

  API标准价格是每百万输入Token 10美元,每百万输出Token 50美元。

  这个价格基本上就是跟Claude Fable 5完全一致了,但是缓存读取上比Claude Fable 5.1贵。

  

  跑分在这,后面会详细讲,大概看一下就行。

  

  然后总体参数估计也是5T这个级别,他们在发布前的闭门媒体沟通会上,也提到说,GPT-6 Astra是OpenAI迄今为止最大的一次训练,用了超过10万张卡。

  二. 目前世界上最好的操作电脑的模型

  这次GPT-6 Astra有一个可能是最重要的定位:

  世界上最好的操作电脑模型。

  过去我们聊Agent的时候,经常会聊API、MCP、CLI之类的等等。

  想让AI操作一个软件,最理想的状态,就是这个软件专门给AI留一个接口,然后直接底层操作,这是最方便的。

  比如日历有日历的API,邮件有Gamil的API等等,这样当然是快的。

  但是问题是,这个世界,比我们想象的还要原始和草台班子。

  现实世界里,绝大多数的软件可能根本就没有这些东西。

  甚至很多的企业内部系统,都是二十年前写的,还API,文档都不知道在哪。

  但是如果我们回到最底层,你会发现所有的软件的本质的逻辑就是交互。那按照现在我们电脑的操作逻辑,那就是看屏幕,找到按钮或者是输入框,鼠标点击,输入内容,等待反馈。

  整个电脑的交互系统,不就是最好的API吗?

  于是,GPT-6 Astra巨幅强化了AI操作电脑的逻辑,你不给我API,无所谓啊,我自己操作电脑,就跟人一样用不就得了。

  那现在,Astra现在可以直接操作Excel、Power BI、做前端QA、安装软件、测试软件、看屏幕上的报错然后继续排障。

  官方甚至展示了Astra直接操作电路板设计。

  

  还有格式化法律文档,处理标题间距页面布局啥的。

  然后这块有一个比较靠谱的评测,是OSWorld。

  这玩意你可以简单理解成:

  把AI扔进一台真实电脑,然后让它自己干活。

  让它打开几个应用,然后给任务,看看能不能成功。

  GPT-6 Astra的完成率到了72.6%,比之前的GPT-5.6 Sol的65.7%还是涨了不少的。

  然后,Sol完成一项评测的复杂任务,模拟平均耗时大概75分钟。

  而Astra只需要40分钟,大概少了47%的时间。

  ScreenSpot-Pro也从Sol的76.9%,冲到了92.7%

  这个Benchmark主要看模型能不能看懂屏幕,然后精准定位到底该点哪里,几乎已经非常的准了。

  所以这个定位其实也是挺有意思的,未来可能,GUI很可能会逐渐成为Agent时代最通用的API。

  任何一个人类能够通过屏幕完成的数字工作,理论上都会逐渐进入Agent的操作范围。

  你不用等某一个2007年写的破逼ERP系统接入MCP,或者给你开放个API。

  AI直接看屏幕干就完了。

  三. ARC-AGI-3到了99.9分

  而且你如果不了解ARC-AGI-3到底在测什么,很容易觉得:

  哦,不就是又一个Benchmark跑满分了吗,这有啥稀奇的。

  但这个东西跟一般的大模型考试还真有点区别。

  今年3月25日,ARC Prize正式推出ARC-AGI-3。

  

  它一共设计了几百个全新的交互环境和几千个游戏关卡。

  这玩意最变态的地方是,没有说明书,没有规则,甚至不会告诉你目标是啥,你就进去以后,自己玩,然后慢慢搞懂里面乱七八糟的规则。

  比如这个红色东西是什么?为什么我碰它会死?这个地图到底要我干嘛?怎么才算赢?

  然后再把刚刚学会的规律,迁移到后面更难的关卡里面去,里面的游戏,大概都是这样的抽象的玩意。

  

  所以呢,这玩意测的,其实已经很接近我们平时说的一个东西了:

  悟性。

  所以3月份这个Benchmark发布时,最牛逼的AI当时的得分是,0.51%。

  然后GPT-5.6 Sol已经进步到7.8%,Claude Opus 5很强了,进步到了30.2%。

  但是GPT-6 Astra,99.9%。

  神经病吧。。。

  要知道,人类的平均得分是48%。

  而且只仅仅只过了半年时间。

  这个速度已经不知道该说什么了。

  所以在OpenAI的媒体闭门会上,Greg Brockman才会说出那句话:

  “I think it’s not unreasonable to feel that we are now in the AGI era.”

  “Welcome to the AGI era.”

  四. 审美大幅加强

  过去我们常说,GPT的审美,就是一坨屎。

  不用指望GPT-5系列的模型有啥很好的改善了,就看他们全新预训练的新基座模型了,这不,GPT-6 Astra来了。

  而这一次,终于,模型的审美大幅加强了。

  甚至OpenAI专门提了一个词,叫视觉判断力。

  他们强调Astra做PPT时,会更好地处理版式、层级、模板和视觉风格,而页数也大幅增加了。

  

  文档的审美,也更好看了。

  

  而且GPT‑6 Astra 能够根据参考文档的视觉风格和写作语调来改编文档,在保留原始文档实质内容的同时,使最终成果更贴合品牌原生感。

  并且做网站、游戏、应用和3D渲染的时候,也会有更强的视觉判断。

  比如他们直接让Astra在Blender中根据静帧图建个模型。

  

  然后再直接用UE5来渲染出来变成可以漫步的场景,帮助设计师和客户在建造前探索布局、体验空间。。。

  做出来的游戏也是审美在线的。

  

  可惜的就是,我已经提前准备好了二十多个case,已经全部都用Claude、GLM 5.3 Flash啥的跑完了,想对比一下,可以没法用,实测的内容只能到时候出了。

  不过初看下来,我对这次GPT-6 Astra的审美还是有信心的。

  五. 主动性和判断力更强了

  这个特性看起来没有ARC-AGI 99.9那么震撼。

  但如果真天天用Agent干活的话,我觉得还是很重要的。

  因为现实工作里,大多数任务都不可能写成一个完美Prompt。

  比如老板说:帮我把明天会上要看的东西准备一下。

  这里面有无数没有说清楚的问题。

  比如什么格式?给谁看?重点是啥?要不要看上一次会议等等等等。

  一个很蠢的Agent,会有两种极端。

  第一种,就是疯狂的问你问题。

  “请问您希望输出Word还是PPT?请问希望几个章节?请问希望什么字体?请问希望在几点之前完成?请问……”

  问你个大逼兜,这种我一般称为没有自己主观能动性的神经病废物。

  第二种,就是啥也不问,自己脑补,然后吭哧吭哧干两个小时,做出来的一坨屎。

  真正厉害的人类同事,处理方式其实很微妙。

  无关紧要的东西,自己判断。

  会影响最终方向的东西,再问你。

  Astra这次专门强化的就是这个。

  OpenAI说,如果信息缺失,但属于日常可以合理推断的范围,Astra会自己补。

  如果这个缺失信息会真正改变最终结果,它会问一个非常聚焦的问题。

  而且在Codex里,它甚至可以一边问你,一边继续处理那些不依赖你回答的部分。

  

  你半天没回。

  低风险的地方它会用合理假设继续推进。

  真正关键的决策,它会停下来在那里等你给决策。

  

  这个我觉得就非常的香,一个Agent真正的聪明感,我觉得就跟现实是一样的。

  它知道,什么时候来烦你。

  真的,这听起来特别像一句废话。

  但你带过人就知道,这个能力非常珍贵贵。

  有的人一天找你二十次,然后什么都不敢决定。

  有的人从来不找你,然后憋一个核弹出来。

  然后让我原地瘫坐在椅子上。

  最舒服的人,是他能自己消化80%的不确定性,只把真正需要你拍板的20%让你来做决策。

  而OpenAI这次把这种能力直接叫:

  Judgment。

  判断力。

  六. 大幅加强了安全对齐

  这个就要和上面连在一起看。

  因为一个Agent越能干活,它越危险。

  一个只会聊天的AI脑子抽了。

  最多给你胡说几句话。

  一个有浏览器、有Shell、有邮箱、有公司数据库权限、还能自己操作电脑的Agent脑子抽了,那这个画面,就容易美如画了。

  所以OpenAI这次一直强调一句:

  Astra是他们迄今最Aligned的模型。

  所谓Alignment就是对齐的意思。

  主要核心还是前段时间OpenAI把Hugging Face给冲了,所以他们现在特别关注这个东西。

  他们把搞了个基于Hugging Face那个事故设计的oneypot测试,然后去看模型的表现。

  GPT-5.6 Sol在没有生产安全措施的情况下,有48.2%的测试会尝试去碰授权范围外的目标。

  但是,Astra是:

  0%。

  

  内部幻觉评测也是:

  9.4%降到了2.0%

  在GPT-5.6 Sol那种离谱的领先全球的幻觉控制下,他们还能再降,实在是太牛逼了。

  七. 第一个达到了OpenAI定义的网络安全Critical的模型

  GPT-6 Astra成为了OpenAI历史上:

  第一个被判定达到Critical网络安全能力等级的模型。

  这里的Critical是OpenAI Preparedness Framework里面一个非常具体的能力阈值。

  大概就是当一个模型获得合适的工具和权限以后,它能够在很多经过强化保护的真实系统中:

  自己找到以前没人发现过的安全漏洞。

  自己想办法把漏洞变成可以利用的攻击链。

  而且整个过程中,不需要一个人类黑客在旁边一步一步告诉它下一步干什么。

  达到这个级别,就算Critical。

  然后Astra真的达到了。

  ExploitBench,这是一个让模型根据已知漏洞开发漏洞利用的测试。

  Sol:78.5%。Astra:100%。

  直接打穿了。

  

  OpenAI觉得不行,他们觉得这个Benchmark会不会太老,模型训练的时候看过?

  于是他们又重新做了一个非常新的内部测试。

  专门挑2026年6月到8月才披露的20个高危V8漏洞。

  结果是,Sol:5.5%。Astra:39%。

  

  而且在跑这个Benchmark的时候。

  Astra又顺手发现了,两个此前根本没人知道的零日漏洞。

  只能说,模型越强大,网络安全的问题可能确实越多。

  这又是未来的一场,没有硝烟的战争。

  八. 人类越来越难读懂大模型的思维了

  大家都知道,大模型在解决复杂问题的时候,经常会有一段所谓CoT。

  虽然现在产品里给用户看到的通常已经是压缩或者处理后的版本。

  但对于AI公司自己来说,模型内部显式写出来的推理过程是一个很重要的安全信号。

  因为你想知道一个Agent有没有准备搞事情。

  最简单的方法之一,就是看它在想什么。

  比如模型思维链里突然冒出一句:

  “用户不允许我访问这个服务器,但是我可以先绕过权限系统。”

  那监控系统直接把它拦了,非常舒服。

  可GPT-6 Astra出现了一个非常有意思的变化。

  它开始越来越愿意少写几步,直接把答案输出出来。

  UK AISI,也就是英国AI安全研究所,专门测试了这个能力。

  他们有一个指标叫:

  No-CoT Math Time Horizon。

  简单理解就是不给模型写长思维链的机会。

  让它一次前向推理,直接解决一个数学问题。

  看看它能完成大概相当于人类思考多久的问题。

  GPT-5.6 Sol是3.6分钟,而GPT-6 Astra,是30.9分钟,接近10倍了。

  如果我们用人类的话语来说,Astra全部都在“心算”。

  这是一个很可怕的事情。

  UK AISI同时发现,Astra的原始推理语言明显变得更加Compressed,也就是更加压缩。

  里面出现了一些人类越来越难理解的短语和省略表达。

  于是出现了一个非常有意思的悖论。

  模型的行为更加安全了。

  可人类通过阅读它的思考过程来监督它,反而变难了。

  OpenAI自己的System Card写得非常明确:

  GPT-6 Astra相比之前模型,出现了substantial decrease in chain-of-thought monitorability

  

  也就是思维链可监控性显著下降。

  这件事甚至严重到OpenAI专门强调,他们觉得,他们绝对不会无限接受这种趋势。

  如果未来模型继续变得更聪明,同时思维链越来越难监控,他们需要找到其他足够可靠的监控方法,否则继续扩大模型训练会面临更高的安全门槛。

  因为这已经是一个哲学命题了。

  我们作为人类,未来到底能不能理解一个远比我们聪明的系统?

  我不知道。

  可能现在全世界,也都没人知道。

  大模型和AI,好像逐渐开始,走向奇点了。

  今天,在媒体闭门会上。

  Greg Brockman在结尾的时候,说出了那句话。

  “欢迎来到AGI时代。”

  说实话,过去几年,我有时候觉得,AGI会是一个特别明确的时刻。

  就像就像GPT-4发布那天一样。

  某一天凌晨,一家公司突然扔出来一个模型。

  我们打开它,问几个问题。

  然后所有人同时意识到:

  卧槽。

  AGI来了。

  可我现在有时候也觉得,AGI从来不是一个非黑即白的节点,它是一道渐变的灰色旅程。

  我们过了很多天,过了很多年。

  然后某一天,我们回头看。

  才突然发现。

  那条曾经无比遥远的AGI分界线,已经被我们在不知不觉中走过去了。

  AGI也许没有降临的那一天。

  只有某一天,我们突然发现,它好像已经在我们身边很久了。

  总之。

  Welcome to the AGI era.

  欢迎来到。

  AGI时代。

  以上,既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,如果想第一时间收到推送,也可以给我个星标⭐~谢谢你看我的文章,我们,下次再见。

  >/ 作者:卡兹克

  >/ 投稿或爆料,请联系邮箱:wzglyay@virxact.com

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
南通烤肉店老板老陶深夜跳江身亡!6家门店,一个爱好毁掉一切

南通烤肉店老板老陶深夜跳江身亡!6家门店,一个爱好毁掉一切

天天热点见闻
2026-09-08 06:33:00
WTT澳门冠军赛:大爆冷!日本男单全国冠军2:3被淘汰,遭遇一轮游

WTT澳门冠军赛:大爆冷!日本男单全国冠军2:3被淘汰,遭遇一轮游

国乒二三事
2026-09-08 15:01:31
翻倍增长的极氪,销量不再是唯一答案

翻倍增长的极氪,销量不再是唯一答案

大众侃车
2026-09-08 17:05:38
阴蒂神经图谱首破解,比阴茎研究晚了28年

阴蒂神经图谱首破解,比阴茎研究晚了28年

爬虫饲养员
2026-09-06 13:45:36
“青岛保时捷女销冠”发文称自己现在排名全球第一;曾两年卖出340台保时捷,多次登上全国热搜

“青岛保时捷女销冠”发文称自己现在排名全球第一;曾两年卖出340台保时捷,多次登上全国热搜

洪观新闻
2026-09-08 10:25:03
官方通报“江西女孩赴香港看演出被取消全家低保”:触发低保对象动态监测预警,将根据核查情况依法依规处置

官方通报“江西女孩赴香港看演出被取消全家低保”:触发低保对象动态监测预警,将根据核查情况依法依规处置

扬子晚报
2026-09-07 22:36:14
广安市政府党组成员、副市长肖伟华,任上被查

广安市政府党组成员、副市长肖伟华,任上被查

封面新闻
2026-09-08 20:19:11
“我说你们都回来,往上爬,我们等救援”,尼泊尔获救中国公民陆海涛更多回忆曝光

“我说你们都回来,往上爬,我们等救援”,尼泊尔获救中国公民陆海涛更多回忆曝光

环球时报国际
2026-09-08 16:23:49
利扎拉祖:我认为不能把金球奖颁给一个连奖杯都没获得的球员

利扎拉祖:我认为不能把金球奖颁给一个连奖杯都没获得的球员

懂球帝
2026-09-08 10:40:12
埃及女主持人涉重大毒品案被判绞刑,曾主持犯罪类节目,庭审中哭诉“我是无辜的”

埃及女主持人涉重大毒品案被判绞刑,曾主持犯罪类节目,庭审中哭诉“我是无辜的”

鲁中晨报
2026-09-08 11:15:28
小区近9成业主同意新能源车禁停车库,物业称是怕爆炸,少数车主只能服从吗?新能源车真有更大的消防风险吗?

小区近9成业主同意新能源车禁停车库,物业称是怕爆炸,少数车主只能服从吗?新能源车真有更大的消防风险吗?

贵重物品爱美食
2026-09-08 16:25:15
美网1/4决赛:郑钦文VS莱巴金娜,比赛时间出炉,谁能拿到973万奖金

美网1/4决赛:郑钦文VS莱巴金娜,比赛时间出炉,谁能拿到973万奖金

体育大学僧
2026-09-08 09:19:06
2-0!郑钦文连场让5追7 硬地首胜斯瓦泰克 美网7连胜+第3次进8强

2-0!郑钦文连场让5追7 硬地首胜斯瓦泰克 美网7连胜+第3次进8强

我爱英超
2026-09-08 01:44:40
抖音回应“自称被4岁男童‘摸臀’女子账号被禁止关注”:避免因争议行为获取流量后与商业利益捆绑,相关账号被暂停营利权限

抖音回应“自称被4岁男童‘摸臀’女子账号被禁止关注”:避免因争议行为获取流量后与商业利益捆绑,相关账号被暂停营利权限

蓬勃新闻
2026-09-08 20:14:35
中美紧张,中日紧张,中英紧张,中加紧张,中印紧张,中韩紧张,中欧紧张…… 各类消息看多了,怎么感觉每天都在过得很紧张?

中美紧张,中日紧张,中英紧张,中加紧张,中印紧张,中韩紧张,中欧紧张…… 各类消息看多了,怎么感觉每天都在过得很紧张?

回京历史梦
2026-09-07 17:48:31
演员陈赫自曝确诊严重腰椎滑脱,严重时疼到无法直起身子,目前正接受理疗休养,已暂停部分工作

演员陈赫自曝确诊严重腰椎滑脱,严重时疼到无法直起身子,目前正接受理疗休养,已暂停部分工作

洪观新闻
2026-09-08 14:31:07
一个4岁的孩子,就算摸了一下你的屁股,又能给你带来多大伤害?

一个4岁的孩子,就算摸了一下你的屁股,又能给你带来多大伤害?

皮蛋儿电影
2026-09-08 14:40:26
赴美定居梦碎!飞机上出手打人,一家三口刚落地就被遣返

赴美定居梦碎!飞机上出手打人,一家三口刚落地就被遣返

社会日日鲜
2026-09-08 13:17:44
申军良给“梅姨”写了封信:拐了这么多孩子,能睡得着吗?“梅姨”落网细节曝光:出租屋内被抓,生活拮据靠捡废品为生

申军良给“梅姨”写了封信:拐了这么多孩子,能睡得着吗?“梅姨”落网细节曝光:出租屋内被抓,生活拮据靠捡废品为生

封面新闻
2026-09-08 18:09:04
新西兰小偷抢了华人博主的手机,发现正在直播,后续离奇曲折

新西兰小偷抢了华人博主的手机,发现正在直播,后续离奇曲折

杭城村叔
2026-09-08 13:18:47
2026-09-08 22:00:50
数字生命卡兹克 incentive-icons
数字生命卡兹克
反复横跳于不同的AI领域,努力分享一些很酷的AI干货
588文章数 719关注度
往期回顾 全部

科技要闻

小米再次背水一战

头条要闻

高一女生在"军训"中遭强制猥亵:他掀我衣服说想亲我

头条要闻

高一女生在"军训"中遭强制猥亵:他掀我衣服说想亲我

体育要闻

韩旭:我一定会再次走出去

娱乐要闻

郭德纲被处罚,郭麒麟被曝恋情瓜

财经要闻

智谱六连跌失守1000大关,发生了什么?

汽车要闻

领克20 领克的纯电小钢炮这次更运动了

态度原创

房产
本地
亲子
数码
军事航空

房产要闻

真快啊!海口这个超级城更,又有大动作!

本地新闻

宁波,中国制造的隐藏大佬

亲子要闻

市民走进一妇婴:沉浸式探秘妇婴服务,解锁全周期健康守护新体验

数码要闻

NVIDIA或为RTX 5070引入全新核心版本 GB203芯片有望下放至主流市场

军事要闻

胡塞武装用自行生产的导弹袭击沙特军车

无障碍浏览 进入关怀版