智猩猩AI整理
编辑:林夕
今天凌晨,OpenAI发布新一代旗舰模型GPT-6 Astra,并给出了一个相当重量级的判断:
“Welcome to the AGI era.”
![]()
它的口号很直白:“Anything you can do on a computer, Astra can do for you.”
但发布之初,Astra并没有直接向所有用户开放,面对用户催问什么时候能用上,OpenAI CEO Sam Altman直接回应:
![]()
不过,访问权限确实正在加速放开。
今天上午,OpenAI产品负责人Tibo在X上透露,团队正在为每天付费的ChatGPT用户提供一次Astra访问权限重置。
![]()
而就在用户还在等权限的时候,Astra的首批成绩单已经先一步冲了出来,如果只看OpenAI公布的Benchmark,Astra几乎就是一台刷榜机器。
![]()
Astra在研究级数学测试FrontierMath Tier 4中拿到97.6%,在科学知识测试GPQA Diamond中拿到96%。
而在长程软件工程测试DeepSWE、CAD绘制测试BenchCAD和漏洞利用能力测试ExploitBench中,Astra分别做到了74.1%、95.9%和100%。
也就是说,GPT-6 Astra已经把很多既有测试刷爆了。OpenAI自己都说,要想完整理解它的能力上限,可能需要设计一些新的测试。
![]()
但官方最愿意强调的还是ARC-AGI-3的成绩:99.9%。
今年3月刚公布时,最强AI成绩只有0.51%,GPT-5.6 Sol默认框架下也只有7.8%。
![]()
短短几个月,从7.8%到99.9%。
如果只看数字,这几乎已经不是提升了一点,而是直接把通用推理的天花板捅穿了,但问题也恰恰出在这里,这个99.9%,并不是大家通常理解的裸模型成绩。
ARC Prize同时提供了一套所有厂商都可以使用的标准测试框架,在这套Standard Harness下,Astra的最高成绩其实只有62.7%。
而OpenAI公布的99.9%,使用的是自家的Responses API生产配置。
![]()
OpenAI针对ARC-AGI-3加入了两个特殊设置:保留推理状态和上下文压缩。
于是,同一个Astra,在两套Harness下出现了62.7%和99.9%两个相差巨大的成绩。
这才是整件事情最值得讨论的地方,OpenAI给出的解释也很合理:
![]()
但问题在于,99.9%这个数字,衡量的已经不只是模型本身有多聪明,它衡量的是模型+记忆机制+上下文压缩+API调度这一整套方案的上限。
这就像考试允许你带一台专门为这场考试优化的特制计算器入场,最后考出来的分数当然是真的。
但你很难再用这个分数直接证明:“这个人的裸算力就是其他人的十几倍。”
所以,问题就变成了:离开这套由OpenAI定义的Harness,Astra还能不能维持同样夸张的领先?
Artificial Analysis的独立测试在其通用智能测试Intelligence Index v4.1.1中,Astra max只有61分。
这个成绩和GPT-5.6 Sol max基本持平,反而低于Fable 5.1的66分、Opus 5的63分以及Muse Spark 1.3的62分。
![]()
也就是说,如果Astra真的已经在通用智力上完成断层式领先,为什么在另一个相对独立的综合智能测试里,却没有出现同样夸张的差距?
在Artificial Analysis Coding Agent Index中,Astra得到67分,距离榜首Fable 5.1差3分。
![]()
但如果把争议放在一边,Astra至少在实际Agent能力和执行效率上,它确实展现出了非常强的竞争力。
Astra使用的token仅相当于5.6 Sol max的三分之一、Opus 5 high的五分之一。
![]()
凭借效率优势,在散点图中,Astra在左上角几乎划出了一个专属斩杀区,在相同成本下,它的效率优势非常明显。
![]()
另外,Astra的幻觉也明显减少。Artificial Analysis测得Astra max的幻觉率为51%,远低于Sol的92%,拒答率数据也显示它没有依靠频繁拒绝回答来压低幻觉。
![]()
但如果把Astra放回整个旗舰模型市场里看,省token,并不等于便宜。
Astra标准模式下,每百万输入token收费10美元、输出50美元,是GPT-5.6 Sol促销价的2.5倍,和Anthropic刚发布的Fable 5.1持平。
![]()
目前,GPT-6 Astra在ChatGPT网页端以“GPT-6 Pro”的名称提供,但使用额度同样设置了明确上限:
200美元/月:每周200条;
100美元/月:每周50条。
折算下来,大约就是每天28条和7条,而Plus用户目前暂时拿不到网页端最强模型的聊天额度。
花200美元/月,买到的并不是一个想聊多少就聊多少的最强模型,而是每周200次的高级模型配额。
![]()
这就让Astra的价格变得更加有意思:API按Token收费,网页端按次数限额。
如果输入超过27.2万token,整次请求的输入和缓存价格翻倍,输出价格升至75美元,快速模式则要支付两倍价格。
105万token上下文窗口,最高输出12.8万token,知识截止2026年4月30日,参数漂亮,但钱包压力也实实在在。
OpenAI的解释是,Astra完成任务所需步骤更少,总成本可能反而更低。但单纯比token单价,这确实是目前最贵的旗舰之一。
![]()
但问题是,一个月200美元,还只能每周用200次,真的算随便用最强模型吗?
尤其是在Artificial Analysis的独立测试里,Astra的综合智能和Coding Agent成绩都没有拉开明显差距。
所以现在的Astra,更像是一款高效率、高单价的旗舰模型,它确实能少用Token,但你得先接受一个更贵的Token。
所以,Astra到底意味着什么?
它不是那个让所有质疑者闭嘴的完美AGI,独立测试没碾压,价格还贵出一大截,ARC-AGI-3的满分也带着明显的特调痕迹。
少用 Token、减少推理成本,同时维持更强的复杂任务能力——这条路线究竟能不能成立,现在还需要更多独立测试来验证。
至少目前来看,Astra 更像是一场仍在进行中的实验,而不是一个已经被证明的 AGI 答案。
关注+星标,获取AI前沿进展与开源一线动态
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.