山姆·阿尔特曼正式官宣了GPT-6 Astra。他在公告里给出的定位很直接:计算机使用、专业工作、科学、编程、网络攻击抵御——这些领域,他都宣称是全球最佳。
但真正让人好奇的不是"最强"这个说法,而是发布时间。按阿尔特曼的解释,团队是主动选择晚一点推出,把额外时间花在了安全与对齐标准的打磨上,以确保模型符合能力层级对应的要求。
![]()
近乎满分的基准测试
这次公开的测试数据确实亮眼。在FrontierMath Tier 4上,GPT-6 Astra得分98%;在ARC-AGI 3上,得分99.9%;在ExploitBench上,更是拿到了100%的满分。三个接近或达到顶格的数字,放在一起看,冲击力不小。
不过,这些分数也引出一个问题:既然测试成绩已经这么高,为什么还要等?阿尔特曼给出的理由是安全与对齐合规。换句话说,能力跑在了前面,但团队认为,确保模型行为可控这件事,比抢首发更重要。
能力越强,门槛越高
这背后其实是AI行业近两年反复出现的博弈。模型能力越强,安全审查的复杂度和责任就越大。GPT-6 Astra在ExploitBench上的满分,恰恰说明它在攻防对抗上的能力已经到了一个新台阶——这种能力本身,就是需要更谨慎对待的理由。
阿尔特曼没有给出具体的推迟时长,也没有透露安全测试的细节。但从他的表述来看,这次发布节奏的调整,更像是一次主动选择:在"更快"和"更稳"之间,OpenAI这次选了后者。
至于这个决定值不值,可能要看接下来GPT-6 Astra在实际使用中的表现,以及它能否经得住外部安全研究的检验。毕竟,基准测试的满分,只是第一步。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.