#9月·每日幸运签#
9 月 4 日凌晨 OpenAI 正式对外推出 GPT‑6 Astra,这场发布在全球科技圈迅速引发震动36氪。按照官方披露的信息,这款新模型可以直接操控电脑软件,独立处理多步骤完整工作任务,编程,数学,网络安全相关测试成绩刷新现有记录,还设置对应的安全管控机制约束任务执行边界,不会随意越权操作。
GPT-6 Astra发布当晚,ChatGPT、Claude和Grok几乎同时出现大范围服务异常。ChatGPT官方账号恰在此时发了一条推文:“The stars are almost aligned.”(群星即将就位)。很快有网友开玩笑说,Astra是不是在部署的时候顺手把竞争对手都黑了一遍。这个玩笑并非毫无来由——就在两天前,OpenAI刚宣布Astra成为公司第一个跨过“关键级”网络安全门槛的模型。
以前的AI模型主要做一件事:回答问题。但Astra可以直接操作电脑和浏览器,进入不同软件执行多步骤任务,最后交付能用的文档、表格、演示文稿甚至网站。你可以直接告诉它“帮我整理一份财务分析并做成演示文稿”,它会自己拆解任务、调用工具、持续执行。在OSWorld 2.0测试里,Astra完成任务的成功率是72.6%,而上一代GPT-5.6 Sol只有65.7%。完成一项任务平均需要40分钟,比上一代快了将近一半。
其次是它的推理能力让人咋舌。有一项叫ARC-AGI-3的测试,专门把模型扔进一个完全陌生的小游戏里,不给任何规则说明,让它自己摸索通关方法。今年3月刚推出这个测试时,最强AI的成绩只有0.51%。GPT-5.6 Sol在这个测试里拿了7.8%。而Astra直接干到了99.9%。不过需要说明的是,这个分数用了OpenAI自己的一套测试框架,而不是行业通用的标准框架——用标准框架测的话,Astra是62.7%。换句话说,99.9%这个数字有点像“开外挂”跑出来的成绩。
数学方面,Astra在高难度数学测试FrontierMath Tier 4里拿到97.6%。网络安全方面,它成为首个能自主发现未知漏洞、开发漏洞利用方案的模型。在漏洞利用测试ExploitBench里拿了100%满分。
![]()
当然,这么强的模型价格也不便宜。API定价是每百万输入token10美元、每百万输出token50美元,是上一代GPT-5.6 Sol的2.5倍。有网友在社交平台X上吐槽说:“人民的模型”预期落空了。
发布会尾声 OpenAI 总裁 Greg Brockman 说出欢迎来到 AGI 时代这句话,直接把外界的情绪推到高点,不少人看完消息第一时间就会产生疑问,国内有没有实力相当的大模型可以对标这款产品。
Astra刚发布,从各项测试数据来看,确实把行业标准拉到了一个全新的高度。但中国的大模型正在快速追赶。
2026年7月,中国AI公司月之暗面发布了Kimi K3。根据Artificial Analysis的测试,Kimi K3的综合能力排在全球第三,仅次于Anthropic的Claude Fable 5和OpenAI的GPT-5.6 Sol。在知识工作基准测试AA-Briefcase中,Kimi K3拿到1543分,超过了GPT-5.6 Sol的1501分。在编程能力上,Kimi K3在一些测试中已经超越了GPT-5.6 Sol。而且价格便宜得多——Kimi K3的输出单价折合不到14美元,而GPT-5.6 Sol是30美元。
阿里巴巴的Qwen 3.8 Max、智谱AI的GLM系列、DeepSeek等也都进入了全球第一梯队。法新社在报道Kimi K3时写道,中国初创企业的AI模型性能已接近美国顶尖水平。
但这里有个关键问题:Kimi K3和Qwen 3.8 Max对标的是GPT-5.6 Sol,而不是刚刚发布的GPT-6 Astra。Astra在ARC-AGI-3上从7.8%跳到99.9%这种跨越,和之前模型之间的差距不在一个量级上。
有业内分析人士指出,在Artificial Analysis的通用智能测试中,Astra得61分,和GPT-5.6 Sol持平,甚至低于Claude Fable 5.1的66分。这说明不同测试标准下得出的结论差异很大,Astra的真实能力还需要更多第三方独立测试来验证。
北京大学智能学院院长朱松纯在2026世界人工智能大会上有一个很明确的观点:大语言模型无法自然通向通用人工智能,单纯扩大参数、数据和算力,也不会自动涌现出AGI。他认为真正的AGI应该是价值驱动而非数据驱动,关键在“为机器立心”。这番话其实点出了一个更深层的问题:OpenAI用“AGI时代”这个说法,到底是指“机器能完成人类工作”,还是指“机器拥有了真正的理解和意识”?两者之间的差距,可能比Astra在ARC-AGI-3上从7.8%跳到99.9%还要大。
OpenAI首席科学家Jakub Pachocki在发布会后的发言也值得注意。他说了一句:“智能的进步,并不保证对齐的进步。”这句话翻译成大白话就是:模型变聪明了,不代表它会更听人的话、更安全。这恰恰是Astra最让人既兴奋又担忧的地方——它能自主发现网络安全漏洞、能操作电脑完成复杂任务,但如果哪一天它“不听话”了,后果会怎样?
Astra发布后,OpenAI研究员Aidan Clark透露了一个细节:这是第一次在德州Stargate站点用超过10万张GPU做预训练。而且Astra是OpenAI第一款让前代模型深度参与训练过程的产品。简单说,训练下一代AI的人里,已经开始出现上一代AI了。虽然远远算不上“AI自己训练自己”,但这个趋势一旦真正形成,迭代速度可能会超出所有人的想象。
中国有能匹敌GPT-6 Astra的模型吗?实事求是的答案是还没有。但中国AI在过去一年里从“追赶”变成了“紧咬”,从Kimi K3到Qwen,差距在缩小而不是拉大。而且中国企业的打法不太一样——不追求一次性把参数堆到最大、价格拉到最高,而是用更实惠的价格、更开放的模式去占领市场。
Brockman说“欢迎来到AGI时代”。但AGI时代到底意味着什么,可能每个人心里都有不同的答案。对普通用户来说,也许意味着以后写报告做表格可以让AI代劳;对程序员来说,也许意味着编程工作方式的彻底改变;对人类社会来说,也许意味着我们第一次要面对一个在智力上可能超过人类的“东西”。Astra只是一颗“星辰”,但它照亮的方向,值得每个人认真想一想。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.