OpenAI刚刚发布GPT-6 Astra。按照OpenAI自己的说法,这是目前能力最强、对齐程度最高的一代模型。
它在电脑操作、浏览器使用、软件工程、科学研究和专业工作等多个方向刷新了成绩。OpenAI总裁Greg Brockman甚至公开表示,如果几年后回过头寻找AGI真正出现的时间点,现在可能会成为一个值得注意的节点。
AGI到底来了没有,现在下结论还太早。但如果把Astra和两个月前发布的上一代旗舰GPT-5.6 Sol放在一起看,会发现这次升级已经出现了一个非常明显的方向变化。
两代模型都拥有大约105万Token的上下文窗口。
Astra真正拉开的差距,是同样给它100万Token、同样给它一台电脑和一项复杂任务,它更有可能找到正确的信息,并一路把事情做完。
一、窗口没有变大,但它在长文本里“找东西”准多了
105万Token听起来已经非常夸张,一次可以塞进长篇报告、代码库、合同,甚至大量企业内部资料。
但能把这些东西装进去,并不等于模型真的能够利用它们。
OpenAI公布的一项长上下文测试很能说明问题。在512K到100万Token范围内,需要模型从大量内容中寻找多个相关信息时,GPT-5.6 Sol的成绩是73.8%,GPT-6 Astra提高到了96.3%。
这就像两个人面前都摆着同样厚的一摞资料。
一个人知道答案肯定藏在里面,却可能翻错页、漏掉前后关系;另一个人不仅能够找到那句话,还能意识到它与几百页之前另一条信息之间存在联系。
所以大模型下一阶段竞争的,已经不只是“上下文有多长”,而是这么长的上下文究竟有多少能够真正参与推理。
这也是Token、Embedding和Attention这些底层机制越来越值得关注的原因。模型面对的并不是100万个人类能够直接阅读的文字,而是海量Token转换成内部表示之后形成的复杂关系。
窗口只是把资料搬进房间。
真正困难的是从里面找到该找的东西。
二、Astra开始真正“用电脑”
Agent出现以后,大模型已经可以调用浏览器、终端和各种工具。
但真正进入复杂的软件环境以后,问题很快就暴露出来:模型可能知道下一步应该干什么,却不一定真的能够把这一步操作成功。
Astra在这一点上的进步非常明显。
它需要看懂屏幕上的内容,找到正确的按钮和输入框,打开软件、填写表格、运行程序,完成之后还要检查结果,根据新的情况继续下一步。
在ScreenSpot-Pro这项屏幕理解测试中,GPT-5.6 Sol的成绩是76.9%,Astra提高到92.7%;OSWorld 2.0电脑操作测试则从65.7%提高到72.6%。
更值得注意的是执行时间。OpenAI的模拟数据显示,在完成相同电脑任务时,Sol大约需要75分钟,Astra约40分钟,时间减少了接近一半。
这意味着模型能力的衡量标准正在发生变化。
过去我们关心它能不能告诉你“下一步该怎么操作”。
现在开始关心的是:它能不能自己找到下一步,并真的操作下去。
三、真正拉开差距的是连续完成任务
Astra最值得关注的一组数字,其实来自AutomationBench。
GPT-5.6 Sol的成绩只有18.1%,GPT-6 Astra提高到了41.4%,提升超过一倍。
这种测试不是给模型一道题,然后等待一个答案,而是直接给它一项工作。
它需要理解要求,打开软件,寻找资料,调用工具,修改文件;中间如果出现错误,还要判断问题出在哪里,重新调整,再继续往下执行,直到最后得到可以交付的结果。
这和聊天完全不是一回事。
现实里的工作几乎从来不是一步完成的。
工程师不会只写一行代码,分析师不会只查一个数字,设计师也不会生成一张图片就结束。一项真正的工作,往往意味着几十甚至几百个连续动作。
其中任何一步理解错了、工具调用失败了,或者中途偏离目标,都可能让前面的工作全部失效。
大模型从Chatbot走向Agent,真正难跨过去的门槛,不只是“更聪明”,而是在漫长的执行过程中一直不掉链子。
这恰恰是Astra这一代最核心的变化。
四、代码能力也开始从“写代码”转向“做工程”
同样的变化也出现在编程领域。
过去评价一个模型的编程能力,很容易看它能不能根据要求迅速生成一段代码。
但真正的软件开发并不是把代码写出来就结束。
代码要运行,要处理依赖,要修改配置,要操作终端;程序报错以后,还得找到原因,重新修改,直到整个工程真正跑起来。
Astra正在把能力从“生成代码”继续向“完成工程”推进。
这也是为什么单纯比较每百万Token多少钱,已经越来越难判断一款模型究竟贵不贵。
Astra的单Token价格可能更高,但OpenAI披露,在Terminal-Bench 4.0等一些复杂任务中,因为它需要的尝试次数更少、绕的弯路更少,最终完成一项任务的整体API成本反而可能低于Sol。
企业真正购买的从来不是Token,而是一个完成的结果。
如果一个便宜模型反复尝试十次才能完成,而一个更贵的模型两三次就能交付,后者反而可能更便宜。
这可能也是未来AI模型定价最值得关注的变化。
结语
从GPT-5.6 Sol到GPT-6 Astra,表面上看只是又一次模型升级,但背后的竞争指标已经开始改变。
上下文超过100万Token以后,再把窗口扩大一点,并不会自动带来质变。
真正困难的是,如何在巨量信息中一直找到正确的信息,如何看懂电脑上的环境,如何连续调用不同工具,并把一个需要几十步甚至几百步的任务真正执行到最后。
过去的大模型竞争,核心问题是“谁回答得更好”;Agent时代开始以后,问题正在变成“谁能把事情做完”。
当AI可以自己阅读百万Token资料、打开软件、调用工具、修改文件、发现错误并继续执行时,我们面对的就不再只是一个更聪明的聊天机器人。
它正在从一个回答问题的模型,变成一个真正能够接手工作的数字执行者。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.