万众瞩目的GPT-6终于发布了,OpenAI的总裁布罗克曼直接在发布会上宣告 "欢迎来到AGI时代",Sam Altman也发推说这是 "全球最智能且最对齐的模型"。两位大佬一唱一和,排面拉满。
![]()
这次铺垫许久声势浩大的发布能否让OpenAI王者归来,反超Fable 5.1?
有三件事值得关注。
电脑起飞,编程没飞
这次GPT-6宣传的重点是电脑操作能力。OpenAI专门放了一支两分钟的宣传短片。
它会自己接管鼠标和键盘,自己打开软件,自己画图,自己建模,看起来非常丝滑。
![]()
看完之后我第一反应就是:真想找个小黑屋、架个投影,好好盯着它干活看一遍。照这个趋势发展下去,鼠标键盘以后可能真要逐渐退居二线了。
在专门测试AI操作电脑能力的OSWorld 2.0上,Astra的准确率也从上一代Sol的65.7%涨到了72.6%。
![]()
但问题来了。
电脑操作进步很大,不代表整体能力也一起起飞了。
大家真正最关心的,还是编程。毕竟这是当下商业用途最广泛的领域,尤其是需要长时间、跨越大量文件的重构任务。
GPT-6的表现不能说差,但也还谈不上代际碾压。整体来看,它大致还是介于 Opus4.7和Fable 5之间。
![]()
Artificial Analysis的Coding Agent Index里,Astra拿到67分,Fable 5.1是70分。
至少在这套独立测试里,GPT-6的编程能力依然没有超过Fable 5.1。发布会声势很大,但真正把模型扔进复杂Coding Agent任务里跑,领先优势并没有出现。
![]()
综合智能方面,Intelligence Index测评里,GPT-6 Astra拿了61分。
上一代Sol也是61分——原地踏步。Fable 5.1在这套测试里反而有66分。
![]()
不过GPT-6有一个地方确实进步很明显:写代码更省Token了。
Artificial Analysis的Coding Agent测试里,上一代Sol平均完成一项任务要消耗1320万Token,到了Astra只剩400万,直接砍掉了接近70%。
但OpenAI也同步把价格涨了。
Sol输入每百万Token 4美元、输出20美元;Astra涨到了10美元和50美元,单价整整翻了2.5倍。
![]()
那最后到底是贵了还是便宜了?
答案是:居然还便宜了一点。
Astra平均完成一项编程任务要花4.72美元,Sol是5美元。也就是说,虽然单价翻了2.5倍,但因为Token省得实在太狠,最后一项任务的实际成本反而低了大约6%。
![]()
不过代价也很明显:Astra平均完成一项任务要26.8分钟,Sol只要10.2分钟,耗时直接翻了一倍多。
钱是省了一点,但时间花得更多了。到底要快一点,还是便宜一点,大家自己掂量。
审美和3D提上来了,设计师瑟瑟发抖
GPT-6的审美能力直线上升,再加上强大的软件操作能力,对3D建模相关的行业冲击会特别大。咱们看几个案例就知道了。
GPT-6 Astra和Fable 5.1同样调用Seedance 2.5生成视频,最后出来的效果差别巨大。
GPT-6这一版最大的感觉就是更灵动。人物在画面里的跳跃、转身和连续动作都更顺,节奏也更自然,Fable 5.1这一版就明显更规整一些,整体会有一点僵。
![]()
3D建模上,它的表现也很夸张。
有人拿一张老式蒸汽火车的手绘图给GPT-6,让它在Blender里把这辆车重新搭出来。
几分钟之后,它做出了3295个可编辑的3D对象。整个火车被拆成了大量独立部件,结构细,几何也漂亮,后面还可以继续调节。
![]()
还有人直接让它去搭3D游戏场景。地形、建筑、光照、材质、物体摆放,它一路做下来,最后出来的画面层次很完整,氛围也很到位,已经很接近一个能直接拿来用的场景雏形。
![]()
室内设计建模也一样。
给它一句需求,它就能直接进3D软件搭房间。家具摆放、材质选择、灯光氛围、空间感觉,会一起落到模型里。
对于室内设计行业来说,从概念到3D效果图这个环节耗的时间可要被大幅压缩了。
![]()
还有一个很有代表性的玩法,有开发者让GPT-6做一个Mac应用:先用Blender建一个3D的iPod,再把原始iPod经典的转轮交互做进去,用它来浏览Codex上的所有线程。
![]()
听起来够复杂了吧?跨越了3D建模、应用开发、UI 交互三个完全不同的领域。
GPT-6 用了15分钟。
![]()
十五分钟。一个完整的、可交互的3D桌面应用。iPod的金属质感、转轮的触控反馈、滑动切换线程时的流畅动画,全都有。
搞编程的看了觉得自己在写什么,搞建模的看了觉得自己在建什么。两拨人同时沉默。
咱们暂时还用不上
GPT-6 Astra目前只向有限的组织推出,分阶段限量预览,也就是说大多数人现在还用不了。
![]()
这个玩法和当初Sora一样,功能很强,也有一些人发布了实测,但我们就是用不上。
而且这个吊胃口的玩法还进阶了。OpenAI的赛博义父Tibo宣称,只要大家晚一天用不上GPT-6,我们就帮大家重置一次Codex积分。所以就算等不到GPT-6,也可以在Codex上薅点羊毛。只能说OpenAI现在的PR手段确实是越来越高了。
![]()
另外多说一嘴。这次OpenAI同时放出了ARC-AGI-3测试的成绩:99.9%,看着特别唬人对吧?
![]()
但实际跑一次要花1.9万美元,而原生模型不加任何tricks的得分只有62.7%。所以布罗克曼嘴里的 "AGI 时代",含金量可能得打个问号。
花一万九跑出来的成绩,跟普通人能用到的体验之间,隔着的可不止一道墙。
AGI先别急着喊
所以现在看GPT-6 Astra,我觉得可以先下一个很克制的结论:
它肯定很强,尤其是电脑操作、3D建模和视觉表现这些地方,已经能看出很明显的新东西;但如果只看目前的第三方评测,它又还没强到可以让人毫无保留地喊出“AGI来了”。
现在最大的问题其实也不是发布会说了什么,而是我们什么时候真的能用上,以及真用起来之后,它到底能不能把这些演示里的能力稳定复现出来。
反正我这边200美金一个月的Pro会员已经充好了,钱先交了,座位也占上了。现在就看OpenAI什么时候兑现承诺,把GPT-6 Astra真正放到我们手里。
等我拿到之后,自己跑一遍,到时候再看看,这次到底是OpenAI真的把下一代做出来了,还是发布会先把下一代喊出来了。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.