网易首页 > 网易号 > 正文 申请入驻

GPT-5.6深夜上线,ChatGPT和Codex正式合并,一个时代结束了。

0
分享至

  今天,GPT-5.6终于在OpenAI的直播中正式上线了。

  除了GPT-5.6之外,ChatGPT也迎来了2022年诞生之后,我觉得最大的升级。

  从OpenAI的直播预告动画就能看出来有趣的端倪了,ChatGPT和Codex,在今天、在此刻合体。

  

  于是,全新的ChatGPT来了。

  

  Codex直接消失,与ChatGPT应用正式合并,以后,也没有Codex这个应用了,只有ChatGPT了。

  但是当你打开新版的ChatGPT界面以后,你又会发现,原版的ChatGPT界面也没有了,满屏的UI,都属于原本的Codex,只剩下那个小小的聊天Tab,证明着曾经的ChatGPT,还存在过。

  

  突然有点感慨。

  至此,由ChatGPT 2022年11月30日开启的Chat时代,也在今天完成了属于大众启蒙的使命,而今天,ChatGPT和Codex的合并,一切也都标志着新时代的来临,此名:

  Agent时代。

  让我们一个一个来聊。

  一. GPT-5.6

  先聊最核心的GPT-5.6。

  这次一共是三个模型,分别是 新旗舰模型Sol,以及适用于日常工作的均衡模型Terra,还有OpenAI所谓的最具成本效益的模型Luna。

  我们主要的核心,还是来聊GPT-5.6 Sol,因为这个也基本代表着OpenAI能对外放出来的目前智能的巅峰。

  这个模型强不强,你就看Anthropic的动作就行了,在GPT-5.6 Sol发布后,他们直接决定,重置额度。。。

  

  可能我这几年,从来没有像现在这样,如此期待一个新模型,期待GPT-5.6的上线。

  原因特别简单,因为我那个AI新闻网站AIHOT,虽然大的我能做的都做了,比如IP地址已经换了,且藏在了边缘代理后面,做了部分DDoS防护,封禁策略和JS挑战啥的也都做了。

  但是每天都在被各种手段攻击,最初的普通攻击,到现在几乎全是DDoS,还有用分布式CC来恶心的,各种乱七八糟的。

  昨天一天就被打了4轮,昨天早上的没防住,导致昨天早上又被干崩了,但是 下午的3轮都防住了 。

  

  在这个阶段,Claude Fable 5已经完全没办法用了,因为这些词几乎都是敏感词,一聊DDoS啥的直接给我切换到Opus 4.8,而且Fable 5虽然智商和规划能力超群,但是在真正的执行上,还是有点问题,经常顾此失彼,然后漏很多的东西,并且跟Claude系列一样,有一定的幻觉。

  然后最大的缺点,就是贵,没蹬一会额度就没了。。。

  

  GPT-5.5是我最近反而用的最多的了。

  但是问题也非常大,规划和做方案的能力非常一般,完全不思考全面,起手就知道干,幻觉率确实极低,代码执行确实很强,改BUG啥的很不错,但是吧,也经常不够全面 ,再加上方案和规划能力是一坨, 短板还是有点太明显了。

  经常给我用的非常的暴躁。

  

  在做安全策略上,更是漏洞百出,它做的方案,被人打成筛子,最后还是得我那仅剩的10%额度的Claude Fable 5来进行规则的重置和兜底。

  这7天高强度的攻防和平均每天16个小时的Coding的经验,让我对Fable 5和GPT-5.5的评价一下的话。

  那就是Fable 5确实是一个总监级别的大神,但是你知道的,管理层嘛,一般执行的细节程度上总归有一点的不精确,工具使用、主动性太强了,经常不管不顾的自己就全部给你搞完了,但是最后在一些细节上,是偏离了你想要的东西的。

  而GPT-5.5呢,就是一个高级工程师,在执行上确实是一把好手,但是用一个网友的话来做一个很形象的描述就是:“GPT-5.5最像那种会议室里突然站起来画白板的人,你还在描述混乱,它已经开始拆方案。”

  现在就卡在这了,Claude Fable 5额度用完了,GPT-5.5只能做中型的项目执行。

  所以在这个背景下,大家应该就懂了,为啥我如此的期待GPT-5.6了。

  因为真的希望他们能把整个Coding的能力,再往前推一步,而且我极度支持OpenAI干死呆逼Anthropic。

  在OpenAI 6月26号发布了前瞻之后,今天凌晨,GPT-5.6终于来了。

  

  我第一时间直接把GPT-5.6 Sol拉到最高档Ultra开干了。

  在我高强度并行开发了5个小时之后,我觉得我对GPT-5.6有了一些自己的体感,如果用一段话描述的话,那就是:

  当今世界最水桶级别的模型,价格低廉,性价比极高,方案和规划能力在一些非巨型任务上媲美Fable 5(巨型任务我也接触不到,已经远超我的能力上限了),Agent能力和Coding执行上幻觉率极低极为精准,配合Codex交互体验和远程Coding更是极佳,浏览器控制更加稳定等等。

  不过前端审美和内容创作依然是老大难问题,这块确实比不上Claude,但除此之外,其他的任何方面我想不出来我自己再用Claude的理由了。

  而且,GPT-5.6 Sol,包含在订阅计划中,未来,订阅用户可用!

  OpenAI赛高!Codex赛高!GPT赛高!

  还是惯例,简单过一下GPT-5.6的官方跑分。

  在覆盖55个领域长期专业工作流的Agents' Last Exam中,GPT‑5.6 Sol以53.6分刷新纪录,比Claude Fable 5(自适应推理)高出 13.1 分。

  即便采用中等推理模式,它仍以约四分之一预估成本领先Fable 5达11.4分。

  

  这个我觉得是里程碑式的,Fable 5确实很强,但是那个经济效应,几乎也代表着我们几乎不可能日常大规模的使用。

  而GPT-5.6以极低的成本,完成了执行效果上的超越。

  而在AA家的智能指数上,GPT-5.6比Fable 5只低了一分,但是 任务完成时间缩短61%,成本预估降低约一半。

  

  而在Coding领域,这个优势更加离谱了。

  在Artificial Analysis 编程智能体指数中,启用最大推理能力的 GPT‑5.6 Sol 以 80 分创下最新技术标杆,比Fable 5高出2.8 分,同时输出 token 减少一半以上,耗时缩短一半以上,成本降低约三分之一。

  

  从这张图其实也能看出来,对于日常来说,改BUG啥的其实推理强度开到高就差不多了。

  

  如果是大型的任务,就开到极高。

  

  究极大型的重构或者要命相关(比如我的AIHOT防护)的任务,或者你的token实在烧不完的时候,偶尔再把推理等级开到Ultra,是Token利用率最高的解法。

  而且你知道,当我看到GPT-5.6 Sol在衡量从接触漏洞代码到任意代码执行进展的ExploitBench, 上,它在可比输出token预算下得分为73.5%。

  这意味着什么呢,意味着,只要极低的成本,就可以达到几乎跟Fable 5相同的网络安全效果!!!

  

  说实话,我看到这个的时候,我的眼睛都在冒光,我激动的都睡不着觉。

  而且在我的实测中,虽然偶尔也会出现网络安全的禁止提示。

  

  但是在我表明是为了做我的边缘代理的防护策略,我希望他帮我优化之后,他顺利的给我进行执行了,没有做任何的阻拦。

  我给的任务,就是这个,我因为是语音输入的,还输入错了,把EO识别成了EU,不过这种都是小问题了:

  

  我直接开了Ultra,而且是快速模式,几乎全部都是浏览器操控,在将近21分钟之后,给了我一个非常详细的审查报告。

  我是200刀的Pro套餐,Token的消耗量大概5小时额度花了20%,周额度大概花了2~3%,我想说,这比Fable 5舒服太多了。

  

  要知道,这可是21分钟的全程Chrome操控且开了快速模式,有1.5倍的消耗,再加上Ultra啊!

  如果是Fable 5的话,你相信我,就这么玩,Fable 5 + Ultracode,都没有快速模式一说,一波能给你周额度干没8~10个点。

  太离谱了。

  而且这个质量,非常的高。

  因为我的边缘代理的规则底子是Fable 5打的,后面GPT-5.5在上面打了一些补丁,也做了N次优化,但是感觉也优化不出来啥,找不出来啥问题了。

  但是GPT-5.6 Sol,直接找出了一堆以前他两没有想到的问题。

  

  我就不放全文了,因为漏洞太多了。。。

  直接扒拉出来了11个任务。

  反正我是叹为观止,然后让GPT-5.6 Sol一波直接自己去修了。

  非常的稳,一波处理的明明白白,没有任何的BUG,就看明天被攻击时候的实际防护效果了。

  然后还有一个方案,大概能看出来GPT-5.6 Sol和Claude Fable 5的一些性格和个性的区别。

  比如我有一个长久以来的痛点,就是为了AIHOT大家无需开魔法的阅读体验,所以我做了每个新闻的详情页,就像这样。

  

  但是这个详情页想法是好的,在实现上,有巨大的问题,因为我要把所有源站的信息,原封不动的抓过来,然后尽可能的给大家还原成跟源站一样的阅读体验。

  但是你要知道,我现在监控信源的背后,有几百个形色各异的网站,我已经尽可能的去想尽一切办法去处理了,还是经常会抓来一些奇奇怪怪的东西。

  就像这样。

  

  还有这样。

  

  想适配所有的网页,全部清洗成好看的,几乎跟源站一样的,甚至还要保留格式、超链接、代码库、图表等等,太难了,因为背后的网页形式实在是太多太多了,之前用Opus 4.8和GPT-5.5分别开发过,效果基本就是一坨狗屎。

  但是我一直还是想解决这个需求,让AIHOT的用户在浏览信息上,能得到最好的体验。

  所以我就把这个需求,同时扔给了GPT-5.6 Sol和Claude Fable 5。

  让他俩同时想方案。

  

  甚至他两用的都是同一份CLAUDE.md,因为我的AGENTS.md直接软链的 CLAUDE.md, 所以几乎变量都是一样的,唯一不同的就是模型本身。

  而最终输出后,GPT-5.6的方案,坦诚的讲,在细致程度上,我甚至觉得比Fable 5考虑的更加周全,这确实是一个很有趣的点。

  比如一开始,从源头上,其实是有分类的,比如有很多不是直接抓取的,是走API和RSS的。

  

  这些是有明确的正文的。

  而在GPT-5.6的考虑中,也想到这部分,但是,他并没有跟Fable 5一样,直接把那个规则当做了必须遵守的。

  而是提出了质疑。

  

  所以,我们不能信他们,所有的源头都只是源头而已,我们必须自己要去做结构化的正文抽离,即使它是RSS和API输出来的,也需要如此考虑。

  Fable 5其实把这个细节漏了。

  包括有一个同域名网站里最近反复出现的内容,大概率就是导航啊固定CTA啥的,所以其实可以做标准化的统计,重复的就可以被识别出来了直接删掉。

  GPT-5.6和Fable 5都考虑到了这一点,但是还是那个问题,在首次的输出上,依然是GPT-5.6考虑的更加细致一点。

  而且还有个更离谱的是,我觉得,这一次GPT-5.6输出内容的可读性,我觉得比Fable 5是要强的,他的方案我能读的下去,但是Fable 5,可能是我太菜逼了,他的信息密度太高了,我读不下去。

  最后这两个方案,我还是选择了让GPT-5.6 Sol去开了目标模式进行最终执行。

  

  因为坦率的讲,这个任务有点复杂,我对Claude Fable 5能长时的稳定的精准的处理完这么多细节,我没有信心,后期其实还是容易出现幻觉,改了这里忘了那里,然后最后再对抗性审查的时候又不断的推翻自己,很麻烦。

  但是GPT-5.6的幻觉率在我的测试过程中,我体感是一如既往的,几乎就是洲际导弹的级别,指哪打哪,再配合上目标模式,最后总是能极其精准的完成任务,真的很香。

  虽然过程中也会偶发跟GPT-5.5一样,有一些奇怪的低级错误导致了部分环节中的循环,但是次数会少一些,同时也能更快的解决,且不影响最终的输出。

  然后之前的那个任务,截止到我发文的时候,已经开发了快2个小时了,但是还没有开发完,主要是逐篇审查对比优化,确实比较浪费时间。

  

  但是在它测试过程,我看到了一些页面,还是很棒的,我现在有点期待完他写完以后,部署到AIHOT上的效果了。

  然后是前端审美这块,确实比GPT-5.5有巨幅加强,但是还是离Claude有一定距离。

  比如最近马上台风不是要来了吗,我随手写了一个Prompt:

  调用一个接口获取巴威台风数据, 生成一个单HTML文件的可视化大屏。

  GPT-5.5的效果是这样的,就Emmmmmm。

  

  但是GPT-5.6 Sol是这样的。

  

  前端效果上还是进化了很多的,至少是不会出AI Slop了。

  目前Plus、Pro用户可以使用GPT‑5.6 Sol,而免费和Go用户,只能使用 GPT‑5.6 Terra。

  而最高档的Ultra推理等级,只对200刀的Pro用户开放,Plus用户也用不了。

  目前GPT‑5.6按每百万Token计费。

  Sol 为 5 美元输入 / 30 美元输出;Terra 为 2.5 美元输入 / 15 美元输出;Luna 为 1 美元输入 / 6 美元输出。

  GPT‑5.6 还引入了更可预测的提示缓存功能,包括支持显式缓存断点⁠以及30分钟的最低缓存生命周期。

  对于GPT‑5.6及后续模型,缓存写入按模型非缓存输入价格的1.25倍计费,而缓存读取则继续享受90%的缓存输入折扣。

  二. ChatGPT Work

  这是一个我没有想到的更新。

  也就是我们开头所说的,合并了ChatGPT和Codex。

  现在,你可以在左上角,直接切换工作和Codex了。

  

  其实就是Cowork和Claude Code的区别。

  Codex虽然是个通用Agent,可能一些专业者都知道,他既能写代码,也能办公,完全没有问题的。

  但是依然有个市场的老大难问题,就是心智问题,你一说你能开发,你能写代码,很多的用户依然会觉得,那上手门槛是不是很高。

  所以从心智上来说,Work和Code,反而拆开应该是最好的,虽然底层都是一个东西,但是用户认账啊。

  你看国内WorkBuddy就知道了,现在都千万日活了,你这找谁说理去。

  而OpenAI的产品确实有点东西,他们妙就妙在这里,没有选择推出Codex Work,而是直接把ChatGPT这个10亿周活的巨无霸给改造了,变成了ChatGPT Work,你看,这是不是就好理解多了。

  而且过去的ChatGPT用户迁移过来,那简直顺理成章。

  不过你要说这个Work模式跟Codex的区别,我觉得可以小到忽略不计了。

  最大的心智特征,可能就是在这个菜单栏上,把分支啥的偏Code的元素,换成了Doc、PPT、Excel三件套,让你体感上,更像是帮你工作的。

  

  我随手用GPT-5.6 Sol给它自己的上线,用它自己的插件,做了个PPT。

  

  就咋说呢,GPT系列的审美啊,是不是得GPT-6的全新一代的预训练模型才能补上了。。

  只是纯能看了。

  不过处理表格啥的数据分析任务,那是真的强,强到上天。

  有条件的,我推荐大家所有人都可以去下一个ChatGPT的应用,用它来帮大家去处理工作,这可能是你当今,能用上的性价比最高、质量最好的Work类Agent产品了。

  而之前的ChatGPT Chat模式,也就是聊天,被藏在了一个小小的tab中,就好像,它的历史使命已经完成了。

  

  点击以后,右下角会出现一个弹窗,这个小小的界面,就是ChatGPT Chat了。

  

  而且这次还有个好玩的新东西,也是给Work场景用的。

  就是新增了一个叫站点的功能。

  

  我们过去都知道,很多非开发者,其实做了一个产品,想要部署到线上,给别人用还是很麻烦的一件事。

  所以OpenAI这次就为了解决这个需求,搞了这么个功能。

  底层本质是包了一个他们自己的叫Sites的Skill。

  

  你做完一个东西以后,直接用Prompt说一句话,比如用Sites部署一下。

  

  他就会自己帮你部署到线上,然后给你一个域名,这个域名就可以分享给你的朋友和同事了。

  

  对大众来说,极其友好。

  我觉得这一次,OpenAI用他们的产品、用他们的模型,再一次证明了。

  这家公司,还是有生命力的,他们还是当年的那个OpenAI。

  曾经的OpenAI,是面对Google的屠龙少年,随着时代的发展,他们逐渐从勇士,变成了金银财宝之上的恶龙。

  他们开始骂声一片,没人再喜欢他们,大家都在说,OpenAI就该完蛋。

  可随着Anthropic的异军突起,OpenAI有那么一段时间,被打的全线开花。

  他灰溜溜的走下了王座,看着曾经它的王座上,盘踞一条新的恶龙。

  随后,他重新拾起盾牌,捡起那个已经开始发绣的剑。

  斩向了自己的身后,把那个亲手将自己送上傲慢王座的Sora,一刀斩断。

  它决定回到群众中,做群众想要的模型,做群众喜欢的产品。

  直到几个月后的今天,他又回到了那个曾经属于他们的王座之前,站在了那个叫Anthropic的恶龙之前。

  他说,这次。

  轮到你了。

  以上,既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,如果想第一时间收到推送,也可以给我个星标⭐~谢谢你看我的文章,我们,下次再见。

  >/ 作者:卡兹克

  >/ 投稿或爆料,请联系邮箱:wzglyay@virxact.com

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
14年前怒扇以色列士兵的11岁小女孩塔米米,后来怎么样了?

14年前怒扇以色列士兵的11岁小女孩塔米米,后来怎么样了?

就一点
2026-09-05 22:54:36
2-0,2-1!美网8强已出2席,萨巴伦卡17连胜,郑钦文比赛时间出炉

2-0,2-1!美网8强已出2席,萨巴伦卡17连胜,郑钦文比赛时间出炉

侃球熊弟
2026-09-07 03:59:13
马卡电台:没有比费尔明更出色的中场,巴萨不会卖他

马卡电台:没有比费尔明更出色的中场,巴萨不会卖他

懂球帝
2026-09-07 22:48:15
很奇怪的现象:现阶段撑起生育大盘的,并非90后、00后,而是人到中年的80后

很奇怪的现象:现阶段撑起生育大盘的,并非90后、00后,而是人到中年的80后

舒山有鹿
2026-08-26 13:53:15
打通任督二脉!中国女篮12人轮转11人得分,71‑51碾压意大利

打通任督二脉!中国女篮12人轮转11人得分,71‑51碾压意大利

茶余饭后说体育
2026-09-08 05:01:04
65岁退休职工夫妻从天台跳下,棋友回忆真相,死因难以启齿

65岁退休职工夫妻从天台跳下,棋友回忆真相,死因难以启齿

罪案洞察者
2025-02-26 14:07:47
贪污上亿、假慈善、被人身控制?54岁韩红的私生活谣言离谱至极

贪污上亿、假慈善、被人身控制?54岁韩红的私生活谣言离谱至极

春之韵
2026-08-14 01:50:55
武大女教授风波升级:两人出轨细节被扒,大胆又荒唐,早不是秘密

武大女教授风波升级:两人出轨细节被扒,大胆又荒唐,早不是秘密

白浅娱乐聊
2026-09-08 01:08:33
伊朗公布一款新型导弹

伊朗公布一款新型导弹

澎湃新闻
2026-09-08 04:06:12
伊朗发出致命警告!敢动用核武器,全球美军基地都将被摧毁!

伊朗发出致命警告!敢动用核武器,全球美军基地都将被摧毁!

原梦叁生
2026-09-05 21:53:24
为啥女生很少有臭脚的?网友:脚臭基本上是闷出来的,试试光脚出门

为啥女生很少有臭脚的?网友:脚臭基本上是闷出来的,试试光脚出门

带你感受人间冷暖
2026-09-08 00:05:28
中方是否愿意加强与德国选择党的交流?外交部回应

中方是否愿意加强与德国选择党的交流?外交部回应

澎湃新闻
2026-09-07 16:31:24
CCTV女篮世界杯直播表:确定直播B、C组争第一!日本生死战最危险

CCTV女篮世界杯直播表:确定直播B、C组争第一!日本生死战最危险

越岭寻踪
2026-09-07 07:33:14
微软发布全新版本Windows 11!64GB内存、250GB/s带宽起步

微软发布全新版本Windows 11!64GB内存、250GB/s带宽起步

快科技
2026-09-06 20:04:05
魏德尔没料到:极右翼胜选次日,中方表态不评内政,对德立场明确

魏德尔没料到:极右翼胜选次日,中方表态不评内政,对德立场明确

奇思妙想生活家
2026-09-08 03:16:05
国内查无此人!海外却疯狂发新车?

国内查无此人!海外却疯狂发新车?

新车评网
2026-09-07 15:05:50
多年布局将前功尽弃?已经独立满百年的蒙古突然调整对外策略,正逐步消解中国历时40年苦心推进的相关战略布局成果

多年布局将前功尽弃?已经独立满百年的蒙古突然调整对外策略,正逐步消解中国历时40年苦心推进的相关战略布局成果

人生录
2026-09-08 00:05:22
沉默7天后,中方送给越南2句话,菲律宾趁势出手,解放军开始上场

沉默7天后,中方送给越南2句话,菲律宾趁势出手,解放军开始上场

老嫅尾声体育解说
2026-09-08 01:30:48
一针没打的280万人,2026年身体真相曝光

一针没打的280万人,2026年身体真相曝光

华庭讲美食
2026-08-26 01:21:08
消息称奥迪中国分治方案基本敲定,上汽奥迪只留AUDI

消息称奥迪中国分治方案基本敲定,上汽奥迪只留AUDI

IT之家
2026-09-07 19:36:57
2026-09-08 06:19:00
数字生命卡兹克 incentive-icons
数字生命卡兹克
反复横跳于不同的AI领域,努力分享一些很酷的AI干货
587文章数 719关注度
往期回顾 全部

科技要闻

小米澎程N90 Max定价26.99万元

头条要闻

梅艳芳哥哥申请禁令阻止梅妈火化:母亲死得不明不白

头条要闻

梅艳芳哥哥申请禁令阻止梅妈火化:母亲死得不明不白

体育要闻

世界杯-中国女篮20分大胜意大利锁D组第二 韩旭19+10杨舒予15分

娱乐要闻

热搜第一,演员李沐宸致歉

财经要闻

证监会原副主席王建军一审被判无期徒刑

汽车要闻

智能可变大空间SUV 小米澎程系列车型上市 20.99万起

态度原创

时尚
亲子
数码
本地
公开课

内娱女星,纷纷“去父留子”

亲子要闻

爱给孩子贴标签这一点我一定要改!!! 杨雪呀

数码要闻

烤箱标配摄像头!今年IFA厨电除了卷AI,还在回归功能本质

本地新闻

扒完小作文,富豪们私藏的度假胜地有多绝

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版