网易首页 > 网易号 > 正文 申请入驻

GPT-5.6深夜上线,ChatGPT和Codex正式合并,一个时代结束了。

0
分享至

  今天,GPT-5.6终于在OpenAI的直播中正式上线了。

  除了GPT-5.6之外,ChatGPT也迎来了2022年诞生之后,我觉得最大的升级。

  从OpenAI的直播预告动画就能看出来有趣的端倪了,ChatGPT和Codex,在今天、在此刻合体。

  

  于是,全新的ChatGPT来了。

  

  Codex直接消失,与ChatGPT应用正式合并,以后,也没有Codex这个应用了,只有ChatGPT了。

  但是当你打开新版的ChatGPT界面以后,你又会发现,原版的ChatGPT界面也没有了,满屏的UI,都属于原本的Codex,只剩下那个小小的聊天Tab,证明着曾经的ChatGPT,还存在过。

  

  突然有点感慨。

  至此,由ChatGPT 2022年11月30日开启的Chat时代,也在今天完成了属于大众启蒙的使命,而今天,ChatGPT和Codex的合并,一切也都标志着新时代的来临,此名:

  Agent时代。

  让我们一个一个来聊。

  一. GPT-5.6

  先聊最核心的GPT-5.6。

  这次一共是三个模型,分别是 新旗舰模型Sol,以及适用于日常工作的均衡模型Terra,还有OpenAI所谓的最具成本效益的模型Luna。

  我们主要的核心,还是来聊GPT-5.6 Sol,因为这个也基本代表着OpenAI能对外放出来的目前智能的巅峰。

  这个模型强不强,你就看Anthropic的动作就行了,在GPT-5.6 Sol发布后,他们直接决定,重置额度。。。

  

  可能我这几年,从来没有像现在这样,如此期待一个新模型,期待GPT-5.6的上线。

  原因特别简单,因为我那个AI新闻网站AIHOT,虽然大的我能做的都做了,比如IP地址已经换了,且藏在了边缘代理后面,做了部分DDoS防护,封禁策略和JS挑战啥的也都做了。

  但是每天都在被各种手段攻击,最初的普通攻击,到现在几乎全是DDoS,还有用分布式CC来恶心的,各种乱七八糟的。

  昨天一天就被打了4轮,昨天早上的没防住,导致昨天早上又被干崩了,但是 下午的3轮都防住了 。

  

  在这个阶段,Claude Fable 5已经完全没办法用了,因为这些词几乎都是敏感词,一聊DDoS啥的直接给我切换到Opus 4.8,而且Fable 5虽然智商和规划能力超群,但是在真正的执行上,还是有点问题,经常顾此失彼,然后漏很多的东西,并且跟Claude系列一样,有一定的幻觉。

  然后最大的缺点,就是贵,没蹬一会额度就没了。。。

  

  GPT-5.5是我最近反而用的最多的了。

  但是问题也非常大,规划和做方案的能力非常一般,完全不思考全面,起手就知道干,幻觉率确实极低,代码执行确实很强,改BUG啥的很不错,但是吧,也经常不够全面 ,再加上方案和规划能力是一坨, 短板还是有点太明显了。

  经常给我用的非常的暴躁。

  

  在做安全策略上,更是漏洞百出,它做的方案,被人打成筛子,最后还是得我那仅剩的10%额度的Claude Fable 5来进行规则的重置和兜底。

  这7天高强度的攻防和平均每天16个小时的Coding的经验,让我对Fable 5和GPT-5.5的评价一下的话。

  那就是Fable 5确实是一个总监级别的大神,但是你知道的,管理层嘛,一般执行的细节程度上总归有一点的不精确,工具使用、主动性太强了,经常不管不顾的自己就全部给你搞完了,但是最后在一些细节上,是偏离了你想要的东西的。

  而GPT-5.5呢,就是一个高级工程师,在执行上确实是一把好手,但是用一个网友的话来做一个很形象的描述就是:“GPT-5.5最像那种会议室里突然站起来画白板的人,你还在描述混乱,它已经开始拆方案。”

  现在就卡在这了,Claude Fable 5额度用完了,GPT-5.5只能做中型的项目执行。

  所以在这个背景下,大家应该就懂了,为啥我如此的期待GPT-5.6了。

  因为真的希望他们能把整个Coding的能力,再往前推一步,而且我极度支持OpenAI干死呆逼Anthropic。

  在OpenAI 6月26号发布了前瞻之后,今天凌晨,GPT-5.6终于来了。

  

  我第一时间直接把GPT-5.6 Sol拉到最高档Ultra开干了。

  在我高强度并行开发了5个小时之后,我觉得我对GPT-5.6有了一些自己的体感,如果用一段话描述的话,那就是:

  当今世界最水桶级别的模型,价格低廉,性价比极高,方案和规划能力在一些非巨型任务上媲美Fable 5(巨型任务我也接触不到,已经远超我的能力上限了),Agent能力和Coding执行上幻觉率极低极为精准,配合Codex交互体验和远程Coding更是极佳,浏览器控制更加稳定等等。

  不过前端审美和内容创作依然是老大难问题,这块确实比不上Claude,但除此之外,其他的任何方面我想不出来我自己再用Claude的理由了。

  而且,GPT-5.6 Sol,包含在订阅计划中,未来,订阅用户可用!

  OpenAI赛高!Codex赛高!GPT赛高!

  还是惯例,简单过一下GPT-5.6的官方跑分。

  在覆盖55个领域长期专业工作流的Agents' Last Exam中,GPT‑5.6 Sol以53.6分刷新纪录,比Claude Fable 5(自适应推理)高出 13.1 分。

  即便采用中等推理模式,它仍以约四分之一预估成本领先Fable 5达11.4分。

  

  这个我觉得是里程碑式的,Fable 5确实很强,但是那个经济效应,几乎也代表着我们几乎不可能日常大规模的使用。

  而GPT-5.6以极低的成本,完成了执行效果上的超越。

  而在AA家的智能指数上,GPT-5.6比Fable 5只低了一分,但是 任务完成时间缩短61%,成本预估降低约一半。

  

  而在Coding领域,这个优势更加离谱了。

  在Artificial Analysis 编程智能体指数中,启用最大推理能力的 GPT‑5.6 Sol 以 80 分创下最新技术标杆,比Fable 5高出2.8 分,同时输出 token 减少一半以上,耗时缩短一半以上,成本降低约三分之一。

  

  从这张图其实也能看出来,对于日常来说,改BUG啥的其实推理强度开到高就差不多了。

  

  如果是大型的任务,就开到极高。

  

  究极大型的重构或者要命相关(比如我的AIHOT防护)的任务,或者你的token实在烧不完的时候,偶尔再把推理等级开到Ultra,是Token利用率最高的解法。

  而且你知道,当我看到GPT-5.6 Sol在衡量从接触漏洞代码到任意代码执行进展的ExploitBench, 上,它在可比输出token预算下得分为73.5%。

  这意味着什么呢,意味着,只要极低的成本,就可以达到几乎跟Fable 5相同的网络安全效果!!!

  

  说实话,我看到这个的时候,我的眼睛都在冒光,我激动的都睡不着觉。

  而且在我的实测中,虽然偶尔也会出现网络安全的禁止提示。

  

  但是在我表明是为了做我的边缘代理的防护策略,我希望他帮我优化之后,他顺利的给我进行执行了,没有做任何的阻拦。

  我给的任务,就是这个,我因为是语音输入的,还输入错了,把EO识别成了EU,不过这种都是小问题了:

  

  我直接开了Ultra,而且是快速模式,几乎全部都是浏览器操控,在将近21分钟之后,给了我一个非常详细的审查报告。

  我是200刀的Pro套餐,Token的消耗量大概5小时额度花了20%,周额度大概花了2~3%,我想说,这比Fable 5舒服太多了。

  

  要知道,这可是21分钟的全程Chrome操控且开了快速模式,有1.5倍的消耗,再加上Ultra啊!

  如果是Fable 5的话,你相信我,就这么玩,Fable 5 + Ultracode,都没有快速模式一说,一波能给你周额度干没8~10个点。

  太离谱了。

  而且这个质量,非常的高。

  因为我的边缘代理的规则底子是Fable 5打的,后面GPT-5.5在上面打了一些补丁,也做了N次优化,但是感觉也优化不出来啥,找不出来啥问题了。

  但是GPT-5.6 Sol,直接找出了一堆以前他两没有想到的问题。

  

  我就不放全文了,因为漏洞太多了。。。

  直接扒拉出来了11个任务。

  反正我是叹为观止,然后让GPT-5.6 Sol一波直接自己去修了。

  非常的稳,一波处理的明明白白,没有任何的BUG,就看明天被攻击时候的实际防护效果了。

  然后还有一个方案,大概能看出来GPT-5.6 Sol和Claude Fable 5的一些性格和个性的区别。

  比如我有一个长久以来的痛点,就是为了AIHOT大家无需开魔法的阅读体验,所以我做了每个新闻的详情页,就像这样。

  

  但是这个详情页想法是好的,在实现上,有巨大的问题,因为我要把所有源站的信息,原封不动的抓过来,然后尽可能的给大家还原成跟源站一样的阅读体验。

  但是你要知道,我现在监控信源的背后,有几百个形色各异的网站,我已经尽可能的去想尽一切办法去处理了,还是经常会抓来一些奇奇怪怪的东西。

  就像这样。

  

  还有这样。

  

  想适配所有的网页,全部清洗成好看的,几乎跟源站一样的,甚至还要保留格式、超链接、代码库、图表等等,太难了,因为背后的网页形式实在是太多太多了,之前用Opus 4.8和GPT-5.5分别开发过,效果基本就是一坨狗屎。

  但是我一直还是想解决这个需求,让AIHOT的用户在浏览信息上,能得到最好的体验。

  所以我就把这个需求,同时扔给了GPT-5.6 Sol和Claude Fable 5。

  让他俩同时想方案。

  

  甚至他两用的都是同一份CLAUDE.md,因为我的AGENTS.md直接软链的 CLAUDE.md, 所以几乎变量都是一样的,唯一不同的就是模型本身。

  而最终输出后,GPT-5.6的方案,坦诚的讲,在细致程度上,我甚至觉得比Fable 5考虑的更加周全,这确实是一个很有趣的点。

  比如一开始,从源头上,其实是有分类的,比如有很多不是直接抓取的,是走API和RSS的。

  

  这些是有明确的正文的。

  而在GPT-5.6的考虑中,也想到这部分,但是,他并没有跟Fable 5一样,直接把那个规则当做了必须遵守的。

  而是提出了质疑。

  

  所以,我们不能信他们,所有的源头都只是源头而已,我们必须自己要去做结构化的正文抽离,即使它是RSS和API输出来的,也需要如此考虑。

  Fable 5其实把这个细节漏了。

  包括有一个同域名网站里最近反复出现的内容,大概率就是导航啊固定CTA啥的,所以其实可以做标准化的统计,重复的就可以被识别出来了直接删掉。

  GPT-5.6和Fable 5都考虑到了这一点,但是还是那个问题,在首次的输出上,依然是GPT-5.6考虑的更加细致一点。

  而且还有个更离谱的是,我觉得,这一次GPT-5.6输出内容的可读性,我觉得比Fable 5是要强的,他的方案我能读的下去,但是Fable 5,可能是我太菜逼了,他的信息密度太高了,我读不下去。

  最后这两个方案,我还是选择了让GPT-5.6 Sol去开了目标模式进行最终执行。

  

  因为坦率的讲,这个任务有点复杂,我对Claude Fable 5能长时的稳定的精准的处理完这么多细节,我没有信心,后期其实还是容易出现幻觉,改了这里忘了那里,然后最后再对抗性审查的时候又不断的推翻自己,很麻烦。

  但是GPT-5.6的幻觉率在我的测试过程中,我体感是一如既往的,几乎就是洲际导弹的级别,指哪打哪,再配合上目标模式,最后总是能极其精准的完成任务,真的很香。

  虽然过程中也会偶发跟GPT-5.5一样,有一些奇怪的低级错误导致了部分环节中的循环,但是次数会少一些,同时也能更快的解决,且不影响最终的输出。

  然后之前的那个任务,截止到我发文的时候,已经开发了快2个小时了,但是还没有开发完,主要是逐篇审查对比优化,确实比较浪费时间。

  

  但是在它测试过程,我看到了一些页面,还是很棒的,我现在有点期待完他写完以后,部署到AIHOT上的效果了。

  然后是前端审美这块,确实比GPT-5.5有巨幅加强,但是还是离Claude有一定距离。

  比如最近马上台风不是要来了吗,我随手写了一个Prompt:

  调用一个接口获取巴威台风数据, 生成一个单HTML文件的可视化大屏。

  GPT-5.5的效果是这样的,就Emmmmmm。

  

  但是GPT-5.6 Sol是这样的。

  

  前端效果上还是进化了很多的,至少是不会出AI Slop了。

  目前Plus、Pro用户可以使用GPT‑5.6 Sol,而免费和Go用户,只能使用 GPT‑5.6 Terra。

  而最高档的Ultra推理等级,只对200刀的Pro用户开放,Plus用户也用不了。

  目前GPT‑5.6按每百万Token计费。

  Sol 为 5 美元输入 / 30 美元输出;Terra 为 2.5 美元输入 / 15 美元输出;Luna 为 1 美元输入 / 6 美元输出。

  GPT‑5.6 还引入了更可预测的提示缓存功能,包括支持显式缓存断点⁠以及30分钟的最低缓存生命周期。

  对于GPT‑5.6及后续模型,缓存写入按模型非缓存输入价格的1.25倍计费,而缓存读取则继续享受90%的缓存输入折扣。

  二. ChatGPT Work

  这是一个我没有想到的更新。

  也就是我们开头所说的,合并了ChatGPT和Codex。

  现在,你可以在左上角,直接切换工作和Codex了。

  

  其实就是Cowork和Claude Code的区别。

  Codex虽然是个通用Agent,可能一些专业者都知道,他既能写代码,也能办公,完全没有问题的。

  但是依然有个市场的老大难问题,就是心智问题,你一说你能开发,你能写代码,很多的用户依然会觉得,那上手门槛是不是很高。

  所以从心智上来说,Work和Code,反而拆开应该是最好的,虽然底层都是一个东西,但是用户认账啊。

  你看国内WorkBuddy就知道了,现在都千万日活了,你这找谁说理去。

  而OpenAI的产品确实有点东西,他们妙就妙在这里,没有选择推出Codex Work,而是直接把ChatGPT这个10亿周活的巨无霸给改造了,变成了ChatGPT Work,你看,这是不是就好理解多了。

  而且过去的ChatGPT用户迁移过来,那简直顺理成章。

  不过你要说这个Work模式跟Codex的区别,我觉得可以小到忽略不计了。

  最大的心智特征,可能就是在这个菜单栏上,把分支啥的偏Code的元素,换成了Doc、PPT、Excel三件套,让你体感上,更像是帮你工作的。

  

  我随手用GPT-5.6 Sol给它自己的上线,用它自己的插件,做了个PPT。

  

  就咋说呢,GPT系列的审美啊,是不是得GPT-6的全新一代的预训练模型才能补上了。。

  只是纯能看了。

  不过处理表格啥的数据分析任务,那是真的强,强到上天。

  有条件的,我推荐大家所有人都可以去下一个ChatGPT的应用,用它来帮大家去处理工作,这可能是你当今,能用上的性价比最高、质量最好的Work类Agent产品了。

  而之前的ChatGPT Chat模式,也就是聊天,被藏在了一个小小的tab中,就好像,它的历史使命已经完成了。

  

  点击以后,右下角会出现一个弹窗,这个小小的界面,就是ChatGPT Chat了。

  

  而且这次还有个好玩的新东西,也是给Work场景用的。

  就是新增了一个叫站点的功能。

  

  我们过去都知道,很多非开发者,其实做了一个产品,想要部署到线上,给别人用还是很麻烦的一件事。

  所以OpenAI这次就为了解决这个需求,搞了这么个功能。

  底层本质是包了一个他们自己的叫Sites的Skill。

  

  你做完一个东西以后,直接用Prompt说一句话,比如用Sites部署一下。

  

  他就会自己帮你部署到线上,然后给你一个域名,这个域名就可以分享给你的朋友和同事了。

  

  对大众来说,极其友好。

  我觉得这一次,OpenAI用他们的产品、用他们的模型,再一次证明了。

  这家公司,还是有生命力的,他们还是当年的那个OpenAI。

  曾经的OpenAI,是面对Google的屠龙少年,随着时代的发展,他们逐渐从勇士,变成了金银财宝之上的恶龙。

  他们开始骂声一片,没人再喜欢他们,大家都在说,OpenAI就该完蛋。

  可随着Anthropic的异军突起,OpenAI有那么一段时间,被打的全线开花。

  他灰溜溜的走下了王座,看着曾经它的王座上,盘踞一条新的恶龙。

  随后,他重新拾起盾牌,捡起那个已经开始发绣的剑。

  斩向了自己的身后,把那个亲手将自己送上傲慢王座的Sora,一刀斩断。

  它决定回到群众中,做群众想要的模型,做群众喜欢的产品。

  直到几个月后的今天,他又回到了那个曾经属于他们的王座之前,站在了那个叫Anthropic的恶龙之前。

  他说,这次。

  轮到你了。

  以上,既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,如果想第一时间收到推送,也可以给我个星标⭐~谢谢你看我的文章,我们,下次再见。

  >/ 作者:卡兹克

  >/ 投稿或爆料,请联系邮箱:wzglyay@virxact.com

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
一半天堂一半地狱:被胖东来虐到崩溃,供应商为何不敢断供

一半天堂一半地狱:被胖东来虐到崩溃,供应商为何不敢断供

流苏晚晴
2026-09-07 11:51:30
45岁男子与女友合租一年吃30次他达拉非,一年后房颤,医生:无知

45岁男子与女友合租一年吃30次他达拉非,一年后房颤,医生:无知

垚垚分享健康
2026-09-06 06:50:20
中纪委再次强调!违规选任干部或用人失察失误,将这样处理!

中纪委再次强调!违规选任干部或用人失察失误,将这样处理!

职场资深秘书
2026-09-07 14:58:55
二手平台转让物品疑遭职业“到手刀”,“仅退款”套路钱货两空 小伙两次从浙江打车到临沂讨说法

二手平台转让物品疑遭职业“到手刀”,“仅退款”套路钱货两空 小伙两次从浙江打车到临沂讨说法

扬子晚报
2026-09-07 22:11:30
从误打误撞入行到“熟女天花板”,跨越二十年的业界传奇

从误打误撞入行到“熟女天花板”,跨越二十年的业界传奇

吃瓜党二号头目
2026-09-07 15:46:06
中国三大长寿食物,南瓜排第3!第一名我们天天见,很多人不爱吃

中国三大长寿食物,南瓜排第3!第一名我们天天见,很多人不爱吃

江江食研社
2026-09-05 15:30:12
网友“实地考察”景甜孙宇晨入住的酒店,调侃:难怪要贴黑胶带了

网友“实地考察”景甜孙宇晨入住的酒店,调侃:难怪要贴黑胶带了

东方不败然多多
2026-09-05 01:43:25
一起震碎你认知的刑事案:一家三口惨遭杀害,凶手竟是朝夕相处的至亲婆婆

一起震碎你认知的刑事案:一家三口惨遭杀害,凶手竟是朝夕相处的至亲婆婆

法网恢恢
2026-09-06 23:21:11
千万千万不要翻长辈手机,网友:这将会颠覆这个人在你心中的形象

千万千万不要翻长辈手机,网友:这将会颠覆这个人在你心中的形象

夜深爱杂谈
2026-08-29 21:36:29
我和妈妈十年受的苦原来100元就能解決,网友:穷人习惯得过且过

我和妈妈十年受的苦原来100元就能解決,网友:穷人习惯得过且过

夜深爱杂谈
2026-08-29 21:06:18
“妖股”直击:平潭发展盘中振幅超8%,两岸融合概念引资金博弈,成交额31.78亿元创近期天量

“妖股”直击:平潭发展盘中振幅超8%,两岸融合概念引资金博弈,成交额31.78亿元创近期天量

金融界
2026-09-07 14:34:43
被大佬带上桌的漂亮女孩们

被大佬带上桌的漂亮女孩们

微微热评
2026-07-22 13:02:16
之前还在避嫌!何超莲窦骁澳门看演出全程搂抱,甜蜜撒糖太好嗑

之前还在避嫌!何超莲窦骁澳门看演出全程搂抱,甜蜜撒糖太好嗑

情感大头说说
2026-09-07 18:02:51
一切崩塌都是迟早的事,你要早做准备

一切崩塌都是迟早的事,你要早做准备

东亚财评V
2026-08-27 18:53:49
撞见亲戚的秘密,到底有多窒息?成年人的体面,全靠假装不知道

撞见亲戚的秘密,到底有多窒息?成年人的体面,全靠假装不知道

夜深爱杂谈
2026-09-07 21:28:15
杨颖马尔代夫被偶遇,一身奢侈品素颜扎低马尾,脸都被墨镜挡住了

杨颖马尔代夫被偶遇,一身奢侈品素颜扎低马尾,脸都被墨镜挡住了

东方不败然多多
2026-09-06 15:04:36
亲华派彻底掌权,成功进入外国高层,对中国做过3好事,机会来了

亲华派彻底掌权,成功进入外国高层,对中国做过3好事,机会来了

山月明史
2026-09-06 21:15:33
94岁原中央保健局局长王敏清:50年没感冒,无三高,靠的就是这几招

94岁原中央保健局局长王敏清:50年没感冒,无三高,靠的就是这几招

新浪财经
2026-06-24 02:28:33
韩国券商:三星、SK海力士存储芯片库存不足10天,明年或现史上最严重短缺

韩国券商:三星、SK海力士存储芯片库存不足10天,明年或现史上最严重短缺

华尔街见闻官方
2026-09-07 19:29:54
“乱港分子”周庭:弃保潜逃加拿大,扬言“永不回国”,如今怎样

“乱港分子”周庭:弃保潜逃加拿大,扬言“永不回国”,如今怎样

芊芊子吟
2026-03-05 19:45:03
2026-09-07 22:56:49
数字生命卡兹克 incentive-icons
数字生命卡兹克
反复横跳于不同的AI领域,努力分享一些很酷的AI干货
587文章数 719关注度
往期回顾 全部

科技要闻

小米澎程N90 Max定价26.99万元

头条要闻

朝鲜新战舰"对阵"美日韩军演 特朗普此前刚向朝鲜示好

头条要闻

朝鲜新战舰"对阵"美日韩军演 特朗普此前刚向朝鲜示好

体育要闻

中超争冠形势:成都蓉城下轮打平夺冠

娱乐要闻

热搜第一,演员李沐宸致歉

财经要闻

证监会原副主席王建军一审被判无期徒刑

汽车要闻

25.99万元起 凯迪拉克全新XT5 PHEV正式上市

态度原创

家居
游戏
教育
艺术
手机

家居要闻

2026建博会(广州) 公装联探展交流活动

《上古世纪S》首度曝光品牌识别与主视觉图

教育要闻

班主任真的没人愿意当吗?为何有的学校津贴不高,老师还抢着干?

艺术要闻

Denisenko Olga:俄罗斯当代女画家

手机要闻

OriginOS 7内测招募:14款机型抢先尝鲜,升级的重心也已清晰!

无障碍浏览 进入关怀版