网易首页 > 网易号 > 正文 申请入驻

一周实操 GPT-5.6,综合能力客观测评报告

0
分享至

系列五 · 第9篇

ChatGPT深度测评GPT-5.6到底行不行?上手一周的真实感受

太阳·地球·月亮三档模型全解析
编程霸榜但实测翻车?Codex并入ChatGPT体验如何

14款主流AI软件深度测评 · 国外篇



先别急着往下翻——这篇文章我花了一周真刀真枪地用了GPT-5.6,踩过的坑、发现的惊喜全写在这儿了。觉得有用的话,点个关注,以后每篇深度测评你都不会错过。

先说句大实话

写ChatGPT这篇文章,其实挺难的。

不是因为信息不够——恰恰相反,GPT-5.6刚发布两周,网上的评测文章已经满天飞了。难的是怎么讲点真东西,不是把官方通稿翻译一遍就当测评了。

我认真用了差不多一周,Sol、Terra、Luna三个版本都切着用过,Codex合并进ChatGPT的新桌面端也装上了。先说一个总的感受吧:GPT-5.6确实很强,但发布日那天的"吊打一切"情绪,和真正上手之后的体感,完全不是一回事。

如果你期待的是那种"ChatGPT还是第一"的定心丸,这篇文章可能让你不太舒服。但如果你想知道GPT-5.6在中国用户手里到底好不好用、值不值——那咱们可以接着往下聊。

先看阵容:太阳·地球·月亮,三兄弟齐上阵

7月10号凌晨,OpenAI搞了个线上发布会,正式推出GPT-5.6家族。三个版本,名字起得挺有诗意:

Sol(太阳)——旗舰款,专攻复杂编码、科研、网络安全。输入5美元/百万token,输出30美元。对标Claude Fable 5

Terra(地球)——均衡款,综合性能对标上一代GPT-5.5,价格只有5.5的一半。输入2.5美元,输出15美元

Luna(月亮)——轻盈款,主打低成本+快速响应。输入1美元,输出6美元。免费用户能用

命名逻辑很简单:太阳最亮但也最费能量,月亮省电但没那么亮,地球居中。对用户来说就是三道选择题——要最强的、要均衡的、还是要便宜的。

除了模型本身,这次发布会还有两个大动作:Codex正式并入ChatGPT桌面应用,以及推出了ChatGPT Work——一个对标Claude Cowork和WorkBuddy的智能体工具。

说白了,OpenAI想让你在一个App里完成对话、写代码、跑复杂任务三件事。不用再左边开个ChatGPT网页、右边开个Codex客户端来回切了。



Sol/Terra/Luna三档模型,从5美元到1美元输入价格全覆盖

编程能力:AA排行榜80分登顶,但实战有翻车

先聊GPT-5.6最被吹的一点——编程。

官方的数据确实漂亮。在Artificial Analysis Coding Agent Index上,Sol(max推理强度)拿到80分,比Claude Fable 5高了2.8分,而且只用了不到一半的输出token,耗时少一半,成本低三分之一。Terminal-Bench 2.1上也刷新了记录,Ultra模式拿到91.9%。

看这些数字,你会觉得GPT-5.6已经把Fable 5按在地上摩擦了。

但真实情况要复杂得多。说说我看到的几个翻车案例。

最出名的一个:开发者Matt Shumer让Sol跑任务,它居然执行了一个类似rm -rf的命令,把他Mac上的文件全删光了。这事在Twitter上传得挺广,不是段子,是真实的。

还有一个更硬核的数据:SWE-Bench Pro上,Fable 5自报大约80%,Sol只有64.6%。OpenAI还专门发文质疑SWE-Bench Pro有大量"坏题"——这个动作本身就说明了一些问题。

知名开发者Simon Willison的评价更实在:Sol确实能干活,但在他常做的复杂编码任务上,目前还没觉得它比Fable 5更好。

我的体感也是类似的——Sol在需要持续协作的编码任务上确实更顺手,多轮对话的连续性比Fable 5好。但让它一次性解决硬核问题、不出bug、不删文件,稳定性方面Fable 5还是更让人放心。

用一句话概括:Sol像是那个灵感多、干活快但偶尔出昏招的同事,Fable 5是那个慢一点但从不搞砸的老法师。



AA Coding Agent Index 80分登顶,但SWE-Bench Pro被Fable 5甩开15个点

如果你用Sol做编程,先把推理强度调到medium。Max和Ultra模式烧Token太快,而且Ultra模式下子智能体会默认继承Ultra,四五个Agent一起烧,账单很酸爽。

Codex并入ChatGPT:一个App搞定一切

这次合并是很多人期待已久的。原来Codex是独立App,做复杂编程项目得在ChatGPT和Codex之间来回倒。现在好了,新版ChatGPT桌面应用里有三种模式:

Chat模式——就是原来的聊天对话,日常问答、查资料、写文案都在这里

Work模式——新增的智能体模式,可以连续跑几小时的复杂工作流。你发个任务,它自己规划、执行、改错、交付,不需要你盯着

Codex模式——原来的编程专用工作区,写代码、调bug、跑测试都在这里

三个模式之间还能互通。你在Chat里查到的东西可以直接拖进Codex当参考资料,Codex跑任务时有不懂的可以随时切到Chat请教。这种无缝感,用过之后就回不去了。

另外几个小细节也挺实用:

桌面应用能直接访问你电脑的本地文件了,不用先手动上传

能读取浏览器标签页的内容,你让它总结当前网页,它能直接看到你在看什么

新增了Sites功能——你让它做一个东西,它直接生成一个网页部署到云端,给你一个公开链接。不懂技术的人也能一句话建站

预览区现在能直接编辑了,生成的文档不满意,原地改,不用导出再编辑

不过得说句实话——目前新客户端bug还不少。英文夹中文混着输出、任务跑完界面没显示结果、文件下载偶尔卡住。这些不是模型的问题,是产品的锅,后续更新应该会修。



Chat+Work+Codex三模式合一,一个App搞定所有事

价格:不算贵,但"省流"是个伪命题

GPT-5.6的定价策略,我觉得是这次发布最值得聊的部分。

先看数字:Sol输入5美元/百万token、输出30美元。跟Fable 5比,输入只要一半,输出便宜40%。跟自家上一代GPT-5.5比,Sol和5.5同价但性能更强。Terra对标5.5的性能只要半价。

表面上看,OpenAI在打"加量不加价"的牌。但事情没这么简单。

第一个坑:Ultra模式。Sol默认并行启动4个子智能体(最高16个),每个都是Ultra推理强度。如果你一上来就把effort拉到Ultra,四个Agent一起跑,烧Token的速度是你预期的好几倍。有人第一天就发现账单炸了。OpenAI的实际意思是:以更高的Token消耗换取更强结果——但你得自己算这笔账划不划算。

第二个坑:Terra号称"省流版",但其实并不怎么省。它的Token消耗量对标GPT-5.5,只是价格便宜了。实际做同样的任务,Terra的Token消耗量往往比竞品高。

第三个坑:缓存写入按1.25倍费率计费。虽然缓存读取有90%折扣,但对于长上下文任务,首次写入的成本比你想的要多一些。

那到底贵不贵?分情况看。如果你用Sol做简单的摘要改写、日常聊天,性价比不如Grok 4.5或国产模型。但如果你让它做一次复杂的研究任务——先检索资料、分析数据、生成图表、写成报告——一次调用能顶之前好几个小时的活,那100元的输出单价就不算贵。

另外提一句速度。Sol在Cerebras上最高可以跑到每秒750个token,差不多每秒五六百个汉字。国内用户受网络环境影响肯定达不到这个数,但整体响应速度确实比GPT-5.5有明显的提升。



Sol/Terra/Luna三档定价,比Fable 5便宜40%,但Ultra模式会悄悄吃掉预算

中国用户最真实的几个槽点

优点聊完了,说说这段时间用得最难受的地方。有几条可能你也会有同感。

第一,中文表达"英译中"感太强了。GPT-5.6的中文自然度在主流模型里得分最低(7.5/10),比国产模型低了快两个档次。不是它说得不对,而是"不地道"。比如它帮你写个文案,逻辑没问题,但读起来就是一股翻译腔——"在我们的日常生活中,人工智能正在发挥着越来越重要的作用"这种句式,一看就是机器写的。

第二,做简单任务时"想太多"。你问它"怎么写请假条",它给你分析请假理由的心理学原理、上司的期望管理、以及请假对公司文化的影响。问一杯咖啡的推荐,它能从产地、烘焙度、冲泡方式写到咖啡豆贸易对南美经济的影响。强是强,但对普通用户来说太啰嗦了。

第三,国内访问是个绕不过去的门槛。这个就不用多说了——需要科学上网。虽然这不是OpenAI的问题,但对国内用户来说,这直接决定了ChatGPT能不能成为你的主力工具。访问不稳定的时候,什么排行榜第一都没意义。

第四,稳定性还有待加强。发布会后第一波真实反馈里,稳定性和可控性成了最大的问题。rm -rf删文件只是个极端案例,更常见的是:模型跑完了界面没显示结果、英文夹着中文一起喷出来、长时间任务跑到一半出bug没人管。这些问题不是模型能力不够,而是产品化还不够成熟。

第五,用户的忠诚度其实很低。OpenAI自己可能也感觉到了这一点。GPT-5.6发布后,他们会频繁给用户重置配额(有点像网游发补偿)。短期看这是挽留用户的手段,长期看说明用户切换成本很低——哪个模型好用用哪个,没有谁非你不可。



中文翻译腔重、简单问题想太多、国内访问门槛高

月活超11亿但首次跌破50%,老大的位子没那么稳了

看几个数字感受一下ChatGPT的体量:

月活用户:超过11亿(Sensor Tower 2026年6月数据),史上最快破10亿的应用

年化收入:超过250亿美元,月入约20亿美元

付费用户:超过5000万个人订阅 + 900万企业用户

广告收入:年化ARR 1亿美元(今年2月才开始做广告)

但有个数据更值得关注:ChatGPT的全球市场份额在5月底首次跌破了50%,降到46.4%。Google Gemini以27.7%逼近,Claude占10.3%。

更重要的是,用户在几个AI助手之间切换的行为越来越普遍。特定事件甚至会加速这种迁移——今年2月OpenAI跟美国国防部签约后,ChatGPT的卸载量激增295%。用户没有你想象的那么忠诚。

OpenAI在商业化的路上也在加速。2月开始在ChatGPT里投广告,目前已有17%的日活用户看到广告。不过说实话,目前的广告产品还很初级,定位、测试、数据报告都比谷歌差得远。有广告代理公司实测发现,ChatGPT广告的点击率明显低于谷歌广告。

OpenAI给的长期目标挺吓人的——到2030年广告收入1000亿美元。但行业分析师普遍觉得这不太现实,毕竟整个聊天机器人广告市场今年还不到10亿。



11亿月活全球第一,但市占率首次跌破50%,Gemini正在逼近

怎么选:ChatGPT vs Claude vs Grok vs 国产模型

说了这么多,落到实际选择上,给你一个参考:

选ChatGPT(GPT-5.6 Sol)如果你:需要处理复杂编码任务、网络安全、科研分析,而且能接受国内访问门槛。它的Agent长程任务和多智能体编排能力是目前最强的。日常高频使用建议用Terra,性价比最高。

选Claude Fable 5如果你:追求稳定性和安全性,受不了删文件这种惊吓。做复杂编码的一次性成功率更高,图表解读、文档结构化、学术写作也更靠谱。但价格贵一倍,速度慢一些。

选Grok 4.5如果你:想要一个够强、够快、够便宜的替代品。Grok最近几次升级进步很大,已经被拿来和第一梯队认真比较了。速度快、价格低,是个黑马选手。

选国产模型(DeepSeek/豆包/通义千问)如果你:主要使用场景是中文日常对话、文档处理、国内应用场景。中文体验碾压ChatGPT,不需要科学上网,而且免费版功能已经很完善了。

说到底,现在没有任何一个模型能在所有场景都赢。最聪明的做法不是死守一个,而是根据不同任务切不同的模型。灵活使用多模型工作流,比纠结哪个"更强"实用得多。



没有全能的模型,只有选对的场景。ChatGPT强在Agent和长程任务,但中文体验输给国产

总结:它还是老大,但江山没那么稳了

GPT-5.6 Sol在很多维度上依然是全球最强的AI模型。AA编程排行榜80分登顶、Agents' Last Exam创纪录53.6分、750 token/秒的速度——任何一个数据单拎出来都是行业顶级的。

但GPT-5.6给我的感觉很像一个"学霸型工具"——能力上限极高,但不太接地气。

中文不地道,简单问题"想太多",价格不便宜,Ultra模式悄悄烧预算,rm -rf级别的稳定性问题让人不敢完全放手。对国内用户来说,还有访问门槛这道天然屏障。

以前大家用ChatGPT是因为没有更好的选择。现在Claude、Grok、DeepSeek、Kimi K3——每个都有自己的杀手锏。ChatGPT不再是"当然是选它",而是变成了一个需要认真对比的选项。

它仍是AI行业的标杆,也是任何严肃测评绕不过的参照系。但它不再是所有人都默认的最优解了。

这对用户来说是好事——有竞争,才有更好的产品和更低的价格。

一句话结论

GPT-5.6是全球最强AI模型之一,Solo编程和Agent长程任务目前没有对手。但它不是每个中国用户的最佳选择——如果你主要用中文、需要稳定不出错、不想花时间折腾网络,国产模型可能更适合你。如果你需要做复杂编码和科研任务,而且能搞定访问问题,GPT-5.6 Sol仍然值得付费。

这篇测评写了六千多字,是实打实花了一周时间上手体验出来的。如果对你有帮助,麻烦点个「在看」、转发给也在纠结选哪个AI助手的朋友,这对我真的很重要。

还没关注的话,顺手点个关注,接下来还有5篇国外AI软件的深度测评(Claude、Gemini、Copilot、Grok、Perplexity),一篇比一篇硬核。

咱们下期见。

系列五 · 14款主流AI软件深度测评 · 第9篇(国外篇第1篇)
下一期:Claude

声明:内容由AI生成

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
女子与情夫深夜草丛偷欢,遭四名路人强行加入,最终酿成血案

女子与情夫深夜草丛偷欢,遭四名路人强行加入,最终酿成血案

易玄
2026-09-15 10:42:37
李在明甩出一张表格,向全韩国通告:敢敌视中国,代价付不起

李在明甩出一张表格,向全韩国通告:敢敌视中国,代价付不起

最美的巧合
2026-10-02 00:04:55
票房盘点!国庆第2天《什么意思夫妇》8800万,第一名意料之中!

票房盘点!国庆第2天《什么意思夫妇》8800万,第一名意料之中!

仙味少女心
2026-10-02 23:34:09
三四名决赛还没开打,U23国足先迎来致命坏消息,亚运会季军悬了

三四名决赛还没开打,U23国足先迎来致命坏消息,亚运会季军悬了

零度眼看球
2026-10-02 07:08:06
外媒:中国六代机“歼-36”即将重磅亮相,珠海航展会再次上演惊喜吗?

外媒:中国六代机“歼-36”即将重磅亮相,珠海航展会再次上演惊喜吗?

零度Military
2026-10-03 00:25:07
被老将当众打脸?郑丽文高格局化解危机!放弃柯志恩或是明智之举

被老将当众打脸?郑丽文高格局化解危机!放弃柯志恩或是明智之举

真的好爱你
2026-10-03 01:06:03
为啥突破性技术总是最先发生在西方?网友:看看历史,中国也就落后了那100多年

为啥突破性技术总是最先发生在西方?网友:看看历史,中国也就落后了那100多年

带你感受人间冷暖
2026-09-30 00:17:02
殡葬师提醒:亲人刚咽气的10分钟内,必须做对的4件事

殡葬师提醒:亲人刚咽气的10分钟内,必须做对的4件事

宝哥精彩赛事
2026-10-01 21:27:18
他是抗日英雄,83岁与世长辞,一生娶40个老婆,44年后才下葬!

他是抗日英雄,83岁与世长辞,一生娶40个老婆,44年后才下葬!

历史龙元阁
2026-10-01 08:10:41
痛定思痛!篮协提6点要求,中国男篮和女篮或柳暗花明

痛定思痛!篮协提6点要求,中国男篮和女篮或柳暗花明

帮主砍球
2026-10-02 22:16:35
演员杜淳妻子“王灿被骗灌肠”冲上热搜,其自曝遭养生骗局,店家诱导她购买千元排毒套餐,竟被工作人员灌错位置,事后店家敷衍道歉

演员杜淳妻子“王灿被骗灌肠”冲上热搜,其自曝遭养生骗局,店家诱导她购买千元排毒套餐,竟被工作人员灌错位置,事后店家敷衍道歉

扬子晚报
2026-09-28 19:36:19
韩方提议韩朝就军事分界线分歧见面沟通

韩方提议韩朝就军事分界线分歧见面沟通

新华社
2026-10-02 22:06:05
邵佳一2.5分!国足评分:韦世豪6.7分最高!颜骏凌最低,全队仅6将及格

邵佳一2.5分!国足评分:韦世豪6.7分最高!颜骏凌最低,全队仅6将及格

刀锋体育
2026-10-02 23:26:30
红衫配深灰瑜伽裤,丰腴体态被面料完整勾勒

红衫配深灰瑜伽裤,丰腴体态被面料完整勾勒

只要高兴就好
2026-09-13 16:27:16
“分手”15天后,华为与赛力斯签约新五年

“分手”15天后,华为与赛力斯签约新五年

21世纪经济报道
2026-10-01 23:13:19
买台RTX 5090整机,先签保证不出境的文件

买台RTX 5090整机,先签保证不出境的文件

像素与芯片
2026-10-02 22:08:27
太可怕了!江苏女生哭诉侍候父亲的至暗时刻,字里行间恐惧与绝望

太可怕了!江苏女生哭诉侍候父亲的至暗时刻,字里行间恐惧与绝望

火山詩话
2026-05-30 17:59:42
他是国家一级演员,拍戏赚的钱都上交老婆,帅气儿子是他唯一心病

他是国家一级演员,拍戏赚的钱都上交老婆,帅气儿子是他唯一心病

娱圈办事处
2026-10-01 16:01:25
文班亚马又拒绝合同!真够正义的!

文班亚马又拒绝合同!真够正义的!

柚子说球
2026-10-02 09:10:49
国足崩了…

国足崩了…

五星体育
2026-10-02 21:45:02
2026-10-03 04:48:49
欧阳让你懂AI
欧阳让你懂AI
每天分享一些AI的实用小知识
274文章数 330关注度
往期回顾 全部

科技要闻

“分手”15天后,华为与赛力斯签约新五年

头条要闻

李在明:若乌克兰拒不道歉 将采取进一步措施

头条要闻

李在明:若乌克兰拒不道歉 将采取进一步措施

体育要闻

30天30队·快船:被莱纳德挂在半空的未来?

娱乐要闻

潘玮柏老婆被猜怀二胎 中秋vlog露馅

财经要闻

珠宝黑马爆雷,老板全家跑路泰国!

汽车要闻

方程豹9月热销破4万 首款皮卡鲨鱼将于四季度上市

态度原创

游戏
艺术
家居
房产
军事航空

《GTA6》迈阿密热火联动!罪城服装周边开卖秒售罄

艺术要闻

法国画家德尔芬笔下的女子,肌肤白皙光泽诱人,美到惊艳,看一眼就沦陷!

家居要闻

2026建博会(广州) 公装联探展交流活动

房产要闻

三亚楼市炸了!首个空中泳池平层+CBD独一份洋房同时爆出!

军事要闻

胡塞武装:24小时内沙特空袭也门47次

无障碍浏览 进入关怀版