网易首页 > 网易号 > 正文 申请入驻

一周实操 GPT-5.6,综合能力客观测评报告

0
分享至

系列五 · 第9篇

ChatGPT深度测评GPT-5.6到底行不行?上手一周的真实感受

太阳·地球·月亮三档模型全解析
编程霸榜但实测翻车?Codex并入ChatGPT体验如何

14款主流AI软件深度测评 · 国外篇



先别急着往下翻——这篇文章我花了一周真刀真枪地用了GPT-5.6,踩过的坑、发现的惊喜全写在这儿了。觉得有用的话,点个关注,以后每篇深度测评你都不会错过。

先说句大实话

写ChatGPT这篇文章,其实挺难的。

不是因为信息不够——恰恰相反,GPT-5.6刚发布两周,网上的评测文章已经满天飞了。难的是怎么讲点真东西,不是把官方通稿翻译一遍就当测评了。

我认真用了差不多一周,Sol、Terra、Luna三个版本都切着用过,Codex合并进ChatGPT的新桌面端也装上了。先说一个总的感受吧:GPT-5.6确实很强,但发布日那天的"吊打一切"情绪,和真正上手之后的体感,完全不是一回事。

如果你期待的是那种"ChatGPT还是第一"的定心丸,这篇文章可能让你不太舒服。但如果你想知道GPT-5.6在中国用户手里到底好不好用、值不值——那咱们可以接着往下聊。

先看阵容:太阳·地球·月亮,三兄弟齐上阵

7月10号凌晨,OpenAI搞了个线上发布会,正式推出GPT-5.6家族。三个版本,名字起得挺有诗意:

Sol(太阳)——旗舰款,专攻复杂编码、科研、网络安全。输入5美元/百万token,输出30美元。对标Claude Fable 5

Terra(地球)——均衡款,综合性能对标上一代GPT-5.5,价格只有5.5的一半。输入2.5美元,输出15美元

Luna(月亮)——轻盈款,主打低成本+快速响应。输入1美元,输出6美元。免费用户能用

命名逻辑很简单:太阳最亮但也最费能量,月亮省电但没那么亮,地球居中。对用户来说就是三道选择题——要最强的、要均衡的、还是要便宜的。

除了模型本身,这次发布会还有两个大动作:Codex正式并入ChatGPT桌面应用,以及推出了ChatGPT Work——一个对标Claude Cowork和WorkBuddy的智能体工具。

说白了,OpenAI想让你在一个App里完成对话、写代码、跑复杂任务三件事。不用再左边开个ChatGPT网页、右边开个Codex客户端来回切了。



Sol/Terra/Luna三档模型,从5美元到1美元输入价格全覆盖

编程能力:AA排行榜80分登顶,但实战有翻车

先聊GPT-5.6最被吹的一点——编程。

官方的数据确实漂亮。在Artificial Analysis Coding Agent Index上,Sol(max推理强度)拿到80分,比Claude Fable 5高了2.8分,而且只用了不到一半的输出token,耗时少一半,成本低三分之一。Terminal-Bench 2.1上也刷新了记录,Ultra模式拿到91.9%。

看这些数字,你会觉得GPT-5.6已经把Fable 5按在地上摩擦了。

但真实情况要复杂得多。说说我看到的几个翻车案例。

最出名的一个:开发者Matt Shumer让Sol跑任务,它居然执行了一个类似rm -rf的命令,把他Mac上的文件全删光了。这事在Twitter上传得挺广,不是段子,是真实的。

还有一个更硬核的数据:SWE-Bench Pro上,Fable 5自报大约80%,Sol只有64.6%。OpenAI还专门发文质疑SWE-Bench Pro有大量"坏题"——这个动作本身就说明了一些问题。

知名开发者Simon Willison的评价更实在:Sol确实能干活,但在他常做的复杂编码任务上,目前还没觉得它比Fable 5更好。

我的体感也是类似的——Sol在需要持续协作的编码任务上确实更顺手,多轮对话的连续性比Fable 5好。但让它一次性解决硬核问题、不出bug、不删文件,稳定性方面Fable 5还是更让人放心。

用一句话概括:Sol像是那个灵感多、干活快但偶尔出昏招的同事,Fable 5是那个慢一点但从不搞砸的老法师。



AA Coding Agent Index 80分登顶,但SWE-Bench Pro被Fable 5甩开15个点

如果你用Sol做编程,先把推理强度调到medium。Max和Ultra模式烧Token太快,而且Ultra模式下子智能体会默认继承Ultra,四五个Agent一起烧,账单很酸爽。

Codex并入ChatGPT:一个App搞定一切

这次合并是很多人期待已久的。原来Codex是独立App,做复杂编程项目得在ChatGPT和Codex之间来回倒。现在好了,新版ChatGPT桌面应用里有三种模式:

Chat模式——就是原来的聊天对话,日常问答、查资料、写文案都在这里

Work模式——新增的智能体模式,可以连续跑几小时的复杂工作流。你发个任务,它自己规划、执行、改错、交付,不需要你盯着

Codex模式——原来的编程专用工作区,写代码、调bug、跑测试都在这里

三个模式之间还能互通。你在Chat里查到的东西可以直接拖进Codex当参考资料,Codex跑任务时有不懂的可以随时切到Chat请教。这种无缝感,用过之后就回不去了。

另外几个小细节也挺实用:

桌面应用能直接访问你电脑的本地文件了,不用先手动上传

能读取浏览器标签页的内容,你让它总结当前网页,它能直接看到你在看什么

新增了Sites功能——你让它做一个东西,它直接生成一个网页部署到云端,给你一个公开链接。不懂技术的人也能一句话建站

预览区现在能直接编辑了,生成的文档不满意,原地改,不用导出再编辑

不过得说句实话——目前新客户端bug还不少。英文夹中文混着输出、任务跑完界面没显示结果、文件下载偶尔卡住。这些不是模型的问题,是产品的锅,后续更新应该会修。



Chat+Work+Codex三模式合一,一个App搞定所有事

价格:不算贵,但"省流"是个伪命题

GPT-5.6的定价策略,我觉得是这次发布最值得聊的部分。

先看数字:Sol输入5美元/百万token、输出30美元。跟Fable 5比,输入只要一半,输出便宜40%。跟自家上一代GPT-5.5比,Sol和5.5同价但性能更强。Terra对标5.5的性能只要半价。

表面上看,OpenAI在打"加量不加价"的牌。但事情没这么简单。

第一个坑:Ultra模式。Sol默认并行启动4个子智能体(最高16个),每个都是Ultra推理强度。如果你一上来就把effort拉到Ultra,四个Agent一起跑,烧Token的速度是你预期的好几倍。有人第一天就发现账单炸了。OpenAI的实际意思是:以更高的Token消耗换取更强结果——但你得自己算这笔账划不划算。

第二个坑:Terra号称"省流版",但其实并不怎么省。它的Token消耗量对标GPT-5.5,只是价格便宜了。实际做同样的任务,Terra的Token消耗量往往比竞品高。

第三个坑:缓存写入按1.25倍费率计费。虽然缓存读取有90%折扣,但对于长上下文任务,首次写入的成本比你想的要多一些。

那到底贵不贵?分情况看。如果你用Sol做简单的摘要改写、日常聊天,性价比不如Grok 4.5或国产模型。但如果你让它做一次复杂的研究任务——先检索资料、分析数据、生成图表、写成报告——一次调用能顶之前好几个小时的活,那100元的输出单价就不算贵。

另外提一句速度。Sol在Cerebras上最高可以跑到每秒750个token,差不多每秒五六百个汉字。国内用户受网络环境影响肯定达不到这个数,但整体响应速度确实比GPT-5.5有明显的提升。



Sol/Terra/Luna三档定价,比Fable 5便宜40%,但Ultra模式会悄悄吃掉预算

中国用户最真实的几个槽点

优点聊完了,说说这段时间用得最难受的地方。有几条可能你也会有同感。

第一,中文表达"英译中"感太强了。GPT-5.6的中文自然度在主流模型里得分最低(7.5/10),比国产模型低了快两个档次。不是它说得不对,而是"不地道"。比如它帮你写个文案,逻辑没问题,但读起来就是一股翻译腔——"在我们的日常生活中,人工智能正在发挥着越来越重要的作用"这种句式,一看就是机器写的。

第二,做简单任务时"想太多"。你问它"怎么写请假条",它给你分析请假理由的心理学原理、上司的期望管理、以及请假对公司文化的影响。问一杯咖啡的推荐,它能从产地、烘焙度、冲泡方式写到咖啡豆贸易对南美经济的影响。强是强,但对普通用户来说太啰嗦了。

第三,国内访问是个绕不过去的门槛。这个就不用多说了——需要科学上网。虽然这不是OpenAI的问题,但对国内用户来说,这直接决定了ChatGPT能不能成为你的主力工具。访问不稳定的时候,什么排行榜第一都没意义。

第四,稳定性还有待加强。发布会后第一波真实反馈里,稳定性和可控性成了最大的问题。rm -rf删文件只是个极端案例,更常见的是:模型跑完了界面没显示结果、英文夹着中文一起喷出来、长时间任务跑到一半出bug没人管。这些问题不是模型能力不够,而是产品化还不够成熟。

第五,用户的忠诚度其实很低。OpenAI自己可能也感觉到了这一点。GPT-5.6发布后,他们会频繁给用户重置配额(有点像网游发补偿)。短期看这是挽留用户的手段,长期看说明用户切换成本很低——哪个模型好用用哪个,没有谁非你不可。



中文翻译腔重、简单问题想太多、国内访问门槛高

月活超11亿但首次跌破50%,老大的位子没那么稳了

看几个数字感受一下ChatGPT的体量:

月活用户:超过11亿(Sensor Tower 2026年6月数据),史上最快破10亿的应用

年化收入:超过250亿美元,月入约20亿美元

付费用户:超过5000万个人订阅 + 900万企业用户

广告收入:年化ARR 1亿美元(今年2月才开始做广告)

但有个数据更值得关注:ChatGPT的全球市场份额在5月底首次跌破了50%,降到46.4%。Google Gemini以27.7%逼近,Claude占10.3%。

更重要的是,用户在几个AI助手之间切换的行为越来越普遍。特定事件甚至会加速这种迁移——今年2月OpenAI跟美国国防部签约后,ChatGPT的卸载量激增295%。用户没有你想象的那么忠诚。

OpenAI在商业化的路上也在加速。2月开始在ChatGPT里投广告,目前已有17%的日活用户看到广告。不过说实话,目前的广告产品还很初级,定位、测试、数据报告都比谷歌差得远。有广告代理公司实测发现,ChatGPT广告的点击率明显低于谷歌广告。

OpenAI给的长期目标挺吓人的——到2030年广告收入1000亿美元。但行业分析师普遍觉得这不太现实,毕竟整个聊天机器人广告市场今年还不到10亿。



11亿月活全球第一,但市占率首次跌破50%,Gemini正在逼近

怎么选:ChatGPT vs Claude vs Grok vs 国产模型

说了这么多,落到实际选择上,给你一个参考:

选ChatGPT(GPT-5.6 Sol)如果你:需要处理复杂编码任务、网络安全、科研分析,而且能接受国内访问门槛。它的Agent长程任务和多智能体编排能力是目前最强的。日常高频使用建议用Terra,性价比最高。

选Claude Fable 5如果你:追求稳定性和安全性,受不了删文件这种惊吓。做复杂编码的一次性成功率更高,图表解读、文档结构化、学术写作也更靠谱。但价格贵一倍,速度慢一些。

选Grok 4.5如果你:想要一个够强、够快、够便宜的替代品。Grok最近几次升级进步很大,已经被拿来和第一梯队认真比较了。速度快、价格低,是个黑马选手。

选国产模型(DeepSeek/豆包/通义千问)如果你:主要使用场景是中文日常对话、文档处理、国内应用场景。中文体验碾压ChatGPT,不需要科学上网,而且免费版功能已经很完善了。

说到底,现在没有任何一个模型能在所有场景都赢。最聪明的做法不是死守一个,而是根据不同任务切不同的模型。灵活使用多模型工作流,比纠结哪个"更强"实用得多。



没有全能的模型,只有选对的场景。ChatGPT强在Agent和长程任务,但中文体验输给国产

总结:它还是老大,但江山没那么稳了

GPT-5.6 Sol在很多维度上依然是全球最强的AI模型。AA编程排行榜80分登顶、Agents' Last Exam创纪录53.6分、750 token/秒的速度——任何一个数据单拎出来都是行业顶级的。

但GPT-5.6给我的感觉很像一个"学霸型工具"——能力上限极高,但不太接地气。

中文不地道,简单问题"想太多",价格不便宜,Ultra模式悄悄烧预算,rm -rf级别的稳定性问题让人不敢完全放手。对国内用户来说,还有访问门槛这道天然屏障。

以前大家用ChatGPT是因为没有更好的选择。现在Claude、Grok、DeepSeek、Kimi K3——每个都有自己的杀手锏。ChatGPT不再是"当然是选它",而是变成了一个需要认真对比的选项。

它仍是AI行业的标杆,也是任何严肃测评绕不过的参照系。但它不再是所有人都默认的最优解了。

这对用户来说是好事——有竞争,才有更好的产品和更低的价格。

一句话结论

GPT-5.6是全球最强AI模型之一,Solo编程和Agent长程任务目前没有对手。但它不是每个中国用户的最佳选择——如果你主要用中文、需要稳定不出错、不想花时间折腾网络,国产模型可能更适合你。如果你需要做复杂编码和科研任务,而且能搞定访问问题,GPT-5.6 Sol仍然值得付费。

这篇测评写了六千多字,是实打实花了一周时间上手体验出来的。如果对你有帮助,麻烦点个「在看」、转发给也在纠结选哪个AI助手的朋友,这对我真的很重要。

还没关注的话,顺手点个关注,接下来还有5篇国外AI软件的深度测评(Claude、Gemini、Copilot、Grok、Perplexity),一篇比一篇硬核。

咱们下期见。

系列五 · 14款主流AI软件深度测评 · 第9篇(国外篇第1篇)
下一期:Claude

声明:内容由AI生成

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
王某退休前夕查出癌症,花光积蓄去南极旅游,回来肿瘤竟变小了;十几年走遍30多国拍下1200种鸟,如今67岁还准备再出发,已预定今明年行程

王某退休前夕查出癌症,花光积蓄去南极旅游,回来肿瘤竟变小了;十几年走遍30多国拍下1200种鸟,如今67岁还准备再出发,已预定今明年行程

农民日报
2026-10-02 13:56:26
最高院:提供 “口交” “肛交”等进入式性服务,是否属卖淫行为?

最高院:提供 “口交” “肛交”等进入式性服务,是否属卖淫行为?

周军律师聊案子
2026-04-21 09:50:16
C罗不满儿子落选葡萄牙U16:不是离队导火索,却是压在心上的另一根刺

C罗不满儿子落选葡萄牙U16:不是离队导火索,却是压在心上的另一根刺

智道足球
2026-10-02 11:24:23
为什么无底线善意反而会招来杀身之祸

为什么无底线善意反而会招来杀身之祸

风铃草语
2026-10-03 07:14:12
浙江一家三口出车祸,唯独后排一人重伤!医生:这个细节造成的,很多人都不知道

浙江一家三口出车祸,唯独后排一人重伤!医生:这个细节造成的,很多人都不知道

环球网资讯
2026-10-03 08:51:06
英媒:中国富豪撤出新加坡?要是中国不给脸,新加坡只是个县

英媒:中国富豪撤出新加坡?要是中国不给脸,新加坡只是个县

此去经年q
2026-10-02 03:43:54
美军搞子午线计划和自主作战司令部,推海陆空天全域智能与无人化

美军搞子午线计划和自主作战司令部,推海陆空天全域智能与无人化

邵旭峰域
2026-10-03 10:48:43
李在明暗示韩国曾统治中原万年言论曝出,日本媒体冷嘲:他对中国“怕不是有啥幻想”,争议迅速发酵

李在明暗示韩国曾统治中原万年言论曝出,日本媒体冷嘲:他对中国“怕不是有啥幻想”,争议迅速发酵

爱竞彩的小周
2026-10-02 04:39:54
这8个草书大字,我瞪半天只认出3个!您能全读对,我甘愿拜师!榜书最难的,究竟是撑大字形,还是写出笔锋?

这8个草书大字,我瞪半天只认出3个!您能全读对,我甘愿拜师!榜书最难的,究竟是撑大字形,还是写出笔锋?

书画相约
2026-10-03 08:34:58
美国总统特朗普确认了:美国与伊朗的战事将很快结束,伊朗永远都不会拥有核武器

美国总统特朗普确认了:美国与伊朗的战事将很快结束,伊朗永远都不会拥有核武器

吉刻新闻
2026-10-03 09:43:24
张锦程豁达回应与张延离婚 引用名著看透男女关系:只是荷尔蒙的反应,希望有个子嗣

张锦程豁达回应与张延离婚 引用名著看透男女关系:只是荷尔蒙的反应,希望有个子嗣

TVB资讯台
2026-10-01 00:45:36
CBA消息,中国篮协提6点要求,12名小将开启留洋,刮起青春风暴?

CBA消息,中国篮协提6点要求,12名小将开启留洋,刮起青春风暴?

体坛小快灵
2026-10-03 08:48:53
国庆噩耗!中国情侣澳洲重大车祸!当场双双毙命,刚刚拿到绿卡...

国庆噩耗!中国情侣澳洲重大车祸!当场双双毙命,刚刚拿到绿卡...

澳洲红领巾
2026-10-02 12:09:10
洋葱尽量少吃,最好不吃,尤其是2类人,大多数人不清楚,需了解

洋葱尽量少吃,最好不吃,尤其是2类人,大多数人不清楚,需了解

健身狂人
2026-10-02 20:39:01
哈马斯利用儿童搬枪!以军称发现孩子后放弃打击

哈马斯利用儿童搬枪!以军称发现孩子后放弃打击

桂系007
2026-09-29 23:46:58
三个青菜41元,物价堪比机场!医生吐槽食堂又贵又难吃!律师:不明码标价、随意定价属于违法行为!不少医院食堂转为自营后,医护更满意

三个青菜41元,物价堪比机场!医生吐槽食堂又贵又难吃!律师:不明码标价、随意定价属于违法行为!不少医院食堂转为自营后,医护更满意

梅斯医学
2026-10-03 07:54:59
国庆当晚,武汉这一幕,让西方无地自容!

国庆当晚,武汉这一幕,让西方无地自容!

戎评
2026-10-02 16:00:36
他是抗日英雄,83岁与世长辞,一生娶40个老婆,44年后才下葬!

他是抗日英雄,83岁与世长辞,一生娶40个老婆,44年后才下葬!

历史龙元阁
2026-10-01 08:10:41
惊人的母子定律:一个男孩的命,看他母亲就知道

惊人的母子定律:一个男孩的命,看他母亲就知道

金哥说新能源车
2026-10-01 21:32:36
彻底翻车!1.16 亿利物浦巨星公开甩锅!安菲尔德球迷集体怒喷

彻底翻车!1.16 亿利物浦巨星公开甩锅!安菲尔德球迷集体怒喷

澜归序
2026-10-03 08:58:29
2026-10-03 11:40:49
欧阳让你懂AI
欧阳让你懂AI
每天分享一些AI的实用小知识
268文章数 330关注度
往期回顾 全部

科技要闻

英伟达盘中创历史新高,市值逼近6万亿美元

头条要闻

33岁音乐教师赴泰国后失联 其手机IP曾两次显示在缅甸

头条要闻

33岁音乐教师赴泰国后失联 其手机IP曾两次显示在缅甸

体育要闻

这个讨论了一夏天的问题,马刺有答案了吗

娱乐要闻

假期快乐!贾乃亮晒和甜馨国庆出游照

财经要闻

4亿台电视挂墙落灰 为何没人愿意开了?

汽车要闻

方程豹9月热销破4万 首款皮卡鲨鱼将于四季度上市

态度原创

时尚
本地
数码
房产
公开课

挨骂的刘雯,做错0件事

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

数码要闻

AMD掌机芯片大变革!锐龙Z3系列曝光:Zen 6架构、25mm封装

房产要闻

三亚楼市炸了!首个空中泳池平层+CBD独一份洋房同时爆出!

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版