网易首页 > 网易号 > 正文 申请入驻

GPT-6 Sol与Claude Opus 5.5同日开打,谁是「性价比之王」

0
分享至

就在刚刚,OpenAI 与 Anthropic 几乎同时推出新模型:OpenAI 推出 GPT-6 Sol 与 GPT-6 Luna;Anthropic 则发布性能直逼 Fable 5.1 的 Claude Opus 5.5。

OpenAI 表示,GPT-6 Sol 与 GPT-6 Luna 脱胎于此前顶级的 GPT-6 Astra 底座,重点是将 Astra 的核心推理与多模态优势下放,重构出更轻量、吞吐量更高的运行版本。也就是说,GPT-6 Astra 承担的是能力探索角色,而 Sol 和 Luna 则承担能力规模化应用的任务。



价格方面则直接「腰斩」,与 GPT-5.6 的促销价相比,Sol 与 Luna 的价格直接降低了 50%。

随后,Sam Altman 在社交平台发文,强调这是 OpenAI 推动「智能普及化」的必经之路 —— 让开发者不再受制于昂贵的算力账单。

「尤其是按照单任务成本(per-task pricing)来比较 —— 而这才是我们认为真正应该关注的指标 —— 我认为目前市场上没有任何产品具备真正的竞争力。

我们希望人们能够大量使用 AI,因为这对于探索眼前这场新的「文艺复兴」非常重要。只有让更多人能够广泛使用 AI,才能真正释放这一轮技术变革带来的可能性。」



而 Anthropic 拿出的则是 Claude Opus 5.5。



作为 Claude 系列中的高性能模型,Opus 5.5 延续了 Anthropic 在复杂任务、代码生成和企业工作流领域的重点布局。

Anthropic 表示,相比 Opus 5,Opus 5.5 在典型任务中的成本降低约 40%,输出速度提升超过 30%。

下面具体来看一下。

OpenAI 发布 GPT-6 Sol、Luna:

将 Astra 能力推向规模化应用、价格「腰斩」

OpenAI 表示,本月早些时候推出了 GPT-6 Astra,这是全球最智能、对齐程度最高的模型,但考虑现实中的工作存在不同规模、不同节奏以及不同预算需求。因此推出 GPT-6 Sol 和 GPT-6 Luna。

如果说,GPT-6 Astra 开启了新一代智能模型,而这两个模型则通过提升成本效率,让更多人能够获得这种智能能力。

OpenAI 认为,模型能力提升固然重要,但单位任务成本同样成为企业部署 AI 时的重要考量。因此此次重点优化了缓存机制和推理效率,并将节省的成本反馈给用户。

  • 博客链接:https://openai.com/index/introducing-gpt-6-sol-and-luna/

相较于 GPT-5.6,GPT-6 Sol 和 Luna 的 API 价格降低了 50%。

  • GPT-6 Sol:输入价格从每百万 token 4 美元降低到 2 美元;输出价格从每百万 token 20 美元降低到 10 美元。
  • GPT-6 Luna:输入价格从每百万 token 0.20 美元降低到 0.10 美元;输出价格从每百万 token 1.20 美元降低到 0.50 美元。



价格下来了,但性能依旧能打。

在 AutomationBench 测试中(该测试评估跨应用的企业工作流),GPT-6 Sol 在最高推理强度(xhigh effort)下超过了 Claude Opus 5 的最高强度表现,而每个任务成本仅为 Opus 5 的 9%。

而在高推理强度下,GPT-6 Luna 相比上一代模型提升了 5.4 个百分点,同时每个任务成本降低 58%。



同时,GPT-6 Sol 也以更低成本超过 Claude Fable 5.1,同时甚至超过了低推理强度下的 GPT-6 Astra。



而在内部事实准确性测试中,该测试基于经过匿名处理的真实用户对话(用户曾标记模型错误),GPT-6 Sol 的错误数量约为上一代模型的一半,接近 Astra 级别的可靠性,同时成本更低。

GPT-6 Luna 也取得明显提升:在更高推理强度下,它能够以约百分之一的成本达到 GPT-5.6 Sol 的水平。



另一个重要变化则出现在软件开发领域,随着 Coding Agent 开始承担越来越复杂的任务,持续运行成本成为开发团队的重要考量。

编程能力上,OpenAI 表示 GPT-6 Sol 和 Luna 在保持强大代码能力的同时,通过更低 API 价格,让开发者拥有更多试验空间,也让团队能够更加大胆地使用 Codex 执行复杂任务。

在 FrontierCode 测试中,GPT-6 Sol 相比 GPT-5.6 Sol 有明显提升,并以更低成本达到 Claude Fable 5.1 xhigh 的水平。



在 DeepSWE v1.1 测试中:GPT-6 Sol 在最高推理强度下获得 68.8% 分数,仅比 Claude Fable 5 的最高成绩 69.9% 低 1.1 个百分点。但 GPT-6 Sol 每个任务成本降低约 80%。GPT-6 Luna 在最高推理强度下获得 66.6%,接近 Claude Opus 5 和 Fable 5 的中等推理强度表现。

在这些比较中:Luna 相比 Opus 5,每任务成本降低 93%;相比 Fable 5,每任务成本降低 96%。

这或许是在说明 OpenAI 的目标并不是简单制造一个更强模型,而是在寻找单位智能成本最低的模型。



计算机操作能力上,GPT-6 Sol 和 Luna 相比上一代模型提供了更高成本效率。

在 OSWorld 2.0 offline 测试中,GPT-6 Sol 在最高推理强度下达到与 Claude Opus 5 中等推理强度相近的成绩:

  • GPT-6 Sol:60.5%
  • Claude Opus 5:60.3%

但 GPT-6 Sol 每任务成本降低约 80%,GPT-6 Luna(max)则能够超过 GPT-5.6 Sol(medium),同时成本仅为其十分之一。



而除了模型价格下降,OpenAI 还针对 Agent 长任务场景优化了缓存机制,改进了 GPT-6 的 Prompt Caching,使默认缓存命中率更高,从而帮助 Agent 复用更多上下文、更快响应、对缓存输入 token 读取享受 90% 折扣。

这意味着,未来模型竞争不仅是模型本身的能力竞争,也包括整个推理基础设施效率竞争。

Anthropic:Opus 5.5 来了,Fable 级能力

OpenAI 发布的另一边,Anthropic 这次同样非常强调「效率」。

Claude Opus 5.5 是 Claude 5.5 系列的第一款模型。Anthropic 给它的定位非常直接:大多数任务达到 Claude Fable 5.1 的水平,但相比 Opus 5,典型任务运行成本降低约 40%,输出速度则提高超过 30%。

  • 博客链接:https://www.anthropic.com/claude-opus-5-5/

先看能力。

在 Anthropic 公布的 headline comparison table 中,Opus 5.5 在列出的项目上全部高于 Fable 5.1。

Terminal-Bench 4.0 上,Opus 5.5 达到 66.4%,Fable 5.1 为 55.8%;FrontierCode v1.1 Main 为 54.4% 对 50.3%;面向真实知识工作的 GDPval-AA v2.1,则是 1846 对 1735。

Agentic coding、知识工作、计算机操作,基本都是这代 Opus 主要的能力提升方向。Anthropic 官方发布也将其称为相比 Opus 5 的一次明显升级。



这当然不意味着「Opus 5.5 已经全面超过 Fable 5.1」。不同 benchmark 使用的 harness、工具和推理强度并不完全一致;就在 Anthropic 自己的表格中,GPT-6 Astra 也仍然在 AutomationBench 和 Terminal-Bench-Science 等项目保持更高成绩。

但能明显看到,Opus 和 Fable 之间原本清晰的能力差距,正在迅速缩小。

而从 API 定价来看就更明白 Anthropic 的意思了。

Opus 5.5 每百万输入、输出 Token 分别为 4 美元和 20 美元,而 Fable 5.1 为 10 美元和 50 美元,后者正好是前者的 2.5 倍。两者都拥有 100 万 Token 上下文窗口和最高 128K 的常规输出能力。



所以这次 Anthropic 没有把 Opus 5.5 描述成一次简单的「性能升级」,而一直在强调单位任务成本。

不再让 Opus「拼命想」

还有一个设置挺有意思。Opus 5.5 的 Adaptive Thinking 永远开启,开发者可以调节推理强度,默认设为 medium;相比之下,Fable 5.1 默认是 high。

这和 Anthropic 公布的一组数据正好对应:在 FrontierCode v1.1 Main 上,Opus 5.5 medium 得分约 54.6%,单任务成本约 0.8 美元;到了 max,成本升至约 6.19 美元,得分反而只有 54.4%。

也就是说,多花近 7.7 倍的钱,并没有换来更高分数。



原因之一在于 FrontierCode 会惩罚超出任务范围的修改,即使这些改动本身有益。推理预算提高后,模型反而可能多做一些无用功,因此更多 test-time compute 并不一定带来更好的任务结果。

第三方的实际测试验证了这个说法。CodeRabbit 在自己的多步骤 Code Review 工作流中发现,Opus 5.5 medium 已经可以达到或超过 Opus 5 high 的表现,同时只使用大约一半的 Token。

Token 只便宜 20%,为什么任务能便宜 40%?

Anthropic 给出的解释是,单个 Token 的价格并不能直接代表最终任务成本。

Opus 5.5 相比 Opus 5,普通输入、输出 Token 价格只下降约 20%,但 Cache Read 从每百万 Token 0.50 美元降到 0.20 美元,降幅达到 60%。对于 Claude Code 这类需要反复读取代码和历史上下文的长任务,缓存降价会被持续放大。

再加上 Opus 5.5 完成同一任务所需的 Token 和步骤更少,Anthropic 测得默认设置下,典型任务的总成本最终可降低约 40%。

「每百万 Token 多少钱」不适合单独计算,更合理的方式是放到实际任务中,看看真正做完要花多少钱。

这和 OpenAI 这轮发布的思路,惊人地一致。

能力之外,价格当然很重要

把两家放在一起看,这轮发布好像都很在意一个问题,那就是用户到底愿意为提升的那部分智能付多少钱。

OpenAI 在 7 月底发布过一篇博客,《Building abundant intelligence》。文中提到,客户真正购买的并不是 Token,而是「任务被完成」。因此更合理的衡量方式,应该是一次成功结果的总成本,其中还要算上重试、人工监督、时间和错误带来的代价。

  • 博客链接:https://openai.com/index/building-abundant-intelligence

换句话说,就是「最后事情做完花多少钱」比 Token 计费更贴近用户心理。

Anthropic 这边,其实已经从企业用户那里收到过一次很直接的价格反馈。

Fable 5 发布后,Ramp 对企业模型支出的追踪显示,这款 Anthropic 当时最贵、能力最强的模型,只占 Anthropic 企业 Token 使用量约 6%。Ramp 将其视为一个价格上限信号,企业并不会因为模型更强,就无限接受更高价格。

随后 Fable 5.1 就做了一些调整。Anthropic 在发布时明确说,新版本是在回应客户对价格、数据留存和安全措施的反馈;虽然输入和输出标价没有下降,但 Cache Read 直接降了 75%,使典型工作负载成本下降约 25%,高度 Agentic 任务最高可降约 45%。

更有意思的是,Anthropic 自己的开发者文档甚至建议:大多数任务先从 Opus 5 开始,只有高 effort 的 Opus 仍然不够时,再考虑 Fable 5.1。

连官方都承认,旗舰模型已经不再是默认选项,而更像是专门留给高难度、长周期任务的昂贵资源。

市场已经开始告诉厂商,仅仅把最强模型继续做强,并不足以让企业持续升级。

当日常任务用 Opus 就已经够好,企业为什么还要支付 Fable 的价格?当 Luna 已经能覆盖越来越多正式工作,为什么每一步都要调用 Astra?

这可能也是两家公司现在共同面对的问题,前沿能力当然还要继续往上发展,但真正想扩大企业使用规模,还是要结合价格来看。

就在 Opus 5.5 发布前三天,路透报道称,Anthropic 正考虑推出新模型,应对 GPT-6 Astra 在企业市场快速获得份额。

OpenAI 和 Anthropic 的这场竞争,恐怕还远没有到休息的时候。

这次两边的发布公告只相差一个小时,甚至有消息称,Fable 5.5 将在 OpenAI 的 DevDay 当天亮相。

而 OpenAI 和 Anthropic 此次的相似操作,似乎也是释放出一个共同信号:AI 正从能力突破阶段进入规模化应用阶段,未来,真正决定 AI 普及速度的,不只是模型 IQ,而是单位任务成本。下一阶段的大模型战争,或许不再只是争夺最高智能峰值,而是谁能够让智能,以最低成本持续创造价值。

对此,广大网友们也是喜闻乐见大家「打起来」。

「我希望它们彼此竞争,最终把智能的价格打到低得离谱。」



那么你呢,如何看待?欢迎在评论区留言、交流!

参考链接:

https://x.com/OpenAI/status/2102460975790137662

https://x.com/i/trending/2102466579913138274

https://x.com/sama/status/2102465143997440308

https://www.anthropic.com/claude-opus-5-5

https://x.com/claudeai/status/2102435511222890900

https://x.com/theojaffee/status/2102454423041818786

https://x.com/FanShifu/status/2102441095066165440



特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
力压董宇辉登榜第一!千万网红顶流“复活”了,曾被停更3年

力压董宇辉登榜第一!千万网红顶流“复活”了,曾被停更3年

福建睿平
2026-09-23 07:09:59
富养女的福报来了!江苏一男子跟女儿说等自己老了以后送养老院就行,女儿的回复震撼在场所有人

富养女的福报来了!江苏一男子跟女儿说等自己老了以后送养老院就行,女儿的回复震撼在场所有人

火山詩话
2026-09-22 14:29:25
表姑向我借了85000元,17年没还,我去银行注销旧卡时,柜员看了眼卡说:女士,最后一笔转账留言您要看吗?

表姑向我借了85000元,17年没还,我去银行注销旧卡时,柜员看了眼卡说:女士,最后一笔转账留言您要看吗?

品读时刻
2026-09-22 09:04:55
果然不出所料!第八轮,美方主动提一个特殊请求,中方早有言在先

果然不出所料!第八轮,美方主动提一个特殊请求,中方早有言在先

你是我心中最美星空
2026-09-22 21:34:38
美专家向特朗普献计:不如舍弃台湾和钓鱼岛,换取中国大陆退出在两国投资,这一说法迅速引爆舆论讨论!

美专家向特朗普献计:不如舍弃台湾和钓鱼岛,换取中国大陆退出在两国投资,这一说法迅速引爆舆论讨论!

谈史论今1
2026-09-20 19:35:10
苹果发布史诗级更新!彻底解决 App 摇一摇广告

苹果发布史诗级更新!彻底解决 App 摇一摇广告

XCiOS俱乐部
2026-09-23 13:22:53
西方万万没想到!封锁令一出,中国反手把全球旧光刻机全买了

西方万万没想到!封锁令一出,中国反手把全球旧光刻机全买了

让心灵得以栖息
2026-09-22 16:09:43
局势反转!菲律宾紧急认账,服软降温!

局势反转!菲律宾紧急认账,服软降温!

故事终将光明磊落
2026-09-23 13:47:57
李梦“耍大牌”再上热搜,她首次回应:我没有耍大牌,也没有说难搞。当年换苹果是因为怕镜头会穿帮

李梦“耍大牌”再上热搜,她首次回应:我没有耍大牌,也没有说难搞。当年换苹果是因为怕镜头会穿帮

银河卧谈会
2026-09-23 12:23:09
夺小组头名!中国男足0-0阿联酋 携朝鲜进亚运8强 王钰栋染黄将停赛

夺小组头名!中国男足0-0阿联酋 携朝鲜进亚运8强 王钰栋染黄将停赛

我爱英超
2026-09-23 15:29:19
突发:民进党参选人邱凤英猝死

突发:民进党参选人邱凤英猝死

金牛传声
2026-09-23 10:27:13
越南国会97%票数通过,俄罗斯在边境铺中方铁轨

越南国会97%票数通过,俄罗斯在边境铺中方铁轨

奇思妙想生活家
2026-09-23 04:56:26
感人!中国男足亚运会爆发大规模冲突:张玉宁1举动令人动容

感人!中国男足亚运会爆发大规模冲突:张玉宁1举动令人动容

邱泽云
2026-09-23 16:36:08
激烈!王楚钦鏖战五局惊险获胜,林昀儒手握赛点发球失误自己笑了

激烈!王楚钦鏖战五局惊险获胜,林昀儒手握赛点发球失误自己笑了

杨哥乒乓
2026-09-23 19:40:08
亚运会最新奖牌榜:日本46枚,韩国27枚,中国运动员太让国人自豪

亚运会最新奖牌榜:日本46枚,韩国27枚,中国运动员太让国人自豪

乌克兰小静
2026-09-23 08:22:42
老子今天查着就给她死!云南这件事,暴露了多少底层人的处境?

老子今天查着就给她死!云南这件事,暴露了多少底层人的处境?

走读新生
2026-09-22 15:33:56
北约宣布已作好开战准备,目前正在增兵

北约宣布已作好开战准备,目前正在增兵

俄罗斯卫星通讯社
2026-09-21 15:08:09
中秋前后,养老金、社保和工资好消息,退休、在职和失业都受益

中秋前后,养老金、社保和工资好消息,退休、在职和失业都受益

风干迷茫人
2026-09-23 11:14:24
绝了!这是隆多儿子!2030届全美第一!

绝了!这是隆多儿子!2030届全美第一!

篮球实录
2026-09-23 02:32:29
尊重!中国女排3-0日本队夺冠后向现场日本观众鞠躬 后者鼓掌致敬

尊重!中国女排3-0日本队夺冠后向现场日本观众鞠躬 后者鼓掌致敬

念洲
2026-09-22 21:18:40
2026-09-23 21:24:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14059文章数 142737关注度
往期回顾 全部

科技要闻

一夜三款新模型,AI价格战再升级

头条要闻

网友发帖称上海一家餐厅点9瓶矿泉水收621元 店员回应

头条要闻

网友发帖称上海一家餐厅点9瓶矿泉水收621元 店员回应

体育要闻

300万英镑,他们买下了一位队史传奇

娱乐要闻

王玉雯杨玏被曝结婚又离 荒唐一幕出现

财经要闻

全市场都在卷自营

汽车要闻

性能与实用兼得 全新奥迪S5 Avant上市 57.18万元

态度原创

教育
家居
艺术
手机
军事航空

教育要闻

拯救躺平的孩子有个最简单办法:把他当“狗”养!

家居要闻

2026建博会(广州) 公装联探展交流活动

艺术要闻

深圳4座新全球总部:大疆尖塔、京东画境、OPPO曲面、科达利窗口

手机要闻

小米18 Pro Max手机发布:首发第六代骁龙8超级至尊版,6999元起

军事要闻

韩国最新型潜艇首次披露

无障碍浏览 进入关怀版