网易首页 > 网易号 > 正文 申请入驻

Claude Opus 5 发布:比 Fable 5 更便宜,也更能干活

0
分享至

AI范儿 · 产品拆解⏱ 7 分钟

Anthropic 正式发布了 Claude Opus 5。

官方给它的定位是:接近 Claude Fable 5 的前沿智能,但价格只有后者的一半。

不过,从 Artificial Analysis 在发布前完成的独立评测来看,这个说法多少有些保守。

Claude Opus 5 不只是"接近"Fable 5。在综合智能、真实知识工作和编程 Agent 等多个测试中,它已经与 Fable 5 打平,甚至实现了反超。

更准确地说,Opus 5 是一个能力边界略低于顶级大模型,但在绝大多数真实工作中更强、更便宜,也更容易部署的模型。

01先看基本参数

Anthropic 依旧没有公布 Opus 5 的参数量、训练数据规模和具体架构,也没有说明它是否采用 MoE。

因此,这次能够比较的"参数",主要是上下文、价格、推理档位、速度和任务成本。

Claude Opus 5 基本参数 上下文窗口 100 万 Token 输入模态 文本、图像 输出模态 文本 输入价格 5 美元/百万 Token 输出价格 25 美元/百万 Token 缓存写入 6.25 美元/百万 Token 缓存命中 0.5 美元/百万 Token 缓存有效期 5 分钟 推理档位 low、medium、high、extra、max Fast Mode 约 2.5 倍速度,价格翻倍 安全降级 支持自动切换到其他模型 上下文长度 与 Opus 4.8 相同

▲ 图:Claude Opus 5 基本参数

Opus 5 延续了 Opus 4.8 的 API 定价,并没有因为能力升级而涨价。缓存写入价格比普通输入高 25%,缓存命中则便宜 90%。官方还提供 Fast Mode,速度约为默认模式的 2.5 倍,但价格也会翻倍。([Anthropic][1])

单看 Token 单价,Opus 5 并不便宜。

Artificial Analysis 统计显示,它的输入和输出价格都显著高于同类模型中位数,最高推理档位的输出速度约为每秒 56.3 个 Token,也低于同档模型约 73.6 个 Token 的中位水平。最高档位首次返回答案的平均等待时间达到 64.52 秒。([Artificial Analysis][2])


因此,Opus 5 的优势从来都不是便宜或响应快。

它真正强调的是:完成一个复杂任务时,花的钱更少,成功率却更高。

02综合智能指数排名第一,但优势非常窄

在 Artificial Analysis Intelligence Index v4.1 中,Claude Opus 5 的 max 档位得分为 61,暂时位列第一。

作为对比:


▲ 图:Intelligence Index 得分对比

这个指数综合了 9 项测试,包括真实知识工作、银行工具调用、终端操作、科学编程、Humanity's Last Exam、物理推理、事实知识和长上下文推理等。([Artificial Analysis][2])

所以,61 分并不意味着 Opus 5 在每一个能力维度都排名第一。

它更像是一个综合成绩。

而且 Opus 5 的 61 分与 Fable 5 的 60 分,实际上几乎处于同一水平,不能简单理解为前者已经全面超越后者。

真正值得注意的是成本。

在 Intelligence Index 中,Opus 5 max 平均每个任务成本为 2.03 美元,比 Fable 5 的 2.75 美元低约 26%。

但它仍然比 Opus 4.8 max 的 1.80 美元,以及 Sonnet 5 max 的 1.53 美元更贵。

这说明 Opus 5 并不是全行业性价比最高的模型。它更准确的定位是:

在前沿智能水平上,比 Fable 5 更便宜。

03真正拉开差距的是知识工作

相比综合智能指数,Opus 5 在 Agent 知识工作上的优势更明显。

Artificial Analysis 目前主要使用两套测试:

一套是 GDPval-AA v2,基于 OpenAI 的 GDPval 数据,覆盖 44 种职业和 9 个行业;

另一套是 AA-Briefcase,让模型面对数千个私有文件,自主完成研究报告、演示文稿和电子表格等复杂交付物。

这类测试不只是考模型会不会回答问题,而是考它能否查找资料、调用工具、分析信息,并真正交付一份可以使用的成果。

在 GDPval-AA v2 中,Opus 5 max 得到 1861 Elo,领先 Fable 5 和 GPT-5.6 Sol 超过 100 分。

在 AA-Briefcase 中,它的优势更加明显:


AA-Briefcase 模型及档位 Elo 单任务成本 Opus 5 max 1720 17.79 美元 Opus 5 xhigh 1693 14.26 美元 Opus 5 high 1606 10.41 美元 Fable 5 1574 22.30 美元 Opus 5 medium 1470 — Opus 5 low 1223 —

▲ 图:AA-Briefcase 成绩与单任务成本

Opus 5 的 max 档位比 Fable 5 高出 146 Elo,但每次任务成本却降低了约 20%。

更值得注意的是 high 档位。

它的得分为 1606,依然比 Fable 5 高 32 分,但每个任务只花 10.41 美元,不到 Fable 5 成本的一半。

因此,Anthropic 所说的"一半价格获得 Fable 级能力",并不只是营销话术。

至少在报告、PPT、表格和复杂资料分析这些任务中,Opus 5 high 已经能够以不到一半的成本,得到略高于 Fable 5 的成绩。

04分析能力提升巨大,但成品美观度不是第一

AA-Briefcase 还会把结果拆成三个部分:

任务要求是否完成、分析质量以及最终交付物的呈现质量。

Opus 5 的提升主要来自前两项。

在 max 档位下,它的 Analytical Quality Elo 达到 2016,比 Fable 5 高出接近 300 分。


这说明 Opus 5 更擅长理解模糊要求、找到关键材料、建立分析逻辑,并在执行过程中发现和修正问题。

Anthropic 官方给出的案例也印证了这一点。

在一项机械零件建模任务中,模型无法直接查看原始图纸,于是自己编写了一套计算机视觉处理流程,从原始像素中提取几何信息,再完成 3D 建模;在另一个开源软件漏洞任务中,它不仅修复了表面症状,还继续找到了社区补丁遗漏的根本原因。([Anthropic][1])

但在最终交付物的视觉呈现上,Opus 5 并不是第一。

它的 Presentation Elo 为 1628,虽然比 Opus 4.8 有所提升,但仍比 GPT-5.6 Sol max 的 1666 低约 40 分。

这意味着 Opus 5 的优势更接近"研究员"或"分析师":分析扎实、检查细致、逻辑完整。

但如果任务特别强调 PPT 美观、页面设计或视觉表达,GPT-5.6 Sol 仍可能更有优势。

05编程 Agent 与 GPT-5.6 Sol 并列第一

在 Artificial Analysis Coding Agent Index 中,Claude Code 搭配 Opus 5 xhigh 得到 67 分,与 Codex 搭配 GPT-5.6 Sol max 并列第一。

Opus 5 max 得到 66 分,也处于第一梯队。


这项指数综合了 DeepSWE、Terminal-Bench v2 和 SWE-Atlas-QnA 三项测试,考察的不只是代码生成,而是理解代码库、使用终端、查询技术资料和完成多步骤开发任务的能力。

其中,Opus 5 在 SWE-Atlas-QnA 上取得最高成绩。

在 Terminal-Bench v2.1 中,Opus 5 max 的成绩达到 89%,也大致追平 GPT-5.6 Sol xhigh。

这与 Anthropic 官方的测试方向一致。

在 Frontier-Bench v0.1 上,Opus 5 的成绩超过其他模型,并以更低的单任务成本,实现了 Opus 4.8 两倍以上的表现;在 CursorBench 3.2 上,max 档位与 Fable 5 的最佳成绩只相差 0.5%,但成本只有后者的一半。([Anthropic][1])

因此,在 Coding Agent 这个方向上,目前已经很难说 Claude 或 Codex 哪一家绝对领先。

更准确的结论是:Claude Code + Opus 5,与 Codex + GPT-5.6 Sol 已经处于同一水平。

06五档 Effort 不是简单的"思考时间"

Opus 5 提供 low、medium、high、xhigh(或extra) 和 max 五档 Effort。

这并不是简单控制模型回答前思考几秒钟,而是在调整整个任务过程中模型投入的推理 Token、工具调用次数、Agent 回合数和验证强度。

以 AA-Briefcase 为例:

五档 Effort 的实际差异 推理档位 Elo 平均任务时间 平均回合数 max 1720 36.2 分钟 103 xhigh 1693 34.3 分钟 91 high 1606 25.7 分钟 76 medium 1470 — — low 1223 — —

▲ 图:不同 Effort 档位的成绩、耗时与回合数

最高三个档位完成一个任务都要超过 25 分钟。

Opus 5 max 平均需要 36.2 分钟,比 Opus 4.8 max 的 24.1 分钟长约 50%;平均 Agent 回合数也由 55 轮增加到 103 轮。

所以它的部分能力提升,确实来自更加深入的执行。

它会搜索更多材料、打开更多文件、调用更多工具,并多次检查和修改自己的成果。

但也不能把 Opus 5 简单理解成"靠堆时间刷分"。

因为在 Anthropic 的一些客户测试中,Opus 5 反而可以用更少的推理 Token、更少的工具调用和更短的时间取得更高准确率。

两者并不矛盾。

在标准化 Benchmark 中,max 档位会尽可能把模型的能力榨出来;但在某些具体工作流中,更强的规划和判断能力,也可能减少无效尝试。

因此,Effort 更像一个"工作投入等级",而不只是一个"等待时间开关"。

07它还有一个不能忽略的短板:事实可靠性

Opus 5 在 Agent 能力上进步明显,但在事实知识方面仍然落后于 Fable 5。

在 AA-Omniscience 中,Opus 5 的准确率相比 Opus 4.8 提升了 7 个百分点,但它在不确定时更倾向于直接回答,而不是承认不知道。


结果是,其幻觉率上升了 14 个百分点,达到 50%。

这一点非常关键。

Opus 5 可以更好地使用工具、分析文件、编写代码和完成复杂工作,但这并不意味着它记忆中的事实知识也同样可靠。

换句话说:

它更会干活了,但不代表它更少瞎说。

对于涉及资料检索、法律、医疗、财务和事实核查的任务,仍然应该要求它引用来源、调用搜索工具,并对关键信息进行二次验证。

这也是 Opus 5 与 Fable 5 仍然存在差异的地方。

Fable 5 的模型规模和知识容量可能仍然更大,在单纯依赖模型内部知识时,具备更强的事实覆盖能力。

08科学推理很强,但同样不是全面第一

在 Humanity's Last Exam 上,Opus 5 得分 53%,与 Fable 5 大致持平。

在 CritPt 物理推理测试中,它也基本追平 Fable 5,但仍然落后于 GPT-5.6 Sol、GPT-5.5 Pro 和 GPT-5.6 Terra。

Anthropic 官方则表示,Opus 5 在生命科学测试中全面超过 Opus 4.8。

其中,光谱数据推断分子结构的内部测试提升了 10.2 个百分点,预测蛋白质序列变化如何影响功能的测试提升了 7.7 个百分点。([Anthropic][1])

所以 Opus 5 的科学能力确实在明显提升,但依然要分领域看待。

它在综合科研 Agent、资料分析和长期任务中很强;在部分前沿物理推理上,GPT-5.6 系列仍然领先。

09Opus 5 并没有让 Fable 5 失去意义

看到这里,可能会产生一个疑问:

既然 Opus 5 比 Fable 5 便宜,在很多测试中还更强,那 Fable 5 还有什么价值?

答案在于,两款模型擅长的能力并不完全相同。

Opus 5 更像是一个经过高度优化的工作模型:

擅长软件开发、知识工作、工具调用、报告交付和企业 Agent。

Fable 5 则仍然拥有更高的知识容量,并且代表 Anthropic 更高的模型规模和能力上限。

此外,Anthropic 官方明确表示,Opus 5 在网络安全任务上仍然落后于 Mythos 5;它在发现软件漏洞方面已经接近 Mythos 5,但在真正开发攻击利用程序方面仍然明显更弱。([Anthropic][1])

所以,Anthropic 现在的产品线并不是简单的高、中、低配,而更像是能力分工:

1Sonnet 5:成本更低的日常主力;

2Opus 5:企业、编程和知识工作主力;

3Fable 5:更大的前沿通用模型;

4Mythos 5:网络安全和部分高风险科研能力更强。

10Opus 5 真正改变的是模型的计价方式

过去大家比较大模型,最常看的指标是 Token 单价。

但 Opus 5 说明,进入 Agent 时代后,这个指标已经不够用了。

同样是每百万 Token 25 美元,有的模型花了很多 Token,最后仍然没有完成任务;有的模型虽然一次调用更贵,却可以一次交付合格的报告、PPT、表格或代码。

因此,更合理的指标开始变成:

完成一项工作到底需要多少钱?

Opus 5 max 在 Intelligence Index 上平均每次任务花费 2.03 美元,在 AA-Briefcase 上则要花 17.79 美元。

这两个数字相差近 9 倍,恰恰说明了"任务"之间的差异。

回答一道科学题,和处理数千个文件、做完分析并交付一份专业报告,显然不是一回事。

所以,Claude Opus 5 最大的意义,并不是又拿了几个第一。

而是 Anthropic 正在把模型从一个聊天工具,变成一套可以明确控制能力、成本和工作投入程度的数字劳动力。

它有五档 Effort,可以让企业决定一件事值得投入多少算力;有 Fast Mode,可以用更高价格换取更低延迟;有自动 fallback,可以在安全分类器拦截请求后继续维持工作流。([Anthropic][1])

综合来看,Claude Opus 5 不是一个完美模型。

它价格仍然很高,响应不算快,最高档位会消耗大量 Token 和时间,事实幻觉率也值得警惕。

但在目前最有商业价值的几个方向:编程、研究、报告、表格、PPT 和复杂 Agent,它已经成为最强的一批模型之一。

如果一定要用一句话概括:

Claude Opus 5 没有全面超越 Fable 5,但它可能是目前最适合真正拿来干活的 Claude。

参考来源[1] Introducing Claude Opus 5 · Anthropic
https://www.anthropic.com/news/claude-opus-5[2] Claude Opus 5 (max) · Intelligence, Performance & Price Analysis
https://artificialanalysis.ai/models/claude-opus-5

你手上的活,值得让模型花 36 分钟吗?评论区聊聊你会用哪一档 Effort觉得有用 → 点个❤️在看转给还不知道的朋友点个赞 告诉我你看完了关注「AI范儿」,下次更新第一时间收到

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
91号赛车燃爆!所在车队宣布永久退赛:组委会救援严重失职 提3要求

91号赛车燃爆!所在车队宣布永久退赛:组委会救援严重失职 提3要求

风过乡
2026-09-06 14:00:44
女篮险胜锁定出线!名宿直呼:太差了,批评一人,中肯点评张子宇

女篮险胜锁定出线!名宿直呼:太差了,批评一人,中肯点评张子宇

理工男评篮球
2026-09-06 23:13:00
女性长期使用情趣用品,身体可能出现哪些不适?不少人缺乏认知

女性长期使用情趣用品,身体可能出现哪些不适?不少人缺乏认知

看世界的人
2026-08-07 09:22:50
拉什福德痛失神仙助攻,阿森纳旧将超级世界波绝平,埃弗顿2-2曼联

拉什福德痛失神仙助攻,阿森纳旧将超级世界波绝平,埃弗顿2-2曼联

钉钉陌上花开
2026-09-06 23:01:26
又一个有钱人死在了加州的路边,他是年薪百万的阿里总监,才42岁

又一个有钱人死在了加州的路边,他是年薪百万的阿里总监,才42岁

皮蛋儿电影
2026-09-06 16:09:30
秒杀孙宇晨小作文:深圳富豪“仅退款”,还把小三送进去14年

秒杀孙宇晨小作文:深圳富豪“仅退款”,还把小三送进去14年

吃瓜体
2026-09-06 11:33:54
成都一小学通知家长到校打扫卫生,区教育局:已要求学校立即整改,严禁任何班级以任何形式,要求或变相要求家长到校打扫卫生

成都一小学通知家长到校打扫卫生,区教育局:已要求学校立即整改,严禁任何班级以任何形式,要求或变相要求家长到校打扫卫生

鲁中晨报
2026-09-06 11:51:04
演唱会上“衣不遮体”,惹争议!官媒下场,莫文蔚那英也没躲过

演唱会上“衣不遮体”,惹争议!官媒下场,莫文蔚那英也没躲过

皮皮电影
2026-09-05 14:20:16
贪污上亿、空壳公司、做戏大王54岁的韩红,私生活谣言太荒谬!

贪污上亿、空壳公司、做戏大王54岁的韩红,私生活谣言太荒谬!

一盅情怀
2026-09-06 12:25:00
多地严查赵一鸣、好想来……

多地严查赵一鸣、好想来……

中吴网
2026-09-06 09:46:34
百万吃播网红“莹莹”去世,仅24岁,知情人曝原因,长期大油大盐

百万吃播网红“莹莹”去世,仅24岁,知情人曝原因,长期大油大盐

裕丰娱间说
2026-09-06 18:18:40
网民“峰哥”大肆招揽外籍人员来华搞“转运做法”,天津边检出手

网民“峰哥”大肆招揽外籍人员来华搞“转运做法”,天津边检出手

观察者网
2026-09-06 20:05:49
大瓜?网传梁宏达也移民了,将在9月15日顺利离境

大瓜?网传梁宏达也移民了,将在9月15日顺利离境

小徐讲八卦
2026-09-06 13:06:15
泰国官员登上“林肯”号航母​,合影中F35C简直锈成废铁

泰国官员登上“林肯”号航母​,合影中F35C简直锈成废铁

三叔的装备空间
2026-09-06 23:11:17
我今年28岁,说实话我不喜欢我老公,结婚五年我背着他出过三次轨

我今年28岁,说实话我不喜欢我老公,结婚五年我背着他出过三次轨

千秋文化
2026-09-06 20:27:27
黄智贤正式变节,邱毅发文确认,馆长也表态了,统派不适合投机者

黄智贤正式变节,邱毅发文确认,馆长也表态了,统派不适合投机者

精彩一网打尽
2026-09-06 15:42:24
财政部将向中国人寿集团、中国太平分别注资350亿元、70亿元,中国人保拟募资不超过150亿元

财政部将向中国人寿集团、中国太平分别注资350亿元、70亿元,中国人保拟募资不超过150亿元

第一财经资讯
2026-09-06 17:39:27
中国女篮锁定附加赛!美国队险胜意大利:提前一轮晋级世界杯八强

中国女篮锁定附加赛!美国队险胜意大利:提前一轮晋级世界杯八强

罗说NBA
2026-09-07 04:52:11
比亚迪、理想、长安等超50家企业预祝小米新车上市成功,雷军向所有品牌表达感谢

比亚迪、理想、长安等超50家企业预祝小米新车上市成功,雷军向所有品牌表达感谢

极目新闻
2026-09-06 22:14:04
俄罗斯星链尴尬事:租星链,不给;偷星链,不让;发射星链,不入轨

俄罗斯星链尴尬事:租星链,不给;偷星链,不让;发射星链,不入轨

李未熟擒话2
2026-09-06 07:49:18
2026-09-07 07:03:01
AI范儿 incentive-icons
AI范儿
AI范儿是一个专注于人工智能领域的资讯和学习平台,提供最新的人工智能资讯
830文章数 685关注度
往期回顾 全部

科技要闻

DeepSeek被曝将采购16万颗华为昇腾950DT

头条要闻

CHINA GT发生重大撞车起火事故 救援人员因为害怕逃离

头条要闻

CHINA GT发生重大撞车起火事故 救援人员因为害怕逃离

体育要闻

3.9秒绝平!杨舒予18+5成女篮救世主

娱乐要闻

杨紫获白玉兰影后!爸爸:累了就回家

财经要闻

亏损高达200亿,昔日彩电霸主走下巅峰!

汽车要闻

带升降立标MPV 岚图梦想家9预售价42.99万起

态度原创

健康
家居
房产
艺术
公开课

脑梗取栓成功≠活下来,还有这三关

家居要闻

2026建博会(广州) 公装联探展交流活动

房产要闻

突发重磅!海口出台楼市新政!

艺术要闻

毛泽东写《兰亭序》,史上最霸气版本!

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版