AI范儿 · 产品拆解⏱ 7 分钟
Anthropic 正式发布了 Claude Opus 5。
官方给它的定位是:接近 Claude Fable 5 的前沿智能,但价格只有后者的一半。
不过,从 Artificial Analysis 在发布前完成的独立评测来看,这个说法多少有些保守。
Claude Opus 5 不只是"接近"Fable 5。在综合智能、真实知识工作和编程 Agent 等多个测试中,它已经与 Fable 5 打平,甚至实现了反超。
更准确地说,Opus 5 是一个能力边界略低于顶级大模型,但在绝大多数真实工作中更强、更便宜,也更容易部署的模型。
01先看基本参数
Anthropic 依旧没有公布 Opus 5 的参数量、训练数据规模和具体架构,也没有说明它是否采用 MoE。
因此,这次能够比较的"参数",主要是上下文、价格、推理档位、速度和任务成本。
Claude Opus 5 基本参数 上下文窗口 100 万 Token 输入模态 文本、图像 输出模态 文本 输入价格 5 美元/百万 Token 输出价格 25 美元/百万 Token 缓存写入 6.25 美元/百万 Token 缓存命中 0.5 美元/百万 Token 缓存有效期 5 分钟 推理档位 low、medium、high、extra、max Fast Mode 约 2.5 倍速度,价格翻倍 安全降级 支持自动切换到其他模型 上下文长度 与 Opus 4.8 相同
▲ 图:Claude Opus 5 基本参数
Opus 5 延续了 Opus 4.8 的 API 定价,并没有因为能力升级而涨价。缓存写入价格比普通输入高 25%,缓存命中则便宜 90%。官方还提供 Fast Mode,速度约为默认模式的 2.5 倍,但价格也会翻倍。([Anthropic][1])
单看 Token 单价,Opus 5 并不便宜。
Artificial Analysis 统计显示,它的输入和输出价格都显著高于同类模型中位数,最高推理档位的输出速度约为每秒 56.3 个 Token,也低于同档模型约 73.6 个 Token 的中位水平。最高档位首次返回答案的平均等待时间达到 64.52 秒。([Artificial Analysis][2])
![]()
因此,Opus 5 的优势从来都不是便宜或响应快。
它真正强调的是:完成一个复杂任务时,花的钱更少,成功率却更高。
02综合智能指数排名第一,但优势非常窄
在 Artificial Analysis Intelligence Index v4.1 中,Claude Opus 5 的 max 档位得分为 61,暂时位列第一。
作为对比:
![]()
▲ 图:Intelligence Index 得分对比
这个指数综合了 9 项测试,包括真实知识工作、银行工具调用、终端操作、科学编程、Humanity's Last Exam、物理推理、事实知识和长上下文推理等。([Artificial Analysis][2])
所以,61 分并不意味着 Opus 5 在每一个能力维度都排名第一。
它更像是一个综合成绩。
而且 Opus 5 的 61 分与 Fable 5 的 60 分,实际上几乎处于同一水平,不能简单理解为前者已经全面超越后者。
真正值得注意的是成本。
在 Intelligence Index 中,Opus 5 max 平均每个任务成本为 2.03 美元,比 Fable 5 的 2.75 美元低约 26%。
但它仍然比 Opus 4.8 max 的 1.80 美元,以及 Sonnet 5 max 的 1.53 美元更贵。
这说明 Opus 5 并不是全行业性价比最高的模型。它更准确的定位是:
在前沿智能水平上,比 Fable 5 更便宜。
03真正拉开差距的是知识工作
相比综合智能指数,Opus 5 在 Agent 知识工作上的优势更明显。
Artificial Analysis 目前主要使用两套测试:
一套是 GDPval-AA v2,基于 OpenAI 的 GDPval 数据,覆盖 44 种职业和 9 个行业;
另一套是 AA-Briefcase,让模型面对数千个私有文件,自主完成研究报告、演示文稿和电子表格等复杂交付物。
这类测试不只是考模型会不会回答问题,而是考它能否查找资料、调用工具、分析信息,并真正交付一份可以使用的成果。
在 GDPval-AA v2 中,Opus 5 max 得到 1861 Elo,领先 Fable 5 和 GPT-5.6 Sol 超过 100 分。
在 AA-Briefcase 中,它的优势更加明显:
![]()
AA-Briefcase 模型及档位 Elo 单任务成本 Opus 5 max 1720 17.79 美元 Opus 5 xhigh 1693 14.26 美元 Opus 5 high 1606 10.41 美元 Fable 5 1574 22.30 美元 Opus 5 medium 1470 — Opus 5 low 1223 —
▲ 图:AA-Briefcase 成绩与单任务成本
Opus 5 的 max 档位比 Fable 5 高出 146 Elo,但每次任务成本却降低了约 20%。
更值得注意的是 high 档位。
它的得分为 1606,依然比 Fable 5 高 32 分,但每个任务只花 10.41 美元,不到 Fable 5 成本的一半。
因此,Anthropic 所说的"一半价格获得 Fable 级能力",并不只是营销话术。
至少在报告、PPT、表格和复杂资料分析这些任务中,Opus 5 high 已经能够以不到一半的成本,得到略高于 Fable 5 的成绩。
04分析能力提升巨大,但成品美观度不是第一
AA-Briefcase 还会把结果拆成三个部分:
任务要求是否完成、分析质量以及最终交付物的呈现质量。
Opus 5 的提升主要来自前两项。
在 max 档位下,它的 Analytical Quality Elo 达到 2016,比 Fable 5 高出接近 300 分。
![]()
这说明 Opus 5 更擅长理解模糊要求、找到关键材料、建立分析逻辑,并在执行过程中发现和修正问题。
Anthropic 官方给出的案例也印证了这一点。
在一项机械零件建模任务中,模型无法直接查看原始图纸,于是自己编写了一套计算机视觉处理流程,从原始像素中提取几何信息,再完成 3D 建模;在另一个开源软件漏洞任务中,它不仅修复了表面症状,还继续找到了社区补丁遗漏的根本原因。([Anthropic][1])
但在最终交付物的视觉呈现上,Opus 5 并不是第一。
它的 Presentation Elo 为 1628,虽然比 Opus 4.8 有所提升,但仍比 GPT-5.6 Sol max 的 1666 低约 40 分。
这意味着 Opus 5 的优势更接近"研究员"或"分析师":分析扎实、检查细致、逻辑完整。
但如果任务特别强调 PPT 美观、页面设计或视觉表达,GPT-5.6 Sol 仍可能更有优势。
05编程 Agent 与 GPT-5.6 Sol 并列第一
在 Artificial Analysis Coding Agent Index 中,Claude Code 搭配 Opus 5 xhigh 得到 67 分,与 Codex 搭配 GPT-5.6 Sol max 并列第一。
Opus 5 max 得到 66 分,也处于第一梯队。
![]()
这项指数综合了 DeepSWE、Terminal-Bench v2 和 SWE-Atlas-QnA 三项测试,考察的不只是代码生成,而是理解代码库、使用终端、查询技术资料和完成多步骤开发任务的能力。
其中,Opus 5 在 SWE-Atlas-QnA 上取得最高成绩。
在 Terminal-Bench v2.1 中,Opus 5 max 的成绩达到 89%,也大致追平 GPT-5.6 Sol xhigh。
这与 Anthropic 官方的测试方向一致。
在 Frontier-Bench v0.1 上,Opus 5 的成绩超过其他模型,并以更低的单任务成本,实现了 Opus 4.8 两倍以上的表现;在 CursorBench 3.2 上,max 档位与 Fable 5 的最佳成绩只相差 0.5%,但成本只有后者的一半。([Anthropic][1])
因此,在 Coding Agent 这个方向上,目前已经很难说 Claude 或 Codex 哪一家绝对领先。
更准确的结论是:Claude Code + Opus 5,与 Codex + GPT-5.6 Sol 已经处于同一水平。
06五档 Effort 不是简单的"思考时间"
Opus 5 提供 low、medium、high、xhigh(或extra) 和 max 五档 Effort。
这并不是简单控制模型回答前思考几秒钟,而是在调整整个任务过程中模型投入的推理 Token、工具调用次数、Agent 回合数和验证强度。
以 AA-Briefcase 为例:
五档 Effort 的实际差异 推理档位 Elo 平均任务时间 平均回合数 max 1720 36.2 分钟 103 xhigh 1693 34.3 分钟 91 high 1606 25.7 分钟 76 medium 1470 — — low 1223 — —
▲ 图:不同 Effort 档位的成绩、耗时与回合数
最高三个档位完成一个任务都要超过 25 分钟。
Opus 5 max 平均需要 36.2 分钟,比 Opus 4.8 max 的 24.1 分钟长约 50%;平均 Agent 回合数也由 55 轮增加到 103 轮。
所以它的部分能力提升,确实来自更加深入的执行。
它会搜索更多材料、打开更多文件、调用更多工具,并多次检查和修改自己的成果。
但也不能把 Opus 5 简单理解成"靠堆时间刷分"。
因为在 Anthropic 的一些客户测试中,Opus 5 反而可以用更少的推理 Token、更少的工具调用和更短的时间取得更高准确率。
两者并不矛盾。
在标准化 Benchmark 中,max 档位会尽可能把模型的能力榨出来;但在某些具体工作流中,更强的规划和判断能力,也可能减少无效尝试。
因此,Effort 更像一个"工作投入等级",而不只是一个"等待时间开关"。
07它还有一个不能忽略的短板:事实可靠性
Opus 5 在 Agent 能力上进步明显,但在事实知识方面仍然落后于 Fable 5。
在 AA-Omniscience 中,Opus 5 的准确率相比 Opus 4.8 提升了 7 个百分点,但它在不确定时更倾向于直接回答,而不是承认不知道。
![]()
结果是,其幻觉率上升了 14 个百分点,达到 50%。
这一点非常关键。
Opus 5 可以更好地使用工具、分析文件、编写代码和完成复杂工作,但这并不意味着它记忆中的事实知识也同样可靠。
换句话说:
它更会干活了,但不代表它更少瞎说。
对于涉及资料检索、法律、医疗、财务和事实核查的任务,仍然应该要求它引用来源、调用搜索工具,并对关键信息进行二次验证。
这也是 Opus 5 与 Fable 5 仍然存在差异的地方。
Fable 5 的模型规模和知识容量可能仍然更大,在单纯依赖模型内部知识时,具备更强的事实覆盖能力。
08科学推理很强,但同样不是全面第一
在 Humanity's Last Exam 上,Opus 5 得分 53%,与 Fable 5 大致持平。
在 CritPt 物理推理测试中,它也基本追平 Fable 5,但仍然落后于 GPT-5.6 Sol、GPT-5.5 Pro 和 GPT-5.6 Terra。
Anthropic 官方则表示,Opus 5 在生命科学测试中全面超过 Opus 4.8。
其中,光谱数据推断分子结构的内部测试提升了 10.2 个百分点,预测蛋白质序列变化如何影响功能的测试提升了 7.7 个百分点。([Anthropic][1])
所以 Opus 5 的科学能力确实在明显提升,但依然要分领域看待。
它在综合科研 Agent、资料分析和长期任务中很强;在部分前沿物理推理上,GPT-5.6 系列仍然领先。
09Opus 5 并没有让 Fable 5 失去意义
看到这里,可能会产生一个疑问:
既然 Opus 5 比 Fable 5 便宜,在很多测试中还更强,那 Fable 5 还有什么价值?
答案在于,两款模型擅长的能力并不完全相同。
Opus 5 更像是一个经过高度优化的工作模型:
擅长软件开发、知识工作、工具调用、报告交付和企业 Agent。
Fable 5 则仍然拥有更高的知识容量,并且代表 Anthropic 更高的模型规模和能力上限。
此外,Anthropic 官方明确表示,Opus 5 在网络安全任务上仍然落后于 Mythos 5;它在发现软件漏洞方面已经接近 Mythos 5,但在真正开发攻击利用程序方面仍然明显更弱。([Anthropic][1])
所以,Anthropic 现在的产品线并不是简单的高、中、低配,而更像是能力分工:
1Sonnet 5:成本更低的日常主力;
2Opus 5:企业、编程和知识工作主力;
3Fable 5:更大的前沿通用模型;
4Mythos 5:网络安全和部分高风险科研能力更强。
10Opus 5 真正改变的是模型的计价方式
过去大家比较大模型,最常看的指标是 Token 单价。
但 Opus 5 说明,进入 Agent 时代后,这个指标已经不够用了。
同样是每百万 Token 25 美元,有的模型花了很多 Token,最后仍然没有完成任务;有的模型虽然一次调用更贵,却可以一次交付合格的报告、PPT、表格或代码。
因此,更合理的指标开始变成:
完成一项工作到底需要多少钱?
Opus 5 max 在 Intelligence Index 上平均每次任务花费 2.03 美元,在 AA-Briefcase 上则要花 17.79 美元。
这两个数字相差近 9 倍,恰恰说明了"任务"之间的差异。
回答一道科学题,和处理数千个文件、做完分析并交付一份专业报告,显然不是一回事。
所以,Claude Opus 5 最大的意义,并不是又拿了几个第一。
而是 Anthropic 正在把模型从一个聊天工具,变成一套可以明确控制能力、成本和工作投入程度的数字劳动力。
它有五档 Effort,可以让企业决定一件事值得投入多少算力;有 Fast Mode,可以用更高价格换取更低延迟;有自动 fallback,可以在安全分类器拦截请求后继续维持工作流。([Anthropic][1])
综合来看,Claude Opus 5 不是一个完美模型。
它价格仍然很高,响应不算快,最高档位会消耗大量 Token 和时间,事实幻觉率也值得警惕。
但在目前最有商业价值的几个方向:编程、研究、报告、表格、PPT 和复杂 Agent,它已经成为最强的一批模型之一。
如果一定要用一句话概括:
Claude Opus 5 没有全面超越 Fable 5,但它可能是目前最适合真正拿来干活的 Claude。
参考来源[1] Introducing Claude Opus 5 · Anthropic
https://www.anthropic.com/news/claude-opus-5[2] Claude Opus 5 (max) · Intelligence, Performance & Price Analysis
https://artificialanalysis.ai/models/claude-opus-5
你手上的活,值得让模型花 36 分钟吗?评论区聊聊你会用哪一档 Effort觉得有用 → 点个❤️在看转给还不知道的朋友点个赞 告诉我你看完了关注「AI范儿」,下次更新第一时间收到
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.