网易首页 > 网易号 > 正文 申请入驻

编程能力从 10% 飙到 70%,Anthropic 新模型却遭遇灵魂拷问:我什么时候才会用它?

0
分享至


作者 | Tina

Anthropic 又发新模型了。

距离 Claude Opus 5.5 发布还不到一周,Anthropic 于 9 月 28 日推出 Claude Sonnet 5.5。这是 Claude 5.5 家族的第二款模型,Haiku 5.5 也将在未来几周内登场。

Anthropic 宣称,新模型的输出速度提升超过 30%,完成多数任务所需的 Token 更少,因此单任务成本最高可降低 30%。

Claude Code 创建者 Boris Cherny 还发布了一段演示,展示 Sonnet 5.5 通过 Claude Code 修复一个 Bug,并配文称:“速度提升 30%,使用量减少 30%。”

不过,Sonnet 5.5 虽然把 Sonnet 这个“中档模型”推到了接近 Opus 的位置,但当推理强度拉到最高,它对 Token 的消耗也达到了一个惊人的水平。

Sonnet 5.5 最明显的升级,就是编程

从 Anthropic 公布的数据看,Sonnet 5.5 的核心提升发生在 Coding Agent 场景。


其中变化最明显的是 Terminal-Bench 4.0。Sonnet 5.5 从上一代的 10.3% 跃升到 70.6%,还超过了 Opus 5.5 公布的最佳成绩。这项测试要求模型在命令行环境中自主使用工具,完成复杂的多步骤任务,考察的已经不只是代码补全能力,而是完整的 Agentic Coding 能力。


CursorBench 更接近日常开发。它使用来自 Cursor 编辑器真实编程会话的任务,包含需求模糊、跨文件修改和理解现有代码库等情况。Sonnet 5.5 在这项测试中得到 55.5%,与 Opus 5.5 的 57.8% 只差约两个百分点。

Anthropic 称,早期测试者最明显的感受,是 Sonnet 5.5 理解代码库的速度更快。它也更倾向于把多个工具调用批量执行,减少模型与终端之间来回交互的次数。对于 Claude Code 这类需要反复搜索、读取、修改、测试和验证的 Coding Agent,减少一步往往意味着同时减少等待时间、Token 消耗和中途出错的机会。

Lovable 的测试提供了一个更具体的观察:Sonnet 5.5 完成编程任务所需的工具调用减少约三分之一,Shell 执行次数大约减半。Base44 在 118 次真实应用构建中发现,Sonnet 5.5 平均经过 3.6 轮迭代完成一个应用,Opus 5 则需要 7.7 轮;新模型的工具调用失败次数也是所有参测模型中最少的。

这些变化比单纯的生成速度更重要。Coding Agent 的成本来自整条执行链:理解代码库、选择文件、调用工具、运行测试、发现错误,再回到代码中继续修改。Sonnet 5.5 的提升主要体现在这条链路变短了。

“单任务最高省 30%”,但有前提

Sonnet 5.5 延续了 Sonnet 5 的价格:每百万输入 Token 2 美元、输出 Token 10 美元、缓存读取 0.2 美元、缓存写入 2.5 美元。


与 Opus 5.5 相比,Sonnet 5.5 的输入、输出和缓存写入价格均低一半,缓存读取价格相同。

但 Artificial Analysis 的测试显示,当推理强度调到 Max 时,Sonnet 5.5 每项 Intelligence Index 任务平均生成约 19.3 万个输出 Token,是该机构测试过的模型中最高的。


这个数字比 Opus 5.5 Max 和 Sonnet 5 Max 高约 60%,约为 GPT-6 Astra Max 的 7 倍。Sonnet 5.5 Max 的单任务成本达到 7.60 美元,比 Sonnet 5 高约 50%。

作为交换,Sonnet 5.5 Max 在 Artificial Analysis Intelligence Index 中得到 56 分,只比 Opus 5.5 Max 低两分。

也就是说,Anthropic 所说的“单任务成本最高降低 30%”针对的是多数任务,并不代表把推理强度调到 Max 后仍然更省。

值得注意的是,Sonnet 5.5 在 FrontierCode 1.1 中使用 Max 设置时得到 46.2%,反而低于 Xhigh 的 52.1%。Anthropic 在脚注中称,Sonnet 5.5 在 Max 设置下更容易触发由多个子 Agent 执行的代码审查。Cognition 检查的两个案例中,出现了超时或任务范围外的额外修改,最终被 FrontierCode 扣分。

谁需要 Sonnet 5.5?

Sonnet 5.5 发布后,一名 Hacker News 用户提出了一个很现实的问题:Opus 5.5 的效率已经很高,即使同时运行两三个会话,Max 5x 套餐的额度也完全足够日常工作。“所以,我想知道自己什么时候才会使用 Sonnet 5.5”。


“至少目前,我自己的工作需求似乎已经快被模型能力完全满足了。当然,我可以把所有请求都调到 Max Effort,单纯为了消耗 Token,但这显然没有意义。”

他的评论点出了 Sonnet 5.5 一个略显尴尬的位置。Claude Max 目前分为每月 100 美元的 5x 套餐和每月 200 美元的 20x 套餐。对已经订阅 Max、日常额度又足够的人来说,Opus 5.5 能处理最难的任务,未必有场景需要我们切换到 Sonnet 5.5。


还有一名 Hacker News 用户问得也很直接:“Opus 5.5 使用 Low 设置时,看起来比 Sonnet Medium 更聪明、更便宜、速度也更快,那 Sonnet 存在的意义是什么?”

另一名用户勉强找出了一个场景:Claude Code 的子 Agent 会继承主 Agent 的 Thinking Level。如果想让不同子 Agent 使用不同强度的推理,就需要换用不同模型,因此他偶尔会选择 Sonnet。但他自己也承认:“这算不上一个特别好的理由,只是我目前唯一会使用 Sonnet 的场景。”

这种困惑也与付费方式有关。Max 用户支付的是固定月费,只要套餐额度还够用,继续使用 Opus 5.5 并不会立刻增加支出,Sonnet 5.5 的低单价自然缺少吸引力。

API 用户面对的情况不同。模型在多轮对话和工具调用过程中产生的输入、输出 Token 都会计入账单,Sonnet 5.5 的输入和输出单价只有 Opus 5.5 的一半。对于需要批量修复 Bug、补充测试、处理 CI 问题或者并行运行多个 Agent 的团队,只要任务边界清晰,Sonnet 5.5 使用 Medium 或 High 设置就能把价格优势真正体现出来。

但把推理强度调到 Max 后,这项优势又很快消失。Artificial Analysis 测得,Sonnet 5.5 Max 的单任务成本达到 7.60 美元,跑 10 个任务就是 76 美元,跑 100 个就是 760 美元。它虽然获得了接近 Opus 的性能,成本也随之进入了另一个区间。

因此,Sonnet 5.5 最清晰的使用场景集中在高频、明确、可验证的 API 任务上。对于 Max 订阅用户,如果 Opus 5.5 已经能在现有额度内完成工作,确实很难找到切换的迫切理由。

更复杂的是,即使开发者选择了 Sonnet 5.5,最终处理请求的也可能是 Sonnet 5。

Sonnet 5.5 是首款加入网络安全分类器和模型回退机制的 Sonnet,其网络安全能力已经接近 Opus 5,因此 Anthropic 为它采用了相同级别的防护措施。

这套检测分为三个阶段:系统首先通过探针读取模型的内部激活状态,随后由运行在 Sonnet 5.5 上的轻量级分类器检查,最后再由一个单独训练的 LLM 分类器决定是否拦截对话。如果请求被判定为高风险网络安全任务,系统可能停止使用 Sonnet 5.5,将请求交给能力较弱的 Sonnet 5。

在 Claude 应用中,用户会看到模型切换提示。API 开发者则需要主动启用服务器端 fallback;启用后,部分因网络安全或前沿模型限制而被拒绝的请求会自动交给 Sonnet 5,没有启用时,请求将直接返回拒绝。

Artificial Analysis 在测试 Sonnet 5.5 的五档推理强度时,均启用了 Anthropic 的默认回退机制。约 0.1% 的 Intelligence Index 任务触发了回退,主要集中在 Terminal-Bench 4.0,所有触发回退的请求最终都由 Sonnet 5 处理。

因此,“选择 Sonnet 5.5”包含了两个问题:它是否比 Opus 更适合当前任务,以及这项请求最终是否真的由 Sonnet 5.5 完成。Artificial Analysis 观察到的回退比例只有约 0.1%,但这个数字仅来自其基准测试,不能代表真实生产环境中的整体回退率。

https://www.anthropic.com/claude-sonnet-5-5

https://artificialanalysis.ai/articles/claude-sonnet-5-5

声明:本文为 InfoQ 编译,不代表平台观点,也不构成投资建议,未经许可禁止转载。

会议推荐

本届大会聚焦 Harness AI 时代的工程实践,从「构建 AI」到「驾驭 AI」,围绕AI Native 架构、Agent Runtime、AI Infra、Agent 安全与可观测、Loop Engineering、具身智能与世界模型等热门技术方向,将邀请 100+ 全球技术社区与产业一线实践者,共同分享 AI Native 时代最具价值的工程经验。限时 9 折优惠立减 680!查看更多详情可扫码或联系票务经理 18514549229 进行咨询。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
白衫黑裤,都市街头的熟女氛围感穿搭

白衫黑裤,都市街头的熟女氛围感穿搭

只要高兴就好
2026-09-30 08:19:07
谢贤前女友Coco直播被说丑,本人回应:“姐都40岁了,把头发往下一放还是迷倒一大片的”

谢贤前女友Coco直播被说丑,本人回应:“姐都40岁了,把头发往下一放还是迷倒一大片的”

韩小娱
2026-09-04 05:54:22
央行宣布,将开展1.2万亿元买断式逆回购操作

央行宣布,将开展1.2万亿元买断式逆回购操作

中国基金报
2026-09-30 22:54:08
万科A跌停

万科A跌停

证券时报
2026-09-30 10:38:12
77比22通过!特朗普:这法案能拯救大学体育

77比22通过!特朗普:这法案能拯救大学体育

甜份超标的我
2026-09-30 01:29:58
这下看懂了!为啥都说中菲如果真要爆发冲突,晚动手不如早动手

这下看懂了!为啥都说中菲如果真要爆发冲突,晚动手不如早动手

叶老四
2026-09-30 12:58:06
卸任多年、曾几乎从不评价外国领导人的默克尔开口了!她没骂特朗普,说出了一句话:这个人,你们绝对不能低估

卸任多年、曾几乎从不评价外国领导人的默克尔开口了!她没骂特朗普,说出了一句话:这个人,你们绝对不能低估

扶苏聊历史
2026-09-30 15:37:01
她连续5次上春晚,却被恩师骗同居流产,如今58岁无依无靠太唏嘘

她连续5次上春晚,却被恩师骗同居流产,如今58岁无依无靠太唏嘘

往史过眼云烟
2026-08-24 22:01:09
民众呼吁“取消养老特权”!71岁专家引发争议,养老差距真相大白

民众呼吁“取消养老特权”!71岁专家引发争议,养老差距真相大白

百科密码
2026-08-31 10:02:15
沈阳来了位新副市长

沈阳来了位新副市长

记者王立君
2026-09-29 16:34:44
洗米华Mandy爱巢终于卖掉,8120万成交亏千万,房款全数用于还债

洗米华Mandy爱巢终于卖掉,8120万成交亏千万,房款全数用于还债

树娃
2026-09-12 12:45:45
意外!为何中国男足在比赛中表现不佳,奥斯卡一针见血说出原因

意外!为何中国男足在比赛中表现不佳,奥斯卡一针见血说出原因

懂个球
2026-10-01 01:47:25
带娃式穿搭,现在的妈妈都好年轻!

带娃式穿搭,现在的妈妈都好年轻!

穿的像个人样
2026-09-30 07:02:19
王楚钦为何忽然热爆全网热搜?不得不提到一个人:何智丽!

王楚钦为何忽然热爆全网热搜?不得不提到一个人:何智丽!

魔都囡
2026-09-29 09:44:43
巴贝尔:布伦纳有机会入选德国队,但他脑子里还缺点东西

巴贝尔:布伦纳有机会入选德国队,但他脑子里还缺点东西

懂球帝
2026-10-01 02:22:27
4.5s破百 纯电路虎揽胜运动版正式亮相

4.5s破百 纯电路虎揽胜运动版正式亮相

车质网
2026-09-30 09:13:15
曾是歌坛一代天王,却沦为臭名昭著的台独分子,今家破人亡下场惨

曾是歌坛一代天王,却沦为臭名昭著的台独分子,今家破人亡下场惨

蜉蝣说
2026-09-22 11:49:00
中央批准!顶级985大学,迎来新党委书记

中央批准!顶级985大学,迎来新党委书记

双一流高校
2026-10-01 02:01:51
网传农村光棍现象已相当严重,足有3000万,而城市里却有大龄剩女

网传农村光棍现象已相当严重,足有3000万,而城市里却有大龄剩女

慧翔百科
2026-06-26 17:45:16
闫妮自曝为招桃花改微信名,结果把沙溢招来了

闫妮自曝为招桃花改微信名,结果把沙溢招来了

韩小娱
2026-09-29 17:28:50
2026-10-01 03:51:00
InfoQ incentive-icons
InfoQ
有内容的技术社区媒体
13010文章数 52081关注度
往期回顾 全部

科技要闻

OpenAI凌晨大上新!新助手dots迎战Muse

头条要闻

美国著名演员史泰龙发声:我糟蹋了自己的身体

头条要闻

美国著名演员史泰龙发声:我糟蹋了自己的身体

体育要闻

30天30队·火箭:乌度卡的控制欲

娱乐要闻

胡歌现身游本昌遗体告别仪式

财经要闻

“杭州六小龙”迎来价值重估

汽车要闻

燃油车的最佳平替 长城大狗HEV简单好开更经济

态度原创

时尚
教育
旅游
亲子
军事航空

从理性到反叛,看米兰时装周风格流转

教育要闻

二三等奖名单公示!祝贺南京这些学生!

旅游要闻

漫游京城 共赏金秋盛景

亲子要闻

着床的那一刻,妈妈的身体会有感觉吗?答案是......

军事要闻

美军最后2500人撤离伊拉克

无障碍浏览 进入关怀版