网易首页 > 网易号 > 正文 申请入驻

Claude Sonnet 5.5深夜空降!一半价格击败Opus,开发者实测账单暴涨

0
分享至


智东西
作者 程茜
编辑 心缘

智东西9月29日消息,今日凌晨,Anthropic发布Claude 5.5系列第二款模型Claude Sonnet 5.5,主打快速、高性价比。

Anthropic在博客中透露,相比Claude Sonnet 5,新模型速度提升超30%,成本降低近30%,更擅长处理日常任务,如修复错误、创建文档、制作幻灯片和电子表格等。


先来看几项关键指标,Sonnet 5.5在多项指标中可对标Opus 5.5,相比Sonnet 5有数倍提升。Anthropic称,这是首个仅通过截图就能赢得《口袋妖怪红》游戏的Sonnet模型。在Artificial Analysis上,Sonnet 5.5在AI分析指数上得分为56,仅次于Opus 5.5的58分,该榜单上,Claude系列模型包揽前三席。


价格方面,Claude Sonnet 5.5定价与上一代相同,即每百万输入token 2美元,每百万输出token 10美元,每百万token的缓存读取操作需0.20美元。不过,其博客提到,模型在实际完成任务时,单任务成本比Claude Sonnet 5要低30%。


官方放出的案例显示,Sonnet 5.5复原魔方时仅花费10秒、0.11美元就完成任务。


Artificial Analysis的榜单显示,Sonnet 5.5单任务输出token数量更多,其单任务成本为7.60美元,比Sonnet 5的单任务成本高出约50%,接近于Opus 5.5的7.63美元。


不少开发者实测发现,Sonnet 5.5的成本非常高,“建议坚持使用Opus 5.5”。


Claude Sonnet 5.5现已在全平台上线,包括AWS、谷歌云以及微软Azure。开发者可在Claude 平台通过模型标识符claude-sonnet-5-5接入使用。 如果原先在Sonnet模型上关闭思考功能,迁移至Sonnet 5.5前,需要切换至新的between_tools参数配置,该配置可保持前置思考功能处于关闭状态。

Anthropic还透露,其专为高并发和成本敏感的应用而设计的Claude Haiku 5.5,将在未来几周发布。

一、数位开发者实测对比,效果惊艳但烧不起,一款射击游戏花费上千元

不少开发者实测对比了Sonnet 5和Sonnet 5.5,两代模型之间的性能提升幅度肉眼可见。

官方案例,知名开发者@_re_pete对比了Sonnet 5和Sonnet 5.5生成落叶模拟器的效果。可以看出,Sonnet 5.5的落叶飘落效果更自然,整体画面更和谐。


在不到一分钟内,开发者@kevin_t_ngo让Sonnet 5.5通过JavaScript动画展示了恐龙的历史,其还对比了Sonnet 5和Sonnet 5.5的生成结果。Sonnet 5.5生成的动画主题形象明确,还能添加配套文字,生成带叙事感的完整插画。


另一开发者对比了Sonnet 5.5与GPT-6 Sol、GPT-6 Astra的效果,其与GPT-6 Astra的差距并不大。Sonnet 5.5、GPT-6 Astra在生成骑自行车动作时没有出现太大瑕疵。


不过效果惊艳背后,用户实测发现Sonnet 5.5的成本并不低。

BridgeMind使用Sonnet 5.5制作了一款射击游戏,它称新模型表现机器出色,生成的游戏堪称神作,但构建成本要达到177美元(约合人民币1187元),耗时49分钟完成。


在下面开发者制作的城市模拟器案例中,Sonnet 5.5的效果明显比Sonnet 5更好,Sonnet 5.5的输出token数量为38万,花费了9.23美元,Sonnet 5为12万,花费4.85美元。


另一开发者使用Sonnet 5.5制作了一个果酱西瓜浏览器动画,最终预计的API使用成本约为8.20美元,其中代码与推理2.80美元、缓存上下文数据3.6美元、缓存写入操作1.8美元、常规输入token 0.02美元,其中2/3的资源都被用于处理上下文相关任务。


二、多项测试可对标Opus 5.5,Anthropic建议开发者调节档位降成本

从Anthropic发布的基准测试来看,Sonnet 5.5在多项指标中已经超越其性能更高的Opus 5.5模型。

具体来看,该基准测试对比了Sonnet 5.5、Sonnet 5、Opus 5.5、GPT-6 Sol四大模型在智能体编程、知识工作、多学科推理、电脑操作、图表识别等方面的性能。

和上代Sonnet 5对比,Sonnet 5.5在编程、图表识别上的分数提升了数倍;和GPT-6 Sol对比,Sonnet 5.5在智能体编程、知识工作、图表识别上都更优;Sonnet 5.5在主动编程领域上的分数甚至超过Claude Opus 5.5,其他几项与之相当。

下图是各模型在不同投入等级下的得分与单任务成本的对比曲线,数据点越靠近图表左上角,代表每花费一美元所能获得的模型能力越强。


在多项基准测试中,低/中等投入档位下的Sonnet 5.5能超越Sonnet 5的最高得分,而单任务成本仅为后者的约十分之一。 Sonnet 5.5在较低投入档位运行时,单任务成本更低,与Opus 5.5形成互补;拉高投入档位后,它可以达到接近Opus的性能,同时成本处于相近水平。


编程是Sonnet 5.5性能提升的一个突出场景。在智能体编程基准FrontierCode的高投入档位下,它的得分比同档位Sonnet 5高出10分左右,单任务成本仅约后者的1/15。

CursorBench基于Cursor真实编程会话任务开展测试,在该基准上,Sonnet 5.5的最高分与Opus 5.5差距仅约2分。

很多早期测试者称,在直接对比测试中,Sonnet 5.5能够将工具调用合并在一起,从而减少操作步骤、降低成本。

Sonnet 5.5在多项知识工作任务上均取得性能提升。GDPval-AA基准覆盖44个职业、9大行业的真实业务任务,在该测试中,Sonnet 5.5得分与Opus 5.5几乎持平,相比Sonnet 5高出约400分。在电脑操作与图表识别能力上,它的表现也十分接近Opus 5.5;而在长周期知识工作场景,其性能明显优于Sonnet 5和GPT-6 Sol。

价格方面,开发者调整投入档位,可在成本、响应速度与任务整体质量之间做权衡。在Claude Code以及Anthropic官方应用中,默认投入档位为中等(Medium);开发者平台Claude Platform默认档位为高(High)。

Anthropic官方称,档位较低时,Claude响应更快、消耗Token更少,适合常规事务处理;档位调高后,Claude会进行更长时间的推理,并对输出结果做更全面的自检核验。

三、大多数对齐性指标,与Sonnet 5相当

在其自动化行为审计中,Sonnet 5.5在大多数对齐性指标上均优于或达到与Sonnet 5相同的水平。由于其网络安全能力与Opus 5相当,因此它是首个具备网络安全防护措施和回退机制的Sonnet模型。其生物学安全防护机制与Sonnet 5相同。这两种安全防护机制都针对的是少数高风险操作;常规的软件开发和大多数生命科学领域的操作并未受到影响。

Anthropic研究人员在博客中透露,Sonnet 5.5并未突破其模型能力的前沿上限,因此他们将模型的对齐评估,聚焦于一组适用于所有能力等级模型的特定风险,包括损害用户利益、误导用户,以及被用于高风险恶意场景时产生协同危害。

研究人员开展自动化行为审计,在约1850个场景下对Claude进行测试。

结果显示,在对齐性、抗滥用能力与诚实度的大部分指标上,Sonnet 5.5相比Sonnet 5均有提升或持平。 在其新推出的隔离防护评估中,Sonnet 5.5尝试突破沙箱的概率接近本次测试中表现最优的Opus 5.5;并且在所有Anthropic模型里,它去试探容器防护边界的概率最低。他们没有发现Sonnet 5.5会去执行与用户意图相冲突的目标。

网络安全方面,Sonnet 5.5的网络安全相关能力相对Sonnet 5有提升,因此研究人员为其部署了与Opus 5.5相近的安全防护机制。用户仍然可以在常规软件开发流程中,利用模型查找并修复代码漏洞;但高风险网络安全任务会自动降级回Sonnet 5处理。

Sonnet 5.5沿用与Sonnet 5相同的生物相关安全防护机制。该防护体系针对有害请求;绝大多数科研、教育以及临床工作不受影响,但部分微生物学与病毒学相关请求可能出现误拦截。

在模型蒸馏防护方面,Sonnet 5.5是首款内置安全分类器以抵御推理提取攻击的Sonnet系列模型,并扩展了保留思考链路(preserved thinking)机制:Claude的推理思考过程无法脱离生成该内容的账号单独剥离。

此外,Claude Sonnet 5.5版本也提供了不保存任何数据功能的版本。

结语:Claude中端主力模型性能暴涨,但成本是个坎

Sonnet 5.5的升级,标志着Anthropic的主力中端大模型正在快速收窄与旗舰模型之间的能力差距。这或许会改变企业落地大模型的选型思路,不必一味追求最高规格旗舰,可采用主力模型承担绝大多数常规任务、旗舰模型仅处理高难度复杂任务的分层调用架构,在能力与成本之间找到更优平衡点。

不过综合开发者的实测结果来看,Sonnet 5.5在成本端并未实现大幅缩减。一旦面对复杂Agent任务,用户往往需要拉高投入等级来换取足够性能,此时单任务开销会明显抬升。

来源:Anthropic、X

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
雷军把罗福莉升到了小米最高职级!

雷军把罗福莉升到了小米最高职级!

人人都是产品经理社区
2026-09-29 12:08:00
亚运会颁奖台上,林诗栋刚戴上金牌,看台有人嘲讽喊打一单还哄笑

亚运会颁奖台上,林诗栋刚戴上金牌,看台有人嘲讽喊打一单还哄笑

雪饼说
2026-09-29 10:05:33
刘欢的板书写得非常漂亮,字如其人,不张扬又足够洒脱。

刘欢的板书写得非常漂亮,字如其人,不张扬又足够洒脱。

荆楚寰宇文枢
2026-09-28 22:18:07
美国币圈37岁华人女高管暴毙!发完“宁愿拿0美元也不封口”帖子次日死于加州沙漠

美国币圈37岁华人女高管暴毙!发完“宁愿拿0美元也不封口”帖子次日死于加州沙漠

听心堂
2026-09-28 20:12:57
中秋晚会主持翻车!全程不看镜头:观众一眼出戏 是提词器装错了?

中秋晚会主持翻车!全程不看镜头:观众一眼出戏 是提词器装错了?

阿废冷眼观察所
2026-09-28 03:53:04
黄东萍社媒发文求裁判公平对待!圣坛组合已经燃尽,混双逆转夺冠

黄东萍社媒发文求裁判公平对待!圣坛组合已经燃尽,混双逆转夺冠

排球黄金眼
2026-09-29 14:46:56
从3金新秀于子迪,到7金王张展硕!韩媒:中国游泳狂揽30金有奥秘

从3金新秀于子迪,到7金王张展硕!韩媒:中国游泳狂揽30金有奥秘

新杀猪的秀才
2026-09-29 22:26:27
陈羽凡现状:低调生活,50岁胖到认不出,17岁儿子1米8长得像妈

陈羽凡现状:低调生活,50岁胖到认不出,17岁儿子1米8长得像妈

三公子娱乐丫
2025-05-17 17:59:45
四川成都一顾客在Tiffany消费超20万后,承诺的中秋月饼未送反以散装桃酥补偿,顾客发帖吐槽账号被限,Tiffany中国零售团队通过邮件致歉

四川成都一顾客在Tiffany消费超20万后,承诺的中秋月饼未送反以散装桃酥补偿,顾客发帖吐槽账号被限,Tiffany中国零售团队通过邮件致歉

大风新闻
2026-09-29 11:17:10
万万没想到,拿下亚运会冠军的陈妤颉,在日本被折腾到5点才能睡

万万没想到,拿下亚运会冠军的陈妤颉,在日本被折腾到5点才能睡

何蕥室内设计
2026-09-27 15:38:53
北上广居然输了?联合国总部若落户中国,最优城市另有其人

北上广居然输了?联合国总部若落户中国,最优城市另有其人

梦想的现实
2026-09-29 16:56:09
医生强烈提醒:明年开始,70岁以上长者请提前做好这3项生活准备

医生强烈提醒:明年开始,70岁以上长者请提前做好这3项生活准备

荆医生科普
2026-09-29 23:30:06
血赚!皇马捡到绝世名帅!穆里尼奥放弃毕生梦想,铁心回归伯纳乌

血赚!皇马捡到绝世名帅!穆里尼奥放弃毕生梦想,铁心回归伯纳乌

澜归序
2026-09-29 09:21:06
开拓者总裁:去年选中杨瀚森对我们帮助很大,得继续开拓市场

开拓者总裁:去年选中杨瀚森对我们帮助很大,得继续开拓市场

懂球帝
2026-09-29 07:17:12
中日会谈气氛紧张,王毅当面警告日前外相:敢翻案,中日难有未来

中日会谈气氛紧张,王毅当面警告日前外相:敢翻案,中日难有未来

万物知识圈
2026-09-29 11:30:10
陈妤颉:布森在泰国也只能称为小施君豪,因为施君豪更牛

陈妤颉:布森在泰国也只能称为小施君豪,因为施君豪更牛

懂球帝
2026-09-29 23:18:10
中菲发生海上冲突,菲方竟抢先动手,这次损失不小,中方发出警告

中菲发生海上冲突,菲方竟抢先动手,这次损失不小,中方发出警告

叹为观止易
2026-09-27 00:43:02
中国男排3比2逆转韩国!拦网17比10,海宁的账还上了

中国男排3比2逆转韩国!拦网17比10,海宁的账还上了

追梦聊球
2026-09-29 23:15:46
荷兰制裁以色列,引入哈马斯学生,10月7日袭击就是我

荷兰制裁以色列,引入哈马斯学生,10月7日袭击就是我

移光幻影
2026-09-29 10:50:48
想不通啊!港一年硕士可同台考编:三年国内读研是不是吃亏?广东网友发帖追问,引发轩然大波

想不通啊!港一年硕士可同台考编:三年国内读研是不是吃亏?广东网友发帖追问,引发轩然大波

火山詩话
2026-09-29 11:32:37
2026-09-30 00:08:49
智东西 incentive-icons
智东西
智东西,AI产业新媒体,专注报道人工智能的前沿技术发展,和技术应用带来的千行百业产业变革。
12681文章数 117174关注度
往期回顾 全部

科技要闻

82亿美元收购!李飞飞将与苏姿丰并肩做AI

头条要闻

老人在景观桥上被虎头蜂蜇伤离世 家属:无人愿意担责

头条要闻

老人在景观桥上被虎头蜂蜇伤离世 家属:无人愿意担责

体育要闻

石雨豪:亚运金牌与背后的十年

娱乐要闻

赌王四房婚礼,何超琼带三房成员现身

财经要闻

央行调整完善若干货币政策工具

汽车要闻

搭华为乾崑ADS 5/设计风格换新 2027款纵横G700售30.49万起

态度原创

房产
手机
健康
数码
教育

房产要闻

三亚楼市下半场,被一次交付和一座艺术馆讲透了

手机要闻

总分屈居第二 但视频独一档!iPhone18 Pro的视频实力依旧没人能追上

洗脸越勤,痘痘反而越多?

数码要闻

iQOO16发布:国补5499元起 首发2K 165Hz三星珠峰屏

教育要闻

如果只给你 100 天,如何从「哑巴英语」到「谈笑风生」?

无障碍浏览 进入关怀版