网易首页 > 网易号 > 正文 申请入驻

Claude Opus 5.5突袭!68万行代码一天迁完,API价格打8折

0
分享至

梦晨 听雨 发自 凹非寺
量子位 | 公众号QbitAI

Claude最新旗舰Opus 5.5跑分登顶!

在代码、知识工作、计算机操作等多项基准测试中拿下第一的同时,输出速度也比Opus 5快了30%以上



这暂停得好好的前沿,怎么不到两周又被推进了。



那CEO Dario Amodei发表的“放缓前沿”公开信算什么?

算他能发。



这届模型开始拿代码当画笔

目前看到比较新颖的测试是用纯代码生成图像,SVG鹈鹕骑自行车已经被刷爆了,这次是更复杂的Python渲染。



类似的能力可以扩展成用纯js代码生成渲染视频。

多项跑分登顶,API价格打8折

他们说任务成本降4成,但API价格并没有直接打6折

Opus 5.5的输入、输出价格分别是每百万Token 4美元20美元,相比Opus 5下降20%

再加上完成同一任务需要的步骤和Token更少,Anthropic测算,典型任务的总成本可以下降40%



真正下狠手的是缓存读取价。这一项从Opus 5的每百万Token 0.50美元,直接降到0.20美元,砍了60%

做Agent编程的都知道,长对话和大型代码任务需要反复读取上下文,缓存读取经常占据成本的大头。相比账面上的API单价,这一刀可能更有实际体感。

另外还有一个Fast mode,输出速度最高可达标准模式的2.5倍,价格也翻倍至每百万输入Token 8美元、输出Token 40美元,适合对延迟特别敏感的场景。

订阅用户也加量了,Pro、Max、Team和按席位收费的企业版,五小时使用限额都会提高;Anthropic还提供了一次可以暂存、由用户自行选择时间使用的rate limit reset。

具体看跑分,目前最新鲜的榜就是Terminal-Bench 4.0了,衡量模型处理复杂命令行任务的能力。

Opus 5.5拿下66.4%,上一代Opus 5是52.3%,OpenAI的GPT-6 Astra57.9%,Claude自家的Fable 5.155.8%

已经明显拉开差距。



在另一项编程基准FrontierCode v1.1上,Opus 5.5以54.4%超过GPT-6 Astra的53.3%,差距就没那么明显了。

而且推理effort开中档效果反而更好。

Opus 5.5在默认effort,也就是中档设置下,反而跑出了54.6%,超过表中其他模型的最高成绩,也略高于自己开到最高档时的54.4%



到了这个能力水平,0.2个百分点基本已经落在波动范围里。

Anthropic自己也承认,跑分差距越来越难准确反映真实使用体验,他们内部使用时,Opus 5.5和Fable 5.1的差距就没有榜单看起来这么大。

另一项CursorBench 4.0,测的是来自真实Cursor会话的多文件模糊任务。

最高effort下,Opus 5.5拿到57.8%,比Fable 5.1的51.8%6分,比GPT-5.6 Sol41.7%16.1分

如果看性价比,Opus 5.5在默认中档设置下得分52.5%,依然领先GPT-5.6 Sol的最高成绩约11分,单项任务成本只有后者的三分之一左右。

Opus 5.5特别强调在大规模代码库级别的任务上有明显提升。

早期测试者曾用它迁移68万行代码不到一天完成。换成人类工程团队,预计至少需要数周

还有一位测试者用它审计并修复一个20万行代码库,耗时不到3小时。同样的任务,Opus 5花了超过20小时,使用的Token数量还是它的2.5倍



在一项内部测试中,Anthropic让Opus 5.5和Fable 5.1分别将HAProxy从C语言重写成Rust。HAProxy是一款被广泛使用的Web流量负载均衡软件。

两个版本都通过了HAProxy自身几乎全部回归测试,但Opus 5.5只用了9.5小时,Fable 5.1用了12小时,前者的成本低了51%

Anthropic还让模型优化一个Web应用所有页面的加载速度。Opus 5.5在40次测试中成功了39次;Opus 5虽然也缩短了加载时间,但改进幅度更小,还改变了应用原本的行为。



知识工作方面同样值得关注。

在覆盖44个职业的真实工作能力评估GDPval-AA v2.1中,Opus 5.5得分1846 Elo,Fable 5.1是1735,Opus 5是1708

在默认effort设置下,Opus 5.5的得分就超过了GPT-6 Astra在最高effort下的表现,单项任务成本大约只有后者的五分之一

投资公司Walleye Capital反馈,Opus 5.5在最低设置下,就基本完成了他们的量化研究评测任务。

把effort调高后,它还发现评测指令里的分钟索引存在一个off-by-one错误,并主动修正。

模型甚至特意备注:这样处理是正确的,但可能会导致自己被评分器扣分。

Walleye称,此前测试过的所有模型,都没有发现并处理这个问题。

还有个明显变化在于:Opus 5.5说话的方式变了

以前Opus 5虽然也能找到答案,但很快就会钻进代码块、时间线和区间定义里,用户需要自己从大量技术细节中提炼结论。

Opus 5.5会先把最重要的信息摆出来,再解释原因。

官网展示了一个billing系统Bug的对比。Opus 5找到问题后,马上开始解释代码改动和时间区间;Opus 5.5开头就把账算清楚了:

额外减少的9.92美元来自一个Bug,免费层调整只占1.50美元



随后它才说明,究竟是哪次代码重构把每个月最后一天的大部分用量漏掉了。

一位早期测试者的评价是:

It writes the way I do(它写东西的方式跟我一样)。

Anthropic还特意强调,表达清楚不只是文风升级。模型把关键信息放在前面、减少术语和特异性表达,人类检查其结论和操作过程也会更加容易,这本身就是一项安全收益。

和Fable一个级别的笼子

能力往前冲,安全笼子也跟着加厚了。

Opus 5.5是首款同时搭载Fable 5.1同级网络安全、生物安全和反蒸馏护栏的Opus模型。触发相关限制后,系统会透明地回退到其他模型处理。

发布之前,它还接受了METR和Frontier Design两家外部机构的评估。

这也是Anthropic对“放缓前沿”的解释:模型照常研发和发布,但要给安全对齐和外部审查留出时间。

在Anthropic内部覆盖近2000个模拟场景的自动化行为审计中,Opus 5.5在几乎所有失调行为指标上,都拿到了近期Claude模型中的最好成绩。

在一项专门测试模型越过安全边界倾向的新评估中,Opus 5.5尝试规避边界的频率,比Opus 5和Claude Mythos 5.1低了约85%。

仅有的几次尝试也都属于低严重性事件,而且由模型自行上报。

不过Anthropic同时承认,他们观察到Opus 5.5经常怀疑自己正在接受评估

一旦模型知道“这是一场考试”,测试中的表现能否代表真实部署环境,就要打上一个问号。Anthropic称,目前仍然没有办法在发布前可靠地发现所有潜在问题。

在更实际的Agent防护上,Opus 5.5还配备了三层措施。

它会在执行前检查每一个操作;运行环境放在安全团队可以审计的开源沙箱中;代码审查功能则会在代码合并前检查漏洞。



面对提示注入攻击,Opus 5.5在Anthropic测试的编程、工具调用、计算机操作和网页浏览等场景中,都追平或超过了Opus 5。

这么厚的笼子,也和它在高风险领域的能力有关。

在生物学领域,Opus 5.5已经在多个方向追平甚至超过Claude Mythos 5.1,因此使用了与Fable 5.1相同的生物安全护栏。

在与Dyno Therapeutics合作开展的长期分子预测和设计评估中,Opus 5.5取得了进一步提升。参与红队测试的专家认为,其科学新颖性与他们测试过的最强模型相当。

经过审核的学术实验室、初创公司和制药企业,可以通过新推出的Life Sciences Verification Program,申请适用于生物研发工作的更宽松权限。

网络安全也是一样。

由于Opus 5.5的网络安全能力很强,普通用户提交的大多数网络安全任务会被自动转交给Opus 4.8。经过认证的网络安全从业者,则可以通过即将扩展的Cyber Verification Program申请使用Opus 5.5。

反蒸馏措施也直接上到了Fable 5.1的级别。

Opus 5.5搭载了preserved thinking机制,限制API用户编辑Claude此前生成的思考上下文,防止攻击者借此批量提取模型的推理能力。

这项限制适用于2026年8月31日及以后创建的API账户。

与此同时,Opus 5.5不再允许关闭thinking模式,输出文本中也加入了水印

这种水印不会直接显示在文本里,也没有添加隐藏字符。它通过调整模型在多个意思相近的词语之间如何选择,留下可供专用检测工具识别的统计模式,普通读者看不出区别。

OMT:Haiku终于更新了

在Sonnet、Opus和Fable都已经进入5系列之后,Claude家的“小杯”还停留在Haiku 4.5。

这次终于有准信了。



Anthropic宣布,Sonnet 5.5和Haiku 5.5都将在未来几周内推出,同样会获得性能、效率和安全方面的升级。

也就是说,Opus 5.5只是5.5系列的第一款。

OpenAI这边刚刚一口气端出GPT-6 Astra和GPT-5.6 Sol,Anthropic那边紧接着发布Opus 5.5,还预告后面有两款新模型排队。

前沿确实没有停,大家都在忙着踩油门啊~

参考链接:
[1]https://www.anthropic.com/claude-opus-5-5
[2]https://x.com/claudeai/status/2102435511222890900

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
纪委通报5起招投标惊天贪腐案!现在的招投标,靠关系已不现实了

纪委通报5起招投标惊天贪腐案!现在的招投标,靠关系已不现实了

职场资深秘书
2026-09-23 12:35:00
CCTV5直播,中国女篮VS蒙古女篮,宫鲁鸣冲击半决赛,要拿下3连胜

CCTV5直播,中国女篮VS蒙古女篮,宫鲁鸣冲击半决赛,要拿下3连胜

体坛小快灵
2026-09-23 10:32:41
国足0-0送阿联酋回家,亚运头名出线!还有3个好消息,进4强有戏

国足0-0送阿联酋回家,亚运头名出线!还有3个好消息,进4强有戏

球场没跑道
2026-09-23 16:28:32
【油价大降】汽油“刚大降近2000元/吨”,92接近7.1元/升后“涨了起来”,近2月统计“大涨超1.1元”后,明晚24时或“再大涨”!

【油价大降】汽油“刚大降近2000元/吨”,92接近7.1元/升后“涨了起来”,近2月统计“大涨超1.1元”后,明晚24时或“再大涨”!

猪友巴巴
2026-09-23 16:05:53
新华社权威快报|第48届世界技能大赛在上海开幕

新华社权威快报|第48届世界技能大赛在上海开幕

新华社
2026-09-22 21:43:22
网传日本女优高桥来中国仙人跳,与客人钱色交易后又顺走50万日元

网传日本女优高桥来中国仙人跳,与客人钱色交易后又顺走50万日元

雪峰说法
2026-09-15 08:05:03
A股:不必等待了,尾盘传来两个信息,明天,周四或要这样走!

A股:不必等待了,尾盘传来两个信息,明天,周四或要这样走!

明心
2026-09-23 15:50:39
你见过最不讲卫生的女生是怎样的?网友:下回不准描述这么细致了

你见过最不讲卫生的女生是怎样的?网友:下回不准描述这么细致了

另子维爱读史
2026-09-22 18:51:38
熊茂平,新职明确

熊茂平,新职明确

新京报
2026-09-22 23:11:10
审美大退步!新老LOGO你喜欢哪个?

审美大退步!新老LOGO你喜欢哪个?

柚子说球
2026-09-23 14:07:17
哈里伯顿公开致谢詹姆斯!若两人早点联手,25年步行者真能赢雷霆

哈里伯顿公开致谢詹姆斯!若两人早点联手,25年步行者真能赢雷霆

小路看球
2026-09-23 15:29:42
张展硕1分43秒49有多强?跻身200自历史前10,仅4人比他更快

张展硕1分43秒49有多强?跻身200自历史前10,仅4人比他更快

全景体育V
2026-09-23 17:02:08
杨幂在米兰成“洋幂”了?还自曝是一时兴起的DIY

杨幂在米兰成“洋幂”了?还自曝是一时兴起的DIY

木子爱娱乐大号
2026-09-23 15:30:25
太惨了!上门取件闹出人命:母亲提议五楼扔退货包裹,15岁女儿不幸坠亡,法院判快递公司担责三成,舆论彻底沸腾

太惨了!上门取件闹出人命:母亲提议五楼扔退货包裹,15岁女儿不幸坠亡,法院判快递公司担责三成,舆论彻底沸腾

火山詩话
2026-09-22 17:43:18
杀疯了!上市首日大涨856%,今天30CM跌停想跑都跑不掉,追高的股民全懵了!

杀疯了!上市首日大涨856%,今天30CM跌停想跑都跑不掉,追高的股民全懵了!

趋势清风侠
2026-09-23 13:50:58
战胜心魔,唐钱婷亚运会女子100米蛙泳突破,为中国队拿回金牌

战胜心魔,唐钱婷亚运会女子100米蛙泳突破,为中国队拿回金牌

体娱一家亲
2026-09-23 17:08:01
造势无用?金球奖最新获奖概率:姆巴佩、亚马尔相加大幅落后凯恩

造势无用?金球奖最新获奖概率:姆巴佩、亚马尔相加大幅落后凯恩

体育世界
2026-09-23 13:20:12
亚运会乒乓球:世界亚军出局!1:3早田希娜,张本美和3:0锁定奖牌

亚运会乒乓球:世界亚军出局!1:3早田希娜,张本美和3:0锁定奖牌

独步天涯
2026-09-23 11:37:49
郭士强选人用人内幕被扒:周琦没参加夏训被拒,林葳没听清喊话被送走,徐杰也被拒

郭士强选人用人内幕被扒:周琦没参加夏训被拒,林葳没听清喊话被送走,徐杰也被拒

萌兰聊个球
2026-09-23 07:24:54
3-0大胜!国乒女团半决赛战朝鲜!孙颖莎丢局,王曼昱回暖,蒯曼狂轰11-1

3-0大胜!国乒女团半决赛战朝鲜!孙颖莎丢局,王曼昱回暖,蒯曼狂轰11-1

好乒乓
2026-09-22 23:27:29
2026-09-23 18:07:00
量子位 incentive-icons
量子位
追踪人工智能动态
13387文章数 176570关注度
往期回顾 全部

科技要闻

2026网易未来大会下午:AI走进现实

头条要闻

中国U23亚运会小组头名出线 八强战或避开日本

头条要闻

中国U23亚运会小组头名出线 八强战或避开日本

体育要闻

300万英镑,他们买下了一位队史传奇

娱乐要闻

王玉雯杨玏被曝结婚又离 荒唐一幕出现

财经要闻

全市场都在卷自营

汽车要闻

5.1米的启境GX7,底盘凭什么又稳又舒服?

态度原创

艺术
手机
本地
公开课
军事航空

艺术要闻

穿浴衣的女子,日本写实画家新作

手机要闻

共研旗舰手机新体验,搭载天玑9600 Pro的OPPO Find X10 Pro Max

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

韩国最新型潜艇首次披露

无障碍浏览 进入关怀版