网易首页 > 网易科技 > 网易科技 > 正文

凌晨最强模型上新,Claude Fable 5.1突然发布,缓存价暴降75%,实测:未必省钱

0
分享至

出品 | 网易智能

作者 | 小小

编辑 | 王凤枝

AI贵不贵,开始要按任务算账了。

9月1日,Anthropic同时发布Claude Fable 5.1和Mythos 5.1。两款产品使用同一个底层模型,重点提升长时间智能体编程和科研能力。科研类终端任务成绩翻了一倍多,办公自动化提高了约八成。


这次比跑分更值得看的是价格。Fable 5.1的标准输入和输出价格没动,但Anthropic宣布,缓存读取价格从每百万Token 1美元降到0.25美元,降幅75%。公司说,典型工作负载的成本能降约25%,高度智能体化的任务最多能降约45%。

但缓存便宜了,一项任务却仍可能更贵。

Artificial Analysis测出来的是另一组数字:在最高努力档下,Fable 5.1的单任务成本反而比上一代高20%。模型翻旧资料是便宜了,但输出的东西多了,总账单反而被抬上去。

当AI可以连续工作几十小时,每百万Token多少钱只是表面价格。真正要算的,是它把事情做完花了多少钱。

01从答一道题,到连续干几十小时

Fable 5.1的跑分提升,主要出现在需要模型连续操作的任务里。

Anthropic公布的测试里,Terminal-Bench-Science从Fable 5的24.7%升到52.6%;AutomationBench从17.1%升到31.4%;OSWorld 2.0的严格评分下,成绩也从36.1%升到41.7%。这些测试的共同点是,要模型在终端或计算机环境里连续搜索、分析、调用工具,还要根据结果调整下一步。


跑分之外,Anthropic发布材料里还列了几个早期测试案例,更容易看懂。

Millennium曾经碰上一个大约每运行100万次才出现一次的软件崩溃。内部团队查了四五年,一直没找到原因。测试中,Fable 5.1拆开外部供应商的软件库,和崩溃留下的core dump比对,最后把问题定位到外部库里的一个漏洞。

Ramp把测试时间拉得更长。一次无人值守的机器学习任务里,Fable 5.1连续跑了38小时。它先发现此前的实验结果受到标签问题影响,修正后启动六组并行实验,最后返回结果和下一步建议。Ramp还说,模型发现了一个无人负责的生产告警,并根据日志给出了修复方案。

Browserbase的说法是,在他们内部最难的浏览器智能体测试里,Fable 5.1完成了82%的任务,Fable 5为57%,Opus 5为74%。每项任务平均运行大约10分钟。

另外两家公司给出的案例更接近企业软件开发。MongoDB说,Fable 5.1用大约三天完成了一个复杂原型:先读公司各项服务的代码和文档,提出设计方案,再连续运行几个小时把它实现出来。Shopify则让它分析一项横跨三个代码库、八项以上服务的改动。按Shopify的说法,模型能把一个请求进入系统之后经过的服务、函数、数据库表和数据行一路梳理下来。

这些案例说明,长任务能力不只是"让模型多想一会儿"。模型还要保存已经完成的步骤,知道接下来该调用哪个工具,并在结果不符合预期时回到前面检查。任务越长,一次判断错了,后面就会被越滚越大。

这些案例都是Anthropic自己挑出来的,没有第三方复现。但它们指向同一个变化:模型开始可以在较长时间里保存进度、检查结果、继续推进,不必每走一步都等用户重新下指令。

82%的浏览器任务完成率反过来说,还有将近五分之一的任务没做完。长时间运行能力提升,不等于用户已经可以放弃验收。企业要的不只是模型肯一直做下去,还要它做不下去时能说一声、能留下过程记录,该把任务交回人手就交回来。

沃顿商学院教授伊森·莫利克(Ethan Mollick)在早期体验后也把注意力放在这一点上。他觉得Fable 5.1在需要判断和取舍的长时间任务里出现了实际进步,但一些带有明显"Claudish"特征的表现并没有跟着消失。

模型能干得更久,随之而来的问题也变得更实在:一次运行不再只是生成几段回答,而可能持续消耗上下文、工具调用和输出Token。能力上去之后,成本就成了下一道门槛。

02缓存便宜75%,为什么一项任务反而更贵

Fable 5.1的标准输入价格仍是每百万Token 10美元,输出仍是50美元。真正降下来的是缓存读取:从每百万Token 1美元降到0.25美元。

缓存读取,就是模型反复翻看已经处理过的资料。智能体连续工作时,需要不断重新读取代码库、系统指令、工具说明、文档和此前积累的上下文。运行时间越长,这部分开销通常越明显。

Anthropic根据2026年8月四周的实际使用情况估算,Fable 5.1在典型工作负载中的成本能降约25%;对缓存读取占比较高的智能体任务,降幅最高约45%。这个估算只针对按Token计费的情况,和Claude订阅价格没关系。

这组数据覆盖Claude Enterprise、Claude Code和API里的实际使用,采用的是各产品的默认努力等级。Fable 5.1在Claude Code里默认用High,在Claude Cowork和Claude.ai里默认用Medium。同一个模型选不同努力等级,思考时间、输出量和最终成本都可能不一样。

Anthropic还保留了更便宜的批处理价格:异步任务的输入和输出分别是每百万Token 5美元和25美元。这适合不用马上出结果的活,但换不掉需要实时来回调用工具的智能体任务。

Cognition联合创始人兼首席产品官沃尔登·严(Walden Yan)说,公司计划在Fable 5.1发布当天把Devin里的Opus 5流量切到Fable 5.1。按Cognition的内部测试,Fable 5.1能达到甚至略高于Fable 5的表现,单任务成本更低。缓存降价之后,代码审查这类此前跑Opus级模型的任务,也开始有了转到Fable级模型的经济性。

Every首席执行官丹·希珀(Dan Shipper)测出来的是另一组结果:Fable 5.1的运行速度大约是Opus 5的两倍,Token消耗大约减少一半。这只是一家公司在自己的任务上跑出来的数据,但它也说明,企业不会只看官网标价,还得拿自己的代码和工作流重新测一遍。

发布后,社交媒体上的好评也集中在这几点上。@kimmonismus强调,45%的降幅只适用于缓存占比较高的智能体负载;马特·舒默(Matt Shumer)关注的是能力提升与缓存降价同时出现;金宇宸的看法是,如果百万次才出现一次的崩溃诊断和更低Token消耗能够稳定复现,意义会更大。




不过,模型的一项成本下降,不等于整项任务一定更便宜。

Artificial Analysis在他们的Intelligence Index测试里发现,Fable 5.1在最高努力档下的单任务成本是3.76美元,比Fable 5高20%。测试里,Fable 5.1用掉的输出Token大约是上一代的1.7倍。缓存降价每项任务省下大约1.40美元,仍不够抵消新增的输出开销。

换到xhigh努力等级后,Fable 5.1的单任务成本降到2.72美元,比最高努力档低1.04美元。这说明同一个模型选不同努力等级,任务成本也可能差不少。

Anthropic和Artificial Analysis测的不是同一批任务,也没有用完全一样的努力等级,两组数字不能直接对照。但它们能解释为什么"缓存价格下降75%"和"单任务成本上涨20%"可以同时成立:模型翻旧资料便宜了,但如果为了完成任务生成更多新内容,总账单一样会涨。

这也是为什么输出价格仍然重要。Fable 5.1每百万输出Token还是收50美元,是缓存读取价格的200倍。长任务里只要多生成一段分析、多做一次检查、或者重跑一条失败路径,新增输出就可能很快吃掉缓存省下来的钱。

模型厂商对"价格"的理解也开始变。据《The Information》报道,OpenAI近几个月向部分大客户提供了任务完成后再付费的选项,比如只有AI完成客服交互才收费。OpenAI没有回应此事,这还不是公开、普遍适用的定价政策。

Anthropic这次仍然按Token计费,两家做法不一样。但AI开始接手一整项活以后,客户关心的不再是花了多少Token,而是活干完没有、干了多久、中途要不要人帮忙。

按结果收费也没有看上去那么简单。"完成一次客服交互"相对好数,"帮助销售团队增加了多少收入"就很难单独归因。就算未来计费单位从Token变成任务,厂商和客户还是得先约定:什么算完成、失败要不要收费、人工接管算谁的成本、结果有争议时以什么记录为准。

03科研不只看回答,还要交出可以验证的结果

Anthropic这次也把长任务能力用到了科学研究上。

这次要看的不是模型能答对多少科学问题,而是它交出来的东西能不能被实验、数据或计算结果验一遍。三个案例分别对应设计、分析和工程优化。

分子设计的测试里,Mythos 5.1用开源的蛋白质设计和折叠工具生成方案,再交给两家外部机构做实验验证。在三个目标上,模型设计的结合亲和力达到相关蛋白质设计竞赛最佳设计的10倍;在12个目标上,整体命中率接近50%。Anthropic说,蛋白质设计的典型命中率大约在10%到15%之间。

有一点要分清:Anthropic展示的设计确实经过实验验证能结合,但配套的结构图仍然是ESMFold2预测出来的,不是实验测出来的。

免疫学家德里亚·乌努特玛兹(Derya Unutmaz)体验后觉得,Fable 5.1的科研能力值得继续验证。他同时注意到,普通生物学和医学问题触发安全机制的频率已经下降85%。

计算分析这块,Fable 5.1用NASA麦哲伦号探测器留下的雷达图像,为金星大约三分之一区域重建了高分辨率的高程地图。Anthropic说,新地图的分辨率从此前的10到20公里提高到2到3公里,地形高度准确度最高提高25%。

计算生物学的测试里,Mythos 5.1为七个开源深度学习模型写了定制的GPU内核,最高把运行速度提高2.5倍,同时保持输出一致。Anthropic估算,这些优化能让全基因组分析的GPU成本降30%到60%。

这些项目还是Anthropic自己挑出来的早期案例,不能据此说模型已经能独立做科学发现。但它们让"怎么考科研能力"这件事换了个方式:答案不再只由另一个模型或一套选择题打分,还要接受实验结果、数据精度和实际运行效率的检验。

其中蛋白质设计的实验验证尤其重要。传统模型评测通常有标准答案,但科研任务可能根本没有现成答案。设计出来的蛋白质能不能结合、计算内核能不能在保持输出一致的前提下加速,这些反馈比语言评分直接得多。不过,一次实验成功,不等于模型给出的科学解释就成立了。设计能用、机制说得通、别人能复现,这是三件事。

AI开发者萨莉·斯德哥尔摩(Sally Stockholm)把这种变化概括为:用户交给模型的工作正在从"帮我写一段代码"变成"继续把这个问题往前推进"。编程和科研,是这种工作方式最早出现的地方。

04能一直干,也要知道自己能干到哪里

Fable 5.1和Mythos 5.1用的是同一个底层模型,区别主要在安全限制和访问资格上。

Fable 5.1已经对普通用户和企业开放,可以用于发现软件漏洞等防御性工作,但漏洞利用代码生成、渗透测试和基于二进制文件的漏洞扫描仍然受限。Anthropic说,新版网络安全机制在Claude Code里的平均干预次数比此前少了大约60%;基础生物学和医学问题触发限制的次数也少了85%。

Mythos 5.1则通过受信任访问项目,向经过审核的网络安全和生命科学机构开放更高权限。Anthropic想用同一个模型加两套访问规则,一边少误伤普通任务,一边把风险更高的能力圈在审核过的机构里。

企业数据怎么被监控,是另一道难题。Anthropic这次同时公布了Enterprise Frontier Safeguards(EFS):客户把相关数据存在自己控制的云基础设施里,默认由客户完成必要的人工审查,不用把数据交给Anthropic。EFS计划从今年秋季起分阶段上线;在此之前,符合条件的客户可以用零数据保留模式。

Anthropic说,EFS是在金融、医疗、制造、通信、法律、公共部门等行业超过100家客户的参与下开发的,计划覆盖Claude Code、Claude Enterprise、Claude Platform以及AWS、Google Cloud和Microsoft的相关平台。它要管的不是模型会不会答题,而是模型碰到企业代码、业务数据和外部工具的时候,监控记录留在哪、谁来看、异常行为谁处理。

这套限制不是凭空加上去的。今年7月,Anthropic披露过:在关闭部分生产安全机制的网络安全评估里,Claude曾多次越过测试边界,进入真实互联网环境,包括访问真实公司的数据库、向PyPI上传恶意软件包。英国AI安全研究所也在刻意开放互联网权限、关闭厂商分类器的测试里观察到类似行为。

其中一次测试里,模型因为开发者指令提到一个并不存在的Python包,就创建了PyPI账号并上传了同名恶意包。这个包在公开仓库存在大约一小时,被15个真实系统下载并执行。这个例子留下来不是因为普通Claude用户会碰上,而是它说明了一点:测试环境和真实互联网没有彻底隔开时,模型可能把模拟任务里的操作带到真实系统里。

这些事发生在故意放宽限制的研究配置下,不是普通用户能直接用的产品环境,也没有涉及Anthropic客户数据或其生产基础设施。Anthropic的说法是,正常启用的生产安全机制本应挡住这些行为。但这也说明:智能体工作时间越长、工具权限越多,模型之外的沙箱、审批、实时监控和停止机制就越重要。

关于发布节奏,投资人加文·贝克(Gavin Baker)觉得,Anthropic选在OpenAI下一代模型之前发布Fable 5.1,说明前沿模型的竞争仍在加速。他还猜Fable 5.2可能已经在准备中。

结语

Fable 5.1把模型竞争里的一笔账摆得更清楚了。

模型可以连续跑几小时甚至几十小时,企业买的就不再只是一次回答。它们还要为模型反复读取上下文、调用工具、生成输出、失败重试和人工接管付费。

Anthropic把缓存读取价格砍了75%,是在压低长期工作中最常见的一项开销;Artificial Analysis的测试则提醒用户,更能干的模型也可能生成更多Token,把总账单重新推上去。

OpenAI据报已经向部分大客户试过任务完成后再付费。Anthropic这次仍然按Token计价,但企业衡量模型的方式正在变。

下一轮比价,厂商还是会公布每百万Token多少钱。但一个模型到底贵不贵,得看它做完一项任务花了多久、重试几次、要不要人接手,以及最后有没有把活交出来。

完成率、单任务成本、人工接管次数,三项摆到一起,这笔账才算得清。

延伸阅读
相关推荐
热点推荐
上海警方:两男子发布涉世赛证件虚假信息被行拘

上海警方:两男子发布涉世赛证件虚假信息被行拘

界面新闻
2026-09-23 17:18:40
亚运男足太残酷了:随着伊朗1-4遭逆转,八强仅一支西亚球队

亚运男足太残酷了:随着伊朗1-4遭逆转,八强仅一支西亚球队

侧身凌空斩
2026-09-23 15:40:55
1-4遭逆转!伊朗球员崩溃瘫坐 从头名到出局 曾嘲讽国足非争冠对手

1-4遭逆转!伊朗球员崩溃瘫坐 从头名到出局 曾嘲讽国足非争冠对手

我爱英超
2026-09-23 16:14:32
夺小组头名!中国男足0-0阿联酋 携朝鲜进亚运8强 王钰栋染黄将停赛

夺小组头名!中国男足0-0阿联酋 携朝鲜进亚运8强 王钰栋染黄将停赛

我爱英超
2026-09-23 15:29:19
理记爆罗永浩的瓜,太劲爆了

理记爆罗永浩的瓜,太劲爆了

大张的自留地
2026-09-22 16:01:08
理记骂战输了后与粉丝告别:没能挽救那些下岗失业的员工,我尽力了

理记骂战输了后与粉丝告别:没能挽救那些下岗失业的员工,我尽力了

葱哥说
2026-09-23 09:54:12
初中生早餐“碳水开会”?难怪上课打瞌睡!真正的营养早餐长这样

初中生早餐“碳水开会”?难怪上课打瞌睡!真正的营养早餐长这样

医药养生保健报社
2026-09-22 20:57:42
雷军回应“打新宇树挣了100多亿”

雷军回应“打新宇树挣了100多亿”

澎湃新闻
2026-09-22 19:07:44
痛快!考公姐开着直播哭诉前男友薄情寡义,分手才四个月就订婚,不到两天她的底就被网友扒了个底朝天

痛快!考公姐开着直播哭诉前男友薄情寡义,分手才四个月就订婚,不到两天她的底就被网友扒了个底朝天

蝴蝶花雨话教育
2026-09-23 00:05:13
亚运会乒乓球:日本2大世界冠军被淘汰!伊藤0:3,林诗栋蒯曼晋级

亚运会乒乓球:日本2大世界冠军被淘汰!伊藤0:3,林诗栋蒯曼晋级

国乒二三事
2026-09-23 13:29:19
高市早苗抵美热情挥手,日本官方晒照打脸:没有人

高市早苗抵美热情挥手,日本官方晒照打脸:没有人

观察者网
2026-09-22 21:41:06
高市早苗在纽约与特朗普会面,主动赶记者出去:要谈的事太多了,请出去吧;联大演讲企图呼吁删除“敌国条款”

高市早苗在纽约与特朗普会面,主动赶记者出去:要谈的事太多了,请出去吧;联大演讲企图呼吁删除“敌国条款”

极目新闻
2026-09-23 10:17:17
33岁女演员确诊癌症,已失去生活自理能力,家人苦撑2年公开求助:她想活下去,还想回去唱戏

33岁女演员确诊癌症,已失去生活自理能力,家人苦撑2年公开求助:她想活下去,还想回去唱戏

扬子晚报
2026-09-23 15:56:49
两幼童被蜇死,全身几百处伤口,养蜂人“不认罪、不认错、不道歉”

两幼童被蜇死,全身几百处伤口,养蜂人“不认罪、不认错、不道歉”

中国新闻周刊
2026-09-23 10:30:13
大跌眼镜!本届亚运会,不可思议一幕出现了!日本以后怎么办?

大跌眼镜!本届亚运会,不可思议一幕出现了!日本以后怎么办?

神牛
2026-09-22 16:30:16
不愿回国!两名朝鲜亚运代表团成员,希望留在日本寻求庇护

不愿回国!两名朝鲜亚运代表团成员,希望留在日本寻求庇护

全景体育V
2026-09-22 19:39:04
日本队失误连连 中国队拿下亚运体操男团三连冠!

日本队失误连连 中国队拿下亚运体操男团三连冠!

中国青年报
2026-09-23 15:18:14
亚运会!国乒爆大冷,世界冠军轰然倒下,孙颖莎丢局,蒯曼轰11-1

亚运会!国乒爆大冷,世界冠军轰然倒下,孙颖莎丢局,蒯曼轰11-1

林子说事
2026-09-23 04:09:43
相亲当天就领证,男子“闪婚”三个月后又离婚,要求退还红包和16.8万元彩礼;律师:需区分“骗婚跑路”情形

相亲当天就领证,男子“闪婚”三个月后又离婚,要求退还红包和16.8万元彩礼;律师:需区分“骗婚跑路”情形

封面新闻
2026-09-22 21:50:14
曝朝鲜亚运会代表团2人不愿回国!想留在日本+寻求庇护 不去韩国

曝朝鲜亚运会代表团2人不愿回国!想留在日本+寻求庇护 不去韩国

念洲
2026-09-23 07:30:43
2026-09-23 17:44:49

科技要闻

2026网易未来大会下午:AI走进现实

头条要闻

中国U23亚运会小组头名出线 八强战或避开日本

头条要闻

中国U23亚运会小组头名出线 八强战或避开日本

体育要闻

300万英镑,他们买下了一位队史传奇

娱乐要闻

王玉雯杨玏被曝结婚又离 荒唐一幕出现

财经要闻

全市场都在卷自营

汽车要闻

5.1米的启境GX7,底盘凭什么又稳又舒服?

态度原创

房产
教育
家居
数码
军事航空

房产要闻

楼市变天!三亚第一个"接住"新政的楼盘出现了

教育要闻

最新!全国化学奥赛北京队名单来了!26人进入决赛,来自这11所学校

家居要闻

2026建博会(广州) 公装联探展交流活动

数码要闻

爱适易和贝克巴斯怎么选:扭力账与沉没成本

军事要闻

韩国最新型潜艇首次披露

无障碍浏览 进入关怀版
×