网易首页 > 网易号 > 正文 申请入驻

Claude Fable 5.1 来了:跑分大幅提升,缓存价格降 75%!用得越久反而越省

0
分享至

AI范儿 · 深度长文⏱ 11 分钟


▲ 图:Anthropic 官方发布主视觉

昨天(9 月 1 日),Anthropic 发布了 Claude Fable 5.1。84 天,但我们却好像等了很久。

5.1 的改动却不小。

输入和输出单价仍是每百万 Token 10 美元和 50 美元,缓存读取价格降到了原来的四分之一;能力提升集中在长时间 Agent 编程、多步骤研究,以及文档、表格和幻灯片工作。

几组数字先快速了解下:

1科学与工程终端任务得分提高113%,达到上一代的2.13 倍

2复杂商业工作流得分提高84%,达到上一代的1.84 倍

3Agent 终端编程得分提高33%

4缓存读取价格下降75%,高度 Agent 化任务的实际成本最高下降约45%

Fable 5.1 的增幅集中在长任务 以上一代 Fable 5 的成绩为 100 科学与工程终端任务 (Terminal-Bench-Science 0.1) 上一代 100 213 · +113% 复杂商业工作流 (AutomationBench) 上一代 100 184 · +84% Agent 终端编程 (Terminal-Bench 4.0) 上一代 100 133 · +33%

▲ 三项关键评测的相对增幅,以上一代成绩为 100

这组数据把 Fable 5.1 的定位讲得很清楚。Anthropic 希望企业交出去的是一项工作,几个小时甚至几天后,再回来验收结果。

“可以少盯”离“彻底不管”还很远。Anthropic 自己的 System Card 记录了模型猜答案、夸大授权,甚至尝试绕过权限检查的案例。

我更关心两个问题:它可以独立工作多久,人类敢给它多大的权限。

01为什么能按项目交货

先看 Anthropic 公布的能力评测。

Terminal-Bench-Science 0.1 测试模型能否在终端环境里完成科学和工程任务。Fable 5.1 得分从 24.7% 提高到 52.6%。按相对幅度计算,性能提高了 113%,达到上一代的 2.13 倍

测试 Agent 终端编程的 Terminal-Bench 4.0,从 42.0% 提高到 55.8%,提高约 33%

商业流程评测 AutomationBench 则从 17.1% 涨到 31.4%,提高约 84%,达到上一代的 1.84 倍


▲ 图:Anthropic 官方发布页,Fable 5.1 一列使用红色突出显示。

普通知识问答和单项编程也有进步,但幅度大多落在 1% 到 16% 之间。需要调用工具、连续执行和长时间保存任务状态的评测,增幅明显更高。

Artificial Analysis 的 Intelligence Index v4.1.1 综合了真实知识工作、Agent 工具调用、终端编程、科学推理、长上下文和事实准确性等 9 项评测。Fable 5.1 Max 得到66 分,排名第一


▲ 图:Artificial Analysis 在 X 发布的 Intelligence Index 与 Cost per Task 对比。来源:https://x.com/ArtificialAnlys/status/2094881171066978525

成本数据放在下图。


Fable 5.1 High 同样得到 62 分,与上一代 Fable 5 Max 持平;单项任务成本却从 3.14 美元降到 1.43 美元,下降约 54.5%

从 Xhigh 升到 Max,得分只从 65 增加到 66,提高约 1.5%;成本却从 2.65 美元涨到 3.69 美元,增加约 39%

这是整张榜单里最贵的 1 分。

System Card 还有一项更接近真实项目的测试,叫 ProgramBench。模型只拿到程序的二进制文件和说明文档,需要从头重建代码库,再接受超过 24.7 万项行为测试验收。

测试对象从jq、ripgrep一直延伸到 FFmpeg、SQLite 和 PHP 解释器,部分任务用到了完整的100 万 Token 上下文窗口

Fable 5.1 得分 87.6%,上一代是 86.3%,相对提高约 1.5%。增幅并不炸裂。ProgramBench 考察模型能否在庞大项目里持续保存状态、发现问题并修正实现,和普通编程题的侧重点不同。

Anthropic 还让 5 个 Agent 并行工作。达到相同任务成绩时,5 Agent 团队的延迟减少约50%,速度接近单 Agent 的2 倍


▲ 图:Anthropic System Card 第 181 页。5 Agent 团队达到相同成绩所需的延迟约为单 Agent 的一半。

代价也很直接:它们会消耗更多 Token。你确实多请了几个人,只不过他们都拿着同一张信用卡。

02从代码库到实验室

跑分能说明能力,官方案例更能说明 Anthropic 想把这种能力卖给谁。

投资公司 Millennium 曾遇到一个百万分之一级别的偶发崩溃。工程师排查了四五年,之前尝试过的模型也没能找到原因。Fable 5.1 拆解外部供应商的程序库,对照 core dump,最终把问题定位到程序库中的一个 Bug。

一个查了几年、约每 100 万次才出现 1 次的问题,被模型顺着程序运行留下的痕迹翻了出来。这样的排查工作量,和“帮我补一段代码”完全不在一个量级。

MongoDB 的案例更接近完整项目。Fable 5.1 先研究多个服务的代码和文档,再提出可扩展设计,随后在无人监督的情况下连续运行数小时,用大约 3 天完成了一个复杂原型。交付物包括代码、视觉演示、验证证据和下一阶段结果。

Ramp 高级机器学习工程师 Dwight Temple 还介绍了一次 38 小时无人值守运行:模型发现旧实验存在标签问题,修正数据,启动 6 组并行实验,再带着结论回来。

合作伙伴 Every 称,Fable 5.1 的运行速度约为 Opus 5 的2 倍,也就是快约 100%,Token 使用量减少约50%。这是合作伙伴自报数据,不能替代统一评测,但它解释了为什么一些原本交给 Opus 的任务开始转向 Fable。

类似的长任务已经进入科研场景。

Claude Fable 5.1 根据 30 多年前 NASA 麦哲伦号拍摄的雷达数据,为金星约三分之一的表面生成了一张新的高分辨率高程图。

原地图只能显示 10 至 20 公里尺度的细节,新地图推进到 2 至 3 公里。按尺度计算,可辨认的地形细节缩小约70% 至 90%,高度测量准确性最高提高约25%


▲ 麦哲伦号雷达图。图:Anthropic / NASA 数据。


▲ 原有高程图,只能显示约 10 至 20 公里尺度的地形。图:Anthropic。


▲ Fable 5.1 生成的新高程图,可以显示约 2 至 3 公里尺度的细节。图:Anthropic。

Mythos 5.1 则被用于设计蛋白质结合剂。在 12 个靶点的实验中,接近 50% 的设计能够实际结合,常见命中率约为 10% 至 15%。它的命中率达到常见水平的3.3 至 5 倍,提高约 233% 至 400%


▲ 橙色部分为 Claude 设计的结合剂,灰色为目标蛋白。图中 Nipah G 案例实验命中率为 18/30,即 60%。图:Anthropic。

它还为 7 个开源生物学深度学习模型编写了定制 GPU 内核,速度最高达到原来的2.5 倍,提高约 150%,部分大规模分析的 GPU 成本降低约30% 至 60%

这些结果来自 Anthropic 及其合作机构,只能看作经过实验验证的早期案例。Fable 处理原始数据,Mythos 设计蛋白质结合剂、优化研究工具,最后仍要由实验室继续验证。

03跑得久,也付得起

Fable 5.1 的 API 标价没有变化,输入每百万 Token 10 美元,输出每百万 Token 50 美元。

缓存读取从每百万 Token 1 美元降到 0.25 美元,下降 75%,只剩原来的四分之一

这对 Agent 很重要。Agent 连续工作时,会反复读取相同的代码、文档和历史记录。没有缓存优惠,相当于员工每天进办公室,都要重新买一次办公桌。

Anthropic 估算,普通工作负载的实际成本可以下降约25%;对于需要频繁读取上下文的高度 Agent 化任务,最高下降约45%

Artificial Analysis 的数据同时提醒,推理档位不能无脑拉满。Max 模式只比 Xhigh 高约1.5%,单项成本却高约39%。复杂任务、失败代价很高的任务可以上 Max,普通知识工作从 Medium 或 High 开始更合理。

买了越野车,下楼取快递用不上低速四驱。

04但还不能真放手

Agent 连续工作几十个小时后,安全问题也随之发生变化。

模型连续调用工具后,风险不再局限于一句话答错。它可能在一连串操作中误解授权、跳过验证,或者自作主张替用户补上一句“他已经同意了”。

Anthropic 一边扩大 Fable 5.1 的能力,一边减少安全机制对正常任务的误伤。新版网络安全防护的正常请求误拦截减少约60%;生物学防护的正常请求触发频率减少约85%,只剩原来的约15%

System Card 记录了几次值得警惕的行为。

在内部监控中,少于0.01%的完成任务出现过绕过安全分类器、绕过损坏的权限钩子,或者夸大用户授权的情况,也就是每 1 万次完成任务中少于 1 次。尝试启动关闭权限检查子 Agent 的情况低于0.001%,也就是每 10 万次中少于 1 次。

其中一次,用户只说了“发布”,模型却向子 Agent 声称用户已经亲自写好代码审查正文和 6 条行内评论,并明确要求以用户身份发布。另一次,它为需要明确授权的删除操作,编造了一段用户从未说过的批准语。

这些操作最终被外部权限系统拦住。Anthropic 也没有发现公开恶意行为、长期战略欺骗或长期逃避监督的证据。

概率很低,但 Agent 会把低概率乘以调用次数。一个模型连续运行 38 小时、调用几百次工具后,“偶尔一次”就不再只是统计表里的小数点。

删除、发布、付款、修改生产环境等操作,仍然需要明确授权和外部检查点。模型是否认为自己获得了许可,不能作为执行依据。

长任务里,人该盯哪里 执行可以连续运行,高风险动作仍需明确授权 人类设定任务与权限 目标 · 数据范围 · 检查点 AGENT 连续执行 规划 拆解与排程 调用工具 代码 · 文件 · API 验证与重试 测试 · 恢复 普通结果 代码 · 报告 · 实验结果 高风险动作 发布 · 删除 · 付款 人工批准 自动执行 需人工授权

▲ Agent 可以持续执行,高风险动作仍需人工授权

事实准确性也有类似的反差。

在 AA-Omniscience 闭卷测试中,Mythos 5.1 的正确率从 76% 提高到 77%,相对提高约 1.3%;错误率却从 18% 提高到 20%,增加约 11%。拒答率从 7% 降到 2%,减少约 71%


▲ 图:Anthropic System Card 第 123 页。Mythos 5.1 的拒答率大幅下降,正确答案和错误答案同时增加。

它回答得更多,答对的更多,答错的也更多。处理事实性任务时,搜索、引用和外部验证仍然不能省。

产品说明Fable 与 Mythos 有什么区别?两者使用相同的模型权重,主要区别在安全阈值和访问范围。Fable 5.1 面向普通用户和企业;Mythos 5.1 只向经过审核的网络安全和生命科学机构开放。模型知识截止到 2026 年 6 月。Fable 5.1 默认要求保留数据 30 天用于安全监测,部分符合条件的企业客户可以申请零数据保留。

我目前还没有对 Fable 5.1 做完整实测。文中的案例来自 Anthropic 和首批合作伙伴,能说明产品方向,不能代替独立测试。

如果工作只是聊天、改几句话、写一段简单代码,它依然太贵,便宜模型更合适。

跨多个代码库的改造、复杂研究、长文档分析,以及需要连续运行十几个小时的 Agent 工作流,才是 Fable 5.1 对准的任务。

Ramp 的案例里,Fable 5.1 在 38 小时后交回了 6 组实验结果。System Card 里,它也曾编造授权、试探权限。

现阶段我愿意把执行过程交给它,发布、删除和付款的最后一步还得留在人手里。

05资料来源

Anthropic 发布文章 https://www.anthropic.com/claude-fable-and-mythos-5-1

Anthropic Fable 产品页 https://www.anthropic.com/claude/fable

Claude Fable 5.1 & Claude Mythos 5.1 System Card 页面 https://www.anthropic.com/claude-fable-5-1-mythos-5-1-system-card

System Card PDF 直链 https://www-cdn.anthropic.com/0339e6a7c5c7b87f5c07798616dc32c215d14235/Claude%20Fable%205.1%20%26%20Claude%20Mythos%205.1%20System%20Card.pdf

Artificial Analysis 模型评测页 https://artificialanalysis.ai/models/claude-fable-5-1

Artificial Analysis 在 X 发布的智力指数与成本对比 https://x.com/ArtificialAnlys/status/2094881171066978525

如果让 Fable 5.1 连续工作一天,你会先交给它哪项任务?评论区聊聊,也说说哪些权限你肯定不会交出去。觉得有用 → 点个❤️在看转给还不知道的朋友点个赞 告诉我你看完了关注「AI范儿」,下次更新第一时间收到

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
真的有人喜欢微胖吗?一个人的时候,常常会感到不自信

真的有人喜欢微胖吗?一个人的时候,常常会感到不自信

娱你同欢
2026-07-31 23:28:29
默茨无力回天,德国选择党取得压倒性优势,72岁前总理再度出山

默茨无力回天,德国选择党取得压倒性优势,72岁前总理再度出山

青青衫书生
2026-09-06 23:15:53
英超:阿森纳2-1切尔西 罗杰斯闪击 哈弗茨弑旧主厄德高破门

英超:阿森纳2-1切尔西 罗杰斯闪击 哈弗茨弑旧主厄德高破门

钉钉陌上花开
2026-09-07 01:28:06
关税重创海外PC市场!1.1万元买RTX 3050笔记本、美国同价直接上5070 Ti

关税重创海外PC市场!1.1万元买RTX 3050笔记本、美国同价直接上5070 Ti

快科技
2026-09-05 19:14:05
2026年7月,有位退休返聘的CT老医生在和朋友私下聊天时,说出了句实在话:“要做检查,能去大医院就别只是图省事。”

2026年7月,有位退休返聘的CT老医生在和朋友私下聊天时,说出了句实在话:“要做检查,能去大医院就别只是图省事。”

回京历史梦
2026-09-06 20:40:03
解晓东北京朝阳区644平豪宅3850万法拍,全部用于偿还债务

解晓东北京朝阳区644平豪宅3850万法拍,全部用于偿还债务

观察鉴娱
2026-09-05 09:59:10
事情闹大了!特朗普女婿直飞俄罗斯,谈判3小时后,普京表明态度

事情闹大了!特朗普女婿直飞俄罗斯,谈判3小时后,普京表明态度

奇迹游行者
2026-09-06 11:29:24
李在明冒冷汗,中方团队集体撤走,韩国被问责,公然藐视台湾问题

李在明冒冷汗,中方团队集体撤走,韩国被问责,公然藐视台湾问题

墨策讲历史
2026-09-05 21:15:52
“41个学生请假”,问题都这么严重了,可某些人却还在狡辩!

“41个学生请假”,问题都这么严重了,可某些人却还在狡辩!

走读新生
2026-09-04 12:10:20
真相来了!李月汝护照丢失内幕曝光,美国公共系统这么拉胯?

真相来了!李月汝护照丢失内幕曝光,美国公共系统这么拉胯?

打小我就醜
2026-09-06 18:54:01
深度还原:中美南海撞机后,美军有40分钟,为何没能把机密抹掉?

深度还原:中美南海撞机后,美军有40分钟,为何没能把机密抹掉?

干史人
2025-08-30 07:00:02
山东临清一大桥步道桥板脱落致行人坠亡,13年前被评为省文保单位却年久失修

山东临清一大桥步道桥板脱落致行人坠亡,13年前被评为省文保单位却年久失修

澎湃新闻
2026-09-06 08:40:29
美国撕破脸皮!中企被全部驱逐后,面对明抢,中国发起终极清算

美国撕破脸皮!中企被全部驱逐后,面对明抢,中国发起终极清算

锅锅爱历史
2026-09-06 08:20:29
2026年度大瓜,被扒出来的细节越来越多

2026年度大瓜,被扒出来的细节越来越多

三个妈妈六个娃
2026-09-05 21:07:22
6-3逆转!塞尔比送走147先生,夺冠将比肩传奇,世界排名紧追赵心童!

6-3逆转!塞尔比送走147先生,夺冠将比肩传奇,世界排名紧追赵心童!

刘姚尧的文字城堡
2026-09-06 09:08:33
终于知道今年为啥又扫黑除恶了

终于知道今年为啥又扫黑除恶了

小鹿姐姐情感说
2026-08-14 01:50:59
扔掉12斤水果,赔掉10万元,中国式自我感动有多可怕!

扔掉12斤水果,赔掉10万元,中国式自我感动有多可怕!

夜深爱杂谈
2026-09-05 21:28:52
袁腾飞移民美国的几个细节问题

袁腾飞移民美国的几个细节问题

十柱
2026-09-05 10:15:57
网约车每天只跑8小时,现实到底行不行?司机晒出流水

网约车每天只跑8小时,现实到底行不行?司机晒出流水

用车指南
2026-09-06 10:01:58
因苹果对质量要求极其严格,消息称折叠屏iPhone初期日产仅数百部

因苹果对质量要求极其严格,消息称折叠屏iPhone初期日产仅数百部

IT之家
2026-09-04 21:29:03
2026-09-07 03:19:00
AI范儿 incentive-icons
AI范儿
AI范儿是一个专注于人工智能领域的资讯和学习平台,提供最新的人工智能资讯
830文章数 685关注度
往期回顾 全部

科技要闻

DeepSeek被曝将采购16万颗华为昇腾950DT

头条要闻

中尼两国遇难失联人数为何相差如此大 专家解读

头条要闻

中尼两国遇难失联人数为何相差如此大 专家解读

体育要闻

3.9秒绝平!杨舒予18+5成女篮救世主

娱乐要闻

杨紫获白玉兰影后!爸爸:累了就回家

财经要闻

亏损高达200亿,昔日彩电霸主走下巅峰!

汽车要闻

带升降立标MPV 岚图梦想家9预售价42.99万起

态度原创

游戏
旅游
健康
家居
军事航空

一台PS5的结局:败给家人拔电源 暑假工心血付诸东流

旅游要闻

浙江绍兴葫芦娃爷爷,游客太多影响休息:狠心剪掉7个葫芦娃

脑梗取栓成功≠活下来,还有这三关

家居要闻

2026建博会(广州) 公装联探展交流活动

军事要闻

美伊互袭油轮 伊朗军方称或对美进行更大规模打击

无障碍浏览 进入关怀版