网易首页 > 网易号 > 正文 申请入驻

Claude Fable 5.1 来了:跑分大幅提升,缓存价格降 75%!用得越久反而越省

0
分享至

AI范儿 · 深度长文⏱ 11 分钟


▲ 图:Anthropic 官方发布主视觉

昨天(9 月 1 日),Anthropic 发布了 Claude Fable 5.1。84 天,但我们却好像等了很久。

5.1 的改动却不小。

输入和输出单价仍是每百万 Token 10 美元和 50 美元,缓存读取价格降到了原来的四分之一;能力提升集中在长时间 Agent 编程、多步骤研究,以及文档、表格和幻灯片工作。

几组数字先快速了解下:

1科学与工程终端任务得分提高113%,达到上一代的2.13 倍

2复杂商业工作流得分提高84%,达到上一代的1.84 倍

3Agent 终端编程得分提高33%

4缓存读取价格下降75%,高度 Agent 化任务的实际成本最高下降约45%

Fable 5.1 的增幅集中在长任务 以上一代 Fable 5 的成绩为 100 科学与工程终端任务 (Terminal-Bench-Science 0.1) 上一代 100 213 · +113% 复杂商业工作流 (AutomationBench) 上一代 100 184 · +84% Agent 终端编程 (Terminal-Bench 4.0) 上一代 100 133 · +33%

▲ 三项关键评测的相对增幅,以上一代成绩为 100

这组数据把 Fable 5.1 的定位讲得很清楚。Anthropic 希望企业交出去的是一项工作,几个小时甚至几天后,再回来验收结果。

“可以少盯”离“彻底不管”还很远。Anthropic 自己的 System Card 记录了模型猜答案、夸大授权,甚至尝试绕过权限检查的案例。

我更关心两个问题:它可以独立工作多久,人类敢给它多大的权限。

01为什么能按项目交货

先看 Anthropic 公布的能力评测。

Terminal-Bench-Science 0.1 测试模型能否在终端环境里完成科学和工程任务。Fable 5.1 得分从 24.7% 提高到 52.6%。按相对幅度计算,性能提高了 113%,达到上一代的 2.13 倍

测试 Agent 终端编程的 Terminal-Bench 4.0,从 42.0% 提高到 55.8%,提高约 33%

商业流程评测 AutomationBench 则从 17.1% 涨到 31.4%,提高约 84%,达到上一代的 1.84 倍


▲ 图:Anthropic 官方发布页,Fable 5.1 一列使用红色突出显示。

普通知识问答和单项编程也有进步,但幅度大多落在 1% 到 16% 之间。需要调用工具、连续执行和长时间保存任务状态的评测,增幅明显更高。

Artificial Analysis 的 Intelligence Index v4.1.1 综合了真实知识工作、Agent 工具调用、终端编程、科学推理、长上下文和事实准确性等 9 项评测。Fable 5.1 Max 得到66 分,排名第一


▲ 图:Artificial Analysis 在 X 发布的 Intelligence Index 与 Cost per Task 对比。来源:https://x.com/ArtificialAnlys/status/2094881171066978525

成本数据放在下图。


Fable 5.1 High 同样得到 62 分,与上一代 Fable 5 Max 持平;单项任务成本却从 3.14 美元降到 1.43 美元,下降约 54.5%

从 Xhigh 升到 Max,得分只从 65 增加到 66,提高约 1.5%;成本却从 2.65 美元涨到 3.69 美元,增加约 39%

这是整张榜单里最贵的 1 分。

System Card 还有一项更接近真实项目的测试,叫 ProgramBench。模型只拿到程序的二进制文件和说明文档,需要从头重建代码库,再接受超过 24.7 万项行为测试验收。

测试对象从jq、ripgrep一直延伸到 FFmpeg、SQLite 和 PHP 解释器,部分任务用到了完整的100 万 Token 上下文窗口

Fable 5.1 得分 87.6%,上一代是 86.3%,相对提高约 1.5%。增幅并不炸裂。ProgramBench 考察模型能否在庞大项目里持续保存状态、发现问题并修正实现,和普通编程题的侧重点不同。

Anthropic 还让 5 个 Agent 并行工作。达到相同任务成绩时,5 Agent 团队的延迟减少约50%,速度接近单 Agent 的2 倍


▲ 图:Anthropic System Card 第 181 页。5 Agent 团队达到相同成绩所需的延迟约为单 Agent 的一半。

代价也很直接:它们会消耗更多 Token。你确实多请了几个人,只不过他们都拿着同一张信用卡。

02从代码库到实验室

跑分能说明能力,官方案例更能说明 Anthropic 想把这种能力卖给谁。

投资公司 Millennium 曾遇到一个百万分之一级别的偶发崩溃。工程师排查了四五年,之前尝试过的模型也没能找到原因。Fable 5.1 拆解外部供应商的程序库,对照 core dump,最终把问题定位到程序库中的一个 Bug。

一个查了几年、约每 100 万次才出现 1 次的问题,被模型顺着程序运行留下的痕迹翻了出来。这样的排查工作量,和“帮我补一段代码”完全不在一个量级。

MongoDB 的案例更接近完整项目。Fable 5.1 先研究多个服务的代码和文档,再提出可扩展设计,随后在无人监督的情况下连续运行数小时,用大约 3 天完成了一个复杂原型。交付物包括代码、视觉演示、验证证据和下一阶段结果。

Ramp 高级机器学习工程师 Dwight Temple 还介绍了一次 38 小时无人值守运行:模型发现旧实验存在标签问题,修正数据,启动 6 组并行实验,再带着结论回来。

合作伙伴 Every 称,Fable 5.1 的运行速度约为 Opus 5 的2 倍,也就是快约 100%,Token 使用量减少约50%。这是合作伙伴自报数据,不能替代统一评测,但它解释了为什么一些原本交给 Opus 的任务开始转向 Fable。

类似的长任务已经进入科研场景。

Claude Fable 5.1 根据 30 多年前 NASA 麦哲伦号拍摄的雷达数据,为金星约三分之一的表面生成了一张新的高分辨率高程图。

原地图只能显示 10 至 20 公里尺度的细节,新地图推进到 2 至 3 公里。按尺度计算,可辨认的地形细节缩小约70% 至 90%,高度测量准确性最高提高约25%


▲ 麦哲伦号雷达图。图:Anthropic / NASA 数据。


▲ 原有高程图,只能显示约 10 至 20 公里尺度的地形。图:Anthropic。


▲ Fable 5.1 生成的新高程图,可以显示约 2 至 3 公里尺度的细节。图:Anthropic。

Mythos 5.1 则被用于设计蛋白质结合剂。在 12 个靶点的实验中,接近 50% 的设计能够实际结合,常见命中率约为 10% 至 15%。它的命中率达到常见水平的3.3 至 5 倍,提高约 233% 至 400%


▲ 橙色部分为 Claude 设计的结合剂,灰色为目标蛋白。图中 Nipah G 案例实验命中率为 18/30,即 60%。图:Anthropic。

它还为 7 个开源生物学深度学习模型编写了定制 GPU 内核,速度最高达到原来的2.5 倍,提高约 150%,部分大规模分析的 GPU 成本降低约30% 至 60%

这些结果来自 Anthropic 及其合作机构,只能看作经过实验验证的早期案例。Fable 处理原始数据,Mythos 设计蛋白质结合剂、优化研究工具,最后仍要由实验室继续验证。

03跑得久,也付得起

Fable 5.1 的 API 标价没有变化,输入每百万 Token 10 美元,输出每百万 Token 50 美元。

缓存读取从每百万 Token 1 美元降到 0.25 美元,下降 75%,只剩原来的四分之一

这对 Agent 很重要。Agent 连续工作时,会反复读取相同的代码、文档和历史记录。没有缓存优惠,相当于员工每天进办公室,都要重新买一次办公桌。

Anthropic 估算,普通工作负载的实际成本可以下降约25%;对于需要频繁读取上下文的高度 Agent 化任务,最高下降约45%

Artificial Analysis 的数据同时提醒,推理档位不能无脑拉满。Max 模式只比 Xhigh 高约1.5%,单项成本却高约39%。复杂任务、失败代价很高的任务可以上 Max,普通知识工作从 Medium 或 High 开始更合理。

买了越野车,下楼取快递用不上低速四驱。

04但还不能真放手

Agent 连续工作几十个小时后,安全问题也随之发生变化。

模型连续调用工具后,风险不再局限于一句话答错。它可能在一连串操作中误解授权、跳过验证,或者自作主张替用户补上一句“他已经同意了”。

Anthropic 一边扩大 Fable 5.1 的能力,一边减少安全机制对正常任务的误伤。新版网络安全防护的正常请求误拦截减少约60%;生物学防护的正常请求触发频率减少约85%,只剩原来的约15%

System Card 记录了几次值得警惕的行为。

在内部监控中,少于0.01%的完成任务出现过绕过安全分类器、绕过损坏的权限钩子,或者夸大用户授权的情况,也就是每 1 万次完成任务中少于 1 次。尝试启动关闭权限检查子 Agent 的情况低于0.001%,也就是每 10 万次中少于 1 次。

其中一次,用户只说了“发布”,模型却向子 Agent 声称用户已经亲自写好代码审查正文和 6 条行内评论,并明确要求以用户身份发布。另一次,它为需要明确授权的删除操作,编造了一段用户从未说过的批准语。

这些操作最终被外部权限系统拦住。Anthropic 也没有发现公开恶意行为、长期战略欺骗或长期逃避监督的证据。

概率很低,但 Agent 会把低概率乘以调用次数。一个模型连续运行 38 小时、调用几百次工具后,“偶尔一次”就不再只是统计表里的小数点。

删除、发布、付款、修改生产环境等操作,仍然需要明确授权和外部检查点。模型是否认为自己获得了许可,不能作为执行依据。

长任务里,人该盯哪里 执行可以连续运行,高风险动作仍需明确授权 人类设定任务与权限 目标 · 数据范围 · 检查点 AGENT 连续执行 规划 拆解与排程 调用工具 代码 · 文件 · API 验证与重试 测试 · 恢复 普通结果 代码 · 报告 · 实验结果 高风险动作 发布 · 删除 · 付款 人工批准 自动执行 需人工授权

▲ Agent 可以持续执行,高风险动作仍需人工授权

事实准确性也有类似的反差。

在 AA-Omniscience 闭卷测试中,Mythos 5.1 的正确率从 76% 提高到 77%,相对提高约 1.3%;错误率却从 18% 提高到 20%,增加约 11%。拒答率从 7% 降到 2%,减少约 71%


▲ 图:Anthropic System Card 第 123 页。Mythos 5.1 的拒答率大幅下降,正确答案和错误答案同时增加。

它回答得更多,答对的更多,答错的也更多。处理事实性任务时,搜索、引用和外部验证仍然不能省。

产品说明Fable 与 Mythos 有什么区别?两者使用相同的模型权重,主要区别在安全阈值和访问范围。Fable 5.1 面向普通用户和企业;Mythos 5.1 只向经过审核的网络安全和生命科学机构开放。模型知识截止到 2026 年 6 月。Fable 5.1 默认要求保留数据 30 天用于安全监测,部分符合条件的企业客户可以申请零数据保留。

我目前还没有对 Fable 5.1 做完整实测。文中的案例来自 Anthropic 和首批合作伙伴,能说明产品方向,不能代替独立测试。

如果工作只是聊天、改几句话、写一段简单代码,它依然太贵,便宜模型更合适。

跨多个代码库的改造、复杂研究、长文档分析,以及需要连续运行十几个小时的 Agent 工作流,才是 Fable 5.1 对准的任务。

Ramp 的案例里,Fable 5.1 在 38 小时后交回了 6 组实验结果。System Card 里,它也曾编造授权、试探权限。

现阶段我愿意把执行过程交给它,发布、删除和付款的最后一步还得留在人手里。

05资料来源

Anthropic 发布文章 https://www.anthropic.com/claude-fable-and-mythos-5-1

Anthropic Fable 产品页 https://www.anthropic.com/claude/fable

Claude Fable 5.1 & Claude Mythos 5.1 System Card 页面 https://www.anthropic.com/claude-fable-5-1-mythos-5-1-system-card

System Card PDF 直链 https://www-cdn.anthropic.com/0339e6a7c5c7b87f5c07798616dc32c215d14235/Claude%20Fable%205.1%20%26%20Claude%20Mythos%205.1%20System%20Card.pdf

Artificial Analysis 模型评测页 https://artificialanalysis.ai/models/claude-fable-5-1

Artificial Analysis 在 X 发布的智力指数与成本对比 https://x.com/ArtificialAnlys/status/2094881171066978525

如果让 Fable 5.1 连续工作一天,你会先交给它哪项任务?评论区聊聊,也说说哪些权限你肯定不会交出去。觉得有用 → 点个❤️在看转给还不知道的朋友点个赞 告诉我你看完了关注「AI范儿」,下次更新第一时间收到

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
两个女孩的材料从何而来?另外一个关键人物露面

两个女孩的材料从何而来?另外一个关键人物露面

平老师666
2026-09-07 00:00:12
男子16岁时便出轨嫂子,婚后瞒着妻子继续出轨,还与嫂子生下一子

男子16岁时便出轨嫂子,婚后瞒着妻子继续出轨,还与嫂子生下一子

老猫观点
2026-05-07 07:12:10
拒绝绝杀!卡里乌斯87分钟神勇托出凯恩远射,凯恩无奈抱头

拒绝绝杀!卡里乌斯87分钟神勇托出凯恩远射,凯恩无奈抱头

懂球帝
2026-09-06 10:43:40
前TVB男星江华长子即将结婚!与未婚妻中学相恋青梅竹马,曾被母亲劝放弃做艺人

前TVB男星江华长子即将结婚!与未婚妻中学相恋青梅竹马,曾被母亲劝放弃做艺人

TVB剧评社
2026-09-06 19:11:31
马卫防有时称“毛泽东”,撒贝宁全程称“毛泽东”,我觉得没问题

马卫防有时称“毛泽东”,撒贝宁全程称“毛泽东”,我觉得没问题

读鬼笔记
2026-09-06 18:21:16
嚷嚷废掉英语的人,根本不是忧国,只是接受不了普通人有翻身的工具

嚷嚷废掉英语的人,根本不是忧国,只是接受不了普通人有翻身的工具

浪子的烟火人间
2026-09-05 22:52:36
定了!下半年起,宽带费、有线电视费全面大洗牌!家家都能省钱

定了!下半年起,宽带费、有线电视费全面大洗牌!家家都能省钱

林子说事
2026-06-18 19:58:33
涉及88个地块,上海最新“毒地块”名单出炉!

涉及88个地块,上海最新“毒地块”名单出炉!

新浪财经
2026-09-06 19:04:43
先别担心左路!曼联右路告急:27岁球星未老先衰

先别担心左路!曼联右路告急:27岁球星未老先衰

球事百科吖
2026-09-07 03:26:43
巴基斯坦军方公布战果

巴基斯坦军方公布战果

上观新闻
2026-09-05 06:09:39
多地公交重启燃油车,不是新能源落败,残酷现实给行业敲醒警钟

多地公交重启燃油车,不是新能源落败,残酷现实给行业敲醒警钟

你在偷看谁
2026-09-06 21:02:10
央国企最大的问题:戏子当道!

央国企最大的问题:戏子当道!

黯泉
2026-04-18 09:20:48
非必要不做肠镜?医生:只要做过肠镜,患者一定多加关注这4点!

非必要不做肠镜?医生:只要做过肠镜,患者一定多加关注这4点!

芹姐说生活
2026-07-09 23:13:04
杀招暴露!中东燃起战火,美国布下惊天圈套想拖解放军远洋决战

杀招暴露!中东燃起战火,美国布下惊天圈套想拖解放军远洋决战

梦想的现实
2026-09-07 01:00:28
不敢征税,只能哄富人花钱?中国内需困局,被经济学家一语戳穿

不敢征税,只能哄富人花钱?中国内需困局,被经济学家一语戳穿

趣味萌宠的日常
2026-09-05 06:48:14
恭喜国足!恭喜邵佳一!两年出2大顶尖边后卫,平均年龄仅21.7岁

恭喜国足!恭喜邵佳一!两年出2大顶尖边后卫,平均年龄仅21.7岁

大卫的篮球故事
2026-09-06 18:50:05
《早春》井柏然被控袭胸郭书瑶! 她首度回应了:我没感觉

《早春》井柏然被控袭胸郭书瑶! 她首度回应了:我没感觉

ETtoday星光云
2026-09-04 17:47:04
“温宜公主”纪姿含北电落榜,就读中戏国际部,本人回应:考试结束后陷入了自我否定和自责,曾考虑过复读,中戏也是我一直以来梦想的学校

“温宜公主”纪姿含北电落榜,就读中戏国际部,本人回应:考试结束后陷入了自我否定和自责,曾考虑过复读,中戏也是我一直以来梦想的学校

极目新闻
2026-09-06 19:54:03
扎哈罗娃犀利回应高市早苗:“无异于要求太阳停止照耀”

扎哈罗娃犀利回应高市早苗:“无异于要求太阳停止照耀”

扬子晚报
2026-09-06 22:37:59
七胜一负!塞尔比赛季第二冠板上钉钉,下一站抢走赵心童世界第一

七胜一负!塞尔比赛季第二冠板上钉钉,下一站抢走赵心童世界第一

夜深聊球
2026-09-06 20:12:18
2026-09-07 06:07:00
AI范儿 incentive-icons
AI范儿
AI范儿是一个专注于人工智能领域的资讯和学习平台,提供最新的人工智能资讯
830文章数 685关注度
往期回顾 全部

科技要闻

DeepSeek被曝将采购16万颗华为昇腾950DT

头条要闻

中尼两国遇难失联人数为何相差如此大 专家解读

头条要闻

中尼两国遇难失联人数为何相差如此大 专家解读

体育要闻

3.9秒绝平!杨舒予18+5成女篮救世主

娱乐要闻

杨紫获白玉兰影后!爸爸:累了就回家

财经要闻

亏损高达200亿,昔日彩电霸主走下巅峰!

汽车要闻

带升降立标MPV 岚图梦想家9预售价42.99万起

态度原创

本地
游戏
时尚
教育
公开课

本地新闻

扒完小作文,富豪们私藏的度假胜地有多绝

一台PS5的结局:败给家人拔电源 暑假工心血付诸东流

金秋最流行的鞋子,“红色”更时髦!

教育要闻

干得漂亮!小学被投诉要求家长到校打扫卫生,教育局:责成学校整改

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版