网易首页 > 网易号 > 正文 申请入驻

ClaudeFable5.1突袭上线!全榜霸榜,奥尔特曼火速预告新品

0
分享至



9月2日,Anthropic一次性对外放出两款重磅大模型,ClaudeFable5.1与ClaudeMythos5.1正式亮相。两款产品共享一套底层模型底座,唯一区别就是安全护栏的松紧程度。

这一次Fable5.1直接横扫多项行业基准测试,把GPT‑5.6Sol、前代Fable5等一众热门模型压在身后。有意思的是,发布消息传出没多久,OpenAI的CEO奥尔特曼就在社交平台发文,预告自家新品很快到来,字里行间透着一场新一轮大模型竞速已经打响。



不同于以往单纯堆性能的迭代,这次更新把成本这件事摆到台面上。表面看官方输入输出标价没有改动,但缓存读取费用大幅下调,还新增推理档位调节。高性能不等于一味烧钱,开发者可以根据业务,自己权衡能力和开销。社交平台上大量开发者已经上手实测,游戏开发、建筑渲染、疑难Bug排查,不少真实案例流出,也让外界看清这一代模型真实的实力与代价。

一、实测见真章:效果亮眼,但账单并不便宜

新版本上线之后,海外社交平台很快就被各路开发者的实测案例填满,不少人拿Fable5.1,和GPT‑5.6Sol、KimiK3做实打实的横向对比。

有开发者做3D场景生成测试,让模型搭建私人岛屿未来豪宅、镶嵌钻石吊灯的宏大厅堂。对比结果很直观,Fable5.1生成出来的画面细节层次更加丰富,光影、物体纹理处理更加细腻,但代价同样突出,完成同一套任务,开销达到GPT‑5.6Sol的六倍。



还有人专门测试游戏开发能力,对比Fable5.1和KimiK3。从交互逻辑、界面完整度到游戏运行流畅度,Fable5.1整体表现占优,整套项目跑下来,KimiK3花费11美元,Fable5.1则要18美元。不少开发者晒出成果,用Fable5.1完成房屋设计、渲染动画,镜子反射桌椅的光影细节都还原到位;也有人直接做出可运行的马里奥卡丁车衍生小游戏,对成品完成度相当满意。不少设计师看完演示,忍不住感慨AI正在快速蚕食传统设计岗位的工作边界。







高分榜单背后,也藏着容易被忽略的现实。第三方平台ArtificialAnalysis的数据显示,即便缓存读取资费砍了七成五,完整任务下Fable5.1的实际单任务成本依旧比Fable5高出两成,根源在于新版本输出Token消耗量是老版本的1.7倍。模型思考更深、输出内容更长,自然会带来额外消耗。







当然它也有省钱的打开方式。Anthropic内部人员分享实测结果,在CursorBench测试当中,把推理档位调到低功耗模式,Fable5.1低档位性能,能够追平Fable5高推理档位,成本却只有后者的三分之一。这就意味着,不是所有场景都必须拉满最高性能,普通业务完全可以降档位,省下一大笔开销。甚至不少开发者反馈,自己的Anthropic调用额度被官方悄悄重置,方便大家上手体验新模型。





二、多项基准霸榜,长周期智能体能力实现跨越式提升

官方公布的八项基准测试里,ClaudeFable5.1全部拿下第一名,AI分析指数拿到66分,高于Opus5的63分、Fable5的62分,也超过GPT‑5.6Sol、Grok4.6的61分。提升最明显的,集中在科学研究、长周期业务工作流这类智能体任务。



在Terminal‑Bench‑Science科研智能体测试当中,Fable5.1拿到52.6%的得分,其余主流模型全部落在22%‑29%区间,差距直接拉开一倍左右36氪。过去很多大模型做科研任务,习惯走捷径,拼凑答案快速输出,Fable5.1不会简单投机取巧,擅长顺着线索定位深层问题根源。

一家投资机构Millennium遇到过一个棘手故障,内部工程师折腾数年,其他大模型也排查无果,系统会不定期出现罕见崩溃。把问题交给Fable5.1之后,模型成功定位到故障诱因,展现出复杂系统排错的硬实力。中等、低难度任务场景,它同样可以做到不输甚至超越上一代Fable5,配合缓存降价,日常业务能够做到效果不掉,成本下降。

不管是自主写代码、跨学科思考,还是终端操作,长链条的多步骤任务,是这一代模型重点突破的方向。而这类任务恰恰是智能体、自动化工作流最核心的场景,也是现在企业落地AI项目最看重的能力。

三、Mythos5.1放开科研护栏,硬核科研任务再进一步

同底座的Mythos5.1,定位更偏向前沿科学研究,安全约束做了调整,面向经过审核的科研人员开放,普通开发者不能直接调用全部能力。官方放出几组相当震撼的科研案例。

在分子设计领域,接入开源蛋白质工具之后,Mythos5.1设计出来的结合剂亲和力表现突出。针对3个测试靶点,亲和力比行业顶尖团队AdaptyvBio高出十倍,12个靶点整体命中率接近50%,行业常规水平大多只有10‑15%。



借助NASA麦哲伦探测器几十年前的雷达原始数据,它训练神经网络,把金星地表高程地图从原来覆盖五分之一,拓展到三分之一,分辨率从10‑20公里提升至2‑3公里,测高精度最高提升25%,帮科研人员补齐金星地表测绘资料。



计算生物学场景下,它还能自动编写GPU专用算子,优化计算缓存,七套开源深度学习模型借助它的改写,运行速度最高提升2.5倍,直接缓解科研项目GPU算力瓶颈。





但高风险能力不会无门槛放开。Mythos5.1延续前代管控,生物相关高阶能力不会随便对外开放,设置两套专门验证计划。生命科学验证计划面向生命科学专业研究者,网络安全验证计划给到防御方向安全研究人员,完成资质审核之后,才能解锁对应的高阶能力。

四、企业安全与合规落地,兼顾能力与风险管控

随着模型能力越来越强,安全、数据隐私、合规,已经是企业选型绕不开的话题。

Fable5.1没有爆出重大安全漏洞,针对恶意编程、操控计算机的高危请求,拒绝拦截水平和前代旗舰模型保持同一水准。网络安全场景误报数量下降60%,模型可以挖掘软件漏洞,但不会生成攻击利用代码。

面向企业推出全新EFS企业安全防护体系,实现近似零数据留存效果,用户数据完全保存在客户自己管控的云服务器上,这套功能今年秋末分批上线给企业客户。

同时遵循欧盟AI法案相关规定,9月之后发布的模型输出内容全部增加水印。水印不会损伤生成内容质量,水印信息不携带用户身份、对话隐私,满足监管溯源要求。

五、大模型算账逻辑已经发生变化

Fable5.1这一轮更新,给行业带来一个很现实的启示。过去大家看API报价,只盯着输入、输出每百万Token多少钱,但是对于Agent、自动化工作流这类高频复用上下文的业务,这个数字已经不能代表真实开销。

缓存命中率、推理档位高低,才是决定最终账单的关键。这次Anthropic没有简单一刀切把全部价格打到底,而是把缓存读取大幅降价,同时开放高低推理档位。同样一个模型,开发者自己选择,追求极致性能就开高档位,预算有限就切低档位,把性能和成本的选择权交到使用者手里。

旗舰大模型之间的比拼,不再仅仅比拼榜单跑分。如何平衡性能、调用成本、安全合规,适配企业真实业务,已经成为各家竞争新战场。OpenAI迅速放出新品预告,也预示接下来一段时间,全球头部大模型的迭代竞速还会持续升温。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
莱巴金娜:登顶世界第一是我的目标,下轮将沿用相同比赛思路

莱巴金娜:登顶世界第一是我的目标,下轮将沿用相同比赛思路

懂球帝
2026-09-08 06:12:06
钾是香蕉28倍!入秋隔天吃这菜,腿脚有劲精神足!

钾是香蕉28倍!入秋隔天吃这菜,腿脚有劲精神足!

美食店主
2026-09-05 08:18:38
官方通报低保女孩追星 有限资源得给真困难的人

官方通报低保女孩追星 有限资源得给真困难的人

看看新闻Knews
2026-09-07 23:08:28
小米上演“价格两极” 雷军通吃“性价比”和“高端化”

小米上演“价格两极” 雷军通吃“性价比”和“高端化”

新京报
2026-09-08 10:18:16
毛主席曾预言道:这两个国家将来对中国的威胁最大,如今果然应验

毛主席曾预言道:这两个国家将来对中国的威胁最大,如今果然应验

DELIXI
2024-12-01 18:32:46
如何消化这次经历?斯瓦泰克:什么意思?你觉得这很疯狂吗?

如何消化这次经历?斯瓦泰克:什么意思?你觉得这很疯狂吗?

懂球帝
2026-09-08 02:53:09
美国终于意识到不对劲:解放军可能不会武力收台,中国另有杀招?

美国终于意识到不对劲:解放军可能不会武力收台,中国另有杀招?

军机Nova
2026-08-30 00:34:10
China GT赛场燃起大火!车手49秒火海救人,吴彦祖:赛事方太丢人

China GT赛场燃起大火!车手49秒火海救人,吴彦祖:赛事方太丢人

娱圈办事处
2026-09-07 18:45:22
争议!37岁福原爱剪去长发再度亮相,球迷:干净清纯的形象还是选石川佳纯

争议!37岁福原爱剪去长发再度亮相,球迷:干净清纯的形象还是选石川佳纯

可乐谈情感
2026-09-06 13:48:19
最新进展:景甜“屏蔽消除”,孙宇晨再发长文太羞耻!

最新进展:景甜“屏蔽消除”,孙宇晨再发长文太羞耻!

默默有话说
2026-09-05 17:15:36
正式告别机顶盒,全国开始部署

正式告别机顶盒,全国开始部署

鲁中晨报
2026-09-05 17:14:04
一旦出现“红皇后效应”,说明公司就要凉了

一旦出现“红皇后效应”,说明公司就要凉了

互联网早读课
2026-08-28 08:11:31
扎心了!印度教授撕开莫迪大国幻觉:中印之间产业差距高达十倍

扎心了!印度教授撕开莫迪大国幻觉:中印之间产业差距高达十倍

Hi科普啦
2026-09-07 15:36:36
不怕秋老虎,就怕晚白露!今年是晚白露,接下来2个月,是热是冷

不怕秋老虎,就怕晚白露!今年是晚白露,接下来2个月,是热是冷

周哥一影视
2026-09-07 11:04:02
71-51赢球后,韩旭低调回应,意大利主帅表态,日本媒体发声!

71-51赢球后,韩旭低调回应,意大利主帅表态,日本媒体发声!

隐于山海
2026-09-08 09:29:26
16GB+2TB!华为发布会汇总:9月7日,新品正式首发!

16GB+2TB!华为发布会汇总:9月7日,新品正式首发!

科技堡垒
2026-09-07 11:35:30
中国目前面临的最大问题:或许已经不是如何发展、如何致富了?

中国目前面临的最大问题:或许已经不是如何发展、如何致富了?

生活新鲜市
2026-09-08 07:03:02
单场56分!地表最强175,还没有放弃梦想!

单场56分!地表最强175,还没有放弃梦想!

篮球实录
2026-09-08 16:07:45
雷军发布小米迄今最贵手机,售价10999元起

雷军发布小米迄今最贵手机,售价10999元起

极目新闻
2026-09-07 20:38:42
网友们这几天都在吃著名毛巾集团洁丽雅的瓜,讽刺其家族“丑闻”

网友们这几天都在吃著名毛巾集团洁丽雅的瓜,讽刺其家族“丑闻”

网络易不易
2026-05-17 12:29:12
2026-09-08 16:36:49
魏家东 incentive-icons
魏家东
一个人的营销商学院!
3077文章数 12280关注度
往期回顾 全部

科技要闻

小米再次背水一战

头条要闻

"粥饼伦"新店开业推出8元套餐现场排起长队 本人回应

头条要闻

"粥饼伦"新店开业推出8元套餐现场排起长队 本人回应

体育要闻

韩旭:我一定会再次走出去

娱乐要闻

郭德纲乱改抗战歌曲被重罚!

财经要闻

全球黄金“回家”

汽车要闻

领克20 领克的纯电小钢炮这次更运动了

态度原创

家居
教育
游戏
健康
军事航空

家居要闻

2026建博会(广州) 公装联探展交流活动

教育要闻

院士李培根教授走进华师一附中讲授“开学第一课”

《湮灭之潮》科隆试玩口碑大爆!外媒:战斗系统太顶

同样是脑梗,为何康复结局大不同?

军事要闻

胡塞武装用自行生产的导弹袭击沙特军车

无障碍浏览 进入关怀版