来了,Claude Fable 5.1和Mythos 5.1都来了。
还是熟悉的搭配,Mythos 5.1还是能看不能用,只会开放给部分人,所以我们还是重点看Fable5.1。先来看看纸面实力,
最离谱的一项是Agent科研,Fable5.1比Fable5提升了27.9点,比GPT 5.6 sol提升了30点。
![]()
这个图也就是我用Fable5.1跑的第一个case,因为对比的图太多,我让它把信息压缩到一个表格里面。
喜大普奔的是,新模型出来价格也降了。
输入输出价格还是每百万token10刀/50刀,但是Fable5.1的缓存读取成本比Fable 5低了75%,来到了每百万token0.25刀,按照A社自己的预估普通任务成本下降25%,高度Agentic任务下降45%。
但是我还是没有原谅A社在订阅计划上搞假动作,因为现在所谓的20x实际上只有pro的6到8倍,5x也只有pro的3.5倍。实际上所谓的20倍只作用在5小时的限制窗口。好一个文字游戏,好一个发新模型要转移注意力。
来都来了,还是来试试看提升的性能能不能值回票价。
那老粉应该知道,我做的AI提示语案例网站goodcase .ai上上周上线到现在访问人数已经超1w了。其实我都截图了非常多可以修改的细节,比方说首页左右侧比例不对,slogan会压缩素材位;
![]()
自动化的提示语提取线路还是会出现XXX的AI视频这样的完全不能代表视频内容本身的视频标题,以及对应原素材是视频的或者竖版图片的时候,现在的截图流程会出现移位。
![]()
![]()
那Fable 5.1有一个非常明显的优化点,在浏览器自动化和电脑自动化上,都能够赶上Codex GPT 5.6的水准。
以前哪怕给它开了全权限,它在浏览器自动化上,比方说让它去Supabase里面跑一个 SQL 语句,修改一下 GoodCase的存储机制,把提示语的权重往前放,通常都会反复失败,最后让我手动去终端命令行操作。这种情况不仅在Fable上有,在Opus 5上也会出现。
但Fable 5.1这次用浏览器扫描了我整个网页的所有页面,给出了每个页面的详细参数与差异说明,做了PC端和手机端的对比,并且还保留了截图。我就用了一句话提示语,
找一个goodcase项目的UI优化点
![]()
Fable5.1优化一轮之后基本上首帧截图不会出现主体只有一半或者一截的情况了,
采用的方法是按照不同尺寸跟展示框的偏移度来算,如果偏移度小就适当裁剪,铺满全框,这样看起来视觉效果最好。如果偏移度大于 0.2 的话,就完整展示,给左右留白。又或者,如果原来的case里面有多个正方形的图,就给它们拼成九宫格,展示所有的效果。
所以你看到的这个页面,既保留了主体性,也会裁剪掉部分多余的空间,能够让不同尺寸的素材都放在一个展示页面里面。
![]()
![]()
还有就是,之前我为了准确修改UI呢,这段时间用了一个新的小技巧,在claude里面开Design。这样它做出来的画布你是可以去实时移动的,但这也带来一个缺点,迭代的时间变长了。不过好过我说这个模块想往上一点点往下一点点,让模型自己去猜好。
从这次批量来修改 UI 的情况下呢,Fable 5.1的前端美学其实有更高的提升。也就是说,在首页的情况下,其实我们其实要抉择,保证 slogan 尽可能大,让大家都能够了解到网页的作用的同时,保证右边三个 case 尽可能大,并且在不同的尺寸上面都能够生效。
![]()
然后就是我之前更新的ai热点网站ai news radar,ai热点地图ai map以及ai agent教程learnprompt都放到一个站里面了,fable5.1还给我更新了热度的衰减算法来每天统计这些case。
![]()
当然还不只是UI的问题,
会有更多像AI编程这个大类,我已经解决了提示语稳定提取的步骤了。
但是我收集了很多提示词,会出现这样一个问题,如果出了新模型,要从goodcase里面随机抽取一些去测试,它们目前缺失分类。因为有一些case其实已经非常完善了,包括网页首页的视频是在线链接,对应的3D效果文件也作为link加到提示语了。也就是说,它们虽然效果看起来很好,但没办法测出这个模型的性能上限。
![]()
![]()
Fable5.1从我的采集路线开始修改,再加上提示语本身新做出了三个分类,还把Agent Skill更新了,现在可以按照类目随机抽case了测试新模型了。
OK,新版的goodcase也上线了,后面会提升case自动收录和人工混合打分的机制,也会从现在的三个平台,x,github,某抖拓展到13个全平台。
![]()
这次我觉得Fable 5.1还有个比较明显的提升,就是会更加积极地搜索过去对话产生的文件。之前它是偏被动型的,需要我主动跟它说在哪个对话里聊过对应的东西。但这次它搜索对话的稳定性更高了,当我直接开一个新对话让它总结新做的采集线的时候,它会找到我们过去几天说过的一个文件来做复用。
![]()
最近除了在高频率更新goodcase,我还在不停救我的mac mini,长时间在一台最低配的mac mini上运行claude code,codex和grok有一个巨大的缺点就是内存非常不够用。
![]()
虽然我做了一个定时任务监控只要超过90%就提醒我,但是在codex的多次优化经验来看,我能做的就只能删掉一些可再生的缓存,治标不治本,基本上三四天就又要清理一次。
![]()
所以,我的思路是这样的,以llm wiki为灵感框架,让Fable5.1倒推历史上有哪些人整理书籍或者说整理文件夹,整理出比较出名的方法论。
1876年,一个叫杜威的图书馆员搞了个十进分类法,逻辑特别简单粗暴,每个东西都该有个固定位置,一个数字编号。对,这就是我们电脑上文件夹套文件夹的祖宗。
后来20世纪的时候,一个印度人阮冈纳赞觉得这事没这么简单,他提出了分面分类,用人物,材料,时间,空间这些维度去组合描述一个东西。这不就是打标签加结构化属性的思路嘛,比文件夹树高级多了。
但其实比他们俩都早两百年,约翰·洛克就已经想通了一件事,你压根不需要先想好怎么分类。他的 Commonplace Book 索引法就一句话,管你现在理不理得清楚,只要以后能找回来就行。用关键词的首字母加元音去定位页面,轻量到离谱但还是很管用。
到了瓦尔堡这就更有意思了。前面几位不管怎么吵,至少都同意整理是为了「找到」。瓦尔堡不这么想,他觉得整理的终极目的是让意外的连接发生。他有个说法叫「好邻居法则」,把可能发生思想碰撞的书放在一起,而且不停地重新排列。
最后是卢曼的卡片盒笔记法 Zettelkasten,这个是在二十世纪中后期搞出来的系统,某种意义上把前面所有人的想法都串起来了。每张卡片独立编号,卡片之间通过链接形成思想网络。一张卡片值不值钱,不取决于它写了什么,取决于它跟多少张其他卡片产生了关系。今天我们比较熟知的「第二大脑」的前身就是它。
所以基于这五个基础理论,Fable5.1做了一个新的文件整理skill,
carl-file-organizer
我的出发点是在保证我们能一眼看清楚的情况下,把结构改成更方便Agent读取的,并且能够删掉多余的无用的文件,让这台 Mac mini 保持一直健康的状态。那首先,这skill会先去判断哪些是重复文件可以移除,然后按照混乱度会给出一个新的文件结构的设计。
![]()
最后,它会以知识图谱的方式,告诉你整理之后的结构是什么样子的。
![]()
它本体其实就是一个提示语,所以哪怕是迁移到Windows,Mac,Linux,都能够在本地的Agent安装,直接用这个 SKill。
github. com/LearnPrompt/carl-skills
OK,来到经典收尾环节。
我们来一个3D版愤怒的小鸟,目前来说我最喜欢测试的3D游戏之一了,除非后面还能一口气做植物大战僵尸的话,提示语很简单,
做一个3D版的愤怒的小鸟,要有关卡和物理反馈
我会先同时给GPT 5.6 sol和Fable 5.1开计划模式,然后按照他们给的选项执行。比较明显的感受就是用Fable5.1开计划模式的时候遇到的多选情况会更多,但是思考的速度没有减慢,甚至比起Fable5更快了。
![]()
GPT 5.6 sol做了一个三个关卡,带上了弹跳和碰撞的音效,而且我觉得还是很符合我心目中的 3D 效果。
因为本来打愤怒的小鸟的时候,那些猪在开局后就会自己把自己作没了,或者是把建筑压到自己身上。这三关很还原了,在3D情况下这些猪会往前倒或者往后倒,也会自己把自己作没。不过后面 Fable 5.1 的完成度就更夸张了
除了把核心玩法复刻下来,Fable 5.1在一个 HTML里面塞下了4种鸟,就是最经典的黄红蓝黑鸟,而且有8关,甚至在执行的一个阶段还问我要不要把3D游戏扩展到手机都能用。
![]()
像是GPT 5.6 Sol做出来的的木质材质,鸟是一碰就会破,没有耐久度可言。但在Fable 5.1的设计上,它们都有自己独立的密度和耐久。也就是说通过的难度高很多,以至于我虽然做出了 8 关,但自己玩10次也就通关了1次而已。所以我把这个也上传到了 GitHub,大家可以尝试一下能不能把8关都打通。
github. com/LearnPrompt/fowl-fortress
我觉得它还原得很好的一个点是跟随镜头,还原了游戏本身的那种紧张感。
鸟落地之后是有滚动的。而且这个3D世界不像GPT 5.6做的那样设了边界,鸟可以往左右随便滚的。同时它还会给特写,比如击中猪之后,后面建筑的坍塌会不会波及到猪,或者猪滚动会不会自己撞上木头把自己搞没,都是可以预见的。
再来点个经典黑鸟炸开清图的截图,后面我拉破防了直接让fable5.1自己打通关了。
![]()
最后的最后,想起来每次测新模型的时候,大家还会关注这个模型的写作能力,所以我就让Fable5.1和Opus4.6各自写一段goodcase的介绍词,这就不需要一行行对比了,fable5.1这次的写作也是负优化的。
这是fable5.1写的,
![]()
这是Opus4.6写的,
![]()
呼,又是一天没睡觉,
隔壁的Codex和Grok不语,只是一味重置额度,
我只能说在这个离谱的AI时代,
我估计等AGI到来之前,
我就会先学会左右脑交互睡眠了,
这样能保持24小时清醒。
@ 作者 / 卡尔
最后,感谢你看到这里如果喜欢这篇文章,不妨顺手给我们点赞|在看|转发|评论
如果想第一时间收到推送,不妨给个星标
如果你有更有趣的玩法,欢迎聊聊
更多的内容正在不断填坑中……
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.