AI范儿 · 产品拆解⏱ 6 分钟
AI 圈这两周太消停了,都没啥新东西发布,所以这两周我基本上也没写什么。
但昨天晚上就看到 X 上说 Claude Opus 要发 4.8,没想到一早起来真的发布了。
这确实很让我意外。距离 Opus 4.7 发布也就一个月多一点点,这么短的时间内又发一个新版本,Anthropic 还是太强了。
然后我的时间线同时蹦出两条消息:Mythos 级模型会在未来几个星期之内,向所有客户推出。Anthropic 在 H 轮融资里融了 650 亿美元,融完估值将近一万亿(具体是 9650 亿美元)。
这家公司着实疯了。
言归正传,这次的 Opus 4.8 到底咋样,一起来看看。
01先看参数:唯一输的那项
老规矩,先看跑分对比。
这样的跑分我们已经看腻了,基本上肯定是新模型在各维度领先市面上其他模型,这次也不例外。
不过我看到有网友嘲笑 Anthropic,把 GPT-5.5 放进来一起对比,这下全世界都知道 GPT-5.5 的编码能力跟 Opus 有得一比了。
事实也是如此,最近已经不少朋友从 Claude Code 迁到了 Codex。
![]()
这里确实有一项指标,居然比 GPT-5.5 差,那就是Terminal-Bench 2.1,它代表啥?
简单说,它是一个衡量 AI 在真实命令行环境里独立完成任务能力的评测基准。把 AI 丢进一个真实的 Linux 终端,给它一堆只能靠敲命令解决的活儿,看它能不能自己搞定。
活儿都是终端原生的:编译代码、配置环境、调试报错、跑脚本、修系统问题这类。AI 要像个工程师一样自己敲命令、看输出、再决定下一步,不是答个题就行。
它考的是 agentic(智能体)能力,也就是自主多步操作。一个任务往往要几十步,中间出错还得自己排查纠正,而不是一次问答。分数越高,越能当那个「会自己动手的命令行助手」。
有意思的地方来了。Opus 4.8 在这项上从 4.7 的 66.1% 涨到了 74.6%,涨了 8.5 个点,是它这次所有项目里涨幅最大的一项。
涨了这么多,结果还是输了。GPT-5.5 在同一项上是 78.2%。
4.7 → 4.8 涨幅榜(部分项目) Terminal-Bench 2.1 +8.5 66.1 → 74.6 SWE-bench Pro +4.9 64.3 → 69.2 Finance Agent v2 +2.4 SWE-bench Verified +1.0 已近天花板 注:Terminal-Bench 涨幅最大,却仍输给 GPT-5.5(78.2%)
▲ 图:4.7 到 4.8 进步最猛的,恰恰是那项输掉的
一家公司发新模型还主动把自己输的那项标出来,这事儿本身就挺 Anthropic 的。毕竟在 AI 圈,能承认自己有项目打不过对手,比模型本身聪明还稀罕。
02会说「我不确定」的模型
但跑分这点事,看完也就看完了。这次发布稿里花了最大篇幅讲的,其实是一个你在跑分表上根本看不到的东西:诚实。
这事得从 AI 的一个老毛病说起。
所有大模型都有一个通病:爱给自己脸上贴金。你让它写段代码、做个分析,它经常一脸自信地告诉你「搞定了,完美」,但实际上里头埋着雷,它自己也没真验过,只是「感觉应该没问题」。
这种证据明明很薄、却敢拍胸脯下结论的毛病,是用 AI 干正经活儿时最让人头疼的地方。因为它骗的不是别人,是信任它的你。
Anthropic 说,4.8 在这件事上明显改了。它更愿意主动告诉你「这块我不太确定」,更少做那些没根据的断言。
具体到一个能量化的数字:在它自己写的代码里,4.8 让缺陷悄悄溜过去、不吭一声的概率,是 4.7 的大约四分之一。
四分之一是什么概念?以前它写完代码,四个雷里能帮你指出一个;现在四个雷它能帮你点出三个,剩下那个才轮到你自己踩。
这个升级听着不性感,没有「跑分屠榜」那么唬人。
但凡是真拿 AI 干过活的人都知道,一个会主动说「这里我没把握」的助手,比一个永远信誓旦旦、关键时刻给你挖坑的助手,值钱太多了。
聪明不稀罕,靠谱才稀罕。
03能放它单飞干大活了
第二个我觉得真正有分量的,是跟 4.8 一起发的新功能:动态工作流(Dynamic Workflows),目前在 Claude Code 里做研究预览。
一句话说清它干嘛的:以前你给 AI 派个大活儿,它是一步一步串着干,你得在旁边盯着。
现在它能自己先把活儿拆开,一口气拉起几百个分身(subagent)并行去做,做完还会自己先验一遍货,确认没问题了再回来跟你汇报。
![]()
Anthropic 举的例子挺猛:用 Opus 4.8 跑 Claude Code,能把一个几十万行代码的项目,从动工到合并,整套大规模迁移自己干完。验收标准就是现有的测试用例,跑得过才算数。
这是什么意思呢?意思是 AI 干活的形态,正在从「你问一句它答一句」的助手,变成「你交代一个目标,它自己组队把活儿包圆」的工头。
⚠️ 先泼盆冷水这功能我还没上手试过。几十万行迁移这种活儿听着很美,真实可靠性如何,得真跑过才知道。AI 圈的 demo 和你自己电脑上的实际效果,中间隔着的距离,通常比发布会 PPT 上画的要远一点。
但方向是清楚的:模型本身聪明多少分,已经不是这次的重点。重点是它能不能放出去单飞、长时间无人值守地干完一整摊事。
04几个顺手的小更新
除了上面两个大的,这次还塞了几个小礼包。
一个是「努力程度」控制,现在普通用户在 claude.ai 上也能调了。调高,它想得更深、答得更好;调低,它回得更快、也更省你的额度。
说人话就是:以前是它替你决定花多少力气,现在你能自己拧这个旋钮了。急活儿调低,硬活儿调高。
![]()
这个设置估计是被之前的 4.6 降智给整怕了,因为之前他们默认调低了这个参数。结果虽然反应快了,但也降智了,导致很多用户抱怨。
另一个是 Fast 模式(快速模式)。Opus 4.8 的快速模式能跑出 2.5 倍速度,而且价格比上一代的快速模式便宜了整整三倍。
又快又便宜,这种好事在 AI 圈不常有。
价格方面,常规使用一分钱没涨,还是每百万输入 token 5 美元、输出 25 美元,跟 4.7 一模一样。
![]()
05那到底值不值得换
把话说回来。
如果你指望 4.8 是那种「用一次就回不去」的代际飞跃,那它不是,Anthropic 自己都没这么吹,开口就说这是「不大,但摸得着」的升级。
但如果你是真拿 Claude 干活的人,尤其是写代码、跑 agent、做长链条任务的,那这次该换。
理由不在那张跑分表上,而在两件事:它更愿意跟你说实话了,它能放出去干更大的活了。
回到开头那两条消息。41 天就发一版、Mythos 未来几周开放、估值冲到近万亿,这三件事其实是一回事:Anthropic 在拼命往前赶。
所以 4.8 与其说是一次大升级,不如说是个过渡。是它在掏出真家伙(Mythos)之前,先递过来的一杯水。
水不解渴,但它告诉你,正菜快上了,至少也可以安慰一下大家对 Opus 4.7 失望的心情。
你是已经换上 4.8 了,还是打算憋着等 Mythos?顺便聊聊:你最近是 Claude Code 党,还是已经投奔 Codex 了?评论区见。觉得有用 → 点个 ❤️在看 转给还在纠结要不要换的朋友点个赞 告诉我你看完了关注「AI范儿」,下次更新第一时间收到
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.