大家好,我是 Ai 学习的老章
短短 24 小时之内,Anthropic 连续扔出了两记紧密咬合的重磅更新
先是在昨天凌晨发布的 Claude Code v2.1.292 中,官方悄然上线了两项底层能力:支持在创建 Subagent 时直接指定 effort 思考强度,同时允许 Mod 在 Workflow Agent 启动前直接拦截拒绝;紧接着在昨晚正式推出 Claude Haiku 5.5,今天凌晨发布的 v2.1.293 也闪电跟进,加入了模型与 agentType 的原生支持
很多朋友如果把它们当作零碎的小更新来看,可能觉得只是多了一个参数、降了一波价
站在架构演进的视角来看,Anthropic 这次打出的是一套教科书级的组合拳:他们正在给 Multi-Agent 系统搭建一套分布式“算力调度器+ 治理控制面”
痛点爆发:当 Agent 从 3 个变成上百个
常玩 AI 编程或搭智能体工作流的同学,一定深有感触:多 Agent 协同最让人心惊肉跳的就是账单
过去大家搭多 Agent 系统,分工往往非常粗放:
主 Agent
├── Research Agent
├── Coding Agent
├── Review Agent
└── Test Agent
每个角色各司其职,看起来挺美好,但实际跑起来往往面临两难困境:
要么全员拉满顶级模型与最高算力,随手跑几个深层 Bug 排查和跨目录依赖检索,几十万 Token 瞬间灰飞烟灭,钱包根本顶不住;要么退而求其次全用小模型,结果复杂规划频频翻车,甚至陷入死循环
尤其是 Anthropic 此前力推的 Dynamic Workflows,其设计愿景是在一个会话里并发跑起数十个甚至上百个 Subagent,如果所有子智能体都以最高推理强度运作,系统的成本和延迟会迅速彻底失控
这就逼出了一个核心命题:不同的工种,所需要的推理计算量天差地别
去跨目录 grep 搜个关键词、提取几行报错日志,凭什么要和系统架构决策、疑难算法重构消耗同样的 Token 预算?
调度革命:给每个打工人分配专属“思考档位”
Claude Code v2.1.292 最具突破性的动作,正是直接把算力分配做成了VIP能力
在官方的 Agent Tool 中,正式新增了 effort 参数:主 Agent 在调度创建 Subagent 时,可以直接指定该子任务的具体推理强度(low / medium / high / max)
这意味着 Orchestrator 可以根据任务难度,动态调整算力分配:
简单搜索 / grep 检索
↓
low effort
日志清洗 / 单测运行
↓
medium effort
核心逻辑编写 / 重构
↓
high effort架构决策 / 复杂 Debug / 终审 Review
↓
max effort
无需再搞一刀切的粗暴消耗,简单任务走 low effort,毫秒级响应且极省 Token;关键决断走 max effort,算力拉满保证质量上限
这一改变让开发者可以真正像管理现代分布式系统那样,精细化管理多智能体的计算预算
治理防线:Mods 进化为 Multi-Agent 控制面
光能分配算力还不够,如果主 Agent 一口气派生了几十个甚至上百个子任务,谁来兜底?
v2.1.292 带来的另一个重磅改动,就是将 workflow agents 纳入了 Mods 的 agent.spawn Hook,并暴露了 run ID 和 index
这意味着 Mod 具备了在这些 Workflow Agent 真正启动前直接一票否决(拒绝运行)的权力
![]()
Multi-Agent 算力调度与治理控制架构
这非常接近现代 Kubernetes 集群中的准入控制器(Admission Controller):
以前的 Orchestration 仅仅解决“谁负责什么任务”
现在的 Claude Code 进一步解决了“谁消耗多少推理算力”以及“谁有资格被启动”
当上层调度器规划了大量并行任务时,控制面可以根据当前并发配额、预估成本预算或安全权限规则,直接拦截超额或高危的子任务,守住成本与安全底线
廉价算力就位:Haiku 5.5 直逼主流旗舰
调度机制与治理防线就绪后,最关键的一块拼图——能够大规模并发、干脏活累活的低成本劳动力,也正式登场了
这就是昨天刚刚发布的 Claude Haiku 5.5
咱们来看看官方公布的硬核定价,数字极具冲击力:
模型级别
输入价格(每 M Token)
输出价格(每 M Token)
缓存读取(每 M Token)
上下文窗口
Haiku 5.5(≤100K 提示) $0.10 $0.50 $0.01
1M
Haiku 5.5(>100K 提示)
$0.50
$2.50
$0.05
1M
Haiku 4.5
$1.00
$5.00
$0.10
200K
Sonnet 5.5
$2.00
$10.00
$0.10
(原$0.20)
1M
在常规短上下文(100K Token 以内)中,Haiku 5.5 的输入价格直接压到了 $0.10 / 百万 Token,输出只要 $0.50,综合运行成本较 Haiku 4.5 暴跌约 75%
这里包含一个极关键的设计细节:阶梯式定价策略
超过 100K 之后输入和输出价格分别变为 与 2.50,官方统计过去 Haiku 约 90% 的请求都在 100K 以内
这一计费规则清晰锁定了它的最佳定位:它天生就适合作为高并发、短平快、上下文轻量的 Subagent,去执行特定数据清洗与检索任务,避免将其作为单次滚长上下文的主会话容器
与此同时,Sonnet 5.5 的 Prompt Cache 读取价格直接减半(从 降 到 0.10),官方测算能让绝大多数 Agent 任务的总成本再降约 20%
而且千万别以为它只是廉价替代品,在 Artificial Analysis(AA)最新基准榜单上,Haiku 5.5(max with fallback)直接打出了 43 分:
![]()
Artificial Analysis 评测:Haiku 5.5 逼近主流旗舰
对比主要模型来看一组相当震撼的数据:
反超 GLM-5.3 Flash :43 vs 42
直逼 Kimi K3(max) :43 vs 44,仅仅只差 1 分
明显高于 DeepSeek V4.1 Flash(max) :43 vs 39
高于 Qwen3.6 27B(xhigh) :43 vs 34
高于 MiniMax-M3 :43 vs 29
仅略低于顶配大模型 GLM-5.3(max 45)与 MiMo-V2.6-Pro(46)
更惊艳的是代际飞跃:上一代 Claude 4.5 Haiku 只有 17 分,Haiku 5.5 实现了整整 +26 分的巨大跨度
从图表的 Token 消耗轴也能看出来,它并未依赖漫无边际的超长思维硬堆分数,它用极具克制的 Token 消耗摸到了主力模型的梯队,在高并发、低成本场景下展现出了惊人的战斗力
实测证据:落蛋模拟、火箭升空与 Devin Fusion
这套“大模型动脑 + 小模型干活”以及“小模型拉满推理”的实战表现到底有多强?咱们来看三组硬核实测
第一组是极具代表性的落蛋物理模拟试验,目标是设计出能让鸡蛋在 32 米高度安全落地的方案:
![]()
落蛋试验实测对比:Opus 5.5 单干 vs 带 10 个 Haiku 5.5 子代理
测试结果展现出了质的差距:
Opus 5.5 单独跑 :耗时 3 分 37 秒,尝试了 25 个方案,总账单花费 $0.47
Opus 5.5 + 10 个 Haiku 5.5 子代理 :仅用 58 秒,并发探索了 86 个方案,总账单只要 $0.14
同样顺利达成目标,时间缩短到原先的约 1/3.7,方案探索量提升了约 3.4 倍,整体账单反而砍掉了整整 70%
这正是多 Agent 协同的精髓所在:Opus 负责想,Haiku 负责干,编排层由大模型把控方向,执行层由 Haiku 规模化推进,效率与成本直接双赢
第二组来自社区开发者 @Bhavani_00007 的面对面对决实测:让 Haiku 5.5 与 GPT-6 Luna 在各自最高档位(max level)下,独立编写并渲染一个动态火箭升空发射模拟场景
实测跑下来的差距令人直呼不可思议:
Haiku 5.5 模拟火箭发射实测效果
Haiku 5.5 :花费 $1.30 ,耗时约 2 分钟,火箭升空的三维结构、发射塔脱离、尾焰与浓烟扩散逼真得令人吃惊,直接在视觉和物理动态上压制了 GPT-6 Luna
GPT-6 Luna :花费 $1.50 ,同样耗时约 2 分钟,渲染细节与动态质感明显逊色
测试者原话感慨:完全没预料到小模型在拉满 reasoning 之后能把场景写得如此真实,整体表现相比上一代 4.5 堪称跨越式巨变
第三组则是 Cognition 团队在 Devin Fusion 中的实测:使用 Opus 5.5 作为 Lead 主脑、Haiku 5.5 作为 Sidekick 副手,整套系统在 FrontierCode 拿下了 66.2 的顶尖分数,同样显著压低了延迟与开销
今天凌晨发布的 v2.1.293 更新还在 subagentStatusLine 中新增了 agentType 字段:
![]()
这让开发者在自动化管理与可视化看板中,能够精准追踪不同工种智能体的运行节奏
避坑指南:推理档位怎么选,别盲目拉满
虽然 Haiku 5.5 性能强悍,但老章在这里必须严肃提醒大家:千万别把 Haiku 5.5 的推理档位一股脑全拉到 max!
在这个级别的小模型上,盲目升档增加的主要是核对步骤与自查循环,基座模型的本质智商并没有发生质的改变
结合多位开发者的实战摸索,老章给大家整理了一套最接地气的档位使用法则:
low 档 :分类、实体抽取、任务路由、简报摘要,只拼极致速度
medium 档(默认基准) :客服对话、浏览器页面操作、范围明确的窄 Subagent 从这里起步
high 档 :当 medium 偶尔漏判或翻车时再升档,适合多步协同或易漏字段的任务
xhigh / max 档 :仅在自己的业务基准评测上验证有明显增益才开启,否则容易超时且徒增花费
长链工程编码坚决别硬扛 :看清官方 Terminal-Bench 4.0 的客观差距(Haiku 5.5 是 39.2%,Sonnet 5.5 高达 70.6%),复杂工程大任务依然老老实实交给主力模型
省钱窗口严控在 100K 内 :牢记阶梯价格,窄任务起步用 medium,失败再升档
大模型狂飙到今天,智能体工程正在告别单体单打独斗的草莽时代
这套以 Claude Code 为调度底座、Haiku 5.5 为执行主力、Mod 为治理防线的组合拳,为多智能体走向工业级落地指明了清晰路径:
任务精细分工 :大模型做架构决策与终审,小模型做高并发检索与信息提取
算力按需分配 :按任务复杂度匹配 effort 档位,消除算力浪费
策略准入把关 :通过治理控制面防范任务失控蔓延
建议大家尽快在本地工作流中尝试这种大小搭配的协作架构,亲身体验算力调度带来的效率跃升
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.