网易首页 > 网易号 > 正文 申请入驻

Claude Code开始做Agent算力调度,配合Claude Haiku 5.5 极致低价,瞄准国产Flash大模型

0
分享至

大家好,我是 Ai 学习的老章

短短 24 小时之内,Anthropic 连续扔出了两记紧密咬合的重磅更新

先是在昨天凌晨发布的 Claude Code v2.1.292 中,官方悄然上线了两项底层能力:支持在创建 Subagent 时直接指定 effort 思考强度,同时允许 Mod 在 Workflow Agent 启动前直接拦截拒绝;紧接着在昨晚正式推出 Claude Haiku 5.5,今天凌晨发布的 v2.1.293 也闪电跟进,加入了模型与 agentType 的原生支持

很多朋友如果把它们当作零碎的小更新来看,可能觉得只是多了一个参数、降了一波价

站在架构演进的视角来看,Anthropic 这次打出的是一套教科书级的组合拳:他们正在给 Multi-Agent 系统搭建一套分布式“算力调度器+ 治理控制面”

痛点爆发:当 Agent 从 3 个变成上百个

常玩 AI 编程或搭智能体工作流的同学,一定深有感触:多 Agent 协同最让人心惊肉跳的就是账单

过去大家搭多 Agent 系统,分工往往非常粗放:

主 Agent
├── Research Agent
├── Coding Agent
├── Review Agent
└── Test Agent

每个角色各司其职,看起来挺美好,但实际跑起来往往面临两难困境:

要么全员拉满顶级模型与最高算力,随手跑几个深层 Bug 排查和跨目录依赖检索,几十万 Token 瞬间灰飞烟灭,钱包根本顶不住;要么退而求其次全用小模型,结果复杂规划频频翻车,甚至陷入死循环

尤其是 Anthropic 此前力推的 Dynamic Workflows,其设计愿景是在一个会话里并发跑起数十个甚至上百个 Subagent,如果所有子智能体都以最高推理强度运作,系统的成本和延迟会迅速彻底失控

这就逼出了一个核心命题:不同的工种,所需要的推理计算量天差地别

去跨目录 grep 搜个关键词、提取几行报错日志,凭什么要和系统架构决策、疑难算法重构消耗同样的 Token 预算?

调度革命:给每个打工人分配专属“思考档位”

Claude Code v2.1.292 最具突破性的动作,正是直接把算力分配做成了VIP能力

在官方的 Agent Tool 中,正式新增了 effort 参数:主 Agent 在调度创建 Subagent 时,可以直接指定该子任务的具体推理强度(low / medium / high / max)

这意味着 Orchestrator 可以根据任务难度,动态调整算力分配:

简单搜索 / grep 检索
↓
low effort

日志清洗 / 单测运行
↓
medium effort

核心逻辑编写 / 重构
↓
high effort

架构决策 / 复杂 Debug / 终审 Review
↓
max effort

无需再搞一刀切的粗暴消耗,简单任务走 low effort,毫秒级响应且极省 Token;关键决断走 max effort,算力拉满保证质量上限

这一改变让开发者可以真正像管理现代分布式系统那样,精细化管理多智能体的计算预算

治理防线:Mods 进化为 Multi-Agent 控制面

光能分配算力还不够,如果主 Agent 一口气派生了几十个甚至上百个子任务,谁来兜底?

v2.1.292 带来的另一个重磅改动,就是将 workflow agents 纳入了 Mods 的 agent.spawn Hook,并暴露了 run ID 和 index

这意味着 Mod 具备了在这些 Workflow Agent 真正启动前直接一票否决(拒绝运行)的权力


Multi-Agent 算力调度与治理控制架构

这非常接近现代 Kubernetes 集群中的准入控制器(Admission Controller):

  • 以前的 Orchestration 仅仅解决“谁负责什么任务”

  • 现在的 Claude Code 进一步解决了“谁消耗多少推理算力”以及“谁有资格被启动”

当上层调度器规划了大量并行任务时,控制面可以根据当前并发配额、预估成本预算或安全权限规则,直接拦截超额或高危的子任务,守住成本与安全底线

廉价算力就位:Haiku 5.5 直逼主流旗舰

调度机制与治理防线就绪后,最关键的一块拼图——能够大规模并发、干脏活累活的低成本劳动力,也正式登场了

这就是昨天刚刚发布的 Claude Haiku 5.5

咱们来看看官方公布的硬核定价,数字极具冲击力:

模型级别

输入价格(每 M Token)

输出价格(每 M Token)

缓存读取(每 M Token)

上下文窗口

Haiku 5.5(≤100K 提示) $0.10 $0.50 $0.01

1M

Haiku 5.5(>100K 提示)

$0.50

$2.50

$0.05

1M

Haiku 4.5

$1.00

$5.00

$0.10

200K

Sonnet 5.5

$2.00

$10.00

$0.10

(原$0.20)

1M

在常规短上下文(100K Token 以内)中,Haiku 5.5 的输入价格直接压到了 $0.10 / 百万 Token,输出只要 $0.50,综合运行成本较 Haiku 4.5 暴跌约 75%

这里包含一个极关键的设计细节:阶梯式定价策略

超过 100K 之后输入和输出价格分别变为 与 2.50,官方统计过去 Haiku 约 90% 的请求都在 100K 以内

这一计费规则清晰锁定了它的最佳定位:它天生就适合作为高并发、短平快、上下文轻量的 Subagent,去执行特定数据清洗与检索任务,避免将其作为单次滚长上下文的主会话容器

与此同时,Sonnet 5.5 的 Prompt Cache 读取价格直接减半(从 降 到 0.10),官方测算能让绝大多数 Agent 任务的总成本再降约 20%

而且千万别以为它只是廉价替代品,在 Artificial Analysis(AA)最新基准榜单上,Haiku 5.5(max with fallback)直接打出了 43 分:


Artificial Analysis 评测:Haiku 5.5 逼近主流旗舰

对比主要模型来看一组相当震撼的数据:

  • 反超 GLM-5.3 Flash :43 vs 42

  • 直逼 Kimi K3(max) :43 vs 44,仅仅只差 1 分

  • 明显高于 DeepSeek V4.1 Flash(max) :43 vs 39

  • 高于 Qwen3.6 27B(xhigh) :43 vs 34

  • 高于 MiniMax-M3 :43 vs 29

  • 仅略低于顶配大模型 GLM-5.3(max 45)与 MiMo-V2.6-Pro(46)

更惊艳的是代际飞跃:上一代 Claude 4.5 Haiku 只有 17 分,Haiku 5.5 实现了整整 +26 分的巨大跨度

从图表的 Token 消耗轴也能看出来,它并未依赖漫无边际的超长思维硬堆分数,它用极具克制的 Token 消耗摸到了主力模型的梯队,在高并发、低成本场景下展现出了惊人的战斗力

实测证据:落蛋模拟、火箭升空与 Devin Fusion

这套“大模型动脑 + 小模型干活”以及“小模型拉满推理”的实战表现到底有多强?咱们来看三组硬核实测

第一组是极具代表性的落蛋物理模拟试验,目标是设计出能让鸡蛋在 32 米高度安全落地的方案:


落蛋试验实测对比:Opus 5.5 单干 vs 带 10 个 Haiku 5.5 子代理

测试结果展现出了质的差距:

  • Opus 5.5 单独跑 :耗时 3 分 37 秒,尝试了 25 个方案,总账单花费 $0.47

  • Opus 5.5 + 10 个 Haiku 5.5 子代理 :仅用 58 秒,并发探索了 86 个方案,总账单只要 $0.14

同样顺利达成目标,时间缩短到原先的约 1/3.7,方案探索量提升了约 3.4 倍,整体账单反而砍掉了整整 70%

这正是多 Agent 协同的精髓所在:Opus 负责想,Haiku 负责干,编排层由大模型把控方向,执行层由 Haiku 规模化推进,效率与成本直接双赢

第二组来自社区开发者 @Bhavani_00007 的面对面对决实测:让 Haiku 5.5 与 GPT-6 Luna 在各自最高档位(max level)下,独立编写并渲染一个动态火箭升空发射模拟场景

实测跑下来的差距令人直呼不可思议:


Haiku 5.5 模拟火箭发射实测效果

  • Haiku 5.5 :花费 $1.30 ,耗时约 2 分钟,火箭升空的三维结构、发射塔脱离、尾焰与浓烟扩散逼真得令人吃惊,直接在视觉和物理动态上压制了 GPT-6 Luna

  • GPT-6 Luna :花费 $1.50 ,同样耗时约 2 分钟,渲染细节与动态质感明显逊色

测试者原话感慨:完全没预料到小模型在拉满 reasoning 之后能把场景写得如此真实,整体表现相比上一代 4.5 堪称跨越式巨变

第三组则是 Cognition 团队在 Devin Fusion 中的实测:使用 Opus 5.5 作为 Lead 主脑、Haiku 5.5 作为 Sidekick 副手,整套系统在 FrontierCode 拿下了 66.2 的顶尖分数,同样显著压低了延迟与开销

今天凌晨发布的 v2.1.293 更新还在 subagentStatusLine 中新增了 agentType 字段:


这让开发者在自动化管理与可视化看板中,能够精准追踪不同工种智能体的运行节奏

避坑指南:推理档位怎么选,别盲目拉满

虽然 Haiku 5.5 性能强悍,但老章在这里必须严肃提醒大家:千万别把 Haiku 5.5 的推理档位一股脑全拉到 max!

在这个级别的小模型上,盲目升档增加的主要是核对步骤与自查循环,基座模型的本质智商并没有发生质的改变

结合多位开发者的实战摸索,老章给大家整理了一套最接地气的档位使用法则:

  1. low 档 :分类、实体抽取、任务路由、简报摘要,只拼极致速度

  2. medium 档(默认基准) :客服对话、浏览器页面操作、范围明确的窄 Subagent 从这里起步

  3. high 档 :当 medium 偶尔漏判或翻车时再升档,适合多步协同或易漏字段的任务

  4. xhigh / max 档 :仅在自己的业务基准评测上验证有明显增益才开启,否则容易超时且徒增花费

  5. 长链工程编码坚决别硬扛 :看清官方 Terminal-Bench 4.0 的客观差距(Haiku 5.5 是 39.2%,Sonnet 5.5 高达 70.6%),复杂工程大任务依然老老实实交给主力模型

  6. 省钱窗口严控在 100K 内 :牢记阶梯价格,窄任务起步用 medium,失败再升档

总结

大模型狂飙到今天,智能体工程正在告别单体单打独斗的草莽时代

这套以 Claude Code 为调度底座、Haiku 5.5 为执行主力、Mod 为治理防线的组合拳,为多智能体走向工业级落地指明了清晰路径:

  • 任务精细分工 :大模型做架构决策与终审,小模型做高并发检索与信息提取

  • 算力按需分配 :按任务复杂度匹配 effort 档位,消除算力浪费

  • 策略准入把关 :通过治理控制面防范任务失控蔓延

建议大家尽快在本地工作流中尝试这种大小搭配的协作架构,亲身体验算力调度带来的效率跃升

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
炸裂!曝女局长婚内与9人有染,聊天内容毁三观,女局长频繁主动挑逗

炸裂!曝女局长婚内与9人有染,聊天内容毁三观,女局长频繁主动挑逗

小鋭有话说
2026-10-10 11:25:02
那天下跪的乘务员,是我

那天下跪的乘务员,是我

普陀动物世界
2026-10-11 00:10:00
美国71岁男子长相酷似爱泼斯坦,长期被网友认为“爱泼斯坦没有死”,无奈赴以色列鉴定DNA,力证自己“完全不是”

美国71岁男子长相酷似爱泼斯坦,长期被网友认为“爱泼斯坦没有死”,无奈赴以色列鉴定DNA,力证自己“完全不是”

极目新闻
2026-10-10 14:46:03
买用户可以自由批评的车

买用户可以自由批评的车

吐槽青年
2026-10-09 21:54:10
赵福刚被美国禁止入境,后续来了

赵福刚被美国禁止入境,后续来了

环球时报国际
2026-10-10 08:02:20
开始查普通医生!中纪委划4条红线,第1种直接被点名,第3种常见

开始查普通医生!中纪委划4条红线,第1种直接被点名,第3种常见

职场资深秘书
2026-10-09 15:14:01
中超争议判罚!杨明洋踢人逃红,王秋明面部被踹出血,媒体人热议

中超争议判罚!杨明洋踢人逃红,王秋明面部被踹出血,媒体人热议

奥拜尔
2026-10-10 20:16:31
目前的中国股市想要逢低建仓,那就买这两种股票,赚到盆满钵满!

目前的中国股市想要逢低建仓,那就买这两种股票,赚到盆满钵满!

股经纵横谈
2026-10-10 22:27:01
新疆发布评尊界刹车断裂风波

新疆发布评尊界刹车断裂风波

小南看车
2026-10-10 22:27:28
超强厄尔尼诺已正式形成!专家:暖冬基本确定,明年夏天可能更热

超强厄尔尼诺已正式形成!专家:暖冬基本确定,明年夏天可能更热

小强热线
2026-10-09 21:27:18
大闸蟹全线崩盘?卖到“地板价”:雌蟹只要五六元,三两的蟹只卖10元

大闸蟹全线崩盘?卖到“地板价”:雌蟹只要五六元,三两的蟹只卖10元

华庭讲美食
2026-10-11 01:54:37
程福波到中国移动调研

程福波到中国移动调研

政知新媒体
2026-10-10 12:38:01
加拿大、丹麦、德国、法国、意大利、日本、荷兰、英国,发表联合声明

加拿大、丹麦、德国、法国、意大利、日本、荷兰、英国,发表联合声明

政知新媒体
2026-10-10 07:51:17
不查不知道一查吓一跳!44岁一家人住北京豪宅的陈婷,私下有多壕

不查不知道一查吓一跳!44岁一家人住北京豪宅的陈婷,私下有多壕

冷紫葉
2026-09-19 12:41:16
云南玉昆球迷意难平!不止因为1-7上海申花,更多在于以下五点!

云南玉昆球迷意难平!不止因为1-7上海申花,更多在于以下五点!

格斗社
2026-10-10 22:07:58
呼声持续高涨!给企退人员发生活补贴,弥补历史上的待遇差距

呼声持续高涨!给企退人员发生活补贴,弥补历史上的待遇差距

百科密码
2026-10-10 16:47:24
果然被岩屋毅说中了:中日缠斗到今天,日本出口额不如中国一个省

果然被岩屋毅说中了:中日缠斗到今天,日本出口额不如中国一个省

麓谷隐士
2026-10-10 00:10:04
女商务局长与前夫及九个情人的狗血剧情,够无耻

女商务局长与前夫及九个情人的狗血剧情,够无耻

雨秋闲话
2026-10-10 14:14:53
皇马TV:肮脏的内格雷拉联赛,皇马赢了完全是场史诗般的胜利

皇马TV:肮脏的内格雷拉联赛,皇马赢了完全是场史诗般的胜利

懂球帝
2026-10-11 05:47:11
高岗随刘少奇访问苏联期间,在会议上突然提议把东北变成苏联的第17个加盟共和国,斯大林听后当场讥讽道:“张作霖同志。”

高岗随刘少奇访问苏联期间,在会议上突然提议把东北变成苏联的第17个加盟共和国,斯大林听后当场讥讽道:“张作霖同志。”

人生录
2026-10-09 16:01:05
2026-10-11 07:12:49
Ai学习的老章 incentive-icons
Ai学习的老章
Ai学习的老章
3536文章数 11198关注度
往期回顾 全部

科技要闻

上世纪成熟的踏板,为何今天还会断裂?

头条要闻

港媒:梅艳芳骨灰被盗三个月无线索 歌迷会公开求助

头条要闻

港媒:梅艳芳骨灰被盗三个月无线索 歌迷会公开求助

体育要闻

十年回首:湖人三榜眼的夏天,与NBA无关

娱乐要闻

宋佳一串三大满贯 争议随之而来

财经要闻

双汇因抗生素超标共被罚1.29亿元

汽车要闻

千匹马力+三把锁/顶配能浮水 银河战舰700限时焕新价16.98万起

态度原创

家居
亲子
旅游
公开课
军事航空

家居要闻

2026建博会(广州) 公装联探展交流活动

亲子要闻

工程车小故事 :分糖果

旅游要闻

假日热度持续领跑 文旅繁花点亮金城

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

美乌将举行新一轮会谈

无障碍浏览 进入关怀版