网易首页 > 网易号 > 正文 申请入驻

Agentic AI崛起,CPU成为新的性能瓶颈

0
分享至



随着AI智能体不断调用工具、生成子智能体并处理更长的Token序列,CPU在AI基础设施中的计算负载持续增加,并逐渐成为影响整体性能的关键瓶颈。

今年早些时候,Amazon Web Services(AWS)的高层向工程师提出了一项新的要求:必须尽可能节省CPU计算资源。据报道,随着AI工作负载不断挤压公司的云基础设施,AWS的CPU服务器容量的等待时间出现了爆发式增长。

这个问题似乎让AWS措手不及,而且原因显而易见。AI的蓬勃发展导致GPU需求激增,随后内存需求也随之飙升。CPU基本没有出现在这轮增长中,因为与GPU相比,CPU的并行能力相对有限,因此并不适合AI模型推理——也就是运行并向用户提供大语言模型(LLM)服务的过程。

但随着Agentic AI(智能体AI)系统兴起,这一叙事正在发生变化。Agentic AI允许AI模型自主运行,并调用其他子智能体来完成任务。

Moor Insights & Strategy副总裁兼首席数据中心分析师Matt Kimball表示,2026年CPU需求出现了明显增长,其中很大一部分来自Agentic AI的发展。Kimball说:“让一个智能体工作,并假设它生成100个智能体是一回事。如果我要把这种模式推广到整个企业,那么这100个智能体很快就会变成数万个、数十万个甚至数百万个智能体。你会看到智能体生成子智能体、发起API(应用程序编程接口)调用,并通过Anthropic的模型上下文协议与更多智能体进行通信。”

AI agents需要使用计算机,而计算机需要CPU

Kimball所说的情况,部分涉及所谓的“工具调用(tool use)”。这是对LLM能力的一种概括,即让大语言模型访问互联网、打开桌面上的文件,以及使用各种软件来完成任务。

经过工具调用训练的LLM能够学会调用其他软件。虽然LLM的推理过程仍然主要在GPU或类似的AI加速器上执行,但LLM发起的工具调用通常会交由CPU处理。

“Agentic AI任务中的许多环节,本质上都是基于CPU的工作。”英特尔高级研究科学家Souvik Kundu解释道,“CPU负责解析输出结果、确定应该调用哪个工具、发起API调用或运行代码、收集结果,并将结果反馈回去。”AMD计算与企业AI副总裁Madhu Rangarajan也表达了类似观点。他表示:“在我们的测试中,实际Agentic AI流程的八个阶段中有七个完全在CPU上运行。”

例如,当一个LLM负责编写软件时,它很可能会调用各种工具,将代码写入文件、移动或替换文件、下载所需的软件包,并在LLM认为代码已经完成后构建软件。

Kundu与佐治亚理工学院的研究人员共同撰写了一篇关于Agentic AI优化的论文。他们发现,当LLM推理在GPU上执行时,CPU往往处于空闲状态;反过来,当工具调用在CPU上执行时,GPU又经常处于空闲状态。为了优化这一现象,Kundu及其同事提出了调度优化方案。在持续负载下,该方案最多可以将端到端延迟,即Agentic AI工作负载从开始到结束所需的时间,降低至原来的约1/1.8,也就是性能提升最高约1.8倍。

这只是一个开始,但这种性能提升面对的是一个不断变化的目标。Agentic AI系统能够以机器的速度产生工作,并在运行过程中不断放大工作量。OpenAI曾无意间“入侵”Hugging Face,其模型在一个小时内发起了多达300次操作,而一个智能体还可以生成自己的子智能体,由后者继续发起工具调用。

此外,还有一个重要因素可能会随着模型变得更加复杂而进一步增加CPU的工作负载,那就是安全护栏(safety guardrails)。

Kundu表示,对agents行为进行安全和策略检查,通常需要依据特定规则检查语法和日志文件。安全护栏也可能使用小型模型(参数量低于10亿)来分析任务复杂度或意图。虽然这些任务也可以在GPU上执行,但实际情况往往并非如此,因为这些模型规模较小,同时又需要尽可能降低延迟,因此相关工作通常会留在CPU上执行。



增加可用 CPU 的数量可以显著降低 Llama-8B 对较长序列长度的响应延迟。来源:Euijun Chung、Yuxiao Jia 等。

Tokenization进一步加剧CPU瓶颈

Euijun Chung佐治亚理工学院博士生Euijun Chung近期与其他研究人员共同撰写了一篇论文,其研究结果与Kundu的研究相辅相成。

Chung及其合作者发现,当服务器的CPU核心数量不足时,系统在向GPU分发工作方面会逐渐跟不上。这会导致GPU因为等待指令而停顿。

除此之外,这篇论文还涉及LLM工作负载中的另一个关键环节:Tokenization(Token化)。

Tokenization是LLM推理关键的第一步,它会将文本转换成模型能够处理的整数Token ID。与大多数LLM推理所需要的矩阵运算不同,Tokenization属于具有大量分支、依赖数据的顺序字符串处理。虽然可以通过将文本分块来实现并行处理,但它并不像LLM推理的大部分计算那样具备大规模并行能力。

对于较短的提示词而言,Tokenization是一项相对简单的任务,即使是入门级CPU也不会承受太大压力。然而,一个会发起工具调用的Agentic AI模型,还必须对工具调用返回的结果进行解析和Tokenization。

Chung表示:“假设你有一个持续进行的序列,其中包含10万个Token,而一次工具调用返回了1000个Token,那么Tokenizer就必须再次对整个序列进行Tokenization。而且,每一次Agentic工具调用都需要进行Tokenization。”这不仅提高了Tokenization发生的频率,也增加了每次需要处理的Token数量。Chung认为,未来的Tokenizer或许能够找到缓解这一问题的方法,但对于当前的LLM推理而言,这仍然是一个问题。

论文发现,首Token生成延迟(time-to-first-token),即模型生成回复中的第一个词所需的时间,会随着序列长度增加而大幅上升。增加CPU核心数量可以缓解这一问题。在更长序列的测试中,增加CPU核心数量可以将首Token生成延迟降低约1.5倍至7倍。

由于测试硬件存在限制,Chung及其同事只能测试规模相对较小的模型,例如阿里巴巴的Qwen 3-30B和Meta的Llama 3.1-70B。他推测,更大型的模型可能因为整体GPU需求更高,而不会出现如此明显的CPU瓶颈,但同时他预计Agentic AI会将Token序列长度推向远超其团队测试范围的水平。

Chung表示:“如果你考虑Anthropic的Claude这样的模型,很容易就会达到50万个甚至100万个Token。在Agentic AI的世界里,平均序列长度会不断增长,所以我预计这个问题在未来的工作负载中会变得更加严重。”

CPU紧缺才刚刚开始吗?

亚马逊开始限制CPU资源使用,只是Kundu和Chung发现其研究具有现实意义的诸多迹象之一。

Intel的服务器CPU至少已经到年底前都已售罄。AMD已经将服务器CPU预测产量翻倍。Arm和Qualcomm都宣布了专门用于加速Agentic AI的新型CPU。就连NVIDIA也将基于Arm架构、面向Agentic AI的Vera CPU优先推出,该处理器也是NVIDIA Vera Rubin平台的一部分。

Kimball表示,这些发展清楚表明,AI行业正在更加重视CPU性能。他认为,CPU需求的激增是一个“绝对明显的信号”,说明CPU如今已经被视为Agentic AI系统的关键组成部分。

遗憾的是,这可能会进一步演变为更广泛的CPU短缺和价格上涨,就像此前GPU和内存市场已经出现的情况一样。

Kimball表示:“我们已经在某种程度上看到CPU紧缺了。从市场限制来看,这种趋势甚至蔓延到了消费领域。”他补充说,尽管英特尔新的18A制程推动了公司客户端业务的销售增长,但英特尔仍然削减了客户端CPU的产量,转而优先生产服务器CPU。在Kimball看来,这表明CPU厂商将会向更具商业价值的市场倾斜。

*声明:本文系原作者创作。文章内容系其个人观点,我方转载仅为分享与讨论,不代表我方赞成或认同,如有异议,请联系后台。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
上海一泌尿科医生坐高铁回老家探亲,结果临时接生了一个娃

上海一泌尿科医生坐高铁回老家探亲,结果临时接生了一个娃

上观新闻
2026-09-09 19:43:53
墙皮都烧卷了,值班员还在电话里“走流程”:“领导咋整?”

墙皮都烧卷了,值班员还在电话里“走流程”:“领导咋整?”

小鹿姐姐情感说
2026-09-08 05:34:56
癌的源头已发现?咸菜没上榜,第1名大家或天天都在吃

癌的源头已发现?咸菜没上榜,第1名大家或天天都在吃

垚垚分享健康
2026-08-26 16:21:31
不出意外,下半年开始,房地产、物业、中介将迎来行业新一轮洗牌

不出意外,下半年开始,房地产、物业、中介将迎来行业新一轮洗牌

细说职场
2026-09-09 10:54:11
1949年划江而治险成真!幸亏没听美苏的,不然中国多惨

1949年划江而治险成真!幸亏没听美苏的,不然中国多惨

小豫讲故事
2026-09-08 06:00:10
汉族血统相对纯正的5大姓氏,你的姓在列吗

汉族血统相对纯正的5大姓氏,你的姓在列吗

糖逗在娱乐
2026-09-01 00:21:11
龙珠:按理说贝吉塔长大后应该是这样子啊

龙珠:按理说贝吉塔长大后应该是这样子啊

动漫心世界
2026-09-09 15:37:23
5800万年轻人不交社保了:断缴的不是懒惰,是生存的算术

5800万年轻人不交社保了:断缴的不是懒惰,是生存的算术

互联网大观
2026-07-21 10:03:18
比弹尽粮绝更可怕,最大危机浮现,普京要押上全部身家梭哈乌克兰

比弹尽粮绝更可怕,最大危机浮现,普京要押上全部身家梭哈乌克兰

民间胡扯老哥
2026-09-06 06:35:38
“这个工作强度,你跟我讲工作态度?”

“这个工作强度,你跟我讲工作态度?”

中国新闻周刊
2026-09-08 20:55:46
四年级男孩周末独自在家上吊身亡,父母索赔70万被法院驳回:这次,网友吵翻了

四年级男孩周末独自在家上吊身亡,父母索赔70万被法院驳回:这次,网友吵翻了

教师吧
2026-09-07 17:17:34
简直就是奇迹:美国林肯号航母5000多大兵在芭堤雅疯狂玩了5天,竟然仅有2个打架的!

简直就是奇迹:美国林肯号航母5000多大兵在芭堤雅疯狂玩了5天,竟然仅有2个打架的!

步论天下事
2026-09-07 09:40:52
大降价果然立竿见影!8月奔驰E级又交付9200台!市场成绩确实优秀

大降价果然立竿见影!8月奔驰E级又交付9200台!市场成绩确实优秀

沙雕小琳琳
2026-09-09 08:19:51
云南嘉华被指“实习生因工资低往鲜花饼里吐痰”“12小时工资仅50元”,当地多部门展开调查

云南嘉华被指“实习生因工资低往鲜花饼里吐痰”“12小时工资仅50元”,当地多部门展开调查

第一财经资讯
2026-09-09 14:51:47
西方为何痛批中国治沙?真相曝光:动了的不是沙子,是老外奶酪!

西方为何痛批中国治沙?真相曝光:动了的不是沙子,是老外奶酪!

史之铭
2026-08-25 17:15:36
“5涨2降”茅台自营店再调价

“5涨2降”茅台自营店再调价

胜马财经
2026-09-09 16:38:34
“出卖”父亲后果凄凉?傅作义之女傅冬菊为何至今仍被黑得如此惨?

“出卖”父亲后果凄凉?傅作义之女傅冬菊为何至今仍被黑得如此惨?

舆图看世界
2026-09-06 11:40:12
《交锋》马憩做梦也没想到!朱应甲策反曹了平,是吴声来设下的局

《交锋》马憩做梦也没想到!朱应甲策反曹了平,是吴声来设下的局

素玉姑娘
2026-09-09 15:28:34
郭德纲为啥不道歉:通报里除了罚款,还有4个字让郭德纲不敢露面

郭德纲为啥不道歉:通报里除了罚款,还有4个字让郭德纲不敢露面

做一个合格的吃瓜群众
2026-09-08 18:08:32
新疆小伙开学带100斤自制切糕到重庆分享给老师同学,家人辛苦做了三天,班上每人能分到1斤,此前还带过烤全羊和瓜果

新疆小伙开学带100斤自制切糕到重庆分享给老师同学,家人辛苦做了三天,班上每人能分到1斤,此前还带过烤全羊和瓜果

极目新闻
2026-09-08 16:36:16
2026-09-09 21:28:49
半导体产业纵横 incentive-icons
半导体产业纵横
探索IC产业无限可能。
3274文章数 1348关注度
往期回顾 全部

科技要闻

AI重大突破!OpenAI称解开近百年数学难题

头条要闻

人民日报:4岁男童的肢体接触 不是制造流量漩涡的素材

头条要闻

人民日报:4岁男童的肢体接触 不是制造流量漩涡的素材

体育要闻

16年后再破门,被皇马放弃的少年没认输

娱乐要闻

郭德纲的商业版图,藏着不知道的真相

财经要闻

知情人士证实DeepSeek备战科创板IPO

汽车要闻

红旗HS7 PHEV申报图曝光 尺寸升级/搭载激光雷达

态度原创

亲子
本地
教育
家居
手机

亲子要闻

开学后,如果孩子总眨眼、摇头、清嗓子,警惕妥瑞症

本地新闻

宁波,中国制造的隐藏大佬

教育要闻

帮信罪不是大学生的「专利」:开学季,这几样东西别让孩子随手借出去

家居要闻

2026建博会(广州) 公装联探展交流活动

手机要闻

iPhone 18 Pro涨价幅度或低于预期 传仅上调100美元

无障碍浏览 进入关怀版