网易首页 > 网易号 > 正文 申请入驻

CPU在智能体AI时代迎来复兴?

0
分享至

设置星标★关注,从此你的世界多点科学~


今年5月,亚马逊旗下子公司,亚马逊网络服务公司(AWS)的管理层向工程师下达一项新指令:不惜一切代价节省中央处理器(CPU)周期。

据报道,由于AI工作负载给公司的云基础设施带来巨大压力,AWS的CPU服务器资源排队等待时间激增。此问题似乎令AWS措手不及,而这不无原因。

要知道,AI热潮带动图形处理器(GPU)需求暴涨,随后内存需求也水涨船高,但CPU却几乎身处局外,因为它们的并行化程度相对不足,不适用于推理,即AI模型收到提问后生成答案的过程。

但智能体AI(agentic AI)系统的崛起正改变局面。这类系统允许AI模型自主运行,并调用子智能体。

马特·金博尔(Matt Kimball)现为美国摩尔洞察与战略咨询公司(Moor Insights & Strategy)的副总裁兼首席数据中心分析师。金博尔表示,2026年CPU需求急剧攀升,其中很大一部分增量来自智能体AI。AI智能体(AI agent)要调用计算机,计算机则离不开CPU。

“设想有一个智能体工作负载,能生成一百个智能体。如果企业大规模部署该系统,一百个智能体就能变出数万、数十万乃至上百万个智能体。智能体会不断生成子智能体,调用应用程序编程接口(API),并通过Anthropic公司的模型上下文协议与更多智能体进行交互。”

——马特·金博尔

那么,AI是如何调用计算机的?这就涉及一系列“工具调用”操作了……

AI能体要用计算机,而计算机要用CPU

所谓工具调用,是指大语言模型(LLM)访问互联网、打开桌面本地文件以及使用各类软件完成任务的能力。

大语言模型经过工具调用专项训练,能学会调用其他软件。而它们发起的工具调用任务通常交由CPU处理——尽管其推理过程主要在GPU或类似AI加速器上完成。

英特尔高级首席研究科学家苏维克·昆杜(Souvik Kundu)解释道:“智能体AI任务的诸多组成部分,本质上就是基于CPU的任务。CPU负责解析输出、判断调用哪项工具、发起API调用或运行代码、收集结果,再把结果反馈给大模型。”

举例来说,一个被指派了软件编写任务的LLM,可能发起工具调用——把代码写入文件、移动或替换文件、下载所需软件包,以及在LLM认定前置准备工作已完成后构建该软件。

昆杜曾与佐治亚理工学院的研究人员合著了一篇关于智能体AI优化的论文。团队发现,当大语言模型的推理在GPU上执行时,CPU常处于空闲状态;反过来,当CPU处理工具调用任务时,GPU又往往无事可做。

针对该问题,昆杜等人提出调度优化方案。该方案可在持续负载下,将端到端延迟,即智能体任务从开始到结束的时间,最多降低到原来的5/9。

上述成果只是行业在新方向上发力的初始尝试,但我们也要知道,性能提升的进度落后于日新月异的现实。智能体系统以机器的速度生成任务,任务量持续倍增。OpenAI曾经历失控调用Hugging Face的事故:模型每小时发起多达300次操作,单个智能体还会衍生子智能体,子智能体再发起自己的工具调用……

随着模型变得越发复杂,另一项关键因素可能增加CPU的工作负载,那就是安全护栏(safety guardrails)。

昆杜介绍,针对智能体行为的安全与策略校验,大多是用于检查语法、日志文件的特定规则。安全护栏也会使用参数量小于10亿的小型模型来分析任务复杂度或模型意图。这些检查任务理论上可由GPU处理,但通常都留在CPU上执行,一方面是因为模型规模小,另一方面原因则是需求尽可能降低延迟。

“分词”任务将CPU推向性能瓶颈

佐治亚理工学院博士生郑义俊(音译,Euijun Chung)近期参与撰写了另一篇论文,其结论和昆杜的成果互为补充。

郑义俊等人发现:当服务器的CPU核心数量过少时,它会来不及向GPU派发任务,这导致GPU因等待指令而陷入空闲停滞。

除此之外,论文还探讨了大语言模型工作负载的另一核心环节,即分词(tokenization)。

分词是大语言模型推理的首个关键步骤。它把文本转换成可供模型运算的整数型词元ID(token ID)。不同于大语言模型推理中所需的大部分矩阵运算,分词是分支繁多、依赖数据的串行字符串操作。虽然可通过文本分块(chunking)实现一定程度的并行化,但它不像LLM推理的主体部分那样具备大规模并行性。

针对简短提示词的分词任务相对简单,即便是入门级CPU也能轻松应对。但一个会发起工具调用的智能体模型,必须对调用返回的结果进行解析和分词,如此工作量对CPU而言可谓繁重。

“智能体的每一次工具调用,都要求执行一次分词。举例来说,假设有个已增长到10万词元长度的上下文序列,而某次工具调用的返回结果新增了1000个词元,由此,分词器必须再对全部序列重新分词。”

——郑义俊

显然,这既提高了分词操作的执行频次,也增加了所涉及词元的数量。未来分词技术或可寻得解题之法,但当前这道难题确实阻碍着LLM推理的发展。

郑义俊团队在论文中指出:首词元时延(TTFT),即从用户提出问题到模型回复第一个词的时间,会随着序列长度增加而大大延长;针对该问题的解决方案之一,就是提高CPU芯片的核心数量。在长序列测试场景下,通过增加CPU核心,可将TTFT降低至原来的大约2/3到1/7。


如图所示,增加可用CPU核心的数量可显著降低大模型Llama-8B在较长序列长度下的响应延迟

受硬件条件限制,团队仅测试了规模较小的模型,例如阿里通义千问系列的Qwen3‑30B和Meta公司的 Llama 3.1‑70B。他们推测:更大规模模型的GPU需求更高,CPU瓶颈带来的影响反倒会减弱;不过与此同时,智能体AI会把上下文序列长度(总词元数)推升至远超他们此前测试达到的长度上限。

“以Anthropic公司的Claude模型为例,序列长度轻松达到50万乃至100万个词元。在智能体AI 时代,平均序列长度只会不断增长。因此我预计,面对未来的工作负载,CPU瓶颈问题将愈发严重。”

——郑义俊

CPU市场库存告急

亚马逊严控CPU资源使用,只是现实世界里CPU资源紧张的信号之一,昆杜与郑义俊的工作也表明,该问题极具现实意义。

英特尔方面,其服务器CPU目前已无对外可售余量,至少到2026年底前,都不再向新客户供货。

美国超威半导体公司则上调业绩预期,将服务器CPU的预测出货量翻倍。

两家芯片设计巨头,ARM与高通均发布了专为加速智能体AI而设计的新型CPU。

值得一提的是,连英伟达也已将Vera列为重点发展项目;Vera是一款基于ARM架构(由ARM公司开发)、面向智能体AI的CPU,隶属于英伟达Vera Rubin平台。

金博尔表示,各种动向都表明AI行业越发重视CPU性能,相关需求激增可视作某种“绝对信号”,CPU 已成为智能体AI系统的核心组成部分。

另一方面,正如此前GPU和内存所遭遇的,CPU市场也很可能出现大范围缺货与价格上涨。

“从某种意义上说,现在的CPU资源已经告急了。看看市场上的各种供给限制吧!库存紧缺甚至已蔓延至消费级市场。英特尔全新的18A制程工艺带动了客户端产品线的业务营收增长,但该企业仍在削减客户端CPU产能,以优先保障服务器CPU生产。我们知道,CPU厂商的投入重心,即是大需求与大利润所在。”

——马特·金博尔

资料来源:


《世界科学》杂志版在售中 欢迎订阅

月刊定价

15元/期

全年订阅价

180元

点击左侧图片或以下方订阅方式选购

方式一

扫描二维码,“杂志铺”(第三方平台)订阅有折扣~

方式二

全国各地邮局订阅 邮发代号:4-263

方式三

机构订阅,请拨打

021-53300839;

021-53300838

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
中央纪委、财政部通报!六起地方政府隐性债务追责问责案例涉资超68亿元

中央纪委、财政部通报!六起地方政府隐性债务追责问责案例涉资超68亿元

环球网资讯
2026-09-11 16:11:08
中国驻日本大使馆:根据签证费对等安排,自9月14日起对日本公民赴华签证规费进行调整,一次签证收费16750日元

中国驻日本大使馆:根据签证费对等安排,自9月14日起对日本公民赴华签证规费进行调整,一次签证收费16750日元

上观新闻
2026-09-11 14:49:35
超63万人预约15999元iPhone Duo,有“黄牛”标价9.9万元代抢......

超63万人预约15999元iPhone Duo,有“黄牛”标价9.9万元代抢......

掌上春城
2026-09-10 23:37:03
上海体育局给了刘翔多项选择,名记:每个职位都不错但他一个都没看上,旧日情分恐到此为止

上海体育局给了刘翔多项选择,名记:每个职位都不错但他一个都没看上,旧日情分恐到此为止

尘语者
2026-09-11 09:22:16
气愤!山东泰山球迷恶意调侃青岛火灾 道歉也没用 警方做出回应

气愤!山东泰山球迷恶意调侃青岛火灾 道歉也没用 警方做出回应

念洲
2026-09-11 14:52:42
3-0!3-0!澳门冠军赛:8强诞生!张本智和剃光头,美和打疯了!

3-0!3-0!澳门冠军赛:8强诞生!张本智和剃光头,美和打疯了!

kio鱼
2026-09-11 00:16:11
虚构:中国的一部手机,竟救了总统阿萨德的命,助他顺利到达俄罗斯

虚构:中国的一部手机,竟救了总统阿萨德的命,助他顺利到达俄罗斯

红豆讲堂
2025-01-15 10:49:37
我们不是快船!13号只属于哈登,火箭队记明牌了,已拒绝所有请求

我们不是快船!13号只属于哈登,火箭队记明牌了,已拒绝所有请求

体育火锅T
2026-09-11 14:13:52
名古屋亚运会主火炬还没点燃,1274人的中国代表团先撞上四道坎——史上首个不建亚运村的亚运会,四千多人挤邮轮、两千多人住集装箱;

名古屋亚运会主火炬还没点燃,1274人的中国代表团先撞上四道坎——史上首个不建亚运村的亚运会,四千多人挤邮轮、两千多人住集装箱;

回京历史梦
2026-09-11 17:34:26
耐人寻味!一段车间裸奔视频全网发酵,瑞浦兰钧风波,远不止网传那般简单

耐人寻味!一段车间裸奔视频全网发酵,瑞浦兰钧风波,远不止网传那般简单

火山詩话
2026-09-11 05:50:16
坚决支持中国政府的严正声明,越南占领的中国岛礁全部归还

坚决支持中国政府的严正声明,越南占领的中国岛礁全部归还

叶老四
2026-09-09 13:55:36
美剧神作排行榜

美剧神作排行榜

喜欢历史的阿繁
2026-09-11 00:50:02
突发!曝知名港星雷宇扬去世,享年62岁曝最后露面照,小21岁娇妻马荔正式噩耗

突发!曝知名港星雷宇扬去世,享年62岁曝最后露面照,小21岁娇妻马荔正式噩耗

裕丰娱间说
2026-09-11 16:04:49
下午3点!CCTV5直播男篮冲击两连胜,王俊杰迎复出 赢球=小组出线

下午3点!CCTV5直播男篮冲击两连胜,王俊杰迎复出 赢球=小组出线

麦子的篮球故事
2026-09-11 14:26:52
黄金,直线拉升

黄金,直线拉升

鲁中晨报
2026-09-11 14:59:25
韩国前第一夫人金建希请求无罪判决:丈夫尹锡悦成为总统后,我失去一切财富和声誉,"婚前经营企业时,我的经济状况要好得多"

韩国前第一夫人金建希请求无罪判决:丈夫尹锡悦成为总统后,我失去一切财富和声誉,"婚前经营企业时,我的经济状况要好得多"

鲁中晨报
2026-09-11 14:31:04
罕见!希拉里·克林顿出来谈台湾问题了!

罕见!希拉里·克林顿出来谈台湾问题了!

果妈聊娱乐
2026-09-11 11:28:54
第二个菲律宾出现?主动邀请美国重启军演,中方近70年友谊喂了狗

第二个菲律宾出现?主动邀请美国重启军演,中方近70年友谊喂了狗

真的好爱你
2026-09-10 18:48:38
随着高芙1-2遭逆转,美网女单决赛2席全部诞生:世界前二霸榜

随着高芙1-2遭逆转,美网女单决赛2席全部诞生:世界前二霸榜

侧身凌空斩
2026-09-11 11:08:57
种植户给香蕉地喷3天农药,毒死隔壁5万斤牛蛙,法院:蕉农在双方共同取水口兑药,蛙农未检测水质也存在过错,自担3成,获赔33.9万元

种植户给香蕉地喷3天农药,毒死隔壁5万斤牛蛙,法院:蕉农在双方共同取水口兑药,蛙农未检测水质也存在过错,自担3成,获赔33.9万元

潇湘晨报
2026-09-11 16:49:53
2026-09-11 18:36:49
世界科学 incentive-icons
世界科学
《世界科学》编辑部运营账号
1951文章数 26958关注度
往期回顾 全部

科技要闻

苹果折叠屏比小米华为贵5000元,该怎么选

头条要闻

3名俄男子被乌女特工"招募" 女方发送自己的火辣照片

头条要闻

3名俄男子被乌女特工"招募" 女方发送自己的火辣照片

体育要闻

37岁还能场场进球,还能翻跟头!

娱乐要闻

黄晓明直言帮太多白眼狼,杨颖遭殃

财经要闻

千叶珠宝创始人夫妇失联 股价应声"腰斩"

汽车要闻

买菜车也有小乐趣 风云T7不止是台合格家用SUV

态度原创

本地
时尚
亲子
房产
公开课

本地新闻

拼假 13 天国内长线路线合集

女人不管三十还是四十,衣服都可以多穿白色,清爽百搭又减龄

亲子要闻

经济拮据,全职宝妈鼓起勇气出来找工作!找到满意岗位却陷入两难:伸手找老公拿家用,还是出门挣工资?

房产要闻

时隔7年,绿地海南再拿地!

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版