网易首页 > 网易号 > 正文 申请入驻

CPU在智能体AI时代迎来复兴?

0
分享至

设置星标★关注,从此你的世界多点科学~


今年5月,亚马逊旗下子公司,亚马逊网络服务公司(AWS)的管理层向工程师下达一项新指令:不惜一切代价节省中央处理器(CPU)周期。

据报道,由于AI工作负载给公司的云基础设施带来巨大压力,AWS的CPU服务器资源排队等待时间激增。此问题似乎令AWS措手不及,而这不无原因。

要知道,AI热潮带动图形处理器(GPU)需求暴涨,随后内存需求也水涨船高,但CPU却几乎身处局外,因为它们的并行化程度相对不足,不适用于推理,即AI模型收到提问后生成答案的过程。

但智能体AI(agentic AI)系统的崛起正改变局面。这类系统允许AI模型自主运行,并调用子智能体。

马特·金博尔(Matt Kimball)现为美国摩尔洞察与战略咨询公司(Moor Insights & Strategy)的副总裁兼首席数据中心分析师。金博尔表示,2026年CPU需求急剧攀升,其中很大一部分增量来自智能体AI。AI智能体(AI agent)要调用计算机,计算机则离不开CPU。

“设想有一个智能体工作负载,能生成一百个智能体。如果企业大规模部署该系统,一百个智能体就能变出数万、数十万乃至上百万个智能体。智能体会不断生成子智能体,调用应用程序编程接口(API),并通过Anthropic公司的模型上下文协议与更多智能体进行交互。”

——马特·金博尔

那么,AI是如何调用计算机的?这就涉及一系列“工具调用”操作了……

AI能体要用计算机,而计算机要用CPU

所谓工具调用,是指大语言模型(LLM)访问互联网、打开桌面本地文件以及使用各类软件完成任务的能力。

大语言模型经过工具调用专项训练,能学会调用其他软件。而它们发起的工具调用任务通常交由CPU处理——尽管其推理过程主要在GPU或类似AI加速器上完成。

英特尔高级首席研究科学家苏维克·昆杜(Souvik Kundu)解释道:“智能体AI任务的诸多组成部分,本质上就是基于CPU的任务。CPU负责解析输出、判断调用哪项工具、发起API调用或运行代码、收集结果,再把结果反馈给大模型。”

举例来说,一个被指派了软件编写任务的LLM,可能发起工具调用——把代码写入文件、移动或替换文件、下载所需软件包,以及在LLM认定前置准备工作已完成后构建该软件。

昆杜曾与佐治亚理工学院的研究人员合著了一篇关于智能体AI优化的论文。团队发现,当大语言模型的推理在GPU上执行时,CPU常处于空闲状态;反过来,当CPU处理工具调用任务时,GPU又往往无事可做。

针对该问题,昆杜等人提出调度优化方案。该方案可在持续负载下,将端到端延迟,即智能体任务从开始到结束的时间,最多降低到原来的5/9。

上述成果只是行业在新方向上发力的初始尝试,但我们也要知道,性能提升的进度落后于日新月异的现实。智能体系统以机器的速度生成任务,任务量持续倍增。OpenAI曾经历失控调用Hugging Face的事故:模型每小时发起多达300次操作,单个智能体还会衍生子智能体,子智能体再发起自己的工具调用……

随着模型变得越发复杂,另一项关键因素可能增加CPU的工作负载,那就是安全护栏(safety guardrails)。

昆杜介绍,针对智能体行为的安全与策略校验,大多是用于检查语法、日志文件的特定规则。安全护栏也会使用参数量小于10亿的小型模型来分析任务复杂度或模型意图。这些检查任务理论上可由GPU处理,但通常都留在CPU上执行,一方面是因为模型规模小,另一方面原因则是需求尽可能降低延迟。

“分词”任务将CPU推向性能瓶颈

佐治亚理工学院博士生郑义俊(音译,Euijun Chung)近期参与撰写了另一篇论文,其结论和昆杜的成果互为补充。

郑义俊等人发现:当服务器的CPU核心数量过少时,它会来不及向GPU派发任务,这导致GPU因等待指令而陷入空闲停滞。

除此之外,论文还探讨了大语言模型工作负载的另一核心环节,即分词(tokenization)。

分词是大语言模型推理的首个关键步骤。它把文本转换成可供模型运算的整数型词元ID(token ID)。不同于大语言模型推理中所需的大部分矩阵运算,分词是分支繁多、依赖数据的串行字符串操作。虽然可通过文本分块(chunking)实现一定程度的并行化,但它不像LLM推理的主体部分那样具备大规模并行性。

针对简短提示词的分词任务相对简单,即便是入门级CPU也能轻松应对。但一个会发起工具调用的智能体模型,必须对调用返回的结果进行解析和分词,如此工作量对CPU而言可谓繁重。

“智能体的每一次工具调用,都要求执行一次分词。举例来说,假设有个已增长到10万词元长度的上下文序列,而某次工具调用的返回结果新增了1000个词元,由此,分词器必须再对全部序列重新分词。”

——郑义俊

显然,这既提高了分词操作的执行频次,也增加了所涉及词元的数量。未来分词技术或可寻得解题之法,但当前这道难题确实阻碍着LLM推理的发展。

郑义俊团队在论文中指出:首词元时延(TTFT),即从用户提出问题到模型回复第一个词的时间,会随着序列长度增加而大大延长;针对该问题的解决方案之一,就是提高CPU芯片的核心数量。在长序列测试场景下,通过增加CPU核心,可将TTFT降低至原来的大约2/3到1/7。


如图所示,增加可用CPU核心的数量可显著降低大模型Llama-8B在较长序列长度下的响应延迟

受硬件条件限制,团队仅测试了规模较小的模型,例如阿里通义千问系列的Qwen3‑30B和Meta公司的 Llama 3.1‑70B。他们推测:更大规模模型的GPU需求更高,CPU瓶颈带来的影响反倒会减弱;不过与此同时,智能体AI会把上下文序列长度(总词元数)推升至远超他们此前测试达到的长度上限。

“以Anthropic公司的Claude模型为例,序列长度轻松达到50万乃至100万个词元。在智能体AI 时代,平均序列长度只会不断增长。因此我预计,面对未来的工作负载,CPU瓶颈问题将愈发严重。”

——郑义俊

CPU市场库存告急

亚马逊严控CPU资源使用,只是现实世界里CPU资源紧张的信号之一,昆杜与郑义俊的工作也表明,该问题极具现实意义。

英特尔方面,其服务器CPU目前已无对外可售余量,至少到2026年底前,都不再向新客户供货。

美国超威半导体公司则上调业绩预期,将服务器CPU的预测出货量翻倍。

两家芯片设计巨头,ARM与高通均发布了专为加速智能体AI而设计的新型CPU。

值得一提的是,连英伟达也已将Vera列为重点发展项目;Vera是一款基于ARM架构(由ARM公司开发)、面向智能体AI的CPU,隶属于英伟达Vera Rubin平台。

金博尔表示,各种动向都表明AI行业越发重视CPU性能,相关需求激增可视作某种“绝对信号”,CPU 已成为智能体AI系统的核心组成部分。

另一方面,正如此前GPU和内存所遭遇的,CPU市场也很可能出现大范围缺货与价格上涨。

“从某种意义上说,现在的CPU资源已经告急了。看看市场上的各种供给限制吧!库存紧缺甚至已蔓延至消费级市场。英特尔全新的18A制程工艺带动了客户端产品线的业务营收增长,但该企业仍在削减客户端CPU产能,以优先保障服务器CPU生产。我们知道,CPU厂商的投入重心,即是大需求与大利润所在。”

——马特·金博尔

资料来源:


《世界科学》杂志版在售中 欢迎订阅

月刊定价

15元/期

全年订阅价

180元

点击左侧图片或以下方订阅方式选购

方式一

扫描二维码,“杂志铺”(第三方平台)订阅有折扣~

方式二

全国各地邮局订阅 邮发代号:4-263

方式三

机构订阅,请拨打

021-53300839;

021-53300838

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
中方赴印代表团规模有多大?外交部:目前无可提供的信息

中方赴印代表团规模有多大?外交部:目前无可提供的信息

澎湃新闻
2026-09-11 15:26:29
刘翔发文后上海体育局通报:11年平均月薪7174元,几十万买断,体育人争光成了一张遮羞布

刘翔发文后上海体育局通报:11年平均月薪7174元,几十万买断,体育人争光成了一张遮羞布

李晚书
2026-09-10 15:36:04
赖清德、周玉琴遭中天封杀?统派在岛内生存空间,肉眼可见在恶化

赖清德、周玉琴遭中天封杀?统派在岛内生存空间,肉眼可见在恶化

明天后天大后天
2026-09-11 15:32:57
“阿嬷”出国在威尼斯出尽“风头”,只是好看的衣服那么多,怎么就给淑柔选了一套最丑的去走红毯?

“阿嬷”出国在威尼斯出尽“风头”,只是好看的衣服那么多,怎么就给淑柔选了一套最丑的去走红毯?

娱乐故事
2026-09-11 15:06:41
31岁李梦将征战全新女篮联赛,苏群:能力没问题

31岁李梦将征战全新女篮联赛,苏群:能力没问题

甜份超标的我
2026-09-10 17:56:57
10万起!广汽新车官宣:9月15日,正式上市

10万起!广汽新车官宣:9月15日,正式上市

科技堡垒
2026-09-10 09:49:03
宝格丽晚宴太真实!啪姐真空,Lisa鼻子尖又大,安妮海瑟薇好温婉

宝格丽晚宴太真实!啪姐真空,Lisa鼻子尖又大,安妮海瑟薇好温婉

小武侃风云
2026-09-11 02:16:59
特朗普又被指拉裤子!万斯站他身后又皱眉又扭头,画面太尴尬

特朗普又被指拉裤子!万斯站他身后又皱眉又扭头,画面太尴尬

乐享人生风雨
2026-09-10 20:08:54
这么多“刚好”、“巧合”凑在一起,你觉得公众会信吗?

这么多“刚好”、“巧合”凑在一起,你觉得公众会信吗?

走读新生
2026-09-10 17:24:39
粟裕没当上元帅的真实原因:除了毛主席,高层几乎没人主动提他

粟裕没当上元帅的真实原因:除了毛主席,高层几乎没人主动提他

呼呼体坛
2026-09-08 15:50:46
600929,重大资产重组!下周一复牌

600929,重大资产重组!下周一复牌

中国基金报
2026-09-11 20:27:06
活久见!山东一教学医院提示牌刷屏,普通号就诊或有医学生参与,评论区炸锅:这多好,普通号专家给你看诊,就是容易被参观

活久见!山东一教学医院提示牌刷屏,普通号就诊或有医学生参与,评论区炸锅:这多好,普通号专家给你看诊,就是容易被参观

火山詩话
2026-09-10 15:43:34
乌克兰眼下最大的问题并不是战后重建,而是战争结束后,大量乌克兰女性很可能找不到正常的乌克兰男性,这事比重建家园更棘手,也更难解决

乌克兰眼下最大的问题并不是战后重建,而是战争结束后,大量乌克兰女性很可能找不到正常的乌克兰男性,这事比重建家园更棘手,也更难解决

扶苏聊历史
2026-09-11 17:17:14
多地严查赵一鸣、好想来等!浙江一地检查情况公布

多地严查赵一鸣、好想来等!浙江一地检查情况公布

台州交通广播
2026-09-11 13:59:33
景甜背后的金主之谜!时间回到15年前,王思聪早已道出事实

景甜背后的金主之谜!时间回到15年前,王思聪早已道出事实

文刀贰
2026-08-28 04:10:03
红亮式穿搭,特别会借灯光给自身造势

红亮式穿搭,特别会借灯光给自身造势

飛尚日记
2026-09-11 07:54:15
16个月宝宝托班第二天埋头抹泪:那张让全网心碎的照片

16个月宝宝托班第二天埋头抹泪:那张让全网心碎的照片

心理咨询师阿秋
2026-09-09 19:02:03
彻底弃用!巴萨 10 亿违约金天才陷入绝境!弗里克直接放弃

彻底弃用!巴萨 10 亿违约金天才陷入绝境!弗里克直接放弃

澜归序
2026-09-11 08:02:22
我和前妻离婚半年了,昨晚喝醉后给她发了条信息:能回来睡一晚吗

我和前妻离婚半年了,昨晚喝醉后给她发了条信息:能回来睡一晚吗

千秋文化
2026-08-24 20:22:09
带老婆满世界旅游,一年不露几次面,耐克为啥每年花1400万养刘翔

带老婆满世界旅游,一年不露几次面,耐克为啥每年花1400万养刘翔

往史过眼云烟
2026-09-11 19:52:44
2026-09-11 20:59:00
世界科学 incentive-icons
世界科学
《世界科学》编辑部运营账号
1951文章数 26958关注度
往期回顾 全部

科技要闻

苹果折叠屏比小米华为贵5000元,该怎么选

头条要闻

打假网红"铁头"获刑8年:以曝黑料威胁向主播索要黄金

头条要闻

打假网红"铁头"获刑8年:以曝黑料威胁向主播索要黄金

体育要闻

37岁还能场场进球,还能翻跟头!

娱乐要闻

黄晓明直言帮太多白眼狼,杨颖遭殃

财经要闻

女装“玖姿”母公司跨境贸易迷局:安正时尚说谎了吗?

汽车要闻

买菜车也有小乐趣 风云T7不止是台合格家用SUV

态度原创

手机
时尚
本地
公开课
军事航空

手机要闻

苹果公布iPhone 18 Pro系列手机维修预估费用:电池服务1048元

女人不管三十还是四十,衣服都可以多穿白色,清爽百搭又减龄

本地新闻

Onestage x 乐华娱乐暑期巡回选拔2026

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

涉伊朗核问题 中国和俄罗斯投下反对票

无障碍浏览 进入关怀版