今年早些时候,亚马逊网络服务(AWS)的领导层向工程师们下达了一项新指令:不惜一切代价节约CPU资源。据报道,随着人工智能工作负载给AWS的云基础设施带来巨大压力,其CPU服务器容量的等待时间出现了激增。
这个问题似乎让AWS措手不及,而且原因显而易见。人工智能的蓬勃发展导致GPU需求激增,随后内存需求也随之飙升。CPU则基本被忽略,因为它们并行化能力相对较弱,不太适合人工智能模型推理——也就是运行大型语言模型(LLM)并将其提供给用户的过程。
但智能体人工智能系统的兴起,使得人工智能模型能够自主运行并调用子智能体,正在改变这种局面。
Moor Insights & Strategy副总裁兼首席数据中心分析师Matt Kimball表示,2026 年 CPU 需求激增,其中很大一部分原因是智能体人工智能 (Agentic AI)的发展。“拥有这种智能体工作负载是一回事,假设它生成 100 个智能体。如果我要在整个企业范围内推广这项技术,那么这 100 个智能体就会变成成千上万、数十万甚至数百万个,”Kimball 说。“这些智能体会生成子智能体,进行应用程序编程接口 (API) 调用,并通过 Anthropic 的模型上下文协议与其他智能体进行通信。”
人工智能代理需要使用计算机
而计算机需要中央处理器(CPU)
Kimball 的评论部分指的是“工具使用”,这是 LLM 访问互联网、在桌面上打开文件以及通常使用各种软件来完成其任务的能力的简称。
用于工具使用的逻辑学习模型(LLM)会学习如何调用其他软件。虽然LLM的推理过程仍然主要在GPU或类似的AI加速器上执行,但LLM发出的工具调用通常会被推送到CPU上。
英特尔高级研究科学家Souvik Kundu解释说:“智能体人工智能任务的许多组成部分本质上都是基于CPU的作业。CPU负责解析输出、确定要调用的工具、进行API调用或运行代码、收集结果并将其反馈给处理器。” AMD计算与企业人工智能副总裁Madhu Rangarajan也提出了类似的观点,他表示:“在我们的测试中,实际智能体人工智能流程的八个阶段中有七个完全在CPU上运行。”
例如,负责软件编程的法学硕士可能会调用工具将代码写入文件、移动或替换文件、下载所需的软件包,并在法学硕士认为软件完成后构建软件。
Kundu与佐治亚理工学院的研究人员共同撰写了一篇关于智能体AI优化的论文。他们发现,当LLM推理在GPU上执行时,CPU经常处于空闲状态;反之,当工具调用在CPU上执行时,GPU也经常处于空闲状态。为了优化这一现象,Kundu及其同事提出了一种调度优化方案,在持续负载下,该方案可以将端到端延迟(智能体工作负载从开始到结束的时间)降低高达1.8倍。
这只是一个开始,但成果难以追赶。智能体系统以机器速度生成工作,并且不断倍增。OpenAI 无意中对 Hugging Face 的攻击导致其模型每小时发出多达 300 个动作,单个智能体甚至可以生成子智能体,这些子智能体可以自行调用工具。
随着模型变得越来越复杂,还有一个重要的复杂因素可能会增加 CPU 的负载:安全防护措施。
Kundu表示,对代理行为的安全性和策略检查通常是通过检查语法和日志文件等特定规则来实现的。防护机制也可能使用小型模型(参数少于十亿)来分析任务的复杂性或意图。虽然这些模型可以在GPU上执行,但通常不会这样做,因为它们体积小,而且需要尽可能降低延迟,所以这些工作都由CPU完成。

Token化加剧了瓶颈
佐治亚理工学院博士生郑义军(Euijun Chung )近期与他人合著了一篇论文,其研究结果与昆杜(Kundu)的研究相辅相成。郑义军及其合作者发现,当服务器的CPU核心数量过少时,其向GPU分配任务的速度就会滞后。这会导致GPU在等待指令时出现停顿。
除此之外,该论文还涉及 LLM 工作负载的另一个关键要素:分词。
分词是LLM推理的关键第一步。它将文本转换为模型可以处理的整数标记ID。与大多数LLM推理所需的矩阵运算不同,分词是分支式的、数据相关的顺序字符串操作。虽然可以通过文本分块实现并行化,但它并不像LLM推理的大部分那样具有大规模并行性。
对简短提示进行词法分析相对简单,即使是入门级 CPU 也不会占用太多资源。然而,需要调用工具的智能体模型必须解析并词法分析调用结果。
“假设你有一个包含10万个词元的序列,而工具返回的结果又包含1000个词元,那么分词器就必须再次对整个序列进行分词。而且,每次智能体调用工具时都需要进行分词,”Chung说道。这既增加了分词的频率,也增加了涉及的词元数量。Chung表示,未来的分词器或许能够找到缓解这个问题的方法,但这仍然是现代逻辑逻辑推理(LLM)面临的一个难题。
该论文发现,随着序列长度的增加,首词延迟(模型生成回复中第一个词所需的时间)会显著增加。使用更多核心的CPU可以缓解这个问题。在更长序列长度的测试运行中,增加CPU核心数可以将首词延迟降低约1.5倍到7倍。
由于测试硬件的限制,Chung 和他的同事只能测试一些较小的模型,例如阿里巴巴的 Qwen 3-30B 和 Meta 的 Llama 3.1-70B。他推测,由于大型模型对 GPU 的整体需求更高,因此瓶颈效应会相对较小,但他同时也预计,智能体 AI 将会把令牌长度推向远超他和他的合作者测试过的最长长度。
“以 Anthropic 的 Claude 为例,很容易达到 50 万,甚至 100 万个令牌,”Chung 说。“在智能体人工智能领域,平均序列长度会不断增长,所以我预计这个问题在未来的工作负载中会变得更加严重。”
CPU 负载高峰才刚刚开始吗?
亚马逊对 CPU 资源使用的打击是 Kundu 和 Chung 所发现的具有现实意义的问题的几个迹象之一。
英特尔的服务器CPU至少到年底前都已售罄。AMD已将其服务器CPU的预期产量翻了一番。Arm和高通都发布了旨在加速智能体AI的新型CPU。就连英伟达也优先推出了其基于Arm架构的智能体AI CPU Vera,它是英伟达Vera Rubin平台的一部分。
Kimball表示,这些发展清楚地表明,人工智能行业越来越重视CPU性能。他认为,需求的激增是CPU如今被视为智能体人工智能系统关键组成部分的“绝对信号”。
不幸的是,这可能会导致 CPU 出现更广泛的短缺和价格上涨,就像 GPU 和内存已经出现的情况一样。
“我们已经看到一定程度的CPU供过于求。从市场限制来看,这种趋势甚至蔓延到了消费领域,”金博尔说道。他还补充说,尽管英特尔新的18A制程工艺提升了其在客户端领域的销售额,但英特尔却削减了客户端CPU的产量,转而生产服务器CPU。金博尔认为,这表明CPU制造商最终会追随利润的指引


VIP复盘网