随着人工智能推理在全球工作负载中占比越来越大,人工智能基础设施的讨论方向也发生了转变。计算成本不再是唯一的限制因素。真正的瓶颈日益在于内存,Counterpoint Research 的预测显示,内存供应紧张的趋势将持续到 2027 年甚至更久。HBM 内存依然价格昂贵且容量有限。通过增加服务器数量来扩展系统会导致 DRAM 内存闲置、互连流量增加以及电力成本上升。相同的数据最终会在各个节点上重复存储,超过一定限度后,增加服务器数量并不能真正提升吞吐量。
Compute Express Link (CXL) 是应对内存压力的最可靠方案,它利用内存池来平衡负载,从而将 HBM内存留给最关键的应用场景。CXL 2.0 产品已开始出货,CXL 3.x 终端设备也已陆续上市,交换机正进入真正的评估阶段。真正的转折点在于支持 CXL 3.x 的 CPU 的问世,预计将于 2027 年初发布,届时大规模开发才成为现实。市场规模预计将十分可观,据Yole Group估计,到 2028 年,全球 CXL 组件市场规模将超过 150 亿美元。
但 CXL 并非即插即用的内存升级方案。如果仅仅将其视为另一层 RAM,很容易误判 CXL 的适用范围、哪些工作负载会从中受益以及如何才能稳定运行。超大规模数据中心在考虑在其基础设施中部署 CXL 之前,需要做出三个关键决策。
1.
当今最适合 CXL 的方案
超大规模数据中心达到传统横向扩展内存极限的第一个症状很常见:GPU 内存已满,但计算能力仍然未得到充分利用,工作集成为瓶颈。服务器平台不断增加 DIMM 通道和插槽,但运营商仍然面临内存压力。大型数据集、键值缓存、向量索引和分析工作集在节点间重复存储,增加了功耗、网络流量和系统成本,但实际性能却未必有所提升。
当运营商需要更多可寻址内存、更高的内存利用率,或者正在评估一种能够减少不必要数据移动的计算内存解决方案时,CXL 是最佳选择。它并不能替代 HBM。训练仍然严重依赖于 HBM 带宽,而且相对于本地 DRAM,CXL 会增加延迟。
更恰当的问题是,工作负载从增加容量中获得的收益是否大于从增加延迟中获得的损失。对于温度较高或访问频率较低的数据,这种权衡通常是可以接受的。但如果替代方案是远程内存、SSD 访问或增加服务器数量,那么 CXL 是更好的选择。
2.
哪些工作负载受益
CXL 最适合的工作负载是 AI 推理,尤其是长上下文键值缓存,以及 RAG、向量数据库和内存分析。随着 AI 应用的普及,以及企业对令牌成本的日益关注,推理应用场景正是利用 CXL 节省运营成本的最佳应用场景。
键值缓存 (KV cache) 的容量会随着上下文长度和并发请求数的增加而扩展。内存规划不能再基于单个节点上的模型权重大小,而变成了一个机架级问题,需要同时考虑 HBM、DRAM、CXL 内存和 SSD 支持的多层存储。当本地内存开始迫使用户做出权衡时,分层存储就变得至关重要:例如,更短的上下文、更少的并发请求、更小的批处理大小、更多的重复计算或溢出到速度较慢的存储设备。具体的阈值取决于模型和服务配置,但信号始终不变:当内存容量在计算资源尚未被充分利用之前就限制了服务时,就出现了问题。
对于 RAG 和向量数据库而言,主要瓶颈在于索引大小。随着向量索引的增长,将其完全保存在内存中变得越来越困难。当索引溢出到 SSD 或分布到更多节点时,就会增加 I/O 操作并导致更高的检索延迟。CXL 扩展通过增加可寻址内存池来缓解这一问题。支持近数据处理的 CXL 产品可以通过在更靠近数据的位置处理某些操作来进一步提升性能,从而减少需要回传到 CPU 或 GPU 的操作量。纯粹受带宽限制的工作负载可能无法仅通过扩展来获益,但如果内存已满而计算和带宽仍有余量,CXL 则可以提供帮助。
3.
什么决定了生产的可靠性
一致性在实践中至关重要,而不仅仅是在架构图中。运维人员希望扩展内存的行为符合内存规范,而不是像一个需要手动管理副本的独立 I/O 设备。如果没有合适的一致性模型,软件就必须处理更多的副本、同步和一致性问题。
内存池化提供了更大的灵活性,但也提高了编排、隔离和安全性方面的要求。其前提条件是控制和可见性:哪些工作负载正在使用池化内存,性能如何变化,延迟目标是否得到满足。
当内存跨主机共享时,故障域会扩大。可重用或以读取为主的数据更容易共享。敏感数据、不断变化的数据或对延迟要求极高的数据应保持隔离。运维人员需要监控内存错误、链路健康状况、延迟、带宽和设备状态,并在部分内存池发生故障时启用备用方案。
RAS(可靠性、可用性和可维护性)特性在人工智能基础设施中比在传统服务器中更为重要。ECC(纠错码)、错误跟踪、遥测、中毒处理、链路可靠性和故障隔离等功能对于在内存问题影响高负载的GPU工作负载之前,及早发现性能下降的迹象至关重要。其目标在于预防,而非仅仅纠正。
透明分层可以将 CXL 内存作为额外的内存层公开,只需对应用程序进行极少的更改,即可轻松实现。通过 SDK 或运行时 API 进行工作负载感知优化,可以更有针对性地放置数据,以用于键值缓存、向量搜索或分析,从而获得更大的性能提升。
回应怀疑论者
一些媒体认为,在带宽受限的环境下,基于 PCIe 的互连技术性能大约比以太网式 SerDes 差 3 倍。如果将 CXL 视为高带宽网络、RDMA 式网络架构或 GPU 互连技术的替代方案,那么这种批评是合理的。
但CXL的用途并非如此。CXL应该专注于容量扩展、内存池化和共享、数据一致性、键值缓存管理以及减少数据移动。具体到键值缓存,研究表明,基于CXL的共享内存比基于RDMA的方法更具吸引力。
做出决定
在进行部署之前,运营商应验证 CPU 支持、BIOS 和固件就绪情况、交换机互操作性、软件支持、管理工具以及实际工作负载性能。长上下文 LLM 推理是最佳的初始工作负载之一。它受限于容量、可衡量,并且可以在进行更深层次的应用变更之前,从透明分层开始。
当试点项目在相同的基础设施上至少取得一项显著成果时,即可视为成功:更大的上下文支持、更多的并发请求、更少的服务器、更高的GPU利用率、更低的网络流量、更低的CPU开销或更低的单令牌成本。内存利用率、GPU利用率以及系统成本或单位工作功耗是最重要的指标。
CXL 已为严肃的基础设施规划做好准备。您可以将其视为一种由工作负载驱动的架构决策,而非简单的与 HBM 的交换。CXL 使运营商能够更高效地利用现有内存——提升键值缓存性能,并能够开放更大的内存层来处理大型提示符和频繁的推理查询


VIP复盘网