扫码体验VIP
网站公告:为了给家人们提供更好的用户体验和服务,股票复盘网V3.0正式上线,新版侧重股市情报和股票资讯,而旧版的复盘工具(连板梯队、热点解读、市场情绪、主线题材、复盘啦、龙虎榜、人气榜等功能)将全部移至VIP复盘网,VIP复盘网是目前市面上最专业的每日涨停复盘工具龙头复盘神器股票复盘工具复盘啦官网复盘盒子股票复盘软件复盘宝,持续上新功能,目前已经上新至V6.5.7版本,请家人们移步至VIP复盘网 / vip.fupanwang.com

扫码VIP小程序
返回 当前位置: 首页 热点财经 中金 | Token 启示录(四):推理产业链深度-技术篇

股市情报:上述文章报告出品方/作者:中金点晴;仅供参考,投资者应独立决策并承担投资风险。

中金 | Token 启示录(四):推理产业链深度-技术篇

时间:2026-08-28 07:33
上述文章报告出品方/作者:中金点晴;仅供参考,投资者应独立决策并承担投资风险。

中金研究

随着大模型调用量快速增长,用户的推理成本提升,用户在选择模型时,不再单一追求极致的智能水平,而开始提升对成本的关注。市场关注推理优化是什么、分哪几层、有怎样的作用?我们推出了推理产业链深度报告,本篇为上篇——技术篇。我们梳理与研究了:1)推理优化技术可分为哪几层来看;2)模型算法架构、工程算法优化、推理引擎设计、异构调度等多种技术因素影响推理优化的原理


Abstract

摘要


我们认为模型推理优化可以分为模型架构优化、推理算法优化、推理引擎和基础设施调度优化四层,分层来看:


► 模型架构决定推理效率的先天上限,模型厂商通过改进计算结构降低推理成本,例如MQA、GQA等Attention机制优化,及MoE、稀疏注意力等架构创新,在扩大模型能力的同时降低计算量和显存需求。


► 推理算法通过改变模型执行方式提升推理效率,包括量化、投机解码等技术。量化通过降低模型参数精度压缩显存占用和数据搬运需求;投机解码通过小模型预测、大模型验证减少串行生成轮次,提高Token生成速度。


► 推理引擎将模型计算与硬件组织为可规模化运行的生产系统。vLLM、SGLang等开源框架已形成行业基础能力,但模型厂商仍需针对模型架构和硬件环境进行深度优化。


► 随着AI基础设施走向多芯片、多算力资源并存,异构调度成为提升整体推理效率的重要环节。通过动态匹配模型、任务与硬件资源,异构调度能够在性能和成本之间实现优化。


整体来看,我们认为推理优化逐渐演变为模型架构、推理算法、系统软件和硬件调度的协同优化,未来领先厂商的竞争优势或来自模型、推理框架和硬件之间的co-design。


风险


技术迭代导致既有优化成果贬值风险;推理优化技术演进风险。


Text

正文


推理优化技术概览



图表1:推理优化的技术架构一览表

资料来源:中金公司研究部


随着大模型调用量快速增长,用户的推理成本大幅提升,这使得用户在选择模型时,不再单一追求极致的智能水平,而开始提升对成本的关注。我们认为模型推理优化可以分为四层:


第一,模型架构优化决定推理效率的先天上限。模型在训练阶段通过改变计算结构降低推理成本,例如Attention机制范式迭代(如MQA、GQA、MLA)、MoE架构和稀疏注意力等。MQA、GQA通过减少KV Cache规模降低显存压力;MLA进一步压缩Attention中的KV表示,提高长上下文推理效率;MoE则通过稀疏激活机制,在扩大模型参数规模的同时降低单Token计算量。


第二,推理算法优化通过改变模型执行方式降低单位Token成本。量化通过降低模型参数精度压缩显存占用和数据搬运需求,例如FP8、INT8、INT4等低精度推理方式,但实际收益取决于硬件对低精度计算的原生支持以及推理框架适配能力。投机解码通过小模型预测候选Token,并由大模型验证,减少自回归生成过程中的串行计算轮次,提高生成速度。


第三,推理引擎将模型计算和硬件资源组织为可规模化运行的生产系统,提高单位GPU算力利用率。推理系统负责请求调度、KV Cache管理、Kernel优化以及跨卡跨节点执行等环节。近年来代表性技术包括PD分离、KV Cache分层管理、跨卡与跨节点执行优化等。vLLM、SGLang等开源框架已将Continuous Batching、KV Cache管理等能力沉淀为行业基础设施,但不同模型架构、芯片环境和业务流量下,端到端推理效率仍存在差异。因此,头部模型厂商通常会在开源框架基础上开发针对自身模型和硬件环境的专有优化,实现模型架构、推理系统和硬件的深度协同。


第四,基础设施调度优化进一步提升多类型算力资源的使用效率。随着GPU、国产AI芯片和专用加速器等多种硬件并存,异构调度需要根据任务类型、模型规模和成本约束进行动态资源匹配,在性能和成本之间进行优化。考虑到国内企业通常存在海外GPU、多类国产芯片以及私有化部署并存的情况,异构调度具备较强的商业价值。


总体来看,我们认为推理优化并非单一环节的技术突破,而是模型架构、推理算法、系统软件和硬件调度多层能力共同作用的结果。未来领先厂商的核心竞争力或将来自模型、推理框架和硬件之间的持续Co-design。通过多层优化协同,厂商能够在相同模型能力下实现更低推理成本和更高任务完成效率。


一、模型在训练阶段的架构决定了什么?




推理阶段输出效率的瓶颈是什么?从经典的Transformer架构说起


从共识性但需要作为基础的内容说起:生成式模型通常先经历prefill(预填充)阶段,再进入逐token生成(decode)阶段。


图表2:生成式模型的prefill和decode阶段

资料来源:Unleashing Llama's Potential: CPU-Based Fine-Tuning - InfoQ,中金公司研究部


► Prefill(预填充)阶段是模型生成回答前的上下文处理环节。当输入一段提示词时,模型会利用并行计算能力,一次性读取并处理所有的输入Tokens,计算出它们之间的注意力权重,并生成KV Cache存储在显存中。这个阶段是典型的计算密集型(Compute-bound)任务,主要依赖GPU强大的矩阵乘法算力,其核心目的是完成对已知信息的编码,为后续逐字生成的Decode提供历史状态支撑。


► Decode(解码)阶段是模型生成回答的具体文本输出环节。当Prefill阶段完成后,模型受限于自回归特性,只能采取串行计算的方式,利用已有的历史信息逐字预测并生成下一个Token,同时将新生成Token的特征状态追加更新到显存的KV Cache中。这个阶段是典型的访存密集型(Memory-bound)任务,由于每次生成新词都需要从显存中读取庞大的KV Cache数据送入计算单元,它极度依赖GPU的显存读写带宽而非纯粹的矩阵乘法算力,其核心目的是将前期编码的历史状态逐步推断为连贯的文本流。


经典的Transformer架构使用全注意力(Full Attention)与多头注意力机制(Multi-Head Attention,MHA)。但在Agent场景下,超长上下文给模型带来以下两个局限性:


► 在标准的全注意力机制下,输入序列中的每一个Token都需要与所有其他Token计算相关性。这种全局计算的时间复杂度和显存占用与序列长度N呈平方级O(N²)增长。当上下文长度拉长时,Prefill阶段的计算量随序列长度呈平方级增长,导致首字响应时间(TTFT)拉长至用户无法忍受的程度。


► 在标准MHA中,每一个注意力头(Head)都拥有独立的一组K和V。在逐字生成的Decode阶段,为了避免重复计算,模型会将历史Token的Key和Value矩阵缓存下来,即KV Cache。在长文本场景下,KV cache的体积将快速增长,并带来Decode阶段的访存带宽限制。


图表3:经典Transformer架构图

注:一段输入文本先经过编码,再在解码条件下逐步生成输出;图示是原始Transformer的编码器—解码器结构,主流生成式LLM多为decoder-only。

资料来源:Attention Is All You Need,中金公司研究部


图表4:多头注意力机制

注:多头注意力机制通过并行注意力头学习不同表示子空间的信息
资料来源:Attention Is All You Need,中金公司研究部


因此,为了解决这种架构带来的计算量和访存带宽的限制,并适应Agent长上下文和并发任务的推理需求,大模型厂商在模型算法架构、工程优化等方面进行了深度的推理优化:


► 算法架构:算法架构决定了一个模型的“先天基因”。注意力机制的计算逻辑、混合专家(MoE)的路由策略等网络结构定义在模型的代码中,而训练得出的参数权重则以模型文件形式存储。大模型厂商在开发新模型时,面临的核心挑战是如何在有限的算力和显存开销下,尽可能提升模型的智能水平。因此,注意力机制范式的迭代(如MQA、GQA)、MoE架构的推出,都是厂商在算法架构层面对推理成本进行优化的结果。我们在算法架构侧聚焦注意力机制的演变,分析其如何解决计算量/访存开销与模型智能水平之间的权衡。


► 推理优化:推理优化是大模型落地时的降本工具。不同于算法架构的顶层设计,推理优化侧重于软件算法与底层硬件的量身定做(工程实现)。针对不同的注意力架构、不同的异构算力芯片,推理侧的工程师需要设计专属的优化策略(如算子融合、显存管理优化、量化等),从而打破显存墙与计算墙,使得单位算力能够更加高效地输出Tokens。


模型架构决定推理效率的先天边界。稠密模型(Dense)每个Token通常读取并计算大部分权重;MoE模型仅激活部分专家,总参数仍影响权重存储和跨卡放置,但单Token计算量主要受激活参数影响。此外,即使激活参数相近,Attention复杂度、KV Cache规模、专家路由和通信模式也会带来显著性能差异。我们认为模型架构设计决定了推理效率的理论空间,实际收益仍需专用Kernel、推理引擎、并行策略和硬件支持共同兑现。


模型架构优化可归纳为三类约束:MoE减少每个Token实际调用的参数量,稀疏或线性注意力减少Token之间的连接,从而降低计算量;GQA、MLA与局部或混合注意力压缩KV Cache或降低其增长速度,从而缓解显存容量与带宽压力;在多卡部署中,MoE的专家数量、粒度与路由方式决定Token在不同GPU之间的数据交换量,KV Cache的规模及切分方式也会影响跨卡通信开销。



MoE:减少激活参数,缓解计算压力


MoE架构持续演进,更多专家、更低激活逐步成为行业共识。混合专家(MoE,Mixture-of-Experts)模型保留大规模参数总量,每个Token仅激活少数专家,以稀疏计算换取参数效率。近期主流模型沿更细粒度专家划分、共享专家机制、更低激活比例的方向持续演进:1)DeepSeek-V3:每个MoE层配置256个路由专家与1个共享专家,每个Token仅激活8个路由专家;2)阿里Qwen3-Next-80B-A3B:总参数800亿,激活参数仅约30亿(激活率约3.75%),采用512个路由专家,每个Token激活10个路由专家叠加1个共享专家。3)Kimi K3:开源3T级模型,总参数达2.8万亿。K3配置896个路由专家,每个Token激活16个专家,结构改进相较Kimi K2带来约2.5倍的整体扩展效率提升。我们认为,更宽的专家池也带来更大的权重存储与跨卡通信压力,All-to-All通信开销随专家数量增长而上升,对推理框架的分布式调度能力提出了更高要求。


图表5:DeepSeek MoE由传统Top-2路由演进至细粒度专家与共享专家

资料来源:DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models,中金公司研究部



稀疏注意力:减少Token连接,降低长上下文计算复杂度


稀疏注意力的核心思路,是不再让每个token都与全部历史token发生注意力交互,而是只保留其中一部分连接。常见的实现方式包括滑窗注意力、分块等[1]。


混合注意力:兼顾全局建模与局部计算效率,成为前沿模型主流路线


当前大多厂商大多采取混合注意力机制。长上下文推理的核心矛盾在于,全注意力能让每个token看到完整上下文,信息交互最充分,但计算量和KV Cache压力会随着上下文长度快速上升;而稀疏或线性注意力,又可能损失远距离依赖、精确检索和复杂推理能力。因此,当前前沿模型主要架构侧重于在两者之间做混合,大部分层采用稀疏或线性结构,以较低成本处理局部信息和高频模式;少数关键层保留全局注意力。


图表6:前沿模型的注意力机制一览

资料来源:《Longformer: The Long-Document Transformer》(Beltagy, Iz, et al.,arXiv preprint arXiv:2004.05150,2020),《Kimi Linear: An Expressive, Efficient Attention Architecture》(Kimi Team, et al,arXiv preprint arXiv:2510.26692,2025),Hugging Face,中金公司研究部


Kimi K3通过KDA(Kimi Delta Attention)实现了长上下文线性注意力的工程化落地。K3的模型架构、算子设计与内存管理实现了系统级协同优化:模型采用3:1的比例混合KDA与Gated MLA(门控多头潜在注意力);通过限制衰减参数数值范围,使KDA计算得以改写为规则矩阵乘法并落到Tensor Core上执行,配合自研Flash KDA算子融合Token并行计算与跨Chunk状态传播,将算法设计对齐至GPU高吞吐计算单元。在缓存管理层面,K3将随上下文长度增长的MLA的KV Cache与固定大小的KDA递归状态纳入统一分页内存池,并以细粒度保存KDA状态检查点,使命中共享前缀的请求可直接从检查点恢复并继续预填充,避免重复计算。


图表7:K3在MLA物理缓存页内设置细粒度哈希边界,并同步保存KDA状态检查点

注:示例中一个6,144Token物理页包含12个512 Token哈希块,命中边界B=2,560仅用于解释机制,不代表所有部署均采用相同块大小
资料来源:Kimi K3技术论文,中金公司研究部


滑窗注意力:工程成熟,以局部可见性换取近线性复杂度


其中,滑窗注意力(Sliding Window Attention, SWA)是当前应用较广、工程实现也较成熟的一类稀疏注意力形式。从机制上看,滑窗注意力将每个token的可见范围限制在最近的k个历史token内,即仅对局部窗口中的上下文计算注意力权重,而不再对完整序列执行全局两两匹配。这样一来,在窗口大小k固定时,注意力计算复杂度从O(n²)降到O(nk),因此对序列长度n呈近似线性扩展,在长上下文场景下能够显著降低计算量与显存占用。


滑窗注意力的优点在于:可在较低成本下较好保留局部依赖建模能力、生态适配相对好。从工程角度看,滑窗注意力相较动态top-k等不规则稀疏形式具有更明显的落地优势,更容易纳入主流推理框架与加速体系(如vLLM等)[2]。其局限性在于缺少远距离依赖建模。由于滑窗机制仅保留局部上下文,模型对远距离依赖的直接建模能力会受到限制;当关键信息分布在窗口之外时,往往需要依赖多层传递,或引入额外的全局注意力模块加以弥补。


图表8:滑窗注意力与全局注意力在计算复杂度上的对比

资料来源:《Longformer: The Long-Document Transformer》(Beltagy, Iz, et al.,arXiv preprint arXiv:2004.05150,2020),中金公司研究部



MLA/GQA/MQA:通过压缩KV Cache缓解显存压力


长文本场景下标准多头注意力(MHA)带来KV Cache快速增长,当前对此的主流路径是对KV Cache进行压缩。代表性优化路径主要有:多查询注意力(Multi-Query Attention,MQA)、分组查询注意力(Grouped-Query Attention,GQA)、多头潜变量注意力(Multi-head Latent Attention,MLA)。


MLA:以低维潜变量深度压缩KV Cache,逐步进入主流模型


Multi-head Latent Attention(MLA,多头潜变量注意力)由DeepSeek在2024年5月提出(DeepSeek V2)[3],先将K/V压缩为更紧凑的潜变量(latent representation),再围绕该潜变量展开后续注意力计算。相较MQA和GQA,MLA对KV Cache的压缩更深,在长上下文场景下对显存容量、带宽的改善更为明显。但在某些场景下,性能可能不及GQA;此外,它在Decode阶段计算成本较高[4]。基于MLA的代表性模型有DeepSeek-V2、V3[5]与V3.2[6]、Kimi K2和K3[7]、GLM 5系列[8]等。


MLA的核心原理可以理解为“信息压缩”。MLA将每个历史Token的Key、Value压缩为低维潜变量,推理时仅缓存压缩后的表示,类似于将每页档案压缩成一张索引卡,从而大幅降低KV Cache的显存占用与读取带宽压力。在自回归Decode阶段,每生成一个新Token都需要读取全部历史KV,上下文越长、并发请求越多,显存容量与带宽就越容易成为瓶颈。MLA降低的是每个Token的缓存宽度,因此在长上下文与高并发场景中,其收益会随请求规模放大而愈发显著。


图表9:MLA与MHA、GQA、MQA的核心差异在于缓存压缩后的潜变量

注:阴影部分表示推理期间需要缓存的数据
资料来源:DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model,中金公司研究部


MQA/GQA:以共享KV头平衡模型质量与推理效率


Multi-Query Attention(MQA,多查询注意力)。MQA由Google于2019年11月系统提出,是探索压缩KV Cache路径的经典起点[9]。MQA的核心思路是让所有query heads共享同一组key/value heads。但由于K/V表达容量被压缩得较为激进,模型质量和训练稳定性欠佳。近年来主流大模型更常在MQA的基础上继续向GQA或MLA演进,以寻求更好的精度—效率平衡。


Grouped-Query Attention(GQA,分组查询注意力)。GQA由Google在2023年5月提出[10],是介于标准多头注意力与MQA之间的折中方案。使用GQA的代表模型包括Gemma 4[11]、gpt-oss[12]、MiniMax M2.7[13]、Qwen 3.5[14]等。其做法是将多个query heads划分为若干组,在组内共享 key/value heads。与MHA相比,GQA可明显压缩KV cache;与MQA相比,其对表示能力的保留更充分,因此在效率与效果之间取得了更均衡的结果。


二、权重确定后,算法如何降低成本?



在模型架构之外,量化与投机解码是贴近模型运行时的两类核心算法。量化把权重、激活或KV Cache映射到更低位宽,减少显存占用和数据搬运;投机解码先用成本较低的草稿过程提出多个候选Token,再由目标模型并行验证,以减少自回归生成的串行轮次。我们认为,量化的收益取决于芯片是否原生支持相应格式、Kernel是否避免高精度回退;投机解码的收益取决于候选接受率、草稿成本、验证预算及服务并发,DSpark和JetSpec代表了对半自回归草稿、置信度调度与并行候选树的近期探索。训练与推理的分界并不绝对,虽然低精度原生训练与MTP草稿能力都需在训练阶段写入模型,但是其收益兑现发生在推理侧且与硬件格式和引擎实现强耦合,因此我们将其归入本章谈论。



量化:以低精度压缩显存与带宽,端到端收益取决于硬件原生支持


大模型量化(Quantization)是一种将模型权重、激活值或KV Cache,从高精度的连续浮点数表示映射为低比特的离散数值格式的软硬件协同压缩技术。量化是大规模推理的关键手段之一,通过降低权重、激活值和KV Cache的精度,可以减少内存占用、计算成本,从而直接提升吞吐量、降低延迟并扩展可支持的上下文长度。计算机在存储大模型的参数时,每一个参数都是一个数字。而精度决定了存储数字需要占用的存储容量。我们测算,以一个70B(700亿参数)的大模型为例,纯粹存放模型权重所需的显存容量:


► 采用FP16/BF16精度:存储1个数字需要16个比特(bits),2个字节(Bytes)。存放70B的参数意味着需要140GB的显存,必须至少2张A100(80GB)才能装下。


► 采用INT8/FP8精度:存储1个数字只需要8个比特(bits),1个字节(Byte)。只需要70GB,显存减少约50%。


► 采用INT4精度:存储1个数字只需要4个比特(bits),0.5个字节(Byte)。显存减少近75%。


图表10:FP16、BF16、FP8、FP4的不同浮点表示法

资料来源:Nvidia官网技术博客,中金公司研究部


硬件代际决定可用低精度格式和理论吞吐上限。量化高度依赖硬件对压缩算法的支持能力,当GPU的矩阵单元原生支持相应数据格式、Kernel能够直接调用低精度计算、推理框架避免频繁反量化与高精度回退时,模型压缩才可能转化为端到端提速。当前,低精度能力已成为AI加速器的重要产品指标:NVIDIA由A100的FP16、H100的FP8演进至Blackwell的FP4;AMD CDNA 4加入MXFP4、MXFP6与FP8矩阵能力,并由ROCm、AITER等承接Kernel适配;Intel Gaudi 3以原生FP8和BF16为主要低精度路径。


量化在工程与算法层面面临精度保持的挑战。1)将高动态范围的浮点数强制映射到有限的离散格子里,会产生截断误差。若量化策略过于激进,可能导致大模型深度推理能力下降、长文本遗忘、以及幻觉率攀升。2)大模型内部存在极少数数值极大且对精度起决定性作用的激活异常值(Outliers),如何进行混合精度隔离(对不敏感区域激进量化,对敏感区域保留BF16)是算法层的长期难点。在更小的分组方式下,个别异常数值影响范围相对有限,量化后的数值精度损失也更小,如NVIDIA Blackwell支持的NVFP4,每16个数值设置一个独立的缩放系数,而MXFP4通常每32个数值共用一个缩放系数,前者具备更小的精度损失。


量化为什么变成了大模型落地的主流优化方式之一?我们认为主要由以下几个维度的技术演进与需求共振所决定:


► 长上下文Agent场景 大参数量模型带来了极高算力需求。AI Agent渗透率提升带来了超长文本与推理场景成为需求常态;叠加基座模型的参数量持续提升。此场景下,系统并发产生的KV Cache显存消耗快速攀升,迫切需要通过低精度量化来释放显存。


► 新一代算力硬件加强对于低精度计算的支持。以NVIDIA Blackwell/Hopper以及国内主流算力芯片为代表的全新一代硬件,在底层原生普及了对FP8(包括E4M3和E5M2格式)的硬件级吞吐加速。并且,由于保留了浮点数指数位,有效避免了整数量化中的截断误差,使得量化后的模型精度损失被控制在极低范围内。


► 软件侧开源推理框架迭代推动生态闭环。随着vLLM、Tensor RT-LLM、LM Deploy等主流开源高性能推理框架的快速迭代,框架层对AWQ、GPTQ以及动态FP8矩阵乘法(GEMM)等底层算子(Kernels)的优化已经极为成熟。


► DeepSeekV3的成功带动行业趋势。以DeepSeekV3/R1等为代表的技术路线向全球证明了“FP8预训练 FP8推理”全栈链路的高性价比,以及在极小精度折损下保持模型核心能力的可行性。因此量化开始成为后续大模型厂商推理优化的重要方式。



投机解码:批量预测并验证候选Token,提升生成速度


MTP、DSpark和JetSpec是投机解码方式下的三类路径:MTP把候选生成能力写入模型训练,DSpark强化运行时置信度调度,JetSpec提高单轮候选的并行度与分支覆盖。我们认为,随着投机解码方法进入vLLM、SGLang等主流引擎,有望为推理优化算法在真实并发、采样和多轮会话下获取稳定收益。


图表11:随着MTP预测Token数量提升,单GPU推理吞吐量实现提升

注:小规模部署情景下,MTP实现预测Token数量提升

资料来源:Accelerating SGLang with Multiple Token   Prediction - LMSYS Org,中金公司研究部


图表12:投机解码作用示意图B300(vllm,M3 Eagle)

资料来源:DSpark: Confidence-Scheduled Speculative Decoding with   Semi-Autoregressive Generation,中金公司研究部


MTP:将多Token预测写入训练,为模型内生投机解码提供草稿能力


MTP(Multi-Token Prediction,多Token预测)在训练阶段让模型基于同一段上下文预测多个未来位置。MTP架构最早于2024年由Meta FAIR团队提出[15];DeepSeek-V3随后形成具有代表性的模型原生实现:主模型串接轻量预测模块,并复用向量(Embedding)与输出头;推理时,辅助模块可一次提出多个候选,再由主模型并行校验。若候选被连续接受,模型便可用一次较重的前向计算生成多个Token,形成模型内生的投机解码能力[16]。MTP并非可对任意模型打开的运行时开关,通常需要模型在训练阶段原生支持;其收益并不随预测头数量线性增加,越远位置越难预测,接受率通常随深度下降;新增预测模块还会带来计算、显存与校验开销。Kimi K3进一步表明,预训练MTP层可以继续转化为EAGLE-3式草稿模型,在训练时就为高效的投机解码铺平道路[17]。


图表13:DeepSeek-V3通过串联MTP模块预测多个未来Token。

注:该图解释MTP实现训练与结构机制,不代表线上加速比例。

资料来源:DeepSeek-V3 Technical Report,中金公司研究部


DSpark:以半自回归草稿和置信度调度提升高并发效率


DSpark将半自回归草稿与硬件感知校验长度结合。DSpark在2026年7月由DeepSeek主导发布。DSpark先用较重的并行主干一次生成一组草稿表征,再用轻量顺序模块恢复候选之间的依赖关系,并依据置信度动态决定送交主模型校验的前缀长度。与固定草稿长度相比,这一设计试图在高置信度时多验证、低置信度时少验证,使投机解码适应不同请求和服务器负载,有助于在用户体验和推理效率之间取得平衡。以DeepSeek-V4为例,在相近总吞吐下,DSpark使V4-Flash单用户生成速度提升约60%-85%,V4-Pro提升约57%-78%[18]。


图表14:DSpark以并行主干、顺序轻量头和置信度调度共同生成草稿

注:Hardware-Aware Prefix Scheduler表示按置信度与硬件代价选择校验前缀
资料来源:DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation,中金公司研究部


JetSpec:以并行候选树扩展单轮校验空间


JetSpec提出并行候选树,有助于扩大单轮可验证空间。JetSpec在2026年6月由阶跃星辰与高校团队共同提出,在冻结目标模型的基础上增加轻量草稿头,一次前向生成多分支候选树,再由目标模型统一校验。与逐Token草稿相比,该方法希望提升单轮候选数量;与彼此独立的并行预测相比,其因果掩码保留每条分支内部的条件依赖,从而缓解并行越宽、候选越不准的矛盾。根据JetSpec论文,在H100、Qwen3模型上,MATH-500(数学数据集)最高获得9.64x端到端加速,开放式对话加速最高为4.58x[19]。


图表15:JetSpec从目标模型中提取特征,并用因果并行草稿头生成候选树。

注:候选树扩大单轮校验空间,但树宽增加也会提高草稿与校验成本。
资料来源:JetSpec: Breaking the Scaling Ceiling of Speculative Decoding with Parallel Tree Drafting,中金公司研究部


三、推理引擎:组织模型、请求与算力,提高单位GPU产出



推理引擎把模型架构和优化算法编排为可调度的生产系统。推理引擎的核心模块包括请求调度与连续批处理、模型执行与Kernel选择、KV Cache与显存管理,以及量化、投机解码等优化策略。vLLM、SGLang等开源框架已将Paged Attention、前缀缓存、分块预填充等相对成熟的能力沉淀为公共基线,显著降低了部署门槛,但是相同功能在不同模型、芯片和流量下的端到端效率仍有明显差异,因此头部模型厂商普遍选择自研闭源引擎。


我们认为推理引擎的竞争重点在于:1)新模型发布首日完成架构解析、算子补齐与精度验证;2)针对MLA、MoE、混合注意力等结构开发专用Kernel,并与低精度格式、互联拓扑和并行策略协同;3)在PD分离与多节点执行下完成SLO约束下的全局调度。核心观测指标包括固定SLO下的tok/GPU/hour、P95/P99时延、GPU有效利用率、新模型适配周期、Kernel复用率、故障恢复能力等,以及性能优势能否跨模型版本和硬件代际延续。



推理引擎:统筹请求调度、模型执行、缓存管理与加速策略


大模型推理框架是模型的推理服务软件栈,负责将用户请求转化为可在底层算力上高效执行的生成任务。推理框架需要在中间完成流量组织和资源调度:上层承接用户聊天、问答、代码生成、Agent体等应用流量,下层调用显卡、算子库、显存管理和通信资源,使模型能够以更低延迟、更高吞吐的方式持续生成结果。推理框架价值最终体现在单位算力服务能力的提升,即同样的模型和硬件配置下,可以承载更多请求,并降低单位token的生成成本。


图表16:大模型推理栈图示

资料来源:《A Survey on Inference Engines for Large Language Models: Perspectives on Optimization and Efficiency》(Park S,Jeon S,Lee C,et al,arXiv:2505.01658,2025),中金公司研究部



开源推理框架:普惠性降低模型部署门槛


推理引擎是连接大模型与AI芯片的执行软件层。推理引擎覆盖推理中的Prefill、Decode阶段,负责模型加载、算子执行、KV Cache管理、请求调度及Token生成,核心在于通过系统级优化提高单位算力的有效Token产出。目前主流开源推理引擎包括vLLM、SGLang等,两者技术均涵盖注意力优化、连续批处理、分块预填充、前缀缓存、量化、投机解码、PD分离等主流优化方向。vLLM基于Paged Attention起家,分页管理KV Cache降低显存碎片;SGLang基于Radix Attention组织KV Cache,自动识别并复用不同请求间的共享前缀。


图表17:主流开源推理框架的定位与适用场景

资料来源:vLLM、NVIDIA TensorRT-LLM、SGLang、LMDeploy、Hugging Face TGI,中金公司研究部


实际经营中,大多数企业使用开源推理框架,但仍存在基于开源框架调优的需求,为什么会产生这样的需求?随着长文本、慢思考(如交错思维链)以及异构算力(英伟达卡与国产芯片混跑)的爆发,推理的瓶颈已经从单卡内存蔓延到了跨节点通信。传统的开源vLLM框架已不再能满足各类模型厂商的实际需求。各家厂商实际选择的模型算法架构需要与底层硬件深度融合,才能提高现有算力的Token输出效率。


因此,在实际中模型厂商每一次迭代模型,都同时伴随着推理框架的迭代和升级。模型厂商通常所说的“原厂调优”的信心也来源于此——自有的Infra团队最熟悉自己的模型架构和算力构成,因此可以提供最高效的Token输出。



KV Cache分层与复用:将缓存变为可调度资产


KV Cache分层与复用改变缓存的存放位置和生命周期。KV Cache主要作为与当前请求和推理实例绑定的运行时状态,即使采用本地前缀缓存,其容量和可见范围通常仍受显存及主机内存限制。分层与复用的思路是把KV Cache沉淀为集群级资产:向下利用GPU集群中闲置的CPU内存、本地SSD乃至对象存储构建多级缓存池,向上让不同请求、不同轮次、甚至不同实例共享同一份历史KV,本质为以存储换计算。


分层与复用是商业价值兑现和构建差异的重要环节。分层与复用通过将KV Cache下沉至成本更低的DRAM、SSD等存储介质,并在跨请求、跨实例间复用缓存,减少重复Prefill计算,从而降低单位Token的GPU计算消耗、提高有效算力利用率。此外,相较MLA、CSA等需在模型设计或训练阶段确定的架构侧优化,KV Cache的分层与复用通常无需重新训练模型,而是通过适配主流开放权重模型实现,为中立推理平台与云厂商提供自主构建差异的空间;多级缓存天然依托存储、网络与集群调度,具备完整基础设施的云厂商在这一层拥有更明显的资源禀赋。


KV Cache管理正由推理引擎内部能力逐步演进为独立基础设施。Mooncake自2024年6月发布技术报告[20]后逐步开源,核心组件包括支持RDMA、TCP、共享内存及NVMe-oF等多种协议的统一数据传输层Transfer Engine,以及基于其构建的分布式KV Cache存储Mooncake Store,并先后被vLLM、SGLang、LMDeploy及vLLM-Ascend等推理框架集成,分别用于PD分离、KV Cache传输与分布式缓存。与此同时,同类能力正在多条技术路线上并行成熟:LMCache已加入PyTorch Ecosystem[21],并被vLLM Production Stack用于KV Cache卸载和跨实例共享,同时与NVIDIA Dynamo集成;Dynamo 1.0以KVBM实现G1至G4的分级卸载并支持对象存储[22];SGLang则以HiCache构建多级存储层次[23]。我们认为,KV Cache管理正逐步演进为具备独立接口、可插拔后端和跨引擎适配能力的基础设施层。


图表18:Mooncake向跨引擎、跨硬件的AI数据传输基础设施演进

资料来源:阿里云开发者社区官方博客,中金公司研究部



PD分离:不同硬件的分工合作,推动芯片异构设计


PD分离(Prefill-Decode Disaggregation)是指将大模型推理中的Prefill阶段和Decode阶段部署在不同的GPU、服务器或集群上执行,以减少相互干扰,提高推理效率[24]。早期由于这一技术需要重构推理服务架构,工程改造成本较高,未被广泛采用。2025年,随着大模型在企业端应用的快速渗透,推理使用进入放量阶段;同时Agent与Coding能力的快速发展带来上下文长度的持续提升,推理的效率与延迟愈发重要,PD分离迅速渗透到几乎所有主要大模型服务的技术栈[25]。


图表19:PD分离原理示意图

资料来源:昇腾开发者社区,中金公司研究部


图表20:PD分离可以降低延迟

资料来源:Hao AI Lab,中金公司研究部


PD分离的优点在于:1)减少干扰,降低延迟。在Prefill阶段模型需要一次性处理整段输入,计算量大;在Decode阶段模型需要频繁读取KV Cache,更受显存带宽影响。如果将两阶段在同一GPU上混合处理,大计算量的Prefill可能卡住正在生成的Decode,增加延迟。2)分而治之,可以就两阶段分别进行硬件调优。分离后可以就两阶段的不同特征进行分别优化。如在Prefill侧重点优化并行计算,Decode侧重点优化KV Cache管理、通信等,提升资源利用率。


PD分离正从单集群内的推理优化,进一步走向跨集群、异构硬件的资源调度架构。目前PD分离主要在数据中心或一个高速网络集群内部落地。由于模型在Prefill完成后会产生大量KV Cache,需要传给Decode侧继续使用,如果KV Cache过大,网络传输的成本就会抵消二者分离的收益。因此,现阶段PD分离更多依赖RDMA、InfiniBand等高速网络,跨集群、跨数据中心分离仍处于探索阶段。


► MoonshotAI在2026年4月提出Prefill-as-a-Service(PrfaaS),指出随着新一代混合注意力模型显著降低KV Cache规模,Prefill与Decode跨集群解耦开始具备工程可行性。具体来看,PrfaaS选择性地将长上下文、计算压力较大的Prefill请求发送至独立的高算力Prefill集群处理,再通过普通以太网将生成的KV Cache传回本地PD集群,由本地Decode节点继续完成生成[26]。Moonshot在内部超大规模混合注意力模型上的实验显示,相较传统同构PD部署,跨集群Prefill服务能够显著提升资源利用效率,证明跨集群PD分离已经具备一定工程可行性。但目前PrfaaS仍主要停留在研究与原型验证阶段,尚未看到大规模生产部署的公开案例。


► Attention-FFN分离(A/F分离)或是下一个分离技术的前沿方向。Decode阶段中,注意力计算更受显存带宽和KV Cache读写限制,FFN更依赖矩阵计算能力,两者的硬件需求并不相同。因此,在理论上,将Attention和FFN拆分到更适合各自特征的硬件上运行,有望进一步提升推理效率、降低单位成本。同时随着大规模MoE模型普及,专家并行本身已经引入大量跨卡通信。如果A/F分离能够与MoE既有通信流程结合,额外通信成本就有望被摊薄。2025年以来,字节跳动MegaScale-Infer[27]已对A/F分离进行了系统验证,阶跃星辰[28]Step-3也采用了类似架构。2026年7月[29],vLLM进一步推出实验性的AFD Plugin,并支持NVIDIA GPU和华为昇腾NPU,使该技术开始进入通用推理框架生态。不过,由于Attention和FFN之间存在高频通信需求,A/F分离仍高度依赖高速互联,目前主要适用于大规模MoE模型和高带宽集群环境,尚未成为通用默认架构。


图表21:StepFun的AF分离

资料来源:Step-3 is Large yet Affordable: Model-system Co-design for Cost-effective Decoding,中金公司研究部



跨卡与跨节点执行:以通信换取模型容量与集群吞吐


分布式并行是大模型规模化训练和推理的基础能力。分布式并行的本质是将模型权重、计算任务或请求负载拆分到多张GPU、多台服务器甚至整个集群中协同执行。随着模型参数、上下文长度和并发请求持续提升,单卡已难以同时承载模型权重、KVCache和高强度计算,分布式并行因此成为突破单卡显存与算力瓶颈的关键手段。通过张量并行(TP)、流水线并行(PP)、专家并行(EP)等方式,系统可以将大模型拆开部署,在保证模型可运行的同时提升吞吐、降低延迟,并改善集群资源利用率。


分布式并行更接近一套贴合硬件条件的部署策略。在大模型私有化部署中,厂商通常会基于vLLM、SGLang等成熟推理框架,根据模型大小、GPU数量、显存容量等因素,配置合适的并行方式,让模型权重和计算任务分布到多张GPU或多台服务器上运行。以DeepSeek-V3为例,其并行方案高度贴合H800集群的硬件特点:由于H800的卡间通信带宽相对受限,训练阶段不适合过度依赖TP,因此系统更多通过PP和EP分摊计算与通信压力。推理阶段则可以根据首token延迟和后续生成速度的要求,选择性使用TP[30]。我们可以看到,分布式并行的关键在于让模型结构、通信方式和硬件能力相匹配,最终提升吞吐、降低延迟,并改善集群利用率。


我们认为,实施并行策略的较优顺序通常是先把模型放入单节点高带宽域,再根据权重容量、长上下文和MoE专家分布逐步引入PP、CP或EP等并行方法;互联硬件、集合通信库和推理框架的协同能力将直接影响GPU新增数量转化为有效Token产能的效率。


图表22:分布式并行策略一览

资料来源:Nvidia官网,Huggingface官方博客,中金公司研究部


张量并行与流水线并行:节点内互联切张量,跨节点扩展切层


张量并行(Tensor Parallelism,TP)通信频率高,通常更适合节点内高带宽互联。TP把同一层的权重矩阵切到多张GPU,每层计算过程中都需要频繁进行集合通信(如全归约All-Reduce、全收集All-Gather、归约散射Reduce-Scatter 等),因此通信频率高、数据量大,对节点内的高速互联带宽要求高,其扩展能力受限于集合通信库和网络拓扑结构。


流水线并行(Pipeline Parallelism,PP)以较低通信频率换取调度复杂度。TP适合于高带宽、低延迟的节点内互联场景,而PP则更适合于跨节点扩展,两者在实际工程中常常组合使用。PP在调度上更为复杂,主要面临三个问题:1)负载不均衡:不同层级的计算量可能差异较大,导致部分GPU闲置;2)流水线气泡(空闲时间):在微批次切换时,部分节点需要等待,造成计算资源浪费;3)单请求延迟增加:由于需要等待流水线填满,单个推理请求的响应时间会有所上升。


NVIDIA构建了从底层硬件到上层运行时的完整生态。NVLink(高速互联通道)和NVSwitch(交换芯片)提供高带宽的节点内互联,NCCL(NVIDIA集合通信库)负责高效的通信调度,TensorRT-LLM(推理优化框架)则在上层实现针对推理的极致加速。这一整套体系不仅提升了多卡并行的有效吞吐量,也使得高效张量并行的适用范围得以扩大。


专家并行:MoE把卡间通信变成主要瓶颈


专家并行(Expert Parallelism,EP)成为MoE架构下的核心扩展方向。在EP模式下,Token经路由后需通过分发(Dispatch)操作发送至持有对应专家的GPU,专家计算完成后通过回收/合并(Combine)操作将结果回传至原始位置,这一机制带来的核心问题是:热门专家可能使部分GPU负载过重,整轮计算受限于最慢的并行进程。因此,EP的优化重点是拓扑感知路由、层次化All-to-All、通信计算重叠、专家副本和在线负载均衡,例如,DeepSpeed(开源深度学习优化库)在层次化All-to-All场景中,先在节点内变换与交换数据,再执行较少的跨节点通信,以降低小消息场景的时延压力。


四、异构调度:优化多芯片资源配置与使用效率



异构调度与资源池化将不同型号的芯片组织为统一资源池,是整个推理优化流程中最接近硬件的一层。异构推理可以分为四个层次:1)芯片适配:决定模型能否运行及算子是否高效;2)资源池化:把不同型号、代际或厂牌的加速卡纳入统一控制面;3)放置策略:决定模型副本部署在哪类资源;4)请求路由:按照SLO、成本、队列和缓存命中选择实例。


异构调度的核心是在性能与成本之间做实时决策。国内客户通常使用海外GPU与多类国产芯片,叠加私有部署比例较高,异构调度具备明确的商业价值。芯片适配方面,随着架构更新加快,维护成本随迭代频率上升,具备完整工具链与成熟开发者生态的硬件厂商护城河更强;资源池化方面,本质是动态匹配,把Prefill的计算密集型负载与Decode的带宽密集型负载分配至最合适的硬件,持续的负载画像、容量预测与调度反馈有望沉淀为平台独有的数据资产。在跨集群调度场景下,我们认为云厂商具备天然优势,异构供给能力、容量管理效率和实例级路由精度,共同构成了云厂商在推理服务层的竞争壁垒。



芯片适配:将模型算子、量化与通信映射至不同硬件后端


推理框架的多后端适配已成常态。vLLM[31]、SGLang[32]等主流开源推理框架已实现对NVIDIA、AMD、Google、华为及Intel等多类硬件的适配覆盖;PyTorch[33]等基础框架也提供了统一的加速器接口与算子注册机制。然而,每类硬件在算子实现、图编译策略、量化格式、内存管理及集合通信等方面,需单独开发和维护;不同硬件对同一模型版本、同一特性的支持进度参差不齐,仍存在后端碎片化问题。


追随模型演进成为硬件适配的竞争重心。对于硬件厂商而言,支撑其硬件的软件栈质量直接影响其在大模型时代的竞争力。NVIDIA以CUDA生态构建了从算子库到推理框架的完整工具链;AMD以ROCm开源平台持续推进对主流框架的支持;Intel Gaudi则依托Habana SDK(含SynapseAI软件栈)寻求差异化突破;Google则凭借TPU硬件与XLA编译器体系形成独立路线。随着模型架构更新节奏日益加快,硬件厂商需投入大量研发资源为新算子编写专用Kernel、为新量化格式提供适配,并持续优化多卡通信,维护成本随架构迭代频率线性上升,我们认为具备完整工具链和成熟开发者生态的厂商在长期竞争中拥有更强的护城河。



资源池化:把不同型号、代际或厂牌的芯片纳入统一控制面


同一模型在不同场景下对硬件资源的需求不同。预填充(Prefill)阶段是计算密集型任务,更依赖GPU的峰值算力;自回归解码(Decode)阶段是显存带宽密集型任务,每个Token的生成都受限于从显存读取模型参数的速度。因此,将不同特性的负载调度到最合适的硬件上具备较高价值。


资源池化的本质是动态匹配,调度能力正在成为推理平台的核心竞争力。资源池化让系统能够离线测准GPU在运行特定模型时的成本和性能边界(SLO边界),再根据实时流量动态调整副本数量。以字节跳动开源的AIBrix推理系统为例,将请求监控、GPU选型优化器、自动扩缩容和流量路由解耦为独立模块,通过离线性能画像(Profiling),为不同请求选择最经济的GPU类型和数量:跑Prefill的请求调给算力型GPU,跑Decode的调给显存带宽型GPU,弹性扩容时优先调度成本更低的卡型。我们认为持续的负载画像、容量预测和调度反馈有望逐步沉淀为平台独有的数据资产,并形成正向飞轮效应。


图表23:AIBrix依据请求分布与离线Profiling选择异构GPU,提升大规模集群推理效率

资料来源:AIBrix Heterogeneous GPU Inference文档,中金公司研究部


单卡算力的合理切分同样关键。目前,以单卡为单位的粗放式分配是导致算力浪费的主要原因之一。许多轻量级推理任务或小规模模型往往只需占用整卡的一小部分资源,却被迫独占一整张GPU,造成大量算力与显存闲置。针对这一问题,NVIDIA MIG(多实例GPU,Multi-Instance GPU)提供了一种硬件级解决方案:可将一张物理GPU切分为多个相互隔离的实例,每个实例拥有独立的显存、缓存和计算资源。


风险提示



技术迭代导致既有优化成果贬值风险。大模型架构、推理算法和开源框架仍处于快速迭代阶段,新模型可能采用不同的注意力机制、专家结构、并行策略或算子设计,vLLM、SGLang等开源框架也在持续吸收行业优化成果。若厂商既有技术对特定模型或硬件依赖较强,相关研发投入可能因模型换代、能力开源或行业标准变化而加速贬值,进而影响技术壁垒、客户黏性及研发投入回报。


推理优化技术演进风险。低精度量化、投机解码、模型压缩等技术能够降低推理成本、提高生成速度,但其优化效果受到模型结构、任务类型、上下文长度和硬件支持程度影响。若压缩比例或推测策略设置不当,可能引发输出精度下降、拒绝率上升、长文本稳定性减弱等问题,进而影响客户体验和商业化部署,并增加模型评测、参数调优及故障回退成本。

股票复盘网
当前版本:V3.0