今日,月之暗面正式开源2.8万亿参数模型Kimi K3,并发布模型权重与技术报告。同日,摩尔线程基于AI训推一体智算卡MTT S5000及MUSA软件栈,率先完成Kimi K3的极速适配与稳定拉起。这不仅展现了MUSA软件生态面向前沿模型的快速响应与全栈协同能力,也再次验证了国产全功能GPU支撑万亿级大模型创新的工程实力。
作为全球首个开源的3万亿级别模型,也是Kimi迄今能力最强的模型,Kimi K3拥有2.8万亿参数,基于KDA混合线性注意力机制(Kimi Delta Attention)和注意力残差(Attention Residuals)技术构建,采用Gated MLA与Stable LatentMoE等架构创新,原生支持视觉理解,并拥有100万token上下文窗口,面向长程编程、知识工作和推理等前沿智能场景而设计。
图:Kimi K3在8张MTT S5000节点上的运行状态
与传统Transformer模型相比,Kimi K3并非简单扩大参数规模。69层KDA与24层Gated MLA共同构成混合注意力主干,AttnRes重新设计跨层信息流,Stable LatentMoE则以896个专家、每个token激活16个专家的方式进一步提升模型容量。新架构同时改变了算子、缓存、通信与调度方式,对AI芯片的软件栈提出了系统性挑战。
面向新架构,构建Day-0系统级工程路径
摩尔线程在模型开源后第一时间完成模型结构解析、权重加载、核心算子、缓存管理与分布式运行链路的适配,并打通从SGLang-MUSA推理框架,到MATE算子库、Triton MUSA、TileLang MUSA适配路径。MTCC编译器,MUSA运行时均高效支持SGLang JIT、DSL算子在MTT S5000上快速部署运行。
面对KimiK3官方MXFP4 checkpoint,摩尔线程设计了加载期在线逐层量化方案,无需离线转换,为Day-0快速拉起K3模型推理提供了关键支撑。
这条链路既保证了Kimi K3架构语义的准确复现,也为后续融合算子、图执行、长上下文缓存和大规模PD分离优化预留了清晰的演进空间。
KDA:打通线性注意力与状态管理
KDA是Kimi K3最核心的架构创新之一。它以固定大小的递归状态压缩历史信息,减少长上下文场景下随序列长度持续增长的KV Cache压力,但也引入了与传统Attention完全不同的计算和内存管理方式。
针对Prefill阶段的大批量token计算与Decode阶段的逐token递归更新,摩尔线程分别完成了KDA Prefill、KDA Decode、短卷积和递归状态更新等关键路径适配。Day-0版本以Triton MUSA正确性实现作为稳定基线,并通过MATE统一算子接口衔接后续高性能内核。
在运行时侧,SGLang-MUSA同步适配Hybrid State Pool,用于管理KDA recurrent state与conv state,并支持状态分配、原地更新、快照和恢复。相较于只移植一个KDA算子,这套实现进一步覆盖了Prefix Cache、分块Prefill以及PD分离场景所需的状态生命周期,为百万上下文能力的工程落地打下基础。
AttnRes与Gated MLA:准确复现K3信息流
AttnRes通过可学习的跨层残差连接,让模型能够从前序多个Block的输出中动态聚合信息。它并不是普通Residual Add的简单替换,而是贯穿模型深度方向的一套状态与权重管理机制。
摩尔线程完成了AttnRes block bank、跨层残差聚合和模型执行顺序的框架适配,确保Kimi K3在深度方向上的信息流与官方模型定义一致。
与此同时,Gated MLA在MLA输出路径中增加门控机制。MUSA软件栈完成相关投影、门控、归一化与注意力路径的组合适配,并与KDA层共同纳入SGLang-MUSA的Hybrid Attention调度,使两类注意力模块能够在同一模型中稳定交替执行。
Stable LatentMoE:承载896选16的稀疏专家计算
Kimi K3将MoE规模扩展至896个专家,每个token激活16个专家。面对更高的专家稀疏度,单纯完成TopK路由并不足以支撑分布式推理,还需要打通token dispatch、expert GEMM、combine以及跨卡All-to-All通信。
围绕Stable LatentMoE,摩尔线程快速完成了DeepEP对896专家、TopK 16激活规模的适配,打通面向Kimi K3的token dispatch、combine与跨卡All-to-All通信链路,为模型Day-0拉起补齐了关键的MoE通信能力。
在此基础上,MUSA软件栈进一步完成模型路由、专家映射和分布式执行链路适配,并通过MCCL、DeepEP与MTSHMEM协同承载张量并行、专家并行和低时延通信,为Kimi K3在多机多卡环境中的规模化部署提供基础。
MATE、Triton-MUSA与TileLang-MUSA协同加速
Kimi K3 Day-0适配并不依赖单一算子方案,而是由多层次算子生态共同支撑。
▼ 完整的主流生态兼容迁移能力:
MUSA在编程模型、运行时接口和主流AI生态接入层具备高度生态兼容与迁移能力,使上游主流生态实现能够被快速识别、迁移和验证,大幅缩短新模型从社区代码到摩尔线程全功能GPU的适配周期。
▼ Triton-MUSA提供稳定基线:
对KDA、Gated MLA及相关融合计算,Triton-MUSA能够快速承接参考实现与正确性回退,在Day-0阶段优先保障模型语义、数值结果和执行稳定性。
▼ TileLang-MUSA打通高性能内核开发:
TileLang-MUSA工具链已经完整接入MUSA软件栈,可直接承载KDA、AttnRes、MoE等自定义算子的原型开发、JIT编译和性能迭代,让面向新架构的算子优化可以从高层DSL快速下沉到MTT S5000。
▼ MATE提供统一算子调度:
自研MATE算子优化引擎负责能力检测、算子选择与后端调度,将Triton、TileLang、预编译内核和稳定回退路径统一到同一调用接口中。由此形成“SGLang-MUSA→MATE→Triton/TileLang/MTCC →MUSA Runtime”的完整软件栈闭环。
分布式推理链路同步就绪
面向万亿级模型,单机算子支持只是第一步。摩尔线程进一步打通SGLang-MUSA与MCCL、DeepEP、MTSHMEM、Mooncake等组件的协同链路,覆盖张量并行、专家并行以及Prefill/Decode分离所需的模型执行、通信与状态传输能力。
其中,MCCL承担集合通信,DeepEP承载MoE token dispatch与combine,Mooncake负责PD分离场景下KV Cache与KDA state的跨节点迁移。框架、算子、通信和状态池由同一套调度体系衔接,使Kimi K3能够从单域正确性验证平滑扩展到多机多卡部署。
MTT S5000稳定承载Kimi K3
在MTT S5000平台上,Kimi K3已经完成模型加载、服务启动和基础推理链路验证。运行过程中,Prefill和Decode节点,MTT S5000均展现出卓越的计算承载力,系统全程稳定运行,显存管控高效。
从Day-0支持到持续性能演进
此次实现Kimi K3的极速支持,标志着摩尔线程在极短时间内完成了对前沿架构的精准解构、全链路打通与稳定验证。在此基础上,摩尔线程将继续推进KDA融合内核、TileLang-MUSA算子优化、MUSA Graph、Prefix Cache、长上下文内存管理以及大规模PD分离等能力,持续释放Kimi K3在MTT S5000上的性能潜力。
未来,摩尔线程将继续依托MUSA软件栈强大的生态兼容性,持续在第一时间拥抱并赋能前沿大模型生态,以高性能、可规模化的全功能GPU基础设施,加速AGI技术的创新与产业化落地。


VIP复盘网