9月10日,DeepSeek-V4.1-Flash正式发布。云天励飞自主研发的 IFWA 软件栈完成 Day 0 适配,并进一步基于真实量化权重,对模型关键推理链路开展数值精度与执行一致性验证。
作为 DeepSeek-V4 系列的进一步演进,V4.1-Flash 在稀疏 Attention、跨层 KV 与 Indexer 共享、FP8/MXFP4 混合精度、mHC 以及 DSpark 投机解码等方面引入新的推理机制。针对这些变化,IFWA 充分复用已有底层能力,并对新增的缓存量化及 Sinkhorn 等语义进行针对性适配。

本轮验证采用 5层主干 Block + 1层 DSpark Block 的真实量化权重切片,覆盖 Prefill、连续 Decode、DSpark 投机解码及自回归续写等关键流程。21组 CPU/IFWA 对比结果全部通过,9组整数结果误差为0,最大浮点绝对误差为 2.38×10⁻⁷,相关回归测试22项全部通过。
真实 FP8/MXFP4 权重进入计算链路
DeepSeek-V4.1-Flash 进一步采用低精度混合计算方式,模型权重同时涉及 FP8 E4M3、MXFP4 以及对应的 E8M0 Scale。相比将低精度模型简单转换为高精度格式运行,真实量化权重进入计算链路,对软件栈的量化数据处理、Scale 管理以及底层矩阵计算能力提出了更高要求。
针对这一变化,IFWA 保留模型原始量化权重及 Scale,并实际调用已有的激活量化与 DeepGEMM 低精度矩阵计算路径,使 FP8 与 MXFP4 权重真正参与模型计算。
其中,FP8 权重进入分组激活量化及 FP8 GEMM 计算路径,MXFP4 专家权重进入 MXFP4 GEMM 路径,量化 Scale 按模型原始数据语义参与计算。
针对真实量化权重切片,团队进一步完成117对数据原始字节核对,结果全部一致,确保模型量化数据在加载、解析及计算前后的数据一致性。
通过真实量化权重验证,IFWA 对低精度模型的支持从“模型结构能够运行”进一步深入到真实量化数据能够加载、量化参数能够正确传递、低精度计算能够实际执行。
稀疏 Attention 与共享 KV,复用既有原生能力
DeepSeek-V4.1-Flash 在稀疏 Attention 基础上进一步引入 跨层 KV 与 Indexer 共享机制,并结合 Compressor、LightningIndexer 等结构,对推理过程中 KV 状态和注意力计算路径提出新的要求。
针对上述变化,IFWA 延续此前 DeepSeek-V4 建立的原生 Sparse Attention 计算能力,模型层负责组织窗口位置、压缩位置以及跨层共享状态,底层计算接口继续承接核心 Attention 计算。
针对 Indexer Q/K 等数据路径,IFWA 同时适配其对应的低精度数据处理逻辑,使 Indexer 数据能够按照模型预期参与稀疏 Attention 计算。
在缓存路径上,V4.1-Flash 对不同类型 KV 数据采用差异化低精度表示:
Window KV:MXFP8
Indexer Q/K:MXFP4
压缩 KV:FP4/E4M3
针对三类数据在分组方式、数据格式及 Scale 规则上的差异,IFWA 新增缓存量化原生接口,通过不同模式承接对应的量化规则,并完成量化—反量化数值语义验证。
需要说明的是,当前阶段重点验证的是低精度计算语义与模型推理正确性,缓存仍以 BF16 承载量化—反量化结果,因此本阶段成果不等同于物理打包的低精度 KV Cache,也不代表已经取得显存带宽或性能收益。
mHC 主体复用,针对 Sinkhorn 语义变化进行适配
mHC 是 DeepSeek-V4.1-Flash 推理链路中的另一项重要机制。

针对 V4.1 在 mHC 残差混合过程中的语义变化,IFWA 沿用已有的系数投影与残差合并能力,无需重新构建完整的 mHC 计算路径。
本次新增工作主要集中于 Sinkhorn 初始化及 pre 系数处理等模型差异部分,通过局部适配完成新模型语义与既有计算接口之间的衔接。
这种“主体能力复用 + 差异部分适配”的方式,使已有 mHC 能力能够继续服务于新模型,同时减少新模型接入过程中底层算子和接口的重复开发。
按照本次模型适配直接调用的原生接口统计,当前方案复用5个已有接口,仅新增2个注册接口,新增能力主要集中于 V4.1 特有的缓存量化和 Sinkhorn 语义变化。
DSpark 投机解码,协同主模型完成连续推理
针对 DeepSeek-V4.1-Flash 的投机解码机制,IFWA 完成 DSpark 草稿模型与主模型协同推理适配,覆盖草稿 Token 生成、主模型验证及后续自回归生成等关键环节。
验证采用 5个主干 Block + 1个 DSpark Block的真实量化权重切片,从 7 Token Prefill 开始,连续执行多个 Decode 位置,并在每轮推理过程中完成 DSpark 投机解码及后续自回归续写。
整个验证过程不仅关注单次算子的计算结果,还进一步验证模型状态在连续推理过程中的传递与更新,包括主模型计算、缓存状态更新、DSpark 投机解码以及后续 Token 生成之间的一致性。
最终,21组 CPU/IFWA 对比结果全部通过,9组整数结果误差为0,最大浮点绝对误差仅为 2.38×10⁻⁷,相关回归测试22项全部通过。
运行记录显示,真实量化权重实际进入 IFWA 已有的分组 FP8 激活量化、FP8 GEMM、MXFP4 GEMM、Sparse Attention 与 mHC等原生计算路径。
这意味着此次适配已经从“模型代码可以执行”,进一步覆盖到:真实量化权重加载 → 低精度计算 → 稀疏 Attention → mHC → 连续 Decode → DSpark 投机解码 → 自回归续写的关键推理链路。
从 DeepSeek-V4 到 V4.1,软件能力持续复用
先进模型架构正在快速演进。
从稀疏 Attention、MoE,到 FP8、MXFP4;从传统 KV Cache 到跨层共享状态,再到 DSpark 等投机解码机制,模型不断提出新的计算需求。
面对快速变化的模型架构,IFWA 并不采用每个新模型重新建设一套底层能力的方式,而是通过持续积累的编译器、算子、低精度计算、推理框架及测试验证能力,让已有能力能够被后续模型持续复用。
此次 DeepSeek-V4.1-Flash 适配中,已有的稀疏 Attention、mHC、激活量化及 DeepGEMM能力继续承接新模型,仅针对缓存量化、Sinkhorn 等真正发生变化的部分进行新增适配。
截至目前,IFWA 已持续开展 DeepSeek V4 Pro、Hy3、Kimi-k3、DeepSeek V4、DSpark Tiny、Qwen3.6、Hy4 Preview、Qwen3.8-Flash-Next、DeepSeek-V4.1-Flash 等先进模型的适配与验证,覆盖稀疏 Attention、MoE、投机解码及低精度计算等多类推理机制。

模型持续演进,软件能力持续积累。
面向 AI 推理时代,云天励飞将持续完善 IFWA 在编译器、算子、推理框架、低精度计算及测试验证等层面的能力,加速先进模型在国产 GPGPU 平台上的适配与落地,夯实国产算力软件基础。


VIP复盘网