扫码体验VIP
网站公告:为了给家人们提供更好的用户体验和服务,股票复盘网V3.0正式上线,新版侧重股市情报和股票资讯,而旧版的复盘工具(连板梯队、热点解读、市场情绪、主线题材、复盘啦、龙虎榜、人气榜等功能)将全部移至VIP复盘网,VIP复盘网是目前市面上最专业的每日涨停复盘工具龙头复盘神器股票复盘工具复盘啦官网复盘盒子股票复盘软件复盘宝,持续上新功能,目前已经上新至V6.5.7版本,请家人们移步至VIP复盘网 / vip.fupanwang.com

扫码VIP小程序
返回 当前位置: 首页 热点财经 计算机|DeepSeek-V4.1-Flash:CED新架构带来推理端进一步提效降本

股市情报:上述文章报告出品方/作者:中信证券研究;仅供参考,投资者应独立决策并承担投资风险。

计算机|DeepSeek-V4.1-Flash:CED新架构带来推理端进一步提效降本

时间:2026-09-17 07:51
上述文章报告出品方/作者:中信证券研究;仅供参考,投资者应独立决策并承担投资风险。

DeepSeek-V4.1-Flash发布,在实现Coding与Agent能力提升的同时强化多模态理解能力。模型创新采用CED架构,结合CSA2跨层缓存共享、索引复用及FP4量化,全局KV Cache降至V4-Flash的约1/4。架构优化释放推理降本空间,DeepSeek宣布继续下调API价格。我们认为,国产模型将沿高性价比与前沿智能两条路径继续展开竞争,DeepSeek深度适配下国产算力基础设施与国产模型同步受益,同时高性价比推理将加速FDE及企业级Agent落地。

DeepSeek-V4.1-Flash:采用CED新架构,模型能力超越DeepSeek-V4-Pro。


2026年9月10日,DeepSeek发布DeepSeek-V4.1-Flash,采用全新“因果编码器-解码器”(CED)架构,具备多模态理解能力,支持百万Token上下文,并同步开放API及模型权重。模型主干参数5520亿,预填充与解码阶段每Token分别激活80亿、160亿参数,进一步降低长上下文与Agent场景的推理开销。据DeepSeek官方微信公众号,考虑到V4.1-Flash 在性能、费用、速度、总用时等各项指标上已全面超越V4-Pro,因此DeepSeek计划有序下线V4 Pro模型,但现阶段考虑到V4-Pro仍保有较大调用量且Infra迁移需要时间,截至9月15日,V4-Pro仍维持服务状态。



编程与Agent能力显著提升,多模态理解拓展任务执行边界。


据DeepSeek微信公众号,1)Coding能力方面,最高思考强度下,V4.1-Flash在Terminal-Bench 2.1达到90.6分,高于Opus 5的89.1分及GPT-5.6 Sol的88.8分,在难度进一步提升的Terminal-Bench 4.0中,V4.1-Flash得分为31.2分,低于GPT-6 Astra的57.9分和Fable 5.1的55.8分;DeepSWE v1.1测试中达到74.2分,与GPT-6 Astra的74.1分基本持平,并高于Fable 5.1的67.4分。


2)Agent能力方面,AutomationBench与Agent’s Last Exam分别取得54.8分、31.8分,均高于Opus-5的50.3分、28.6分及GPT-5.6 Sol的45.8分、26.7分,体现了在视觉理解能力增强后,通用自动化任务与复杂任务的执行能力有所提升。



架构创新:CED架构与CSA2协同优化计算路径和缓存复用,延续长上下文推理的极致降本。


1)创新“因果编码器-解码器”(CED)架构,全局KV Cache占用降至V4-Flash的约1/4。模型的40层Transformer网络被划分为前20层因果编码器(Causal-Encoder)和后20层解码器(Decoder),由编码器末层输出直接投影生成解码器所需的全局 KV,无需依赖解码器各层的隐藏状态逐层生成,因此大多数输入token仅需完成编码器计算。为保留局部信息,解码器额外处理提示末尾128个token,近似重建各层滑动窗口注意力(SWA)缓存,使长输入场景下的预填充计算量接近减半,参考DeepSeek官方技术报告,预填充(Prefill)阶段每token激活参数由解码阶段的160亿降至80亿。缓存精度方面,模型将全局主KV Cache由前代FP8降至FP4,并在后训练中引入量化感知训练控制精度损失,使该部分存储占用接近减半,SWA KV则保留FP8。模型架构创新结合CSA2的跨层缓存共享机制,全局KV Cache占用降至V4-Flash的约1/4,同步带动新模型对HBM的需求减少到V4-Flash的1/4,对SSD需求减少到1/8。


2)CSA2通过分层共享KV及复用Top-K token检索结果,同步压低缓存占用与浮点运算量。模型前两层仅使用SWA,其余层采用压缩稀疏注意力CSA2,并配置Full、Reindex、Reuse三种模式:Full模式下模型通过计算生成全局主KV与索引键,并筛选Top-K历史位置;Reindex在下一层共享上一层Full模式下的KV,但重新计算相关性更新Top-K token;Reuse同时共享KV与Top-K结果,省去重复缓存生成及索引计算。具体而言,编码器其除了2层SWA外的其余18层按每6层一组配置“1层Full+5层Reuse”;解码器20层分为5组,首组为“1层Full+3层Reuse”,后4组为“1层Reindex+3层Reuse”,使后20层共享首个Full层生成的全局KV。上述设计将减少KV Cache与减少Indexer检索计算相结合,据DeepSeek官方技术论文,模型上下文由4K扩展至1M时,单Token解码FLOPs仅增加约25%,体现出长上下文推理效率的显著改善。



推理优化向API降价传导,维持国产开源模型高性价比优势。


据DeepSeek官方定价,V4.1-Flash每百万Token闲时缓存命中输入、未命中输入及输出价格分别为0.02元、1元、4元,较前代0.05元、1.5元、4.5元分别下降60.0%、33.3%、11.1%,高峰时段价格为闲时的两倍。



应用影响:新模型延续极致降本方向,利好FDE及企业级Agent应用落地


我们认为,模型在编程、Agent和多模态能力提升的同时继续降低调用价格,有望减轻企业级Agent的多轮工具调用、长上下文处理的成本负担,推动FDE加速落地。同时,具备行业知识积累、深度嵌入企业业务流程,或拥有垂直私域数据壁垒、能够在强监管场景交付可靠结果的专业软件公司,有望率先将模型能力转化为产品价值与商业化增量。



风险因素:


AI核心技术发展、应用拓展不及预期;算力降本不及预期;AI被不当使用造成严重社会影响;数据安全风险;信息安全风险;行业竞争加剧等。



投资策略:建议关注以下三条投资主线。


1)AI基础设施:DeepSeek深度适配国产算力,国产算力与国产模型相向而行。


2)AI应用:模型延续开源策略,推理进一步提效降本,利好FDE及有壁垒的软件应用公司。


3)模型原厂:一方面,架构创新持续释放推理提效降本空间。近2个月内发布的DeepSeek-V4.1-Flash、GLM-5.3-Flash、Qwen3.8-Flash均通过架构优化显著降低长上下文推理开销,验证了架构升级仍具备进一步降本潜力。另一方面,国产模型将围绕高性价比与前沿智能水平两条路径继续展开竞争。Flash系列以较低激活参数量和调用成本覆盖日常编程、办公及通用Agent需求,大参数量旗舰模型则有望继续提升复杂推理、专业知识及长程任务能力上限。

股票复盘网
当前版本:V3.0