扫码体验VIP
网站公告:为了给家人们提供更好的用户体验和服务,股票复盘网V3.0正式上线,新版侧重股市情报和股票资讯,而旧版的复盘工具(连板梯队、热点解读、市场情绪、主线题材、复盘啦、龙虎榜、人气榜等功能)将全部移至VIP复盘网,VIP复盘网是目前市面上最专业的每日涨停复盘工具龙头复盘神器股票复盘工具复盘啦官网复盘盒子股票复盘软件复盘宝,持续上新功能,目前已经上新至V6.5.7版本,请家人们移步至VIP复盘网 / vip.fupanwang.com

扫码VIP小程序
返回 当前位置: 首页 热点财经 国产AI算力芯片公司,死磕稀疏计算

股市情报:上述文章报告出品方/作者:半导体芯闻;仅供参考,投资者应独立决策并承担投资风险。

国产AI算力芯片公司,死磕稀疏计算

时间:2026-09-02 15:31
上述文章报告出品方/作者:半导体芯闻;仅供参考,投资者应独立决策并承担投资风险。

AI大模型的竞争仍在继续,但数据中心真正焦虑的已经不是参数,而是账单。


Token数量持续增长,推理正在成为AI基础设施最大的成本来源。越来越多GPU被部署进智算中心,但算力利用率和能耗却并没有同步改善。如何让同样一块芯片完成更多推理,正成为国产芯片厂商共同面对的新课题。


在近日举行的ICDIA2026大会上,墨芯人工智能市场部副总裁郭威俊提出一个鲜明判断:稀疏计算不是未来的可选项,而是AI推理从暴力计算走向精确计算的必经路线。





稀疏计算,必经之路




所谓稀疏计算(SparseComputing),是一种面向人工智能的高效计算技术。其核心思想是只计算有效数据,跳过零值或近零值产生的无效运算。


之所以需要稀疏计算,是因为在神经网络中,无论是权重还是激活值,都存在大量具有稀疏性的参数,传统稠密计算会对所有元素逐一运算,而稀疏计算则仅保留非零元素及其位置信息进行处理,从源头减少乘加次数和数据存储量。如文章开头所说,因为Token成本已经成为大模型企业竞争的重要胜负点,这就使得稀疏计算空前重要。


和业内一些人将稀疏计算当成是一种算法或剪枝、蒸馏不一样,郭威俊在与半导体行业观察等交流的时候强调:“稀疏计算不是一种算法,也不是一个数学名词,而是一套贯穿芯片、调度、计算单元和软件生态的生产工具。”


郭威俊认为,真正的稀疏计算并非简单地做模型剪枝或参数压缩,而是在芯片设计阶段就构建专门的稀疏算子、稀疏调度机制以及独立的SPU(SparseProcessingUnit)计算单元,通过软硬协同和函数调度,实现对模型中有效参数的精准激活。他举例称,当用户询问“牙疼怎么办”时,未来无需调用整个数百亿参数模型,而是通过稀疏激活与专家路由机制,快速调度到医学领域相关专家,,仅激活对应参数完成推理,从“暴力计算”走向“精确计算”。


在郭威俊看来,稀疏计算的核心价值并不在于提升GPU的峰值算力,而是在跳过无效计算的前提下,让有限的硬件资源完成更多有效推理。他表示,目前国内GPU整体算力利用率仍然偏低,而墨芯通过稀疏计算可将算力利用率提升至30%—70%,同时由于无需进行大量无效计算,整体功耗也显著下降,并已在多个数据中心项目中验证了能效优势。


他重申,真正的稀疏计算并不是简单增加一套算法,而是一套覆盖模型预训练(pre-training)、后训练(post-training)、注意力机制、动态与静态稀疏、算子优化以及芯片调度引擎的软硬件协同体系。未来随着工业视觉、生命科学、安防等行业垂直模型不断普及,相比追求超大参数的大模型,更适中的行业模型反而能够进一步发挥稀疏计算在效率、能耗和推理成本上的优势。


“随着AI推理Token数量未来呈百倍、千倍甚至万倍增长,传统“暴力计算”已难以支撑电力供应、绿电要求和推理成本,AI推理必须从完整计算走向精确计算,稀疏计算将成为不可回避的技术路线。”郭威俊在演讲中强调。




墨芯的系统级打法




作为稀疏计算领域的引领者,墨芯在这个领域的研究和成果是显著的。但在具体介绍他们之前,我们先来看一下郭威俊对稀疏计算硬件的一些判断。


郭威俊认为,目前全球范围内没有任何一家公司能够定义稀疏计算的最终硬件架构。英伟达的2:4结构化稀疏是目前产业化最成熟的方案,从Ampere架构时代便开始在硬件和模型层协同支持稀疏,但它只是现阶段的一条技术路径,而非最终答案。


“稀疏计算不能依靠后期算法补救,而必须在芯片设计阶段完成硬件布局。”郭威俊强调。


基于这个见解,墨芯祭出了其稀疏计算路线策略:依托自研双稀疏核心技术与完整AI算力软硬件方案,攻克稀疏计算算法、编译、芯片架构等层面的核心难题,以实现商业化部署。具体而言,墨芯的路径包括四个层面:


  • 芯片架构层:在ASIC内部设计独立的SPU(SparseProcessingUnit),为稀疏算子提供专门的硬件加速,而不是依赖通用计算单元。

  • 计算与调度层:通过动态、静态稀疏结合的方式,实现函数级调度,让模型只激活与任务相关的专家和参数,从“暴力计算”走向“精确计算”。

  • 软件编译层:自研编译器、稀疏高性能算子和工具链,对模型进行适配、量化和调度,实现软硬件协同,而非单纯依赖算法优化。

  • 模型生态层:与基础模型公司、高校合作,希望未来把稀疏能力前移至训练阶段,在基模训练时就引入稀疏激活机制与稀疏调度策略,而不是等模型完成后再做优化。


“墨芯并不是单纯提升AI算力芯片计算性能,而是围绕稀疏推理重构芯片内部架构。在架构中集成计算单元与SPU(SparseProcessingUnit),实现动、静态稀疏的硬件支持,让稀疏调度、计算单元和函数执行成为芯片原生能力,而不是外挂功能。”郭威俊表示,他指出,设计稀疏AI芯片最大的挑战不是算力,而是资源分配。受制于制程和晶体管面积,芯片必须在内存容量、带宽、缓存、通用计算单元、动态调度单元和SPU面积之间不断取舍,同时兼顾Prefill阶段对算力与Decode阶段对带宽及显存的不同需求。


在上述四位指导下,墨芯等企业已经推动稀疏计算从前几年“停留在理论层面”走向工程落地,并已在云端推理、行业AI和科学计算等多个场景得到实际应用。


据介绍,在大语言模型云端推理中,英伟达的GPU已支持2:4结构化稀疏,并在部分训练和推理场景中得到应用;同时,稀疏计算也已部署于生物医药仿真训练、医疗影像、金融量化以及自动驾驶算法研发等垂直领域。他认为,这些行业模型参数规模未必很大,反而更能体现稀疏小模型的计算优势。


对于国内的落地场景,郭威俊表示,墨芯目前主要将稀疏计算应用于工业视觉质检、城市警务安防、生命科学与蛋白计算、运营商智算以及大模型部署等方向,并已结合多所高校开展产学研联合攻关。




未来规划




据透露,墨芯即将发布的SP200推理芯片重点优化了内存子系统,并集成压缩单元、动态寻址、寻址加速和调度单元等专用硬件模块,让芯片能够更高效地识别和处理稀疏数据。同时,墨芯将自研的稀疏调度引擎内置到芯片中,根据不同模型和不同上下文完成计算调度,而非依赖单一算法实现稀疏优化。


郭威俊指出,新一代SP200之所以研发周期较长,就是用了6~8个月反复验证这种硬件平衡,希望在有限制程下实现性能、成本与产业适配的最佳折中。此外,公司还规划了稀疏I/O接口,未来支持一机八口、单卡四Die,并将稀疏能力进一步延伸至拓扑和集群互联层面。


在分享最后,郭威俊重申,全球稀疏计算仍处于探索阶段,真正实现产业化量产的方案目前只有英伟达2:4结构化稀疏,而墨芯希望率先实现半结构化动静态稀疏推理GPU的商业落地。


他表示,GoogleTPU正在尝试完全非结构化稀疏,Cerebras也在推进晶圆级架构,虽然这些技术路线具有前瞻性,但他认为目前“更多地停留在理论层面”。相较之下,唯一经过产业验证并实现批量量产的是上述的英伟达方案。


对于即将进入批量市场的下一代芯片,郭威俊重申,这将是国内首款支持半结构化动静态稀疏的推理加速卡,将围绕推理场景优化Prefill和Decode性能。“我们这款产品能进入国内推理GPU市场前五。”郭威俊自信地说。

股票复盘网
当前版本:V3.0