扫码体验VIP
网站公告:为了给家人们提供更好的用户体验和服务,股票复盘网V3.0正式上线,新版侧重股市情报和股票资讯,而旧版的复盘工具(连板梯队、热点解读、市场情绪、主线题材、复盘啦、龙虎榜、人气榜等功能)将全部移至VIP复盘网,VIP复盘网是目前市面上最专业的每日涨停复盘工具龙头复盘神器股票复盘工具复盘啦官网复盘盒子股票复盘软件复盘宝,持续上新功能,目前已经上新至V6.5.7版本,请家人们移步至VIP复盘网 / vip.fupanwang.com

扫码VIP小程序
返回 当前位置: 首页 热点财经 这颗RISC-V+数据流架构的AI芯片,想把视频生成成本打下来

股市情报:上述文章报告出品方/作者:芯东西;仅供参考,投资者应独立决策并承担投资风险。

这颗RISC-V+数据流架构的AI芯片,想把视频生成成本打下来

时间:2026-08-06 14:29
上述文章报告出品方/作者:芯东西;仅供参考,投资者应独立决策并承担投资风险。
芯东西8月6日报道,今年,视频生成成了AI行业最热闹的赛道之一。前有Seedance 2.0引发全球关注,就在上周,MiniMax H3、Seedance 2.5又接连登场,中国玩家们正在文生视频、图生视频等场景领跑全球,而视频生成技术在影视、短剧、电商等场景的应用也正加速落地。
但热闹背后,账越来越难算:视频生成的推理成本居高不下,多路视频理解的实时需求还在膨胀,而作为主力算力的通用GPU,在视频场景里长期存在算力浪费、功耗高、延迟大等客观问题。
供需之间的剪刀差,正在给专用芯片打开窗口:国内外互联网大厂纷纷下场自研视频芯片,新兴创企也不断涌现,其中,数据流架构芯片成为不少厂商共同关注的方向,多家芯片公司的新一代产品都开始采用这一路线。
今年上半年,国内较早将数据流架构产业化的中科通量,正式发布新一代数据流架构视频AIGC芯片金刚GC3,这款芯片拥有12个RISC-V核心、200 TOPS INT8算力、128GB LPDDR5 ECC统一内存,主打“为视频而生”,兼顾视频编解码和视频生成等需求。近日,芯东西对话中科通量CTO吴冬冬,聊了聊这颗芯片背后的技术判断与商业考量

01.
视频智能的算力困局:
为什么通用GPU不够用?


一段视频在GPU服务器里,究竟要经历什么样的旅程?吴冬冬向芯东西拆解了两种典型场景。
先看视频理解(如安防、质检、多路内容审核):海量视频流涌入服务器后,CPU或专用解码单元先做视频解码,将压缩的码流还原成像素帧;然后GPU接手,在上面跑目标检测、行为识别等AI推理任务,从画面里提取结构化信息。“这时候GPU的主要负载是‘看懂’画面,”吴冬冬说,“但瓶颈往往不在算力,而在多路并发时数据搬运的延迟。”
再看视频生成(如文生视频、图生视频):这个过程刚好反过来——GPU先跑扩散模型或Transformer,逐帧生成像素内容,生成完毕后再交由编码器压缩成可供传输或存储的视频文件。“生成是计算密集型,算力越大越好,但同样绕不开数据搬运的问题,尤其视频大模型中间参数动辄上百GB,反复搬运就是反复烧钱。”
他发现,不论理解还是生成,视频计算都卡在同一个症结上:数据搬运的代价太大。理解是多路并发时,每一帧都要在内存和计算单元之间往返,路数一多延迟就上去了;生成是单次计算的规模太大,模型参数和中间结果反复读写,带宽和功耗跟着飙升。
吴冬冬称,任务量不大时,这种浪费难以察觉,然而一旦进入产业级的高密集、高并发场景,搬运的代价就会被放大成延迟和费电
延迟和费电只是表象,底层原因在架构层面。如今业界主流的CPU、GPU底层都是冯·诺依曼架构:指令和数据存放在同一块内存中,依靠一个叫“程序计数器”的指针逐条取出下一条指令来执行,也就是所谓的控制流
这套设计为通用计算而生,也的确胜任:程序逻辑千差万别,分支跳转难以预测,由一个中央控制器逐条调度指令,是较为灵活的方案,CPU和GPU几十年的成功都建立在这套范式之上。
但视频计算的特点恰好是它的反面:计算模式高度规整,数据量极大,并行天然存在,控制流架构的三个问题于是被同时放大:
一是并行度受限控制流架构的乱序执行、多发射等优化手段,都只能在一个有限的指令窗口内选取可执行的指令。而视频生成是像素级、矩阵级的海量并行计算,窗口之外的大量并行操作只能等待,降低了算力利用率。
二是访存开销大控制流架构中,指令和数据挤在同一块内存里,中间结果要在各级存储之间反复存取。对视频生成来说,模型参数和中间结果体量巨大,反复搬运意味着算力空等数据;对编解码来说,视频流绵延不绝,每一路都在持续进出内存,浪费会随路数成倍放大。
三是同步开销大多个计算核之间要靠屏障机制(barrier)对齐进度。视频编解码存在帧内帧间的依赖关系,多路并发时又需要大量核间协同,核心越多,花在等待上的时间就越多,实时性也会受到影响。
这些瓶颈落到具体业务里,都是实打实的成本。做视频生成的企业按Token计价,推理成本降不下来,生意就很难成立;而在安防、智慧城市、工业质检等视频理解场景,成千上万路视频流需要同时分析,通用架构很难做到实时;到了边缘端,园区和工厂想把AI算力部署在本地,又绕不开GPU服务器功耗和散热的门槛。
结论已经清晰:视频智能需要的不是更强的通用算力,而是为视频数据流动方式量身设计的专用架构。
在吴冬冬的观察中,行业的解法正在收敛。首先是把CPU、VPU、GPU、NPU都放到一颗芯片里,用统一内存让数据在不同部件之间传递的时候不需要搬运,节省了数据搬运的时间。另一条主线更为激进:“数据流代替控制流或者指令流,可能也是未来的趋势。”

02.
数据流 RISC-V
为视频而生的架构答案


中科通量今年发布的金刚GC3,正是这样一款芯片。它以数据流架构为计算引擎,以RISC-V指令集为控制核心,并采用统一内存设计——吴冬冬观察到的两条行业主线,在这颗芯片上合流了。
先看数据流架构。和冯·诺依曼架构相比,它最大的变化是取消了程序计数器在控制流里,程序是一串按顺序排列的指令,执行先后由位置决定;而在数据流架构中,程序被展开成一张“数据流图”:每个计算操作是图上的一个节点,数据之间的依赖关系是节点之间的连线。一条指令什么时候执行,不再看它排在第几位,只看它的输入数据是否全部就绪。
可以用一条工厂流水线来理解:每个工位(计算单元)不等中央指挥逐条下令,零件(数据)一到齐就自动开工,做完直接传给下一个工位。哪个工位的零件先到齐,哪个工位就先动起来,整条流水线没有总调度,却几乎没有空转。
“我们最核心的理念,就是数据准备好了,我就计算。”吴冬冬说。
值得一提的是,这也是近期AI芯片领域备受关注的LPU(Language Processing Unit)所采用的核心思路。LPU的走红,恰恰印证了数据流架构在应对高密度、低延迟AI推理场景时的天然优势——当行业对Token生成效率的需求逼近极致时,数据流正从一种学术路线变成产业共识。
在视频生成场景,这一架构能带来许多直接的好处。所有输入就绪的操作可以同时执行,生成一段视频所需的像素级、矩阵级海量计算,不再被指令窗口卡住,算力利用率随之提升。此外,计算的中间结果可在计算节点之间直接流动,不必反复进出内存,而视频生成是模型参数和中间结果体量巨大的负载,搬运少了,带宽压力和功耗也会有所下降。
在内存设计上,GC3配备了128GB LPDDR5 ECC统一内存,单芯片即可跑视频生成,原本需要跨卡通信才能承载的大模型参数和中间激活,现在全部装进一颗芯片的统一寻址空间里。视频生成中常见的大模型参数动辄上百GB,若显存不足就需要在多卡间频繁搬运或分时加载,每一轮搬运都是延迟和功耗的损耗。而GC3一颗芯片就把模型完整装下,数据在不同计算单元间流转时无需拷贝复制,地址直接传递。用吴冬冬的话说:“搬运少了,Token就便宜了。”
此外,由于指令的执行顺序由数据之间的依赖关系天然决定,多核协同跑大模型推理时无需全局屏障对齐进度花在等待上的时间被压到很低。与此同时,分支预测、寄存器重命名等控制流架构的复杂设计都被省去,片上逻辑更简单,用更少的面积和功耗就能实现更高的性能。
GC3的另一大特点是使用了RISC-V指令集。这种开放、免费、可定制的指令集,让芯片从指令集层面实现自主可控,也意味着可以针对视频智能场景做软硬件协同优化。
这种软硬件协同的一个例子,是可配置。视频理解和视频生成虽然都是视频,底层负载却有明显差异:理解是解码重、计算轻、并发高,一颗芯片要同时看懂多路高清画面;生成则是计算重、路数少、带宽高,单路4K、8K画面的AI计算量巨大。GC3的解法是让部件随场景变形:128路1080P解码能力,在生成场景下可以重组为8K、120帧的视频编码。
支撑这种能力的,正是12个RISC-V核心。它们在这颗芯片里充当控制平面,负责对片上各计算部件进行配置和编排。“其实每个部件都是可以配置的,唯一改变的,可能就是我们控制它的方式,”吴冬冬解释,“这些核心起的就是胶水作用,它会去调度,保证所有部件都以跟业务流最匹配的方式运转,使用效率能到80%、90%。”
这套设计也回应了行业的一个普遍焦虑。如今模型三个月迭代一版,固化算子的芯片可能面临设计出来就过时的问题。GC3的思路是软硬协同:算法在变,但底层百分之七八十的算子不变,矩阵乘这类重负载固化为高效NPU单元,多变的部分交给编译工具和CPU调度,用架构的弹性换取对模型迭代的适应能力。

03.
开源、适配、落地:
GC3的商业化路线图


对于GC3这样一款采用新型计算架构的芯片而言,生态建设也是重要一环。数据流架构存在理论性能高、但生态还不够完善的困境。
中科通量的解法是长期投入、多点铺路。在工具链上,目前编译器等市场需要的开发工具已经配齐,并仍在持续改进;在开源上,中科通量已开源软件栈,同时自建开发者社区
此外,中科通量还以开放原子开源基金会白金捐赠人的身份“出钱、出力、出代码”。这笔投入已有直接回报:麒麟、欧拉、鸿蒙等国产操作系统如今都能直接安装在新芯片上,不会出现芯片出来了、没有操作系统可用的窘境
商业化上,GC3走的是云边端全线铺开的路线。云端做高密度智算中心,向运营商和平台公司输出高性价比的视频类Token服务,也为大型平台与园区搭建私有化Token服务平台;边缘端则是AI PC和小金刚智算盒子。小金刚优先聚焦了科研场景,这部分用户对新产品更加开放,愿意尝鲜,他们的反馈能反向推动产品改进。

04.
结语:视频智能撞上通用架构天花板
数据流芯片押注下一条路


视频是AI时代数据量最大的负载,也是最先撞上通用架构天花板的负载之一。从编解码专用芯片到视频AIGC芯片,专用化芯片的性价比正在不断提升。行业研究也指向同一个方向,麦肯锡预测,到2030年,配备专用ASIC芯片的AI加速器将处理大多数AI工作负载。
当然,替代不会在一夜之间完成。吴冬冬对节奏的判断并不激进:“GPU也不是马上就被取代的,它保有量大、算力很高、生态很好,个人用户或者并发不多的时候,是比较容易上手的方式。”但对于产业互联网、运营商这类要面对大量高并发任务请求的场景,通用GPU的替代已经处于进行时。
谈及未来,吴冬冬说道:“视频还是我们的基本盘。”但他的视野并不止于视频:随着芯片能力的提升,语言模型、多模态应用也已经进入这颗芯片的能力半径,“图像和语言加起来,就是人类理解万物的方式,这些我们都可以触及。”

股票复盘网
当前版本:V3.0