随着Agentic AI快速发展,算力需求迎来爆发式增长。如何让海量资源像一台机器一样协同运转,成为行业亟待破解的难题。
传统计算架构下,十万卡集群的模型算力利用率仅约20%,大量算力资源消耗在跨设备通信等待上,而非真正的模型计算。大模型参数迈向10T级别,中间激活数据、海量KV缓存远超单卡内存承载上限;Agent智能体每小时数百次的交互,要求CPU与NPU高频灵活协同。华为常务董事、ICT BG CEO杨超斌在2026华为全联接大会上指出:“集群内不同部件之间的互联与通信能力,已成为决定计算系统性能的关键。”

华为常务董事、ICT BG CEO 杨超斌
面对这一产业痛点,华为以灵衢互联为核心,打造集群与超节点协同的新计算架构,构建从单柜到百万卡集群弹性扩展的算力底座。
多年技术积淀 打通算力协同壁垒

据了解,灵衢(UnifiedBus,简称UB)相关技术研究最早启动于2019年,名字取自“九省通衢”,核心目标就是打通大规模算力之间的连接通道。灵衢1.0已经应用在Atlas 900超节点产品上,自2025年3月正式商用交付。迭代升级而来的灵衢2.0,则支撑起Atlas 950超节点。在2025华为全联接大会上,华为就已经对外开放灵衢2.0技术规范,邀请产业链上下游基于这套技术开发硬件部件与相关产品。
四大技术特性 夯实灵衢计算系统能力

杨超斌在演讲中,围绕计算架构创新,系统介绍了灵衢计算系统具备的四大特征。
一是协议归一,具备内存语义。系统把十余种不同的互联协议统一为灵衢协议,互联带宽由百GB级别提升到TB级别,RTT通信时延从7微秒压缩至2微秒,支持超节点内部全局内存统一编址。协议完成统一后,上层应用不用再针对多种互联方式分别做适配;全局内存统一编址,则能够做到跨设备访问内存,效果和读取本地内存基本一致。
二是适配多样算力,实现异构协同。CPU、NPU、内存、SSD等硬件经由灵衢完成直连,各硬件之间可以去中心化平等访问,CPU和NPU资源配比能够按需灵活调整。依托分层分级Transformer硬件加速能力,把Attention与FFN做解耦,完成AF分离部署,两类计算模块可以部署到不同算力单元,结合业务实际调配资源,能够很好适配Agentic AI场景下CPU、NPU高频协同的业务特点。
三是分级存储,做到全局池化。依靠混合介质资源池化处理激活值缓存难题,把DDR当做NPU的第二份内存,一方面降低搜推广业务时延,将千亿级、数千维向量检索性能实现翻倍;另一方面减轻10T参数大模型训练对于单卡HBM容量的硬性要求,助力提高集群模型算力利用率。
四是光电互联,支持灵活组网。搭建高带宽、低时延的传输通道,不同体量的算力都能够按需拓展,针对不同规模算力业务提供弹性组网能力。
三级互联,从柜内到百万卡集群的弹性扩展

围绕这套全新架构,华为发布了分层分级的灵衢互联设备,覆盖柜内、跨柜、集群三个层级互联需求,系统规模能够从单柜一直拓展到百万卡集群。
柜内场景,灵衢互联刀片做到零电缆,不存在电路损耗,一套4096规模超节点,就可以节约196公里铜缆。跨柜层面,跨柜灵衢互联设备拥有176个端口,单端口带宽1.6T,单机实现280T全光互联,是当前业界端口数量、互联带宽都处于领先水平的高速总线互联设备,RTT时延低至2微秒。集群侧,UBG 灵衢网络交换机拥有1024的超大扇出能力,可支撑百万卡规模超节点集群,适配未来几十万亿参数模型的发展需要。
本次大会,华为还对外发布Cloud Engine SF9300系列UBG灵衢网络交换机,设备采用两层多平面架构,能够把建网成本下降30%;依托UB极简转发,端到端时延降低40%;搭载LLR链路层重传技术,遇到链路误码或者故障时,可以完成微秒级重传,做到链路闪断零丢包。
在组网方式上,多个超节点既可以通过灵衢连接,也可以借助RoCE实现对接,搭建规模更大的超节点集群。数据显示,通过二层CLOS四平面组网,集群最大规模可以达到51.2万卡;叠加多轨道拓扑技术,最高可以支撑100万卡昇腾超节点集群。
技术下沉 兼顾超大规模与中小企业需求

在会上,华为同步发布基于灵衢打造的Agentic AI超节点集群,整套系统由鲲鹏950、昇腾960 超节点、OceanStor M900记忆存储、星河 UBG交换机组成,可以实现不同类型算力协同,以及分级资源池化。
其中昇腾960超节点,是业界首款采用NPO近封装光学技术的超节点。产品基于灵衢与HiONE技术打造,采用正交架构搭配全液冷方案,依靠灵衢完成内存统一编址,可扩展至 4096 卡,能够输出8EFLOPS FP8、16EFLOPS FP4算力,服务十万亿参数大模型的训练和推理业务。相关测试数据,昇腾 960超节点用5500个HiONE光引擎,替代原先4.8万颗800G光模块,整体功耗减少550千瓦以上,设备无故障运行时间直接翻倍,系统可用度达到99.8%。
通用计算领域,超节点架构同样落地通算系统,全新升级的鲲鹏超节点依托灵衢全光组网,最多支持4096节点,构建256TB统一内存池。同时推出OceanStor M900集群,基于灵衢UnifiedBus总线,支持一跳直连,是PB级KV缓存解决方案。
灵衢技术的落地并不局限于超大集群场景,同样向下覆盖一体机产品。据悉,华为基于灵衢架构推出1卡到8卡的一体机产品,还有鲲鹏昇腾模组。以Atlas 650E风冷服务器为例,设备通过双机灵衢直连,可以实现16个NPU无需交换机直接互联,两台服务器可以像一台设备运行,支持平滑扩容形成小型超节点,中小企业也能够本地部署运行万亿参数大模型。
开源开放共建生态 新算力架构赋能千行百业

一套新架构能否真正落地,生态建设是不可或缺的一环。目前,昇腾已经与DeepSeek Harness、OpenCode、openJiuwen等开源框架开展合作,开发智能管理、推理加速、安全框架等Agent插件组件并且全部开源;联合五十余家客户、合作伙伴、高校机构,打造26个行业算子库,同时,与90多家主流开源社区建立合作,帮助合作伙伴快速开发行业Agent,完成和现有IT系统对接。CANN也已经全面开源开放,进入常态化社区运营阶段,进一步降低技术使用门槛。
杨超斌强调:“华为将坚持系统级创新,构筑系列化算力底座,开源开放,联合客户、伙伴和开发者共建生态,为世界提供新选择。”


VIP复盘网