当大模型训练从千卡向万卡、十万卡规模迈进,当推理工作负载从单机部署走向大规模分布式服务,AI产业的竞争逻辑正在发生深刻变革。算力集群的效能不再取决于单一芯片的峰值性能,而取决于从芯片到集群、从硬件到协议的端到端协同效率。
在这一背景下,网络互联这条曾经被视为“配角”的赛道,正跃升为决定系统整体效能的核心命脉。
近日,世界人工智能大会(WAIC 2026)在上海拉开帷幕。作为行业领先的AI网络全栈式互联产品及解决方案提供商,奇异摩尔以“国产化超节点互联全栈”为核心,集中展示了从Scale-Out网间互联、Scale-Up超节点xPU间互联到下一代光互联的全栈解决方案
展会期间,奇异摩尔网络技术副总裁叶栋接受了"半导体行业观察"在内的媒体采访,围绕AI网络的技术演进、产品架构与产业生态等话题进行了深度分享。
800G SNIC:国产AI超级网卡从“可用”迈向“高性能”
当前,国产高性能网卡公开产品与产业叙事仍多集中于100/200G RDMA引擎阶段,大量方案停留在FPGA验证层面。而奇异摩尔率先在国产阵营中实现了实质性突破——基于自研800G AI超级网卡(SNIC)平台架构设计的ASIC芯片已完成回片,并顺利通过核心RDMA架构的硅验证,单通道吞吐量稳定在400Gbps
叶栋表示,这一突破意味着,奇异摩尔不仅填补了国内高带宽超级网卡芯片的空白,更充分证明了公司已掌握2×400G乃至更高速率产品的核心设计能力。
奇异摩尔800G SNIC全面对标英伟达ConnectX-8/9的架构方向,采用与国际先进方案相一致的“高速网络处理 PCIe Switch能力”一体化设计思路。在产品形态上支持2×400G端口以太网总带宽,在架构层面同时承担AI服务器内部互连优化与节点间高速通信能力。
据介绍,奇异摩尔800G AI 超级网卡具备几大核心特性:800G高带宽与数百万pps高吞吐、微秒级低延时、数百万级消息处理能力与数百万队列(QP)高并发支撑亿级用户; HPDE高性能架构兼顾灵活性与性能等AI原生功能,以及基于以太网生态的高性价比与大规模部署能力
在增强型RDMA方面,奇异摩尔在800G架构里对传统的RoCE v2做了很大扩展。“增加了包喷洒、多路径传输、乱序重组、高效重传、高级可编程拥塞控制等AI网络急需的增强特性”。叶栋强调,这些都是行业前沿的RDMA新机制,对AI网络来说至关重要。
此外,奇异摩尔还在芯片内部集成了PCIe Switch IP。“以前像H100配ConnectX-7,GPU的PCIe和CPU的PCIe都要挂在一颗独立外置的PCIe交换芯片上,那颗芯片其实很贵。我们相当于把PCIe Switch也集成到了超级网卡芯片里。”叶栋指出,这种设计让两个GPU可以直接挂在网卡的PCIe接口上,同时网卡出800G以太网口——这一架构重构了GPU到GPU、GPU到NIC的数据路径,提升集合通信效率、降低系统复杂度,并增强对整机平台和集群方案的定义能力。
谈及为何选择以太网路线而非InfiniBand,叶栋表示:“我们没有走InfiniBand路线,而是走以太网。因为RoCE本身就是基于以太网的,以太网开源生态非常成熟,成本也低,整个产业链也很完善。以太网的技术路线确保了产品的开放互操作性与生态兼容性,为进入头部云服务供应商以及未来平滑融入超以太网生态、实现跨厂商协同奠定了基础。”
可见,在当前国产高性能网卡多集中于100/200G RDMA ASIC阶段的背景下,奇异摩尔正以单通道400G RDMA ASIC引擎快速突破,为国产AI超级网卡快速迈向800G ASIC揭开序幕。
HPDE架构:既不是传统ASIC,也不是通用DPU
在解释奇异摩尔的技术路线时,叶栋特别强调了HPDE(High Performance Data Engine)高性能可编程数据引擎的设计逻辑,“这与传统ASIC网卡和通用DPU的路线有本质区别。”
在网卡架构的技术路线上,业界长期存在两种主流范式:传统ASIC网卡性能高但可编程性弱,难以适应AI网络快速迭代的节奏;DPU主要面向网络卸载、存储卸载、加解密等, 搭载比较多的CPU核(如Arm核),实现控制面任务,总体核心目的是卸载CPU。
奇异摩尔选择了一条不同的路径——独创的高性能可编程数据引擎(HPDE,High Performance &Programmable Data Engine)。
“传统ASIC网卡的特点是性能高,但可编程性弱。问题是现在AI网络领域还有很多技术没有完全定型,需要持续迭代演进,客户也有定制化需求,纯ASIC路线在这个方向上会有风险。”叶栋指出,DPU最原始的目的是卸载CPU。2016年的时候,每个服务器CPU只有8核或12核,每个核都很珍贵,所以要把虚拟机交换(OVS)、存储基础设施处理这些不产生营收的工作卸载掉。但到今天,一颗CPU高达128核,可以拿出8~10个核用于基础网络存储处理,避免需要高复杂度,高投入,需要长时间开发迭代才能成熟的硬件卸载方案可以说原先卸载CPU的强列需求不存在了。”
在他看来,AI网络与传统云网络有着本质区别。传统云网络有存储、网络、加解密、各种协议和管理功能,什么都想卸载;但AI网络相对纯粹,核心是在万卡、十万卡规模下,实现所有GPU之间的并行处理。AI流量有个特点——所有GPU是同步的,同时产生数据、同时计算,是高度并行的。如果有一个点出问题,其他所有GPU都要等它,甚至全部要回退重算。
因此,AI时代不再需要那么多网络卸载、存储卸载的功能,更重要的是实现大规模、端到端、可靠的并发传输。核心诉求就是高带宽、低延时,以及增强型的RDMA。
HPDE正是在这一背景下诞生的。
叶栋强调:“我们的可编程性(HPDE)体现在数据面。因为AI网络不需要DPU那么多复杂的硬件卸载功能,但要对RDMA本身做极大增强——多路径、包喷洒、乱序重组等,这些才是AI网卡需要重点强化的地方。”
传统RDMA基于UDP,没有端到端的可靠传输,拥塞控制就是简单的DCQCN 拥塞控制 机制——堵了报个CNP,通知源端降速。这种机制在网络规模小的时候没问题,但到了上千、几千个节点,传统机制就完全不够用了。在奇异摩尔SNIC专门设有处理核来实现可编程的拥塞控制算法,能够根据AI训练和推理的不同流量特性,定制针对性的拥塞算法。
IBGDA:打破国产GPU与国产网卡“最后一堵墙”
在WAIC展台上,奇异摩尔与壁仞科技联合展示的IBGDA Demo吸引了大量关注。叶栋向我们详细介绍了IBGDA技术的特点与优势。
先来看一下传统架构和IBGDA架构的区别:
在传统架构中,GPU有数据要发送时,数据先放到HBM显存里,然后通知CPU侧的代理进程;CPU准备好工作队列和门铃记录后给网卡发门铃通知;网卡收到通知后去读任务单、取数据、发出去,再回写完成队列;CPU读到完成事件后再通知GPU。“整个流程是:GPU→CPU→网卡→CPU→GPU,CPU全程代理。”叶栋说
IBGDA则完全不同,“GPU直接写好工作队列——数据在哪、多长、传给谁——通过门铃机制直接通知网卡。网卡收到通知直接从GPU显存取数据、发出去、回写完成队列。GPU和网卡直接交易,CPU完全bypass。”叶栋解释道。
他进一步区分了GDR(GPU Direct RDMA)和IBGDA:“GDR只是解决了网卡能直接访问GPU显存的问题,而IBGDA更进一步,把控制面也绕过了CPU。以前数据面通过GDR直连了,但控制面还是要全部走CPU。IBGDA把中间这个中间人也去掉了,GPU和网卡直接‘交易’。
简言之,传统的通信模式中,GPU进行节点间通信需要CPU作为“中介”来转发指令,这会带来延迟和CPU开销。而IBGDA允许GPU的流式多处理器直接创建网络工作描述符并写入GPU内存,然后通过写入网卡的“门铃”寄存器来直接通知网卡进行数据传输。整个过程将CPU从通信的控制路径上完全移除,实现了由GPU内核发起的通信。
这种“直连”模式充分发挥了GPU在并行计算海量线程的优势,将吞吐和All-to-All延迟及计算利用率大大提升,在MoE模型的推理场景中尤为关键。
这与当下的行业趋势不谋而合。
当下AI产业正在发生核心范式切换,千亿大模型大规模训练项目增速放缓,MoE混合专家模型、多模态Agent推理业务爆发,算力流量形态、性能指标要求完全重构。
叶栋对此有深刻的观察,“去年或更早时候,大家谈的都是十万卡、百万卡的大规模训练。但随着大模型发展到一定程度,边际差异没那么大了,行业重心开始从训练驱动转向推理驱动。”
需要注意的是,训练和推理对网络的要求有所不同:训练的核心是所有GPU同步计算,要求集合通信、高性能即时通信、严格的尾延迟控制,流量模式以是大数据块、有序并发、大象流为主;而推理的衡量指标是首token延迟和后续token生成的吞吐量,流量以小数据为主、量大、有随机性和突发性,用户随时来请求,波峰波谷很明显。
这正是奇异摩尔800G超级网卡的优势所在,针对推理场景做了多项专属优化:
小包传输优化:自研IBGDA GPU直连技术绕过CPU代理,消除传统三层转发开销,MoE模型小消息吞吐提升、All-to-All通信时延最高降低75%;
海量队列支撑:数百万级QP适配百万级并发推理会话,解决同时在线用户流量拥堵;
可编程拥塞控制:标准DCQCN 拥塞算法针对训练场景,推理流量不均衡、极化严重,HPDE引擎和可编程拥塞控制支持客户自定义流控策略,均衡多路径负载;
成本优先导向:推理按token计费,网络功耗、整机采购成本成为核心考核项,基于以太网的开放方案相比封闭IB架构具备显著成本优势。
“训练拼算力峰值,推理拼系统效率与并发承载能力,网络不再只是算力配套,而是直接决定用户体验、业务营收的核心基础设施。” 叶栋总结道。
本次奇异摩尔联合壁仞科技现场演示的国产GPU 国产SNIC IBGDA Demo,填补了本土软硬件深度协同空白
叶栋透露,奇异摩尔已经启动与多家主流国产GPU的适配验证工作。“在国际方案中,英伟达凭借其GPU与ConnectX系列网卡的深度协同,实现了IBGDA方案。而国产集群要实现同等能力,需要国产化GPU满足对类NVSHMEM编程及最新NCCL通信库以及DeepEP等集合通信库的支持,并与国产RDMA网卡在软硬件层面完成适配。当前,国产RDMA网卡与国产GPU实现网卡直通的落地案例仍非常罕见。”
目前,奇异摩尔推出的单通道400G RDMA ASIC引擎,基于Kiwi SNIC 800G平台架构设计,已完成软硬件协同开发,兼容专为MoE模型优化的集合通信库,并原生支持IBGDA机制。
全栈布局:从芯粒、网卡到光互联的端到端协同
行业里大多数厂商要么只做芯粒IP、要么只做网卡,像奇异摩尔这样从UCIe Die-to-Die互联IP,到Scale-Up的GPU互联IO Die,再到Scale-Out的超级网卡的全链路层同时覆盖的非常少见。
叶栋认为,这种全栈布局的能力,源于奇异摩尔独特的技术起点。
传统网卡厂商研发起点是服务器PCIe网卡,仅对接CPU,在GDR出现前甚至无法访问GPU显存,天然缺失芯片内部、超节点芯粒互联技术积累,不容易切入Scale Up超节点市场。
奇异摩尔的起点不一样。“我们从成立之初就深耕UCIe Die-to-Die互联(Scale Inside 层),最开始面向的就是从通用CPU到AI GPU的芯片内部的互联;从芯片内部互联向上延伸至超节点 G2G IO 互联芯粒(Scale up),再拓展至集群 800G SNIC 网卡(Scale Out),三层复用统一HPDE可编程引擎、RDMA协议体系,形成Kiwi Fabric全域统一互联架构。”叶栋表示,我们和GPU厂商的关系非常密切,有了这个基础再做超级网卡就水到渠成了。
随着AI基础架构从以计算为中心转向以系统为中心,超节点正成为新的基本计算单元。当前超节点互联面临高带宽与低延时需求、Scale Up协议繁多且不兼容、内存语义需求迫切等挑战。
针对这些难题,奇异摩尔推出的800G GPU互联IO芯粒,多芯粒可支持带宽高达2TB/s,内建HPDE引擎,可灵活支持多种Scale Up协议,原生支持内存语义,并支持各种灵活拓扑的互联。
能够看到,这一套体系打通了从芯粒内部到万卡集群完整数据流,给GPU、整机、云厂商提供一站式互联底座,省去多厂商适配、协议联调巨大时间成本;同时Scale Up与Scale Out底层带宽、拥塞控制技术互通,可实现端到端全局性能调优,这是单一产品线厂商无法实现的。
除电互联完整产品线外,奇异摩尔还在同步布局下一代光电融合技术,今年4月与图灵量子达成战略合作,联合研发OSU(Optical Scale-Up)IO芯粒,并在本次WAIC大会期间联合港科大(广州)等机构发布了《共封装光学 CPO 技术白皮书》,进一步彰显奇异摩尔推动产业协同的前瞻布局。
面向未来,光互联正成为下一代超节点系统的基石。传统电互联受限于铜缆物理极限,带宽密度与能耗已难以支撑下一代算力需求;而光互联在Scale-Up空间内几乎没有通信距离焦虑。
叶栋表示,当前主流光互联以可插拔光模块为主,光引擎仍停留在主板边缘。为满足Scale-Up对低功耗、低延迟的要求,光引擎必须向计算核心持续收敛,由此形成清晰的演进路径:可插拔光模块→NPO→CPO→OIO,最终目标是“光内生”——将光互联功能直接集成于计算芯片内部。路径越短,收益不止于物理距离的缩短。更近的互联可省去DSP,有效降低延迟,同时简化系统设计、降低功耗与成本,最终提升整体算力利用率
在本次展位上,奇异摩尔和奇点光子带来了直连NPO光互联测试板,搭载了奇异摩尔主芯片和奇点光子定制化NPO进封装引擎。双方围绕算力互联架构、资源调度优化与行业场景适配等维度,加速推动光互连从当前的“板级”互联迈向更高集成度的“芯片级”融合。
“这不仅是对下一代互连技术的提前卡位,更是与产业链伙伴协同探索国产AI算力基础设施光电融合演进路径的战略举措。”叶栋强调。
在生态层面,奇异摩尔还深度参与腾讯牵头的IO-NET项目并牵头组建IOD芯粒工作组,与中国信通院、腾讯等共同发起成立"智算互联芯粒实验室"(ACCL),参与中国移动主导的OISA 2.0协议制定工作,全线产品均支持OISA标准。WAIC期间,上海市算力网络协会、上海人工智能实验室、中国信通院华东分院联合发起"国产超节点生态共建倡议行动",奇异摩尔作为核心参与方,与产业链伙伴共同推动开放、兼容的超节点互联标准。
结语
从单通道400G RDMA ASIC引擎的硅验证成功,到800G SNIC平台的架构卡位;从HPDE数据面可编程架构的独创设计,到IBGDA国产GPU直通国产网卡的规模化落地;从Scale-Up芯粒到Scale-Out网卡的全栈覆盖,再到光互联的前瞻布局——奇异摩尔正在以“技术 生态”的双轮驱动,深度融入并推动国产AI算力产业的发展进程。
正如奇异摩尔创始人兼董事长田陌晨所说:“连片成林,方能御风守固。网络互联是打破算力孤岛、让单个强点连成高效系统的关键脉络。”在国产算力从“单点突破”走向“系统级协同”的进程中,互联已不再是配角,而是决定系统整体效能的核心命脉


VIP复盘网