服务器行业越来越焦虑了。
这句话听起来有些反常。毕竟,AI还在制造人类科技史上最昂贵的一轮基础设施建设。按市场预测,2026年全球四大云厂商与AI相关的资本开支合计将达7250亿美元。以7250亿美元计算,相当于每天投入近20亿美元,其中相当大一部分最终流向AI服务器及其配套基础设施。
服务器市场也在迅速变大。2026年第一季度,全球服务器市场厂商收入达到1226亿美元,同比增长30.4%。问题在于,流向AI服务器的钱越多,不等于每一笔钱都会经过传统服务器厂商。市场的增长,与服务器厂商在产业链中的位置,正在成为两件事。
01今年服务器厂商的焦虑,写在WAIC 2026里。
向上看,芯片厂商不再满足于销售GPU或NPU。华为、沐曦、摩尔线程已经把互联、通信库、参考架构和整机柜一起推向客户,希望亲自回答一颗芯片如何组成千卡集群。
向下看,云厂商和头部互联网公司掌握模型与负载,可以自己定义服务器,再直接向ODM下单。2026年第一季度,ODM Direct收入仍占全球服务器市场的50.2%。换句话说,全球约一半的服务器收入,已经可以在大客户和制造厂之间直接完成。
AI发展下,芯片厂商、ODM厂商、OEM厂商、云厂商的边界越发模糊。在市场快速扩张下,服务器厂商必须重新回答一个问题:自己在AI产业链中究竟不可替代在哪里?
我们看到,服务器厂商想的第一步,是走向多卡异构。尤其是对于中国的服务器厂商,这一步变得非常必要。毕竟,中国市场的特殊性,让市场中出现越来越多的AI加速卡。
有行业研究今年7月对60名中国企业高管的调查显示,受访者预计未来12个月将把46%的AI加速器预算投向国产芯片,高于当前的30%。除了英伟达,客户还可以在华为昇腾、寒武纪、昆仑芯、摩尔线程、沐曦集成、燧原科技、天数智芯等厂商之间选择。它们从NPU、通用GPU和专用AI处理器等不同路线切入,适合的模型与场景也不相同。
选择多了,生意看起来也变宽了:同一条服务器产品线可以搭载不同芯片,覆盖更多客户。真正做起来,却不是换一块硬盘那么简单。换一张加速卡,主板布局、供电、散热、固件和信号完整性都可能重做;机器点亮以后,还要处理驱动、编译器、算子库和通信库。同一个模型迁移到另一张卡上,也常常只是“能跑”,离合理性能还有一段距离。
服务器厂商先从硬件下手。今年3月,浪潮信息披露,其多元开放算力架构通过开放加速器模块和算力模组,可让同一系统平台支持业界90%的AI芯片,以及x86、ARM等CPU架构,并把芯片到算力系统的研发周期缩短至6至8个月。
接下来是更难的软件适配。超聚变在B.E.S.T 3.0和FusionOne AI继续推向软件层,把算子、模板库、编译器、模型部署和推理加速放入一套方案,并提出异构算力要“协同可用、混合可训、混合可推”。新华三的灵犀智算试图统一接入、复用和调度异构GPU;联想的万全异构智算平台,则要把不同芯片、模型和从百卡到万卡的集群放进同一套管理体系。
一位国产加速芯片厂商人士告诉笔者,互联网客户采购前会拿自己的模型反复做POC,最后算的是TCO。硬件跑分只是其中一项,软件是否好用、模型多久能够完成适配、芯片能否持续供货,都会影响采购结果。
这让服务器厂商重新有了价值空间。国产芯片越多,客户越不可能逐一吃透每套软硬件体系。服务器厂商若只能列出一张“兼容清单”,仍然容易被替代;若能把换芯时间、性能损失和运维成本一并压下来,卖的才不只是一个装卡的盒子。
02纵观WAIC 2026,另一个明显的趋势是:超节点成为AI时代的产品单元。上海人工智能实验室DeepLink团队发布的《超节点技术体系白皮书》给过一组对比:过去5年,预训练所需算力增长约3000倍,单芯片算力同期只增长约16倍。
超节点先用Scale-Up把更多加速卡组成低时延计算域,再通过Scale-Out接入更大的集群。用户买到的表面上仍是机柜,使用时却要把它当成一台跨越多个机柜的“大机器”。
于是也会带来一个问题:卡数并不等于有效算力。上述白皮书在一套参考设计中测算,Scale-Up域从8卡扩大到32卡,千亿参数模型的训练收益为20%、推理收益为42%;扩大到512卡后,两项收益也只增加到21%和45%。
今年AI服务器的竞争,更像是“数卡比赛”:64卡、128卡、256卡、1024卡,以及向万卡、十万卡扩展的集群。但“超节点是极致工程问题,不是卡越多越好,适合应用场景的才好。”一位国产GPU厂商人士在采访中说。超节点扩大了低时延通信范围,也扩大了故障影响:一张卡掉线、一次网络拥塞或一个液冷接头出问题,拖慢的可能不再是一台服务器。
这时候,不同公司的优势被摆到了同一张桌上。
第一类是掌握芯片、互联和软件的全栈厂商。华为在WAIC 2026展示的Atlas 950 SuperPoD是一套1024卡集群。按华为披露的数据,它拥有256TB全局统一内存,往返时延为3微秒;此前的昇腾384超节点已落地750多套。华为可以同时设计NPU、灵衢互联、整机和CANN软件栈,用纵向一体化换系统效率。阿里以自研芯片、ALink互联和磐久服务器走的是类似路线,并可用云上真实负载检验系统。
第二类是从芯片向系统延伸的GPU厂商。沐曦曦景S600将单柜64张GPU全互联;摩尔线程MTT C256用两个标准机柜连接256张GPU,并称将卡间时延压到亚微秒级。它们做超节点,是要证明自家GPU不仅单卡能跑,也能组成商用系统。优势是更懂自己的芯片和通信栈,短板则是商用交付还涉及网络、存储、供电、液冷、故障管理和服务体系。
第三类就是传统的服务器和ICT厂商,这类厂商更重要的是强调兼容和交付。我们看到,中兴通讯的OEX超节点主打开放和快速换芯。它将计算托盘与交换托盘正交直连,取消内部高速线缆,并开放机械和电气接口。按中兴披露的数据,这套设计能将故障维护从小时级缩短到分钟级,整机开发周期压缩至3至6个月;通过更换关键模块,可适配不同GPU平台。中兴还联合壁仞、沐曦、燧原、天数智芯等厂商推出Matrix方案。
新华三UniPoD S80000系列单柜可部署32至64张加速卡,Scale-Up可扩展至1024卡,Scale-Out可延伸至16384卡。同时,新华三同时拿出了102.4T智算交换机、全闪存储、液冷、供电和运维系统,展示“算-网-存-云-安-维”全栈协同能力
远图前瞻性布局高密计算、高速互联、高效供电与液冷散热技术能力,并提供32 卡、64 卡至 128 卡的多层级超节点整机方案。在国内多数算力厂商仅深耕服务器单一赛道时,远图选择“服务器 高速交换机”双赛道同时自主研发、批量交付,拉通“算、网、存、管”,将长期服务头部客户积累的联合开发、供应链和制造能力,变成标准化的自有产品。
03AI服务器的竞争,现在还要落到Tokne上。截至今年3月,中国日均Token(词元)调用量已超过140万亿,相比2024年初的1000亿增长了1400倍。大模型从训练走向应用后,客户不只看GPU数量和峰值算力,还要问同样的机器与电力一天能生成多少Token、用户要等多久、每百万Token要花多少钱。
今年以来,“Token Factory”“Token工厂”和“词元工厂”密集出现。对于Token的生产,不同AI服务器厂商有不同的看法。
新华三打造了面向算力、模型、任务与Token的一体化运营管理平台图灵Token工厂,向上承接模型任务与应用请求,向下统一调度GPU资源与算力分配。此前,新华三集团总裁兼首席执行官于英涛透露,“图灵小镇”并不只是传统意义上的算力园区。它更像是一个围绕Token生产、调度、使用的“Token工厂”。
超聚变已经“以身试法”,把Token Factory真正跑起来:日均500亿 Token需求、30 智能体场景,AI赋能软件工程两年实现100%全员研发覆盖,最新Agentic实践中,1个小队3个月由多Agent并行产出50万行代码。
04全球服务器市场还在扩张,高盛Allen Chang团队发表研报,将全球服务器市场总规模上调,预计2028年全球服务器市场收入将达1.1万亿美元。其中AI服务器机架收入将以118%的复合年增长率扩张至5,614亿美元,占全球服务器市场总收入的51%。
AI服务器没有变成一门更标准的生意。芯片路线、互联协议、液冷方式和模型负载都在分化,它反而从标准产品重新变成了复杂工程。这将成为AI服务器厂商的下一个门槛。


VIP复盘网