扫码体验VIP
网站公告:为了给家人们提供更好的用户体验和服务,股票复盘网V3.0正式上线,新版侧重股市情报和股票资讯,而旧版的复盘工具(连板梯队、热点解读、市场情绪、主线题材、复盘啦、龙虎榜、人气榜等功能)将全部移至VIP复盘网,VIP复盘网是目前市面上最专业的每日涨停复盘工具龙头复盘神器股票复盘工具复盘啦官网复盘盒子股票复盘软件复盘宝,持续上新功能,目前已经上新至V6.5.7版本,请家人们移步至VIP复盘网 / vip.fupanwang.com

扫码VIP小程序
返回 当前位置: 首页 热点财经 2026,从“堆芯片”到“造Token”,AI算力竞赛换了记分卡

股市情报:上述文章报告出品方/作者:智能相对论;仅供参考,投资者应独立决策并承担投资风险。

2026,从“堆芯片”到“造Token”,AI算力竞赛换了记分卡

时间:2026-09-22 22:37
上述文章报告出品方/作者:智能相对论;仅供参考,投资者应独立决策并承担投资风险。

AI算力正在集体押注“Token工厂”





过去两年,整个AI行业的注意力几乎都压在训练端。行业热点主要是哪家公司建了多大的集群、哪个模型把参数又推高了一个量级、哪家芯片的新品又把算力翻了一倍。


那是一个“造模型”的时代。算力的全部意义,似乎就是支撑下一次参数竞赛。


进入2026年,风向变了。


训练的故事还在继续,但行业真正的焦虑、真正的资本开支、真正的工程难题,正在集体挪到另一边——怎么让已经做出来的模型,稳定、便宜、大规模地跑起来。而围绕这个问题的讨论,正在收敛成一个新词:Token工厂。


在AICC 2026大会上,IDC和浪潮信息联合发布的报告显示:2026年全球活跃Agent约7940万个,到2030年将达22.16亿个。而同期Token消耗量的增长更为惊人:从2026年的0.026Peta(千万亿),增长到2030年的152667Peta。Agent数量增长约28倍,Token消耗却增长数百万倍。


与此同时,斯坦福大学披露的大模型推理成本两年下降了280多倍,一边是成本的下降,另一边是中国Token消耗量的大幅暴涨,由此业内也出现了“Token通缩”的说法——模型越便宜,用得越多;用得越多,越要把每一张卡、每一度电榨出更多Token。


而这一切背后的推手,正是Agent。


当智能体开始替人完成真实工作,算力的消耗方式就从“一次性的峰值”变成了“常年在线的供给”。一个复杂任务的背后,已经不再是一次模型调用,而是几十次、几百次的模型推理,是多个Agent连续几小时,甚至几天的协同工作。


智能本身,正在像电一样,成为一种可以被规模化生产、计量和供给的生产要素——Token,正是这种生产要素的计量单位。


1

Token工厂,

正在成为算力行业的新共识


浪潮信息首席AI战略官刘军在AICC 2026人工智能计算大会主论坛上,把这场变化概括为一次从“提供算力”到“生产智能”的迁移。


用刘军的话说,从ChatGPT到快速发展的Agent,AI正在发生一个关键变化——从回答问题,走向解决问题:一个智能体接到任务后,要理解目标、制订计划、调用工具、执行任务、检查结果,发现问题还要重新规划,跑起来就是几个小时甚至几天。


顺着这个判断往产业里看,最直接的承接者,就是Token工厂。这种共识在AICC上体现得尤其直接,本次大会甚至专门设置了“Token工厂”分论坛,一众Infra厂商都在讨论同一件事——怎么把算力高效地变成Token。


分论坛上,信通院专家给出了一个判断:Token正在具备“水电煤”式的属性——普惠、基础、连续;围绕它的产业生态,已经从算力供给、Token生产、Token分发一路延伸到Token应用,Token工厂正成为连接AI基础设施与Agent应用的底座。因此,在不少行业人士看来,2026年已经称得上“Token元年”了。


时至今日,Token工厂的入场者已经越来越多:运营商把它当成新的大生意,云厂商把它做成新的服务形态,初创公司靠极致的算力优化把价格打下来,大型企业则把它视为守住数据与安全的私有底座。有人甚至断言:未来人人都是Token工厂。


Token工厂之所以在这个时间点集中涌现,底层原因是需求的形状变了。Agent规模化之后,一次任务从“一次模型调用”变成了“几十、上百次推理”的乘法题,而算力供给只能以线性的速度增长——供需之间的缺口是结构性的,不会随着某一轮扩产而消失。而Token工厂,正是对这种结构性缺口的正面回应:把算力稳定地转化为可计量的Token供给。


更深一层看,Token成为计价单位,也意味着算力行业的商业模式正在发生迁移。过去按“资源”计价,比如卡、机房、云主机都是按配置和时长来卖的,今天算力行业第一次有了真正意义上的“计价单位”——Token。


从本质来说,运营商的大生意、云厂商的新服务、初创公司的价格战、企业的私有底座,都是同一件事:从卖算力,走向了卖Token产能。“算力规模决定产能上限,优化效率直接变成利润”正在成为Token工厂这门生意的核心逻辑。



而在供给侧,算力行业接下来要走的路也越来越清晰。刘军把算力供给分为两个方向:Capability AI Compute(能力型智算)向上突破智能上限,Capacity AI Compute(容量型智算)向广实现智能充分供给。



这两个方向,也成为浪潮信息产品创新的重要着力点。面向能力型智算,浪潮信息发布元脑SD200 Ultra超节点AI服务器。元脑SD200 Ultra基于本土AI芯片,单机承载运行2.8万亿参数的Kimi K3大模型,Token生成时延首次突破5.85毫秒。


面向容量型智算,浪潮信息发布元脑HC2000多元算力机组,采用DirectCom 2.0极速架构,基于高密液冷AI整机柜、搭配MCIS推理软件栈,实现计算负载按需匹配、动态优化,同等投资Token产能提升10倍。


值得一提的是,容量型智算的核心,不追求用一种算力解决所有问题,而是以开放汇聚多元、以协同实现全局最优,让每一份算力都转化成更多可交付的智能——而Token工厂,就是容量型智算最典型的落地形态。


2

Token工厂走红,行业路径变了:

从“一芯打天下”到“各就其位”


当算力行业的评价标尺从“算力规模”变成了“Token产出”,产业要重构的就不是单颗芯片,而是整个系统。而要看清产业重构的方向,得先回到Agent对算力的真实要求——Agent要的从来不是某一瞬间的爆发力,而是三件非常朴素的事。


其一,装不装得下——更大的模型权重、更长的上下文、持续增长的KV Cache要同时驻留显存。其二,跑不跑得稳——漫长任务链路上任何一次抖动,都可能让之前的推理和执行全部作废。其三,跑得划不划算——推理成本要低到让企业敢把业务真正跑上去。


但这三件事,没有一件是靠“把单卡算力再提高一倍”就能解决的。究其原因,推理不是一种负载,而是一系列负载。


譬如,Prefill高并行、高计算密度,是典型的计算密集型任务,吃算力,且可以通过批处理摊薄成本。Decode逐Token串行执行,是典型的访存密集型任务,吃内存带宽,而且随着任务变长,对显存容量和显存带宽的要求还会更高——每个Token的生成都串行依赖上一步,容不得半点拖沓。Attention频繁访问不断增长的KV Cache,MoE则是大规模All-to-All通信。


如果把它们硬塞进同一套代码和配置里,虽然也能跑,但很容易就会出现顾此失彼的局面。总之,用同一种算力去扛所有任务,必然有大量资源在闲置和等待——简单加服务器带不来线性增长,反而让一部分算力长期闲置、另一部分持续拥塞。


这就是为什么“堆卡”这件事,在以推理为主导的Agent时代突然不灵了。


如今,当我们把各家Token工厂的方案拆开看,可以发现技术路线正收敛为PD分离与多元异构,即把Prefill和Decode拆开、让不同芯片各司其职——这比“一芯扛所有”更划算。



众所周知,芯片从来不是“样样精通”的——峰值算力、显存容量、显存带宽、互联带宽四个维度,即使是旗舰芯片,也难在这四个维度同时做到极致,多数芯片则各有偏科。而异构部署的价值,正是让“偏科”的芯片做自己擅长的事:擅长Decode的芯片,不该被绑死在耦合部署里浪费掉。


可以预见,随着芯片百花齐放、各有专长,跨集群异构的推理架构会成为标配。那么,方向有了,谁来把这些多元算力组织起来、按业务负载动态调配,真正变成可计量的Token产能?这,正是算力机组要回答的问题。


所谓算力机组,本质上是Token工厂里负责“生产Token”的那套产能系统——不要求一种芯片什么都做,而是让不同的算力干最适合自己的活。


以元脑HC2000多元算力机组来说,硬件层面基于DirectCom 2.0极速架构,以原生液冷高密整机柜为载体,把单柜供电做到300kW以上、承载256张加速卡,算力密度提升了4倍。



很显然,当单颗芯片功耗向千瓦级逼近、单机柜功率向兆瓦级逼近,散热和供电已经不是机房配套工程,而是决定Token工厂能否持续运转的主命题,液冷由此从“可选项”变成“必选项”。


与此同时,在软件层面, MCIS多元算力协同推理软件栈持续测量不同算力资源的能力与负载,根据任务需求动态分配算力,并在运行过程中实时调整资源配置,让不同负载都能找到更适合的算力。



综合来看,芯片各就其位,软件动态调度,整机柜按负载组织资源——这套组合解决的不是“某一颗芯片好不好”,而是“多元算力机组怎么被用成一支配合的队伍”。落在Token工厂上,结果也很具体:在HC2000上部署主流开源大模型推理服务,同样的SLO约束下,同等投资Token产能提升10倍。



要知道,电费本就是推理成本里最大的一块刚性支出,每度电多产出10%的Token,光电费这项刚性支出就能省下近一成。也就是说,企业从算力机组里买到的,也不再是一堆零件,而是一套可以直接换算成Token产能的生产系统。


3

写在最后


总的来说,Token工厂的评价标尺,正在从“拥有多少算力”切换到“生产多少智能”。这不是某一家公司的叙事需要,而是Agent规模化之后需求侧的真实变化——客户要的不再是一次性的算力峰值,而是持续、稳定、可负担的智能供给;落到工程上,就是单位投资、单位电力能够稳定产出的Token产能。



回看技术史,一项技术的最高水平决定它能做到什么,普及程度才最终决定它能改变什么。真正改变几十亿人生活的不是ENIAC,而是个人电脑和智能手机;真正改变工业社会的不是最先进的发电技术,而是稳定廉价的电力进入千家万户。


今天,Token工厂要做的,正是把“智能”这道电,稳定廉价地送进千家万户。企业已经不太关心有多少卡了,他们只关心一件事——投入的算力能替自己生产多少Token、多少智能。

股票复盘网
当前版本:V3.0