大模型公司开始提前备货
过去,大模型公司通常从云厂商手中购买算力。
这套方式适合创业初期。公司不需要自己买地、建机房,也不必管理复杂的硬件集群,租用 GPU 就可以开始训练。
但当计算需求从几百张芯片增长到几万甚至几十万张时,云端资源很难像水龙头一样随开随有。
前沿模型的训练可能持续数月,期间还要同时安排后训练、推理和大量实验。头部公司需要的已经不是一次性的计算资源,而是一套能够长期调动的系统。
OpenAI 因此推进 Stargate,首批设施从 1GW 级起步,整体规划达到数 GW;
xAI 在孟菲斯建设 Colossus,并把规模扩大到约 2GW;Meta 的 Hyperion 目标达到 5GW,其更大的基础设施规划还准备继续扩张;
Anthropic 则通过与 Amazon 的长期合作锁定约 5GW 算力。Google 很早就围绕 TPU 建立自己的计算集群,国内的字节和智谱也都进入了 1GW 级建设阶段。
这些公司的方式并不相同。有的直接修建园区,有的和云厂商深度绑定,有的拥有自研芯片。但它们面对的是同一个时间差:模型几个月就会更新一次,数据中心却需要几年才能建成。
今天签下的土地和电力合同,服务的可能是三年后的模型。所谓建设算力中心,其实是在为尚未确定的下一代技术提前留位置。
02
软件生意开始有了钢筋水泥味
算力中心把 AI 公司带进了一个陌生世界。
软件产品开发完成后,可以近乎零成本地复制给更多用户;数据中心却需要土地、变电设施、冷却设备、高速网络和长期能源合同。
服务器进入机房前,可能已经有数十亿美元投入到看不见的土建和供电工程里。
过去,一家 AI 公司最重要的能力是招到研究人员、训练模型和推出产品。现在,它还要处理电网接入、施工进度、设备折旧和资本安排。基础设施基金、能源企业、地产商和长期债务,也开始进入大模型产业链。
这让 AI 竞争多了一层赌注。
头部公司普遍相信,未来的模型会消耗更多计算资源,因此必须提前扩建。
但几年后的训练方式会不会改变,新增算力能否被充分利用,模型收入又能否覆盖持续增长的成本,目前都没有确定答案。
一座空闲的数据中心不会因为属于 AI 行业就变得更便宜。昂贵芯片只有持续运行,才可能转化为研发效率;一旦需求低于预期,它也可能迅速变成沉重的折旧负担。
算法公司最擅长预测下一个词,现在却不得不预测几年后的电力需求。
03
路怎么修?
智谱项目与海外同行最大的差别,在于它全部采用中国制造的芯片。
全球公司的底层选择已经开始分化:OpenAI 和 xAI 主要依赖英伟达,Meta 在采购英伟达的同时推进自研 MTIA,Anthropic 使用 Amazon Trainium 与英伟达,Google 坚持 TPU,字节的相关项目采用华为昇腾。
智谱则把整座 1GW 数据中心放在国产芯片体系上运行。
当模型公司只是在云上租用算力时,芯片更像一项被封装好的服务。
开始建设自己的数据中心后,底层硬件会牵动整套系统:服务器如何设计,芯片之间如何通信,编译器和训练框架如何适配,故障发生后如何恢复,都需要重新磨合。
单颗芯片能够运行模型,和成千上万颗芯片能够一起高效训练,并不是同一件事。
集群扩大后,任何通信延迟、软件兼容问题或者设备故障,都可能让大量机器停下来等待。
英伟达的优势,很大一部分来自 CUDA 和长期积累的工程生态。
使用这套体系扩建算力,更像在已经铺好的高速公路上增加车道。智谱面对的情况更复杂:它既要扩大车流,还要参与修路。
所以,1GW 只是一个工程规模,不能直接等同于模型能力。
这座数据中心最终有没有价值,要看它能否稳定承担大规模训练,是否能保持较高利用率,以及能不能真正缩短 GLM 系列模型的迭代周期。
只有当机房里的芯片持续转化成新的模型和产品,算力中心才不只是一个醒目的数字。
过去,人们习惯通过排行榜和发布会观察 AI 竞争。下一轮差距,可能在模型登场前就已经形成——藏在提前锁定的电力、尚未安装的服务器,以及那些需要几年才能建成的数据中心里。
智谱进入的,正是这场更慢、更重,也更难临时追赶的比赛


VIP复盘网