当亚马逊(Amazon)在2015年收购芯片设计公司Annapurna Labs时,AI热潮还有好几年才会到来。当时押下的赌注非常明确:如果专为云端工作负载设计芯片,而不是依赖通用硬件,就能以更低的成本提供更高的性能。
对人工智能基础设施的不同押注
十年后,这一赌注已成为亚马逊历史上增长最快的业务之一。
亚马逊的芯片业务——涵盖用于AI训练与推理的 Trainium、用于通用云计算(以及日益增多的代理式AI,即Agentic AI)的 Graviton,且均基于用于安全和 networking 的 Nitro 系统——最近的年化营收跑率(annual revenue run rate)已突破 250亿美元,实现了三位数的同比增长。
“鉴于我们在AI(通过 Trainium)和 CPU(通过 Graviton)领域都拥有领先的性价比芯片,我们在这场AI转折点中处于极为有利的地位。”—— 安迪·贾西(Andy Jassy),亚马逊首席执行官
以下年表详细记录了亚马逊多代专用芯片的发展历程。

亚马逊为何选择自研芯片
在历史上,AI芯片市场并不急于降低成本,行业领导者也极少自我颠覆。亚马逊则选择了一条不同的道路。
亚马逊没有完全依赖现成的处理器,而是从零开始针对特定的工作负载设计芯片。这种方法实现了深度垂直整合:硬件和软件工程师从芯片设计一直到服务器部署全程紧密合作,以逆向工作法(Working Backwards)从系统倒推,从而打造出完全契合客户实际运行工作负载的芯片。

AWS Trainium3 芯片
其成果便是服务于不同但互补角色的三大芯片系列:
Trainium:专为 AI训练与推理 打造——即训练AI模型以及大规模运行这些模型的高强度计算工作。
Graviton:处理 通用云计算——即驱动现代软件的网站、应用程序、数据库以及日益增加的代理式AI工作负载。在我们的前1,000家顶级 EC2 客户中,有 98% 都在使用 Graviton,且其营收承诺环比增长了近3倍。最新一代 Graviton5 比上一代性能提升高达25%,其增长速度几乎是 Graviton4 的两倍。
Nitro:为 AWS 云基础设施背后的网络、存储和安全提供动力支持。
正如首席执行官安迪·贾西在公司2026年第二季度财报电话会议上所指出的:“我们的芯片业务年化营收跑率现已超过 250 亿美元。鉴于我们在 AI(通过 Trainium)和 CPU(通过 Graviton)领域均拥有领先性价比的芯片,我们在这场 AI 转折点中处于极为有利的地位。除了 Anthropic 和 OpenAI 这两家全球顶尖的 AI 实验室与 Trainium 签订了涉及数吉瓦(gigawatt)电力的多年期合作协议外,越来越多的 AI 初创企业也在采用 Trainium。”
亚马逊芯片对 AI 客户意味着什么
对于使用 AI 进行构建的企业来说,芯片的经济性至关重要。训练一个前沿AI模型可能需要几十万颗芯片持续运行数周或数月。而大规模运行该模型——每天响应数百万次查询——则需要高效的推理基础设施。即便性价比只有微小的提升,在大规模应用中也能转化为巨额的成本节省。
这就是为什么全球顶尖的 AI 实验室和科技公司都在针对亚马逊的芯片做出重大承诺:
Anthropic 已承诺使用高达 5 吉瓦(GW)的当前及下一代 Trainium 芯片来训练和驱动其 Claude 模型,该模型运行在超过 100 万颗 Trainium2 芯片之上。Anthropic 还在使用数千万个 Graviton 核心,以便在广泛生成式 AI 工作负载中提供具备可扩展性的性能和成本效益。
OpenAI 已承诺从 2027 年开始,通过 AWS 基础设施使用 2 吉瓦的 Trainium 算力来驱动其前沿模型。
Meta 已签署协议,部署数千万个 Graviton 核心,为其代理式 AI(agentic AI)背后的 CPU 密集型工作负载提供支持。
Uber 正在使用 Graviton 在几毫秒内将乘客与司机进行匹配,并试点使用 Trainium3 来训练能让每次行程更加智能的 AI 模型。
为满足前所未有的大规模客户需求
而打造的 AI 芯片
Amazon Bedrock 是该公司为数十万客户提供的托管 AI 服务,其大部分推理工作都在 Trainium 上运行。越来越多的 AI 初创企业也开始采用 Trainium,其中包括 Neura Robotics(选择 Trainium 用于物理 AI)和 Odyssey(选择 Trainium 构建模拟物理规律的世界模型,其单美元获得的有用算力几乎是其他替代方案的两倍)等独角兽企业。此外还有 TwelveLabs、DeCart、Poolside、Karakuri、Matagenomi、NetoAI 和 Splash music 等初创公司,以及 Uber 和 Pinterest 等规模更大的公司。
在 Graviton 方面,如今已有超过 13 万客户使用基于 Graviton 的服务器。AWS 新增的所有算力中,有一半以上都运行在 Graviton 芯片上。

AWS Graviton5 芯片
这一需求反映了 AI 基础设施构建方式的变化。随着 AI 系统从解答问题转变为采取行动——即实时推理、代码生成和多步骤任务编排——所需的算力对 AI 加速器和 CPU 都提出了极高的要求。而亚马逊在这两个领域都占据了有利地位。
但单颗芯片只是故事的一部分。亚马逊将它们连接成越来越强大的系统:
Trn3 UltraServers:将多达 144 颗 Trainium3 芯片打包到一个集成系统中,计算性能比 Trainium2 UltraServers 提升高达 4.4 倍。这使得客户能够在几周内(而非几个月)完成模型训练。
雷尼尔计划(Project Rainier):全球最大的 AI 计算集群,专为大规模训练前沿模型而打造。雷尼尔计划目前正在运行 Anthropic 的 Claude 模型。
能效:Trainium3 每兆瓦输出的 Token 数量是 Trainium2 的 5 倍以上——这种效率在大规模应用时,对成本和环境影响都至关重要。

雷尼尔计划内部:全球最大的 AI 计算集群之一
AI、芯片与量子计算
亚马逊芯片业务的未来
亚马逊的芯片路线图正在持续加速推进。Trainium4 已在开发中。Graviton 在代理式 AI 时代继续演进。在现已统领涵盖 AI 模型、自研芯片和量子计算全新组织的 彼得·德桑蒂斯(Peter DeSantis) 领导下,亚马逊正在将这些技术融合在一起,使其相互促进。
“我们在构建这些模型时获得优势的方式之一,就是利用我们在芯片领域的深厚投资来提供性能和成本效益,这将使我们的模型开发脱颖而出。”
—— 彼得·德桑蒂斯(Peter DeSantis),亚马逊 AI 模型、芯片与量子计算高级副总裁
这一战略押注在一个简单的前提上:掌握自主芯片的公司将主导 AI 的发展节奏。凭借涵盖训练、推理和通用计算的芯片产品组合,以及已提前多年吸引客户强烈兴趣的路线图——亚马逊正在构建支撑下一代 AI 运行的基础设施层


VIP复盘网