扫码体验VIP
网站公告:为了给家人们提供更好的用户体验和服务,股票复盘网V3.0正式上线,新版侧重股市情报和股票资讯,而旧版的复盘工具(连板梯队、热点解读、市场情绪、主线题材、复盘啦、龙虎榜、人气榜等功能)将全部移至VIP复盘网,VIP复盘网是目前市面上最专业的每日涨停复盘工具龙头复盘神器股票复盘工具复盘啦官网复盘盒子股票复盘软件复盘宝,持续上新功能,目前已经上新至V6.5.7版本,请家人们移步至VIP复盘网 / vip.fupanwang.com

扫码VIP小程序
返回 当前位置: 首页 热点财经 AMD为何收购这家芯片公司?

股市情报:上述文章报告出品方 / 作者:半导体行业观察;仅供参考,投资者应独立决策并承担投资风险。

AMD为何收购这家芯片公司?

时间:2026-08-09 09:26
上述文章报告出品方 / 作者:半导体行业观察;仅供参考,投资者应独立决策并承担投资风险。

英伟达首席执行官兼联合创始人黄仁勋在 3 月份的 GTC 2026 大会上透露,如果超大规模数据中心运营商、云构建商、人工智能模型构建商和其他企业以及主权国家需要低延迟推理才能使用智能人工智能,或者只是想对聊天机器人推理收取额外费用,那么他们无法在 GPU 架构上实现这一点。


黄的研究表明,为了在更广泛的延迟范围内获得最佳的低延迟性能,公司需要做的是将他们的 AI 推理引擎拆分,并在 GPU 集群上处理上下文窗口的输入标记(GPU 集群非常擅长这项工作,这被称为预填充),然后将解码部分(模型给出响应的部分)卸载到大规模并行、更具确定性、SRAM 密集型的矩阵数学引擎上,例如 Grok、SambaNova Systems、Cerebras Systems 等公司创建的引擎。


原因很简单。GPU 是一款优秀的、高性能、高带宽的通用并行处理引擎,但它在推理解码部分的性能不如理想状态稳定。黄仁勋在 GTC 大会上展示的图表显示,由其“Grace”CG100 CPU 和“Hopper”H100 GPU(据推测是一个八 GPU 节点)组成的系统,通过批量处理用户,每个用户每秒可以处理大约 100 个 token,之后性能就明显下降了。


他称之为中等性能水平。NVL72混合CPU-GPU平台拥有18个CPU和36个GPU,基于相同的Grace CPU和Nvidia的“Blackwell”B300 GPU,在100 TPS交互级别下,其性能(以每秒每兆瓦的令牌数表示)约为现有系统的3.5倍。即将推出的基于“Vera”CV100 CPU和“Rubin”R200 GPU的NVL72机架级系统,其TPS/MW性能约为Grace-Blackwell系统的2倍,这意味着其性能是Grace-Hopper系统的7倍。


Grace-Hopper节点的交互能力已无法超越此水平,但Grace-Blackwell系统可以支持Huang所说的“高层级”应用,即每用户200 TPS,并保持合理的整体吞吐量,而Vera-Rubin NVL72的性能则要好三倍。在高级层级应用(交互能力达到400 TPS)下,Grace-Blackwell机架式系统的TPS/MW接近于零,而Vera-Rubin的性能则要好十倍,并能提供合理的整体TPS/MW。


同样,这些方法都使用 GPU 来进行推理的预填充和解码部分。但是,当 Nvidia 将推理负载拆分,把预填充放在 GPU 上,而把解码放在我们推测是一整套 Grok LP30 加速器机架上时,会发生什么呢?


全新的 Ultra 推理层级正式启用,它很可能成为交互量超过 1000 TPS/用户的智能体工作负载的性能基准。不仅如此,搭载 Grok 加速器的 Vera-Rubin NVL72 的 Premium 层级性能也比未搭载 Grok 加速器的 Grace-Blackwell NVL72 提升了 35 倍(相比之下,未搭载 Grok 加速器的 Grace-Blackwell NVL72 的性能提升仅为 10 倍)。显而易见,仅靠 GPU 加速器很难在合理的系统整体吞吐量下实现超过 400 TPS/用户的性能。


当然,Grok集群在解码方面的扩展能力也有限。你不可能把一百万个这样的设备连接起来以进一步增强交互性。(当然,我们并不知道这些限制是什么。)


这两张图表不仅解释了英伟达为何在去年12月斥资200亿美元收购了Grok团队及其技术,还解释了AMD为何与Cerebras合作开发分解式推理技术,以及为何本周AMD收购了人工智能推理初创公司Taalas——这并非某种可疑的、规避审查的收购,而是实实在在的收购——收购金额未公开。AMD的GPU在推理解码方面与英伟达的GPU存在同样的局限性。


与 Cerebras 的合作对 AMD 和 Cerebras 来说都是一件好事,这将使 AMD 的“Helios”集群(使用“Verano” Epyc CPU 和“Altair” MI455X GPU)能够像 Nvidia 未来 Vera-Rubin-LPU 组合那样进行分解推理,我们推测该集群将于今年晚些时候发布第四代晶圆级计算引擎 (WSE-4)。


唯一的问题是,AMD 无法掌控 Cerebras 的技术,因为后者在今年早些时候上市前筹集了大量资金,使得 AMD 收购该公司的成本非常高昂。AMD 越来越倾向于掌控自己的技术栈,而 Cerebras 目前的市值高达 509 亿美元,这意味着 AMD 可能需要花费 600 亿美元收购一家目前季度营收不足 2 亿美元的公司。在如今的收购市场,支付 300 倍的年营收溢价风险极大,而通常情况下,收购溢价可能只有这个数字的十分之一。


因此,AMD 目前看来只能寻求新的合作方式——由于 Graphcore 被 Arm 的母公司软银收购,Nvidia 收购了 Grok,而 SambaNova 与英特尔合作,Cerebras 成了 AMD 唯一的选择——并寻找未来推理加速的新方法。


今年二月,Taalas公司正式发布新品时,我曾对其进行过深入报道,这里就不赘述了。该公司由一群曾创立或就职于人工智能加速器和RISC-V架构领军企业Tenstorrent的工程师组成。其创新之处在于将人工智能推理模型及其权重硬编码到ROM电路中,并将其连接到巨大的SRAM块,这些SRAM块充当片上键值缓存(KV缓存)。目前Taalas的HC1芯片可以存储包含80亿个参数的模型,而下一代HC2芯片则计划存储200亿个参数。理论上,几十个芯片互连后,就可以存储包含万亿个参数的推理模型及其权重。在初步基准测试中,与Nvidia Blackwell B200 GPU相比,Taalas展现出了极低的延迟和更低的单次推理成本。


Taalas 的诀窍在于,每个模型都需要一个不同版本的 HC1 芯片——SRAM 和周围的组件都相同,但芯片中用于编码模型和权重的两层金属必须改变。不过,Taalas 也表示,训练一个新的 GenAI 模型所需的成本是定制 Taalas HC 芯片并以合理数量(几十万个芯片比较合适)购买的成本的 100 倍。


AMD 对 Taalas 的计划并未透露太多,只表示“AMD 计划将该技术整合到其加速器路线图中,并使用 AMD Instinct GPU 开发系统级解决方案”。


欢迎来到模型特定架构的世界。


(来源:编译自nexeplatform

股票复盘网
当前版本:V3.0