初创公司 d-Matrix 的工程师们在过去七年中,一直在构建一个软硬件结合的平台,旨在加速 AI 推理工作负载并降低成本。自 2019 年成立以来,该公司一直专注于推理,“当时甚至没有多少人知道推理是什么,”联合创始人兼首席执行官 Sid Seth 表示。
自那时起,对更快推理的需求呈爆发式增长。随着过去一年中像 Anthropic 的 Claude Code 等 Agentic AI(智能体 AI)工具的崛起,以及 OpenClaw 的引入,推理工作负载已超出 Nvidia 和 AMD 等公司的 GPU 独立处理能力的极限。
“在过去 12 个月中,许多不同应用对低延迟推理的需求迎来了爆发,”Seth 在本周的媒体与分析师简报会上表示。“现在,随着网络安全应用的到来,对低延迟 Token 的需求极大。正是因为低延迟推理的爆发,对推理的需求才真正飙升。”
经过七年的研发,在获得包括微软 M12 风险投资部门在内超过 5 亿美元资金支持的 d-Matrix,于今年 6 月推出了其首款推理加速平台 Corsair。该平台采用了以内存为中心(memory-centric)的方法,高管们声称这能帮助运行推理工作负载的速度比单用 Nvidia GPU 快十倍。
现在,Corsair 正与 Nvidia 的“Blackwell”GPU 加速器一同集成在同一个机柜中。
这种 XPU 将 SRAM 或 3D-RAM 等内存与同一机柜中的 GPU 和 CPU 紧密结合,以加速 Token 的生成并降低相关成本。


VIP复盘网