今日,MiniMax正式开源多模态生成模型MiniMax H3。同日,摩尔线程基于AI训推一体智算卡MTT S5000及MUSA软件栈,率先完成H3的极速适配与高效运行。这一成果不仅展示了MUSA软件生态面向前沿模型的快速响应与全栈协同能力,也彰显了全功能GPU驱动多模态模型创新的实践能力。
视频:H3在单机八卡MTT S5000节点上的运行状态
作为MiniMax首款开源多模态生成模型,H3突破了传统单一任务的边界,能在多模态上下文中统一理解创作意图,支持文本、图片、音频和视频的多元输入,可直出2K分辨率、最长15秒的原生音画内容。在生成表现与性价比上,H3具备商用级多场景内容生成能力,不仅在Artificial Analysis视频模型榜单中斩获“视频编辑能力全球第一”,其2K分辨率视频生成价格更低至0.8元/秒,展现出极高的商业性价比。此外,H3的开源属性显著降低了应用门槛,支持企业本地化灵活部署与自有数据定制,在满足安全合规需求的同时,加速多模态生产力的广泛普及。
MiniMax H3开源当日,摩尔线程团队迅速完成了模型架构拆解、核心技术分析及典型算子梳理,仅用3小时便打通了从SGLang-MUSA推理框架到MATE、muDNN高性能算子库的完整适配路径,实现了H3在MTT S5000上的快速部署与稳定运行。
依托MTT S5000大算力底座,从容应对高计算负载
由于多模态上下文的引入,MiniMax H3的序列长度方差扩大了3倍,理解与生成阶段的计算负载显著提升,对底层硬件的算力规格与吞吐提出了严峻挑战。MTT S5000凭借业内领先的算力密度,从容承接H3在理解与生成全流程中的高计算负载,高效满足多模态上下文推理的算力需求,充分释放H3模型完整性能。
MATE与SGLang-MUSA深度协同,全栈加速推理效能
MiniMax H3 Day-0适配并不依赖单一算子方案,而是由多层次算子、推理框架生态共同支撑。
MUSA在编程模型、运行时接口及主流AI生态接入层,具备高度生态兼容与迁移能力,可加速上游实现的识别、迁移与验证,大幅缩短新模型适配周期;自研开源算子优化引擎MATE负责能力检测、算子选择与后端调度,为Attention、GEMM等核心算子提供高效实现及统一调用接口,构建起“SGLang-MUSA—MATE—MTCC—MUSA Runtime”的软件闭环。
在推理框架层面,SGLang-MUSA已于今年4月合入SGLang主线,成为官方后端矩阵一员。不论SGLang框架本体sglang、高性能算子库sgl-kernel,还是多模态生成模型的推理子系统SGLang-Diffusion,开发者均可原生调用摩尔线程GPU,获得极致的性能体验。
本次MiniMax H3在MTT S5000上的极速适配,再次彰显了MUSA架构面向前沿模型“发布即适配”的全栈协同能力,并以“适配—部署—优化”的完整工程路径,助力开发者以更快速度与更低成本接入最新模型。
未来,摩尔线程将与MiniMax持续深化合作,在多模态领域共同探索更强的上下文理解能力与更大模型规模,加速AGI技术的创新与产业化落地。


VIP复盘网