8月26日,智谱正式发布并开源GLM-5系列的首个原生多模态模型GLM-5.3-Flash(320B-A18B)。沐曦股份曦云C系列GPU完成该模型Day 0全链路适配,再度以全栈自主软硬件技术实力,领跑国产GPU生态适配赛道。
GLM-5.3-Flash仅320B总参数,能力超过GLM-5.2,在全球权威的Artificial Analysis Intelligence Index(AA综合智能指数)中取得57分,进入全球前沿模型能力区间,与Anthropic最受欢迎的模型Claude Opus 4.8得分持平。在自研 Z.ai Code Bench 体感评估中,其表现与 Claude Opus 4.8 相当。

与此同时,GLM-5.3-Flash定价为1/10的GLM-5.3,限时折扣内为1/20的GLM-5.3,为Opus 4.8的1/40。同样智力,1/40价格,前沿智能,第一次不需要省着用。
曦云C系列GPU为GLM-5.3-Flash提供澎湃国产算力

基于沐曦股份自研核心GPU IP打造的曦云C系列GPU,兼具高能效比与高通用性,在保持优异精度的同时,实现高性能、低延迟推理。依托沐曦股份全栈自研的 MXMACA 软件栈,曦云C系列GPU能实现模型低成本迁移与高效部署,并充分释放自身澎湃算力,为GLM-5.3-Flash提供 “发布即能用”的国产算力底座。
MXMACA软件栈是推动沐曦GPU从“能用”走向“好用、易用”的关键一环。其作为连接硬件算力与上层应用生态的核心枢纽,全链路覆盖底层驱动、用户态接口、MXCC编译器、算子深度适配及主流训练/推理框架对接。目前,MXMACA软件栈已实现对主流AI生态的广泛覆盖:兼容支持40余种AI框架、1000多款模型,适配超6000个开源项目测试,全量支持PyTorch 2.8的2410个GPU算子。
持续领跑国产GPU Day 0适配赛道

自2025年12月以来,沐曦股份已完成32个主流顶尖模型Day 0适配,涵盖智谱AI、阿里千问、MiniMax、DeepSeek、阶跃星辰、腾讯混元等头部厂商,适配品类囊括通用语言、多模态、OCR等,适配速度、数量、生态广度均位居行业前列。
此前,智谱推出的GLM-4.6V、GLM-OCR、GLM-5、GLM-5.1、GLM-5.2等全系列模型,沐曦股份均实现Day 0同步适配。本次GLM-5.3-Flash的无缝适配,再一次充分体现了曦云C系列与MXMACA软件栈的高兼容性与快速适配能力。
未来,沐曦股份将继续深化与国内头部AI企业的生态协同,以自主可控的高性能算力,助力AI产业高质量发展与算力国产化落地。
关于GLM-5.3-Flash

在正式发布前,GLM-5.3-Flash以匿名模型Ox-Alpha(中文社区称作牛来)在OpenCode和OpenRouter上进行了大规模测试。Ox-Alpha迅速成为当周最受欢迎的模型,创下双平台调用量新高。这些请求流量全部由国产芯片提供算力支持。
GLM-5.3-Flash在各项基准测试和实际使用中,全面超越参数量高出一倍的GLM-5.2,定价却仅为后者的1/10。这得益于GLM-5.3-Flash的全新模型架构。GLM-5.3-Flash的架构专为极低成本而设计,其总参数量与GLM-4.5基本相当(355B vs. 320B),但激活参数量(32B → 18B)和层数(92 → 45)几乎减半。结合智谱最新的30T Token多模态预训练语料,这些改进使得GLM-5.3-Flash能够在较少的计算资源下实现更强大的性能。
GLM-5.3-Flash同时进行了多项架构升级,是首个采用稀疏注意力与线性注意力混合架构的开源前沿模型,在保持精准长上下文能力的同时,大幅降低了长上下文服务成本。此外,GLM-5.3-Flash采用了流形约束超连接(Manifold-Constrained Hyper-Connections,mHC),进一步提升了模型的Scaling能力。
极致低成本架构
为降低模型在长上下文场景下的注意力成本,智谱采用了线性注意力与稀疏注意力相结合的混合架构。其中,线性注意力通过递归机制捕获局部依赖关系,稀疏注意力则借助轻量级索引器召回全局上下文。为进一步降低1M上下文下索引器的时延与内存开销,智谱引入了IndexPool,通过加权池化将索引器的4个缓存向量压缩为1个向量。
代码循环中的视觉反馈
GLM-5.3-Flash是GLM-5系列的首个原生多模态模型。视觉编码(Visual Coding)并不只是处理图像,它拓展了Coding所能触及的边界。对于前端开发、游戏开发、3D仿真等任务而言,最终产物并不只是代码,还包括用户能够感知的界面、交互或虚拟世界。视觉能力被原生集成进模型中,使其能够自主判断何时需要“观察”,并利用视觉反馈来指导下一步行动。
超越Coding的工作伙伴
GLM-5.3-Flash在专业工作流中的能力相较同级别模型显著提升。针对PPTX、PDF、DOCX和XLSX等Office与文档类任务,新增的视觉理解能力使模型能够检查并优化自身输出,并具备更强的审美判断能力。此外,模型还可以将自己的输出结果与视觉上下文以及预期的结果进行对比,从而实现更有效的自我验证和优化——包括更准确的呈现质量评估以及审美判断。
即日起,GLM-5.3-Flash正式面向全球开源,且已接入ZCode等编码平台,并纳入GLM Coding Plan(每天限量发放10,000张体验卡),同步开放API调用。


VIP复盘网