国模一哥的位子,空了几个月,或许又回到了智谱手里。

8月14日,智谱发布新一代基座模型GLM-5.3。这次提升最集中的方向是代码。智谱公布的数据显示,GLM-5.3编程体感较上代GLM-5.2提升约50%。基准成绩上,衡量真实终端复杂任务执行能力的Terminal-Bench 3.0,得分从5.1提到28.3,高于Kimi K3的17.4;Agents' Last Exam从23.8提到28.5,高于K3的27.6;覆盖44种职业真实工作任务的GDPval-AA v2拿到1769分,排名世界第二;长程软件工程基准DeepSWE上,从46.2提升至66.9。整体看,这代模型在Coding和Agent类基准上回到了开源最前列,能力接近最前沿的海外闭源模型Claude Fable 5。
提升主要集中在长程、复杂的软件工程任务上,开发者圈子的反馈更直观。发布后不久,多个社区陆续出现实测案例:让它排查一个老旧Python项目的依赖冲突,可以连续操作终端、读日志、改配置,几乎不需要人工干预;从零搭建一个前后端分离项目,目录结构、接口设计和边界处理都比上一代完整。不少一线开发者的判断是,这大概是目前国内实测下来代码能力最强的开源模型。
有意思的是,这一代模型的基座架构与参数规模同上一代基本保持一致,能力提升来自大规模后训练(Post-training Scaling)——依托数十倍规模的长程任务环境和更充分的训练过程,持续挖掘既有基座的智能潜力。效率表现同样突出:在真实编程场景评测中,GLM-5.3完成单项任务的平均输出约5万tokens,不到海外旗舰闭源模型Claude Opus 4.8(约12万tokens)的一半,准确率反而更高。以更集约的算力消耗获得更强的模型能力,正在成为大模型技术演进的新方向。
GLM-5.3更受关注的是直接对标Mythos的网络安全能力。官方选取了覆盖漏洞分析、验证和利用不同阶段的三个基准,对GLM-5.3的网络安全能力进行评估。在CyberGym测试中,模型从白盒源代码出发,通过触发程序故障来识别和验证漏洞,GLM-5.3得分为84.5%,略高于Mythos 5的83.8%和GPT-5.6 Sol的83.6%。在更考验深度推理能力的ExploitBench中,GLM-5.3得分为54.4%,是GLM-5.2的两倍多,但仍低于Mythos 5的78.0%。
同时,智谱宣布完整模型权重将在两周内开源。智谱表示当攻击者开始使用前沿AI,最强的防御能力不能只掌握在少数机构手中。随着GLM-5.3的开源,它即将掌握在所有人手中。此举被认为是上个月Hugging Face被OpenAI智能体入侵事件的回应。Hugging Face在遭遇攻击时,调查取证初期,团队使用商业闭源模型分析攻击日志,但由于模型无法区分使用者是攻击者还是安全人员,相关请求被拒绝;随后,Hugging Face将智谱GLM-5.2部署在自有服务器上,分析超1.7万条事件,成功还原攻击过程,日志、凭据等敏感数据全程留在本地。
放到更大的图景里看,这也是国产开源大模型近期集体走强的一个缩影。过去几个月,Kimi、DeepSeek接连刷出新高度,中国开源模型在全球开发者社区的存在感明显上升。
智谱商业化也在走强:智谱MaaS开放平台注册用户已接近700万,较七月初增加约200万,其中企业客户2.3万家;编程工具ZCode上线一个月用户破百万;今年以来ARR增长15倍。另据市场消息,其已建成1GW国产AI算力集群,超5万块国产芯片投入使用,Coding Plan在大幅涨价后已重新开放购买。声量、用户、收入、算力,几条线都在往上走。两周后的开源实测,会是检验这轮"超预期"成色的下一道关。


VIP复盘网