扫码体验VIP
网站公告:为了给家人们提供更好的用户体验和服务,股票复盘网V3.0正式上线,新版侧重股市情报和股票资讯,而旧版的复盘工具(连板梯队、热点解读、市场情绪、主线题材、复盘啦、龙虎榜、人气榜等功能)将全部移至VIP复盘网,VIP复盘网是目前市面上最专业的每日涨停复盘工具龙头复盘神器股票复盘工具复盘啦官网复盘盒子股票复盘软件复盘宝,持续上新功能,目前已经上新至V6.5.7版本,请家人们移步至VIP复盘网 / vip.fupanwang.com

扫码VIP小程序
返回 当前位置: 首页 热点财经 GLM-5.3实测体感超预期,编程能力最强开源模型,网络安全能力涌现

股市情报:上述文章报告出品方/作者:财联社;仅供参考,投资者应独立决策并承担投资风险。

GLM-5.3实测体感超预期,编程能力最强开源模型,网络安全能力涌现

时间:2026-08-14 16:42
上述文章报告出品方/作者:财联社;仅供参考,投资者应独立决策并承担投资风险。

国模一哥的位子,空了几个月,或许又回到了智谱手里。

814日,智谱发布新一代基座模型GLM-5.3这次提升最集中的方向是代码。智谱公布的数据显示,GLM-5.3编程体感较上代GLM-5.2提升约50%。基准成绩上,衡量真实终端复杂任务执行能力的Terminal-Bench 3.0,得分从5.1提到28.3,高于Kimi K317.4Agents' Last Exam23.8提到28.5,高于K327.6;覆盖44种职业真实工作任务的GDPval-AA v2拿到1769分,排名世界第二;长程软件工程基准DeepSWE上,从46.2提升至66.9。整体看,这代模型在CodingAgent类基准上回到了开源最前列,能力接近最前沿的海外闭源模型Claude Fable 5

提升主要集中在长程、复杂的软件工程任务上,开发者圈子的反馈更直观。发布后不久,多个社区陆续出现实测案例:让它排查一个老旧Python项目的依赖冲突,可以连续操作终端、读日志、改配置,几乎不需要人工干预;从零搭建一个前后端分离项目,目录结构、接口设计和边界处理都比上一代完整。不少一线开发者的判断是,这大概是目前国内实测下来代码能力最强的开源模型。

有意思的是,这一代模型的基座架构与参数规模同上一代基本保持一致,能力提升来自大规模后训练(Post-training Scaling)——依托数十倍规模的长程任务环境和更充分的训练过程,持续挖掘既有基座的智能潜力。效率表现同样突出:在真实编程场景评测中,GLM-5.3完成单项任务的平均输出约5万tokens,不到海外旗舰闭源模型Claude Opus 4.8(约12万tokens)的一半,准确率反而更高。以更集约的算力消耗获得更强的模型能力,正在成为大模型技术演进的新方向。

GLM-5.3更受关注的是直接对标Mythos的网络安全能力。官方选取了覆盖漏洞分析、验证和利用不同阶段的三个基准,对GLM-5.3的网络安全能力进行评估。在CyberGym测试中,模型从白盒源代码出发,通过触发程序故障来识别和验证漏洞,GLM-5.3得分为84.5%,略高于Mythos 583.8%GPT-5.6 Sol83.6%。在更考验深度推理能力的ExploitBench中,GLM-5.3得分为54.4%,是GLM-5.2的两倍多,但仍低于Mythos 578.0%

同时,智谱宣布完整模型权重将在两周内开源。智谱表示当攻击者开始使用前沿AI,最强的防御能力不能只掌握在少数机构手中。随着GLM-5.3的开源,它即将掌握在所有人手中。此举被认为是上个月Hugging FaceOpenAI智能体入侵事件的回应。Hugging Face在遭遇攻击时,调查取证初期,团队使用商业闭源模型分析攻击日志,但由于模型无法区分使用者是攻击者还是安全人员,相关请求被拒绝;随后,Hugging Face将智谱GLM-5.2部署在自有服务器上,分析超1.7万条事件,成功还原攻击过程,日志、凭据等敏感数据全程留在本地。

放到更大的图景里看,这也是国产开源大模型近期集体走强的一个缩影。过去几个月,KimiDeepSeek接连刷出新高度,中国开源模型在全球开发者社区的存在感明显上升。

智谱商业化也在走强:智谱MaaS开放平台注册用户已接近700万,较七月初增加约200万,其中企业客户2.3万家;编程工具ZCode上线一个月用户破百万;今年以来ARR增长15倍。另据市场消息,其已建成1GW国产AI算力集群,超5万块国产芯片投入使用,Coding Plan在大幅涨价后已重新开放购买。声量、用户、收入、算力,几条线都在往上走。两周后的开源实测,会是检验这轮"超预期"成色的下一道关。

股票复盘网
当前版本:V3.0