1.本周观点
1.1 近期大模型密集发布,多项评测指标成为评估关键
2026年7月中旬以来,国产语言大模型迎来了一轮密集发布潮:
7月17日,月之暗面发布新一代开源大模型Kimi K3(总参数量2.8万亿),原生搭载视觉理解、支持百万词元超长上下文,拿下Frontend Code Arena编程榜单榜首,实现开源模型首次超越头部闭源模型登顶。
7月31日,DeepSeek宣布DeepSeek-V4-Flash正式版API上线公测。据官方更新日志,正式版在Agent能力上大幅增强,多项基准测试远超预览版;模型结构、尺寸与预览版保持一致,仅重新进行了后训练。
8月3日,阿里巴巴正式发布新一代基座大模型Qwen3.8,总参数量2.4万亿,在编程(Coding)和专业办公(Cowork)方面能力大幅提升。
8月13日,DeepSeek-V4-Pro-0813正式版上线。Agent能力几乎全面提升,知名机构SemiAnalysis表示,DeepSeek V4 Pro和Flash在Agent相关测试中,都甩开了参数更大的英伟达Nemotron 3 Ultra模型。
8月14日,智谱正式发布新一代基座模型GLM-5.3。该模型通过后训练提高了模型的智能上限,在包括Terminal Bench 3.0、Agents' Last Exam(CLI)在内的公开基准测试中取得开源第一。

各家模型在Benchmark展示上维度不一、侧重点各异。Kimi K3分编程能力、通用智能体能力、视觉智能体能力三方面展示;DeepSeek V4 Pro聚焦Agent能力;GLM-5.3则分编程能力、网络安全、智能体综合能力三方面呈现。各家榜单口径不一、维度各异,面对如此密集的发布与纷繁的评测数据,普通投资者和从业者难免感到困惑。那么,我们究竟应如何透过这些benchmark科学评判大模型的优劣?哪些指标最具参考价值?
1.2 哪些Benchmark值得重点看
2026年初,一项发表在arXiv上的系统性研究分析了60个主流大语言模型基准,结论令人不安——近一半的基准已经饱和,即排名靠前的模型得分趋同,基准失去区分能力。因此评估一个Benchmark的重要标准就是任务真实反映实际工作场景,同时足够难,使得前沿模型得分尚未饱和,能在更宽分数区间区分前沿智能体。

工具调用与MCP编排能力重点关注Toolathlon Verified。Toolathlon Verified2026年6月发布,由中国香港科技大学自然语言处理组(HKUST-NLP)主导开发,主要评估智能体在现实环境中工具使用能力。

环境交互与计算机操作能力重点关注Terminal-Bench 3.0。2026年5月发布的Terminal-Bench 2.1评估的是AI Agent通过终端操作计算机的能力。但目前各家最优大模型在这一基准的得分均在88分左右,差距过小,区分模型的能力较差,而目前新发布的Terminal-Bench 3.0难度较高,目前GLM-5.3较GLM-5.2的分数4.有较大提升,是当前排名最高的开源模型,分数达到28.3,与其他国产开源模型拉开较大差距。

代码开发与软件工程测评是各家大模型重点关注的核心测评能力,值得重点关注的基准是DeepSWE、NL2Repo和ProgramBench。早期代码评测基准主要使用SWE-bench,通过挖掘公开GitHub仓库中的已合并修复来构建测试任务,但修复方案和讨论早已公开、可能已被纳入模型预训练数据,高分反映的可能是“记忆”而非真正的“问题解决能力”。而DeepSWE基准的任务从头编写、永不回灌上游,参考解不会出现在训练数据;并用手写验证器检验功能是否实现、接受任意正确实现。DeepSWE v1.1 保留了与 v1 相同的长期工程任务,但通过在干净、隔离的环境中对已提交代码进行评分,更新了代理的执行和评分方式,使结果更易于重现、审计和分析。NL2Repo是评估编码智能体长周期仓库生成能力而设计的基准测试,主要考察模型的从零开始工作的能力。目前最前沿的大模型在这两项上的得分在在70分左右,未来仍然可以很好的作为区分标准。ProgramBench是Meta2026年5月推出用于衡量软件工程智能体整体性地开发软件的能力的Benchmark,目前各前沿大模型得分主要分布在10-30分,区分能力较好。

高级推理与长周期规划能力重点关注HLE w/Tools、Agents’Last Exam、AutomationBench。HLE(Humanity‘s Last Exam)是一个位于人类知识前沿的多模态基准测试,HLE w/Tools分别指的是使用工具和不使用工具,目前各前沿大模型分数在60分左右。不同于HLE考察人类知识的极限, Agents’Last Exam测试的是AI Agent干活的极限,号称“智能体最后的考试”的全新基准测试,目前各前沿大模型得分都低于30分。

垂直领域专业智能体能力重点关注CyberGym、Harvey LAB-AA、τ³-Banking,它们分别反映当前智能体在网络安全、法律、金融等垂直领域的表现。其中CyberGym是加州大学伯克利分校研究人员在2025年6月提出的用于大规模评估AI代理网络安全能力的基准测试框架。在CyberGym测试中,模型从白盒源代码出发,通过触发程序故障来识别和验证漏洞。GLM-5.3得分为84.5%,高于GLM-5.2的77.2%,也略高于Mythos 5的83.8%和GPT-5.6 Sol的83.6%,GLM-5.3是目前在网络安全领域表现最好的大模型,优势突出。

1.3 2026最新Agent Benchmark全景解读
语言大模型(LLM)近期取得了显著进展,能够处理各种具有挑战性的任务。然而,LLM 是静态的,拥有固定的知识,并且局限于文本到文本的交互。而LLM 智能体能够执行计算、检索最新信息,并与其环境进行交互,可以在现实场景中自主规划、执行和调整复杂策略,从而弥补了上述不足。这种从静态模型到自适应、交互式智能体的转变,要求为基于 LLM 的智能体的评估建立新的范式,来评估智能体在动态环境中进行序贯决策和操作的能力,这需要能够通过一系列动作和交互来评估智能体完成用户任务能力的基准。本文梳理了目前用于评估大模型Agent的主流基准,并据此将其划分为五类。
1.3.1 工具调用与MCP编排能力
工具调用与MCP编排衡量Agent读懂 API 文档、调用外部工具、编排多步骤工具链并在不同工具间灵活切换的能力,是智能体从会对话迈向能办事的关键门槛。当前主流基准主要包含三类:Toolathlon-Verified 以 108 个手工构建任务强调真实场景下的工具使用;MCP-Atlas 凭借 36 个真实 MCP 服务器、1000 个任务在规模上占优,更适合做广覆盖的能力普查;MCPMark-Verified 于 2026 年 6 月推出,专门补足早期 MCP 基准范围窄、不够真实的短板,以固定版本与稳定化 Verified 子集保证可复现。

1.3.2 环境交互与计算机操作能力
环境交互与自动化操作衡量智能体在真实的计算机环境中执行点击、输入、导航等复杂自动化任务的能力,对应计算机使用这一场景。主流基准覆盖广泛:OSWorld-Verified/2.0 聚焦桌面与系统操作,AutomationBench 评测跨应用工作流编排,Terminal-Bench 2.1、 Terminal-Bench 2.3针对终端,BrowseComp 针对网页浏览,CyberGym 针对网络安全,OfficeQA Pro 与 SpreadsheetBench 2 针对办公文档与表格。

1.3.3 代码开发与软件工程能力
代码开发与软件工程衡量智能体从自然语言需求出发解决 GitHub Issue、解决现实软件问题、整体性地开发软件的能力。主流方法包括 DeepSWE、NL2Repo、ProgramBench 与 SWE-bench(含 Verified/Pro 变体)。需指出的是,绝大多数公开编码基准沿用 SWE-bench 思路——从 GitHub 已合并补丁中挖掘任务,带来数据污染(修复方案可能已被预训练记忆)与测试偏袒(原测试只验证单一方案)两大隐患。

1.3.4 高级推理与长周期规划能力
高级规划、推理与长任务衡量智能体在开放、复杂场景下做深度推理、制定长周期计划、跨文档检索(DeepSearch)及处理模糊目标时的决策能力,对应长任务/知识工作这一最具经济价值的智能体形态。表中覆盖 Agents' Last Exam(ALE)、Humanity's Last Exam(HLE)、APEX-Agents、AA-Briefcase、GDPval-AA、ResearchRubrics、DeepSearchQA、JobBench 八类,横跨专家级推理、投行/咨询/法律等长周期知识工作、深度研究与搜索等方向。


1.3.5 垂直领域专业智能体能力
智能体在特定专业领域(金融、法律、银行等)内,运用领域知识处理复杂业务逻辑的能力。本类基准评估智能体在金融、法律、银行、网络安全等垂直专业领域内,运用领域知识处理复杂业务逻辑的能力,是智能体落地"高价值职业场景"的关键。主流方法包括Finance Agent v2、Harvey Lab-AA、Legal Research Bench 、τ³-Banking与CyberGym。


1.4 投资建议
伴随开源模型与闭源模型差距持续收窄,K3 License开创的分成模式有望加速渗透,DeepSeek的涨价正式打开国内大模型量价齐升的商业化黄金期,利好开源模型公司与算力租赁厂商两大方向。建议重点关注:1)开源模型方向的智谱、MiniMax。2)算力租赁方向的宏景科技、集智股份(ARM Token工厂)、协创数据、利通电子、行云科技、智微智能、阿里巴巴、优刻得、金山云等标的。
2.行业新闻
SpaceX600亿美元收购AI编程公司Cursor
8月14日,SpaceX 完成了对 AI 编程初创公司 Cursor 的 600 亿美元收购。作为科技行业有史以来规模最大的收购之一,SpaceX 希望借助 Cursor 加快开发更先进的 AI 工具,用于简化编程等任务。
林俊旸创办语用科技,聚焦数字世界和物理世界中的下一代Agent研究
8月12日,前阿里巴巴千问大模型负责人林俊旸正式官宣创业,宣布在上海成立AI公司Pragmatik Labs(语用科技),聚焦数字世界和物理世界中的下一代Agent研究。与此同时,Pragmatik Labs背后的投资阵容也随之公开。高榕创投和HSG(红杉中国)共同领投本轮融资,腾讯和上海未来产业基金提供支持。这也是林俊旸今年3月从千问团队卸任后,首次正式披露新公司的名称以及具体创业方向。
DeepSeek V4 Pro 正式版发布
8月13日,DeepSeek V4 Pro 正式版已同步在 APP、网页端和 API 更新上线。用户可以通过 APP 或网页端选择“专家模式”使用全新的 V4 Pro 正式版模型。Agent 能力大幅提升:正式版 DeepSeek V4 Pro 增强了 Agent 能力,在生产环境中的性能表现提升尤为显著。更灵活的思考强度控制:V4-Pro 和 V4-Flash 思考模式现支持 low / high / max 三档思考强度,用户在实际使用中可以根据任务复杂度灵活选择。API 定价调整:为了更加合理地调配资源,将采用峰谷定价,闲时价格为高峰时段价格的一半,鼓励用户根据实际使用情况调整任务时间。新价格将于北京时间 2026 年 8 月 17 日 0 时开始生效。
3.公司新闻
智谱:8月14日,智谱发布GLM-5.3,与GLM-5.2相比,基座模型没变,但通过极致的后训练Scaling大大提高了模型的智能上界:数十倍的长程任务环境、更丰富多样的环境类型、超长的后训练时间。相比前代,GLM-5.3的新能力包括:1)更强的编程能力,在包括Terminal Bench 3.0、Agents' Last Exam (CLI)在内的公开基准测试中取得开源第一。2)网络安全能力,在白盒代码审查与漏洞发现等安全任务中,GLM-5.3的表现持平Mythos 5,展现出面向网络安全防御场景的强大潜力。
兆日科技:2026年8月12日,新疆晁骏股权投资有限公司与上海璟和珩科技有限公司签署《股份转让协议》,约定璟和珩以协议转让方式受让新疆晁骏持有的深圳兆日科技股份有限公司全部47,658,852股股份(持股比例14.18%)。交易价格约为人民币11.3062元/股,交易对价合计人民币53884万元。
汇金股份:河北汇金集团股份有限公司于2025年8月29日在巨潮资讯网上披露了《关于筹划重大资产重组暨签署〈支付现金购买资产意向协议〉的提示性公告》,公司筹划以现金方式购买库珀新能源股份有限公司20%股权,同时库珀新能的股东于春生通过向上市公司委托或让渡不少于31%表决权的方式,保证上市公司拥有标的公司的表决权比例不低于51%。鉴于交易各方未能就本次交易的核心条款达成一致,未能达成最终方案和正式协议。经交易各方一致同意,终止本次筹划的重大资产重组事项。
赛意信息:2026年8月11日,公司首次通过股份回购专用证券账户以集中竞价交易方式回购公司股份549,100股,占目前公司总股本的0.1344%,最高成交价格为27.40元/股,最低成交价格为27.23元/股,成交总金额为15,005,669元。
4.本周市场回顾
本周(08.10-08.14)沪深300指数下跌0.61%,中小板指数下跌0.63%,创业板指数上涨1.77%,计算机(中信)板块下跌0.47%。板块个股涨幅前五名分别为:兆日科技、ST易联众、春秋电子、云赛智联、数据港;跌幅前五名分别为:汇金科技、朗科科技、新开普、*ST航图、科蓝软件。




5.风险提示
1)人工智能政策不及预期:如果在未来一段时间内,人工智能相关政策落地进度缓慢或存在变化,都有可能导致产业发展不及预期。
2)行业竞争加剧:AI领域存在大量竞争者,未来为了在细分领域获取更大份额,可能存在市场、技术等方面竞争持续加剧的情况。


VIP复盘网