DeepSeek V4 Pro正式版:Agent能力跃升、Harness开放
2026年8月13日,DeepSeek V4 Pro正式版在APP、网页端和API同步上线,本次更新的核心不是继续扩大参数或上下文,而是把后训练重点转向生产环境中的Agent执行能力,并同时补齐Responses API、Codex适配和思考强度控制。V4 Pro采用MoE架构,总参数1.6T、单Token激活参数49B,原生支持100万Token上下文,API最大输出长度为384K;在100万Token上下文下,其单Token推理FLOPs和KV Cache分别约为DeepSeek-V3.2的27%和10%。相比4月预览版,正式版在HLE工具增强、TerminalBench 2.1、DeepSWE、Toolathlon-Verified和Auto mationBench Public上分别提升24.5%、21.9%、389.8%、32.6%和148.4%。
价格方面,自北京时间8月17日0时起,DeepSeek改用峰谷定价,空闲时段价格为高峰时段的一半;以"100万未命中输入 20万输出"的长程Agent任务衡量,V4 Pro空闲/高峰成本约7.2/14.4元,空闲价约为Kimi K3的17%、Claude Opus 4.8的10%,即使高峰时段也仍约为Kimi K3的34%,成本优势依然明显。与正式版发布同期开放的DeepSeek Harness开发者预览版采用“一切皆插件”的开放架构,预置Standard、PTC、Minimal和Creator四种模式,并采用追加式会话日志记录系统提示词、推理、工具调用与返回等完整执行轨迹。总体来看,V4 Pro的竞争力已由单点模型转向模型—Harness协同。
DeepSeek V4 Pro三类金融投研任务实测
我们以估值建模、多因子回测和行业研究三个真实投研任务,对DeepSeek V4 Pro、Kimi K3和GLM-5.2三个模型进行了实测。估值任务中,Kimi K3排名第一,其收入预测按"分产品销量×单价"拆解,颗粒度最细,报告结论与目标价、评级一致;DeepSeek V4 Pro排名第二,报告口径更新、结论审慎,但Excel关键公式存在系统性错位,修改假设后无法可靠重算;GLM-5.2排名第三,工作簿核心公式异常、结论无法复核,存在明显冲突。
回测任务中,DeepSeek V4 Pro排名第一,扣除交易成本、明确区分信号日与执行日并剔除停牌,底稿完整、可逐期复核;Kimi K3排名第二,交付较完整,但未扣成本、未区分交易时点、未处理不可交易状态,高换手下收益可能被明显高估;GLM-5.2排名第三,毛净收益完全相同,相当于未扣成本,中间过程披露不足。
行业研究任务中,DeepSeek V4 Pro排名第一,投资框架可复算,Wiki沉淀了来源页、实体页与综合页,关键数据可追溯;Kimi K3排名第二,评分框架完整但Wiki沉淀不足;GLM-5.2排名第三,知识库覆盖面最大,但缺少评分权重与计算方法,结论无法还原,可核实性最弱。总体来看,三个模型在预测颗粒度、底稿可复核性、交易约束处理和来源追溯等方面仍存在明显差距。
风险提示
结果通过历史数据统计、建模和测算完成,历史规律不代表未来;在市场环境发生变化时,模型存在失效的风险;策略依据一定的假设通过历史数据回测得到,当交易成本或其它条件改变时,可能导致策略收益下降甚至出现亏损;大模型输出的内容存在一定的随机性和准确性风险;本文所提炼的观点,基于一定的提示词产生,大语言模型输出的结果可能随着提示词的变化而发生变化。部分应用本身可能存在一定的安全风险,在使用此类应用时,用户需自行承担由此可能引发的任何风险和后果。在使用AI生成内容时,需要注意相关版权问题。用户应确保所使用的工具及其生成的内容符合相关法律法规的要求,避免侵犯他人知识产权


VIP复盘网