扫码体验VIP
网站公告:为了给家人们提供更好的用户体验和服务,股票复盘网V3.0正式上线,新版侧重股市情报和股票资讯,而旧版的复盘工具(连板梯队、热点解读、市场情绪、主线题材、复盘啦、龙虎榜、人气榜等功能)将全部移至VIP复盘网,VIP复盘网是目前市面上最专业的每日涨停复盘工具龙头复盘神器股票复盘工具复盘啦官网复盘盒子股票复盘软件复盘宝,持续上新功能,目前已经上新至V6.5.7版本,请家人们移步至VIP复盘网 / vip.fupanwang.com

扫码VIP小程序
返回 当前位置: 首页 热点财经 刚刚,DeepSeek V4 系列更新,架构没变,Agent 能力为何大涨

股市情报:上述文章报告出品方/作者:AI科技评论;仅供参考,投资者应独立决策并承担投资风险。

刚刚,DeepSeek V4 系列更新,架构没变,Agent 能力为何大涨

时间:2026-07-31 15:04
上述文章报告出品方/作者:AI科技评论;仅供参考,投资者应独立决策并承担投资风险。

刚刚,DeepSeek 更新了 DeepSeek-V4-Flash。

官方把它称为“正式版”,不过目前只是在 API 端上线公测。此次更新也只涉及 deepseek-v4-flash,V4-Pro API,以及 App 和网页端当前使用的模型,都没有随之更新。

但比起“正式版”这个名字,这次更新更值得关注的是另一句话:DeepSeek-V4-Flash-0731 与此前的 Preview 版本采用相同的模型结构和参数规模,只重新进行了后训练。

01


没有换架构,为什么能力还能提升?

大模型的训练其实可以被简单分成两个阶段。

第一个阶段是预训练。模型通过大量文本和代码学习知识,形成基础能力。这个阶段决定了模型大致有多聪明、知道多少东西。

第二个阶段是后训练。它更像是针对具体工作进行专项训练,让模型学会怎样回答问题、怎样调用工具,以及怎样按照要求完成任务。

这次 DeepSeek 没有重新设计模型架构,也没有扩大参数规模,而是在原有模型上重新进行后训练。模型的结构没有变化,但内部权重和行为方式会发生变化。

这有点像同一辆车没有更换发动机,却重新调整了变速箱、控制系统和驾驶策略。车本身没有变大,但在特定道路上的表现可能明显改善。

不过,DeepSeek 并没有公布这次后训练具体使用了哪些数据、奖励方法和训练流程。因此,目前只能确定它重新做了后训练,不能进一步断言性能提升究竟来自哪一种技术。

02


提升主要指向 Agent 能力

根据 DeepSeek 公布的结果,新版 V4-Flash 在 Terminal Bench 2.1 上获得 82.7,在 DeepSWE 上获得 54.4,在 DSBench-FullStack 上获得 68.7。

这些测试和传统的代码补全不同。传统代码测试通常只要求模型写出一段代码,而 Agent 测试要求模型真正进入一个工作环境。它需要读取文件、理解代码仓库、调用终端、修改程序、运行测试,再根据报错继续处理。

也就是说,模型不只是要知道答案,还要连续完成多个步骤。

不过,这些成绩也不能完全理解成模型自身的单独能力。DeepSeek 明确说明,部分代码 Agent 测试使用了尚未公开的 DeepSeek Harness,并采用了较高的推理档位;DSBench-FullStack 和 DSBench-Hard 还是 DeepSeek 自己的内部测试集。

因此,更准确的说法是:V4-Flash-0731 在 DeepSeek 公布的 Agent 运行环境中取得了明显提升,但它在第三方框架中的实际表现,还需要更多独立测试。

03


Responses API 解决的是接入问题

此次更新还有一个重要变化:V4-Flash 开始原生支持 Responses API,并针对 Codex 进行了适配。

Responses API 可以理解为一套更适合 Agent 的通信接口。它可以更统一地处理模型回复、推理状态、工具调用和执行结果。

它本身不会让模型突然变得更聪明,但可以减少模型接入 Codex 等 Agent 工具时的适配工作,让开发者更容易把模型放进真实的软件开发流程。

所以,这次更新其实包含两部分:一部分是重新后训练后的模型权重,另一部分是更适合 Agent 使用的接口和运行环境。

最终成绩由模型、推理预算、工具环境和 Agent 框架共同决定,很难只归功于其中某一项。

04


这次更新真正值得关注的是什么?

目前可以确定的是,DeepSeek 在没有改变 V4-Flash 模型结构和参数规模的情况下,通过重新后训练提高了官方 Agent 基准成绩,同时增强了对 Responses API 和 Codex 工作流的支持。

但现阶段还不能直接得出后训练已经可以替代模型扩容或者V4-Flash 已经全面领先其他 Agent 模型这样的结论。

一方面,V4-Flash-0731 的具体后训练变化尚未公开;另一方面,官方部分测试所使用的 Harness 和内部数据集还不具备完整的外部复现条件。

所以,这次更新不适合简单总结为DeepSeek 又发布了一个更强的模型。更准确的理解是,DeepSeek 正在验证一条更加务实的技术路线:当模型结构和参数规模保持不变时,能否通过重新后训练、工具接口适配和 Agent 运行框架,进一步提高模型完成真实任务的能力。

DeepSeek 已经给出了官方成绩,但这条路线究竟能带来多大的实际提升,还要等待更多训练细节、公开工具和第三方测试

股票复盘网
当前版本:V3.0