昊梵体育网

7 月 31 日今天,DeepSeek 把 V4-Flash 的「正式版」推上

7 月 31 日今天,DeepSeek 把 V4-Flash 的「正式版」推上 API 公测。

听起来像是发了新模型,其实架构和参数规模都没变。和之前的 Preview 版本相比,只重新做了一遍后训练。

后训练这件事值得解释一下。大模型训练通常分两段:第一段是预训练,让模型学知识、懂基础能力;第二段是后训练,针对具体工作做专项训练,让模型学会怎么回答问题、怎么调用工具、怎么按要求完成任务。这次 DeepSeek 没有动模型结构、没有扩大参数,只是在原有模型上重新调整了权重。架构没换,但行为方式变了。

效果指向 Agent 能力。DeepSeek 官方公布的三项 Agent 测试成绩:Terminal Bench 2.1 拿到 82.7 分,DeepSWE 拿到 54.4 分,DSBench-FullStack 拿到 68.7 分。Agent 测试不是让模型写一段代码,而是让它真正进入工作环境,读文件、理解代码仓库、调用终端、修改程序、跑测试,根据报错继续处理。

不过这几组成绩需要打折扣看。DeepSeek 自己也说明了,部分测试用了尚未公开的 DeepSeek Harness,并采用了较高的推理档位;DSBench-FullStack 和 DSBench-Hard 还是 DeepSeek 自家的内部测试集。更准确的说法是:V4-Flash-0731 在 DeepSeek 公布的 Agent 运行环境中取得了明显提升,但在第三方框架里的实际表现还要等独立测试。

另一个变化是 V4-Flash 开始原生支持 Responses API,并针对 Codex 做了适配。这是一套更适合 Agent 的通信接口,能更统一地处理模型回复、推理状态、工具调用和执行结果。它本身不会让模型更聪明,但能让开发者更容易把模型接进真实的软件开发流程。

这次更新真正值得看的不是「DeepSeek 又发布了一个更强的模型」,而是 DeepSeek 在验证一条更务实的技术路线:模型结构和参数不变的情况下,能不能通过重新后训练加上工具接口适配,让模型完成真实任务的能力再往前推一步。

从年初的 V3 到 4 月底 V4 双版本发布,到 7 月中旬 V4 正式版全量商用(Pro 版 1.6 万亿参数,Flash 版 2840 亿,全系 100 万 token 上下文,国内首创峰谷分时计费,谷时算力费降约 60%),再到今天的 V4-Flash 后训练版上线,DeepSeek 这条路线越走越清楚:不是堆参数、卷榜单,而是把单位智能的成本压到最低,把工程化做到极致。

至于这波后训练到底带来了多少实际提升,目前还不好说。官方成绩摆在那里,但训练细节、Harness、测试集都没完全公开。等第三方复现再说吧。

DeepSeekV4Flash正式版上线DeepSeekDeepSeekV4DeepSeek