7月31日下午,DeepSeek 没有开发布会,没有预热推文,只是悄悄在 API 文档里更新了一行日志:DeepSeek-V4-Flash 正式版(V4-Flash-0731)上线公测。
但就是这"轻描淡写"的一步,把路直接走穿了。
一个激活参数只有130亿、价格低至0.02元/百万token的"廉价模型",在多项 Agent 基准测试中,把三个月前的 V4-Pro 预览版摁在地上摩擦。 
先看最炸裂的数字:DeepSWE 暴涨6倍
正式版 V4-Flash 相比 Preview 版本,模型结构、参数规模完全一致------总参数2840亿(MoE架构),激活参数130亿。底层基座一点没动,只是重新做了一轮后训练。
但 Agent 能力却实现了质的飞跃。官方公布的基准测试成绩如下:
| 基准测试 | V4-Flash 正式版得分 |
|---|---|
| Terminal Bench 2.1 | 82.7 |
| NL2Repo | 54.2 |
| Cybergym | 76.7 |
| DeepSWE | 54.4 |
| Toolathlon verified | 70.3 |
| Agent Last Exam | 25.2 |
| Automation Bench (Public) | 25.1 |
| DSBench-FullStack | 68.7 |
| DSBench-Hard | 59.6 |
最让人震撼的是 DeepSWE------这个专门评估 AI Agent 在真实、长周期、多步骤编程任务中自主解决问题能力的基准,Flash 正式版从预览版的7.3分直接飙到54.4分,暴涨超过6倍。
再看 Terminal Bench 2.1(评估 Agent 在 Linux 终端环境中自主规划、执行多步命令行任务及错误恢复能力的权威基准):Flash 正式版拿到82.7分,高于 V4-Pro-Preview 的72.1和 GLM-5.2 的81.0,逼近 Opus-4.8 的85.0。
在海外模型评测机构 Artificial Analysis 的智能指数测试中,V4-Flash-0731(最高推理档位)拿下50分------比4月发布的 V4-Flash 高出10分,比 V4-Pro 高出6分,仅比 GPT-5.6 Luna 的最高51分低1分。
最细思极恐的点:结构没变,只是"重新教育"了一遍
这次升级最值得注意的不是分数,而是分数是怎么来的。
V4-Flash-0731 与预览版模型结构、参数规模完全一致,底层基座未做改动,仅完成新一轮后训练优化。用网易有道官方的话说:底座没有变,变的是"后天教育"。
也就是说,过去三个月里 DeepSeek 团队通过更精细的后训练策略(专家模型培养+策略蒸馏的两阶段范式),在不动架构的前提下,把模型的工具调用能力和多步骤任务执行能力大幅提升。同等任务复杂度下,新模型能用更少的 token 消耗完成相同工作。
这意味着什么?后训练优化的空间,可能比我们想象的大得多。这也解释了为什么 DeepSeek 敢说"V4-Pro 正式版将尽快发布"------同样的后训练方法搬到 Pro 上,效果只会更夸张。
技术底座:百万上下文,效率革命
V4-Flash 的核心参数本身就很能打:
- 上下文长度:100万 token(1M),最大输出 384K tokens
- 可切换思考/非思考模式
- 原生支持 Responses API 格式,针对 Codex 代码场景完成专项适配
- API 兼容 OpenAI + Anthropic 格式
而支撑这一切的,是 V4 系列的三项技术创新:
- 混合注意力架构(CSA + HCA) :传统 Attention 在长上下文下呈 O(n²) 复杂度,V4 在 token 维度引入压缩机制------对强关联 token 精读,对弱关联 token 压缩或跳过,突破了二次复杂度瓶颈。
- 流形约束超连接(mHC) :解决深层堆叠时的数值不稳定性,训练稳定性提升6.7%。
- Muon 优化器:全链路推理加速最高接近2倍。
在100万 token 场景下,V4-Flash 的单 token 推理 FLOPs 低至 V3.2 的10%,KV 缓存占用低至7%。长文本场景"跑不动、记不住、算不起"的痛点被直接打穿。
api-docs.deepseek.com/quick_start...
价格屠夫:0.02元/百万token,98%缓存命中折扣
V4-Flash 的价格依然是"屠夫价":
| 计费项 | 平时价格 | 高峰时段(9:00-12:00、14:00-18:00) |
|---|---|---|
| 输入(缓存命中) | 0.02元/百万token | 0.04元/百万token |
| 输入(缓存未命中) | 1元/百万token | 2元/百万token |
| 输出 | 2元/百万token | 4元/百万token |
换算一下:用 Flash 处理一篇10万字的文章,成本不到1分钱。有媒体测算,其价格仅为 Claude 的约1/90。
更关键的是缓存策略------DeepSeek 为其自有 API 提供了约98%的缓存命中折扣,远超业内大多数厂商的90%。缓存命中与未命中的输入价格相差50倍。有开发者实测,重构缓存策略后,单次请求成本从1.2元降到0.17元,直接砍掉85%。
对于高频调用的 Agent 工作流、RAG 应用、批量生成场景,这个价格意味着可以把企业级 AI 能力的门槛压到几乎可以忽略不计。
生态已经在动了
正式版刚上线,生态反应极快:
- 网易有道宣布旗下 AI Agent 产品矩阵完成全面接入,覆盖全场景办公助手 LobsterAI、有道词典、有道翻译、有道AI同传、Hi Echo、有道AI答疑笔、企业级大模型聚合平台 ThinkFlow 等全线产品。
- Codex 场景专项适配完成,配合原生 Responses API,代码开发场景的接口调用流畅度与响应准确率大幅提升。
- 社区里,开发者用 DeepSeek-V4-Flash 搭配 Claude Code(Anthropic 兼容接口)做终端原生编程 Agent,体验接近开源编程智能体 OpenCode 的速度。
什么人该用 Flash?
一句话总结 V4 双版本的定位:重推理、长文档、复杂自动化任务选 Pro;高并发、低成本、批量轻任务选 Flash。简单 Agent 任务上,Flash 正式版与 Pro 旗鼓相当。
具体来说,Flash 适合:
- 日常问答和内容生成(中文写作能力尤其自然)
- 轻量到中等难度的代码开发
- 高频调用的 Agent 步骤、RAG 应用
- 批量数据处理和摘要分类
- 对成本敏感的产品功能
而 V4-Pro 正式版还在路上------DeepSeek 官方明确表示,本次仅升级了 V4-Flash 的 API,V4-Pro API 及 APP/WEB 端模型未做更改。
结语
拿不到顶级芯片,就靠工程优化把价格炸穿地板------这很 DeepSeek。
从4月的 V4 预览版开源,到7月末的 Flash 正式版,这家公司一直在用同一个故事打动人:不是堆参数,而是把每一分算力、每一分钱都用到极致。1M 上下文、13B 激活参数、0.02元的价格、逼近顶级的 Agent 能力------当这四个词出现在同一个模型上时,行业的价格体系又要重新洗牌了。
V4-Pro 正式版发布那天,恐怕才是真正的"王炸"时刻。