DeepSeek V4-Flash 正式版深度解读:一行 changelog 里的暗涌与野心

一句话定位:这是一篇给开发者、AI 从业者和关心大模型行业的人的深度解读------不吹不黑,逐条拆解官方更新日志,算清楚这笔账,再斗胆预测 DeepSeek 下一步的棋。


为什么这次发布值得你放下手头的事?(Why)

2026 年 7 月 31 日下午,DeepSeek 的 API 更新日志里多了一行字:「DeepSeek-V4-Flash 正式版 API 上线公测」

没有发布会,没有直播,没有 PPT,连官网首页的横幅都没有,公众号更是静默。但就是这一行字,当天下午到晚上,把 DeepSeek 顶上了知乎热搜第一,开发者圈子里炸开了锅。

为什么?因为这次发布的「正式版」,做了一件过去两年行业里几乎没人做成的事:一个叫 Flash 的轻量级模型,把自家 Pro 预览版按在地上摩擦。更微妙的是,就在前几天,OpenAI 刚把 GPT-5.6 Luna 的价格砍了 80%,转头 DeepSeek 就把 Agent 能力拉高一大截、价格一分没动,还顺手把 OpenAI 的 Codex 大门给撬开了。

这不仅是技术新闻,更是一场关于「定价权」和「Agent 生态入口」的商业博弈。看懂这次更新日志,你就能看懂未来三个月的行业走向。


官方更新日志到底说了什么?(What)

换汤没换药:架构不变,只重练了「后半截」

先看最关键的一句:DeepSeek-V4-Flash-0731 的模型结构、尺寸和 Preview 版保持一致,仅重新进行了后训练(post-training)

翻译一下:底座没换,参数没加(总参数 284B、激活参数仅 13B),这次只重练了「怎么干活」的后半段------怎么接任务、怎么调工具、失败了怎么重试、什么时候该收工。

这意味着什么?意味着这次升级不是「换发动机」,而是把「驾驶技术」练到了极致。参数没动,价格没动,就是把活干得更好了。这在靠堆算力卷参数的行业里,是一条完全不同的路线。

九项基准全面上涨,Flash 反超 Pro 预览版

官方更新日志放出了 9 项评测成绩,全部上涨,每一项都超过自家 V4-Pro-Preview:

评测基准 分数 测的是什么
Terminal Bench 2.1 82.7 终端操作、命令行任务执行
Cybergym 76.7 网络安全与攻防自动化
Toolathlon (verified) 70.3 工具调用能力
DSBench-FullStack 68.7 全栈开发任务(DeepSeek 内部测试集)
DSBench-Hard 59.6 高难度开发任务(内部测试集)
DeepSWE 54.4 真实 GitHub 仓库:读 issue、写补丁、跑测试
NL2Repo 54.2 自然语言生成完整代码仓库
Agent Last Exam 25.2 综合智能体考试
Automation Bench (Public) 25.1 自动化任务执行

逐项拆解:这 9 场「Agent 考试」到底在考什么?

对不常刷论文的读者来说,这些英文名看着像天书。别急,一个一个说人话(先普及一个小知识:benchmark 就是「基准测试」,你可以把它理解成一场标准化的考试,各家模型用同一套卷子、同一个评分标准,分数才有可比性):

Terminal Bench 2.1(82.7)------「现场实操考试」 最接近真实工作的一项。它把 AI 丢进一个真实的终端环境(就是开发者每天敲命令的那个黑窗口),下达真实任务:改配置文件、跑脚本、装依赖、修 bug、翻日志定位问题。考的不是「知道答案」,而是「动手把事办成」。82.7 分意味着大多数终端任务它都能独立完成------相当于一个能直接上手干活、不用你手把手教的实习生。

Cybergym(76.7)------「网络安全攻防训练场」 模拟真实网络攻防场景,考察 AI 在复杂环境中的推理与安全操作能力:识别漏洞、分析攻击、执行防御动作。76.7 分说明它在安全这类高推理强度任务上表现不俗,也侧面反映了模型的复杂推理上限。

Toolathlon(70.3)------「工具使用能力竞赛」 「athlon」源于希腊语,意为「竞赛」。这场考试考的是 AI 会不会「用工具」:给定一个目标,旁边摆着一堆 API、函数、外部工具,看它能否正确选择、正确调用、处理返回结果。打个比方:给新人配齐 IDE、浏览器、数据库客户端,看他能不能在合适的时机拿起合适的工具------这是「能干活的 Agent」和「只会聊天的模型」之间的核心分水岭。

DeepSWE(54.4)------「真实软件工程师考试」 把 AI 丢进真实的 GitHub 仓库,让它自己读懂 issue(用户提交的问题报告)、定位相关代码、写出补丁、跑测试直到通过,全程无人干预。这是全行业公认最难的软件工程基准之一。据社区流传的对比数据,Claude 3.5 Sonnet 在同一指标上约为 49%,GPT-4o 约为 38%(此组横向数据未经官方确认)。一个叫 Flash 的轻量模型跑到这个分数,已经摸到闭源旗舰的脚后跟。

NL2Repo(54.2)------「一句话生成整个代码仓库」 Natural Language to Repository 的缩写:输入一句自然语言需求(比如「做一个带用户登录的博客系统」),直接输出一个完整、可运行的代码仓库。考的是从零到一的工程组织能力------不只是写几行函数,而是搭起整个项目的骨架。

DSBench-FullStack / DSBench-Hard(68.7 / 59.6)------「DeepSeek 自家模拟考」 DeepSeek 内部搭建的全栈开发与高难度任务测试集。注意:这是自家出的卷子、自家阅卷,参考时心里打个折。

Agent Last Exam(25.2)------「综合大考」 面向 Agent 的综合考试,覆盖规划、推理、多步任务执行等综合能力。25.2 分看着低?别慌,这是业内出了名的「地狱级」卷子,各家模型普遍都在二三十分徘徊,分数绝对值不能拿去和别的基准横向比较。

Automation Bench(25.1)------「自动化流水线执行」 考 AI 执行自动化工作流的能力:按流程一步步完成多步骤任务、处理中间异常。这是企业 RPA(机器人流程自动化)、运维自动化的核心场景。

两个要点提醒:

  1. 这些分数是官方用自家尚未发布的 Harness 框架、在特定参数配置下跑出的「官方自测」,参考时要打个折。
  2. 这 9 项几乎全是 Agent / 代码场景,聊天、写作等通用能力未必同水平------别把这张成绩单当成全科成绩。

放在行业里看:这是什么水平?

  • 官方原话是「远超 V4-Pro-Preview」------同门 Pro 预览版被自家轻量版反超,这剧情放在武侠剧里就是师弟把师兄按在了脚下。
  • 据社区与媒体评测口径(未经官方确认):V4-Flash 正式版在多项 Agent 任务上已超过 GLM-5.2、逼近 Claude Opus 4.8;在 SWE-bench Verified(另一知名软件工程基准)上取得开源权重模型的最高分,被评价为「匹配 GPT-5.5 级别的 Agent 性能」。
  • 独立第三方 Artificial Analysis 的智能指数为 50 分,比自家 V4 Pro 高 6 分,距 GPT-5.6 Luna(51 分)仅差 1 分(详见下一节)。

综合看下来,这串数字的共同指向非常明确:DeepSeek 已经不是在做「聊天模型」,而是朝着「能独立完成工作的 AI 软件工程师」全力转型。

给 Codex 专门开了门:原生支持 Responses API

跑分之外的隐藏炸点,是这句不起眼的话:「V4-Flash 原生支持 Responses API 格式,并针对性适配了 Codex」

Responses API 是 OpenAI 去年 11 月推出的新一代接口规范,Codex、Agent SDK 和各种自动化工具都走它。以前想把国产模型接进 Codex,中间得垫一层协议转换,模型的推理过程、工具调用这些结构化信息,转一道就容易压扁丢失。

现在不用了。base_urlhttps://api.deepseek.com,模型名填 deepseek-v4-flash,直接指过去就能用,现有客户端一行不用改,不支持的参数会被静默忽略。

这不是技术细节,是商业策略。Codex 是 OpenAI 把 GPT 系列变现的核心入口------ChatGPT 编程订阅、企业代码自动化、Cursor/Copilot 后端都靠它。DeepSeek 用同一套协议把「轻量版」塞进去,等于对所有 Codex 用户说:你可以用 OpenAI 的姿势,调用更便宜的中国模型。

价格一分没涨,但缓存折扣更狠

能力涨了这么多,价格呢?没动,还是那张老价目表:

计费项 价格(美元/百万 token) 约合人民币
缓存命中输入 $0.0028 约 0.02 元
缓存未命中输入 $0.14 约 0.95 元
输出 $0.28 约 1.9 元

真正的狠招在缓存折扣:DeepSeek 为自己的 API 提供了约 98% 的缓存命中折扣,而行业大多数厂商只给 90% 左右。

别小看这几个百分点的差异。Agent 场景里,系统提示词、工具定义、前几轮对话历史,每一轮都在重复发送,这部分只要能命中缓存,实际账单和不命中能差出几十倍。换算下来,在 DeepSeek 自有 API 上的单任务成本,比已经降价 80% 的 GPT-5.6 Luna 还低约 60%。

日志角落里没宣传的三件事

  1. 老 API 已经静悄悄下线 :V4 预览版于 4 月 24 日上线时,官方即预告 deepseek-chatdeepseek-reasoner 两个老接口将在 3 个月内停止维护;7 月 24 日(15:59 UTC 起),两个老接口正式停用,旧请求直接失败,所有流量全部指向 deepseek-v4-flash。也就是说,在正式版官宣之前,开发者调用的 DeepSeek 任何功能,背后跑的都是 V4-Flash------先用 Preview 标签悄悄跑了一周多,等 bug 在真实流量里消化掉,再「正式」宣布。
  2. 峰谷定价预告:早在 6 月 29 日官宣 V4 正式版上线计划时,DeepSeek 就已预告将首次引入「峰谷定价」机制------高峰时段(北京时间每天 9:00--12:00、14:00--18:00)价格为平时 2 倍,适用所有计费项。官方注明「具体时间以正式通知为准」。这次更新日志发布后,定价页上的该预告依然有效。对开发者来说,批量任务错峰跑能省一半。
  3. V4-Pro 正式版「尽快发布」:更新日志最后一句是 V4-Pro 正式版将会尽快发布。官方文档显示 Pro 的 Responses API 支持预计 8 月初上线。

第三方视角:独立评测机构怎么看?(What +)

官方跑分有「王婆卖瓜」之嫌?没关系,独立评测机构也出了结果。

Artificial Analysis(智能指数 AII):DeepSeek V4 Flash 0731 拿到 50 分,比 4 月发布的 V4 Flash 高 10 分,比 V4 Pro 高 6 分,距离 OpenAI 目前最高分的 GPT-5.6 Luna(51 分)只差 1 分。即便 OpenAI 当天刚把 Luna 价格下调 80%,V4 Flash 的单任务成本仍比它低约 60%,关键因素就是那 98% 的缓存命中折扣。

Arena(人类偏好盲测) :在 Frontend Code Arena(前端代码竞技场)中,DeepSeek-V4-Flash-High 以 1586 分重塑榜单------总排名第 7、开放类别排名第 3,比 Preview 版提升 154 分,比 V4-Pro-Preview 提升 121 分。每个 MToken 价格 0.14/0.14/ 0.14/0.28,被评价为「同类产品中性价比最高」。

两个维度的独立验证指向同一个结论:这不是营销话术,Flash 的 Agent 能力是真的上来了。


怎么用?开发者接入姿势(How)

快速上手

已经在用 DeepSeek API 的开发者,迁移成本几乎为零------模型名保持 deepseek-v4-flashbase_url 不变,唯一要做的是重新跑一轮回归测试:

text 复制代码
base_url:  https://api.deepseek.com   (保持不变)
model:     deepseek-v4-flash          (老接口流量已全部指向它)

如果要用 Codex,按官方 Responses API 指南补上 responses.create 调用即可。

一个关键提醒

目前的 Responses API 是无状态实现:不支持 previous_response_idstore 参数恒为 false,每轮对话历史还是得自己带上。另外目前只有 Flash 支持 Responses API,Pro 要等到 8 月初。

成本账怎么算

Agent 场景下,系统提示词、工具定义、前几轮历史,每一轮都在重复发。这部分能命中缓存的话,实际账单和不命中能差出几十倍。所以这张价格表里,最值得盯的是 0.02 元那行------设计好提示词结构、让可缓存部分保持稳定,是省钱的唯一正解


这次发布对行业意味着什么?

1. 「轻量 = 便宜 + 牺牲性能」的公式被打破了

过去两年,AI 行业的「小模型」逻辑是:轻量 = 便宜 + 牺牲性能。GPT-4o-mini、Claude Haiku、Gemini Flash 都是这个思路------日常对话够用,专业任务就差一截。V4-Flash 用 13B 激活参数跑出 Pro 级 Agent 成绩,直接把这个等式踩进了土里:1M 上下文的全仓库代码分析、企业级 Agent 自动化、长文档综述------这些过去只有 Pro 才能跑的任务,现在 Flash 都能跑。

2. 算力账被重算了一遍

据社区流传的对比测算(未经官方确认):V4-Flash 跑在 1M token 上下文下,单 token 算力仅约 0.13 TFLOPs、显存不到 3GB;同样的输入给 V3.2,约需 1.2 TFLOPs 和 50GB。若属实,Flash 算力约省 89%、显存约省 94%,同样的钱能多喂约 8 倍的上下文。对企业级 Agent 自动化公司来说,成本结构、定价权、调用频率上限,全被重新洗牌。

3. 国内小模型策略被迫重新评估

阿里通义、字节豆包、腾讯混元各家轻量版,都要在 DeepSeek 面前回答同一个问题:你的 Flash,凭什么让开发者换过来?「轻量级 Agent 第一名」的位子,DeepSeek 先坐下了。

4. 对 OpenAI 的 Codex 生态是釜底抽薪

DeepSeek 用同一套 Responses API 协议接入 Codex,等于把 OpenAI 的变现入口变成了自己的获客渠道。开发者可以「用 OpenAI 的姿势,调用更便宜的中国模型」------这比任何广告都有效。


对个人开发者意味着什么?

对个人来说,这次发布最实在的一句话是:「难的活」的范围,正在以月为单位缩小。

  • 以前要上旗舰模型才敢接的活(长代码库分析、多工具链协调、自动化脚本),现在一个 Flash 就能跑,账单还不到旗舰的零头。
  • Codex 指到 DeepSeek 就能用,意味着你手里那些基于 OpenAI 生态的 Agent 工具、IDE 插件、自动化脚本,改一行配置就能切换到成本低一个量级的模型上。
  • 峰谷定价落地后,把批量任务挪到夜间和周末跑,账单还能再省一半。

有人上个月刚把主力模型从「一家贵的」换成国产混搭,月开销从 1200 美金降到 4000 人民币。当时还有人留言说「便宜是便宜,难的活还是得上强模型」------这个判断现在依然成立,但最难的长链条任务,第一梯队那几家也在被逐个追平。


未来预测:DeepSeek 下一步可能做什么?

以下均为基于公开信息的合理推测,不代表官方承诺,仅供参考。

1. V4-Pro 正式版 8 月初登场(高置信度) 官方白纸黑字写了「尽快发布」,Responses API 文档也标注 Pro 支持预计 8 月初上线。Flash 已经这样了,Pro 正式版大概率会刷新综合能力榜------到时候「Pro 强、Flash 弱」的分层逻辑可能正式回归,也可能被彻底重构。

2. 峰谷定价正式落地(高置信度) 预告已经挂在定价页,落地只是时间问题。这也侧面说明 DeepSeek 的推理负载已经出现明显的潮汐效应,需要用价格杠杆削峰填谷。

3. 开源 V4 系列权重(中置信度) DeepSeek 自 R1、V3 起就坚持开源传统,社区普遍猜测 V4 系列最终会开源。若成真,将再次点燃全球范围内的蒸馏与微调热潮,也意味着「Flash 级 Agent 能力」会迅速下沉到任何有 GPU 的团队手里。

4. 工具生态继续扩张(中置信度) Responses API 只是第一步,接下来大概率是 MCP(模型上下文协议)、更多 IDE 插件、Agent 框架的官方适配,把「Codex 平替」做成「Agent 全家桶」。

5. 价格战进入「不降单价、只降任务成本」的新阶段(高置信度) 这次的关键词不是「降价」而是「缓存折扣 + 后训练提效」。当模型在同样价格下把活干得更好,单价不动,任务总成本却实打实地下降------这是比直接降价更高级的竞争手段,对手很难跟进。


常见误区与避坑指南

误区 正确理解 建议
「正式版 = 换了新模型」 架构和 Preview 完全一致,只重练了后训练,能力提升集中在 Agent 场景 按「升级补丁」对待,重点回归 Agent 工作流
「跑分 82.7 就能全面替代旗舰」 九项基准全是 Agent/代码场景,聊天、写作等通用能力未必同水平 按场景选模型,别拿单一榜单当全科成绩单
「Agent Last Exam 25.2 分 = 模型很弱」 这是业内出了名的「地狱级」卷子,各家普遍二三十分,绝对值不能跨基准比较 看相对排名而非绝对分数
「官方 9 项跑分 = 铁证」 这些是官方用自家未发布的 Harness 框架自测的成绩 交叉比对第三方评测(AA、Arena),心里打个折
「接入 Codex 零成本」 协议是兼容了,但 Responses API 是无状态实现,历史得自己带 核对 previous_response_idstore 参数限制
「缓存折扣 98% 意味着永远便宜」 折扣只对命中部分有效,且峰谷定价落地后高峰时段翻倍 优化提示词结构提高缓存命中率,批量任务错峰跑
「DSBench 系列跑分权威」 是 DeepSeek 内部测试集,存在自测偏差 参考时心里打个折,优先看国际通用基准

小结

DeepSeek V4-Flash 正式版的真正信号,不在那九个跑分里,而在这三条时间线交叠的时刻:老 API 静默下线、Responses API 默认接通、Pro 还没正式发布。

从今天起,调 deepseek-v4-flash 不再是「试一试」,而是默认项。等到 9 月各家开发者做下半年规划时,会发现自己的 Agent 系统已经深度绑在了这个 13B 激活参数的小模型上------不是选的,是被默认的。

「Flash 都这样了,Pro 正式版什么样?」------这句话,大概是接下来一个月整个行业共同的悬念。

给个人的行动建议只有一句:把 Codex 的接口指到 DeepSeek 试一段时间,先买便宜的试,日常活真够用再切主力。不行也没亏多少------毕竟,最贵的从来不是模型,是你犹豫的时间。


参考链接

注:本文成文于 2026 年 8 月 1 日,定价与接口信息以官方页面实时数据为准。文中「未来预测」部分为基于公开信息的推测,不构成投资或采购建议。

相关推荐
Aloudata1 小时前
Prompt 驱动分析 vs Skill 驱动分析:企业 AI 分析如何从会问走向可复用
大数据·人工智能·数据分析·prompt·skill·语义层
笨鸟先飞,勤能补拙1 小时前
下一个十年:网络安全正在被重写
网络·人工智能·安全·web安全·网络安全·github
weixin_429615991 小时前
快速生成流程图
人工智能·chatgpt·aigc·流程图
骇客野人1 小时前
PGSQL运维筛选近30天有数据改动数据库表和表名
人工智能
孪生质数-1 小时前
AI 应用实践篇——让大模型真正开始工作
linux·运维·服务器·人工智能·深度学习·语言模型·llama
维克兜率天2 小时前
【维克】回归诊断:如何知道你的模型是不是“坏了“?
人工智能·数据挖掘·回归
数字化老赵2 小时前
有没有什么好用的AI工具可以用在设备巡检管理的?
大数据·人工智能·设备管理·设备
cxr8282 小时前
第6章 强制执行令牌
人工智能·智能体