2840亿参数只卖白菜价:DeepSeek V4 Flash 正式版上线,Agent 能力暴涨6倍

7月31日下午,DeepSeek 没有开发布会,没有预热推文,只是悄悄在 API 文档里更新了一行日志:DeepSeek-V4-Flash 正式版(V4-Flash-0731)上线公测。

但就是这"轻描淡写"的一步,把路直接走穿了。

一个激活参数只有130亿、价格低至0.02元/百万token的"廉价模型",在多项 Agent 基准测试中,把三个月前的 V4-Pro 预览版摁在地上摩擦。

先看最炸裂的数字:DeepSWE 暴涨6倍

正式版 V4-Flash 相比 Preview 版本,模型结构、参数规模完全一致------总参数2840亿(MoE架构),激活参数130亿。底层基座一点没动,只是重新做了一轮后训练。

但 Agent 能力却实现了质的飞跃。官方公布的基准测试成绩如下:

基准测试 V4-Flash 正式版得分
Terminal Bench 2.1 82.7
NL2Repo 54.2
Cybergym 76.7
DeepSWE 54.4
Toolathlon verified 70.3
Agent Last Exam 25.2
Automation Bench (Public) 25.1
DSBench-FullStack 68.7
DSBench-Hard 59.6

最让人震撼的是 DeepSWE------这个专门评估 AI Agent 在真实、长周期、多步骤编程任务中自主解决问题能力的基准,Flash 正式版从预览版的7.3分直接飙到54.4分,暴涨超过6倍。

再看 Terminal Bench 2.1(评估 Agent 在 Linux 终端环境中自主规划、执行多步命令行任务及错误恢复能力的权威基准):Flash 正式版拿到82.7分,高于 V4-Pro-Preview 的72.1和 GLM-5.2 的81.0,逼近 Opus-4.8 的85.0。

在海外模型评测机构 Artificial Analysis 的智能指数测试中,V4-Flash-0731(最高推理档位)拿下50分------比4月发布的 V4-Flash 高出10分,比 V4-Pro 高出6分,仅比 GPT-5.6 Luna 的最高51分低1分。

最细思极恐的点:结构没变,只是"重新教育"了一遍

这次升级最值得注意的不是分数,而是分数是怎么来的。

V4-Flash-0731 与预览版模型结构、参数规模完全一致,底层基座未做改动,仅完成新一轮后训练优化。用网易有道官方的话说:底座没有变,变的是"后天教育"。

也就是说,过去三个月里 DeepSeek 团队通过更精细的后训练策略(专家模型培养+策略蒸馏的两阶段范式),在不动架构的前提下,把模型的工具调用能力和多步骤任务执行能力大幅提升。同等任务复杂度下,新模型能用更少的 token 消耗完成相同工作。

这意味着什么?后训练优化的空间,可能比我们想象的大得多。这也解释了为什么 DeepSeek 敢说"V4-Pro 正式版将尽快发布"------同样的后训练方法搬到 Pro 上,效果只会更夸张。

技术底座:百万上下文,效率革命

V4-Flash 的核心参数本身就很能打:

  • 上下文长度:100万 token(1M),最大输出 384K tokens
  • 可切换思考/非思考模式
  • 原生支持 Responses API 格式,针对 Codex 代码场景完成专项适配
  • API 兼容 OpenAI + Anthropic 格式

而支撑这一切的,是 V4 系列的三项技术创新:

  1. 混合注意力架构(CSA + HCA) :传统 Attention 在长上下文下呈 O(n²) 复杂度,V4 在 token 维度引入压缩机制------对强关联 token 精读,对弱关联 token 压缩或跳过,突破了二次复杂度瓶颈。
  2. 流形约束超连接(mHC) :解决深层堆叠时的数值不稳定性,训练稳定性提升6.7%。
  3. Muon 优化器:全链路推理加速最高接近2倍。

在100万 token 场景下,V4-Flash 的单 token 推理 FLOPs 低至 V3.2 的10%,KV 缓存占用低至7%。长文本场景"跑不动、记不住、算不起"的痛点被直接打穿。

api-docs.deepseek.com/quick_start...

价格屠夫:0.02元/百万token,98%缓存命中折扣

V4-Flash 的价格依然是"屠夫价":

计费项 平时价格 高峰时段(9:00-12:00、14:00-18:00)
输入(缓存命中) 0.02元/百万token 0.04元/百万token
输入(缓存未命中) 1元/百万token 2元/百万token
输出 2元/百万token 4元/百万token

换算一下:用 Flash 处理一篇10万字的文章,成本不到1分钱。有媒体测算,其价格仅为 Claude 的约1/90。

更关键的是缓存策略------DeepSeek 为其自有 API 提供了约98%的缓存命中折扣,远超业内大多数厂商的90%。缓存命中与未命中的输入价格相差50倍。有开发者实测,重构缓存策略后,单次请求成本从1.2元降到0.17元,直接砍掉85%。

对于高频调用的 Agent 工作流、RAG 应用、批量生成场景,这个价格意味着可以把企业级 AI 能力的门槛压到几乎可以忽略不计。

生态已经在动了

正式版刚上线,生态反应极快:

  • 网易有道宣布旗下 AI Agent 产品矩阵完成全面接入,覆盖全场景办公助手 LobsterAI、有道词典、有道翻译、有道AI同传、Hi Echo、有道AI答疑笔、企业级大模型聚合平台 ThinkFlow 等全线产品。
  • Codex 场景专项适配完成,配合原生 Responses API,代码开发场景的接口调用流畅度与响应准确率大幅提升。
  • 社区里,开发者用 DeepSeek-V4-Flash 搭配 Claude Code(Anthropic 兼容接口)做终端原生编程 Agent,体验接近开源编程智能体 OpenCode 的速度。

什么人该用 Flash?

一句话总结 V4 双版本的定位:重推理、长文档、复杂自动化任务选 Pro;高并发、低成本、批量轻任务选 Flash。简单 Agent 任务上,Flash 正式版与 Pro 旗鼓相当。

具体来说,Flash 适合:

  • 日常问答和内容生成(中文写作能力尤其自然)
  • 轻量到中等难度的代码开发
  • 高频调用的 Agent 步骤、RAG 应用
  • 批量数据处理和摘要分类
  • 对成本敏感的产品功能

而 V4-Pro 正式版还在路上------DeepSeek 官方明确表示,本次仅升级了 V4-Flash 的 API,V4-Pro API 及 APP/WEB 端模型未做更改。

结语

拿不到顶级芯片,就靠工程优化把价格炸穿地板------这很 DeepSeek。

从4月的 V4 预览版开源,到7月末的 Flash 正式版,这家公司一直在用同一个故事打动人:不是堆参数,而是把每一分算力、每一分钱都用到极致。1M 上下文、13B 激活参数、0.02元的价格、逼近顶级的 Agent 能力------当这四个词出现在同一个模型上时,行业的价格体系又要重新洗牌了。

V4-Pro 正式版发布那天,恐怕才是真正的"王炸"时刻。

相关推荐
不爱记笔记1 小时前
多模态AI如何理解视频内容?从视觉、语音到语义的三层技术拆解
人工智能·自然语言处理·nlp·音视频·多模态
让学习成为一种生活方式1 小时前
苄基异喹啉生物碱糖基转移酶UGT74AN1晶体--Journal of Agricultural and Food Chemistry
人工智能·算法
犀利豆1 小时前
Claude code tools 研究系列(二)EnterPlanMode
人工智能·后端
alphaTao1 小时前
LeetCode 每日一题 2026/7/27-2026/8/2
python·算法·leetcode
sponge'2 小时前
《以场景为中心的无监督视频全景分割》论文框架讲解
人工智能·深度学习
陕西企来客2 小时前
2026年7月西安GEO优化哪家好?实战对比评估
人工智能·西安geo优化哪家好
LXT7122 小时前
2026职称申报冲刺期:ChatGPT、Claude、Kimi、雷小兔同题横评
人工智能·chatgpt
sali-tec2 小时前
C# 基于OpenCv的视觉工作流-章98-频域滤波
图像处理·人工智能·opencv·计算机视觉
眼泪划过的星空2 小时前
基于 LangChain 框架构建本地化 RAG 系统:无需调用云端 API 的完整实践
人工智能·langchain