# DeepSeek V4.1 Flash 正式发布 vs V4 Pro 四天后「退役」

2026 年 9 月 10 日,DeepSeek 正式发布 V4.1 Flash 模型并同步执行新的 Flash 定价。官方罕见地放出狠话:经内外部多方测试,V4.1 Flash 在性能、费用、速度、总用时 等各项指标上已全面超越 V4 Pro。更炸裂的是------V4 Pro 将于 9 月 14 日 12:00 正式下线,一个「Pro 旗舰被自家 Flash 取代」的时代,真的来了。


一、事件速览:一次「明牌」的重磅发布

与 7 月底 V4-Flash 正式版「悄悄写进更新日志」的低调不同,这次 DeepSeek 选择了正面官宣。9 月 10 日,官方向 API 用户发送通知邮件,几个关键时间点一目了然:

时间 事件
9 月 10 日 12:00 V4.1 Flash 正式发布,新定价生效
9 月 14 日 12:00 V4 Pro 服务下线(原计划更早,已推迟)
下线后 V4 Pro 请求自动路由至 V4.1 Flash,并按 V4.1 Flash 价格计费

与此同时,旧版 V4 Flash 和视觉实验版 V4-Flash-Vision-Exp 也已同步下线,原来两个模型名的请求全部由 V4.1 Flash 承接------文字与图片处理,正式进入同一个主力 API 模型。

官方对新模型的定调非常直接:「经内部、外部多方测试,V4.1 Flash 在性能、费用、速度、总用时等各项指标上已全面超越 V4 Pro。」

一个「Flash」(轻量快速版)全面干掉「Pro」(旗舰版),这在传统产品线逻辑里几乎是不可想象的。但看完技术细节你会发现,DeepSeek 这次是认真的。


二、核心变化一:全新模型结构,KV Cache 压到原来的 1/4

V4.1 Flash 不是旧模型的「后训练加强版」,而是全新模型结构系列中的最小尺寸型号 ,采用非对称编码器---解码器结构

规格 参数
总参数 550B
输入阶段激活 8B
输出阶段激活 16B
上下文长度 100 万 tokens
最大输出 384K tokens

注意这个「非对称」设计:输入(理解)只激活 8B,输出(生成)激活 16B。读得快、写得强,算力花在了刀刃上。

最狠的一刀:KV Cache 大压缩

新模型最核心的变化在缓存:

  • 每个 Token 的 KV Cache 从上一代 V4 Flash 的 3514 字节降至 890 字节 ,约为原来的 1/4
  • 与初代 DeepSeek V1 相比,缩小到约 1/437
  • 缓存相关的 HBM 需求降至上一代的 1/4,SSD 需求降至 1/8

为什么这件事极其重要?因为在 Agent 使用场景中,缓存命中的费用往往占大头------Agent 连续工作时,需要反复把历史对话、工具说明、代码上下文重新喂给模型。KV Cache 压缩 75%,直接意味着 Agent 类任务的使用成本大幅下降。

DeepSeek 还表示,这套新结构支持向更大参数规模扩展------也就是说,今天看到的是「最小号」,后面还有大的。


三、核心变化二:视觉能力从「外挂」变「原生」

此前 DeepSeek 的视觉能力靠实验性质的 V4-Flash-Vision-Exp 单独提供,开发者处理图文混合任务时需要在模型之间切换。这次 V4.1 Flash 原生具备多模态视觉理解能力

  • 描述图片、识别截图文字、分析图表,一个模型全搞定
  • 图片支持公开链接传入、编码后直接提交,或通过 Files API 上传后引用
  • 提供思考与非思考模式 ,默认开启思考,思考强度支持 low / high / max 三档

对处理真实业务资料的 Agent 来说,这是实打实的生产力升级:业务文档里的说明文字与图表、代码与界面截图,经常需要结合起来理解。统一模型入口后,开发者再也不用在不同模型之间做「任务分发」了。


四、核心变化三:Agent 能力全面反超 V4 Pro

口说无凭,看官方公布的对比数据(V4.1 Flash vs V4 Pro):

基准测试 V4 Pro V4.1 Flash 提升
DeepSWE v1.1(代码 Agent) 62.7 74.2 +11.5
Terminal-Bench 3.0(终端操作) 11.8 30.0 +18.2(约 2.5 倍)
Automation-Bench(自动化) 43.2 54.8 +11.6
CyberGym(网络安全攻防) 83.3 88.1 +4.8

横向对比同样亮眼:在 DeepSWE v1.1、CyberGym 和 Automation-Bench 三项上,V4.1 Flash 得分超过了 Kimi K3、GLM 5.3、Claude Opus 5 和 GPT 5.6-Sol,拿到榜首。

当然也要客观说一句:GPQA Diamond(高难度科学推理)上 V4.1 Flash 仍低于 V4 Pro ,部分测试也未超过表中全部竞品。它的强项很明确------Agent、工具调用、自动化干活,而不是纯学术推理。

配套的 DeepSeek Harness 同步更新至 v0.1.5,模型针对标准模式、程序化工具调用模式和极简模式做了专项训练。模型也已在 Hugging Face 开源。


五、新定价:缓存命中暴降 60%,Agent 越用越便宜

新价格于 9 月 10 日 12:00 生效,继续采用峰谷定价(每百万 tokens):

计费项 空闲时段 高峰时段 较旧版 V4 Flash 降幅
输入(缓存命中) 0.02 元 0.04 元 -60%
输入(缓存未命中) 1 元 2 元 -33.3%
输出 4 元 8 元 -11.1%

高峰时段:北京时间周一至周五 9:00--12:00、14:00--18:00,其余均为空闲时段。

降价结构非常有讲究:缓存命中降得最狠(60%),未命中次之,输出降得最少。这和 KV Cache 压缩的技术路线完全呼应------就是要鼓励 Agent 式的「反复读取长上下文」用法。

算一笔账:一次任务消耗 100 万缓存命中输入 + 10 万未命中输入 + 1 万输出 tokens,空闲时段费用将从 0.245 元降至 0.16 元,降幅约 34.7%。上下文越长、工具调用轮次越多,省得越多。


六、V4 Pro 退役:一个时代的落幕

这可能是本次发布最有象征意义的一条消息:9 月 14 日 12:00,V4 Pro 服务正式下线

下线安排干净利落:

  • 所有发往 V4 Pro 的请求自动路由到 V4.1 Flash
  • 计费按 V4.1 Flash 的更低价格执行
  • V4 Pro 服务期间价格保持不变;不同意新计费方式的用户可选择退出并申请退款

「Pro 被 Flash 取代」听起来反常,但逻辑其实很顺:当一个更小、更快、更便宜的新架构模型在核心指标上全面超越旧旗舰,继续维护两套模型反而成了包袱。DeepSeek 选择果断砍掉旧旗舰,把全部筹码压在新架构上------这份决绝,本身就是对新结构的信心投票。


七、官网首页大变脸:三种模式合而为一

和新模型同步落地的,还有 DeepSeek 官网/APP 的一次重要产品改版:原有的「快速模式」「专家模式」「识图模式」三个按钮没了,合并为统一的「智能模式」

新版对话框下只剩「深度思考」和「智能搜索」两个能力开关,交互逻辑完全变了:

  • 自动检测查询复杂度:简单问题直接快速回答,复杂问题自动投入更多推理
  • 检测到图片输入时自动激活视觉能力
  • 根据任务难度自动调整处理能力

这个改动看似只是少了几个按钮,实质是 DeepSeek 把「模型选择权」从用户手里收了回去------以前是用户猜「这道题该用快速还是专家」,选错了浪费时间;现在由系统在后台调度,产品形态变成「一个入口,自动分流」。

从行业视角看,这和 OpenAI 在 GPT-5 时代推行的「自动路由」思路如出一辙:让用户只面对一个模型,把复杂度藏在后台。而统一的智能模式,恰好为 V4.1 Flash 这种「日常对话 + 图片理解 + 复杂问题一体化」的新模型铺好了路。


八、意义与价值:这次发布为什么重要?

1. 「以下克上」成为新常态

从 7 月底 V4-Flash 正式版在 Agent 基准上反超 V4-Pro 预览版,到这次 V4.1 Flash 全面超越并直接取代 V4 Pro------DeepSeek 连续两次证明:模型规模不再是决定性因素,架构创新和训练方法的权重正在快速上升。参数更小、激活更少的模型,完全可以跑出旗舰级表现。

2. Agent 成本曲线被狠狠压了一刀

KV Cache 压到 1/4、缓存命中价格暴降 60%------这两件事叠加,瞄准的都是同一个目标:让 Agent 长时间、多轮次、长上下文地干活变得足够便宜。当「让 AI 连续工作一小时」的成本降到一杯奶茶钱的零头,Agent 应用的爆发才真正具备经济基础。

3. 新架构系列才刚刚开场

V4.1 Flash 是新结构系列的最小尺寸型号,官方明确表示该结构支持向更大规模扩展。最小号已经全面超越旧旗舰,更大的型号会是什么样?这个悬念,可能比本次发布本身更值得期待。

4. 产品哲学转向「无感智能」

官网三模式合一,标志着 DeepSeek 从「让用户挑模型」转向「系统自动决定该用多少智能」。模型越强大,用户应该越无感------这是大模型产品走向成熟的标志。


结语

9 月 10 日这一天,DeepSeek 同时完成了三件事:发布新架构模型、砍掉旧旗舰、重塑产品入口。

V4.1 Flash 用 550B 总参数、非对称激活和 1/4 的 KV Cache,证明了一件事:大模型的下半场,拼的不是谁的块头大,而是谁的效率高。 V4 Pro 的退役不是终点,而是新架构系列的开场哨。

四天后,当我们习惯性地点开 DeepSeek,背后默默干活的,已经是这条更轻、更快、更便宜的「小鲸鱼」了。

相关推荐
VIP_CQCRE3 小时前
在 Visual Studio 里接入 Ace Data Cloud:让 AI 编程能力更快落地
ai·visual studio·ace data cloud
终见曦月4 小时前
DeepSeek 最新模型怎么选:视觉实验版与正式旗舰的区别
技术分享·deepseek·最新模型怎么选·视觉实验版与正式·旗舰的区别
tachibana24 小时前
什么是 Function Calling ?
数据库·人工智能·ai·llm·agent
全栈弄潮儿²⁰²⁴4 小时前
AI Agent 开发实战(7):如何接入搜索和数据库工具?
数据库·人工智能·ai·chatgpt·oracle·agent·ai编程
ss2735 小时前
梁神回归,教师节的礼物——DeepSeek Flash系列降价与新版本解读
deepseek
学习日记5256 小时前
第 5 章:自定义 Skill——把重复操作封装成一键命令
人工智能·ai·prompt
Jia ming7 小时前
DeepSeek API配置踩坑记:OpenMAIC部署全流程
deepseek·openmaic
沈管家AI数字员工7 小时前
对话式数据分析实操:从自然语言到可视化图表的全流程
数据库·人工智能·ai·oracle·数据分析
艾克斯观察7 小时前
一条辞职帖,14小时7700万人看:全网到底在吵什么
人工智能·ai·x·世界末日·传播学