2026 年 9 月 10 日,DeepSeek 正式发布 V4.1 Flash 模型并同步执行新的 Flash 定价。官方罕见地放出狠话:经内外部多方测试,V4.1 Flash 在性能、费用、速度、总用时 等各项指标上已全面超越 V4 Pro。更炸裂的是------V4 Pro 将于 9 月 14 日 12:00 正式下线,一个「Pro 旗舰被自家 Flash 取代」的时代,真的来了。
一、事件速览:一次「明牌」的重磅发布
与 7 月底 V4-Flash 正式版「悄悄写进更新日志」的低调不同,这次 DeepSeek 选择了正面官宣。9 月 10 日,官方向 API 用户发送通知邮件,几个关键时间点一目了然:
| 时间 | 事件 |
|---|---|
| 9 月 10 日 12:00 | V4.1 Flash 正式发布,新定价生效 |
| 9 月 14 日 12:00 | V4 Pro 服务下线(原计划更早,已推迟) |
| 下线后 | V4 Pro 请求自动路由至 V4.1 Flash,并按 V4.1 Flash 价格计费 |
与此同时,旧版 V4 Flash 和视觉实验版 V4-Flash-Vision-Exp 也已同步下线,原来两个模型名的请求全部由 V4.1 Flash 承接------文字与图片处理,正式进入同一个主力 API 模型。
官方对新模型的定调非常直接:「经内部、外部多方测试,V4.1 Flash 在性能、费用、速度、总用时等各项指标上已全面超越 V4 Pro。」
一个「Flash」(轻量快速版)全面干掉「Pro」(旗舰版),这在传统产品线逻辑里几乎是不可想象的。但看完技术细节你会发现,DeepSeek 这次是认真的。
二、核心变化一:全新模型结构,KV Cache 压到原来的 1/4
V4.1 Flash 不是旧模型的「后训练加强版」,而是全新模型结构系列中的最小尺寸型号 ,采用非对称编码器---解码器结构:
| 规格 | 参数 |
|---|---|
| 总参数 | 550B |
| 输入阶段激活 | 8B |
| 输出阶段激活 | 16B |
| 上下文长度 | 100 万 tokens |
| 最大输出 | 384K tokens |
注意这个「非对称」设计:输入(理解)只激活 8B,输出(生成)激活 16B。读得快、写得强,算力花在了刀刃上。
最狠的一刀:KV Cache 大压缩
新模型最核心的变化在缓存:
- 每个 Token 的 KV Cache 从上一代 V4 Flash 的 3514 字节降至 890 字节 ,约为原来的 1/4
- 与初代 DeepSeek V1 相比,缩小到约 1/437
- 缓存相关的 HBM 需求降至上一代的 1/4,SSD 需求降至 1/8
为什么这件事极其重要?因为在 Agent 使用场景中,缓存命中的费用往往占大头------Agent 连续工作时,需要反复把历史对话、工具说明、代码上下文重新喂给模型。KV Cache 压缩 75%,直接意味着 Agent 类任务的使用成本大幅下降。
DeepSeek 还表示,这套新结构支持向更大参数规模扩展------也就是说,今天看到的是「最小号」,后面还有大的。
三、核心变化二:视觉能力从「外挂」变「原生」
此前 DeepSeek 的视觉能力靠实验性质的 V4-Flash-Vision-Exp 单独提供,开发者处理图文混合任务时需要在模型之间切换。这次 V4.1 Flash 原生具备多模态视觉理解能力:
- 描述图片、识别截图文字、分析图表,一个模型全搞定
- 图片支持公开链接传入、编码后直接提交,或通过 Files API 上传后引用
- 提供思考与非思考模式 ,默认开启思考,思考强度支持 low / high / max 三档
对处理真实业务资料的 Agent 来说,这是实打实的生产力升级:业务文档里的说明文字与图表、代码与界面截图,经常需要结合起来理解。统一模型入口后,开发者再也不用在不同模型之间做「任务分发」了。
四、核心变化三:Agent 能力全面反超 V4 Pro
口说无凭,看官方公布的对比数据(V4.1 Flash vs V4 Pro):
| 基准测试 | V4 Pro | V4.1 Flash | 提升 |
|---|---|---|---|
| DeepSWE v1.1(代码 Agent) | 62.7 | 74.2 | +11.5 |
| Terminal-Bench 3.0(终端操作) | 11.8 | 30.0 | +18.2(约 2.5 倍) |
| Automation-Bench(自动化) | 43.2 | 54.8 | +11.6 |
| CyberGym(网络安全攻防) | 83.3 | 88.1 | +4.8 |
横向对比同样亮眼:在 DeepSWE v1.1、CyberGym 和 Automation-Bench 三项上,V4.1 Flash 得分超过了 Kimi K3、GLM 5.3、Claude Opus 5 和 GPT 5.6-Sol,拿到榜首。
当然也要客观说一句:GPQA Diamond(高难度科学推理)上 V4.1 Flash 仍低于 V4 Pro ,部分测试也未超过表中全部竞品。它的强项很明确------Agent、工具调用、自动化干活,而不是纯学术推理。
配套的 DeepSeek Harness 同步更新至 v0.1.5,模型针对标准模式、程序化工具调用模式和极简模式做了专项训练。模型也已在 Hugging Face 开源。
五、新定价:缓存命中暴降 60%,Agent 越用越便宜
新价格于 9 月 10 日 12:00 生效,继续采用峰谷定价(每百万 tokens):
| 计费项 | 空闲时段 | 高峰时段 | 较旧版 V4 Flash 降幅 |
|---|---|---|---|
| 输入(缓存命中) | 0.02 元 | 0.04 元 | -60% |
| 输入(缓存未命中) | 1 元 | 2 元 | -33.3% |
| 输出 | 4 元 | 8 元 | -11.1% |
高峰时段:北京时间周一至周五 9:00--12:00、14:00--18:00,其余均为空闲时段。
降价结构非常有讲究:缓存命中降得最狠(60%),未命中次之,输出降得最少。这和 KV Cache 压缩的技术路线完全呼应------就是要鼓励 Agent 式的「反复读取长上下文」用法。
算一笔账:一次任务消耗 100 万缓存命中输入 + 10 万未命中输入 + 1 万输出 tokens,空闲时段费用将从 0.245 元降至 0.16 元,降幅约 34.7%。上下文越长、工具调用轮次越多,省得越多。
六、V4 Pro 退役:一个时代的落幕
这可能是本次发布最有象征意义的一条消息:9 月 14 日 12:00,V4 Pro 服务正式下线。
下线安排干净利落:
- 所有发往 V4 Pro 的请求自动路由到 V4.1 Flash
- 计费按 V4.1 Flash 的更低价格执行
- V4 Pro 服务期间价格保持不变;不同意新计费方式的用户可选择退出并申请退款
「Pro 被 Flash 取代」听起来反常,但逻辑其实很顺:当一个更小、更快、更便宜的新架构模型在核心指标上全面超越旧旗舰,继续维护两套模型反而成了包袱。DeepSeek 选择果断砍掉旧旗舰,把全部筹码压在新架构上------这份决绝,本身就是对新结构的信心投票。
七、官网首页大变脸:三种模式合而为一
和新模型同步落地的,还有 DeepSeek 官网/APP 的一次重要产品改版:原有的「快速模式」「专家模式」「识图模式」三个按钮没了,合并为统一的「智能模式」。
新版对话框下只剩「深度思考」和「智能搜索」两个能力开关,交互逻辑完全变了:
- 自动检测查询复杂度:简单问题直接快速回答,复杂问题自动投入更多推理
- 检测到图片输入时自动激活视觉能力
- 根据任务难度自动调整处理能力
这个改动看似只是少了几个按钮,实质是 DeepSeek 把「模型选择权」从用户手里收了回去------以前是用户猜「这道题该用快速还是专家」,选错了浪费时间;现在由系统在后台调度,产品形态变成「一个入口,自动分流」。
从行业视角看,这和 OpenAI 在 GPT-5 时代推行的「自动路由」思路如出一辙:让用户只面对一个模型,把复杂度藏在后台。而统一的智能模式,恰好为 V4.1 Flash 这种「日常对话 + 图片理解 + 复杂问题一体化」的新模型铺好了路。
八、意义与价值:这次发布为什么重要?
1. 「以下克上」成为新常态
从 7 月底 V4-Flash 正式版在 Agent 基准上反超 V4-Pro 预览版,到这次 V4.1 Flash 全面超越并直接取代 V4 Pro------DeepSeek 连续两次证明:模型规模不再是决定性因素,架构创新和训练方法的权重正在快速上升。参数更小、激活更少的模型,完全可以跑出旗舰级表现。
2. Agent 成本曲线被狠狠压了一刀
KV Cache 压到 1/4、缓存命中价格暴降 60%------这两件事叠加,瞄准的都是同一个目标:让 Agent 长时间、多轮次、长上下文地干活变得足够便宜。当「让 AI 连续工作一小时」的成本降到一杯奶茶钱的零头,Agent 应用的爆发才真正具备经济基础。
3. 新架构系列才刚刚开场
V4.1 Flash 是新结构系列的最小尺寸型号,官方明确表示该结构支持向更大规模扩展。最小号已经全面超越旧旗舰,更大的型号会是什么样?这个悬念,可能比本次发布本身更值得期待。
4. 产品哲学转向「无感智能」
官网三模式合一,标志着 DeepSeek 从「让用户挑模型」转向「系统自动决定该用多少智能」。模型越强大,用户应该越无感------这是大模型产品走向成熟的标志。
结语
9 月 10 日这一天,DeepSeek 同时完成了三件事:发布新架构模型、砍掉旧旗舰、重塑产品入口。
V4.1 Flash 用 550B 总参数、非对称激活和 1/4 的 KV Cache,证明了一件事:大模型的下半场,拼的不是谁的块头大,而是谁的效率高。 V4 Pro 的退役不是终点,而是新架构系列的开场哨。
四天后,当我们习惯性地点开 DeepSeek,背后默默干活的,已经是这条更轻、更快、更便宜的「小鲸鱼」了。