
9 月 8 日下午,DeepSeek 在官方用户群里丢了一条不到 100 字的通知。没有发布会,没有预热海报,官网文档都没更新,就扔出一个模型名:
csharp
deepseek-v4.1-flash-expires-on-0910
名字最后那串 0910 是它的保质期。48 小时后,9 月 10 日中午 12:00,正式版上线,官方公众号标题朴素得像周报------《更强、更快、更普惠》。但正文里藏着一句让整个行业坐直了的话:
经多方测试,V4.1 Flash 在性能、费用、速度、总用时等各项指标上已全面超越 V4 Pro,因此我们计划有序下线 V4 Pro 模型。 ------ DeepSeek 官方公告,2026 年 9 月 10 日^1^
翻译一下:Flash 长大了,轮到 Pro 退休。北京时间 9 月 14 日 12:00 之后,所有打给 deepseek-v4-pro 的请求会被静默路由到 V4.1 Flash,按 Flash 的单价计费,直到 V4.1 Pro 上线为止^2^。
如果你的生产代码里硬编码了 deepseek-v4-pro,你还有不到四天。
一分钟速查
| 项 | 值 |
|---|---|
| 总参数 | 552B(MoE) |
| 激活参数 | 输入 8B / 输出 16B(非对称) |
| 架构 | Causal-Encoder-Decoder(全新,非 V4 Flash 增量) |
| 上下文 / 最大输出 | 1M tokens / 384K tokens^[3](#项 值 总参数 552B(MoE) 激活参数 输入 8B / 输出 16B(非对称) 架构 Causal-Encoder-Decoder(全新,非 V4 Flash 增量) 上下文 / 最大输出 1M tokens / 384K tokens3 多模态 原生视觉理解(不再是外挂视觉编码器) 每 token KV Cache 890 字节(V1 的 1/437) 显存/存储需求 HBM 降至上一代 1/4,SSD 降至 1/8 开源协议 MIT,权重已在 HuggingFace 开源 API 模型名 deepseek-flash 价格(闲时,¥/百万 tokens) 缓存命中 0.02 / 未命中 1.0 / 输出 4.0 "#user-content-fn-3")^ |
| 多模态 | 原生视觉理解(不再是外挂视觉编码器) |
| 每 token KV Cache | 890 字节(V1 的 1/437) |
| 显存/存储需求 | HBM 降至上一代 1/4,SSD 降至 1/8 |
| 开源协议 | MIT,权重已在 HuggingFace 开源 |
| API 模型名 | deepseek-flash |
| 价格(闲时,¥/百万 tokens) | 缓存命中 0.02 / 未命中 1.0 / 输出 4.0 |
换骨架,不是换皮肤
先说清楚一件事:V4.1 Flash 不是 V4 Flash 的后训练版。
今年 7 月 31 日那次 V4 Flash 更新,官方原话是「keeps the same model architecture and size as DeepSeek-V4-Flash-Preview, and was only re-post-trained」^2^------同一个骨架,重新练了一遍。这次不一样,结构上重做了。
552B 的 MoE,采用的是 Causal-Encoder-Decoder(因果编码器---解码器)结构。核心特征是输入输出非对称:
- 处理输入(prefill):激活 8B。552B 的专家池里,每个输入 token 只点亮约 1.45% 的参数。
- 生成输出(decode):激活 16B,是输入侧的整整 2 倍。
直觉上讲得通。读一段代码、看一张截图、扫一遍工具返回值,绝大多数 token 是上下文铺垫,不需要深度推理;真正要动脑子的是生成的那一刻。把算力押在输出侧------输入走轻量通道,输出走完整通道。
这套设计与 Agent 的工作方式咬合得很紧。Agent 负载的 token 结构是极度倾斜的:几万 token 的上下文、工具返回、代码仓库前缀,换回几十到几百 token 的判断和指令。降低输入侧开销,打击面正好落在最贵的地方。
顺带一提技术报告里被媒体转述出来的几个组件^4^:CSA2(压缩稀疏注意力 2)通过跨层复用 KV Cache 配合 Top-K 索引,分 Full / Reindex / Reuse 三种模式;KV Cache 从上一代的 FP8 进一步压到 FP4 ;生成阶段加了 DSpark,用轻量模块先预测部分 token 再由主模型确认,提升 decode 效率。
一句话:这不是「调参调出来的性价比」,是结构性的成本重排。
437 倍,才是这次真正的里子
如果说非对称激活是新招,KV Cache 压缩就是 DeepSeek 的祖传手艺了。官方给了一张跨度近三年的数据:
| 模型 | 时间 | 每 token 全局 KV Cache | 累计压缩 |
|---|---|---|---|
| DeepSeek-V1 | 2023.11 | 389,120 字节 | --- |
| DeepSeek-V3.2 | 2025.12 | 48,068 字节 | 8.1× |
| DeepSeek-V4-Flash | 2026.04 | 3,514 字节 | 13.7× |
| DeepSeek-V4.1-Flash | 2026.09 | 890 字节 | 3.9×(累计 437×) |
对应的硬件侧结果:相比上一代,HBM 需求降到 1/4,SSD 需求降到 1/8。
这笔账对谁最有感?Agent 开发者。Agent 任务的典型形态是长上下文 + 高频调用------系统提示词、工具定义、历史对话,每一轮都要重复送进去。缓存命中率经常到 99%+,意味着账单大头其实是缓存命中的那部分输入费,不是输出费。
所以看这次降价的结构就很有意思:缓存命中输入 0.05 → 0.02 元(-60% ),未命中输入 1.5 → 1.0 元(-33%),输出 4.5 → 4.0 元(-11% )^3^。降幅最大的那一项,正好是 KV Cache 压出来的那一块。官方很清楚钱是从哪儿省出来的。
有个细节值得玩味:一个模型 API 会关心 SSD 需求,说明它的缓存分层里本来就把 SSD 当成一级存储在用。这是 DeepSeek 服务栈一贯的路线,不是临时起意。
还有个推论:每步要读的 KV 已经小到不再主导显存带宽,权重读取成了瓶颈------这大概就是社区测出「速度不随上下文长度衰减」的物理原因^5^。
图 1 · V4.1 Flash 的非对称计算路径与缓存压缩位置
跑分:赢得有选择,输得也明白
官方 changelog 的完整列表^2^:
| 基准 | V4-Flash 0731 | V4-Pro 0813 | V4.1-Flash |
|---|---|---|---|
| GPQA Diamond | 89.9 | 92.4 | 90.9 |
| HLE | --- | 42.7* | 36.8(纯文本子集 39.1*) |
| Codeforces (Rating) | 3289 | 3348 | 3471 |
| MathArena Apex | 58.6 | 65.3 | 65.6 |
| Terminal-Bench 2.1 | 82.7 | 87.9 | 90.6 |
| Terminal-Bench 3.0 | 7.6 | 11.8 | 30.0 |
| Terminal-Bench 4.0 | 7.0 | 12.4 | 31.2 |
| DeepSWE v1.1 | 54.4 | 62.7 | 74.2 |
| NL2Repo-Bench | 54.2 | 61.5 | 65.4 |
| CyberGym | 76.7 | 83.3 | 88.1 |
| Automation-Bench | 37.7 | 43.2 | 54.8 |
| Agents' Last Exam | 25.2 | 25.7 | 31.8 |
| HLE (w/tools) | 51.5 | 60.0 | 63.9 |
| BabyVision (w/tools) | 85.7 | --- | 89.6 |
* HLE 只在纯文本子集上测试。数据来源:DeepSeek API Docs Change Log^2^。
注意看几个跳变:Terminal-Bench 3.0 从 7.6 直接到 30.0,接近 4 倍;DeepSWE 从 54.4 到 74.2。这两个都是 Agent 实战类基准,跳变幅度说明后训练的方向很明确------就是往「能干活」上堆。
但别急着喊全面制霸。横向看官方自己贴的对比图(媒体转述数据^6^):
- CyberGym 88.1、Automation-Bench 54.8、DeepSWE v1.1 74.2 ------ 三项第一,其中 DeepSWE 只比 Opus 5 的 74.0 高 0.2 分。
- GPQA Diamond 90.9 ------ 低于 GLM-5.3 的 92.9、Opus 5 的 93.4、GPT-5.6-Sol 的 94.1。
- HLE 36.8 ------ 在这张表里是全场最低,GPT-5.6-Sol 拿到 56.3。
- Terminal-Bench 3.0 / 4.0 ------ 30.0 / 31.2,明显低于 Opus 5 的 43.3 / 51.8。
甚至对自家旧旗舰都没全赢:V4 Pro 的 GPQA Diamond 是 92.4,V4.1 Flash 是 90.9,低了 1.5 分。官方那句「全面超越」指的是性能、费用、速度、总用时四个维度的综合账,不是每一项跑分都高。
所以更准确的说法是:这是一次「在 Agent 主战场,用三分之一的价格追平甚至超过旗舰」的发布。对绝大多数业务场景,后者才是要害;但如果你在做科研推理类应用,HLE 那个 36.8 值得多看两眼。
算一笔真实的账
新价格,2026 年 9 月 10 日 12:00 生效,单位 ¥/百万 tokens^1^^7^:
| 模型 / 时段 | 输入·缓存命中 | 输入·未命中 | 输出 |
|---|---|---|---|
| V4.1 Flash · 空闲 | 0.02 | 1.0 | 4.0 |
| V4.1 Flash · 高峰 | 0.04 | 2.0 | 8.0 |
| V4 Flash · 空闲(旧) | 0.05 | 1.5 | 4.5 |
| V4 Pro · 空闲 | 0.15 | 4.5 | 13.5 |
| V4 Pro · 高峰 | 0.30 | 9.0 | 27.0 |
高峰时段:工作日 9:00--12:00、14:00--18:00(北京时间),其余全算空闲,含周末。
三笔账:
- 对比旧 Flash:缓存命中 -60%、未命中 -33%、输出 -11%。由于缓存命中率极高,真实账单的降幅远大于表面那个 11%。
- 对比 V4 Pro:输出高峰价从 27 元砍到 8 元,不到原价三分之一------还是在跑分整体更高的前提下。
- 错峰:一个月的批量离线任务挪到晚上或周末跑,成本直接再打五折。
腾讯新闻那边算过一个具体例子^3^:一次任务消耗 100 万缓存命中输入 + 10 万未命中输入 + 1 万输出,空闲时段费用从 0.245 元降到 0.16 元,下降约 34.7%。
背景板也别忘了:就在一个月前,DeepSeek 才因为 V4 Pro 上线涨过一次价,高峰输出一度到 27 元。一个月后自己把它砍到 8 元。这个动作比任何 PR 稿都说明竞争压力。
怎么切过去
改动小到几乎可以忽略,OpenAI SDK 只换一个模型名:
python
from openai import OpenAI
client = OpenAI(
api_key="YOUR_DEEPSEEK_KEY",
base_url="https://api.deepseek.com",
)
resp = client.chat.completions.create(
model="deepseek-flash", # 即 V4.1 Flash
messages=[{
"role": "user",
"content": [
# 原生多模态:文字和图片混排,不再需要单独的 vision 模型
{"type": "text", "text": "看这张报错截图,说说是哪一层抛的"},
{"type": "image_url", "image_url": {"url": "https://..."}},
],
}],
)
规格上:1M 上下文、384K 最大输出、JSON Output、工具调用、Responses API 都支持;思考模式默认开启,强度分 low / high / max 三档^3^。
几个必须知道的时间点和坑:
- 旧模型名还在但只是过渡 。
deepseek-v4-flash和deepseek-v4-flash-vision-exp已下线,旧名暂时路由到 V4.1 Flash,别指望长期有效。 - 9 月 14 日 12:00 是硬 deadline 。在那之后
deepseek-v4-pro静默切走,按 Flash 计费。没有公开的 opt-out 机制。 - 内测版模型名
deepseek-v4.1-flash-expires-on-0910已失效 ,正式版是deepseek-flash。 - C 端三模式合并了 。原来的快速 / 专家 / 识图合并成统一的智能模式,模型自己判断复杂度、检测到图片就激活视觉能力^8^。
说点泼冷水的
吹完了,讲三个我认为该警惕的地方。
第一,静默路由在工程上是有风险的。
官方的说法逻辑上无懈可击------「继续以更高价格、更慢速度为用户提供更弱的 V4 Pro,已不再合适」。但生产系统是围绕特定模型的失败模式调优的:你的重试策略、你的 prompt 兜底、你的监控告警,都建立在 V4 Pro 的行为分布上。V4.1 Flash 均分更高,不代表它在你那套 prompt 上的失败分布 和 V4 Pro 一致。Hacker News 上的争论也集中在这里^9^。
建议:9 月 14 日之前,拿真实流量跑一遍回归,重点看结构化输出(JSON / 函数调用)的格式漂移。别等报警。
第二,已知的两个语言问题。
内测期间社区反馈了两个坑:英文提问偶尔返回中文回复;开启联网搜索时存在语言不一致。第二个尤其烦人------搜到的资料是什么语言,回答就飘到什么语言。如果你的产品英文用户占比高,这条要专门测。社区里有人的土办法是在 prompt 末尾硬塞一句 Answer in English!,据说有时候得重复五次才生效^9^。说实话,这不该是用户侧解决的问题。
第三,开源了,但「开源」和「能用」之间隔着一整套推理工程。
权重确实在 HuggingFace 上,MIT 协议,没有附加条款,商用、微调、二次分发、甚至拿来训练竞品都不受限^10^。这次连 DeepSeek License 那套限制都没用,比 V3 时代的协议干净得多。技术报告 PDF 也一起挂出来了。
但 552B 的 MoE 摆在那儿。官方自己说了一句很实诚的话:如果有大规模部署需求且具备相应资源------2000 张 GPU + 存储集群------欢迎联系。对绝大多数团队来说,这是「能下载」而不是「能跑」。好消息是 KV Cache 只有 890 字节/token,显存压力比上一代友好很多,社区适配值得蹲一波。
我的判断
V4.1 Flash 是新架构家族里尺寸最小的成员。官方明说了这套结构「可扩展到更大参数模型」。
也就是说,这只是地基。真正的重头戏是还没来的 V4.1 Pro------同一个架构,更大的尺寸。如果 Flash 这个尺寸就能在 DeepSWE、CyberGym、Automation-Bench 上拿第一,那 Pro 版本的落点大概不在「能不能干这个活」,而在「HLE 那 20 分的差距能补回多少」。
另一个更值得关注的转向是产品形态:快速 / 专家 / 识图三个模式合而为一,模型自己判断任务复杂度、自己决定要不要激活视觉。这意味着「选模型」这件事正在从用户手里收走,交给路由层。Gemini 走过这条路,现在 DeepSeek 也走了。对用户是好事,对做中间层的人是个提醒:你的价值如果建立在「帮用户挑模型」上,这个位置正在消失。
至于 V4 Pro------一个月前涨价,一个月后被自己的 Flash 送走。这个行业对一个旗舰模型的耐心,现在只有 30 天。
参考来源
层级说明:一手 = DeepSeek 官方发布;媒体 = 有采编流程的媒体转述;社区 = 开发者自测,未经官方确认。
补充说明 :文中引用的实测速度数据(TTFT 178ms vs V4 Pro 766ms、持续输出 355 tok/s、同任务 18 分 49 秒 / 11.59M tokens vs 30 分 11 秒 / 20.31M tokens)来自 X 用户 @riba2534 及社区自测,分布区间在 200--500+ tok/s 之间,受调用时段、任务长度和测试方法影响很大,均非官方口径,只作方向性参考。
Footnotes
-
一手 DeepSeek 微信公众号《DeepSeek V4.1 Flash:更强、更快、更普惠》,2026-09-10。定价表、V4 Pro 下线时间、非对称结构说明均出自此文。转载见 湖南日报·今日头条、凤凰网科技。 ↩ ↩2
-
一手 DeepSeek API Docs --- Change Log,2026-09-10 「DeepSeek-V4.1-Flash Release」条目。完整 19 项 benchmark 数值、API 模型名变更、V4 Pro 路由规则、以及 2026-07-31 / 08-13 / 08-21 各次更新的历史数据均出自此页。 ↩ ↩2 ↩3 ↩4
-
媒体 《DeepSeek V4.1 Flash 发布:新架构、更低价格,接替上一代 Pro?》,腾讯新闻,2026-09-10。1M 上下文 / 384K 输出规格、思考强度分档、降价幅度测算、费用对比示例。 ↩ ↩2 ↩3 ↩4
-
媒体·转述技术报告 《刚刚,DeepSeek 发布新模型,Flash 把 Pro 给干掉了》,腾讯新闻,2026-09-10。CSA2 三种模式(Full / Reindex / Reuse)、FP4 KV Cache、DSpark 推测解码等技术报告内容。技术报告原文:
huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash/blob/main/DeepSeek_V41_Tech_Report.pdf。 ↩ -
媒体 《DeepSeek V4.1 Flash 正式上线!已适配 Harness》,网易号,2026-09-10。KV Cache 与带宽瓶颈的关系分析、社区速度数据汇总。 ↩
-
媒体·转述官方对比图 《DeepSeek 发布 V4.1 Flash 模型:采用全新架构,KV 缓存大压缩》,以及 《DeepSeek V4.1 Flash 正式上线!已适配 Harness》。V4.1 Flash 与 Kimi-K3、GLM-5.3、Opus 5、GPT-5.6-Sol 的横向对比数值。 ↩
-
媒体 《DeepSeek 正式发布 V4.1 Flash》,21 世纪经济报道 / 南方财经,2026-09-10。定价与峰谷时段定义。 ↩
-
媒体 《DeepSeek:9 月 14 日 12:00 下线 V4 Pro 服务》,凤凰网科技,2026-09-10。三模式合并为统一智能模式的说明,以及「继续使用即视为同意调整后计费方式,不同意可退出使用并申请退款」的官方表态。 ↩
-
社区 Hacker News 讨论串 "DeepSeek launching v4.1 flash cheaper and more capable than v4 pro",镜像见 whnex.com/items/49624...。静默路由争议、英文提问返回中文、联网搜索语言漂移等反馈均出自此串,未经官方确认。 ↩ ↩2
-
一手 HuggingFace: deepseek-ai/DeepSeek-V4.1-Flash。MIT 协议、权重分片、技术报告 PDF、推理参考代码。仓库元数据与协议核对见 IT 爆破手的核实记录。 ↩