DeepSeek V4.1 Flash:一次把自家旗舰送走的发布

9 月 8 日下午,DeepSeek 在官方用户群里丢了一条不到 100 字的通知。没有发布会,没有预热海报,官网文档都没更新,就扔出一个模型名:

csharp 复制代码
deepseek-v4.1-flash-expires-on-0910

名字最后那串 0910 是它的保质期。48 小时后,9 月 10 日中午 12:00,正式版上线,官方公众号标题朴素得像周报------《更强、更快、更普惠》。但正文里藏着一句让整个行业坐直了的话:

经多方测试,V4.1 Flash 在性能、费用、速度、总用时等各项指标上已全面超越 V4 Pro,因此我们计划有序下线 V4 Pro 模型。 ------ DeepSeek 官方公告,2026 年 9 月 10 日^1^

翻译一下:Flash 长大了,轮到 Pro 退休。北京时间 9 月 14 日 12:00 之后,所有打给 deepseek-v4-pro 的请求会被静默路由到 V4.1 Flash,按 Flash 的单价计费,直到 V4.1 Pro 上线为止^2^。

如果你的生产代码里硬编码了 deepseek-v4-pro,你还有不到四天。


一分钟速查

总参数 552B(MoE)
激活参数 输入 8B / 输出 16B(非对称)
架构 Causal-Encoder-Decoder(全新,非 V4 Flash 增量)
上下文 / 最大输出 1M tokens / 384K tokens^[3](#项 值 总参数 552B(MoE) 激活参数 输入 8B / 输出 16B(非对称) 架构 Causal-Encoder-Decoder(全新,非 V4 Flash 增量) 上下文 / 最大输出 1M tokens / 384K tokens3 多模态 原生视觉理解(不再是外挂视觉编码器) 每 token KV Cache 890 字节(V1 的 1/437) 显存/存储需求 HBM 降至上一代 1/4,SSD 降至 1/8 开源协议 MIT,权重已在 HuggingFace 开源 API 模型名 deepseek-flash 价格(闲时,¥/百万 tokens) 缓存命中 0.02 / 未命中 1.0 / 输出 4.0 "#user-content-fn-3")^
多模态 原生视觉理解(不再是外挂视觉编码器)
每 token KV Cache 890 字节(V1 的 1/437)
显存/存储需求 HBM 降至上一代 1/4,SSD 降至 1/8
开源协议 MIT,权重已在 HuggingFace 开源
API 模型名 deepseek-flash
价格(闲时,¥/百万 tokens) 缓存命中 0.02 / 未命中 1.0 / 输出 4.0

换骨架,不是换皮肤

先说清楚一件事:V4.1 Flash 不是 V4 Flash 的后训练版。

今年 7 月 31 日那次 V4 Flash 更新,官方原话是「keeps the same model architecture and size as DeepSeek-V4-Flash-Preview, and was only re-post-trained」^2^------同一个骨架,重新练了一遍。这次不一样,结构上重做了。

552B 的 MoE,采用的是 Causal-Encoder-Decoder(因果编码器---解码器)结构。核心特征是输入输出非对称

  • 处理输入(prefill):激活 8B。552B 的专家池里,每个输入 token 只点亮约 1.45% 的参数。
  • 生成输出(decode):激活 16B,是输入侧的整整 2 倍。

直觉上讲得通。读一段代码、看一张截图、扫一遍工具返回值,绝大多数 token 是上下文铺垫,不需要深度推理;真正要动脑子的是生成的那一刻。把算力押在输出侧------输入走轻量通道,输出走完整通道。

这套设计与 Agent 的工作方式咬合得很紧。Agent 负载的 token 结构是极度倾斜的:几万 token 的上下文、工具返回、代码仓库前缀,换回几十到几百 token 的判断和指令。降低输入侧开销,打击面正好落在最贵的地方。

顺带一提技术报告里被媒体转述出来的几个组件^4^:CSA2(压缩稀疏注意力 2)通过跨层复用 KV Cache 配合 Top-K 索引,分 Full / Reindex / Reuse 三种模式;KV Cache 从上一代的 FP8 进一步压到 FP4 ;生成阶段加了 DSpark,用轻量模块先预测部分 token 再由主模型确认,提升 decode 效率。

一句话:这不是「调参调出来的性价比」,是结构性的成本重排。


437 倍,才是这次真正的里子

如果说非对称激活是新招,KV Cache 压缩就是 DeepSeek 的祖传手艺了。官方给了一张跨度近三年的数据:

模型 时间 每 token 全局 KV Cache 累计压缩
DeepSeek-V1 2023.11 389,120 字节 ---
DeepSeek-V3.2 2025.12 48,068 字节 8.1×
DeepSeek-V4-Flash 2026.04 3,514 字节 13.7×
DeepSeek-V4.1-Flash 2026.09 890 字节 3.9×(累计 437×)

对应的硬件侧结果:相比上一代,HBM 需求降到 1/4,SSD 需求降到 1/8。

这笔账对谁最有感?Agent 开发者。Agent 任务的典型形态是长上下文 + 高频调用------系统提示词、工具定义、历史对话,每一轮都要重复送进去。缓存命中率经常到 99%+,意味着账单大头其实是缓存命中的那部分输入费,不是输出费。

所以看这次降价的结构就很有意思:缓存命中输入 0.05 → 0.02 元(-60% ),未命中输入 1.5 → 1.0 元(-33%),输出 4.5 → 4.0 元(-11% )^3^。降幅最大的那一项,正好是 KV Cache 压出来的那一块。官方很清楚钱是从哪儿省出来的。

有个细节值得玩味:一个模型 API 会关心 SSD 需求,说明它的缓存分层里本来就把 SSD 当成一级存储在用。这是 DeepSeek 服务栈一贯的路线,不是临时起意。

还有个推论:每步要读的 KV 已经小到不再主导显存带宽,权重读取成了瓶颈------这大概就是社区测出「速度不随上下文长度衰减」的物理原因^5^。

flowchart TB A[&#34;<b>输入 Prefill</b><br/><i>激活 8B · 轻量通道</i>&#34;] --> B[&#34;<b>KV Cache</b><br/><i>890 B/token · FP4</i>&#34;] B --> C[&#34;<b>输出 Decode</b><br/><i>激活 16B · 完整通道</i>&#34;] C --> D[&#34;<b>DSpark 推测解码</b><br/><i>轻量模块先猜 · 主模型确认</i>&#34;] A --> E[&#34;<b>552B MoE 专家池</b><br/><i>容量在这 · 成本不在这</i>&#34;] C --> E classDef p1 fill:#534AB7,stroke:#AFA9EC,color:#EEEDFE classDef t1 fill:#0F6E56,stroke:#5DCAA5,color:#E1F5EE classDef gray fill:#2C2C2A,stroke:#5F5E5A,color:#888780 class A p1 class B gray class C t1 class D t1 class E p1

图 1 · V4.1 Flash 的非对称计算路径与缓存压缩位置


跑分:赢得有选择,输得也明白

官方 changelog 的完整列表^2^:

基准 V4-Flash 0731 V4-Pro 0813 V4.1-Flash
GPQA Diamond 89.9 92.4 90.9
HLE --- 42.7* 36.8(纯文本子集 39.1*)
Codeforces (Rating) 3289 3348 3471
MathArena Apex 58.6 65.3 65.6
Terminal-Bench 2.1 82.7 87.9 90.6
Terminal-Bench 3.0 7.6 11.8 30.0
Terminal-Bench 4.0 7.0 12.4 31.2
DeepSWE v1.1 54.4 62.7 74.2
NL2Repo-Bench 54.2 61.5 65.4
CyberGym 76.7 83.3 88.1
Automation-Bench 37.7 43.2 54.8
Agents' Last Exam 25.2 25.7 31.8
HLE (w/tools) 51.5 60.0 63.9
BabyVision (w/tools) 85.7 --- 89.6

* HLE 只在纯文本子集上测试。数据来源:DeepSeek API Docs Change Log^2^。

注意看几个跳变:Terminal-Bench 3.0 从 7.6 直接到 30.0,接近 4 倍;DeepSWE 从 54.4 到 74.2。这两个都是 Agent 实战类基准,跳变幅度说明后训练的方向很明确------就是往「能干活」上堆。

但别急着喊全面制霸。横向看官方自己贴的对比图(媒体转述数据^6^):

  • CyberGym 88.1、Automation-Bench 54.8、DeepSWE v1.1 74.2 ------ 三项第一,其中 DeepSWE 只比 Opus 5 的 74.0 高 0.2 分。
  • GPQA Diamond 90.9 ------ 低于 GLM-5.3 的 92.9、Opus 5 的 93.4、GPT-5.6-Sol 的 94.1。
  • HLE 36.8 ------ 在这张表里是全场最低,GPT-5.6-Sol 拿到 56.3。
  • Terminal-Bench 3.0 / 4.0 ------ 30.0 / 31.2,明显低于 Opus 5 的 43.3 / 51.8。

甚至对自家旧旗舰都没全赢:V4 Pro 的 GPQA Diamond 是 92.4,V4.1 Flash 是 90.9,低了 1.5 分。官方那句「全面超越」指的是性能、费用、速度、总用时四个维度的综合账,不是每一项跑分都高。

所以更准确的说法是:这是一次「在 Agent 主战场,用三分之一的价格追平甚至超过旗舰」的发布。对绝大多数业务场景,后者才是要害;但如果你在做科研推理类应用,HLE 那个 36.8 值得多看两眼。


算一笔真实的账

新价格,2026 年 9 月 10 日 12:00 生效,单位 ¥/百万 tokens^1^^7^:

模型 / 时段 输入·缓存命中 输入·未命中 输出
V4.1 Flash · 空闲 0.02 1.0 4.0
V4.1 Flash · 高峰 0.04 2.0 8.0
V4 Flash · 空闲(旧) 0.05 1.5 4.5
V4 Pro · 空闲 0.15 4.5 13.5
V4 Pro · 高峰 0.30 9.0 27.0

高峰时段:工作日 9:00--12:00、14:00--18:00(北京时间),其余全算空闲,含周末。

三笔账:

  1. 对比旧 Flash:缓存命中 -60%、未命中 -33%、输出 -11%。由于缓存命中率极高,真实账单的降幅远大于表面那个 11%。
  2. 对比 V4 Pro:输出高峰价从 27 元砍到 8 元,不到原价三分之一------还是在跑分整体更高的前提下。
  3. 错峰:一个月的批量离线任务挪到晚上或周末跑,成本直接再打五折。

腾讯新闻那边算过一个具体例子^3^:一次任务消耗 100 万缓存命中输入 + 10 万未命中输入 + 1 万输出,空闲时段费用从 0.245 元降到 0.16 元,下降约 34.7%。

背景板也别忘了:就在一个月前,DeepSeek 才因为 V4 Pro 上线涨过一次价,高峰输出一度到 27 元。一个月后自己把它砍到 8 元。这个动作比任何 PR 稿都说明竞争压力。


怎么切过去

改动小到几乎可以忽略,OpenAI SDK 只换一个模型名:

python 复制代码
from openai import OpenAI

client = OpenAI(
    api_key="YOUR_DEEPSEEK_KEY",
    base_url="https://api.deepseek.com",
)

resp = client.chat.completions.create(
    model="deepseek-flash",   # 即 V4.1 Flash
    messages=[{
        "role": "user",
        "content": [
            # 原生多模态:文字和图片混排,不再需要单独的 vision 模型
            {"type": "text", "text": "看这张报错截图,说说是哪一层抛的"},
            {"type": "image_url", "image_url": {"url": "https://..."}},
        ],
    }],
)

规格上:1M 上下文、384K 最大输出、JSON Output、工具调用、Responses API 都支持;思考模式默认开启,强度分 low / high / max 三档^3^。

几个必须知道的时间点和坑:

  • 旧模型名还在但只是过渡deepseek-v4-flashdeepseek-v4-flash-vision-exp 已下线,旧名暂时路由到 V4.1 Flash,别指望长期有效。
  • 9 月 14 日 12:00 是硬 deadline 。在那之后 deepseek-v4-pro 静默切走,按 Flash 计费。没有公开的 opt-out 机制。
  • 内测版模型名 deepseek-v4.1-flash-expires-on-0910 已失效 ,正式版是 deepseek-flash
  • C 端三模式合并了 。原来的快速 / 专家 / 识图合并成统一的智能模式,模型自己判断复杂度、检测到图片就激活视觉能力^8^。

说点泼冷水的

吹完了,讲三个我认为该警惕的地方。

第一,静默路由在工程上是有风险的。

官方的说法逻辑上无懈可击------「继续以更高价格、更慢速度为用户提供更弱的 V4 Pro,已不再合适」。但生产系统是围绕特定模型的失败模式调优的:你的重试策略、你的 prompt 兜底、你的监控告警,都建立在 V4 Pro 的行为分布上。V4.1 Flash 均分更高,不代表它在你那套 prompt 上的失败分布 和 V4 Pro 一致。Hacker News 上的争论也集中在这里^9^。

建议:9 月 14 日之前,拿真实流量跑一遍回归,重点看结构化输出(JSON / 函数调用)的格式漂移。别等报警。

第二,已知的两个语言问题。

内测期间社区反馈了两个坑:英文提问偶尔返回中文回复;开启联网搜索时存在语言不一致。第二个尤其烦人------搜到的资料是什么语言,回答就飘到什么语言。如果你的产品英文用户占比高,这条要专门测。社区里有人的土办法是在 prompt 末尾硬塞一句 Answer in English!,据说有时候得重复五次才生效^9^。说实话,这不该是用户侧解决的问题。

第三,开源了,但「开源」和「能用」之间隔着一整套推理工程。

权重确实在 HuggingFace 上,MIT 协议,没有附加条款,商用、微调、二次分发、甚至拿来训练竞品都不受限^10^。这次连 DeepSeek License 那套限制都没用,比 V3 时代的协议干净得多。技术报告 PDF 也一起挂出来了。

但 552B 的 MoE 摆在那儿。官方自己说了一句很实诚的话:如果有大规模部署需求且具备相应资源------2000 张 GPU + 存储集群------欢迎联系。对绝大多数团队来说,这是「能下载」而不是「能跑」。好消息是 KV Cache 只有 890 字节/token,显存压力比上一代友好很多,社区适配值得蹲一波。


我的判断

V4.1 Flash 是新架构家族里尺寸最小的成员。官方明说了这套结构「可扩展到更大参数模型」。

也就是说,这只是地基。真正的重头戏是还没来的 V4.1 Pro------同一个架构,更大的尺寸。如果 Flash 这个尺寸就能在 DeepSWE、CyberGym、Automation-Bench 上拿第一,那 Pro 版本的落点大概不在「能不能干这个活」,而在「HLE 那 20 分的差距能补回多少」。

另一个更值得关注的转向是产品形态:快速 / 专家 / 识图三个模式合而为一,模型自己判断任务复杂度、自己决定要不要激活视觉。这意味着「选模型」这件事正在从用户手里收走,交给路由层。Gemini 走过这条路,现在 DeepSeek 也走了。对用户是好事,对做中间层的人是个提醒:你的价值如果建立在「帮用户挑模型」上,这个位置正在消失。

至于 V4 Pro------一个月前涨价,一个月后被自己的 Flash 送走。这个行业对一个旗舰模型的耐心,现在只有 30 天。


参考来源

层级说明:一手 = DeepSeek 官方发布;媒体 = 有采编流程的媒体转述;社区 = 开发者自测,未经官方确认。

补充说明 :文中引用的实测速度数据(TTFT 178ms vs V4 Pro 766ms、持续输出 355 tok/s、同任务 18 分 49 秒 / 11.59M tokens vs 30 分 11 秒 / 20.31M tokens)来自 X 用户 @riba2534 及社区自测,分布区间在 200--500+ tok/s 之间,受调用时段、任务长度和测试方法影响很大,均非官方口径,只作方向性参考。

Footnotes

  1. 一手 DeepSeek 微信公众号《DeepSeek V4.1 Flash:更强、更快、更普惠》,2026-09-10。定价表、V4 Pro 下线时间、非对称结构说明均出自此文。转载见 湖南日报·今日头条凤凰网科技 2

  2. 一手 DeepSeek API Docs --- Change Log,2026-09-10 「DeepSeek-V4.1-Flash Release」条目。完整 19 项 benchmark 数值、API 模型名变更、V4 Pro 路由规则、以及 2026-07-31 / 08-13 / 08-21 各次更新的历史数据均出自此页。 2 3 4

  3. 媒体 《DeepSeek V4.1 Flash 发布:新架构、更低价格,接替上一代 Pro?》,腾讯新闻,2026-09-10。1M 上下文 / 384K 输出规格、思考强度分档、降价幅度测算、费用对比示例。 2 3 4

  4. 媒体·转述技术报告 《刚刚,DeepSeek 发布新模型,Flash 把 Pro 给干掉了》,腾讯新闻,2026-09-10。CSA2 三种模式(Full / Reindex / Reuse)、FP4 KV Cache、DSpark 推测解码等技术报告内容。技术报告原文: huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash/blob/main/DeepSeek_V41_Tech_Report.pdf

  5. 媒体 《DeepSeek V4.1 Flash 正式上线!已适配 Harness》,网易号,2026-09-10。KV Cache 与带宽瓶颈的关系分析、社区速度数据汇总。

  6. 媒体·转述官方对比图 《DeepSeek 发布 V4.1 Flash 模型:采用全新架构,KV 缓存大压缩》,以及 《DeepSeek V4.1 Flash 正式上线!已适配 Harness》。V4.1 Flash 与 Kimi-K3、GLM-5.3、Opus 5、GPT-5.6-Sol 的横向对比数值。

  7. 媒体 《DeepSeek 正式发布 V4.1 Flash》,21 世纪经济报道 / 南方财经,2026-09-10。定价与峰谷时段定义。

  8. 媒体 《DeepSeek:9 月 14 日 12:00 下线 V4 Pro 服务》,凤凰网科技,2026-09-10。三模式合并为统一智能模式的说明,以及「继续使用即视为同意调整后计费方式,不同意可退出使用并申请退款」的官方表态。

  9. 社区 Hacker News 讨论串 "DeepSeek launching v4.1 flash cheaper and more capable than v4 pro",镜像见 whnex.com/items/49624...。静默路由争议、英文提问返回中文、联网搜索语言漂移等反馈均出自此串,未经官方确认。 2

  10. 一手 HuggingFace: deepseek-ai/DeepSeek-V4.1-Flash。MIT 协议、权重分片、技术报告 PDF、推理参考代码。仓库元数据与协议核对见 IT 爆破手的核实记录

相关推荐
LXMXHJ1 小时前
springboot中的线程操作
java·spring boot·后端·线程
Sinclair1 小时前
MCP 功能详解:内置 108 个工具,让 AI 直接帮你管理网站
后端·mcp
用户233376852181 小时前
接口卡死排查实录-缺失return的UB死循环
前端·后端
用户489148799762 小时前
Go 系统服务开发实战:systemd+sdnotify + 看门狗-agent与系统服务
后端
拾光师2 小时前
Python 模式匹配:从 in 到正则再到 match-case,一招对一招
后端
只爱喝胡辣汤2 小时前
JUC 并发工具与线程安全源码深度解析
后端
只爱喝胡辣汤2 小时前
03-KafkaProducer 源码分析
后端
只爱喝胡辣汤2 小时前
13-KRaft 元数据管理与 Raft 协议源码分析
后端
只爱喝胡辣汤2 小时前
异步线程深度剖析(CompletableFuture/异步模式/虚拟线程)
后端