9月10日,DeepSeek 发布了 V4.1 Flash。官方口径是"全新模型结构系列中尺寸最小的一款",但这句话本身带有很强的迷惑性。552B 参数的 MoE 模型,说"小"显然不是指参数量本身,而是指它在新的架构家族中的定位------以最小的激活成本,支撑最大的能力覆盖。
对于一线开发者和技术决策者而言,真正值得关注的不是"又发了一个模型",而是这次发布背后的架构选择:Causal Encoder-Decoder 的不对称设计、KV Cache 的大幅压缩、以及紧随其后的 API 价格调整。这三者环环相扣,指向的是同一个目标:让 Agent 场景下的高频推理变得真正可负担。
一、不对称架构:输入 8B 激活,输出 16B 激活
V4.1 Flash 最核心的架构变化,是采用了全新的 Causal Encoder-Decoder(CED)结构,且输入和输出不对称。具体来说,输入侧仅激活 8B 参数,输出侧激活 16B 参数。
这个设计的直觉是:输入理解相对"便宜",输出生成相对"昂贵" 。对于 Agent 场景而言,大量调用发生在"读上下文、做判断、选工具"的环节,真正的长文本生成占比并不高。把输入侧的激活压到 8B,意味着在同样的硬件上,可以并行处理更多的请求,或者在缓存命中时以更低的算力成本完成前向推理。
从技术报告披露的组件来看,CED 结构并非孤立存在。它配套了 Compressed Sparse Attention 2(CSA2) 和 Cross-Layer KV and Index Reuse 等机制。换句话说,输入侧的稀疏化不仅体现在参数激活上,也体现在注意力计算和 KV 索引的复用上。这是一套系统性的"输入端降本"方案,而非单纯的 MoE 路由调参。
二、KV Cache 压缩:HBM 降至 1/4,SSD 降至 1/8
如果说 CED 是"算得省",那么 KV Cache 的压缩就是"存得省"。根据官方数据,V4.1 Flash 相比上一代 V4 Flash,每 token 的全局 KV Cache 大小降低了约 4 倍 (HBM 需求降至 1/4),相比 V1 则降低了 437 倍。SSD 存储需求降至上一代的 1/8。
这个数字对 Agent 应用的成本结构有直接影响。在长上下文、多轮工具调用的场景中,缓存命中(cache hit)的费用往往占据总成本的很大比例。DeepSeek 官方在 API 文档中明确提到:"Cache-hit charges often account for a large share of agent costs"。KV Cache 的体积越小,意味着同样大小的 HBM 或 SSD 可以缓存更多的历史上下文,缓存命中率提升,单次调用的边际成本随之下降。
技术报告中提到的 FP4 Main KV Cache 和 Persistent KV Cache Management 是支撑这一压缩比的关键组件。FP4 量化本身不是新概念,但将其应用于主 KV Cache 并配合持久化管理策略,说明 DeepSeek 在推理系统层面做了相当深的工程优化,而非仅仅在训练侧堆算力。
三、API 价格调整:缓存命中降 60%,峰谷差价继续拉大
架构优化的结果直接体现在定价上。V4.1 Flash 上线后,DeepSeek 同步调整了 API 价格:
| 计费项 | 高峰时段 | 闲时时段 |
|---|---|---|
| 输入(缓存命中) | 0.04 元/百万 tokens | 0.02 元/百万 tokens |
| 输入(缓存未命中) | 2.0 元/百万 tokens | 1.0 元/百万 tokens |
| 输出 | 8.0 元/百万 tokens | 4.0 元/百万 tokens |
对比此前价格,缓存命中的输入价格降幅达到 60%。闲时价格依然是高峰时段的一半,高峰时段定义为工作日 9:00-12:00 和 14:00-18:00,其余时间(含周末)均为闲时。
这个定价结构传递的信号很清晰:鼓励缓存复用,鼓励任务调度。对于可以容忍一定延迟的批处理任务、离线 Agent 工作流,把执行时间挪到闲时,成本可以直接减半。而对于高频短请求的在线 Agent,缓存命中价格的下降带来的收益最为直接。
四、兼容性与迁移:旧模型名自动路由
对于已经在使用 DeepSeek API 的团队,迁移成本几乎为零。官方说明如下:
-
将模型名称设为
deepseek-flash即可调用 V4.1 Flash; -
旧模型名
deepseek-v4-flash和deepseek-v4-flash-vision-exp将暂时路由到 V4.1 Flash; -
2026 年 9 月 14 日 12:00 起,
deepseek-v4-pro的请求也将路由到 V4.1 Flash,并按 V4.1 Flash 单价计费,直至 V4.1 Pro 上线。
这意味着现有的集成代码不需要任何修改,只要没有硬编码模型版本号,就会自动切换到新模型。对于依赖 deepseek-v4-pro 的团队,需要注意计费基准的变化,但短期内不需要做接口层面的调整。
五、对开发者的实际影响
从工程视角看,V4.1 Flash 的三个变化值得纳入技术选型评估:
第一,Agent 场景的成本基准线被重置。 缓存命中输入 0.02 元/百万 tokens 的闲时价格,意味着一个高频调用、上下文高度复用的 Agent,单次推理的输入成本可以压到极低水平。这对于构建"常驻型" Agent(如持续监控、定时巡检、长期对话记忆)是实质性利好。
第二,KV Cache 压缩比是比参数量更值得关注的指标。 552B MoE 的参数量听起来很大,但 1/4 的 HBM 需求和 1/8 的 SSD 需求,决定了它在实际部署中的并发能力和长上下文成本。对于自部署场景,这个数字直接关系到单卡能跑多少并发、长上下文能撑多长。
第三,不对称架构可能成为后续模型的默认范式。 输入侧轻量化、输出侧保留能力的思路,在 Agent 场景中具有普适性。如果 V4.1 Pro 延续这一设计哲学,那么围绕"输入理解"和"输出生成"做差异化优化的推理框架,会获得更大的调优空间。
DeepSeek V4.1 Flash 的发布,没有追求参数规模的数字游戏,而是把重心放在了"每 token 的真实成本"上。CED 架构、KV Cache 压缩、价格调整,三者共同指向一个判断:Agent 时代的竞争,不再是单次对话的质量比拼,而是在高频、长上下文、多轮调用的真实负载下,谁能把边际成本降到足够低。从这个角度看,V4.1 Flash 是一份相当务实的答卷。