DeepSeek Flash 降价的技术账本:缓存友好型定价如何改写推理成本结构

9 月 10 日,DeepSeek 正式下调 Flash 系列 API 价格。从调价幅度分布看,这不是一次简单的卷价格,而是针对推理架构的精准手术。

降了什么: 涉及 deepseek-v4-flash 和 deepseek-vision-exp。输入缓存命中从 0.05 元/百万 token 降至 0.02 元,降幅 60%;缓存未命中降 33%;输出从 4.5 元降至 4 元,仅降 11%。三档差异悬殊------缓存命中是主战场。

为什么缓存命中降得最狠: MoE 架构下每次推理仅激活部分专家子网络,计算量远低于稠密模型。KV cache 命中时,模型跳过 prefill 阶段的大量计算,直接复用已缓存的键值对,成本进一步骤降。此前 0.05 元的定价并未充分反映这一优势------降到 0.02 元,是把 MoE + Cache 的架构红利让渡给开发者,换取更高缓存复用率。

输出为什么只降 11%: 自回归生成每个 token 必须逐步推理,无法像 prefill 那样批量并行,算力成本刚性较强。11% 是跟随市场的对称动作,而非架构红利的外溢。

V4.1-Flash 的位置: 已升级至 V4.1 架构,是新一代模型族中参数量最小但吞吐最高的成员。原生多模态视觉理解替代了独立的 Vision Exp 模型,支持 Responses API 工具调用,基准性能超过 V4 Pro。用最小模型打最强性价比------这是大模型竞赛之外的第二条路线。

对开发者的影响: system prompt 固定的 Agent、RAG 等高重复前缀场景,缓存命中率可达 70-90%,输入成本直降至原来的 40%。日均 1000 万输入 token 的中型 Agent,月成本从约 1500 元降至 600 元级别。

行业信号: 此前 R1 系列的分时定价推动了批处理负载向低谷迁移。此次缓存友好型定价,本质是用价格信号重塑 prompt 工程习惯------写好 system prompt、设计好缓存边界,就能拿到市场最低推理单价。

价格战的尽头是成本结构透明化。这一步,把"模型有多便宜"的竞争推向了"架构有多高效"的维度。

相关推荐
hweiyu005 小时前
Redis命令:HPERSIST
redis·缓存
hweiyu005 小时前
Redis命令:HPEXPIRE
redis·缓存
starzy19908 小时前
Flink 优化之网络缓存优化及参数详解:从数据传输机制到反压原理的生产调优指南
网络·缓存·flink
ShineWinsu9 小时前
对于Redis:string类型的解析
java·c++·redis·分布式·缓存·面试·string
CoLiuRs11 小时前
电商价格是怎样算出来的
数据库·redis·缓存
蜗牛互联网16 小时前
HSTU在Dynamo-Triton中的AOTI与KV缓存验收方法
java·人工智能·后端·缓存
hweiyu001 天前
Redis命令:HMGET
redis·缓存
陕西企来客1 天前
豆包检索层 9 月迭代后信源陈旧的核心 —— 缓存策略的可用性优先转向
缓存
三掌柜6662 天前
ArkWeb 手记 07|缓存和离线页怎么做
缓存·harmonyos
wefg12 天前
【Redis】初识 Redis
数据库·redis·缓存