一、官方公告:V4.1 Flash 明天前后发布

DeepSeek 开放平台「用量信息」页面已挂出通知,原文如下:
DeepSeek 计划于北京时间 2026 年 9 月 10 日前后正式发布 V4.1 Flash 模型。经内部、外部多方测试,V4.1 Flash 在性能、费用、速度、总用时等各项指标上已全面超越 V4 Pro。秉持着对用户负责的态度,在 V4.1 Flash 正式上线之后、V4.1 Pro上线之前,我们会将对 V4 Pro 的请求全部路由到 V4.1 Flash,并按 V4.1 Flash 单价计费。如您在 V4 Pro 和 V4.1 Flash 的对比测试中发现任何问题,请及时向我们反馈,感谢您的支持!
翻译成人话:过渡期内,你还调着 Pro,跑的是 Flash,付的也是 Flash 的钱。
2点直接影响:
- 成本自动下降:路由发生在服务端,代码不用改,但是更便宜
- 响应可能变样:底层模型换了,输出风格与细节颗粒度建议做一次回归
二、同时生效:Flash 全线降价,缓存命中砍 60%

北京时间 9 月 10 日中午 12 点起,Flash 系列调价:
| 项目(元/百万 tokens,闲时) | 涨价前 | 现在 | 9/10 12:00 起 | 对比现价 |
|---|---|---|---|---|
| 输入·缓存命中 | 0.02 | 0.05 | 0.02 | -60% |
| 输入·缓存未命中 | 1.00 | 1.50 | 1.00 | -33% |
| 输出 | 2.00 | 4.50 | 4.00 | -11% |
高峰时段(周一至周五 9:00--12:00、14:00--18:00)价格为闲时的 2 倍,缓存命中高峰同步降到 0.04 元。
注意时间线:8 月中旬刚涨价,三周后就降了回来。缓存命中和未命中输入都已回到涨价前水平,但输出还停在 4 元,涨价前是 2 元------没降特别多。
实际能省多少取决于调用结构:长对话、Agent 反复携带相同上下文的,缓存命中是大头,这波很划算;以生成为主的任务,开销集中在输出,只降约 11%,体感有限,但好过没有。
三、那个"0910"到期的模型名是什么

比降价更早的信号,是 9 月 8 日下午 DeepSeek 在官方交流群开启的 V4.1 Flash 中间版本内测。
调用方式很"临时":base_url 不变,只把模型名改成:deepseek-v4.1-flash-expires-on-0910
后缀已经说明------这是个 9 月 10 日到期的临时测试端点 ,计费与 deepseek-v4-flash 相同,每账号限 20 路并发。
官方对内测版的描述是:新的模型结构、原生多模态、能力更强、速度更快、成本更低。有网友实测输出能跑出 350 tokens/s 以上。
四、从"外挂 Vision"到"原生多模态"
这是本次更新最值得关注的技术变化。
8 月 21 日上线的 DeepSeek-V4-Flash-Vision-Exp,本质还是"外挂"------API 里 deepseek-v4-flash 和 deepseek-v4-flash-vision-exp 是两个独立模型,前者不能读图。
而 V4.1 Flash 用的是"原生多模态支持"这个词。如果正式版延续这一设计,意味着视觉能力被整合进基础模型,不再是单开一个实验分支------这是两条技术路线,不是一个版本的迭代。
不过目前技术报告、参数规模、架构细节、benchmark 一个都没公布,"新架构新在哪"仍是这次内测留下的最大悬念。
五、为什么刚涨价又降价了?
官方口径是模型迭代、成本下降。但也有更现实的因素------同期竞品动作很密:
- DeepSeek 8 月涨价没多久,GLM 放出 GLM-5.3-Flash,能力追平顶级模型,价格还更便宜
- 腾讯混元发布 HY4 后,目前在 WorkBuddy 限免
大模型现在几乎没有护城河,基本上是谁便宜用哪家,我个人预估 DeepSeek 这一个月损失的用户非常多,价格上涨体感非常大,很多身边朋友原来用 DeepSeek 的,涨价之后,都直接订阅 ChatGPT 了,这下 DeepSeek 估计慌了吧。
欢迎大家关注我的公众号:深入浅出AI
