DeepSeek 最新发布的 DeepSeek-V4.1-Flash 现已上线 DigitalOcean AI 推理平台 ,开发者可以直接通过 DigitalOcean 无服务器推理(Serverless Inference)调用,无需自己部署和维护 GPU 推理集群。
这次的 V4.1 Flash 有点不一样。
它并没有继续简单地追求"参数越大越好",而是采用了 DeepSeek 新一代 Causal Encoder-Decoder(因果编码器-解码器)架构 :模型总参数达到 5520 亿 ,但处理输入时只激活约 80 亿参数 ,生成输出时激活约 160 亿参数。
更值得关注的是,在 DeepSeek 自己公布的测试中,这个"Flash"版本在不少 Agent 和 Coding Benchmark 上,反而超过了参数规模更大的 DeepSeek-V4-Pro。
与此同时,它还支持 100 万 Token 上下文、原生图像输入,以及更精细的 Reasoning Effort 调节,并大幅压缩了 KV Cache 占用。
对于正在做 AI Coding、Agent、长文档处理或者视觉 Agent 的团队来说,DeepSeek-V4.1-Flash 更像是在尝试解决一个越来越现实的问题:
能不能不靠持续增加单 Token 的计算量,也把 Agent 能力继续往上推?
而在 DigitalOcean 上,这款模型也不必单独使用。开发者可以通过同一套 API 接入平台上的多款模型 ,并把 DeepSeek-V4.1-Flash 加入 Inference Router,根据成本、延迟和任务类型,在 DeepSeek、Claude、GPT、Qwen、Kimi、GLM 等模型之间进行路由。 Inference Router(推理路由)目前是免费面向所有 DigitalOcean 用户的,具体使用方法可咨询 DigitalOcean 中国区战略合作伙伴卓普云(aidroplet.com)。
5520 亿参数,输入却只激活 80 亿
DeepSeek-V4.1-Flash 是一款 552B,也就是 5520 亿参数的 MoE 模型。
但比较特别的是,它采用了新的 Causal Encoder-Decoder 架构,把"理解输入"和"生成输出"两个阶段需要的计算量做成了不对称设计:
- 输入阶段:约 8B(80 亿)激活参数
- 输出阶段:约 16B(160 亿)激活参数
这和很多传统 Decoder-only 大模型有一个明显区别。
对于大模型推理来说,读取一大段 Prompt 和逐 Token 生成答案,其实是两种不同的计算过程。特别是在 Coding Agent、RAG 和长文档应用里,输入往往非常长,而最终输出可能没有那么长。
如果处理输入时仍然使用和输出阶段相同规模的计算,就可能造成大量不必要的算力开销。
DeepSeek-V4.1-Flash 的思路是:
输入阶段尽量用更低的计算成本理解上下文,真正生成答案时再使用更多专家参数。
这也是为什么"5520 亿总参数,但输入只激活 80 亿"并不意味着它是一款普通的 8B 模型。
5520 亿参数决定了模型整体的容量,而 8B / 16B 则代表每个阶段实际参与计算的参数规模。
这类设计的价值,主要在于把模型容量 和单 Token 计算成本尽可能拆开。
对于高频 Agent 工作负载来说,这一点尤其重要。
KV Cache 更小,缓存读取低至每百万 Token 0.006 美元
DeepSeek-V4.1-Flash 另一个很值得关注的变化,是 KV Cache。
与上一代 DeepSeek-V4-Flash 相比,V4.1 Flash 的全局 KV Cache 大约只需要:
1/4 的 HBM 显存空间,以及 1/8 的 SSD 存储空间。
这对于 Agent 场景尤其重要。
一个 Coding Agent 在执行任务时,往往会反复携带:
- System Prompt
- 项目说明
- 代码文件
- Tool Calling 历史
- Terminal 输出
- 测试结果
- 前面几十轮对话
如果这些内容每一轮都重新计算,不仅会增加延迟,也会快速推高 Token 成本。
Prompt Cache 的作用就是复用已经计算过的上下文。
而 DeepSeek-V4.1-Flash 本身又进一步压缩了 KV Cache 占用,所以它从模型架构层面就在针对长上下文和 Agent 工作流做优化。
目前在 DigitalOcean 无服务器推理中,DeepSeek-V4.1-Flash 的 Standard 模式价格为:
| 类型 | 价格 / 百万 Token |
|---|---|
| 输入 | 0.30 美元 |
| 输出 | 1.20 美元 |
| Cache read | 0.006 美元 |
其中 Cache read 的价格只有普通输入 Token 的 2%。
换句话说,如果一段重复上下文能够命中缓存,这部分 Token 的读取成本相比普通输入可以降低约 98%。
对于一个会持续读取相同 System Prompt、代码库、工具定义和历史上下文的 Agent 来说,这个差距会非常明显。
所以 V4.1 Flash 的 KV Cache 优化,并不只是一个底层技术指标。
它最终会直接影响:
显存占用、推理吞吐、缓存成本,以及长周期 Agent 的整体运行费用。
Flash 版本,Agent 跑分反而超过 V4 Pro
名字里虽然带着"Flash",但 DeepSeek-V4.1-Flash 并不是简单做了一个缩水版模型。
根据 DeepSeek 公布的测试结果,有两个数据特别值得关注:
| Benchmark | DeepSeek-V4.1-Flash | DeepSeek-V4-Pro |
|---|---|---|
| Terminal-Bench 2.1 | 90.6 | 87.9 |
| DeepSWE v1.1 | 74.2 | 62.7 |
其中 Terminal-Bench 2.1 更偏向测试模型在真实终端环境中执行任务的能力,而 DeepSWE v1.1 更接近真实的软件工程 Agent 场景。
也就是说,至少按照 DeepSeek 自己公布的 Benchmark,V4.1 Flash 在这两项测试上都已经超过了规模更大的 V4 Pro。
这个结果其实比"又出了一个更大的模型"更有意思。
因为它说明模型能力提升并不一定只能靠:
更多参数 → 每个 Token 做更多计算 → 更高推理成本。
新的模型架构、预训练方式以及后训练,同样有机会让一个每 Token 激活参数明显更少的模型,获得更好的 Agent 能力。
当然,Benchmark 依然不能直接等同于真实生产环境。
不同 Coding Agent、System Prompt、工具定义、代码仓库和推理参数,都可能影响最终表现。
但至少从目前的数据来看,V4.1 Flash 的定位已经很清楚:
它不是为了便宜而牺牲能力,而是在推理效率和 Agent 能力之间重新做了一次平衡。
100 万 Token,可以一次放进更大的代码库
DeepSeek-V4.1-Flash 支持最高 100 万 Token 上下文窗口。
对于普通聊天来说,这个数字可能意义不大。
但对于 Coding Agent 和长周期 Agent,情况完全不同。
一个真实的软件工程任务里,模型可能需要同时理解:
- 大量代码文件
- README 和技术文档
- API 定义
- 数据库 Schema
- Git Diff
- 单元测试
- 编译日志
- Terminal 输出
- 多轮工具调用历史
上下文不够时,就只能不断做摘要、裁剪或者重新检索。
这些操作当然可以解决问题,但也容易把某些关键细节提前丢掉。
100 万 Token 上下文则给 Agent 留出了更大的余量,让它在一次任务中持续保留更多代码和工作状态。
类似的优势也适用于:
- 大型合同分析
- 科研材料处理
- 企业知识库
- 大型技术文档
- 复杂日志分析
- 长周期 Agent 工作流
当然,这并不意味着"上下文越长越好"。
把几十万甚至上百万 Token 全部塞进模型,同样会增加延迟和推理费用。
真正有价值的是:
当任务确实需要完整上下文时,模型不会因为窗口不够而成为瓶颈。
DeepSeek V4.1 Flash 也开始原生"看图"了
V4.1 Flash 还具备原生多模态输入能力。
它可以在一次请求中同时处理:
文本和图片。
这对于 Agent 的意义,可能比普通的"图片问答"更大。
例如 Coding Agent 可以直接查看:
- 网页运行截图
- UI 界面
- 错误弹窗
- 数据图表
- PDF 页面
- 产品设计稿
模型不再只能通过文字描述猜测软件运行成了什么样,而是可以直接读取视觉结果,再决定下一步操作。
这也是现在很多 Agent 正在发生的变化:
从"调用工具",逐渐走向"调用工具 → 查看结果 → 根据结果继续行动"。
对于 Browser Agent、Computer Use、文档理解和视觉自动化来说,原生多模态会越来越重要。
不只是 DeepSeek,一个 API 可以接入多个模型
DeepSeek-V4.1-Flash 目前已经可以通过 DigitalOcean Serverless Inference 直接使用。
开发者不需要自己准备 GPU,也不用部署推理框架或者维护模型权重,通过 API 即可调用。
但 DigitalOcean 在这里更值得关注的地方,并不只是"又多上架了一款 DeepSeek"。
它支持通过同一套 API 接入多个模型,包括 DeepSeek、Claude、GPT、Qwen、Kimi、GLM、Llama 等不同模型系列。
这意味着,同一个 AI 应用并不需要被绑定在 DeepSeek-V4.1-Flash 上。
比如一个 Coding Agent 可以这样分:
简单分类、意图识别 → 使用更轻量的模型
日常代码分析 → DeepSeek-V4.1-Flash
超复杂推理 → 更强的旗舰模型
视觉分析 → 选择更适合当前任务的多模态模型
这些模型可以通过同一套推理接口调用,不需要为了测试不同模型分别维护多套 SDK、API Key 和业务代码。
这对于现在的 Agent 应用会越来越重要。
因为真正合理的成本优化,往往不是找到一个模型然后"所有任务都用它",而是:
不同难度的任务,用不同模型处理。
立即体验 DeepSeek-V4.1-Flash
DeepSeek-V4.1-Flash 现已通过 DigitalOcean Serverless Inference 上线。
对于开发者来说,这次更新比较值得关注的不只是"DeepSeek 又发了一款模型"。
V4.1 Flash 展示的是另一条越来越清晰的路线:
不再单纯依赖更大的单 Token 计算量换能力,而是通过新的模型架构、更低的激活参数、更小的 KV Cache 和更灵活的推理控制,把 Agent 能力和推理效率同时往前推。
对于正在做 AI Coding、Agent、视觉理解或者长上下文应用的团队,它值得拿真实业务跑一轮。
而通过 DigitalOcean AI 推理平台,也可以直接把 DeepSeek-V4.1-Flash 加入现有的多模型架构,通过同一个 API 接入多个模型,再利用 Inference Router 根据任务复杂度、成本和延迟选择更合适的模型,而不需要从一开始就把整个产品绑定在单一模型上。
DigitalOcean 中国区企业用户如果需要测试 DeepSeek-V4.1-Flash、评估不同模型的实际效果,或者规划 Serverless Inference、Inference Router 与多模型架构,也可以联系 DigitalOcean 中国区战略合作伙伴 卓普云 AI Droplet 获取中文技术支持。