2026 年 9 月的大模型赛道堪称"神仙打架":Anthropic 发布 Claude Fable 5.1,OpenAI 押上十万卡训练 GPT-6 Astra,xAI 的 Grok 4.7 参数冲到 2.1 万亿。在一片"更大、更强"的军备竞赛中,DeepSeek 却在 9 月 10 日悄悄上线了一款把效率 当核心卖点的模型------V4.1-Flash。它没有疯狂堆参数,而是靠一套名为 Causal Encoder-Decoder(CED) 的架构创新,在编码类 Agent 场景下把 prefill 激活参数量从 13B 砍到 8B,全局 KV Cache 内存降到上一代的四分之一。这篇文章带你拆解它到底做了什么。
一、问题背景:prefill 正在吃掉 Agent 的算力账单
传统 Transformer 解码器在推理时分为两个阶段:prefill (并行处理输入 token,产出 KV Cache)和 decode(逐 token 自回归生成)。过去大家默认 prefill 计算量小、decode 才是瓶颈,所以服务商普遍让两者共享同一套模型权重。
但 Agentic 场景的出现彻底改变了这个格局。一个 Coding Agent 在单次任务中往往要反复读代码、看报错、翻文档,输入的 prompt token 数量可能是生成 token 的几十倍。prefill 的计算占比被急剧放大------你为"读入"花的钱,可能远高于"生成"本身。
DeepSeek 的判断是:既然生成比阅读更难,就应该把算力优先分配给 decode;既然 Agent 的 prefill 又长又频繁,那就想办法让它变得更便宜。
二、核心思路:把 40 层拆成"两个工种"
CED 架构的做法非常直观:把 V4.1-Flash 的 40 层网络拆成 20 层 Causal Encoder + 20 层 Decoder。
输入序列(长) 输出序列(逐 token)
│ ▲
▼ │
┌───────────────────┐ KV 投影 ┌───────────────────┐
│ 20 层 Causal │ ────────────▶ │ 20 层 Decoder │
│ Encoder(8B 激活)│ │(16B 全量激活) │
└───────────────────┘ └───────────────────┘
prefill 阶段 decode 阶段
```
关键在"投影"二字:**decoder 每一层的 KV 状态不是独立计算的,而是直接从 encoder 的输出投影而来**。这意味着:
1. **prefill 阶段只需跑 20 层 encoder**,每 token 激活约 8B 参数;而上一代 V4-Flash prefill 和 decode 都要激活 13B。对长输入而言,prefill 的理论计算量接近减半。
2. 2. **decode 阶段跑完整 40 层(16B 激活)**,把省下来的算力集中在最难的生成环节。
用公式直观表达,就是:
V4-Flash: prefill 激活 = 13B decode 激活 = 13B
V4.1-Flash: prefill 激活 = 8B decode 激活 = 16B
表面看 decode 变重了,但由于 KV 由 encoder 投影而来,decode 每层的注意力计算反而更省,整体在 Agent 场景下是"以小搏大"。
## 三、KV Cache 三连降:内存砍到四分之一
KV Cache 是长上下文推理的"内存黑洞"。V4.1-Flash 除了 CED 本身的投影机制天然压缩 KV 之外,还叠加了两项技术:
- **Compressed Sparse Attention 2(CSA-2)**:在注意力层之间共享 KV 条目,避免每层都存一份冗余。
- - **FP4 KV 缓存**:把 KV 条目用 FP4 低精度存储,单位 token 占用内存骤降。
三管齐下,官方数据显示 V4.1-Flash 的**全局 KV Cache 内存仅为 V4-Flash 的四分之一**。内存占用变低带来两个连锁收益:单位显存能装下更长上下文,缓存命中率提升;同时 KV 服务的内存成本显著下降------对按 token 计费的长上下文场景,这是实打实的成本利好。
## 四、代码视角:API 使用几乎零迁移成本
对开发者最友好的部分是:架构翻天覆地,API 却几乎不变。官方兼容 OpenAI 协议,调用方式和上一代一致:
```python
from openai import OpenAI
client = OpenAI(
base_url="https://api.deepseek.com/v1",
api_key="<your-key>",
)
resp = client.chat.completions.create(
model="deepseek-v4.1-flash",
messages=[
{"role": "system", "content": "你是资深代码评审专家。"},
{"role": "user", "content": "请审查下面这段代码的内存泄漏风险:\n" + code_snippet},
],
max_tokens=2048,
)
```
迁移成本近乎为零,而收益体现在账单上------如果你的工作负载是"读多写少"的 Agent 循环,同样的预算能跑出明显更多的轮次。
## 五、实践心得与选型建议
**适合场景**:Coding Agent、代码补全、长文档问答、多轮工具调用等 prefill 远多于 decode 的负载。Baseten 的评测指出,这类 agentic loop 正是 CED 收益最大的区域。
**需要注意**:如果你做的是短 prompt、长生成的写作类任务(比如让模型写一篇 2000 字文章),decode 占比高,V4.1-Flash 的 16B decode 未必比 V4-Flash 更划算。选型前先盘点自己的"读写比"。
**行业信号**:DeepSeek 这次没有选择"更大",而是选择"更聪明地分配算力"。当模型能力趋同、十万卡训练成为常态时,**推理效率就是新的护城河**。谁能用更少的显存跑更长的上下文、用更低的单价撑起 Agent 的疯狂轮询,谁就能在应用层赢得更大的市场。下一个被重估的,可能不只是架构,还有整个推理服务的定价逻辑。
## 技术标签
#DeepSeek #大模型推理 #CausalEncoderDecoder #KV Cache #Agent #架构优化 #效率优先 #2026前沿技术