不同架构模型KV Cache大小计算

MHA模型

kv cache采用BF16存储时,每个token KV cache大小:

layer_num * 2 * head_num * head_dim *2

第一个2是key和value两个张量,第二个2是BF16的dtype大小。

DeepSeek V3.1架构MLA

DeepSeek V3.1架构模型包括DeepSeek V3.1, Kimi-k2全系列,如Kimi-k2.6, k2-thinking等。

kv cache采用BF16存储时,每个token KV cache大小:

layer_num*(512+64)*2

例如DeepSeek V3.1:

61*(512+64)*2 = 68.625 K

Kimi-k2.5/Kimi-k2.6与DeepSeek层数都是61层,区别是MOE部分,因此kv cache容量相同。

DeepSeek V3.2架构MLA + topk indexer

DeepSeek V3.2架构模型包括DeepSeek V3.1,GLM5系列,如GLM5.1.

DeepSeek V3.2与V3.1的区别,除了增加了一个2048 topk的indexer模块,还采用了FP8量化,但是不是所有部分都进行了FP8量化,这使得kv cache计算稍微复杂了一些。当然V32也可以采用BF16存储,只是对推理decode能达到的batch不利。

每个token KV cache大小: layer_num * (656 + (128+4)) = layer_num *788

解释:

FP8量化按128分块,每个分块需要一个FP32的缩放系数,所以每个128对应128xFP8+1xFP32。

head_dim是512+64,512的部分采用FP8,大小是512(FP8) + 512/128*4,而64的部分BF16不量化。indexer部分128采用FP8,大小为128+4。

所以总大小为:512(FP8) + 512/128*4 + 64(BF16)*2 + (128+4)

DeepSeek V3.2的FP8 kv cache大小为:

61*(656 + (128+4)) = 46.942 K

GLM5/GLM5.1与DeepSeek V3.2除了MOE,还有模型层数变大,为78层。因此kv cache大小为

78*788 = 61464 = 60.023 k。

to do: 3:1混合attention,包括MHA+linear, MLA+linear

相关推荐
I Am a robert girl8 天前
STEPQuant:Delta-Rule 循环状态量化中,误差何时何地才真正致命
深度学习·模型部署·量化·kv cache·线性注意力·显存优化·循环状态
小马92610 天前
KV Cache 瘦身 437 倍:DeepSeek V4.1-Flash 的推理效率革命
大模型·moe·kv cache·deepseek·推理优化·ai基础设施
Together_CZ19 天前
DeepSeek-V4.1-Flash:Pushing the Limits of KV Cache Compression——推动 KV 缓存压缩的极限
缓存·llm·compression·kv cache·deepseek·v4.1-flash·推动 kv 缓存压缩的极限
晨欣1 个月前
LLM Architecture Gallery 是什么:新开源模型出来后,先对照架构再决定要不要部署
qwen·moe·gqa·kv cache·deepseek·mla·llm架构
weixin_440213291 个月前
大模型训练、微调、对齐、推理、量化、优化、数据集等
微调·数据集·sft·预训练·模型量化·gptq·kv cache
weixin_440213292 个月前
大模型推理核心原理:KV Cache、Prefill、Decode、TTFT、vLLM、算子
vllm·大模型推理·decode·kv cache·prefill·llm 部署
thesky1234562 个月前
27届大模型面试准备(三十六):注意力机制演进与 KV Cache 优化——从 MHA 到 MLA 的显存之战
大模型·注意力机制·mha·gqa·mqa·kv cache·mla
白拾2 个月前
【NeurIPS 2023】H2O:重型命中者预言机——大模型高效生成式推理的 KV Cache 驱逐策略|从大模型推理系统优化视角
大模型推理·高效推理·kv cache·稀疏注意力·h2o 论文分享·neurips 2023
thesky1234562 个月前
27届大模型面试准备(十九):模型量化全攻略——INT8/INT4、GPTQ、AWQ、SmoothQuant 与 KV Cache 量化
大模型·模型量化·gptq·awq·kv cache·smoothquant·int4
Token炼金师3 个月前
服务的骨架:网关、负载均衡、容灾、弹性与多机房 —— 推理系统架构五柱
人工智能·系统架构·llm·负载均衡·容灾·kv cache·prefix cache