大模型Transformer笔记:KV缓存

1 MHA(M ulti-H ead Attention)

  • 最经典的多头注意力
    • 等价于多个独立的单头注意力的拼接
  • 对于LLM来说,一般都是自回归地一个一个token的输出,也就相当于只有Transformer的decoder input在变化,之前作为prompt部分的是不变,可以缓存的(KV cache)
    • KV cache的减少可以让我们有更长的context prompt,更快的推理速度,更低的推理成本

2 MQA(M ulti-Q uery Attention)

Fast Transformer Decoding: One Write-Head is All You Need 2019

PaLM 6、StarCoder 7、Gemini 8

  • 所有注意力头共享同一套K,V
    • ------>KV 缓存减少到1/h
    • KV参数的减少可以到FFN/GLU规模的增大来弥补

3 GQA(G rouped-Q uery Attention)

GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints emnlp 2023

所有 Head 分为 g个组( g可以整除 head数量 h)

LLAMA2-70B , LLAMA3

参考内容:缓存与效果的极限拉扯:从MHA、MQA、GQA到MLA

相关推荐
I Promise345 分钟前
Fast‑BEV 完整实战教程(智驾工程视角)
深度学习·神经网络·目标检测·目标跟踪·自动驾驶
CarIise1 小时前
JavaScript进阶与轮播图实现 课堂笔记
开发语言·javascript·笔记
神经星星1 小时前
「TVM教程」理解 Relax 抽象层
人工智能·深度学习
薛定e的猫咪1 小时前
【大模型量化】使用 llama.cpp 完成量化、本地推理与服务化部署
人工智能·深度学习·算法·llama
Sherotree1 小时前
Agent 工程笔记①:工具调用失败时,先查哪三层
网络·数据库·笔记
薛定e的猫咪1 小时前
【源码解读版】ContraBAR:用 CPC 对比学习替代变分推断做贝叶斯元 RL
人工智能·深度学习·学习·算法·机器学习
现代野蛮人1 小时前
【深度学习实验】—— 基于 LSTM 的年度医疗费用回归预测
深度学习·回归·lstm
m0_547486661 小时前
《深度学习技术基础》全套PPT课件2026
人工智能·深度学习·powerpoint
征尘bjajmd1 小时前
黑马AI大模型机器学习课程笔记(个人记录、仅供参考)
人工智能·笔记·机器学习
蒸蒸yyyyzwd1 小时前
cpp选手备战秋招学习笔记day17
笔记·学习