27届大模型面试准备(三十六):注意力机制演进与 KV Cache 优化——从 MHA 到 MLA 的显存之战本篇是 A 系列第 36 篇(A12–A35 已覆盖 RAG、长上下文、VLM、高效推理、后训练、分布式训练、LoRA、量化、评测、MoE、推理时扩展、数据工程、位置编码、推理服务化、幻觉、蒸馏、安全、长文本推理、推理优化、多模态推理、RAG 进阶、解码策略、端侧部署、小模型蒸馏)。A29 讲了高效注意力(FlashAttention、稀疏、线性注意力),A30 讲了推理性能优化全栈。本文聚焦推理侧最贵的那块内存——KV Cache,从注意力机制的演进(MHA→MQA→GQA→MLA)一路讲到 KV Ca