
2023年以来,AI Agent规模化落地、超长文本交互、海量并发推理等场景全面爆发,彻底倒逼大语言模型底层架构进入高速迭代周期。很多开发者在模型部署、长文本推理、显存优化的实操过程中都会发现一个核心痛点,传统Transformer架构的算力与显存瓶颈,几乎全部集中在Attention注意力模块与对应的KVCache缓存机制上。
纵观大模型底层技术迭代全局,整体架构从初代Transformer Decoder的基础残差结构,迭代至Deepseek-V4的mHC混合架构。FFN前馈网络从单一MLP的稠密结构,升级为当前业界主流的稀疏MoE专家架构。而作为模型理解上下文、捕捉语义关联的核心,Attention模块的演进最为激进,完成了从经典MHA稠密注意力,到GQA分组注意力、MLA隐式注意力,再到DSA稀疏注意力、CSA压缩稀疏注意力、HCA混合压缩注意力的六代技术迭代。
所有架构迭代的核心逻辑始终没变,在不损失模型语义理解能力的前提下,持续压缩KVCache显存占用、降低注意力矩阵运算算力消耗、适配更长的上下文窗口与更高的推理并发。不同于公式化的理论讲解,本文将结合主流开源模型的落地实践,拆解每一代Attention架构的优化逻辑、算子细节、KVCache变化、优劣边界,串联起大模型注意力机制的完整进化图谱,帮开发者理清长文本推理优化的底层逻辑。
一、迭代原点:MHA架构奠定大模型Attention基础范式
当下所有新型Attention架构,都是对初代MHA(多头注意力)的优化与改造,MHA也是LLaMa1、LLaMa2、LLaMa3等经典开源基座模型的标配注意力结构,是大模型工业化落地的首个成熟范式。依托标准Transformer Decoder架构,MHA构建了完整的Token语义关联逻辑,也确立了KVCache缓存的基础规则,为后续所有迭代提供了底层框架。
我们以业界最常用的LLaMa2-7B模型为例,拆解MHA的完整算子流程与缓存逻辑,这是理解后续所有优化的前提。在模型推理过程中,隐藏态Hidden States输入Attention模块后,会通过三个独立线性层Linear-Q、Linear-K、Linear-V,分别映射得到Query、Key、Value三个特征矩阵,这是注意力计算的核心输入。
位置编码的适配是MHA的关键细节,模型会对Query和Key添加相对位置编码,以此捕捉文本的语序信息,而Value矩阵无需位置编码。具体维度上,LLaMa2-7B的Query、Key、Value维度完全统一,Shape均为B,32,S,128。其中B代表推理批次Batch,32为注意力头数量Head Num,S为文本序列长度Sequence Length,128为单头维度Head Dim。固定的维度配比,让MHA的计算逻辑极度规整,工程落地兼容性极强。
在大模型自回归推理场景中,整个流程分为Prefill首Token生成和Decode逐Token解码两个阶段,KVCache机制正是为优化Decode阶段而生。模型会缓存每一轮Token对应的Key与Value矩阵,后续新Token推理时直接复用历史缓存,避免重复计算,大幅提升推理速度。LLaMa2-7B的KVCache固定Shape为N,T,32,128,N对应总请求批次、T为上下文长度,缓存维度与注意力头维度完全对齐。
MHA架构最核心的特征,也是其后续被优化的最大短板,Q头、K头、V头的数量完全一致,均为32头。同时满足Head Num与Head Dim的乘积等于模型隐藏层维度,也就是32×128=4096,完美匹配LLaMa2-7B的Hidden Size。这种设计带来了极致的语义匹配精度,每个Query头都能独立匹配对应的KV头,全方位捕捉上下文关联,但代价极其明显,算力冗余、显存占用极高。
从算力消耗来看,MHA的计算量与注意力头数、序列长度平方成正比。在短文本场景下这种冗余可以忽略,但当上下文长度拓展至数万、数十万Token时,KV头全量计算、全量缓存的模式会让显存占用和算力开销呈爆炸式增长,这也是MHA无法适配超长文本推理的核心原因。可以说,MHA搭建了注意力机制的基础框架,却也埋下了大模型长文本落地的性能瓶颈,后续所有架构迭代,本质都是在修正MHA的冗余缺陷。
二、轻量化第一步:GQA分组注意力实现KV资源精简
针对MHA算力、显存双重冗余的问题,业界首先落地的优化方案是GQA(分组查询注意力),目前Qwen3系列等主流商用开源模型均采用该架构,是平衡精度与性能的经典过渡方案。GQA的核心优化逻辑非常直白,打破MHA中Q、KV头数量对等的固定范式,通过多头共享KV的方式,精简KV计算量与KVCache体积,同时通过分组设计规避MQA单头KV的精度损失。
以Qwen3-32B模型的GQA架构为实操案例,我们可以清晰看到迭代差异。相较于MHA,GQA做了三处关键结构调整,首先是头尾配比重构,模型Q头数量保留64头,保证语义查询的丰富度,而KV头数量缩减为8头,仅为Q头数量的八分之一,实现了KV资源的大幅精简。其次是前置归一化,在Q、K、V矩阵计算前,分别增加RMSNorm归一化操作,优化特征分布,弥补KV头减少带来的精度损耗。最后是维度解耦,Q头数量与单头维度的乘积,不再等于模型隐藏层维度,彻底跳出MHA的固定维度束缚,提升架构适配性。
KVCache的优化效果是GQA最核心的价值点。相较于同参数规模的MHA模型,GQA通过多头共享KV的机制,直接将需要缓存的KV数据量缩减数倍。Qwen3-32B的8个KV头可以覆盖64个Q头的查询需求,每个KV头由8个Q头共享,缓存空间无需按照Q头数量分配,仅需存储少量KV缓存,显存占用大幅降低。
这里需要厘清一个很多开发者容易误解的技术点,GQA精简的是KV缓存体量和KV计算开销,整体注意力总计算量并没有明显下降。核心原因在于,KV头采用共享机制,所有Q头的查询运算依然需要完整执行,查询阶段的矩阵乘算力消耗保持不变。简单来说,GQA的优化收益集中在显存占用、缓存读写速度、推理并发能力上,而非算力计算速度,这也是它的核心技术边界。
从落地场景来看,GQA是性价比极高的折中方案。相较于MHA,它以几乎可忽略的精度损失,换取了数倍的显存优化效果,适配绝大多数中长文本对话场景。相较于后续极致精简的架构,它的逻辑简单、稳定性强、工程适配成本极低。也正因如此,GQA至今仍是很多商用大模型的主力注意力架构,是MHA向高阶稀疏注意力迭代的关键过渡形态。
三、低秩重构:MLA隐式注意力实现KV缓存极致合并
如果说GQA是在MHA基础上做头尾配比的表层优化,那么Deepseek-V3、Deepseek-R1搭载的MLA(多头隐式注意力),就是对注意力算子的底层重构,通过低秩降维、矩阵合并、Partial RoPE等创新设计,将KV缓存与算子冗余压缩到极致,是稠密注意力架构的最优形态。
MLA架构彻底摒弃了传统MHA、GQA的稠密映射逻辑,在输入特征进入Linear-Q、Linear-K、Linear-V之前,新增低秩矩阵运算,对7168维的原始隐藏态特征进行降维处理,分别压缩至1536维与576维。低秩降维的核心作用是过滤特征冗余信息,保留核心语义特征,让后续注意力计算不再依赖高维稠密矩阵,从源头降低计算与缓存压力。
在位置编码层面,MLA创新采用Partial RoPE局部旋转位置编码,区别于传统架构对整个单头维度添加位置编码的方式,仅对单头维度中的64维数据施加位置编码,剩余维度保留原生特征。这种设计既保证了语序信息的有效捕捉,又避免了全量位置编码带来的特征扰动与计算冗余,进一步优化算子效率。
MLA最颠覆性的优化在KV缓存机制上,该架构最终将KV头数量精简为1头,实现了极致的MQA形态。单KV头的设计让KCache与VCache可以完全合并存储,无需区分多头缓存数据,KVCache的存储结构被极大简化,缓存体积相较于GQA再次大幅压缩,是稠密注意力架构中缓存效率最高的方案。
结合Deepseek-V3的源码逻辑来看,MLA可以通过矩阵合并、转置运算,在Prefill阶段兼容MHA计算逻辑,在Decode阶段退化为轻量化MQA逻辑,兼顾了训练精度与推理效率。但MLA同样存在明显短板,和GQA类似,其整体注意力计算量并未实现有效下降。虽然KV头精简为单头,但所有Q头需要共享唯一的KV头,查询阶段的矩阵运算依然全覆盖所有Token,算力开销没有明显优化,核心收益依旧集中在显存缓存层面。
综合来看,MLA完成了稠密注意力架构的终极优化,彻底榨干了传统全量注意力的显存优化空间。但受限于稠密计算的底层逻辑,它无法突破序列长度带来的算力瓶颈,当上下文长度突破10万Token后,全量Token匹配的算力消耗依然会成为推理瓶颈,这也推动注意力架构从稠密迭代正式走向稀疏迭代。
四、稀疏突破:DSA稀疏注意力精准削减长序列算力
前面三代架构MHA、GQA、MLA均属于全量稠密注意力,核心优化集中在KV缓存的显存精简,始终无法解决长序列场景下,Token全量匹配带来的算力爆炸问题。基于这一痛点,Deepseek-V3.2版本推出DSA(Deepseek稀疏注意力),新增Token稀疏筛选机制,首次从算力层面实现注意力计算的大幅精简,彻底突破长文本推理的算力瓶颈。
DSA架构是在MLA的基础上迭代优化而来,整体保留了MLA的低秩降维、Partial RoPE、单KV头核心设计,保证显存优化的基础优势,最大的改动是新增Lightning Indexer索引筛选模块,这也是DSA稀疏能力的核心来源。传统稠密注意力会让当前Token与上下文所有历史Token做注意力匹配,而Indexer模块可以精准计算当前Token与每一个历史Token的语义关联分数,自动筛选出相关性最高的2048个历史Token参与后续注意力计算。
这种稀疏筛选逻辑带来了质的性能提升,模型将原本全局上下文长度的全量注意力计算,压缩为固定2048Token的局部计算,算力消耗不再随上下文长度线性暴涨,完美适配160K超长上下文推理场景。同时这种筛选是基于语义相关性的智能筛选,区别于固定窗口的滑动窗口注意力,能够优先保留关键语义Token,最大程度避免稀疏裁剪带来的精度损失。
从KVCache维度来看,DSA出现了一次特殊的反向迭代。相较于MLA极致精简的缓存结构,DSA的KVCache数据量略有增加,核心原因是Indexer筛选模块需要独立缓存一套索引KV数据,用于计算Token相关性分数。虽然新增了少量缓存开销,但相比于算力数十倍的优化收益,这点显存增量完全可以忽略,属于典型的以极小显存代价换取极大算力收益。
结合源码实操逻辑来看,DSA的稀疏机制具备极强的工程实用性。在Prefill阶段,模型会完成全量Token的特征编码与缓存初始化,Indexer模块完成所有Token的相关性打分;在Decode阶段,逐Token推理时仅调用筛选后的2048个Token参与计算,大幅降低每一步解码的算力消耗。这种设计让Deepseek-V3.2在超长文档解析、长Agent任务执行场景中,推理速度远超前代稠密架构模型。
五、压缩协同:CSA架构实现算力与显存双向极致优化
DSA解决了长序列算力爆炸问题,但依然存在缓存冗余、筛选Token数量固定的短板,为进一步压缩显存开销、优化稀疏计算精度,Deepseek-V4-Flash版本推出CSA(压缩稀疏注意力)架构,融合滑动窗口、Token压缩、智能筛选三重机制,实现了算力与KVCache显存的双向极致优化,是当前工业界落地性最强的注意力架构之一。
CSA架构在DSA的基础上完成了全方位升级,整体结构分为Q计算模块、滑动窗口KV缓存模块、Indexer筛选模块、双向压缩模块四大核心部分。其中Q特征计算逻辑基本延续MLA、DSA的低秩降维设计,仅调整维度适配参数,保证模型语义提取能力的稳定性,核心优化全部集中在KV缓存与稀疏计算环节。
首先是滑动窗口缓存机制的引入,CSA摒弃了全量历史Token缓存的模式,默认仅保留最近128个Token的原始KVCache,通过固定短窗口缓存,彻底杜绝超长序列下缓存无限累积的问题,从源头控制显存占用。其次是Indexer模块的升级,保留语义相关性筛选逻辑的同时,新增Compressor压缩单元,将索引KV缓存的序列维度压缩至原来的四分之一,在不损失核心关联特征的前提下,大幅精简索引缓存体积。
最后是全局KV缓存的二次压缩优化,CSA通过独立的黄色Compressor模块,对窗口外的历史KV缓存统一做四倍压缩处理,压缩后的Token缓存由Indexer模块筛选出512个高关联度Token,参与最终的注意力计算。最终模型的注意力计算范围固定为128个最新原始Token加512个压缩关键Token,总计640个Token,相较于DSA的2048Token计算量,算力开销再次大幅降低。
CSA最大的突破是解决了DSA的显存冗余问题,通过滑动窗口+双向压缩的组合设计,其KVCache总体量相较于DSA实现了大幅缩减,同时算力计算范围进一步收敛。这种架构设计兼顾了短文本的实时性、长文本的稳定性与超高推理效率,完美适配AI Agent长任务、超长文档摘要、多轮超长对话等核心落地场景,是当前效率与精度平衡最优的架构方案。
六、极致压缩:HCA架构探索大模型注意力极限精简
在CSA的基础上,Deepseek-V4-Flash同步推出HCA(混合压缩注意力)架构,这是目前Attention迭代的最新形态,主打极致的KVCache压缩率,将显存精简能力推到行业极限。不同于CSA的稀疏筛选逻辑,HCA放弃了Token筛选机制,转而通过超高倍率的特征压缩,实现全量历史Token的轻量化计算,开辟了注意力优化的全新路径。
HCA与CSA的核心差异集中在压缩倍率与计算逻辑两大维度。在压缩倍率上,CSA采用四倍压缩比例,而HCA将压缩倍率提升至128倍,实现了128个历史Token的KV特征融合压缩为1个Token的极致精简效果,这让全局KVCache的显存占用直接降至历史最低水平。
在计算逻辑上,HCA彻底取消了Indexer模块的稀疏Token筛选机制,不再固定筛选少量高关联Token,所有历史Token都会参与注意力计算。只是所有历史Token的KV特征都经过128倍超高压缩,以轻量化融合特征的形式参与匹配,既保留了全局上下文的语义关联,不会丢失远距离Token的语义信息,又规避了全量原始Token计算的算力与显存开销。
需要重点厘清的是HCA的性能取舍逻辑,这也是很多开发者容易混淆的技术细节。相较于CSA,HCA的KVCache显存占用进一步大幅降低,是目前所有架构中显存效率最高的方案。但对应的,它的注意力计算量略有增加,因为其采用全局Token参与计算的逻辑,不再是稀疏局部计算,整体算力开销与MQA架构基本持平。
这种取舍让HCA拥有了独特的场景优势。对于需要全局上下文语义、不能裁剪任何历史Token的场景,比如超长代码解析、长篇论文逻辑梳理、法律文本全量校验等,CSA的稀疏筛选可能会丢失部分远距离弱关联语义,而HCA通过全局压缩计算,既能保留完整上下文信息,又能控制显存与算力开销,实现精度最大化。而对于常规对话、短文本生成场景,CSA的稀疏计算效率依然更优。
七、迭代内核复盘:六大Attention架构的进化逻辑与落地取舍
纵观MHA、GQA、MLA、DSA、CSA、HCA六代Attention架构的完整迭代路径,我们可以清晰梳理出大模型注意力机制的核心进化逻辑,所有优化都围绕长文本落地、高并发推理、显存算力平衡三大工程核心诉求展开,每一代架构的迭代都是一次精准的取舍与升级。
初代MHA是标准的稠密全量注意力,优势是语义精度最高、逻辑最简单、工程稳定性最强,短板是算力显存双重冗余,仅适配短文本场景,是所有迭代的基础底座。二代GQA通过分组共享KV,在几乎无损精度的前提下,大幅精简KVCache显存,优化并发推理能力,算力无明显损耗,是性价比最高的通用型架构。三代MLA通过低秩降维、单头KV合并,榨干稠密注意力的显存优化潜力,实现稠密架构的极致缓存效率,适配中长文本常规推理场景。
四代DSA首次引入稀疏计算思想,通过语义智能筛选Token,彻底解决长序列算力爆炸问题,以极小的显存增量换取极致算力优化,正式适配超长上下文场景。五代CSA融合滑动窗口、双向压缩、智能筛选三重机制,实现算力、显存双向优化,平衡精度与效率,是工业界落地场景最广的最优解。六代HCA以极致压缩替代稀疏筛选,保留全局上下文语义,牺牲部分算力效率换取极致显存精简与全局精度,适配高精度超长文本场景。
从KVCache的演进维度来看,整体变化路径呈现出清晰的规律,从MHA的全量多头缓存,到GQA的分组共享缓存,再到MLA的单头合并缓存,完成了稠密架构的缓存精简迭代。随后DSA新增索引缓存、小幅提升缓存体量,换取算力突破,最终通过CSA、HCA的多级压缩机制,实现缓存体量的断崖式下降,完美适配大模型超长上下文、高并发部署的核心需求。
从算力优化维度来看,迭代逻辑同样清晰,MHA、GQA、MLA三代稠密架构,优化重心集中在显存缓存,算力始终保持全量开销。DSA开启稀疏算力优化,大幅收敛计算范围,CSA进一步压缩计算量,HCA则切换优化思路,以全局压缩计算兼顾精度与算力,形成了完整的算力优化体系。
八、工程落地启示:Attention迭代背后的大模型技术趋势
Attention架构的六代迭代,不只是单一模块的技术升级,更折射出2023年以来大模型底层技术的核心发展趋势,彻底改变了大模型训练、推理、部署的工程逻辑,为后续AI Agent、超长文本大模型、端侧轻量化模型的发展指明了方向。
首先是模型优化重心从训练精度转向推理工程落地。早期大模型迭代以提升参数规模、优化训练精度为核心,MHA稠密注意力的设计优先保证训练效果。而随着模型落地场景普及,推理效率、显存占用、并发能力、上下文长度等工程指标成为核心痛点,后续GQA、MLA、DSA、CSA、HCA的所有优化,都是以落地效率为核心,在精度与性能之间寻找最优平衡点,这也是工业级大模型与实验室模型的核心差异。
其次是稀疏化、轻量化成为大模型底层架构的终极方向。传统稠密Transformer架构的性能天花板已经非常明显,参数规模、序列长度的增长必然带来算力显存的爆炸式增长。无论是DSA的Token稀疏筛选,还是CSA、HCA的特征压缩稀疏,本质都是跳出稠密计算的固有框架,用稀疏计算、特征压缩替代全量矩阵运算,这也是后续大模型突破超长上下文、低成本部署的核心路径。
最后是模块化、可定制化架构成为主流。从迭代过程可以看出,新一代Attention架构不再是固定的算子结构,而是由特征降维、位置编码、缓存管理、稀疏筛选、特征压缩等多个可插拔模块组成。开发者可以根据场景需求,自由组合滑动窗口、倍率压缩、全局筛选、局部计算等能力,比如常规对话场景选用CSA架构,高精度长文本场景选用HCA架构,通用场景选用GQA架构,实现场景化精准适配。
结语
从MHA的基础奠基,到GQA、MLA的稠密优化,再到DSA、CSA、HCA的稀疏革新,大模型Attention架构在短短数年完成了多次跨越式迭代。整个演进过程没有绝对最优的架构,只有最适配场景的方案,每一次迭代都是对算力、显存、精度三者平衡的重新定义。
当下AI Agent与超长文本应用仍在快速迭代,Attention架构的优化之路并未止步。Deepseek推出的mHC混合架构,正是基于CSA、HCA的融合升级,未来必然会出现更多兼顾全局语义、极致效率、超低显存占用的新型注意力机制。对于技术开发者而言,理清这一套完整的演进逻辑,不仅能掌握大模型推理优化的核心底层原理,更能精准适配不同场景的模型部署、调优、开发需求,真正实现大模型技术的高效落地与创新应用。