技术栈
mqa
Briwisdom
6 天前
llm
·
attention
·
mha
·
mqa
·
flash attention
Attention 优化全景:FlashAttention 的加速魔法与 MHA/GQA/MLA 的结构演进
副标题: Attention 的优化有两个正交方向——FlashAttention 用 Tiling + Online Softmax 省掉了 O(N²) 的中间矩阵;MHA→GQA→MLA 通过减少 KV Head 数量压缩了 KV Cache。两者叠加,才是现代推理引擎的全貌。
一顿能吃五大海碗啊啊啊
4 个月前
mha
·
gqa
·
mqa
·
kv cache
大模型推理加速 KV cache
目录一、Attention 计算Attention 计算详解备注:1. Mask 的核心作用2. 两种主要的 Mask 类型
江小皮不皮
2 年前
llm
·
transformer
·
llama
·
注意力机制
·
gqa
·
mhd
·
mqa
MHD、MQA、GQA注意力机制详解
自回归解码器推理是 Transformer 模型的 一个严重瓶颈,因为在每个解码步骤中加 载解码器权重以及所有注意键和值会产生 内存带宽开销
我是有底线的