【NLP】MHA、MQA、GQA机制的区别

Note

  • LLama2的注意力机制使用了GQA。三种机制的图如下:

MHA机制(Multi-head Attention)

MHA(Multi-head Attention)是标准的多头注意力机制,包含h个Query、Key 和 Value 矩阵。所有注意力头的 Key 和 Value 矩阵权重不共享

MQA机制(Multi-Query Attention)

MQA(Multi-Query Attention,Fast Transformer Decoding: One Write-Head is All You Need)是多查询注意力的一种变体,也是用于自回归解码的一种注意力机制。与MHA不同的,MQA 让所有的头之间共享同一份 Key 和 Value 矩阵,每个头只单独保留了一份 Query 参数,从而大大减少 Key 和 Value 矩阵的参数量。

GQA机制(Grouped-Query Attention)

GQA(Grouped-Query Attention,GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints)是分组查询注意力,GQA将查询头分成G组,每个组共享一个Key 和 Value 矩阵。GQA-G是指具有G组的grouped-query attention。GQA-1具有单个组,因此具有单个Key 和 Value,等效于MQA。若GQA-H具有与头数相等的组,则其等效于MHA。GQA介于MHA和MQA之间。GQA机制,多头共用 KV Cache。

Reference

1 一文通透各种注意力:从多头注意力MHA到分组查询注意力GQA、多查询注意力MQA

2 Transformer系列:注意力机制的优化,MQA和GQA原理简述

3 Navigating the Attention Landscape: MHA, MQA, and GQA Decoded

相关推荐
AI你一生一世3 小时前
中国半导体破局:从底层架构到AI软硬协同的演进趋势
人工智能·大模型·算力·半导体·国产替代·ai芯片·软硬协同
程序猿编码5 小时前
扔掉 vLLM!从零构建 Qwen3-8B 推理引擎,C++/CUDA 实现性能追平 98%
大模型·qwen·推理
Raas1009 小时前
AI网关支持OpenAI吗?MAI Gateway(魔芋企业级AI网关)实战能力深度解读
网关·安全·大模型·ai网关·mai gateway·魔芋·企业级产品
Alice-YUE13 小时前
前端速通 Agent:5 个项目,一条学习路径
前端·大模型·ai agent·学习路径·deerflow
VIP_CQCRE16 小时前
用 Ace Data Cloud 快速接入 Gemini Chat Completion API:让多模型调用像 OpenAI 一样简单
大模型·api·gemini·ai开发·ace data cloud
艾莉丝努力练剑18 小时前
【AI大模型接入SDK】LLM会话管理模块设计
网络·c++·人工智能·学习·大模型
IT·陈寒1 天前
Redis 连接池泄漏害我加班到凌晨三点
人工智能·大模型·api·创业·变现·简历优化
海带紫菜菠萝汤1 天前
大模型本地部署踩坑实录:显存不足、依赖冲突、推理慢的完整排查
人工智能·ai·大模型
vibecoding772 天前
企业买国产模型怎么选(2026 年 9 月):先看备案,再算峰谷价、分档价与积分价,最后决定要不要多家并用
人工智能·大模型
霸道流氓气质2 天前
大模型微调工具实战:LLaMA-Factory 与 Unsloth Studio 完全指南
大模型