各种attention的变体:MHA,GQA,MQA,MLA(DeepSeek-V2)详解

参考文章:DeepSeek-V2:

Multi-Head Attention (MHA)示意图:

Grouped-Query Attention (GQA)

减小KV head的数量,多个Query head共用一个KV head

Multi-Query Attention (MQA)

只有一个KV head,多个Query head共用一个KVhead

Multi-head Latent Attention(MLA)示意图:

MLA在DeepSeek-V2论文中被提出,

在生成QKV时,先将向量都down projection到低维度。

对于KV head部分,都由一个共用的低维度向量表示来up pojection出来多个head

在推理时,KV cache只用保存这个低维度的向量,在计算时由up projection还原到多个head的高维空间,这样做的好处是减小了KV cache

原论文中画的MLA的示意图:

具体计算方式:

其中的W^UK可以和W^UQ合并,W^UV和W^O可以合并

相关推荐
中微极客9 小时前
AI Agent与TinyML边缘部署:OAuth 2.0集成实战
人工智能
是上好佳佳佳呀9 小时前
【机器学习|DAY01】机器学习概述
人工智能·机器学习
沉默王二9 小时前
又一个顶级 AI 终端诞生了!Kaku 开源,实测安装配置+分屏对决
人工智能·openai·claude
xcLeigh9 小时前
Doubao-Seed-Evolving大模型接入教程|搭建全品类提示词+AI工具导航网页
前端·人工智能·python·ai·html·ai开发·豆包
不如语冰9 小时前
AI大模型入门-模块导入import
数据结构·人工智能·pytorch·python
海兰9 小时前
【高速缓存】RedisVL 指南:从向量搜索到 AI 应用落地
人工智能·redis
智恒百亿9 小时前
RTX 5090服务器全场景技术解析:极致算力的行业落地与价值赋能
大数据·人工智能·5090服务器
金伟API10249 小时前
常见的SQL面试题:经典50例
数据库·人工智能·笔记·sql·学习
硅徒9 小时前
金融系统渗透测试复盘:从授权边界到报告整改的全流程
人工智能
学术小白人9 小时前
【倒计时4个月】-AI赋能图像处理与计算机视觉技术国际学术研讨会
网络·人工智能·神经网络·数据分析·光学