gqa

thesky1234563 天前
大模型·注意力机制·mha·gqa·mqa·kv cache·mla
27届大模型面试准备(三十六):注意力机制演进与 KV Cache 优化——从 MHA 到 MLA 的显存之战本篇是 A 系列第 36 篇(A12–A35 已覆盖 RAG、长上下文、VLM、高效推理、后训练、分布式训练、LoRA、量化、评测、MoE、推理时扩展、数据工程、位置编码、推理服务化、幻觉、蒸馏、安全、长文本推理、推理优化、多模态推理、RAG 进阶、解码策略、端侧部署、小模型蒸馏)。A29 讲了高效注意力(FlashAttention、稀疏、线性注意力),A30 讲了推理性能优化全栈。本文聚焦推理侧最贵的那块内存——KV Cache,从注意力机制的演进(MHA→MQA→GQA→MLA)一路讲到 KV Ca
空巢青年_rui4 个月前
llm·attention·mha·gqa·dsa·mla·swa
【翻译】现代LLM中注意力变体的可视化指南:从MHA和GQA到MLA、稀疏注意力机制和混合架构原文地址:A Visual Guide to Attention Variants in Modern LLMs
一顿能吃五大海碗啊啊啊5 个月前
mha·gqa·mqa·kv cache
大模型推理加速 KV cache目录一、Attention 计算Attention 计算详解备注:1. Mask 的核心作用2. 两种主要的 Mask 类型
缘友一世10 个月前
人工智能·深度学习·缓存·transformer·llama·gqa·kv缓存
LLama 3分组查询注意力与KV缓存机制要理解分组查询注意力(Group Mulit-Query Attention,GQA) 的价值,我们首先要明白它解决了什么问题。这个问题主要源于 LLM 的自回归生成方式和多头注意力机制。
爱听歌的周童鞋1 年前
attention·gqa·deepseek·mla
DeepSeek MLA(Multi-Head Latent Attention)算法浅析学习 DeepSeek 中的 MLA 模块,究极缝合怪,东抄抄西抄抄,主要 copy 自苏神的文章,仅供自己参考😄
江小皮不皮2 年前
llm·transformer·llama·注意力机制·gqa·mhd·mqa
MHD、MQA、GQA注意力机制详解自回归解码器推理是 Transformer 模型的 一个严重瓶颈,因为在每个解码步骤中加 载解码器权重以及所有注意键和值会产生 内存带宽开销
代码讲故事2 年前
llama·llama2·注意力机制·解码器·感知器·gqa·变换器
Llama2模型的优化版本:Llama-2-OnnxLlama2模型的优化版本:Llama-2-Onnx。Llama-2-Onnx是Llama2模型的优化版本。Llama2模型由一堆解码器层组成。每个解码器层(或变换器块)由一个自注意层和一个前馈多层感知器构成。与经典的变换器相比,Llama模型在前馈层中使用了不同的投影大小。例如,Llama1和Llama2的投影都使用了2.7倍的隐藏大小,而不是标准的4倍隐藏大小。Llama1和Llama2之间的一个关键区别在于注意层的架构变化,Llama2利用了分组查询注意(GQA)机制来提高效率。
我是有底线的