Flash-Attention

这是一篇硬核的优化Transformer的工作。众所周知,Transformer模型的计算量和储存复杂度是 O ( N 2 ) O(N^2) O(N2) 。尽管先前有了大量的优化工作,比如LongFormer、Sparse Transformer、Reformer等等,一定程度上减轻了Transformer的资源消耗,但对Transformer的性能有所折损,且扩展性不强,不能泛化到其它领域、以及复杂结构的叠加。

这篇工作从底层对Transformer的计算和读写进行了优化,主要有三个贡献:

  1. 加速了模型计算:现在GPU的计算速度已经远远超过了内存读写速度,当GPU完成计算后,内存确还在读取数据,造成GPU闲置而内存繁忙读(消费者早就消费完了,生产者还在缓慢生产)的现象,也就是内存墙问题。FlashAttention通过tiling和算子融合计算,将复杂操作放到SRAM中计算,并减少从HBM读取次数,加快了模型计算速度。而之前的工作虽然减少了Transformer的计算复杂度,却并没有减少模型计算时间。
  2. 节省了显存:FlashAttention通过引入全局统计量,避免实例化大注意力矩阵,减少了显存占用。
  3. 精确注意力:FlashAttention从底层优化了Transformer的计算,但是任务指标上没有任何折损,与普通的Transformer结果是完全等价。

现代GPU内存分级


参考

相关推荐
xiaohe06012 小时前
🎮 豆包完胜 DeepSeek ?!零玩家竞技场,AI Agent 专属对弈!
游戏·llm·agent
DigitalOcean2 小时前
加了 1 个参数,GLM-5.3-Flash 便宜了 6.3 倍
llm
武子康2 小时前
图像生成为什么需要独立的 Gateway 抽象:参数、重试与幂等设计
人工智能·llm·agent
tachibana22 小时前
微调和 RAG 各自的优劣势是什么?
人工智能·ai·大模型·llm·agent
桃西西呀5 小时前
RAG 接个向量库就完事?从切块到重排的 7 步流水线,我替你踩了 8 个深坑
人工智能·llm·ai编程
momo6 小时前
LightRAG Query Pipeline 核心架构与源码设计分析报告(2)
llm·lightrag
SDWAN_Cheap7 小时前
CPU与GPU的区别及应用场景详解
cpu·gpu
Eloudy7 小时前
全文 - 第1部分 - NVIDIA Fabric Manager User Guide
gpu·fabric·超节点
Eloudy7 小时前
全文 - Scale-up fabrics
gpu·eda·超节点
得物技术8 小时前
得物小摊 AI Native 演进实录:用 Harness 构建可控 AI 交付
人工智能·架构·llm