RNN 和 Transformer 复杂度比较

这里假设BatchSize为 1,就是单样本的情况。

原始 RNN 块:

(1)单步计算 H,包含两个矩阵向量乘法,和一个激活,复杂度HidSize²

(2)一共有SeqLen步,所以整体复杂度SeqLen * HidSize²

LSTM 块:

(1)单步计算 F I C_hat O,包含八个矩阵向量乘法,和四个激活:HidSize²

(2)单步计算 C,包含两个逐元素乘法,和一个加法;HidSize²

(3)单步计算 H,包含一个逐元素乘法和一个激活;HidSize²

(4)一共有SeqLen步,所以整体复杂度SeqLen * HidSize²

TF 块:

(1)计算 QKV,包含三个矩阵乘法,SeqLen * HidSize²

(2)计算注意力矩阵,包含 HeadCount 个 矩阵乘法,HeadCount * HeadSize * SeqLen²

由于HidSize = HeadCount * HeadSize,实际上是HidSize * SeqLen²

(3)Softmax 激活,HeadCount * SeqLen² << HidSize * SeqLen²

(4)计算 O,包含HeadCount个矩阵乘法,HeadCount * HeadSize * SeqLen² = HidSize * SeqLen²

(5)计算输出向量,包含一个矩阵乘法SeqLen * HidSize²

(6)FFN ,两个矩阵乘法,SeqLen * HidSize²

(6)整体复杂度,SeqLen * HidSize² + HidSize * SeqLen²

HidSize是每层之间传输的嵌入向量的维度,大概几百维。

聊天的时候SeqLen大概几十到一百,明显低于HidSize,这个时候二者是差不多的。

长文本翻译的时候SeqLen是几千,那么 RNN 明显比 Transformer 快。

等于说,Transformer 的高复杂度缺点被并行掩盖了。在单机单卡这种不能并行的环境,效率远不如 RNN。这就是很多人一定要搞线性注意力的原因。

相关推荐
星爷AG I几秒前
14-8 姿势控制:移动(AGI基础理论)
人工智能·agi
雪碧聊技术1 分钟前
AI时代的“炼金术士”:当“抽卡师”成为内容生产的新兴职业
人工智能·aigc·ai抽卡师
云飞云共享云桌面3 分钟前
SolidWorks云电脑如何多人共享访问?
运维·服务器·人工智能·3d·自动化·云计算·电脑
零千叶5 分钟前
养龙虾,本地部署OpenClaw
人工智能·macos·openclaw
吴佳浩 Alben7 分钟前
大模型垂直领域微调系列(二):ms-swift 框架全景
人工智能·语言模型·transformer
bst@微胖子10 分钟前
OpenCV 案例三【人脸比对】
人工智能·opencv·计算机视觉
米小虾10 分钟前
从理论到实践:构建生产级 AI Agent 的完整指南
人工智能
chaors11 分钟前
Langchain入门到精通0x07:基于Web网页的RAG实战
人工智能·langchain·ai编程
KG_LLM图谱增强大模型11 分钟前
OpenClaw官方解密:开源AI Agent 智能体平台的蜕变之路
人工智能·开源