论文阅读——RetNet

transformer的问题:计算量大,占用内存大,不好部署。

所以大家在找能解决办法,既能和transformer表现一样好,又能在推理阶段计算复杂度很低。

这些方法大概分类三类:一是代替transformer非线性注意力机制的线性注意力,二是牺牲并行训练,但是推理效率高的循环模型,三是寻找一种其他机制代替注意力机制。但是都不成功。

RetNet整体结构:

X是每层的输入序列,LN是LayerNorm

MSR:multi-scale retention

RetNet是L个单独模块堆叠,每个模块包含MSR和FFN两部分。

考虑循环模型序列建模问题,可以表示为:

其中,Sn是隐层,Vn是输入。

By absorbing A into WQ and WK,把方程写为:

γ简化为标量:

retention layer定义为:

相关推荐
知几蜗牛几秒前
AI会找数据还不够,联合国开放平台把“来源”也接进Agent
人工智能
明月_清风几秒前
JEV 又有新玩法:当 AI Agent 开始拥有一个“决策层”
人工智能·后端·agent
老金带你玩AI几秒前
一个人创业后,我用豆包工作写了一本关于OPC的书
人工智能
犀利豆2 分钟前
AI 店长发誓不买 PS5,三周后它还进了一条活鱼
人工智能·llm·aigc
AlbertZein3 分钟前
Step 5 Preview 实测:和 DeepSeek V4 Pro、GLM5.3 同做一个 3D 游戏
人工智能·ai编程
10年前端老司机3 分钟前
面试被问 RAG 说不清楚?故事 + 代码带你吃透检索增强生成
人工智能·langchain·llm
知几蜗牛3 分钟前
医疗文档审核从几天缩到几小时,最该追问的不是模型多快
人工智能
知几蜗牛3 分钟前
Agent会话不是沙箱:微软这次把两个最容易混的隔离轴拆开了
人工智能
知几蜗牛3 分钟前
GGUF能在Transformers里直接跑了,本地模型终于不用二选一
人工智能