论文阅读——RetNet

transformer的问题:计算量大,占用内存大,不好部署。

所以大家在找能解决办法,既能和transformer表现一样好,又能在推理阶段计算复杂度很低。

这些方法大概分类三类:一是代替transformer非线性注意力机制的线性注意力,二是牺牲并行训练,但是推理效率高的循环模型,三是寻找一种其他机制代替注意力机制。但是都不成功。

RetNet整体结构:

X是每层的输入序列,LN是LayerNorm

MSR:multi-scale retention

RetNet是L个单独模块堆叠,每个模块包含MSR和FFN两部分。

考虑循环模型序列建模问题,可以表示为:

其中,Sn是隐层,Vn是输入。

By absorbing A into WQ and WK,把方程写为:

γ简化为标量:

retention layer定义为:

相关推荐
IT_陈寒16 分钟前
为什么我的Vue组件总是莫名其妙重渲染?
前端·人工智能·后端
欧特克_Glodon1 小时前
OpenCV计算机视觉开发入门与实践<二十七>:图像分割概述
c++·人工智能·opencv·计算机视觉
lhldsg1 小时前
AI零售系统实战指南:从架构设计到落地部署全解析
java·人工智能·小程序·uni-app·零售
richard_first1 小时前
Transformer与大语言模型:第13章 Decoder
人工智能·机器学习
东坡肘子1 小时前
举手之劳 -- 肘子的 Swift 周报 #151
人工智能·swiftui·swift
Henry-SAP1 小时前
AI产业迎来标准化与商业化双突破
人工智能·云原生·sap·erp
火山引擎开发者社区1 小时前
Seed-Evolving再升级:更强多模态能力,更低幻觉
人工智能
港股研究社1 小时前
专注履约底座,顺丰同城在即时零售效率时代提升增长动能
大数据·人工智能
Warren2Lynch1 小时前
告别静态图片:利用 VPasCode AI 功能将 C4 模型图像一键转换为可编辑代码
人工智能
AI砖家2 小时前
Codex 客户端频繁提示「正在重连 / Reconnecting」的原因与完整解决方案
人工智能·chatgpt·ai编程·codex