论文阅读——RetNet

transformer的问题:计算量大,占用内存大,不好部署。

所以大家在找能解决办法,既能和transformer表现一样好,又能在推理阶段计算复杂度很低。

这些方法大概分类三类:一是代替transformer非线性注意力机制的线性注意力,二是牺牲并行训练,但是推理效率高的循环模型,三是寻找一种其他机制代替注意力机制。但是都不成功。

RetNet整体结构:

X是每层的输入序列,LN是LayerNorm

MSR:multi-scale retention

RetNet是L个单独模块堆叠,每个模块包含MSR和FFN两部分。

考虑循环模型序列建模问题,可以表示为:

其中,Sn是隐层,Vn是输入。

By absorbing A into WQ and WK,把方程写为:

γ简化为标量:

retention layer定义为:

相关推荐
古养摩登原始人9 分钟前
脑机接口合规最新发展:从政策到实践,构建安全可控的技术生态
人工智能·安全
JSCircuit9 分钟前
高校材料工艺实验室采购真空甲酸炉的深度分析与选型指南
人工智能·经验分享·ai写作
阿童木写作11 分钟前
跨境电商翻译工具推荐:批量图片翻译+视频字幕实时翻译
人工智能·python·音视频
晶捷软件13 分钟前
晶捷智能:集团型制造企业ERP如何实现多工厂统一管控
大数据·人工智能·python·制造
JiNan.YouQuan.Soft14 分钟前
数值计算引擎:计算固体力学
人工智能·算法·机器学习
QC777LX15 分钟前
成本会计如何用好AI?从月结流程中拆出6类可落地能力
人工智能
非凡ghost17 分钟前
AI修图不“造假“,摄影师的出片效率加速器
服务器·前端·人工智能·电脑
小岐AI观21 分钟前
智赋岐黄能否嵌入机构现有业务体系?
大数据·人工智能·四诊仪·智赋岐黄·中医ai
甲维斯24 分钟前
太尴尬了!Opus5把GPT6按在地上摩擦了!
人工智能
和裕25 分钟前
光伏储能定制加强型瓦楞纸箱:降低组件运输隐裂率与售后损耗的核心价值
大数据·运维·网络·人工智能·算法