论文阅读——RetNet

transformer的问题:计算量大,占用内存大,不好部署。

所以大家在找能解决办法,既能和transformer表现一样好,又能在推理阶段计算复杂度很低。

这些方法大概分类三类:一是代替transformer非线性注意力机制的线性注意力,二是牺牲并行训练,但是推理效率高的循环模型,三是寻找一种其他机制代替注意力机制。但是都不成功。

RetNet整体结构:

X是每层的输入序列,LN是LayerNorm

MSR:multi-scale retention

RetNet是L个单独模块堆叠,每个模块包含MSR和FFN两部分。

考虑循环模型序列建模问题,可以表示为:

其中,Sn是隐层,Vn是输入。

By absorbing A into WQ and WK,把方程写为:

γ简化为标量:

retention layer定义为:

相关推荐
W***25921 分钟前
2026企业AI办公工具选型全指南
大数据·人工智能
雪雪9081 分钟前
AI视频多轨道怎么同步预览
人工智能
DP DPharness6 分钟前
拆开 clearai-dsh 的包结构:一个 DSH 预设如何不改引擎加进认识论层
人工智能·dpharness
蜗牛互联网11 分钟前
Python Responses API函数调用实战:工具白名单、参数校验与预算
java·人工智能·后端
时代的凡人12 分钟前
用 AI 来做大学教材。
人工智能
秦先生在广东13 分钟前
GPT-6 模型家族选型、成本控制及长任务工作流管理深度指南
人工智能
禁默14 分钟前
如何把AI Agent托管在家里电脑:2026年UU远程终端/CLI/端口映射/网络代理开发者实测
网络·人工智能·电脑
开开心心就好14 分钟前
二维码批量生成导出工具,离线可用完全免费
java·前端·人工智能·智能手机·github·excel·visual studio
IT古董16 分钟前
《FDE前沿部署工程师实战教程》31 - Enterprise AI Reliability:Agent稳定性与生产运维体系
大数据·数据库·人工智能
这张生成的图像能检测吗21 分钟前
(论文速读)FFS:用 Normalizing Flow 改进 VOS 的虚拟异常特征合成
人工智能·计算机视觉·分布外检测