台大李宏毅老师讲解memba和类似linear atttenion 模型,笔记

还有外国人还是会万玩, du公司股份,看 2027年 transformer 还是霸榜

可以使用bili2text工具从指定B站视频中根据语音提取文字资料,该工具输入链接即可使用,免费且能一步到位地实现Bilibili视频转文字。其项目地址为:https://gitcode.com/gh_mirrors/bi/bili2text

memba 通过RNN讲解 ,而不是从工程学的smm 角度讲解

每一个模型为了解决一个问题,存在都有他的理由

残差网络

解释为什么要有残差网络,提供了可视化 loss变化

self-attenion

RNN

self-attention

\\

### selft-attenion

更加并行计算(台湾叫平行化)

在这里插入图片描述

RNN 改进 linear attention

简化函数 fa 去掉 相当 不做运算 ht-1 -= ht-1 不做计算

扫描算法,不作介绍,后面有i更加简单的

linear attention 2020年

记忆有限 transformer 一样。其实就是少了softmax

长度够长 数据会重复 ,t>d

在低维空间中 ,只能找到第一个正交的向量

linear attteion 真正的问题,不会遗忘,固定

所有lineeare attention 模型列表

deltanet

如何训练mamba 现有语言模型,去掉selft-attiion 。然后训练,或者不去掉selft-attention

du局

视频资料

https://www.bilibili.com/video/BV1XBe3zRE18/?spm_id_from=333.337.search-card.all.click\&vd_source=7d3841cb81fdca8b20a31fa9ee5ec8ef

l另外一个视频,

https://www.bilibili.com/video/BV1uEoXBgE7D/?spm_id_from=333.337.search-card.all.click\&vd_source=7d3841cb81fdca8b20a31fa9ee5ec8ef![在这里插入图片描述](https://i-blog.csdnimg.cn/direct/00fa12ae7db14d3da420ecf3600ac36c.png)

相关推荐
91刘仁德1 分钟前
Linux网络编程从入门到实战:UDP/TCP协议与socket编程全解析
linux·网络·笔记·tcp/ip·udp
龙亘川4 分钟前
数智赋能物业不动产治理:亘川智城智慧物业系统实践解析
大数据·人工智能·智慧城市·开源软件·数据可视化
明月_清风7 分钟前
AI Agent 进入系统层:现在有哪些开源项目在解决这个问题?
人工智能·后端
@Mike@7 分钟前
13-数据库学习笔记(查询执行处理模型)
数据库·笔记·学习
成为深度学习高手11 分钟前
SEMixer:以随机注意力增强patch语义、渐进混合多尺度的轻量长期时序预测模型
人工智能·深度学习·机器学习·数据挖掘·时间序列
泡海椒14 分钟前
JQuick-Excel dateFormat 转换实战:日期值与 FORMAT 显示格式的边界
开发语言·python·excel
弯_弯20 分钟前
企业 AI 服务商评估:以「是否先做诊断」为第一筛选门
人工智能
Go Work25 分钟前
实体类字段用 @Value 赋了默认值,取出来还是 null?
经验分享·笔记
白杨尚青29 分钟前
C++入门篇(十三):vector(上)——动态数组:构造、空间增长与迭代器失效
开发语言·c++·笔记·算法·stl
归秋14230 分钟前
流行音乐编曲软件怎么选:流行音乐创作的实用工具清单
人工智能