超简单理解LSTM和GRU模型

目录

RNN在反向传播时容易遭受梯度消失的问题,而梯度是用于更新神经网络权重的关键因子,梯度消失描述的是梯度在时间序列反向传播中逐渐减小的情况。

若梯度过小,它对于网络的学习贡献甚微。结果是,在RNN中,梯度更新很小的层级,并不能有效的学习。

RNN 容易遗忘较长序列中的信息,从而只留下短期记忆。

LSTM 和 GRU 正是为了解决短期记忆而设计的。

而LSTM的核心概念是它们的单元状态和各种门。

细胞状态如同一条信息告诉通道,持续传递至整个序列中,它可被视作网络的记忆中心。




参考资料

1\] [超简单理解LSTM和GRU模型,深度学习入门](https://www.bilibili.com/video/BV1EP411Y74W/?spm_id_from=333.337.search-card.all.click&vd_source=b5e395daf1dc59fb72b2633affa96661) 2023.8

相关推荐
AI Echoes28 分钟前
大模型(LLMs)加速篇
人工智能·python·算法·机器学习·面试
CV-杨帆2 小时前
论文阅读:2024 arxiv Jailbreaking Black Box Large Language Models in Twenty Queries
论文阅读·人工智能·语言模型
山石网科3 小时前
2025 RSAC|自主式 GenAI 安全智能体(Agent)开启防御新纪元
网络·人工智能
jndingxin3 小时前
OpenCV 图形API(66)图像结构分析和形状描述符------将一条直线拟合到三维点集上函数fitLine3D()
人工智能·opencv·计算机视觉
说私域3 小时前
技术驱动与模式创新:开源AI大模型与S2B2C商城重构零售生态
人工智能·小程序·重构·开源·零售
诗意地回家4 小时前
阿里开源Qwen3:大语言模型的新突破
人工智能·ai
Johny_Zhao5 小时前
Ubuntu堡垒机搭建与设备管理指南
linux·网络·人工智能·信息安全·云计算·yum源·系统运维·teleport
deephub5 小时前
加速LLM大模型推理,KV缓存技术详解与PyTorch实现
人工智能·pytorch·深度学习·缓存·大语言模型
月巴月巴白勺合鸟月半6 小时前
语音识别质量的跟踪
人工智能·语音识别·健康医疗
新加坡内哥谈技术6 小时前
Mem0.ai研究团队开发的全新记忆架构系统“Mem0”正式发布
人工智能·团队开发