对gru的理解

GRU(Gated Recurrent Unit,门控循环单元)是一种循环神经网络(RNN)的变体,最早由Kyunghyun Cho等人在2014年提出。它是**LSTM(Long Short-Term Memory)**的简化版,旨在缓解标准RNN的梯度消失问题,同时减少计算开销。


1. GRU 结构

GRU的核心由两个门控制信息流动:

  • 更新门(Update Gate,z):决定当前时间步的隐藏状态有多少信息需要保留、多少信息来自新输入。
  • 重置门(Reset Gate,r):控制遗忘过去的信息,决定当前输入对隐藏状态的影响程度。

GRU的数学公式如下:

  1. 更新门

    z t = σ ( W z x t + U z h t − 1 + b z ) z_t = \sigma(W_z x_t + U_z h_{t-1} + b_z) zt=σ(Wzxt+Uzht−1+bz)

  2. 重置门
    r t = σ ( W r x t + U r h t − 1 + b r r_t = \sigma(W_r x_t + U_r h_{t-1} + b_r rt=σ(Wrxt+Urht−1+br

  3. 候选隐藏状态

    h ~ t = tanh ⁡ ( W h x t + U h ( r t ⊙ h t − 1 ) + b h ) \tilde{h}t = \tanh(W_h x_t + U_h (r_t \odot h{t-1}) + b_h) h~t=tanh(Whxt+Uh(rt⊙ht−1)+bh)

  4. 最终隐藏状态更新
    h t = ( 1 − z t ) ⊙ h t − 1 + z t ⊙ h ~ t h_t = (1 - z_t) \odot h_{t-1} + z_t \odot \tilde{h}_t ht=(1−zt)⊙ht−1+zt⊙h~t

其中:

  • σ \sigma σ 是sigmoid函数,确保门的输出在 (0,1) 之间。
  • ⊙ \odot ⊙ 代表逐元素乘法(Hadamard 乘积)
  • W W W 和 U U U 是可训练权重, b b b 是偏置项。

从公式我们可以看出, 在计算 h ~ t \tilde{h}_t h~t 的时候, r t rt rt(重置门) 越接近1则结果受到过去状态的影响越大, r t rt rt(重置门) 越接近0的时候,结果受到过去状态的影响越小。 这就是重置门的作用。用于控制遗忘过去的信息。

计算新的 h t h_t ht 的时候, 更新们 z t z_t zt 越接近1,结果受到 h ~ t \tilde{h}_t h~t (当前输入)影响大, 当 z t z_t zt 越接近0时, 结果受到 h t h_t ht(过去状态)影响大。所以这体现了更新门的作用:决定当前时间步的隐藏状态有多少信息需要保留、多少信息来自新输入。

相关推荐
抓个马尾女孩14 分钟前
位置编码:绝对位置编码、相对位置编码、旋转位置编码
人工智能·深度学习·算法·transformer
这张生成的图像能检测吗1 小时前
(论文速读)SFAFBR:一种自监督的人工特征偏置校正框架
人工智能·深度学习·神经网络·机器学习·故障诊断·自监督学习
nap-joker2 小时前
【综述型论文+知识增强深度学习KADL】知识增强深度学习及其应用:一项综述
人工智能·深度学习·知识增强深度学习·kadl·经验知识·科学知识·知识识别
CoovallyAIHub2 小时前
ICLR 2026 | MedAgent-Pro:用 Agent 工作流模拟临床医生的循证诊断过程
深度学习·算法·计算机视觉
九.九2 小时前
3W功耗 HiNas+cpolar,随时随地访问家里的文件
人工智能·深度学习
CoovallyAIHub2 小时前
AAAI 2026 | 上海AI Lab发布RacketVision,首次为球拍运动标注球拍姿态
深度学习·算法·计算机视觉
qq_281684213 小时前
Transformer-XL:突破固定长度枷锁,重构长文本语言模型
人工智能·深度学习·语言模型·重构·transformer
CoovallyAIHub3 小时前
中文语音识别该用谁?6 个开源模型 + 2 个配套工具,一文理清
深度学习·算法·计算机视觉
华农DrLai4 小时前
什么是角色扮演Prompt?为什么给AI设定身份能提升表现?
人工智能·深度学习·ai·prompt·bert·transformer
yiyu07164 小时前
3分钟搞懂深度学习AI:实操篇:Attention
人工智能·深度学习