RNN和QKV区别

RNN和QKV区别


全文链接:RNN和QKV区别


用「指代消解 → RNN 传话困境 → Attention 全场扫描 → Q/K/V 三分工 → 注意力公式」这条线,通俗说明 RNN 与 QKV(Self-Attention)在信息流动上的根本差异,以及 Q、K、V 为何要拆成三个矩阵。整理自知乎回答(作者:最后的绅士);完整推导与类比见本站长文。


一句话定位

RNN 像传话游戏:信息沿序列串行 传递,长距离易衰减;Self-Attention + QKV 让每个词同时扫描全句,任意两词一步可达------Transformer 的核心差异在「信息怎么流动」,而不只是多乘几个矩阵。

资源 链接
本站完整版 https://handsomestwei.top/posts/RNN和QKV区别/
Transformer 原论文 https://arxiv.org/abs/1706.03762
知乎原回答 https://www.zhihu.com/question/298810062/answer/2041184627159814333

从「它」指谁说起

实验句:「猫坐在垫子上因为它很舒服。」

「它」指垫子 ------大脑读到「它」时,会同时比较「猫」「垫子」等候选,而非等前面信息一层层传完。

  • 2017 年前 :主流用 RNN 逐词传递隐藏状态理解指代。
  • Transformer 后 :用 Attention,全句并行扫描。

RNN:传话游戏的困境

十人传话:信息经九次转述,每次压缩损耗,第十人往往面目全非。

text 复制代码
「猫」→「坐在」→「垫子」→「上」→「因为」→「它」
  每步:上一隐藏状态 + 当前词 → 新状态 → 再往后传

当「它」出场时,「垫子」的信号已被压缩多次。架构约束是串行衰减,非单纯算力不足。

维度 RNN
信息流动 沿时间步串行
长距离依赖 路径长,易衰减
并行性 时间步依赖强
典型问题 长程指代、长句理解

Attention:废除排队,全场同时对话

Transformer 的思路:每个词直接和所有词说话,不是改良传话,而是废除排队。

text 复制代码
「它」同时看向每个词:
  「猫」   → 不太像指代对象
  「垫子」 → 被坐在上面,「舒服」是其属性 → 命中
  「舒服」 → 确认「垫子」

这就是 Attention(注意力) ------但数学上不能简单「两个向量比相似度」,需要 Q、K、V 三分工。


Q、K、V 为什么是三个矩阵

行业会议类比

工具 对应 作用
你的嘴(Q) Query 发问:「有人做过推理优化吗?」
胸牌(K) Key 标签:「vLLM」「FP8 量化」------供被检索
干货(V) Value 聊完后得到的方案与踩坑------真正内容

为何要三分?

  1. 问法 ≠ 名牌写法 → Q 与 K 需不同矩阵 (W_q, W_k)
  2. 名牌 ≠ 肚子里内容 → K 与 V 需不同矩阵 (W_k, W_v)
  3. 三者相同 → 只能匹配「说话方式一样的人」,学不会跨表述的能力匹配
矩阵 作用
(W_q) 词变成「我要找什么」
(W_k) 词变成「我是什么标签」
(W_v) 词变成「我能贡献什么内容」

同一词「猫」经三种投影:搜寻者(Q)、被搜寻者(K)、内容提供者(V)------三重人格由训练学出。


注意力公式在做什么

text 复制代码
Attention 分数 = Q × K^T / √d_k
输出           = Softmax(分数) × V
步骤 含义
Q × K^T 每个 Query 与所有 Key 匹配 → 分数矩阵
÷ √d_k 缩放,稳定 Softmax
Softmax 分数变概率,每行和为 1,竞争式分配注意力
× V 按权重聚合真正内容

本质:先决定「听谁的」(Q×K),再决定「听什么」(×V)。

多头注意力:多个并行头关注语法、语义等不同侧面,最后拼接(如 (d_k = d_{\text{model}}/\text{num_heads}))。


RNN 与 QKV 对比

维度 RNN Q/K/V + Self-Attention
信息流动 串行,隐藏状态逐步传递 任意两词直接交互
长距离依赖 易衰减 一步可达
并行性 难充分并行 层内大规模并行
表示方式 单一隐藏状态压缩历史 每词分 Q/K/V 三角色
核心操作 上一状态 + 当前输入 Q 匹配 K,加权聚合 V

收束 :QKV 不是巧合,而是在「每个词需同时和所有词对话」的需求下,把检索(K)、查询(Q)、内容(V) 分流的信息方案。


小结

问题 结论
RNN 最大架构短板 串行传递导致长程信息衰减
Attention 改变了什么 全句并行扫描,废除「只和邻居说话」
为何要 Q、K、V 三个矩阵 提问方式、可检索标签、实际内容是三套语义空间
注意力公式核心 先 Q×K 定权重,再对 V 加权求和
与 Transformer 的关系 Self-Attention + QKV 是 Transformer 编码/解码的核心

延伸阅读

资源 链接
本站完整版 RNN和QKV区别
Attention Is All You Need https://arxiv.org/abs/1706.03762
知乎原回答(最后的绅士) https://www.zhihu.com/question/298810062/answer/2041184627159814333

标签RNN QKV Transformer Self-Attention 注意力机制 深度学习 NLP 大模型

相关推荐
AI新角度1 小时前
构建系统优化:增量编译与缓存命中率提升
人工智能
陈嘿萌1 小时前
ICML 2026 | 福州大学 LaRA-Fusion:用双环约束优化红外与可见光融合潜空间的拓扑结构
人工智能·图像融合·icml2026·福州大学·双环约束
三声三视2 小时前
我弃了“全自主 Agent“:一次误退款,让我给所有危险工具加了道人工闸
人工智能·ai·aigc
Python私教2 小时前
前端转 AI 全栈:别只做聊天框,SSE 与审批流才是分水岭
前端·人工智能
机器人落地派2 小时前
机器人项目变更闭环检查表:别只写“已经改了”
人工智能·机器人·人形机器人·机器人落地·评审
小园子的小菜2 小时前
从Prompt到Loop:AI工程化四层范式完全指南(Prompt/Context/Harness/Loop)
人工智能·prompt
canonical-entropy2 小时前
Mission Driver:Loop Engineering 的一种通用参考实现
大数据·人工智能·ai-agent·可逆计算·nop平台·harness
cn分享汇2 小时前
启锐H20照片打印机,随时实地轻松打印
人工智能
Python私教2 小时前
AI Agent 为什么总在最后一步失败?从启动异常到可恢复工作流
人工智能