自注意力机制(Self‑Attention)

自注意力是 Transformer 的核心模块 ,作用是让序列里面每一个token(词/字符),都可以直接关注序列里其它所有token,计算相互之间的关联权重,捕捉长距离依赖关系。

对比RNN:RNN串行逐个处理,长距离信息会衰减;自注意力一步直接看到整个序列全部位置。

核心思想

输入一组向量,分别映射出三组向量:

  • Q Query 查询:我要找什么
  • K Key 键:我有什么
  • V Value 值:我实际携带的信息
  1. 拿每个 Q 和全部 K 做点积,算出相似度分数

  2. 除以

    缩放,防止维度大分数爆炸

  3. Softmax,把分数变成0~1的权重,权重总和为1

  4. 用权重对 V 加权求和,得到该位置输出

公式:

通俗例子

句子:动物 不 喜欢 吃 冰冷 的 食物

处理"吃"这个词:

  • Q来自"吃";和所有词的K计算相似度
  • 模型算出:和"动物"、"食物"权重高,和"的"权重低
  • 输出向量就更多融合"动物、食物"的信息,理解:谁在吃,吃什么

自注意力可以直接捕捉相隔很远的词的关系。

多头自注意力 Multi‑Head Attention

把 Q/K/V 切分成多组,每组独立跑一套自注意力,最后拼接再做线性变换。

  • 单头:只能学到一种关联模式
  • 多头:不同头捕捉不同关系,比如一头关注语法,一头关注指代,一头关注语义。

掩码自注意力 Masked Self‑Attention(解码器)

生成场景(GPT)用,加掩码,屏蔽未来位置

预测第 i 个词的时候,看不到 i 之后的token,防止偷看还没生成的内容。

自注意力优缺点

✅优点

  1. 全局建模,长距离依赖能力强
  2. 完全并行计算,相比RNN可以GPU加速
  3. 权重动态:不同上下文同一个词,注意力分布不一样

❌缺点

  1. 时间复杂度

    ,序列长n很大时计算显存爆炸

  2. 长文本成本高,衍生出:稀疏注意力、滑动窗口注意力、KV缓存等优化。

简单区分

  • 自注意力 Self‑Attention :Q、K、V来自同一组输入,比如BERT编码器。
  • 交叉注意力 Cross‑Attention:Q来自A序列,K、V来自B序列,用于翻译(编码器-解码器)。
相关推荐
品牌测评1 小时前
大模型推理算力平台推荐分享|六家平台计费与架构拆解
大数据·人工智能·架构
武汉万象奥科1 小时前
8路AHD摄像头同时输出演示,万象奥科RK3576 AHD硬件方案
人工智能·计算机视觉
LedgerNinja1 小时前
WEEX 真实情况如何?交易平台如何判断是否可靠
大数据·人工智能·区块链
重庆传粉科技1 小时前
GEO深度解读:AI时代品牌营销的核心,从内容优化转向事实治理
人工智能
用户69371750013841 小时前
#DeepSeek+Pi‑Agent 王炸组合跑赢 Claude‑Code!
前端·人工智能·后端
顿哥GPT2 小时前
2026年8月11日深度剖析:ChatGPT Plus/Pro 与 Codex 技术实战——构建智能代码生成助手
人工智能·chatgpt
小饕2 小时前
Jetson 设备上部署 ONNX 模型的完整指南:从环境配置到生产级推理
人工智能·大模型端侧部署
aiqianji2 小时前
文风接近真人的AI生成短篇小说软件有哪些?
人工智能·python
甲维斯2 小时前
Opus5和gpt5.6修bug又干起来了!
人工智能