Attention计算中的各个矩阵的维度都是如何一步步变化的?

在Transformer模型中,各个矩阵的维度变化是一个关键的过程,涉及到输入、编码器、解码器和输出等多个阶段。以下是详细的维度变化过程:

输入阶段

  • 输入序列 :假设输入序列的长度为seq_len,每个单词或标记通过词嵌入(word embedding)转换为一个固定维度的向量,维度为d_model。因此,输入矩阵的维度为(seq_len, d_model)。
  • 位置编码 :位置编码(Positional Encoding)通常与词嵌入向量相加,以提供序列中每个单词的位置信息。位置编码的维度与词嵌入相同,即(seq_len, d_model)。

编码器(Encoder)阶段

  • 多头注意力机制(Multi-Head Attention):

    • 查询(Q)、键(K)、值(V)矩阵 :输入矩阵与权重矩阵相乘得到Q、K、V矩阵。假设每个头的维度为d_k(通常d_k = d_model / num_heads),则Q、K、V的维度为(seq_len, d_k)。
    • 注意力计算 :Q与K的转置相乘,得到一个注意力得分矩阵,维度为(seq_len, seq_len)。经过softmax处理后,再与V相乘,得到输出矩阵,维度为(seq_len, d_k)。
    • 多头拼接 :将所有头的输出拼接或平均,得到最终的输出矩阵,维度为(seq_len, d_model)。
  • 前馈神经网络(Feed-Forward Network):

    • 输入矩阵经过两个线性变换和非线性激活函数,最终输出的维度保持为(seq_len, d_model)。

解码器(Decoder)阶段

  • 掩码多头注意力机制(Masked Multi-Head Attention):

    • 类似于编码器中的多头注意力机制,但使用了掩码来防止解码器在生成时"偷看"未来的信息。输出矩阵的维度为(seq_len, d_model)。
  • 编码器-解码器注意力机制:

    • 解码器的查询(Q)与编码器的键(K)和值(V)进行注意力计算,输出矩阵的维度为(seq_len, d_model)。

输出阶段

  • 线性层和Softmax :
    • 解码器的输出经过一个线性层,将维度从(seq_len, d_model)转换为(seq_len, vocab_size),其中vocab_size是词汇表的大小。
    • 最后通过Softmax层,得到每个单词的概率分布,用于预测下一个单词。

这些维度变化确保了Transformer模型能够有效地处理序列数据,并在各个层之间传递和转换信息。

相关推荐
Rocky Ding*1 分钟前
DeepSeek DSec技术深度解析:Agent规模化训练的真正瓶颈,是沙箱基础设施
论文阅读·人工智能·深度学习·机器学习·aigc·agent·ai-native
阿里云大数据AI技术4 分钟前
息壤开物 × 阿里云:为具身智能造一座“会生长的数据工厂“
大数据·人工智能·阿里云·dataworks·maxcompute
147API6 分钟前
如何设计“回答、追问、停答”三类蒸馏训练集
人工智能·算法·机器学习
ndglzx8 分钟前
AI+制造落地:南德管理政企联动公益讲座助力中小企业大模型应用
人工智能·其他
Zootopia62610 分钟前
快递无人车与无人机各自进入配送网络后,路线能否一起算?
c++·人工智能·机器学习·matlab·ai·机器人·无人机
空 白II17 分钟前
9.30 大语言模型研究简报:Claude Sonnet 5.5:更快、更便宜的 Agent 模型
人工智能·语言模型·自然语言处理
小朱爱编程12324 分钟前
我用 Jev 做了三个实用工具:整理标签页、分诊飞书反馈、找回 GitHub 收藏
java·开发语言·人工智能·后端·python·架构·ai编程
AI职业加油站27 分钟前
大模型开发工程师证书怎么考?零基础学习路径与价值拆解
大数据·人工智能·学习·职场和发展·数据分析
镭封32 分钟前
基于微信小程序的移动端AI配音工作流设计
人工智能·小程序·媒体
leoZ23140 分钟前
第 40 篇 AI 团队搭建与角色分工
人工智能·大模型·agent