Transformer and Pretrain Language Models3-2

transformer structure注意力机制的各种变体

第二种变体:

如果两个向量的维度不一样,我们就需要在中间加上一个权重矩阵,来实现他们之间的相乘,然后最后得到一个标量

第三种变体:

additive attention

它和前面的有一个比较大的不同,它使用了一层的前馈神经网络,来将两个向量变成一个标量,来得到注意力分数

在这个变体中,w1、w2和v,分别是两个权重矩阵和一个权重向量;tanh是一个激活函数。这样的话最后也可以得到一个标量,作为前面的注意力分数

此外还有许多其他的变体,可执行查找了解。

相关推荐
千天夜1 小时前
让大模型“先想再答”:Chain-of-Thought Prompting 论文精读——CoT 为什么能激发多步推理?
人工智能·深度学习·llm·gpt-3·llama
橙臣程2 小时前
深度学习9——transformer之注意力机制
人工智能·深度学习·transformer
恒知学术3 小时前
SCI 文献怎么检索?英文关键词、DOI、被引量和开放获取线索整理
人工智能·深度学习·sci·文献检索·谷歌学术·doi
我登哥MVP4 小时前
Headroom 深度指南:AI Agent 上下文压缩实战
人工智能·python·深度学习·神经网络·机器学习·自然语言处理·pip
OpenApi.cc4 小时前
来了,来了,我来了,Mocode
人工智能·深度学习·神经网络·目标检测·数据挖掘
hongyucai6 小时前
大模型常见问题整理
人工智能·深度学习
再渊6 小时前
基因归因到底怎么计算的?
python·深度学习·机器学习
HiDev_7 小时前
【非标自动化】2、认识元器件(接近传感器)
人工智能·深度学习·自动化
user-猴子8 小时前
AiPy + Kimi K3:2048小游戏生成的技术分析
人工智能·语言模型·大模型·prompt
phltxy8 小时前
LangGraph智能租房助手实践
大数据·人工智能·python·深度学习·语言模型·langchain