词嵌入位置编码的实现(基于pytorch)

背景介绍

在transformers架构当中,对于词向量的输入需要加上原本词对应的位置信息,作为输入到模型中训练的input,那具体的位置编码如何实现呢?本篇博客就跟大家一起分享一下对应的步骤

位置编码的公式

对于词向量的位置编码的方式有多种,这里就介绍用三角函数进行位置编码的公式

PE是position embeding位置编码的意思,pos表示词的位置,表示词向量的维度,i表示词向量的第i维度

那接下来我们就根据公式进行位置编码的代码实现

代码实现

环境依赖的库

python 复制代码
import torch
import math
import numpy as np
import matplotlib.pyplot as plt

定义一个函数获取位置编码的信息

python 复制代码
def generate_word_embeding(max_len,d_model):
    # 初始化位置信息
    pos = torch.arange(max_len).unsqueeze(1)
    
    # 初始化位置编码矩阵
    result = torch.zeros(max_len,d_model)

    # 获得公式对应的值
    coding = torch.exp(torch.arange(0,d_model,2)*(-math.log(10000.0))/d_model)
    result[:,0::2] = torch.sin(pos*coding)
    result[:,1::2] = torch.cos(pos*coding)

    # 为了与原编码直接相加,格式为[B,seq_len,d_model],需要再增加一个维度
    return result.unsqueeze(0)

假设我们的max_len是100,d_model为20,那么pos的维度为100,1,result的维度为100,20,coding的维度为1,d_model/2,result:,0::2是指对result的每列从第0列开始每隔一列赋值,对应公式中的PE(pos,2i);同理,result:,1::2对应公式中的PE(pos,2i+1)

位置编码信息可视化

我们把得位置编码信息进行可视化从而得到更直观的感受

python 复制代码
d = 6
pos_code = generate_word_embeding(100,d)
print(pos_code.shape)
plt.plot(np.arange(100),pos_code[0,:,0:d])
plt.legend(['dim=%d'%p for p in range(d)])
plt.show()

把词的时序长度设置为6,显示对应时序上每一个维度的位置编码信息

可以看到每一个时序位置上对应每一个维度都对应一个三角函数的变换规律,在放进model中训练的后就能够通过学习获得位置对应的知识

欢迎大家讨论交流~


相关推荐
AI职业加油站1 小时前
大模型开发工程师证书怎么考?零基础学习路径与价值拆解
大数据·人工智能·学习·职场和发展·数据分析
镭封1 小时前
基于微信小程序的移动端AI配音工作流设计
人工智能·小程序·媒体
leoZ2311 小时前
第 40 篇 AI 团队搭建与角色分工
人工智能·大模型·agent
海宇大数据1 小时前
零信任架构实战:基于海宇车辆出险记录核验构建自动化二手车收车评估网关
运维·人工智能·架构·自动化
搞科研的小刘选手1 小时前
【中国南京&新加坡 双会场 | EI-JA期刊、CA会议征稿】2026年绿色能源与人工智能国际学术会议(GEAI 2026)
人工智能·学术会议·会议推荐·绿色能源·新加坡·南京
hunteritself1 小时前
卷卷卷!GPT-6 Sol、Luna 正式发布,OpenAI 开始卷价格了
大数据·前端·人工智能·深度学习·transformer
东方佑2 小时前
权重绑定深度语言模型:深度缩放、免费早退与一个基本权衡
人工智能·语言模型·自然语言处理
玫瑰互动GEO2 小时前
GEM优化+GEO优化+信息流三件套:AI时代投放闭环的工程化拆解
人工智能·ai·ai搜索·gem·gem优化·cpcq
明月_清风2 小时前
企业买了 Codex、WorkBuddy,AI 为什么还是没落地?我用 FDE + AKA 做深度定制
人工智能·后端
TomEval2 小时前
【测AI】第06篇:数据清洗实战 —— Pandas 处理爬取的 JD 数据
人工智能·python·自动化·aigc·pandas