深度学习进阶:自然语言处理|3.2.3 QA|word2vec 中为什么输入和输出权重都可以表示单词

word2vec 中 W_in、h、W_out 的作用

例子:

text 复制代码
词表大小 V = 7
隐藏维度 H = 3
输入词:you
目标词:say

1. W_in 做什么?

W_in 是输入侧矩阵。

text 复制代码
you_one_hot · W_in = h

形状:
1×7 · 7×3 = 1×3

因为 you_one_hot 只有 you 的位置是 1,所以乘 W_in 等于取出 W_in 的 you 这一行。

所以:

text 复制代码
W_in[you] = you 作为输入词时的向量 = h

形状:
W_in[you] 是 1×3
h 也是 1×3

它表示:看到 you 后,模型带着什么信息去预测周围词。

2. h 长什么样?

h 是一个普通数字向量,形状是 1×3:

text 复制代码
h = [0.21, -0.43, 0.88]

它不是 one-hot,也不是概率。

在这个例子里:

text 复制代码
h = W_in[you]

所以 h 就是 you 的输入侧词向量。

3. h 用来干什么?

h 用来和 W_out 的每一列做点积,给每个候选输出词打分:

text 复制代码
scores = h · W_out

形状:
1×3 · 3×7 = 1×7

展开看就是:

text 复制代码
score(you) = h · W_out[:, you]
score(say) = h · W_out[:, say]
score(.)   = h · W_out[:, .]

如果:

text 复制代码
h · W_out[:, say]

最大,那么模型就倾向于预测 say。

4. W_out 做什么?

W_out 是输出侧矩阵。

text 复制代码
W_out[:, say] = say 作为输出词时的向量

形状:
W_out[:, say] 是 3×1

它表示:什么样的 h 应该把 say 预测出来。

5. 最短总结

text 复制代码
x(1×7) · W_in(7×3) = h(1×3)
h(1×3) · W_out(3×7) = scores(1×7)
text 复制代码
W_in:把输入词 you 变成隐藏向量 h。
h:拿去和每个候选输出词做匹配。
W_out:存放每个候选输出词的向量,用来打分。

所以:

text 复制代码
W_in 的行:词作为输入时的向量。
W_out 的列:词作为输出时的向量。
相关推荐
Joshua-a3 小时前
工程数学-理解卷积的含义_线性时不变系统的冲激响应与卷积
人工智能·深度学习
song5013 小时前
React Native for OpenHarmony 实战:三方库 react-native-css-transformer 的鸿蒙化适配指南
css·人工智能·深度学习·react native·transformer
IT研究所11 小时前
AI-ITR平台如何减少客户问题反复升级?
大数据·运维·人工智能·低代码·自然语言处理·安全架构·企微
数智工坊12 小时前
视觉SLAM第12讲|地图构建:单目稠密重建、RGB-D点云与八叉树地图全解析
人工智能·深度学习·矩阵·机器人
GPU实战笔记12 小时前
云端 GPU 训练的账户余额提醒:它能说明什么,不能说明什么?
深度学习·算法·成本管理·gpu云计算·云端训练
论文复现现场14 小时前
8卡4090能跑70B吗?Llama-2显存预算、QLoRA与通信瓶颈
人工智能·深度学习·分布式训练·llama·显存·qlora·算家云
用户159706376014 小时前
一文读懂淘宝店铺在售商品接口:整店商品批量拉取用于竞品研究
深度学习
布吉岛的石头14 小时前
Java 程序员第 49 阶段11:Java 接 BERT:用 ONNX Runtime 做句向量推理
java·人工智能·python·深度学习·bert·transformer
liron7116 小时前
技术的诞生与演化--技术自举及其冷启动
人工智能·深度学习·神经网络·自然语言处理
喜欢打篮球的普通人17 小时前
MiniMind 学习笔记(十八):速通强化学习——从 MDP 到 PPO 的概念与算法地图
笔记·深度学习·学习