word2Vec理解(下):本质理解

最近一直在思考word2Vec这算法,其根本是想知道它是怎么从softmax的思想,丝滑转变为词距离远近的思想,理解了这种思想,可以解决很多其他相似的问题。

想要理解这个算法,需要知道它是怎么操作的。

以skip-gram算法为主,假设我有一句话,I love deep learning,以deep 为中心词,然后windows=3,这样我们可以得到三个训练样本(deep, love)、(deep, learning)、(deep, I),训练样本的意思是,根据A,预测B,例如根据deep预测 love,根据deep,预测learning。我的词表大小是M,第一组样本 deep,love 扔进网络,deep经过nn.Embedding得到w_deep,然后 w_deep输入nn.Linear,得到和词表M个标量分数(logits);也就是:

score(I), score(love), score(deep), score(learning), ... score(word10000)

因为Linear本质是 y = Wx + b, 然后经过softmax之后,将标量变成了概率,即模型认为:

P(I|deep) = 0.08

P(love|deep)=0.85

P(deep|deep)=0.02

P(learning|deep)=0.05

但是我们输入的样本是deep, love, love概率越低,产生的loss值越大。

需要理解:

  • 生成训练样本的时候,窗口的大小,只是影响样本的多少,在样本训练中,不会体现这个词距离中心词多远,为什么,因为Skip-gram 的目标不是学习"空间距离",而是学习一个词的上下文;
  • 但是有一个问题,两个词距离越近,进入训练的样本数就越多,因为在预料中,距离比较近的词,就会频繁出现,这样进入训练的次数就会多,从而间接去影响梯度;
  • 在 word2vec 之前,计算机表示词通常是, one-hot类型,两个词之间没有距离,word2vec 将词变成了连续向量。
  • word2vect重要的思想是,不要人工定义语义,只要设计一个预测任务,就可以让模型自己学习表示空间,这个思想影响巨大。
相关推荐
惊鸿一博1 小时前
# 生成模型(Generative Models)基础介绍_四大分类_扩散模型介绍
人工智能
漏刻有时1 小时前
PHP 5.6 老系统接入 DeepSeek AI:错别字检查 / 文案解读 / 智能问答,三合一实战方案
人工智能
ZJNF20031 小时前
EC节能风机厂家直销,如何避开选型误区?——从效率实测到服务保障的全面解读
人工智能·容器
财迅通Ai1 小时前
康美药业资源卡位与终端布局双向贯通 发展空间进一步打开
大数据·人工智能·康美药业
思尔芯S2C1 小时前
思尔芯RCF RTL自动分割工具,助力大规模AI/HPC芯片原型验证
人工智能·fpga开发·内存模型·自动编译·ddr5·prototyping·原型验证
wordbaby1 小时前
Harness:比模型更持久的工程问题
人工智能
2601_965799681 小时前
在线培训考试系统全功能解析:助力企业打造高效人才培养体系
大数据·人工智能·笔记·功能测试
csdn杰哥1 小时前
瑞萨单片机AI教程【六】导入外部电机状态数据训练模型
人工智能·单片机·嵌入式硬件·瑞萨·ra6m5
鬼手点金1 小时前
机器学习、深度学习、强化学习、神经网络、自注意力机制
人工智能·深度学习·神经网络·机器学习·skill·vibecoding·opencode