自然语言处理-词向量模型-Word2Vec

通常数据的维度越高,能提供的信息也就越多,从而计算结果的可靠性就更值得信赖

如何来描述语言的特征呢,通常都在词的层面上构建特征,Word2Vec就是要把词转换成向量

假设现在已经拿到一份训练好的词向量,其中每一个词都表示为50维的向量

如果在热度图中显示,结果如下

在结果中可以发现,相似的词在特征表达中比较相似,也就是说词的特征是有意义的!

在词向量模型中,输入和输出分别是什么?

数据从哪来?

构建训练数据

不同模型对比

CBOW模型

Skip-gram模型

Skip-gram模型所需训练数据集

如何进行训练?

如果一个语料库稍微大一些,可能的结果简直太多了,最后一层相当于softmax,计算起来十分耗时,有什么别的方法吗?

初始方案:输入两个单词,看他们是不是前后对应的输入输出,也就相当于一个二分类任务

出发点非常好,但是此时训练集构建出来的标签全为1,无法进行较好的训练

改进方案。加入一些负样本(负采样模型)

词向量训练过程

初始化词向量矩阵

通过神经网络反向传播来计算更新,此时不光更新权重参数,还更新输入数据

相关推荐
Young丶8 小时前
讲透 Claude Code 系列 (四):Claude Skills 完全指南:可复用的“专业能力包”从入门到精通
人工智能·ai·ai编程·ai coding
runningshark8 小时前
Lecture: Understanding Different Registers: Formal to Consultative
自然语言处理
阿里云大数据AI技术8 小时前
Hologres:一站式 Agentic 多模态检索分析平台
人工智能
回眸&啤酒鸭8 小时前
【回眸】AI新鲜事——百度 AI 搜索实战应用场景与落地
人工智能·百度
jsl_jsl_jsl8 小时前
《Agent 的记忆怎么做:实时记忆、被动压缩与主动整理的三层设计》
人工智能
林浩杨_8 小时前
SIGIR 2026|南京大学:Video-GAR:“通过生成 Query 来验证视频语义理解”的生成增强范式
论文阅读·人工智能·算法
speop9 小时前
Hello-Agents | Task00 环境配置
人工智能
7177779 小时前
基于 Gitee 的软件成分分析(SCA)工具选型与集成参考
人工智能·gitee
子非鱼eva9 小时前
Ascend950PR版本速配表
人工智能·ai
Henry-SAP9 小时前
SAP PP模块核心机制解析
人工智能·云原生·sap·erp