词嵌入中语料库矩阵和句子矩阵是怎样的?

词语是不能进行计算的,要理解词语,就必须转化成数字,向量可以表示多个词语之间的关系,离得近就是相似等不同的关系。

1 语料库矩阵

假设语料库是N段语句组成的,最后算下来有5000个字组成的语料库,然后我们将这个语料库训练成每个字都由128维向量表示的,向量集合。这就是语料库矩阵。该矩阵记为E

2 句子矩阵(One-Hot编码)

句子矩阵就是,句子分词后,这个词或者字,在语料库中的位置(5000个字词中的位置),如:『我』在这5000个字词库中的第2位,『喜欢』在这5000个字词库中的第1位,『学习』是第3位,以此类推。我们将该矩阵记为V

3 E x V 即为句子的嵌入向量

最终会得到4 * 128的句子向量

4 实际上

下图中还是语料矩阵,只是写出了例句中各个元素的位置。V * E就是将例句中的向量,从语料矩阵中取出。

5 词嵌入的优势

5.1 表达效率的提升

5.2 理解词语的语义

5.3 嵌入矩阵的通用性

视频参考:https://www.bilibili.com/video/BV1sw411S7i1?spm_id_from=333.788.recommend_more_video.-1\&trackid=web_related_0.router-related-2206419-zjg6v.1764578610538.562\&vd_source=e10f137a63ff65947d019d16bb78ea8d

相关推荐
Mxsoft6191 小时前
某次数据分析偏差,发现时区设置错,修正时间戳救场!
人工智能
努力也学不会java1 小时前
【docker】Docker Register(镜像仓库)
运维·人工智能·机器学习·docker·容器
m0_650108241 小时前
OLMo 2:全开放语言模型的技术突破与实践
论文阅读·人工智能·olmo 2·全开源多模态大模型·全链路开放·训练稳定性
Mintopia1 小时前
🧠 AIGC技术标准制定:Web行业协同的必要性与难点
人工智能·前端框架·trae
轻竹办公PPT1 小时前
AI一键生成年终总结PPT
人工智能·python·powerpoint
是Dream呀1 小时前
昇腾平台 PyTorch 迁移实操:从环境搭建到精度达标的完整步骤
人工智能·pytorch·python·昇腾
Mintopia1 小时前
🧩 Codex 配置自定义指令指南
人工智能·llm·claude
一个处女座的程序猿1 小时前
AGI:《从规模扩张到研究驱动:Ilya Sutskever畅谈AI泛化瓶颈、人类学习启事与超级智能未来之路》
人工智能·llms·ilya sutskever
工藤学编程1 小时前
零基础学AI大模型之Milvus实战:Attu可视化安装+Python整合全案例
人工智能·python·milvus