Co-Occurrence Matrix——共现矩阵原理介绍

文章目录

共现和上下文窗口

  • 共现(Co-occurrence)------对于给定的语料库,一对单词(如w1和w2)的共现是指它们在上、下文窗口中同时出现的次数。
  • 上下文窗口(Context Window)------指的是某个单词w的上下文范围的大小,也就是前后多少个单词以内的才算是上下文?一般,上、下文窗口由数字和方向指定。

示例中的上下文窗口为 2

共现矩阵的生成

  1. 由语料库中所有不重复单词构成矩阵A以存储单词的共现次数。

  2. 人为指定Context Window大小,计算每个单词在指定大小的上下文窗口中与它周围单词同时出现的次数。

  3. 依次计算语料库中各单词对的共现次数。

共现矩阵存在的问题及解决方法

  • 共现矩阵增加了字典或词汇的大小(Increase in size with dictionary or vocabulary.)
  • 对于一个庞大的语料库,这个共现矩阵可能变得非常复杂(高维),后续分类模型面临稀疏性问题,模型的健壮性较差。

奇异值分解(SVD)和主成分分析(PCA)是两种特征值方法,主要用于将高维数据集降维,同时保留重要信息。

主成分分析 PCA
奇异值分解 SVD
相关推荐
是麟渊7 小时前
【大模型面试每日一题】Day 27:自注意力机制中Q/K/V矩阵的作用与缩放因子原理
人工智能·线性代数·自然语言处理·面试·职场和发展·架构
SZ17011023115 小时前
n 阶矩阵 A 可逆的充分必要条件是 ∣ A ∣ ≠ 0
线性代数·矩阵
martian66517 小时前
线性代数中的向量与矩阵:AI大模型的数学基石
人工智能·线性代数·矩阵
带电的小王1 天前
【动手学深度学习】2.3. 线性代数
人工智能·深度学习·线性代数
phoenix@Capricornus1 天前
PCA例题
线性代数·算法·机器学习
水花花花花花1 天前
线性代数基础
线性代数·算法·机器学习
姬公子5211 天前
leetcode hot100刷题日记——9.矩阵置零
算法·leetcode·矩阵
LVerrrr1 天前
Missashe线代题型总结
笔记·学习·线性代数·考研
martian6652 天前
矩阵详解:线性代数在AI大模型中的核心支柱
人工智能·线性代数·矩阵
byxdaz2 天前
CUDA加速的线性代数求解器库cuSOLVER
机器学习·矩阵