第十八章 番外 余弦相似度

余弦相似度(Cosine Similarity)是一种衡量两个非零向量之间角度的度量方式,用于评估它们之间的相似性。它的值范围从 -1 到 1,其中 1 表示完全相同的方向(即向量完全相同),0 表示正交(没有相似性),而 -1 表示完全相反的方向。

假设我们有两个向量 A 和 B,它们的余弦相似度可以通过以下公式计算:

\\text{similarity} = \\cos(\\theta) = \\frac{\\mathbf{A} \\cdot \\mathbf{B}}{\|\\mathbf{A}\| \|\\mathbf{B}\|}

其中:

  • \\mathbf{A} \\cdot \\mathbf{B} 是向量 A 和 B 的点积(内积)。
  • \|\\mathbf{A}\| 和 和 和 \|\\mathbf{B}\| 分别是向量 A 和 B 的模长(长度)。

具体来说:

  • 点积(内积) \\mathbf{A} \\cdot \\mathbf{B} = \\sum_{i=1}\^{n} A_i B_i ,其中 (n) 是向量的维度。
  • 模长(长度) \|\\mathbf{A}\| = \\sqrt{\\sum_{i=1}{n} A_i\^2}

公式可以进一步展开为:

\\text{similarity} = \\frac{\\sum\\limits_{i=1}\^{n} A_i B_i}{\\sqrt{\\sum\\limits_{i=1}\^{n} A_i\^2} \\sqrt{\\sum\\limits_{i=1}\^{n} B_i\^2}}

示例计算

假设我们有两个向量 A 和 B,其中:

  • \\mathbf{A} = \[1, 2, 3\]
  • \\mathbf{B} = \[4, 5, 6\]

我们可以按照上述公式计算它们之间的余弦相似度:

  1. 点积
    \\mathbf{A} \\cdot \\mathbf{B} = 14 + 25 + 3\*6 = 4 + 10 + 18 = 32
  2. 模长
    • \|\\mathbf{A}\| = \\sqrt{12 + 22 + 3\^2} = \\sqrt{1 + 4 + 9} = \\sqrt{14}
    • \|\\mathbf{B}\| = \\sqrt{42 + 52 + 6\^2} = \\sqrt{16 + 25 + 36} = \\sqrt{77}
  3. 余弦相似度
    \\text{similarity} = \\frac{32}{\\sqrt{14} \\sqrt{77}} = \\frac{32}{\\sqrt{1078}}

我们可以使用 Python 来计算这个值:

python 复制代码
import numpy as np

# 定义两个向量
vector_a = np.array([1, 2, 3])
vector_b = np.array([4, 5, 6])

# 计算点积
dot_product = np.dot(vector_a, vector_b)

# 计算模长
norm_a = np.linalg.norm(vector_a)
norm_b = np.linalg.norm(vector_b)

# 计算余弦相似度
cosine_similarity = dot_product / (norm_a * norm_b)

print("Cosine similarity:", cosine_similarity)
相关推荐
测试人社区-小明7 小时前
智能弹性伸缩算法在测试环境中的实践与验证
人工智能·测试工具·算法·机器学习·金融·机器人·量子计算
人邮异步社区8 小时前
PRML为何是机器学习的经典书籍中的经典?
人工智能·机器学习
xiangzhihong88 小时前
使用 Trae IDE 一键将 Figma 转为前端代码
机器学习
Coding茶水间9 小时前
基于深度学习的反光衣检测系统演示与介绍(YOLOv12/v11/v8/v5模型+Pyqt5界面+训练代码+数据集)
图像处理·人工智能·深度学习·yolo·目标检测·机器学习·计算机视觉
露临霜9 小时前
重启机器学习
人工智能·机器学习
CappuccinoRose10 小时前
均值向量的检验
机器学习·均值向量·均值向量的检验·多元均值向量的检验
数据科学项目实践11 小时前
建模步骤 3 :数据探索(EDA) — 1、初步了解数据:常用函数
人工智能·python·机器学习·数据挖掘·数据分析·pandas·数据可视化
明月照山海-12 小时前
机器学习周报二十六
人工智能·机器学习·计算机视觉
Master_oid12 小时前
机器学习25:了解领域自适应(Domain Adaptation)
人工智能·深度学习·机器学习
陈天伟教授13 小时前
人工智能应用-机器视觉:车牌识别(2)
人工智能·神经网络·机器学习