想要通过矩阵相乘去计算7个二进制编码相互间的余弦相似性, 我们得先把二进制编码转成数值向量, 针对每个二进制编码, 我们能够把0映射成-1, 把1映射成1, 借此得到一个数值向量, 接着, 我们能够把这些数值向量表示成一个矩阵, 进而进行矩阵相乘去计算余弦相似性。
以下是一个示例代码,使用和NumPy库来执行此操作:
import numpy as np
# 7个二进制编码
binary_codes = [
[0, 1, 0, 1, 1, 0, 0],
[1, 0, 1, 0, 0, 1, 1],
[0, 0, 1, 0, 1, 0, 1],
[1, 1, 1, 0, 0, 1, 0],
[1, 0, 0, 1, 0, 1, 0],
[0, 1, 0, 0, 1, 0, 1],
[1, 1, 0, 1, 1, 0, 1]
]
# 将二进制编码转换为数值向量
vectorized_codes = np.array(binary_codes) * 2 - 1
# 计算余弦相似性
cosine_similarity = np.dot(vectorized_codes, vectorized_codes.T) / np.outer(np.linalg.norm(vectorized_codes, axis=1), np.linalg.norm(vectorized_codes, axis=1))
print(cosine_similarity)
上面所说的代码, 会输出一个矩阵, 这个矩阵是7x7的, 当中的每个元素, 代表着第i个二进制编码跟第j个二进制编码之间的余弦相似性, 值的范围处于-1到1之间, 越朝着1靠近说明相似性越高, 越朝着-1靠近说明相似性越低, 对角线上的元素, 意味着每个编码与自身的相似性, 所以都应当为1。
计算余弦相似性之际, 我们得去比较向量间的夹角, 二进制编码是由0与1构成的序列, 它不含连续的数值信息, 没办法直接计算向量间的夹角,所以, 我们有必要把二进制编码转化成数值向量, 以此来进行余弦相似性的计算。

把二进制编码转成数值向量, 有一种常见办法, 那就是把0映射成-1, 把1映射成1。这么做是为了留存二进制编码的相对性质, 也就是把0还有1分别映射到数值空间里两个相距较远的点。经由这种映射, 我们能够计算向量间的夹角, 并且用余弦相似性当作相似性度量。
请留意, 此方法假定二进制编码里的0与1有着同等的重要程度, 要是对特定问题而言, 0和1带有不一样的含义或者重要性, 或许就得采用别的数值映射方式。
要是打算运用汉明距离去比较二进制编码相互间的相似程度, 能直接对编码之间的汉明距离予以计算。什么是汉明距离呢, 它指的是在长度一模一样的两个二进制编码里, 处于对应位置上不一样的位数。
下来是, 一个示例代码, 其用途是, 用以计算, 7个二进制编码, 相互之间的, 汉明距离。
# 7个二进制编码
binary_codes = [
[0, 1, 0, 1, 1, 0, 0],
[1, 0, 1, 0, 0, 1, 1],
[0, 0, 1, 0, 1, 0, 1],
[1, 1, 1, 0, 0, 1, 0],
[1, 0, 0, 1, 0, 1, 0],
[0, 1, 0, 0, 1, 0, 1],
[1, 1, 0, 1, 1, 0, 1]
]
# 计算汉明距离矩阵
hamming_distance = []
for i in range(len(binary_codes)):
row = []
for j in range(len(binary_codes)):
distance = sum(bit1 != bit2 for bit1, bit2 in zip(binary_codes[i], binary_codes[j]))
row.append(distance)
hamming_distance.append(row)
# 输出汉明距离矩阵
for row in hamming_distance:
print(row)