【Educoder数据挖掘实训】用Cosine计算相似度

【Educoder数据挖掘实训】用Cosine计算相似度

开挖挖挖挖

这个题目跟上一个实训很类似,区别在于本关旨在计算文本的相似度。

这里虽然说的是文本相似度但是却没有提及顺序的问题,比如否定句"不喜欢"和疑问句"喜欢不"在本实训中认为是完全相同的。

首先计算方式是基于 j i e b a jieba jieba库中的函数 j i e b a . c u t jieba.cut jieba.cut,把句子拆分成不同的单词,喜欢不和不喜欢都会被拆分成"不"和"喜欢"。

然后将两个句子的词取并集作为词库,而后进行数量统计。

最后用 c o s i n e cosine cosine计算相似度即可。

计算公式为:
c o s = x 1 ∗ x 2 + y 1 ∗ y 2 x 1 2 + y 1 2 x 2 2 + y 2 2 cos = \frac{x_1*x_2 + y_1 * y_ 2}{\sqrt{x_1^2 +y_1^2}\sqrt{x_2^2 + y_2^2}} cos=x12+y12 x22+y22 x1∗x2+y1∗y2

代码如下:

python 复制代码
import numpy as np
import jieba
def cosine_similarity(sentence1: str, sentence2: str) -> float:
    #1.实现文本分词
    ########## Begin ##########
    seg1 = [word for word in jieba.cut(sentence1)]
    seg2 = [word for word in jieba.cut(sentence2)]
    ########## End ##########
    #2.建立词库
    ########## Begin ##########
    word_list = list(set([word for word in seg1 + seg2]))#建立词库
    ########## End ##########
    word_count_vec_1 = []
    word_count_vec_2 = []
    for word in word_list:
        #3.统计各个文本在词典里出现词的次数
        ########## Begin ##########
        word_count_vec_1.append(seg1.count(word))
        word_count_vec_2.append(seg2.count(word))
        ########## End ##########
    vec_1 = np.array(word_count_vec_1)
    vec_2 = np.array(word_count_vec_2)
    #4.余弦公式
    ########## Begin ##########
    num = vec_1.dot(vec_2.T)
    denom = np.linalg.norm(vec_1) * np.linalg.norm(vec_2)
    cos = num / denom
    ########## End ##########
    return cos
str1="湖南是一个好地方"
str2="湖南好吃的在哪里"
sim1=cosine_similarity(str1,str2)
print(sim1)
相关推荐
searchforAI几秒前
2026国产AI笔记工具横评:Get笔记、Ai好记、通义听悟、BiBiGPT各有什么特色?
人工智能·笔记·学习·ai·音视频·知识图谱·知识库
学术小白人1 分钟前
【早鸟优惠】第二届AI赋能图像处理与计算机视觉技术国际学术研讨会(AIPCVT 2026)
大数据·人工智能·医学·数字能源·学术会议参会
咕咕AI学堂2 分钟前
AI 任务调度算法:从优先级队列到公平调度的推理服务资源分配
人工智能
LaughingZhu4 分钟前
Product Hunt 每日热榜 | 2026-06-16
前端·人工智能·经验分享·chatgpt·html
guygg885 分钟前
二维弹塑性有限元分析(von Mises 等向硬化)— MATLAB 实现
开发语言·人工智能·matlab
三千花灯10 分钟前
【Playwright】 自动化测试之参数化登录(Excel/CSV 数据源)
人工智能·机器学习·excel
johnny23313 分钟前
Agent记忆框架:MemPalace、Cognee、Hindsight、memories.ai
人工智能
YOLO数据集集合14 分钟前
无人机风电设备智能巡检 风机叶片缺陷目标检测数据集实战 | 表面腐蚀漏油识别 工业视觉质检 深度学习模型训练落地10337期
人工智能·深度学习·目标检测·计算机视觉·无人机
zhenlai201214 分钟前
Vue3 + SpringBoot + AI:我做了一个股票分析工具(第1周复盘)
人工智能·spring boot·后端
装不满的克莱因瓶15 分钟前
【工业领域】了解目标检测基本流程——从数据到部署的完整工程化思路
人工智能·python·深度学习·机器学习·计算机视觉·目标跟踪·工业领域