当前目录下的excel文件的两列内容的相似度比较

-- coding: utf-8 --**

from sklearn.feature_extraction.text import CountVectorizer

from sklearn.metrics.pairwise import cosine_similarity

import numpy as np

import pandas as pd

import os

获取当前目录

current_dir = os.getcwd()

获取当前目录下所有xlsx文件名

xlsx_files = file for file in os.listdir(current_dir) if file.endswith(".xlsx")

打印xlsx文件名

for file in xlsx_files:

print(file)

读取Excel文件

excel_file = file

data = pd.read_excel(excel_file)

提取第3列和第5列的值

column3_values = data.iloc:, 1 # 第3列的值

column5_values = data.iloc:, 3 # 第5列的值

打印提取的值

print("第3列的值:")

print(column3_values)

print("\n第5列的值:")

print(column5_values)

print(len(column3_values))

print(len(column5_values))

res=\[\]

# 两段话

for i in range(len(column3_values)):

创建计数向量器

vectorizer = CountVectorizer().fit_transform(column3_values\[i, column5_valuesi])

计算余弦相似度

cosine_sim = cosine_similarity(vectorizer)

提取余弦相似度值

similarity_value = cosine_sim01

if similarity_value>0.3:

res.append("正确")

elif similarity_value>0.05 and similarity_value<0.3:

res.append("部分正确")

else:

res.append("错误")

res.append(similarity_value)

print("两段话的余弦相似度:", similarity_value)

指定txt文件名

txt_file =excel_file.replace(".xlsx","")+".txt"

将列表逐行写入txt文件

with open(txt_file, 'w') as f:

for item in res:

f.write("%s\n" % item)

print("内容已写入到", txt_file)

相关推荐
文人sec44 分钟前
玩转excel数据透视表和图表
excel
leihefeng5 小时前
PX06-对比两个 Excel 文件的差异:从逐单元格到生产级实现
python·excel
我的愿望是成为富婆9 小时前
HR数字化校招技术栈拆解:SQL、Excel、Power BI和AI工具在2026届JD中的真实权重
人工智能·sql·excel
泡海椒10 小时前
JQuick-Excel 项目定位与适用场景:声明式 Java Excel 的边界
java·开发语言·excel
96245610 小时前
从 Excel 营业流水到可验证测试订单:测试数据导入工具工程复盘
excel
用户03321266636712 小时前
Python 实现 Excel 转 XML:快速上手
python·excel
asdzx6713 小时前
Excel 水印方案对比:页眉图片 vs 背景图片(附 C# 实现)
c#·excel
Data-Miner1 天前
怎么用AI给Excel去重?先核对这7条再下手,别让好数据被删错:数以轻舟方案解析
人工智能·excel
Data-Miner1 天前
做表格数据分析的AI工具怎么选?先对一下这三个真实需求,再看哪些真能落地
人工智能·数据分析·excel
宿州派大星7 天前
【Python实战】:基于 OpenCV + dlib 的传统换脸术原理与实战
opencv·python3.11·dlib