本地文档批量统计词权

如果你需要在 Windows 桌面端对同一目录下大量纯文本做批量词频统计,并可选带上 TF-IDF、BM25 两列用于后续筛选或简报,可以用【批量文档词频权重统计工具】。下文只记操作与产物,不写任何公式或底层实现。

前置条件:语料必须是 .txt;放在同一主文件夹内,需要时勾选「遍历子目录」把子文件夹里的 txt 一并扫进来。

主界面选路径支持浏览与拖拽。计算选项里「词频」不可取消;需要对比「跨文档更显眼」的词时勾选 TF-IDF,需要另一种常见检索权重时再勾选 BM25,二者可同开。勾选后「显示排序」下拉里会出现对应字段,便于你在结果区按不同指标预览前 200 条。

过滤区「最小词长」「最小词频」按语料规模调。噪声多就提高词长或词频门槛。菜单「停用词/词典」里可维护停用词:从 txt 批量导入、导出备份、恢复默认,或在列表里增删。另有「自定义词典」页,按界面示例准备每行词条,可提升领域专有词被整词识别的概率。

点开始后排进度与日志;失败文件会标明读取问题。底部摘要给总文件数、成功/失败/跳过、总词数与去重词数。结果文本框仅展示前两百词,全量请用「导出」生成 CSV:在弹出框选排序字段、升降序、是否导出全部或仅前 N 条。

说明:纯标点、停用表里的词、过短的词以及纯数字形式会被过滤,具体以运行结果为准。若中途停止,是否仍能导出部分结果视当时完成情况而定,建议重要任务一次跑完或先小样验证。

相关推荐
小码哥哥1 天前
从TF-IDF到RAG:企业AI知识库检索技术的六次范式跃迁
人工智能·tf-idf
解局易否结局1 天前
鸿蒙端侧 NLP 实战:分词器 + TF-IDF + 朴素贝叶斯分类 + 文本相似度
华为·自然语言处理·分类·harmonyos·tf-idf
五条凪3 天前
简单理解 BM25 与 TF-IDF
人工智能·算法·搜索引擎·全文检索·tf-idf
All The Way North-3 天前
【NLP文本分类实战】随机森林 + TF-IDF 完整流程,准确率82.5%(数据分析/分词/模型训练)
随机森林·机器学习·nlp·tf-idf·文本分类·sklearn·保姆级教程
XGeFei4 天前
TF-IDF(词频-逆文档频率)
算法·tf-idf
想会飞的蒲公英14 天前
TF-IDF + 随机森林中文文本分类全链路实战:从训练脚本到 Flask API + Streamlit 前端
人工智能·pytorch·python·随机森林·分类·flask·tf-idf
TE-茶叶蛋1 个月前
TF-IDF 与 BM25 深度解析:从理论到项目实战
python·django·tf-idf
m沐沐2 个月前
【机器学习】NLP---用 Python+TF-IDF 给《红楼梦》自动提取关键词
人工智能·python·机器学习·自然语言处理·nlp·中文分词·tf-idf
SHolmes18542 个月前
TF-IDF为什么能找出文本里的重要词?
tf-idf
不会计算机的g_c__b2 个月前
基于酒店文本描述的相似酒店推荐系统:从TF-IDF到余弦相似度实战
tf-idf