-
TF-IDF(Term Frequency-Inverse Document Frequency,词频-逆文档频率)是一种用于信息检索和文本挖掘的统计方法,用来评估一个词在一组文档中的重要性。
-
TF-IDF的基本思想是,如果某个词在一篇文档中出现频率高,但在其他文档中很少出现,那么它可能具有很高的重要性
-
TF-IDF由两个主要部分组成:
TF-IDF(x) = TF(x)*IDF(x)- TF(词频)
- TF代表的是某个词在一篇文档中出现的频率。
- 这个频率可以通过计算词在文档中出现的次数与该文档中总词数的比例来得到。
- 词频衡量了某个词在特定文档中的重要性。
- w是某个单词
- d是特定文档
- count(w,d)------这个单词在这个文档中出现的次数
- size(d)------这个文档的单词数量
- IDF(逆文档频率)
- IDF则衡量的是某个词在整个文档集中的普遍性
- IDF用来降低那些在很多文档中都出现过的常用词(如"的"、"是")的权重,使得独特而少见的词更为突出
- n------文档总数
- docs(w,D)------词w出现在文件集D的多少个文件中
- TF(词频)
NLP 笔记:TF-IDF
UQI-LIUWJ2024-05-06 6:05
相关推荐
小李不想当小白8 分钟前
PCB结构与组成(PCB设计入门学习笔记)Omics Pro11 分钟前
1个月2轮融资!长寿虚拟细胞hanlin0336 分钟前
刷题笔记:力扣第76题-最小覆盖子串hengmeida37 分钟前
楼宇控制柜标准化项目交付完整规范tiger86539 分钟前
大语言模型面试和题解,梳理中国主流开源 LLM 系列的发展脉络、技术路线与工程取舍蒸蒸yyyyzwd1 小时前
cpp 选手秋招学习笔记 day40有范先生1 小时前
速食米饭:如何避开闷味、干硬的速食主食长葡萄的叶子1 小时前
AI Agent 中的 Skill:从 Tool 调用到任务能力封装tiger8651 小时前
大语言模型面试和题解,Context Engineering 怎么做?长 Prompt、动态上下文与 Memory 管理LuminousCPP1 小时前
Linux系统编程(二):从目录树到命令执行|路径、环境变量、alias 与文件操作入门