NLP 笔记:TF-IDF

  • TF-IDF(Term Frequency-Inverse Document Frequency,词频-逆文档频率)是一种用于信息检索和文本挖掘的统计方法,用来评估一个词在一组文档中的重要性

  • TF-IDF的基本思想是,如果某个词在一篇文档中出现频率高,但在其他文档中很少出现,那么它可能具有很高的重要性

  • TF-IDF由两个主要部分组成:

    复制代码
    TF-IDF(x) = TF(x)*IDF(x)
    • TF(词频)
      • TF代表的是某个词在一篇文档中出现的频率。
      • 这个频率可以通过计算词在文档中出现的次数与该文档中总词数的比例来得到。
      • 词频衡量了某个词在特定文档中的重要性
        • w是某个单词
        • d是特定文档
        • count(w,d)------这个单词在这个文档中出现的次数
        • size(d)------这个文档的单词数量
    • IDF(逆文档频率)
      • ​​​​​​​IDF则衡量的是某个词在整个文档集中的普遍性
      • IDF用来降低那些在很多文档中都出现过的常用词(如"的"、"是")的权重,使得独特而少见的词更为突出
        • n------文档总数
        • docs(w,D)------词w出现在文件集D的多少个文件中
相关推荐
凉、介18 小时前
别再把 PCIe 的 inbound/outbound、iATU 和 eDMA 混为一谈
linux·笔记·学习·嵌入式·pcie
雷工笔记20 小时前
MES / WMS / AGV 交互时序图及生产管理模块界面设计清单
人工智能·笔记
大邳草民20 小时前
Python 中 global 与 nonlocal 的语义与机制
开发语言·笔记·python
landuochong20021 小时前
claude-obsidian 再升级
人工智能·笔记·claudecode
CheerWWW21 小时前
C++学习笔记——线程、计时器、多维数组、排序
c++·笔记·学习
ljt272496066121 小时前
Compose笔记(七十六)--拍照预览
笔记·android jetpack
ZC跨境爬虫21 小时前
dankoe视频笔记:如何培养对自己喜欢之事的痴迷感
人工智能·笔记·搜索引擎
新手小新21 小时前
C#学习笔记1-在VS CODE部署C#开发环境
笔记·学习·c#
DevOpenClub1 天前
NLP 命名实体识别 API 接口
人工智能·自然语言处理
ZC跨境爬虫1 天前
Dan koe视频笔记: 个人成长与目标设定的重要性
人工智能·笔记·搜索引擎