TF-IDF (Term Frequency-Inverse Document Frequency,词频-逆文档频率)是信息检索与文本挖掘中最基础、最经典的特征加权技术。
其基本思想 可以概括为一句话:"如果一个词在单篇文档中反复出现,但在整个文档集合的其他文档中极少出现,那么这个词对这篇文档而言就具有极高的区分度和重要性。"
为了帮你透彻理解,我把它拆解为两个核心逻辑,并直接关联到你刚才提到的"需求声音库"场景:
1. 两个核心因素的"攻守同盟"
-
TF(词频,Term Frequency)------衡量"局部重要性":
-
逻辑:在一篇特定的文档(比如某条差评工单)里,某个词出现得越频繁,它在这篇文档里就越重要。
-
举例:如果用户在一条反馈里反复提到"闪退"、"闪退"、"闪退",那么"闪退"大概率是这条反馈的核心痛点。
-
-
IDF(逆文档频率,Inverse Document Frequency)------惩罚"全局普遍性":
-
逻辑:如果一个词在所有文档中都普遍存在(比如"的"、"了"、"登录"),那么它的区分价值就极低,需要被降权打压。
-
举例:几乎每篇文档都有"登录"这个词,那它就不能帮助我们将"支付报错"和"界面卡顿"区别开,因此IDF会赋予它一个极低的权重。
-
最终公式 :TF−IDF=TF×IDFTF−IDF=TF×IDF。只有**"文档内部频率高(TF高)"且"全库范围内稀有(IDF高)"**的词,才能获得最高的最终权重。