LLM(大语言模型)常用评测指标之F1-Score

F1-Score

F1-Score 是一种常用于评估分类模型性能的指标,特别是在数据不平衡的情况下。它是精确度 (Precision) 和召回率 (Recall) 的调和平均值,用于衡量模型对正类的预测能力。

计算方法

  1. 精确度 (Precision) :是指正确预测为正类的数量与所有预测为正类的数量之比。它反映了模型预测正类的准确性。
    P r e c i s i o n = T P T P + F P Precision = \frac{TP}{TP + FP} Precision=TP+FPTP

    其中,TP (True Positives) 是真正类的数量,FP (False Positives) 是假正类的数量。

  2. 召回率 (Recall) :是指正确预测为正类的数量与实际正类的数量之比。它反映了模型找出正类的能力。
    R e c a l l = T P T P + F N Recall = \frac{TP}{TP + FN} Recall=TP+FNTP

    其中,FN (False Negatives) 是假负类的数量。

  3. F1-Score :是精确度和召回率的调和平均值,用于平衡精确度和召回率。
    F 1 = 2 × P r e c i s i o n × R e c a l l P r e c i s i o n + R e c a l l F1 = 2 \times \frac{Precision \times Recall}{Precision + Recall} F1=2×Precision+RecallPrecision×Recall

应用场景

F1-Score 通常用于评估分类模型,尤其是在正负类样本不平衡的情况下。它帮助衡量模型对少数类的预测能力,因此在医学诊断、欺诈检测、文本分类等领域被广泛使用。

示例

假设一个二分类模型的混淆矩阵如下:

预测正类 预测负类
实际正类 TP = 80 FN = 20
实际负类 FP = 30 TN = 70
  • 精确度 (Precision) = 80 / (80 + 30) = 0.727
  • 召回率 (Recall) = 80 / (80 + 20) = 0.8
  • F1-Score = 2 * (0.727 * 0.8) / (0.727 + 0.8) = 0.761

因此,该模型的 F1-Score 为 0.761,反映了模型在平衡精确度和召回率方面的性能。

相关推荐
aigcapi1 分钟前
AI搜索排名提升:GEO优化如何成为企业增长新引擎
人工智能
mit6.8245 分钟前
几何|阻碍链
算法
彼岸花开了吗6 分钟前
构建AI智能体:八十、SVD知识整理与降维:从数据混沌到语义秩序的智能转换
人工智能·python·llm
有一个好名字7 分钟前
力扣-小行星碰撞
算法·leetcode·职场和发展
MM_MS7 分钟前
Halcon图像锐化和图像增强、窗口的相关算子
大数据·图像处理·人工智能·opencv·算法·计算机视觉·视觉检测
韩师傅13 分钟前
前端开发消亡史:AI也无法掩盖没有设计创造力的真相
前端·人工智能·后端
AI大佬的小弟15 分钟前
【小白第一课】大模型基础知识(1)---大模型到底是啥?
人工智能·自然语言处理·开源·大模型基础·大模型分类·什么是大模型·国内外主流大模型
lamentropetion15 分钟前
E - Equal Tree Sums CF1656E
算法
代码游侠16 分钟前
应用——智能配电箱监控系统
linux·服务器·数据库·笔记·算法·sqlite
lambo mercy22 分钟前
无监督学习
人工智能·深度学习