LLM(大语言模型)常用评测指标之F1-Score

F1-Score

F1-Score 是一种常用于评估分类模型性能的指标,特别是在数据不平衡的情况下。它是精确度 (Precision) 和召回率 (Recall) 的调和平均值,用于衡量模型对正类的预测能力。

计算方法

  1. 精确度 (Precision) :是指正确预测为正类的数量与所有预测为正类的数量之比。它反映了模型预测正类的准确性。
    P r e c i s i o n = T P T P + F P Precision = \frac{TP}{TP + FP} Precision=TP+FPTP

    其中,TP (True Positives) 是真正类的数量,FP (False Positives) 是假正类的数量。

  2. 召回率 (Recall) :是指正确预测为正类的数量与实际正类的数量之比。它反映了模型找出正类的能力。
    R e c a l l = T P T P + F N Recall = \frac{TP}{TP + FN} Recall=TP+FNTP

    其中,FN (False Negatives) 是假负类的数量。

  3. F1-Score :是精确度和召回率的调和平均值,用于平衡精确度和召回率。
    F 1 = 2 × P r e c i s i o n × R e c a l l P r e c i s i o n + R e c a l l F1 = 2 \times \frac{Precision \times Recall}{Precision + Recall} F1=2×Precision+RecallPrecision×Recall

应用场景

F1-Score 通常用于评估分类模型,尤其是在正负类样本不平衡的情况下。它帮助衡量模型对少数类的预测能力,因此在医学诊断、欺诈检测、文本分类等领域被广泛使用。

示例

假设一个二分类模型的混淆矩阵如下:

预测正类 预测负类
实际正类 TP = 80 FN = 20
实际负类 FP = 30 TN = 70
  • 精确度 (Precision) = 80 / (80 + 30) = 0.727
  • 召回率 (Recall) = 80 / (80 + 20) = 0.8
  • F1-Score = 2 * (0.727 * 0.8) / (0.727 + 0.8) = 0.761

因此,该模型的 F1-Score 为 0.761,反映了模型在平衡精确度和召回率方面的性能。

相关推荐
我希望的一路生花10 分钟前
Nik Collection 6.2全新版Nik降噪锐化调色PS/LR插件
人工智能·计算机视觉·设计模式·stable diffusion·aigc
牵星术小白37 分钟前
【GNSS基带算法】Chapter.2 相干积分与非相干积分
算法
.银河系.1 小时前
819 机器学习-决策树2
人工智能·决策树·机器学习
哇哈哈QIQ2 小时前
2025.7.19卡码刷题-回溯算法-组合
算法
AI扶我青云志3 小时前
Milvus 安装和启动指南
人工智能·云原生·eureka·大模型
一只齐刘海的猫4 小时前
部署Qwen2.5-VL-7B-Instruct-GPTQ-Int3
人工智能·多模态
gihigo19984 小时前
matlab多目标优化差分进化算法
数据结构·算法
朝日六六花_LOCK4 小时前
深度学习之NLP基础
人工智能·深度学习·自然语言处理
weixin_582470174 小时前
GS-IR:3D 高斯喷溅用于逆向渲染
人工智能·算法
Lin9成5 小时前
机器学习集成算法与K-means聚类
算法