LLM(大语言模型)常用评测指标之F1-Score

F1-Score

F1-Score 是一种常用于评估分类模型性能的指标,特别是在数据不平衡的情况下。它是精确度 (Precision) 和召回率 (Recall) 的调和平均值,用于衡量模型对正类的预测能力。

计算方法

  1. 精确度 (Precision) :是指正确预测为正类的数量与所有预测为正类的数量之比。它反映了模型预测正类的准确性。
    P r e c i s i o n = T P T P + F P Precision = \frac{TP}{TP + FP} Precision=TP+FPTP

    其中,TP (True Positives) 是真正类的数量,FP (False Positives) 是假正类的数量。

  2. 召回率 (Recall) :是指正确预测为正类的数量与实际正类的数量之比。它反映了模型找出正类的能力。
    R e c a l l = T P T P + F N Recall = \frac{TP}{TP + FN} Recall=TP+FNTP

    其中,FN (False Negatives) 是假负类的数量。

  3. F1-Score :是精确度和召回率的调和平均值,用于平衡精确度和召回率。
    F 1 = 2 × P r e c i s i o n × R e c a l l P r e c i s i o n + R e c a l l F1 = 2 \times \frac{Precision \times Recall}{Precision + Recall} F1=2×Precision+RecallPrecision×Recall

应用场景

F1-Score 通常用于评估分类模型,尤其是在正负类样本不平衡的情况下。它帮助衡量模型对少数类的预测能力,因此在医学诊断、欺诈检测、文本分类等领域被广泛使用。

示例

假设一个二分类模型的混淆矩阵如下:

预测正类 预测负类
实际正类 TP = 80 FN = 20
实际负类 FP = 30 TN = 70
  • 精确度 (Precision) = 80 / (80 + 30) = 0.727
  • 召回率 (Recall) = 80 / (80 + 20) = 0.8
  • F1-Score = 2 * (0.727 * 0.8) / (0.727 + 0.8) = 0.761

因此,该模型的 F1-Score 为 0.761,反映了模型在平衡精确度和召回率方面的性能。

相关推荐
谭欣辰9 分钟前
C++ 排列组合完整指南
开发语言·c++·算法
love530love13 分钟前
精简版|Claude-HUD 插件介绍 + 一键安装教程
人工智能·windows·笔记
墨心@19 分钟前
赋予智能体技能,让其胜任现实世界任务
语言模型·大语言模型·agent
代码中介商23 分钟前
银行管理系统的业务血肉 —— 流程、状态机、输入校验与持久化(下篇)
c语言·算法
冬奇Lab31 分钟前
RAG 系列(四):文档处理——从原始文件到高质量 Chunk
人工智能·llm·源码
冬奇Lab37 分钟前
一天一个开源项目(第89篇):Warp - AI 驱动的现代化 Rust 终端
人工智能·rust·开源
蔡俊锋1 小时前
AI是一面镜子
人工智能·ai·规格说明书·ai是一面镜子
四方云1 小时前
Kamailio 启动报错 “invalid curve” 与 “freeing already freed pointer” 的终极解决方案
人工智能
foundbug9991 小时前
自适应滤除直达波干扰的MATLAB实现
开发语言·算法·matlab
沪漂阿龙1 小时前
OpenAI Agents SDK 深度解析(三):执行层——Agent 的“幕后指挥部”
人工智能·深度学习