【AI】机器学习常见的指标及其解释

机器学习常见的指标及其解释

机器学习中的评估指标种类繁多,没有"万能指标",选择完全取决于你所解决的任务类型(分类、回归、聚类、排序等)以及业务关注的重点。


一、回归任务(预测连续数值)

这类任务评估的是"预测值"与"真实值"之间的偏差程度。

指标 英文全称 计算公式/含义 核心特点与适用场景
MAE 平均绝对误差 1n∑∣yi−y^i∣\frac{1}{n}\sum|y_i - \hat{y}_i|n1∑∣yi−y^i∣ 直观,表示平均差多少。对异常值不敏感,适合业务解释(如房价预测)。
MSE 均方误差 1n∑(yi−y^i)2\frac{1}{n}\sum(y_i - \hat{y}_i)^2n1∑(yi−y^i)2 放大较大误差,对异常值非常敏感。常用于优化目标(梯度更平滑)。
RMSE 均方根误差 MSE\sqrt{MSE}MSE 量纲与原始数据一致,比MSE更直观。对异常值敏感,不适合含大量离群点的数据。
MAPE 平均绝对百分比误差 100%n∑∣yi−y^iyi∣\frac{100\%}{n}\sum|\frac{y_i - \hat{y}_i}{y_i}|n100%∑∣yiyi−y^i∣ 相对百分比 ,直观易懂,适合不同尺度数据的对比(如销量预测)。 ⚠️ 致命弱点:真实值为0时无意义,且实际值很小时会异常放大。
SMAPE 对称平均绝对百分比误差 改进版MAPE,分母取$( y_i| + |\hat{y}_i|)/2$
R² (决定系数) Coefficient of Determination 1−SSresSStot1 - \frac{SS_{res}}{SS_{tot}}1−SStotSSres 模型解释力,取值(-∞, 1]。衡量模型比简单均值好多少。负值说明模型还不如直接取平均值。

二、分类任务(预测离散标签)

这是机器学习最庞大的评估体系,包含二分类、多分类和特殊的不平衡分类场景。

1. 基础指标(基于混淆矩阵)
指标 核心公式 通俗理解 适用场景
准确率 (Accuracy) (TP+TN)/Total 整体猜对的比例 适合各类别样本数量大致均衡的场景(如手写数字识别)。
精确率 (Precision) TP/(TP+FP) "宁缺毋滥",预测为正例的样本中有多少是真正的正例。 垃圾邮件过滤(宁愿漏掉,不愿误把正常邮件放垃圾箱)。
召回率 (Recall) TP/(TP+FN) "宁可错杀一千",所有真实正例中有多少被成功找出来。 疾病筛查、金融风控(漏掉一个病人的后果比误判严重)。
F1-Score (2 * (P * R) / (P + R)) 精确率和召回率的调和平均。 需要同时兼顾P和R,且数据存在不均衡时(如信用卡欺诈)。
2. 高级指标(不均衡数据专用)
  • AUC-ROC :衡量模型对正负样本排序能力 的阈值无关指标。AUC=0.5相当于随机猜,越接近1越好。它对正负样本比例不敏感,是不均衡分类的首选标准。
  • AUC-PR (PR曲线下面积):当负例极多,正例极少时,PR曲线比ROC曲线更能反映模型表现(因为ROC可能因TN多而虚高)。

三、聚类任务(无监督,无标签)

评估聚类效果通常分为内部评估 (无需真实标签)和外部评估(需要真实标签)。

指标 适用类型 核心逻辑
轮廓系数 (Silhouette Score) 内部评估(最常用) 综合衡量簇内紧密 (内聚度)和簇间分离(分离度),取值-1, 1,越大越好。
戴维斯-布尔丁指数 (DBI) 内部评估 衡量簇内距离与簇间距离之比,越小代表聚类效果越好。
调整兰德指数 (ARI) 外部评估(需真实标签) 衡量两个数据划分的相似程度,已校正随机性,取值-1, 1。
互信息 (NMI) 外部评估 衡量真实标签与聚类标签的共享信息量,取值0, 1,越大越好。

四、排序与推荐系统(Top-K场景)

评估模型返回的前K个结果的优劣。

指标 核心含义 适用场景
NDCG@K 归一化折损累计增益:考虑排序位置的顺序权重(排名越靠前,权重越大)。 搜索引擎、电商推荐,用户更关心首页前几名的结果。
MRR 平均倒数排名:关注第一个正确答案出现的位置。 问答系统、导航查询(只关心最匹配的那一个)。
Hit Rate (Recall@K) 前K个推荐结果中是否包含了用户真实喜欢的物品。 粗略评估推荐系统的命中覆盖能力。

五、生成式AI / 大语言模型(文本生成)

这类任务有独特的评估方式,但也是争议最大的。

指标 核心逻辑 缺点
困惑度 (Perplexity) 衡量模型对测试数据预测概率的倒数,越低代表模型越不"困惑"。 只反映模型自信度,与生成文本的实际质量(通顺、逻辑)关联不大。
BLEU 衡量生成文本与参考译文之间的N-gram精确匹配(侧重精确率)。 惩罚短句,不擅长同义词识别,只适合机器翻译。
ROUGE 衡量生成文本与参考文本的N-gram重叠率(侧重召回率)。 主要用于文本摘要评估。
BERTScore / GPTScore 利用BERT/GPT等预训练模型计算语义向量相似度。 算力消耗大,但比BLEU更能捕捉语义(最新趋势)。

🎯 如何快速做出选择?(决策树)

  1. 业务是预测具体数值? → 选 MAE (易解释)或 RMSE (放大错误);若需要百分比看 MAPE(确保Y没有0)。
  2. 业务是分类,且类别均衡? → 准确率 足够,但建议附带 混淆矩阵。
  3. 业务是分类,且正负样本极度不均? (如欺诈、癌症)→ 舍弃准确率,紧盯 召回率(Recall) 和 AUC-ROC ,或使用 F1。
  4. 业务是推荐/搜索? → 关注 NDCG@K 和 Hit Rate@K。
  5. 业务是无监督聚类? → 首选 轮廓系数。
相关推荐
Qyr991 小时前
2026-2032年全球高可靠性电阻器市场发展全景与竞争格局解析
人工智能·物联网
红海云1 小时前
向机制要活力,以数字促转型:国企“三能”改革深水区攻坚策略
人工智能
weixin_448119941 小时前
Datawhale Easy Data × AI:构建知识与记忆驱动的 Agent笔记8
人工智能·笔记·react.js
Fibocom广和通1 小时前
IMC 2026|从连接到规模部署,广和通深化印度IoT市场布局
人工智能
蜗牛互联网1 小时前
Python + JSON Schema 实现工单结构化输出与本地复核
java·人工智能·后端
华微软件1 小时前
华微软件 AI 领域新增一项国家发明专利
人工智能
jimmyleeee2 小时前
大模型安全之四十五:从数据到输出----GenAI 版权、知识产权与伦理合规实战指南
人工智能·深度学习·安全
loulanyue_2 小时前
构建实时沉浸式世界模型体验:AI+IP与商业模式重构——读Reactor首席技术官Bryce 2026云栖专场演讲
人工智能·重构
面包狗AI4S2 小时前
【AI4S】生化环材高可信技术与产业周报(2026-10-03—2026-10-09)
人工智能·深度学习·机器学习·ai