Day25评价问题

评价问题本质是用科学指标判断模型好不好用,核心是"看模型预测结果和真实情况差多少",帮你选出效果最优的模型。

  1. 核心逻辑:先分数据,再看指标拆分数据:不能用训练模型的数据来评价(相当于考试偷看答案),要把数据分成两部分------训练集(教模型学习)和测试集(考模型效果)。

选对指标:根据任务类型挑指标,不同任务"好模型"的标准不同,比如:

  • 分类任务(如判断邮件是否为垃圾邮件):看准确率(对的占比)、召回率(漏判的少不少)。

  • 回归任务(如预测明天的气温):看MAE(平均绝对误差,误差越小越好)。

  1. 小白必避的2个坑
  • 坑1:指标只看一个。比如只看准确率,可能忽略"少数重要样本全错"的问题(如癌症检测漏诊)。

  • 坑2:测试集"污染"。如果测试集的数据提前被模型见过,评价结果会虚高,毫无参考价值。@浙大疏锦行

相关推荐
wno70418 分钟前
Spring Security权限控制
java·python·spring
ShineWinsu1 小时前
对于Coze—AI:SDK的解析
人工智能·python·ai·sdk·项目·coze·字节跳动
右耳朵猫AI1 小时前
Python周刊2026W38 | 标准流编码修复、PEP 845/846 草案、解析器提速 10%、集合字典二次复杂度
python·ai·数据科学
微软技术分享1 小时前
大模型网络结构:模型接口测试用例参考
python
Bruce_Liuxiaowei2 小时前
Python 实例赋值遮蔽类属性:一个从不报错的静默陷阱
开发语言·python·语法糖
做运维的阿瑞3 小时前
Python 标准库汇总:分类速览与常用模块清单
linux·运维·python
why-geo3 小时前
Hermes Agent 与 Python 的会产生什么样的碰撞
人工智能·python·ai编程
正经教主3 小时前
【FDE系列】阶段2:Day 29:FastAPI 进阶 — Pydantic 模型与完整 CRUD 实战
人工智能·python·fde
gCode Teacher 格码致知3 小时前
Pandas教学-6:coerce详解
python·pandas
梦在远山后3 小时前
Electron 与 FastAPI 如何完成流式 Agent 对话
python·langchain·agent