Day25评价问题

评价问题本质是用科学指标判断模型好不好用,核心是"看模型预测结果和真实情况差多少",帮你选出效果最优的模型。

  1. 核心逻辑:先分数据,再看指标拆分数据:不能用训练模型的数据来评价(相当于考试偷看答案),要把数据分成两部分------训练集(教模型学习)和测试集(考模型效果)。

选对指标:根据任务类型挑指标,不同任务"好模型"的标准不同,比如:

  • 分类任务(如判断邮件是否为垃圾邮件):看准确率(对的占比)、召回率(漏判的少不少)。

  • 回归任务(如预测明天的气温):看MAE(平均绝对误差,误差越小越好)。

  1. 小白必避的2个坑
  • 坑1:指标只看一个。比如只看准确率,可能忽略"少数重要样本全错"的问题(如癌症检测漏诊)。

  • 坑2:测试集"污染"。如果测试集的数据提前被模型见过,评价结果会虚高,毫无参考价值。@浙大疏锦行

相关推荐
卷无止境18 分钟前
Coding Agent 里的上下文 Compact,到底在压缩什么
后端·python
Patrick在香港30 分钟前
Claude Prompt Caching 实测账单:第一轮贵 25%,从第二轮开始省 86%
python·prompt·claude·成本优化·prompt缓存·anthropic api
新时代牛马33 分钟前
字符设备注册:从cdev_add 到chrdev_open 的 VFS路径
python
life16934 分钟前
python requests采集同花顺F10、龙虎榜数据
python·同花顺·龙虎榜
angushine44 分钟前
qwen3-tts使用实例
python·tts
陈年老古董1 小时前
OpenCV实战:文档扫描与图像风格迁移
人工智能·python·opencv·计算机视觉
benchmark_cc2 小时前
数据 API 稳定性为什么会影响量化策略?从数据获取到信号执行的完整分析
开发语言·python·数据分析·量化·股票数据·quantdash·量化数据源
STLearner2 小时前
KDD 2026 | (2月轮)时空数据(Spatial-Temporal)论文总结时空(交通)预测,轨迹数据挖掘(表示,生成)
论文阅读·人工智能·python·深度学习·学习·机器学习·数据挖掘
axinawang2 小时前
ddddocr--识别验证码
python
2601_962180332 小时前
python——Django 框架
开发语言·python·django