【2025版李宏毅机器学习系列课程】CH2 机器学习 Training Guide

作业流程

General Guide

  • model bias:增加模型的flexibility,比如激活函数、更多层数等
  • model bias 还是 optimization ?
    • comparison
    • Start from shallower network (or other models), which are easier to optimize
    • If deeper networks do not obtain smaller loss on training data, then there is optimization issue.
  • Overfitting:flexibility太大,training data不够多导致的
    • more training data:
      • data augmentation 数据增强,对现有数据进行各种变换来生成更多数据,要合理变换
    • less flexibility , constrained model:
      • Less parameters:less神经元、less层数
      • sharing parameters:CNN
      • Less features
      • Early stopping
      • Regularization
      • Dropout

Bias-Complexity Trade-off

  • benchmark corpora:基准测试语料库
  • how to select the best one?
    • 不建议的做法:直接比较model 在 public testing set的分数来选择。WHY?类比猴子敲出莎士比亚,如果test很多遍,即使是很废模型,还是有可能拿到好分数
    • testing set分public和private:public one 可以看成是训练时会用的,private one可以理解为实际放出来给大众用的,在public testing set上表现好可能是用了某些手段导致在此过拟合,但是在private testing set的表现不好
    • 建议的做法:cross validation,用validation set 来选model,少看public testing set的结果
    • n-fold cross validation

Mismatch

  • training and testing data have different distribution

critical point:local minima、saddle point

  • gradient为0的点统称critical point:比如local minima、saddle point
  • 判断critical point的类型:Hessian
  • saddle point:可以沿着负特征值的特征向量去更新参数
  • local minima:When you have lots of parameters, perhaps local minima is rare
    可能在高维空间只是个saddle point
  • 经验上看,其实local minima其实不常见,多数是saddle point

Batch

  • shuffle after each epoch

  • Why batch? 如果不用batch,那就是整个training set一起训练,相当于batch size = training set size,即极端情况的large batch

    • Small Batch v.s. Large Batch

      • large batch:Long time for cool down, but powerful(稳定)
      • small batch:Short time for cool down, but powerful but noisy
    • 时间上,large batch 跑完一个epoch的时间反而短,因为GPU并行运算的能力

    • 但noisy反而会有利于training

    • 而且 Small batch is better on testing data,大的batch size会让我们倾向于走到峡谷里面

  • 总结:Batch size is a hyperparameter you have to decide

相关推荐
说私域几秒前
短视频私域流量池的变现路径创新:基于AI智能名片链动2+1模式S2B2C商城小程序的实践研究
大数据·人工智能·小程序
yugi9878384 分钟前
用于图像分类的EMAP:概念、实现与工具支持
人工智能·计算机视觉·分类
aigcapi7 分钟前
AI搜索排名提升:GEO优化如何成为企业增长新引擎
人工智能
彼岸花开了吗12 分钟前
构建AI智能体:八十、SVD知识整理与降维:从数据混沌到语义秩序的智能转换
人工智能·python·llm
MM_MS13 分钟前
Halcon图像锐化和图像增强、窗口的相关算子
大数据·图像处理·人工智能·opencv·算法·计算机视觉·视觉检测
韩师傅19 分钟前
前端开发消亡史:AI也无法掩盖没有设计创造力的真相
前端·人工智能·后端
AI大佬的小弟21 分钟前
【小白第一课】大模型基础知识(1)---大模型到底是啥?
人工智能·自然语言处理·开源·大模型基础·大模型分类·什么是大模型·国内外主流大模型
lambo mercy27 分钟前
无监督学习
人工智能·深度学习
阿里巴巴P8资深技术专家28 分钟前
基于 Spring AI 和 Redis 向量库的智能对话系统实践
人工智能·redis·spring
sunfove41 分钟前
致暗夜行路者:科研低谷期的自我心理重建
人工智能