DAY 37 早停策略与模型权重保存

📝 DAY 37 早停策略与模型权重保存


一、怎么判断模型过拟合?

过拟合就是模型在训练集表现特别好,但在测试集表现变差的情况。

  • 方法:同时打印训练集和测试集的指标(比如损失、准确率)
  • 信号:训练集损失持续下降,测试集损失先降后升,两者差距越来越大 → 过拟合了!

二、模型保存的 3 种方式

根据不同需求,选不同保存方法:

方式 保存内容 优点 适用场景
仅保存权重 只存模型参数(轻量级) 文件小、加载快 ✅ 模型部署(推理)、跨设备迁移
保存权重 + 模型结构 连模型结构一起存 加载后直接用,不用重写网络结构 ✅ 快速验证、代码共享
保存全部信息(Checkpoint) 权重 + 模型结构 + 优化器状态 + 当前 epoch 数 支持断点续训 ✅ 长时间训练、意外中断后继续训练

💡 对应文件后缀:

  • 仅权重 / 权重 + 结构:.pth
  • Checkpoint(断点续训):.ckpt
  • 跨框架迁移(比如给 TensorFlow 用):导出为 .onnx 格式

三、早停策略(防止过拟合的神器)

早停就是在模型开始过拟合前,提前结束训练,不用跑完所有 epoch。

核心逻辑

patience(耐心值)和 counter(计数器)来监控测试集损失:

  • patience:允许测试集损失连续多少轮不改善的最大次数
  • counter:当前连续没改善的轮数

不同情况怎么处理?

测试集损失趋势 counter 状态 早停是否触发 训练结果
持续下降 始终为 0 ❌ 不触发 一直训练到设定的 num_epochs 轮结束
稳定 / 波动(没超过 patience) 小于 patience ❌ 不触发 继续训练,再观察几轮
上升且连续 patience 轮没改善 等于 patience ✅ 触发 提前终止训练,保存当前最好模型

四、一句话速记

  • 过拟合判断:看训练集和测试集指标差距
  • 保存选择 :部署用 .pth 权重,续训用 .ckpt 断点,跨框架用 .onnx
  • 早停逻辑 :测试集损失连续 patience 轮不改善,就停!

@浙大疏锦行

相关推荐
vibecoding775 小时前
一文搞懂企业级 API 网关选型:12 个维度、4 类企业、7 步落地
人工智能·大模型·ai编程
Rocktech_ruixun6 小时前
机器人本地跑LLM大模型对主板硬件有什么要求?瑞迅科技RK3588/3568方案选型解析
人工智能·科技·嵌入式硬件·机器人·边缘计算
yxlalm6 小时前
Spring AI+RAG 01-项目背景与技术选型
java·人工智能·spring
tedcloud1236 小时前
Wand-Enhancer 怎么搭建?开源 Wand 客户端增强与远程控制工具介绍
大数据·服务器·人工智能·开源·音视频
科技苑6 小时前
如何用Python编程实现一个简单的Web爬虫?
人工智能·python
迅利科技6 小时前
新能源汽车零部件研发,SIMULIA一站式仿真解决方案如何缩短研发周期
人工智能·汽车
Databuff7 小时前
AI SSH工具,集齐SSH、SFTP、知识库RAG、AI助手
网络·人工智能·ssh
Blockchina7 小时前
从一篇文章到一条完整视频:用 Codex 搭建可复用的 AI 视频生产线
人工智能
Proaiapi8 小时前
一张图介绍gpt-image-2.5
人工智能·gpt
czxxxc8 小时前
当AI开始“动手”:一场从“会说”到“会做”的静默转折
人工智能