我将其整理为标准的 7大核心阶段,并特别区分了"验证"和"评估"在实际工作中的不同职责:
1. 业务定义与问题框架
在收集数据前,必须先定义目标:是分类、回归还是推荐?核心是定义评价指标(如准确率、召回率、AUC)------这个指标将指导后续所有工作。
2. 数据收集与探索
收集原始数据(数据库、API、日志),并进行探索性数据分析(EDA),查看数据分布、缺失值、异常值,验证数据是否足以解决业务问题。
3. 数据预处理与特征工程
这是最耗时的一步:清洗缺失值、编码类别变量、标准化/归一化,并提取/构造有意义的特征(特征工程)。数据质量直接决定模型上限。
4. 模型训练与调优
选择基础算法(如XGBoost、DNN),用训练集进行拟合。同时利用验证集 进行超参数调优(如网格搜索、贝叶斯优化),寻找最佳参数组合。
5. 模型验证
这里的"验证"特指离线验证 :使用训练中未见的**验证集(Validation Set)**检查模型是否过拟合,并利用交叉验证评估泛化能力。若效果不达标,需返回步骤3或4重新迭代。
6. 模型评估
这里的"评估"特指最终评估 :使用完全隔离、模型从未见过的测试集(Test Set) 进行最终打分。这步只能执行一次,以获取模型上线前的无偏最终性能指标(如业务KPI)。
7. 部署、监控与持续迭代
模型通过评估后,部署到生产环境提供推理服务。部署后需持续监控 :不仅看系统资源,更要监控模型漂移(数据漂移/概念漂移) 。当性能下滑时,触发模型重训/更新,开启新的生命周期循环。