目录标题
一、建模流程
1.获取数据
2.数据基本处理
3.特征工程
4.机器学习(模型训练)
5.模型评估
- 模型预测

二、特征工程
特征提取,特征预处理,特征降维,特征选择,特征组合
重点是:特征提取和特征预处理
利用专业背景知识和技巧处理数据,让机器学习算法效果最好,这个过程就是特征工程
数据和特征决定了机器学习的上限,而模型和算法只是逼近这个上限而已
- 特征提取

- 特征预处理
特征预处理:
两种解决办法:
采用归一化(受到最大值和最小值影响),标准化(均值)

- 特征降维

- 特征选择

- 特征组合

特征工程下 特征预处理

归一化公式:

标准化公式:


标准化代码api调用

看下面结果:以第一列特征为例

对比:

三、拟合


泛化:模型在新数据集(非训练数据)上的表现好坏的能力 = 模型的拟合情况
奥卡姆剃刀原则: 给定两个具有相同泛化失误的模型,较简单的模型比复杂的模型更可取
四、鸢尾花案例
步骤:
加载数据,数据预处理,特征工程,模型训练,模型评估,模型预测

第一步: 利用导入包获取鸢尾花测试数据

第二步: 利用导入的包,将测试数据分为训练集和测试集(第四个参数要给,不然每次生成随机数据都不一致)

PPT实例代码

第三步: 特征处理

第四,五步 训练模型,模型预测(用测试集预测)

第四,五步 训练模型,模型预测(用自定义预测)

第六步 训练评估
