机器学习 —— 总结

一、KNN算法 (分类问题&回归问题)

python 复制代码
#分类
from sklearn.neighbors import KNeighborsClassifier   
#回归
from sklearn.neighbors import KNeighborsRegressor

思想: 近朱者赤近墨者黑

核心: 计算距离

1.曼哈顿距离

2.欧式距离

3.切比雪夫距离

4.闵氏距离

方案:

分类:多数表决

回归:算平均

https://blog.csdn.net/i_k_o_x_s/article/details/159694910?spm=1001.2014.3001.5502

二、线性回归 (回归问题)

python 复制代码
from sklearn.linear_model import LinearRegression
python 复制代码
#正规方程模型
from sklearn.linear_model import LinearRegression 
python 复制代码
#梯度下降法
from sklearn.linear_model import SGDRegressor 

一元线性

y = wx + b (w:权重 b: 偏置)

多元线性

y = W转置*X + b

线性回归评估方案

1.最小二乘

2.MSE/MAE/RMSE

python 复制代码
from sklearn.metrics import (
    mean_squared_error ,        #MSE  均方误差
    mean_absolute_error,        #MAE  平均绝对误差
    root_mean_squared_error)    #RMSE 均方根误差

前置概念: 误差 = 预测值 - 真实值

损失函数

回归损失最小:

1.正规方程(矩阵存在可逆)

2.梯度下降 W新 = W旧 - 学习率 * 梯度

导数 , 矩阵

https://blog.csdn.net/i_k_o_x_s/article/details/159929680?spm=1001.2014.3001.5502

https://blog.csdn.net/i_k_o_x_s/article/details/159995884?spm=1001.2014.3001.5502

三、逻辑回归 (二分类神器)

python 复制代码
# 混淆矩阵
from sklearn.metrics import confusion_matrix 

from sklearn.metrics import (
    accuracy_score,   # 准确率
    recall_score,     # 召回率
    precision_score,  # 精确率
    f1_score          # F1分数
)

思想:把线性回归的输出作为激活函数的输入 ,设置阈值完成分类

核心:sigmoid 二分类、 激活函数(深度学习)

目的:增加模型的非线性能力

分类模型评估:

1.混淆矩阵

2.准确率

3.精确率

4.召回率

5.F1-score

https://blog.csdn.net/i_k_o_x_s/article/details/160083736?spm=1001.2014.3001.5502

https://blog.csdn.net/i_k_o_x_s/article/details/160087403?spm=1001.2014.3001.5502

四、聚类算法 K-means (无监督学习算法)

python 复制代码
#聚类算法
from sklearn.cluster import KMeans 
#造数据
from sklearn.datasets import make_blobs 
#CH指标 评估聚类算法的   CH数值越大,说明聚类效果越好
from sklearn.metrics import calinski_harabasz_score 

1.K-means算法流程

<1> 选定 K个 质心点,几个质心点也就几个簇

<2> 算距离 ,每个样本点与质心点算距离,该样本点离哪个质心点近,就归于哪个簇

<3> 根据每个簇的样本点,内部重新计算新的聚类中心(平均值)

<4> 如果计算得出新的点 和 上一个质心点 位置一样,停止聚类。否则 <2>,<3>.

如果存在一个样本点和两个质心点的距离一样。随机分给一个簇 ..(后续 方法)

2.评估指标: CH 越大越好

https://blog.csdn.net/i_k_o_x_s/article/details/160087753?spm=1001.2014.3001.5502

五、特征工程

数据预处理

python 复制代码
#切分数据集
from sklearn.model_selection import train_test_split 

量纲问题

1.归一法

python 复制代码
# 归一化
from sklearn.preprocessing import MinMaxScaler

2.标准法

python 复制代码
# 标准化
from sklearn.preprocessing import StandardScaler

https://blog.csdn.net/i_k_o_x_s/article/details/159807413?spm=1001.2014.3001.5502

六、模型建模流程

1.准备数据

2.数据处理 缺失值 思考:是否存在量纲问题 _标准化 归一化

3.特征工程

4.模型训练

5.模型预测

6.模型评估

https://blog.csdn.net/i_k_o_x_s/article/details/159696090?spm=1001.2014.3001.5502

相关推荐
格林威11 分钟前
C# 相机Burst模式图像采集:使用相机内存配合OpenCvSharp和Halcon实现短时间的高速采集的方法
开发语言·人工智能·数码相机·计算机视觉·c#·视觉检测·工业相机
轮到我狗叫了16 分钟前
Slurm如何使用
人工智能·python·深度学习·机器学习
AI创界者20 分钟前
【开源硬核】comfyUI MiniMax H3 融合模型本地部署一键整合包!单卡撬动 2K 影音全模态输出,附避坑指南
人工智能·aigc
2601_9637491024 分钟前
越华环保集团|河湖工况下数字化污水治理云边协同采集架构实现
人工智能·架构
闪学it28 分钟前
小滴课堂-AI大模型小龙虾-OpenClaw-0基础从入门到实战
人工智能
代码方舟29 分钟前
零信任架构实战:基于天远手机携号转网V即时版构建自动化营销风控网关
人工智能·智能手机·架构·自动化
会周易的程序员29 分钟前
企业私有 AI 算力服务器架构设计:异构四节点 + QUIC 微服务
运维·服务器·c++·人工智能·微服务·架构
闪学it32 分钟前
AE影视后期特效-遮罩/调色/抠像/MG动画/3D/Vlog制作
人工智能
Shulex37 分钟前
电商 AI 客服接管率怎么提升?从指标口径到转人工规则
大数据·人工智能·智能客服·跨境电商
海盗123437 分钟前
AI新闻日报_2026-08-24——AI 安全从理论风险变成现实事件——Coding Agent 越狱与具身机器人运动会共塑“干活即合规“新基线
人工智能·安全·机器人