分类算法3.1 sklearn转换器和估计器;3.2 K-近邻算法

3.1 sklearn转换器和估计器

转换器

估计器(estimator)

3.1.1 sklearn转换器 ------特征工程的父类

1.实例化(实例化的是一个转换器类(transforer))

2.调用fit_transform(对于文档建立分类词频矩阵,不能同时调用)

标准化:

(x-mean)/std

fit_transform()

fit() :计算 每一列的平均值,标准差

transform() :(x-mean)/std进行最终的转换

3.1.2 估计器(sklearn机器学习算法的实现)

估计器工作流程

估计器(estimator)

  1. 实例化一个estimator

  2. estimator.fit(x_train,y_train) 计算

  3. 模型评估:

1) 直接比对真实值和预测值

y_preidct = estimator.predict(x_test)

y_test == y_predict

  1. 计算准确率

accuray = estimator.score(x_test,y_test)

3.2 K-近邻算法

3.2.1什么是K-近邻算法

1.K-近邻算法(KNN)原理

这个算法是机器学习中一个比较经典的算法。

定义:

如果一个样本在特征空间中的k个最相似(即特征空间中最邻近)的样本中的大多数属于某一个类别,则该样本也属于这个类别。

距离公式:

求算距离有以下几种方法:

曼哈顿距离,绝对值距离,明可夫斯基距离。

2 电影类型分析

电影类型分析

k = 1 爱情片

k = 2 爱情片

k = 6 无法确定

k = 7 动作片

3 问题

如果取的最近的电影数量不一样,会是什么结果?

k值取得过小,容易受到异常点的影响

k值取得过大,样本不均衡的影响

结合前面的约会对象数据,分析K-近邻算法需要做什么样的处理

3.2.2 K-近邻算法API

3.2.3 案例1 : 鸢尾花种类预测

1 数据集介绍

iris数据集是常用的分类实验室数据集,有Fsisher,1936收集整理,iris也称鸢尾花卉数据集,是一类多重变量分析的数据集。

1)获取数据

2)数据集划分

3)特征工程

标准化

4)KNN预估器流程

5)模型评估

pycharm代码:

3.2.4 K-近邻总结

优点:简单,易于理解,易于实现,无需训练

缺点:懒惰算法,对测试样本分类时的计算量大,内存开销大

必须使用指定k值,k值选择不当则分类精度不能保证

使用场景:小数据场景,几千-几万样本,具体场景具体业务去测试

相关推荐
汤姆和佩琦6 小时前
2025-1-21-sklearn学习(43) 使用 scikit-learn 介绍机器学习 楼上阑干横斗柄,寒露人远鸡相应。
人工智能·python·学习·机器学习·scikit-learn·sklearn
缺的不是资料,是学习的心7 小时前
使用qwen作为基座训练分类大模型
python·机器学习·分类
沉木渡香14 小时前
[2025分类&时序异常检测指标R-AUC与VUS]
分类·数据挖掘·时序异常检测·vus·r-auc
云天徽上17 小时前
【数据可视化】全国星巴克门店可视化
人工智能·机器学习·信息可视化·数据挖掘·数据分析
大乔乔布斯18 小时前
数据挖掘常用算法模型简介
决策树·数据挖掘·线性回归
睡不着还睡不醒19 小时前
【深度学习】神经网络实战分类与回归任务
深度学习·神经网络·分类
知识鱼丸19 小时前
machine learning knn算法之使用KNN对鸢尾花数据集进行分类
算法·机器学习·分类
周杰伦_Jay19 小时前
简洁明了:介绍大模型的基本概念(大模型和小模型、模型分类、发展历程、泛化和微调)
人工智能·算法·机器学习·生成对抗网络·分类·数据挖掘·transformer
赛丽曼1 天前
机器学习-分类算法评估标准
人工智能·机器学习·分类
汤姆和佩琦1 天前
2025-1-20-sklearn学习(42) 使用scikit-learn计算 钿车罗帕,相逢处,自有暗尘随马。
人工智能·python·学习·机器学习·scikit-learn·sklearn