分类算法——sklearn转换器和估计器(一)

转换器(特征工程的父类)

  • 实例化(实例化的是一个转换器类(Transformer))
  • 调用fit_transform(对于文档建立分类词频矩阵,不能同时调用)

把特征工程的接口称之为转换器,其中转换器调用有这么几种形式:

标准化:(X- mean) / std

  • fit_transform( )
  • fit()------计算每一列的平均值、标准差
  • transform()------(X- mean) /std进行最终的转换
bash 复制代码
In [1] : from sklearn.preprocessing import StandardScaler
In [2] : std1=StandardScaler()
In [3] : a=[[1,2,3],[4,5,6]]
In [4] : std1.ft_transform( a)
out [4] :
array ([[-1.,-1.,-1.],
	   [1.,1.,1.]])
	   
In [5] : std2=StandardScaler()
In [6] : std2.fit(a)
out[6] : StandardScaler(copy=True,with_mean=True,with_std=True)

In [7] : std2.transform(a)
out[7] :
array([[-1.,-1.,-1.],
	  [1.,1.,1.]])

从中可以看出,fit_transform的作用相当于transform加上fit。

bash 复制代码
In [8] : b=[[7,8,9],[10,11,12]]
In [9] : std2.transform(b)
out [9] :
array([[3.,3.,3.],
	  [5., 5.,5.]])
	  
In [10] : std2.fit_transform(b)
out [10] :
array([[-1.,-1.,-1.],
	  [1.,1.,1.]])

估计器(sklearn机器学习算法的实现)

在sklearn中,估计器(estimator)是一个重要的角色,是一类实现了算法的API

  • 1用于分类的估计器:
    • sklearn.neighbors k-近邻算法
    • sklearn.naive_bayes 贝叶斯
    • sklearn.linear_model.LogisticRegression 逻辑回归
    • sklearn.tree 决策树与随机森林
  • 2用于回归的估计器:
    • sklearn.linear_model.LinearRegression 线性回归
    • sklearn.linear_model.Ridge 岭回归
  • 3用于无监督学习的估计器:
    • sklearn.cluster.KMeans 聚类

估计器工作流程

  • 实例化一个estimator
  • estimator.fit(x train, y train) 计算
    一调用完毕,模型生成
  • 3模型评估:
    • ①直接比对真实值和预测值
      y_predict = estimator. predict(x_test)
      y_test == y_predict
    • ②计算准确率
      accuracy = estimator.score(x_test, y_test)
相关推荐
计算机源码社7 分钟前
【大数据项目实战】基于大数据的影视内容生态综合质量分析与可视化-基于数据挖掘的影视内容类型共现与口碑聚类分析系统
大数据·人工智能·python·数据挖掘·数据分析·毕业设计·课程设计
hqyjzsb7 小时前
Python 技术人转型 AI:CAIE Level I、Level II 对比怎么选
开发语言·人工智能·python·金融·数据挖掘·数据分析·aigc
sbjdhjd13 小时前
在 8 字符、字母数字过滤与 PHP 版本差异下复盘临时文件命令执行链 | (8字符绕过)
android·java·开发语言·安全·web安全·数据挖掘·php
泛联新安13 小时前
FPGA仿真加速:AccEmu正式亮相,一周的回归,一天跑完
机器学习·fpga开发·数据挖掘·回归·自动化·嵌入式软件·代码漏洞扫描
天行健,君子而铎15 小时前
数据分类分级的范式转换:从规则匹配到模型持续优化规模化前瞻算法
大数据·网络·数据库·安全·分类
TKcloudmaster_H15 小时前
告别低效运营:跨境数据分析 + 多账号矩阵增效方案
大数据·矩阵·数据挖掘·数据分析·新媒体运营·产品运营·流量运营
hqyjzsb1 天前
零 AI 项目经验,学 Python 转型 AI 的正确顺序是什么?
开发语言·人工智能·python·算法·职场和发展·数据挖掘·数据分析
SimpleLearingAI1 天前
DFL:分布焦点损失——让框回归“学分布“,而不只是“猜数字“
人工智能·数据挖掘·回归
m0_587383002 天前
全民健身解决方案软件开发:从架构设计到落地实践
人工智能·数据挖掘·系统架构·需求分析
萌新小码农‍2 天前
Logistic回归为什么不用均方误差 MSE(square error)
人工智能·数据挖掘·回归