【Python机器学习】预处理对监督学习的作用

还是用cancer数据集,观察使用MinMaxScaler对学习SVC的作用。

首先,在原始数据上拟合SVC:

python 复制代码
cancer=load_breast_cancer()
X_train,X_test,y_train,y_test=train_test_split(
    cancer.data,cancer.target,random_state=0
)
svm=SVC(C=100)
svm.fit(X_train,y_train)
print('test set accuracy:{:.2f}'.format(svm.score(X_test,y_test)))

下面先用MinMaxScaler对数据进行缩放,然后再拟合SVC:

python 复制代码
scaler=MinMaxScaler()
scaler.fit(X_train)
X_train_scaler=scaler.transform(X_train)
X_test_scaler=scaler.transform(X_test)

svm.fit(X_train_scaler,y_train)

print('Scaler test set accuracy:{:.2f}'.format(svm.score(X_test_scaler,y_test)))

可以发现,数据缩放的作用非常显著。虽然数据缩放不涉及任何复杂的数据,但良好的做法仍然是使用scikit-learn提供的缩放机制,而不是自己重新实现它们,因为即使在这些简单的计算中也容易犯错。

还可以通过改变使用的类将一种预处理算法替换成另一种,因为所有的预处理类都具有相同的接口,都包含fit和transform方法:

python 复制代码
scaler=StandardScaler()
scaler.fit(X_train)
X_train_scaler=scaler.transform(X_train)
X_test_scaler=scaler.transform(X_test)

svm.fit(X_train_scaler,y_train)

print('SVM test accuracy:{:.2f}'.format(svm.score(X_test_scaler,y_test)))
相关推荐
Henry-SAP2 分钟前
SAP MRP类型与计划策略配置精髓解析
人工智能·云原生·sap·erp
未若君雅裁3 分钟前
Agent 的结构化输出,ProviderStrategy、ToolStrategy 与错误重试
python·langchain
筑梦geo5 分钟前
天津口碑好的天津GEO获客公司哪家好 - 成本透明度
人工智能·天津口碑好的
DeepIntelli6 分钟前
GEO 团队选型
人工智能·chatgpt
洛兮银儿7 分钟前
pycharm选中同一个词的标记颜色的修改
ide·python·pycharm
Nontee7 分钟前
腾讯 Hy4 开源:770B 旗舰,和一句“它参与了自己的训练“
人工智能·开源
一切皆是因缘际会12 分钟前
智能革新
人工智能·科技
Csvn17 分钟前
评测集不是“一堆问题”,是“测试资产”——30 条结构化评测集(E02)
人工智能·agent
OpenBayes22 分钟前
Qwen3.8-27B-FP8 降低大模型部署门槛,开启高效多模态智能体验;MiniMax H3-1K 发布千段视频测试数据集,全面评估 AI 视频生成能力
人工智能·深度学习·计算机视觉·自然语言处理·语音识别·多模态大模型
2601_9623878223 分钟前
用Python进行机器学习(4)K-Means算法
机器学习·无监督学习·聚类算法·k-means·数据分组