sklearn机器学习实战

1.PCA降维

不是每个数据特征对分析的问题都有用。即使有用,对问题的重要程度也不一样。而我们需要过滤和筛选一些特征,去除冗余。

数据降维是指采取某种映射方法,把高维空间中可能包含冗余信息和噪声的数据点映射到低维空间,在低维空间重新表示高维空间中的数据,挖掘数据内部本质结构特征,提高识别精度、减少计算量和空间复杂度。

PCA主成分分析,通过对矩阵进行奇异值分解,并期望在投影后的维度上方差最大,使得投影后的维度尽可能少,同时保留尽可能多的原数据特征。

pca = PCA(n_components=None, whiten=False, svd_solver='auto', iterated_power='auto', random_state=None)

其中:

· n_components指定要保留的成分的数量。

· svd设置奇异值分解的方法,如auto, full, arpack, randomized.

PCA对象的常用属性:

pca.components_:表示特征空间中的主成分,表示数据中最大方差的方向。

常用方法:

· fit(X):用X训练模型。

· fit_transform(X):用X拟合模型,并对X降维。

· transform(X):对X进行降维。

2.交叉验证 CV

确定模型后,应该设置合适的模型参数。

为了对模型进行评估,不同的数据集划分会影响结果。因此可以使用不同的划分评估并求平均值。

crossvalidation交叉验证,会反复划分数据集并评估模型。//相当于就直接train了然后直接求score。

cross_val_score(estimator, X, y=None, cv=None)

其中:

· estimator指定被评估的模型。

· X和y指定数据集和对应的label。

· cv指定划分策略,设置为整数时表示把数据集拆成几个部分对模型进行训练和评分、设置为None默认使用3折叠交叉验证。

scores = cross_val_score(..., cv=shuffleSpilt(test size=, train size=, n_splits=)) //交叉验证 随机拆分

3.网格搜索

代替多次交叉验证取得最优参数的过程。

gscv = GridSearchCV(estimator, paramgrid, scoring=None, fit_params=None, cv=None, refit=True)

其中:

· estimator用来设置待选择参数的模型。

· param设置待测试和选择的参数。

· scoring设置选择参数的评分函数。

· cv同上。

· refit设置是否使用在整个数据集上发现的最佳参数对模型进行重新拟合。

GridSearchCV类对象的属性:

· cv_results:交叉验证结果。

· best_estimator:得分最高的模型。

· best_score:最佳模型的平均得分。

· best_params:最佳参数。

· scorer:使用的评分函数。

· n_splits:交叉验证时折叠的数量。

~的方法:

· fit(X, y=None):使用所有参数拟合模型。

· predict(X):使用最佳参数调用模型的predict()方法。

· score(X, y=None):返回模型在指定数据上的得分。

· transform(X):使用最佳参数调用模型的transform()方法。

相关推荐
琅琊榜首202011 小时前
移动端AI挂机新范式:YOLOv8+NCNN实现无Root视觉自动化
人工智能·yolo·自动化
甲枫叶11 小时前
【claude+weelinking产品经理系列16】数据可视化——用图表讲述产品数据的故事
java·人工智能·python·信息可视化·产品经理·ai编程
大模型真好玩11 小时前
LangChain DeepAgents 速通指南(二)—— Summarization中间件为Agent作记忆加减法
人工智能·langchain·agent
北辰alk11 小时前
大模型微调技术全景解析:从LoRA到RLHF的演进之路
人工智能
未来之窗软件服务12 小时前
AI人工智能(二十一)pt模型转onnx sensvoice—东方仙盟练气期
人工智能·python·仙盟创梦ide·东方仙盟
2501_9464903812 小时前
Hirender MTC时间码技术实操——PH®CLUB激光投影声光电精准同步实现方案
大数据·运维·人工智能·hirender·hecoos
诚思报告YH12 小时前
半导体石英制品市场洞察:2026-2032年复合增长率(CAGR)达9.2%
大数据·人工智能
yohalaser12 小时前
智测破局提质 武汉曜华激光助力钙钛矿产线规模化量产
大数据·人工智能·太阳能·光伏发电·曜华激光·光伏组件生产线
苡~12 小时前
【openclaw+claude】手机+OpenClaw+Claude实现远程AI编程系列大纲
java·前端·人工智能·智能手机·ai编程·claude api
生成论实验室12 小时前
即事经智能:一种基于生成易算的通用智能新范式(书)
人工智能·神经网络·算法·架构·信息与通信