【Python机器学习】利用PCA来简化数据——示例:利用PCA对半导体制造数据降维

数据背景:

通过半导体工程上的一些过程数据,对一些产品进行是否有缺陷的验证。

数据样例:

数据中包含了590个特征,且存在很多的缺失值,这些缺失值是以NaN标识的。因为在590个特征下,几乎所有样本都有NaN,因此去除不完整的样本不太现实。尽管我们可以将所有的NaN替换成0,但是由于并不知道这些值的意义,所以这样做是下策。比如如果有特征是温度值,那么这样处理就会出问题。

下面我们用平均值来代替缺失值,平均值根据那些非NaN得到:

python 复制代码
def replaceNanWithMean():
    datMat=loadDataSet('test/secom.data',' ')
    numFeat=shape(datMat)[1]
    for i in range(numFeat):
        #计算所有非NaN的平均值
        meanVal=mean(datMat[nonzero(~isnan(datMat[:,i].A))[0],i])
        #将所有的NaN置为平均值
        datMat[nonzero(isnan(datMat[:,i].A))[0],i]=meanVal
    return datMat

上述代码首先打开了数据集并计算出了其特征的数目,然后再在所有的特征上进行循环。对于每个特征,首先计算出那些非NaN值的平均值。然后,将所有的NaN替换成该平均值。

我们已经去除了所有的NaN,接下来在数据集上应用PCA。首先确认所需特征和可以去除特征的数目。PCA会给出数据中所包含的信息量。需要注意的是,数据和信息之间具有巨大的区别。数据指的是接收的原始材料,其中可能包含噪声和不相关信息。信息是指数据中的相关部分。这些并非只是抽象概念,我们还可以定量的计算数据中所包含的信息并决定保留的比例。

通过已有代码去除均值、计算协方差矩阵:

python 复制代码
dataMat=replaceNanWithMean()
meanVals=mean(dataMat,axis=0)
meanRemoved=dataMat-meanVals
covMat=cov(meanRemoved,rowvar=0)

最后对该矩阵进行特征值分析:

python 复制代码
eigVals,eigVects=linalg.eig(mat(covMat))
print(eigVals)

如上图,有很多数值,其中,有超过20%的特征值都是0,这意味着这些特征都是其他特征的副本,也就是说它们可以通过其他特征来表示,而本身没有提供额外的信息。

从大小排序来看,前15个的数量级大于10^5,这些是重要特征,只占所有特征的一部分。

相关推荐
鹿角片ljp6 分钟前
Java框架篇:Spring + SpringMVC + SpringBoot + MyBatis深度复习
java·开发语言
火山引擎开发者社区10 分钟前
火山引擎开源 Agent 驱动的搜索自迭代技术
人工智能
董员外14 分钟前
RAG 系统进化论(七):Multimodal RAG(多模态 RAG),当知识存在于表格、图片和页面中
人工智能·后端·设计模式
玉鸯17 分钟前
多 Agent 并行时如何保证状态一致性?
分布式·python·agent
QYR-分析17 分钟前
RISC-V AI加速器SoC行业研究报告:开放架构赋能AI芯片,高增赛道开启国产化新机遇
人工智能·架构·risc-v
沐籽李18 分钟前
HuDiff在抗体人源化项目中的工程化落地
人工智能·算法·aidd·抗体设计
IvorySQL18 分钟前
PostgreSQL 日报| GiST 索引扫描可见性缺陷(8 月 3 日)
数据库·人工智能·postgresql·开源
众人皆醒我独醉18 分钟前
KServe:Kubernetes 原生的模型推理平台——把 vLLM/TGI/Triton 变成 Serverless
人工智能·ci/cd·面试
studyrunner18 分钟前
【AI开源】reverse-skill 实战教程:为 Claude Code、Cursor、Cline、Codex 配置 AI 逆向与安全技能路由
人工智能·安全·开源
zzzll111121 分钟前
0基础入门大模型:一份清晰的学习路线图
人工智能·学习·chatgpt