数据可视化02-PCA降维

一、PCA

**PCA做什么?**找坐标系。

**目标?**二维降到一维,信息保留最多。

**怎么样最好?**数据分布最分散的方向(方差最大),作为主成分(坐标轴)。

二、怎么找主成分?

PC1的确定: 每个点的 之和最小, 之和最大。

**PC2的确定:**过原点,且与PC1垂直。

**PCA降维的核心思想是:**用少数几个最重要的方向(主成分PC1)来表示数据,而不是用所有方向。

为什么可以降噪?

  1. 舍弃次要方向: 噪声(偏离的点)通常分布在次要方向(如PC2)上,降维时舍弃这些方向,相当于过滤了一部分噪声。

  2. 压缩噪声的影响: 即使噪声点在PC1上仍有偏离,它们的偏离程度比在原始数据中要小。

三、特征值与特征向量

(一)特征向量

简单来说,特征向量定义了新的坐标轴的方向

(二)特征值

特征值表示了每个主成分在数据集中的方差贡献率

(三)碎石图

相关推荐
三块钱07948 分钟前
如何让AI视频模型(如Veo)开口说中文?一个顶级提示词的深度拆解
人工智能
杜子不疼.15 分钟前
《Python学习之文件操作:从入门到精通》
数据库·python·学习
轻松Ai享生活15 分钟前
从0-1学习CUDA | week 1
人工智能
蒋星熠18 分钟前
C++零拷贝网络编程实战:从理论到生产环境的性能优化之路
网络·c++·人工智能·深度学习·性能优化·系统架构
微小的xx21 分钟前
java + html 图片点击文字验证码
java·python·html
wayman_he_何大民22 分钟前
初始机器学习算法 - 关联分析
前端·人工智能
杭州泽沃电子科技有限公司28 分钟前
告别翻山越岭!智能监拍远程守护输电线路安全
运维·人工智能·科技·安全
wayman_he_何大民31 分钟前
初始机器学习算法 - 聚类分析
前端·人工智能
金色旭光31 分钟前
uv 现代化的虚拟环境管理工具
python·python进阶
TDengine (老段)38 分钟前
TDengine IDMP 高级功能(4. 元素引用)
大数据·数据库·人工智能·物联网·数据分析·时序数据库·tdengine