机器学习PCA

PCA ( Principal Component Analysis ,主成分分析) 是一种无监督降维方法:在尽量保留方差(信息)的前提下,把数据投影到更低维空间。

核心思想

高维数据里,很多方向变化很小(冗余)。PCA 找一组正交的新坐标轴(主成分),使得:

  1. 第 1 主成分:投影后方差最大
  2. 第 2 主成分:与第 1 正交,且方差次大
  3. 依此类推

用前 个主成分近似原数据 → 降维、去相关、便于可视化。

计算步骤(对应代码)

步骤 含义 notebook
1. 中心化/标准化 去均值,消除量纲影响 calc_cov 里对 X 标准化
2. 协方差矩阵 刻画特征间相关与方差
3. 特征分解 np.linalg.eig
4. 排序取前 k 大 → 该方向信息多 argsort()::-1,取前 n_components
5. 投影 ( 为前 个特征向量) np.matmul(X, eigenvectors)

直观理解

  • 特征值 :该主成分能解释多少方差
  • 特征向量 :主成分方向
  • 降到 2/3 维后画散点(鸢尾花示例),是为了看类别是否仍大致可分

和 LDA 的区别

PCA LDA
是否用标签 否(无监督) 是(有监督)
目标 方差最大 类间大、类内小
用途 降维、压缩、可视化 分类相关的有监督降维

一句话: PCA = 对协方差矩阵做特征分解,用方差最大的几个方向做投影,实现降维。

** **代码** **

复制代码
import numpy as np

class PCA():
    # 计算协方差矩阵
    def calc_cov(self, X):
        m = X.shape[0]
        # 数据标准化
        X = (X - np.mean(X, axis=0)) / np.var(X, axis=0)
        return 1 / m * np.matmul(X.T, X)

    def pca(self, X, n_components):
        # 计算协方差矩阵
        cov_matrix = self.calc_cov(X)
        # 计算协方差矩阵的特征值和对应特征向量
        eigenvalues, eigenvectors = np.linalg.eig(cov_matrix)
        # 对特征值排序
        idx = eigenvalues.argsort()[::-1]
        # 取最大的前n_component组
        eigenvectors = eigenvectors[:, idx]
        eigenvectors = eigenvectors[:, :n_components]
        # Y=PX转换
        return np.matmul(X, eigenvectors)

** **代码** **

复制代码
from sklearn import datasets
import matplotlib.pyplot as plt

# 导入sklearn数据集
iris = datasets.load_iris()
X = iris.data
y = iris.target

# 将数据降维到3个主成分
X_trans = PCA().pca(X, 3)
# 颜色列表
colors = ['navy', 'turquoise', 'darkorange']

# 绘制不同类别
for c, i, target_name in zip(colors, [0,1,2], iris.target_names):
    plt.scatter(X_trans[y == i, 0], X_trans[y == i, 1],
            color=c, lw=2, label=target_name)
# 添加图例
plt.legend()
plt.show();

** **代码** **

复制代码
# 导入sklearn降维模块
from sklearn import decomposition
# 创建pca模型实例,主成分个数为3个
pca = decomposition.PCA(n_components=3)
# 模型拟合
pca.fit(X)
# 拟合模型并将模型应用于数据X
X_trans = pca.transform(X)

# 颜色列表
colors = ['navy', 'turquoise', 'darkorange']
# 绘制不同类别
for c, i, target_name in zip(colors, [0,1,2], iris.target_names):
    plt.scatter(X_trans[y == i, 0], X_trans[y == i, 1], 
            color=c, lw=2, label=target_name)
# 添加图例
plt.legend()
plt.show();
相关推荐
回眸&啤酒鸭4 天前
【回眸】Minicart 电商购物车核心功能落地指南
人工智能
一隅论数智4 天前
给AI一张“业务概念地图“:本体如何从哲学走向企业智能
大数据·人工智能·经验分享·笔记·学习·学习方法·政务
AI的探索之旅4 天前
97 个 OpenCV 实例(三十):双目立体,从标定到点云
人工智能·opencv·计算机视觉
AlbertZein4 天前
Step-5-Preview 上手实测:3D 游戏、金融分析、网页设计一次跑完
人工智能·aigc
LaughingZhu4 天前
Product Hunt 每日热榜 | 2026-09-19
人工智能·深度学习·神经网络·搜索引擎·百度
美狐美颜SDK开放平台4 天前
开发直播APP时如何接入视频美颜SDK?开发流程与注意事项
android·人工智能·计算机视觉·音视频·直播美颜sdk
wukangjupingbb4 天前
智能网联汽车安全能力框架
人工智能
龙亘川4 天前
明月照湾区,智启新赛道:从顶流文旅IP盛会看智慧文旅升级路径
人工智能·智慧城市·开源软件·数据可视化
飞猫的边缘AI4 天前
边缘AI应用:家用AI摄像头怎么做数据训练?
人工智能·边缘计算·ai算法·边缘ai