机器学习PCA

PCA Principal Component Analysis ,主成分分析) 是一种无监督降维方法:在尽量保留方差(信息)的前提下,把数据投影到更低维空间。

核心思想

高维数据里,很多方向变化很小(冗余)。PCA 找一组正交的新坐标轴(主成分),使得:

  1. 1 主成分:投影后方差最大
  2. 2 主成分:与第 1 正交,且方差次大
  3. 依此类推

用前 个主成分近似原数据 → 降维、去相关、便于可视化。

计算步骤(对应代码)

步骤 含义 notebook
1. 中心化/标准化 去均值,消除量纲影响 calc_cov 里对 X 标准化
2. 协方差矩阵 刻画特征间相关与方差
3. 特征分解 np.linalg.eig
4. 排序取前 k 大 → 该方向信息多 argsort()::-1,取前 n_components
5. 投影 为前 个特征向量) np.matmul(X, eigenvectors)

直观理解

  • 特征值 :该主成分能解释多少方差
  • 特征向量 :主成分方向
  • 降到 2/3 维后画散点(鸢尾花示例),是为了看类别是否仍大致可分

LDA 的区别

PCA LDA
是否用标签 否(无监督) 是(有监督)
目标 方差最大 类间大、类内小
用途 降维、压缩、可视化 分类相关的有监督降维

一句话: PCA = 对协方差矩阵做特征分解,用方差最大的几个方向做投影,实现降维。

** **代码** **

复制代码
import numpy as np

class PCA():
    # 计算协方差矩阵
    def calc_cov(self, X):
        m = X.shape[0]
        # 数据标准化
        X = (X - np.mean(X, axis=0)) / np.var(X, axis=0)
        return 1 / m * np.matmul(X.T, X)

    def pca(self, X, n_components):
        # 计算协方差矩阵
        cov_matrix = self.calc_cov(X)
        # 计算协方差矩阵的特征值和对应特征向量
        eigenvalues, eigenvectors = np.linalg.eig(cov_matrix)
        # 对特征值排序
        idx = eigenvalues.argsort()[::-1]
        # 取最大的前n_component组
        eigenvectors = eigenvectors[:, idx]
        eigenvectors = eigenvectors[:, :n_components]
        # Y=PX转换
        return np.matmul(X, eigenvectors)

** **代码** **

复制代码
from sklearn import datasets
import matplotlib.pyplot as plt

# 导入sklearn数据集
iris = datasets.load_iris()
X = iris.data
y = iris.target

# 将数据降维到3个主成分
X_trans = PCA().pca(X, 3)
# 颜色列表
colors = ['navy', 'turquoise', 'darkorange']

# 绘制不同类别
for c, i, target_name in zip(colors, [0,1,2], iris.target_names):
    plt.scatter(X_trans[y == i, 0], X_trans[y == i, 1],
            color=c, lw=2, label=target_name)
# 添加图例
plt.legend()
plt.show();

** **代码** **

复制代码
# 导入sklearn降维模块
from sklearn import decomposition
# 创建pca模型实例,主成分个数为3个
pca = decomposition.PCA(n_components=3)
# 模型拟合
pca.fit(X)
# 拟合模型并将模型应用于数据X
X_trans = pca.transform(X)

# 颜色列表
colors = ['navy', 'turquoise', 'darkorange']
# 绘制不同类别
for c, i, target_name in zip(colors, [0,1,2], iris.target_names):
    plt.scatter(X_trans[y == i, 0], X_trans[y == i, 1], 
            color=c, lw=2, label=target_name)
# 添加图例
plt.legend()
plt.show();
相关推荐
2601_9499506313 小时前
练题簿,把培训从“走过场”变成“真落地”
人工智能·学习·小程序·刷题·小程序推荐
诸神缄默不语14 小时前
备战 AI 出海 DAY 0:海外数据采集
大数据·人工智能
Ysn071916 小时前
YOLO-Master工程:experts.py 专家结构详解与目标检测专家设计启发
人工智能·yolo·目标检测
BingoGo16 小时前
使用 GPT-6 Astra 模型 请立刻更新你的 Skill 与提示词
人工智能
香菜+16 小时前
端侧视频分析 · 架构笔记
人工智能
s1ckrain16 小时前
【论文阅读】A Survey on Vision–Language–Action Models for Embodied AI
论文阅读·人工智能·多模态·具身智能
深圳雨林凯AI16 小时前
图案裂变的“风格归一化“设计思路:主体保得住,画风才拉得齐|雨林凯AI技术笔记
人工智能·笔记
DevNo16 小时前
英文会议转中文纪要,三款AI工具实测体验
人工智能
深小乐16 小时前
AI 说话越来越难懂?Anthropic 员工都在用 ELI5 这个图解 Skill
人工智能
问天_观心16 小时前
大模型微调学习(二)
人工智能·python·深度学习·学习·语言模型·transformer