无监督学习中的经典聚类算法——K-Means笔记

一、无监督学习中的经典聚类算法------K-Means

  • 目的:在没有标签的情况下,把"相似样本"自动分到同一组,用于数据探索、分群、压缩、异常检测等场景

二、核心概念

  1. 聚类(Clustering)

    -- 无监督:没有 y 标签

    -- 目标:高内聚、低耦合

  2. 难点

    -- 如何评估好坏?

    -- 如何选取参数(主要是 K)?

三、距离度量(先选"像不像"的尺子)

  • 欧式距离(L2):多维直线距离,最常用

  • 曼哈顿距离(L1):坐标轴绝对轴距之和,适合高维稀疏

四、K-Means 算法流程("三步走")

  1. 随机选 K 个初始中心

  2. 分配:每个样本→距其最近的中心所属簇

  3. 更新:重新计算各簇中心(均值)

    循环 2-3 步直到中心不再移动或达到 max_iter

五、评估指标

  • SSE(类内平方和):越小越紧凑

  • CH 指数:同时衡量类内紧密度与类间分离度,越大越好

  • 轮廓系数(Silhouette):-1,1,>0.5 通常可接受

六、优缺点速记

优点:

✓ 原理简单、实现容易、速度快、可并行

缺点:

✗ K 值需事先给定

✗ 对初值敏感(随机初始中心)

✗ 只能发现"球形"簇,对任意形状、密度差异大数据表现差

✗ 对异常值/噪声敏感

七、关键超参数

  • n_clusters(K):簇的数量

  • max_iter:最大迭代次数

  • n_init:随机运行次数,取最好结果

  • random_state:随机种子,复现实验

相关推荐
商业白皮书24 分钟前
用手机怎么拍证件照?光线、机位、姿态和后期制作步骤
笔记
GlueNa2SiO31 小时前
05-Flask表单处理与文件上传
笔记·python·学习·flask
STQY燊桐启元(深圳)电子科技1 小时前
免涂硅脂新时代,ST‑PCMTC96 与 ST‑PCM180 相变陶瓷片重构功率器件热管理
经验分享·笔记·重构·pcm
LuminousCPP1 小时前
数据结构-二叉树(三):堆复杂度证明与 Top-K 问题|错位相减推导 + 海量数据内存优化
c语言·数据结构·笔记·排序算法
GlueNa2SiO32 小时前
04-Flask数据库操作SQLAlchemy
笔记·python·flask
浔溺3 小时前
al+大数据每日学习笔记28
笔记·学习
FakeOccupational5 小时前
【github 有趣项目】OpenPLC: 支持通用硬件的开源 PLC 软件平台‌
笔记
xian_wwq10 小时前
【学习笔记】-深度认知系列-第2讲-大模型到底是什么?——拆解“参数、训练、推理”
笔记·学习·深度认知
Oll Correct13 小时前
Adobe illustrator 案例九:百宝箱图标绘制
笔记·ui·adobe·illustrator
M78佐菲14 小时前
Linux学习笔记:进程
linux·笔记·学习·算法