K-Means 聚类的目标函数:簇内误差平方和

1. 什么是 K-Means?

K-Means 是一种无监督迭代式 的聚类算法:

给定数据集 {x₁, x₂, ..., xₙ} 与预设簇数 K,算法把样本划分为 K 个不相交的簇 C₁, C₂, ..., Cₖ,使得同一簇内样本尽可能相似,不同簇间样本尽可能远离

核心思想:

> "让簇内'抱团',让簇间'疏远'。"


2. 目标函数 J:簇内误差平方和(WCSS)

K-Means 用几何距离 衡量相似性,目标函数 J 定义为:
J=∑k=1K∑x∈Ck∥x−μk∥2 J = \sum_{k=1}^{K} \sum_{x \in C_k} \|x - \mu_k\|^2 J=k=1∑Kx∈Ck∑∥x−μk∥2

  • μₖ:第 k 个簇的质心(centroid)
  • ‖x − μₖ‖²:样本到所属质心的欧氏距离平方
  • J 的物理意义:Within-Cluster Sum of Squares (WCSS),即"簇内误差平方和"

> 算法目标 :找到使 J 最小的簇划分 {C₁,...,Cₖ} 与质心 {μ₁,...,μₖ}


3. 迭代两步:坐标下降求 J

K-Means 采用坐标下降策略,交替更新两个变量:

步骤 固定量 优化量 公式
E步 (Assignment) 质心 μₖ 样本归属 Cₖ Cₖ = {x : ‖x − μₖ‖² ≤ ‖x − μⱼ‖², ∀j}
M步 (Update) Cₖ 质心 μₖ μₖ = (1/Cₖ) ∑_{x∈Cₖ} x

示例

python 复制代码
def kmeans(X, K, max_iter=100):
    n, d = X.shape
    mu = X[torch.randperm(n)[:K]]          # 随机初始化 K 个质心
    for _ in range(max_iter):
        # E步:计算距离并分配样本
        dist = torch.cdist(X, mu)           # (n, K)
        labels = torch.argmin(dist, dim=1)  # (n,)
        # M步:重新计算质心
        for k in range(K):
            mask = labels == k
            if mask.sum() > 0:
                mu[k] = X[mask].mean(dim=0)
    return labels, mu
相关推荐
zhangshuang-peta1 小时前
通过 MCP 控制平面引入技能
人工智能·机器学习·ai agent·mcp·peta
大连好光景2 小时前
学会评估模型的拟合状态和泛化能力
人工智能·机器学习
智在碧得2 小时前
碧服智能体进化:AI赋能意图识别能力,“一问”更智能
大数据·人工智能·机器学习
w_t_y_y3 小时前
模型和算法篇(一)监督学习回归问题(2)树形回归
机器学习
AC赳赳老秦5 小时前
OpenClaw image-processing技能实操:批量抠图、图片尺寸调整,适配办公需求
开发语言·前端·人工智能·python·深度学习·机器学习·openclaw
Project_Observer5 小时前
为您的项目选择最合适的Zoho Projects自动化巧能
大数据·运维·人工智能·深度学习·机器学习·自动化·编辑器
好运的阿财5 小时前
“锟斤拷”问题——程序中用powershell执行命令出现中文乱码的解决办法
linux·前端·人工智能·机器学习·架构·编辑器·vim
沅_Yuan6 小时前
基于LSSVM-ABKDE的多输入单输出回归预测模型【MATLAB】
人工智能·神经网络·机器学习·matlab·回归预测·lssvm·kde
小陈工6 小时前
Python Web开发入门(十八):跨域问题解决方案——从“为什么我的请求被拦了“到“我让浏览器乖乖听话“
开发语言·python·机器学习·架构·数据挖掘·回归·状态模式
AI科技星6 小时前
全维度相对论推导、光速螺旋时空与北斗 GEO 钟差的统一理论
开发语言·线性代数·算法·机器学习·数学建模