机器学习Day10:聚类

概念

聚类是按照某个特定标准把一个数据集分割成不同的类或簇,使得同一个簇内的数据对象的相似性尽可能大,同时不在同一个簇中的数据对象的差异性尽可能大

聚类的过程

  1. 数据准备:特征标准化和降维
  2. 特征选择:从最初的特征中选择最有效的特征,并将其存储在向量中
  3. 特征提取:通过对选择的特征进行转换形成新的突出特征
  4. 聚类:基于某种距离函数 进行相似度度量,获取簇
  5. 聚类结果评估:分析聚类结果,如距离误差和等

聚类方法

1.划分类聚类方法

代表:k-means算法

基本思想:对于给定的类别数据k首先给出初始划分 ,通过迭代 改变样本和簇的隶属关系,使得每一次改进后的划分方法都比前一次更好

优点:简单快速;当簇近似于高斯分布时效果好

缺点:在簇的平均值 可被定义时才能使用;对初值敏感

2.层次聚类方法 :对给定的数据集进行层次的分解 ,直到满足某种条件为止

如下图所示,由于a、b某特征有相似之处,将他们聚类一类,以此类推

特征:对噪声敏感

3.基于密度的聚类方法

典型算法:DBSCAN算法

特点:抗噪效果好;性能一般

聚类算法效果评判

  1. 均一性:聚类结果的一致性或者稳定性
  2. 完整性:聚类结果 与真实类别或标签之间的一致性
  3. V-measure:综合考虑了均一性 和完整性
  4. ARI:比较了聚类结果与真实类别之间的一致性,考虑了分类中的随机性因素
  5. AMI:聚类结果与真实类别之间的一致性,同时考虑了类别分布的随机性
  6. 轮廓系数:结合了聚类的紧密度(密度 )和分离度(分散度)
相关推荐
泥人张7 小时前
踩坑无数换来的教训:指挥AI开发App,这几点你必须知道
人工智能
蓝速科技7 小时前
政务自助终端信创选型与无人值守落地方案
android·大数据·数据库·人工智能·科技·技术分享·政务
“AI国潮设计-小江”7 小时前
[AIGC实战] 基于Stable Diffusion的潮汕非遗IP自动化生成工作流(附Python批量处理脚本)
开发语言·人工智能·python·prompt·aigc
szxinmai主板定制专家7 小时前
RK3576+CODESYS+RK182X+FPGA异构架构:半导体精密设备一体化控制器方案
人工智能·fpga开发·架构·rk3576+codesys
EatFan7 小时前
GitHub Trending 三连观察:AI 编码智能体进入“周边生态”竞争阶段
人工智能·驱动开发·github·mcp·superpowers·github trending·spec kit
szxinmai主板定制专家7 小时前
半导体设备控制器:RK3576+CODESYS+RK182X异构架构,实现晶圆视觉检测与运动联动闭环
人工智能·fpga开发·架构·视觉检测·边缘计算·codesys·rk3576
空奈qwq7 小时前
PyTorch 进阶指南:从张量操作到模型训练全流程
人工智能·pytorch·深度学习
会议咨询7 小时前
2026年计算机工程、数据处理与机器学习国际会议(CDML 2026)
人工智能·机器学习·数据处理
武乐乐~8 小时前
LLaVA1.5-7B复现
人工智能
小淮AI8 小时前
AI生成PPT工具的功能观察:百度文库、Gamma、WPS AI
人工智能·powerpoint·wps