机器学习Day10:聚类

概念

聚类是按照某个特定标准把一个数据集分割成不同的类或簇,使得同一个簇内的数据对象的相似性尽可能大,同时不在同一个簇中的数据对象的差异性尽可能大

聚类的过程

  1. 数据准备:特征标准化和降维
  2. 特征选择:从最初的特征中选择最有效的特征,并将其存储在向量中
  3. 特征提取:通过对选择的特征进行转换形成新的突出特征
  4. 聚类:基于某种距离函数 进行相似度度量,获取簇
  5. 聚类结果评估:分析聚类结果,如距离误差和等

聚类方法

1.划分类聚类方法

代表:k-means算法

基本思想:对于给定的类别数据k首先给出初始划分 ,通过迭代 改变样本和簇的隶属关系,使得每一次改进后的划分方法都比前一次更好

优点:简单快速;当簇近似于高斯分布时效果好

缺点:在簇的平均值 可被定义时才能使用;对初值敏感

2.层次聚类方法 :对给定的数据集进行层次的分解 ,直到满足某种条件为止

如下图所示,由于a、b某特征有相似之处,将他们聚类一类,以此类推

特征:对噪声敏感

3.基于密度的聚类方法

典型算法:DBSCAN算法

特点:抗噪效果好;性能一般

聚类算法效果评判

  1. 均一性:聚类结果的一致性或者稳定性
  2. 完整性:聚类结果真实类别或标签之间的一致性
  3. V-measure:综合考虑了均一性完整性
  4. ARI:比较了聚类结果与真实类别之间的一致性,考虑了分类中的随机性因素
  5. AMI:聚类结果与真实类别之间的一致性,同时考虑了类别分布的随机性
  6. 轮廓系数:结合了聚类的紧密度(密度 )和分离度(分散度
相关推荐
2zcode6 分钟前
基于低光照增强与轻量型CNN道路实时识别算法研究(UI界面+数据集+训练代码)
人工智能·算法·cnn·低光照增强·自动驾驶技术
萑澈18 分钟前
Xiaomi MiMo Orbit 百亿 Token 计划申请保姆级教程
人工智能
缝艺智研社19 分钟前
誉财 YC - 23 全自动上底裤明橡筋机:裤腰加工的革新力量
人工智能·自动化缝纫机·线上模板机·无人自动化产线·线内模板机
北京软秦科技有限公司20 分钟前
工厂到货验收的突破:IACheck如何提升AI报告审核效率
人工智能
LaughingZhu22 分钟前
Product Hunt 每日热榜 | 2026-05-03
人工智能·经验分享·深度学习·神经网络·产品运营
缝艺智研社22 分钟前
誉财 YC - 18 - JG 小型激光模板机:服装缝切工艺的革新先锋
人工智能·新人首发·自动化缝纫机·线上模板机·无人自动化产线
m0_4665252927 分钟前
绿盟科技发布2026年一季报,收入微增,亏损收窄,现金流持续为正
人工智能·科技
weixin_4080996728 分钟前
身份证OCR识别中的“隐形防线”:复印件/翻拍检测如何拦截99%的虚假注册?(附多语言代码)
人工智能·ocr·图像识别·api接口·实名认证·身份证ocr·石榴智能
love you joyfully36 分钟前
如何随时随地访问你的“进程”?
网络·人工智能·网络安全·远程访问·网络技术
ting945200036 分钟前
告别无效学习:Scholé 如何用 AI 重构职场学习,让学习直接嵌入工作流
人工智能·学习·重构