机器学习Day10:聚类

概念

聚类是按照某个特定标准把一个数据集分割成不同的类或簇,使得同一个簇内的数据对象的相似性尽可能大,同时不在同一个簇中的数据对象的差异性尽可能大

聚类的过程

  1. 数据准备:特征标准化和降维
  2. 特征选择:从最初的特征中选择最有效的特征,并将其存储在向量中
  3. 特征提取:通过对选择的特征进行转换形成新的突出特征
  4. 聚类:基于某种距离函数 进行相似度度量,获取簇
  5. 聚类结果评估:分析聚类结果,如距离误差和等

聚类方法

1.划分类聚类方法

代表:k-means算法

基本思想:对于给定的类别数据k首先给出初始划分 ,通过迭代 改变样本和簇的隶属关系,使得每一次改进后的划分方法都比前一次更好

优点:简单快速;当簇近似于高斯分布时效果好

缺点:在簇的平均值 可被定义时才能使用;对初值敏感

2.层次聚类方法 :对给定的数据集进行层次的分解 ,直到满足某种条件为止

如下图所示,由于a、b某特征有相似之处,将他们聚类一类,以此类推

特征:对噪声敏感

3.基于密度的聚类方法

典型算法:DBSCAN算法

特点:抗噪效果好;性能一般

聚类算法效果评判

  1. 均一性:聚类结果的一致性或者稳定性
  2. 完整性:聚类结果真实类别或标签之间的一致性
  3. V-measure:综合考虑了均一性完整性
  4. ARI:比较了聚类结果与真实类别之间的一致性,考虑了分类中的随机性因素
  5. AMI:聚类结果与真实类别之间的一致性,同时考虑了类别分布的随机性
  6. 轮廓系数:结合了聚类的紧密度(密度 )和分离度(分散度
相关推荐
ai小陈几秒前
Python 3.12与CUDA 12.8镜像实战:启动GPU实例后的五项自检
开发语言·人工智能·python·深度学习·ai·gpu算力
Thomas.Sir4 分钟前
第48课:TensorFlow|TF模型线上部署入门【本地服务封装、接口快速开发】
人工智能·python·tensorflow
Q26433650235 分钟前
【有源码】基于 Hadoop 的强化学习智能体轨迹数据挖掘与可视化分析系统大数据毕设项目
大数据·hadoop·机器学习·数据挖掘·spark·课程设计·数据可视化
Xxtaoaooo5 分钟前
AI 视频生成能不能真正跑通?MoneyPrinterTurbo 本地制作、远程访问与授权验证
人工智能·音视频·cpolar·ai视频·自动化短视频
海浪仙人掌7 分钟前
流动比率有哪些分析陷阱?流动比率怎么避开这些陷阱?
大数据·数据库·人工智能
宝桥南山16 分钟前
DeepSeek - 尝试安装和使用一下DeepSeek Harness
人工智能·ai·aigc·ai编程
小海豚儿21 分钟前
不是所有 Workflow,都值得升级成 Graph
人工智能·ai编程
X54先生(人文科技)24 分钟前
Yuri演唱会碳硅协同思维推演备忘录
人工智能·深度学习·知识图谱·零知识证明
网易云信29 分钟前
更强、更快、更普惠!网易智企帝王蟹率先接入 DeepSeek V4.1 Flash
人工智能·agent·deepseek
Coffeeee35 分钟前
claude-video 一个让你的Agent拥有看视频能力的Skill
android·人工智能·aigc