K-Means和KNN

主要区别

从无序 ---> 有序

从K-Means ---> KNN

  • KNN:监督学习,类别是已知的,对已知分类的数据进行训练和学习,找到不同类的特征,再对未分类的数据进行分类。
  • K-Means:无监督学习,事先不知道数据有几类,通过聚类分析将数据聚合成几个群体。聚类不需要对数据进行训练和学习。

KNN

原理

将预测点与所有点的距离进行计算,然后保存并排序,选出前面K个值看看哪些类别比较多,则预测的点就属于哪一类。

KNN也可以用于回归预测

算法步骤

对未知类别属性的数据集中每个点依次执行以下操作:

  1. 计算已知类别数据集中的点与当前点之间的距离;
    通常使用的是欧氏距离
  2. 按照距离递增次序排序;
  3. 选取与当前点距离最小的k个点;
    如何确定k?
    通过交叉验证,从选取一个较小的k值开始,不断增加k的值,然后计算验证集合的方差,最终找到一个比较合适的k值。
  4. 确定前k个点所在类别的出现频率;
  5. 返回前k个点出现频率最高的类别作为当前点的预测分类。

K-Means

原理

随机选取质心------计算各样本点和质心的距离后分类------再次选择新的质心

【扩展】

邻近度函数(即距离计算):

(1)曼哈顿距离:质心------中位数,目标函数------最小化对象到簇质心的距离和;

(2)平方欧几里得距离:质心------均值,目标函数------最小化对象到簇质心的距离的平方和;

(3)余弦距离:质心------均值,目标函数------最大化对象与其质心的余弦相似度和;

(4)Bregman散度:质心------均值,目标函数------最小化对象到簇质心的Bregman散度和。

算法步骤

  1. 随机选取k个质心(k值取决于想聚成几类);
  2. 计算样本到质心的距离,距离质心近的归为一类,分为k类;
  3. 求出分类后的每类的新质心;
  4. 再次计算样本到新质心的距离,距离质心距离近的归为一类;
  5. 判断新旧聚类是否相同,如果相同就代表已经聚类成功,如果没有则循环2-4。


相关推荐
人工智能培训4 分钟前
人工智能性别与地域偏见的成因及消解路径
大数据·人工智能·算法·生活
段一凡-华北理工大学5 分钟前
高炉炉况智能诊断与预警实战~系列文章24:炉况诊断实战全景复盘:从需求到价值的完整案例
大数据·人工智能·机器学习·模型可解释性·高炉智能化·高炉炉况诊断·高炉炉况预警
鹿角片ljp6 分钟前
LeetCode 56:合并区间复盘|从排序思维到 List<int[]> 的简洁写法
算法·leetcode·list
小白说大模型16 分钟前
基于 Qwen3.8-Max 构建 AI 合同精审系统:文档解析、多轮条款分析 Pipeline 工程实战
数据库·人工智能·spring·机器学习·自然语言处理
AI工具测评家21 分钟前
2026实测对比|论文降AI改写底层技术解析:同义词替换≠真正去除AI写作特征
人工智能·机器学习·ai写作·降重·ai检测·查重·降ai
M78佐菲22 分钟前
Linux学习笔记:网络通信
linux·笔记·学习·算法
漂流瓶jz24 分钟前
UVA-1609 不公平竞赛 题解答案代码 算法竞赛入门经典第二版
数据结构·算法·链表·贪心·aoapc·算法竞赛入门经典·uva
咖啡星人k38 分钟前
2026 Agentic RAG 实战:让 AI 学会“先想后查“,MonkeyCode 云端跑通
人工智能·机器学习
学习星球1 小时前
贪心算法精讲——贪心策略的“局部最优“如何通向全局最优?
算法·贪心算法