机器学习笔记——K近邻算法、手写数字识别

KNN算法

"物以类聚,人以群分"相似的数据往往拥有相同的类别

其大概原理就是一个样本归到哪一类,当前样本需要归到频次最高的哪个类去

也就是说有一个待分类的样本,然后跟他周围的k个样本来看,k中哪一个类最多,待分类的样本就是哪一个。

那就以手写数字识别为例吧

c 复制代码
import matplotlib.pyplot as plt
import numpy as np
import os
#%%
# 读入mnist数据集
m_x = np.loadtxt('./data/mnist_x', delimiter=' ')
m_y = np.loadtxt('./data/mnist_y')
#%%
# 数据集可视化
data = np.reshape(np.array(m_x[0], dtype=int), [28, 28])
plt.figure()
plt.imshow(data, cmap='gray')
#%%
# 将数据集分为训练集和测试集
ratio = 0.8
split = int(len(m_x) * ratio)
# 打乱数据
np.random.seed(0)
idx = np.random.permutation(np.arange(len(m_x))) #随机排序
m_x = m_x[idx]
m_y = m_y[idx]
x_train, x_test = m_x[:split], m_x[split:]
y_train, y_test = m_y[:split], m_y[split:]
#%%
#定义距离函数
def distance(x,y):
    return np.sqrt(np.sum(np.square(x-y)))

#%%
#定义KNN模型
class KNN:
    def __init__(self,k,label_num):
        self.k=k
        self.label_num=label_num #类别的数量
    def fit(self,x_train,y_train):
        self.x_train=x_train
        self.y_train=y_train
    def get_knn_indices(self,x): #获得距离目标样本最近的k个点的标签,a来做self_x.train
        dis=list(map(lambda a:distance(a,x),self.x_train))
        knn_indices=np.argsort(dis) #对距离排序,在选择k个出来
        knn_indices=knn_indices[:self.k]#标签
        return knn_indices
     def get_label(self,x):#计算k个点中,样本的标签数量是多少
         knn_indices=self.get_knn_indices(x)
         label_statistic=np.zeros(shape=[self.label_num])
         for index in knn_indices:
             label=int(self.y_train[index])
             label_statistic[label]+=1
         return np.argmax(label_statistic) #找出最大的类别
     def predict(self,x_test):
         predicted_test_labels=np.zeros(shape=[len(x_test)],dtype=int)
         for i,x in enumerate(x_test): #枚举
             predicted_test_labels[i]=self.get_label(x)
         return predicted_test_labels

#%%
for k in range(1,10):
    knn=KNN(k,label_num=10)
    knn.fit(x_train,y_train)
    predicted_labels=knn.predict(x_test)
    accuracy=np.mean(predicted_labels==y_test)
    print(f'k的取值为{k},预测准确率为{accuracy*100:.lf}%')
相关推荐
天若有情67313 小时前
Node+MySQL小型全栈笔记项目实战课程分享
数据库·笔记·mysql
147API15 小时前
蒸馏模型量化上线前,先查精度退化和算子兼容
大数据·人工智能·深度学习·机器学习·蒸馏
摇滚侠15 小时前
《SpringBoot 3:入门与应用实战》第 12 章 JDBC 与事务 JDBC 事务管理 阅读笔记 33
spring boot·笔记·后端
Omics Pro16 小时前
Arc研究所Cell|全新虚拟细胞官方基准评测框架
大数据·人工智能·深度学习·算法·机器学习
Wendy不吃榴莲16 小时前
# AI短剧教程 - 《后西游记》开播后,AI影视为什么更考验“连续讲故事”?
人工智能·笔记·学习·ai·视频
Agudamu116116 小时前
B站学习视频怎么变笔记:用 Ai好记 + Obsidian 搭建个人知识库的完整教程
人工智能·笔记·学习·音视频
搞科研的小刘选手17 小时前
【泰国曼谷举办】第二届机器学习与社会计算国际研讨会(MLSC 2026)
机器学习·社会计算·学术会议·会议推荐·泰国曼谷
小雨笙笙17 小时前
机器学习:评估模型与选择
人工智能·算法·机器学习
兮动人18 小时前
Python变量与常量
开发语言·python·机器学习·python变量与常量
2601_9623008118 小时前
机器学习的理想基石
人工智能·python·机器学习·编程语言·数据处理