一、算法思想和原理
基本思想可以参考这篇文章https://blog.csdn.net/hajk2017/article/details/82862788,来自博主hajk2017
https://blog.csdn.net/qq_41709378/article/details/105386111,来自博主三个半_Z,这篇文章能够迅速理解算法的原理和代码实例计算,里面也牵扯到如何采用交叉验证选择k值
有关KD树的构造可以参考知乎专栏https://zhuanlan.zhihu.com/p/23966698,出处为JoinQuant量化课堂。
二、KNN算法的实现
1.简单实例
import matplotlib.pyplot as pltimport numpy as npimport operator #注意这个库# 已知分类的数据x1 = np.array([3,2,1])y1 = np.array([104,100,81])x2 = np.array([101,99,98])y2 = np.array([10,5,2])scatter1 = plt.scatter(x1,y1,c='r') #(x1,y1)是一类scatter2 = plt.scatter(x2,y2,c='b') #(x2,y2)是一类# 未知数据x = np.array([18])y = np.array([90])scatter3 = plt.scatter(x,y,c='k')#画图例plt.legend(handles=[scatter1,scatter2,scatter3],labels=['labelA','labelB','X'],loc='best')plt.show()# 已知分类的数据x_data = np.array([[3,104],[2,100],[1,81],[101,10],[99,5],[81,2]]) #红色和蓝色的点一起归于x_datay_data = np.array(['A','A','A','B','B','B']) #定义标签x_test = np.array([18,90]) #测试实例# 计算样本数量x_data_size = x_data.shape[0] #计算行数x_data_size#复制x_testnp.tile(x_test, (x_data_size,1))#后面的参数是复制行和列的次数,第一个是行的次数,第二个是列的次数,这个相当于在行的方向复制6次,目的是要计算这个点和所有点的距离# 计算x_test与每一个样本的差值diffMat = np.tile(x_test, (x_data_size,1)) - x_datadiffMat# 计算差值的平方sqDiffMat = diffMat**2sqDiffMat# 求和sqDistances = sqDiffMat.sum(axis=1)sqDistances# 开方distances = sqDistances**0.5distances #得到欧式距离# 从小到大排序sortedDistances = distances.argsort() #对索引进行排序sortedDistancesclassCount = {} #建立一个字典# 设置kk = 5for i in range(k): #这里要统计最近k个点的标签多少,便于依照少数服从多数原则进行分类# 获取标签votelabel = y_data[sortedDistances[i]]# 统计标签数量classCount[votelabel] = classCount.get(votelabel,0) + 1 #get函数获取键值,如果获取不到键值,就返回0 [key!这里有点难以理解]classCount# 根据operator.itemgetter(1)-第1个值对classCount排序,然后再取倒序sortedClassCount = sorted(classCount.items(),key=operator.itemgetter(1), reverse=True) #数量最多的在最前面sortedClassCount #得到一个list# 获取数量最多的标签knnclass = sortedClassCount[0][0]knnclass #得到分类类别
2.鸢尾花的应用
# 导入算法包以及数据集import numpy as npfrom sklearn import datasetsfrom sklearn.model_selection import train_test_splitfrom sklearn.metrics import classification_report,confusion_matriximport operatorimport randomdef knn(x_test, x_data, y_data, k):# 计算样本数量x_data_size = x_data.shape[0]# 复制x_testnp.tile(x_test, (x_data_size,1))# 计算x_test与每一个样本的差值diffMat = np.tile(x_test, (x_data_size,1)) - x_data# 计算差值的平方sqDiffMat = diffMat**2# 求和sqDistances = sqDiffMat.sum(axis=1)# 开方distances = sqDistances**0.5 #求解欧氏距离# 从小到大排序sortedDistances = distances.argsort()classCount = {}for i in range(k):# 获取标签votelabel = y_data[sortedDistances[i]]# 统计标签数量classCount[votelabel] = classCount.get(votelabel,0) + 1# 根据operator.itemgetter(1)-第1个值对classCount排序,然后再取倒序sortedClassCount = sorted(classCount.items(),key=operator.itemgetter(1), reverse=True)# 获取数量最多的标签return sortedClassCount[0][0]data_size = iris.data.shape[0] #计算多少个数据(行数)index = [i for i in range(data_size)]random.shuffle(index) #打乱上面的list# 载入数据iris = datasets.load_iris() #sklearn库自带的数据集# x_train,x_test,y_train,y_test = train_test_split(iris.data, iris.target, test_size=0.2) #分割数据0.2为测试数据,0.8为训练数据,系统自带的切分数据集代码形式#打乱数据data_size = iris.data.shape[0] #计算多少个数据(行数)index = [i for i in range(data_size)]random.shuffle(index) #打乱上面的listiris.data = iris.data[index]iris.target = iris.target[index]#切分数据集(自己实操的方式)test_size = 40x_train = iris.data[test_size:] #取剩余部分x_test = iris.data[:test_size] #取前40个y_train = iris.target[test_size:]y_test = iris.target[:test_size]predictions = []for i in range(x_test.shape[0]):predictions.append(knn(x_test[i], x_train, y_train, 5))print(classification_report(y_test, predictions))print(confusion_matrix(y_test,predictions))
3.sklearn库的使用
# 导入算法包以及数据集from sklearn import neighborsfrom sklearn import datasetsfrom sklearn.model_selection import train_test_splitfrom sklearn.metrics import classification_reportimport random# 载入数据iris = datasets.load_iris()print(iris)# 打乱数据切分数据集# x_train,x_test,y_train,y_test = train_test_split(iris.data, iris.target, test_size=0.2) #分割数据0.2为测试数据,0.8为训练数据#打乱数据data_size = iris.data.shape[0]index = [i for i in range(data_size)]random.shuffle(index)iris.data = iris.data[index]iris.target = iris.target[index]#切分数据集test_size = 40x_train = iris.data[test_size:]x_test = iris.data[:test_size]y_train = iris.target[test_size:]y_test = iris.target[:test_size]# 构建模型model = neighbors.KNeighborsClassifier(n_neighbors=3) #直接利用sklearn库进行分类model.fit(x_train, y_train)prediction = model.predict(x_test)print(classification_report(y_test, prediction))
