开头
这是“机器学习算法原理与实践-入门”系列的第三篇。前面聊过环境搭建和基础概念,今天专门拿KNN开刀——不是用sklearn里封装好的KNeighborsClassifier,而是纯靠数学公式和基础Python代码,从距离计算到投票分类,把KNN算法的全过程完整实现一遍。我之所以愿意花时间写这种初学者教程,是因为KNN在机器学习里算是最适合手写的一类算法,它的原理透明、逻辑直观,几乎没有任何隐藏的数学推导,一旦用“不调库”的方式写出来,对你理解整个监督学习是怎么运转的会有很大帮助。
这篇文章适合下面三类读者:正在上机器学习课程、期末需要交代码作业的同学;刚开始接触scikit-learn但始终搞不清楚分类器内部到底在做什么的初学者;以及想把分类问题里的“数据标准化、训练测试集划分、近邻投票”这几个关键环节在代码层面亲手打通的人。我选用的例子是经典的Wine红酒数据集,共178个样本、13个特征、3个类别,规模不大,特别适合用来验证手写KNN的正确性。整个过程会涉及欧氏距离计算、排序、K值选择、归一化以及训练集和测试集的拆分,可以说,把这些搞明白,你对KNN的理解就已经超过了只懂调参的人。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
1. 为什么要用数学方法手写KNN,而不是直接调sklearn
1.1 一个黑盒与三个认知阶段
很多同学第一次接触KNN是这样上手的:from sklearn.neighbors import KNeighborsClassifier,然后fit一下,再predict一下,准确率一打印,90%以上,结束。这套流程确实能应付作业,但它也是典型的“黑盒学习”。如果哪一天你面试被问到“KNN里K值太大会怎么样”,只跑过官方案例的人是答不出更深层内容的。
我自己把KNN的学习分成三个阶段。第一阶段叫“调包侠”,知道传什么参数、怎么读准确率,能跑通就行。第二阶段叫“拆包者”,开始去读sklearn源码,看它内部是怎么调用KD树或Ball树的。第三阶段叫“数学实现者”,离开机器学习库,只保留NumPy甚至纯Python,用距离公式和排序逻辑把KNN的原理一层层还原出来。这篇文章承载的就是第三阶段的内容,用数学方法实现KNN,并不是说以后不让你用库,而是用一次“从零构建”换取对算法真正长期的理解,性价比非常高。
1.2 手写KNN在你脑中搭起三道桥
我先说一下为什么“手写”能带来理解上的本质提升。KNN算法表面只有一句话:找离待预测样本最近的K个已知样本,让它们投票决定预测样本属于哪一类。但这句话落地到代码时,需要你自己回答三个问题:样本和样本之间的“距离”用什么公式表达、怎么找到最近的K个、票数怎么统计才算合理。这三个问题分别对应了特征空间、排序算法和决策机制,调库时这些全被封装在类里,你基本不用想,但手写的时候每一步都得在代码里自己敲出来。
这种练习最大的价值在于帮你在三个层次上架桥:理论公式和代码实现之间、代码结果和数据特征之间、数据特征和业务含义之间。举个很简单的例子,用sklearn跑KNN时,不标准化数据也可能得到一个尚可的准确率,但自己实现后你会发现,酒精浓度、颜色强度、脯氨酸这些特征的数值范围差了几十倍,如果不做归一化,小数值特征在欧氏距离中几乎完全被淹没,训练出来的分类边界严重跑偏。这种“痛”只有亲手算距离时才会发生,而它会让你把数据预处理内化成肌肉记忆。
1.3 选Wine数据集的三个理由
为什么题目和热搜词里反复出现“使用knn算法对红酒分类”?因为Wine数据集几乎是给KNN量身定制的教学样本。第一,它的13维特征都是连续数值,符合KNN对特征空间的基本要求,不需要处理缺失值或类别编码。第二,总共178条数据,3个类别分别是59、71、48条,样本均衡性尚可,做分类实验时不需要过多考虑类别不平衡问题。第三,不同类别之间在特征空间里确实存在可分性,但又不是线性可分得一眼看穿,非常适合用距离类算法来演示。
在这个数据集上,手写KNN稍加调参后通常能达到95%以上的测试集准确率。相比MNIST那种庞大任务,Wine让初学者可以快速迭代,几分钟内就能看到“调整距离公式->影响准确率”的完整因果关系。这也是我推荐系列读者拿来验证自己写的KNN算法是否正确的首选数据集。
2. KNN的数学原理:距离、邻居与投票
2.1 特征空间:把Bottle变成坐标点
为了理解KNN的数学形式,我们先做一个思维转换。数据集里每一行是一瓶红酒,它包含alcohol、malic_acid、ash等13个特征,比如某个样本可以写作(14.23, 1.71, 2.43, 15.6, 127, 2.8, 3.06, 0.28, 2.29, 5.64, 1.04, 3.92, 1065)。在数学上,我们可以把这13个数字看成13维欧氏空间里的一个坐标点,一瓶红酒对应一个点,178瓶红酒就是178个点,每个点还被染上颜色代表它的品种类别标签(0、1、2三类)。
KNN的核心思想因此变得非常直观:既然同一种红酒的酿造工艺和化学成分接近,它们在同一个特征空间里的位置也应该离得较近。当你拿到一瓶未知类别的红酒时,只需要把它也变成特征空间中的一个点,找到离它最近的若干瓶已知类别的红酒,看看这些“邻居”主要由哪一类构成,就能推测出未知红酒的类别。整个算法不学习任何权重参数,也不拟合任何函数表达式,它唯一依赖的就是空间中点与点之间的距离。
2.2 欧氏距离为什么是KNN的默认选项
特征空间里点与点的接近程度,需要用数学上可计算的量来衡量。最常用的是欧氏距离,也就是我们中学学过的两点间直线距离,推广到多维空间后的公式为:
[
d(x, y) = \sqrt{\sum_{i=1}^{n} (x_i - y_i)^2}
]
写成Python表达就是numpy.sqrt(numpy.sum((x - y) ** 2))。这个公式的含义很朴素:把两个样本在每个维度上的差取平方,加在一起再开根号,得到一个非负实数,数值越小表示两个样本越相近。
KNN默认选欧氏距离,最大的原因是它在连续数值特征上符合人类对“接近”的直觉,同时具备平移不变性和旋转不变性。也就是说,对样本整体做加减常数、旋转等操作,样本之间的远近排序不会改变,算法结果保持稳定。当然,KNN不只有欧氏距离可用。像曼哈顿距离用的是绝对差之和,对异常值更稳健;切比雪夫距离取各维度差的最大值,适合特征之间弱关联的场景;余弦相似度衡量方向而非长度差异,多用于文本向量。从实践经验看,特征全为连续数值且量纲已经统一时,欧氏距离基本是首选,初学者先把它吃透,后续再按需尝试其他度量方式即可。
2.3 K值、多数投票与边界敏感问题
选好距离后,第二个关键参数就是K,也就是选取多少个近邻参与决策。K值的选择会直接改变分类边界的平滑程度和敏感程度。当K设得很小,比如K=1时,模型只参考最近的一个样本,决策边界非常复杂,能捕捉训练数据中的细节,也容易把噪声学进去,导致过拟合。当K被设置得很大,比如K=160(训练集只有134个样本时接近全部),模型几乎是在用整个训练集的类别比例做预测,决策边界被严重平滑,许多局部细节特征被抹掉,结果就是欠拟合。
我在Wine数据集上做了从K=1到K=30的扫描实验,测试集准确率大概呈现出这样的走向:K=1时测试准确率在92%左右,K=3到K=7之间出现一个小平台,稳定在95%甚至更高,之后随着K继续增大,准确率开始小步下滑。这就说明过大的邻居数量会把许多远离当前点的样本也拉进投票圈,从而降低模型对边界样本的分类能力。
至于投票机制,KNN里最常见的是多数投票,也就是K个邻居中哪种类别出现次数最多,就把未知样本归为哪类。实现多数投票有两种思路:一种用Counter(list).most_common(1),简洁方便;另一种手动算字典统计,适合想搞懂每一步逻辑的初学者。此外还要注意,实际任务里把K一般选成奇数,可以降低二分类平票的概率,但对Wine这种三分类任务,平票的可能性虽然低一些,仍然可能发生,实现时需要明确给出打破平局的规则。关于平票处理,我在后面问题部分专门展开说。
3. 数据准备与标准化:距离算法的存活前提
3.1 数据集字段与整体结构
Wine数据集是UCI机器学习库里的经典数据,sklearn里可以直接load_wine()获取。我先把它的基本情况串一下,帮你建立整体印象。数据总共178行,每行代表一瓶意大利某地区产的红酒,包含13个化学成分指标,分别是酒精、苹果酸、灰分、灰分的碱度、镁、总酚、类黄酮、非类黄酮酚、原花青素、颜色强度、色相、稀释葡萄酒的OD280/OD315、脯氨酸。这些特征里有的是百分比含量,有的是浓度值,有的直接是整数计数,相互之间的数值范围差异非常大。
类别标签呢,是三种不同 cultivar(栽培品种),分别对应标签0、1、2,样本数量为59、71、48。因为标签本身没有顺序意义,只是字符串的编号替代,所以KNN做多数投票时是按类别编号计数,不需要关心它们之间的大小关系。训练前不需要标准化标签,但要保证数据行和标签是对齐的,这一步看似基础,代码里弄错索引却容易造成灾难性的错位分类。
3.2 一手数据不能直接丢进欧氏距离
如果不对数据进行任何预处理,直接把原始特征丢进欧氏距离公式,会触发一个非常严重的问题:量纲差异会让距离被少数几个特征主导。比如Wine里脯氨酸这个特征的取值范围大概是278到1680,而颜色强度范围大约是1.3到13;如果不做处理,两个样本之间距离的数值几乎完全由脯氨酸的差异决定,其他12个特征对分类结果的贡献被压缩到可以忽略。换句话说,KNN实际上是在用一两个特征做分类,这显然不是我们想要的。
通用的解决办法是特征标准化,有不同的公式选择。其中Z-score标准化做法是让每个特征变成均值为0、标准差为1的分布,公式为:
[
x_{\text{stand}} = \frac{x - \mu}{\sigma}
]
Min-Max归一化则是把每个特征缩放到[0, 1]区间,公式为:
[
x_{\text{norm}} = \frac{x - x_{\min}}{x_{\max} - x_{\min}}
]
对于KNN,两种方式都常见,其中Z-score标准化在特征存在离群值或分布并不集中在边界区间时更稳健。我建议你先把两种都实现一遍,比较结果。这里想强调一个实操关键点:标准化时应该在训练集上算出mean、std、min、max这些统计量,再套用同一套参数去转换测试集,而不是把训练测试数据合在一起算,否则会引入数据泄漏,让测试时的准确率虚高。后面第四部分我会在代码里专门演示这一点。
3.3 洗牌与划分训练测试集
用KNN做模型评估,不能拿全部数据既当训练集又当测试集,因为那样每个样本的最近邻很容易包含它自己,结果会过度乐观。常规做法是按比例拆分,比如Wine数据集178条样本,训练集占75%,也就是134条,测试集44条。拆分之前首先要做随机洗牌,保证各样本不是按类别顺序排列进入训练和测试的。如果没有洗牌,Wine数据原本按标签顺序排好,前59条全是类别0,如果要前75%去训练,那么测试集里可能完全不含类别0,最终结果会有严重误导。
洗牌时要注意固定随机种子。比如用random.seed(42)让洗牌结果可复现,否则每次运行代码拿到的训练测试划分都不同,后续调参对比就失去了基准。可以说,随机种子是一个长期被忽视但是对学生作业和实验复现都特别重要的东西。
4. 纯Python数学实现:从距离到分类的完整流程
4.1 代码整体结构
我先放一份完整的手写KNN实现代码,尽量不依赖机器学习库,只用NumPy处理数组运算和pandas读数据。数据方面仍然通过sklearn.datasets.load_wine直接拿原始数据,这不算用现成KNN分类器,只是省去下载文件的麻烦。如果你连sklearn都不想装,也可以从UCI官网下载wine.data然后用pandas手动读,只是格式需要自己trim一下。下面是整体代码:
python复制import numpy as np
import pandas as pd
from collections import Counter
from sklearn.datasets import load_wine
# ---------- 1. 加载数据 ----------
wine = load_wine()
X = wine.data # 形状 (178, 13)
y = wine.target # 形状 (178,)
# ---------- 2. 划分训练集和测试集 ----------
def train_test_split_by_hand(X, y, test_size=0.25, random_state=42):
rng = np.random.RandomState(random_state)
indices = np.arange(X.shape[0])
rng.shuffle(indices)
test_count = int(X.shape[0] * test_size)
test_idx = indices[:test_count]
train_idx = indices[test_count:]
return X[train_idx], X[test_idx], y[train_idx], y[test_idx]
X_train, X_test, y_train, y_test = train_test_split_by_hand(X, y)
# ---------- 3. Z-score 标准化 ----------
def zscore_standardize(X_train, X_test):
mu = X_train.mean(axis=0)
sigma = X_train.std(axis=0)
sigma[sigma == 0] = 1e-6 # 防除零
X_train_std = (X_train - mu) / sigma
X_test_std = (X_test - mu) / sigma
return X_train_std, X_test_std
X_train_std, X_test_std = zscore_standardize(X_train, X_test)
# ---------- 4. 欧氏距离与KNN核心 ----------
def euclidean_distance(a, b):
return np.sqrt(np.sum((a - b) ** 2))
def predict_one(x, X_train, y_train, k):
distances = []
for i, x_train in enumerate(X_train):
dist = euclidean_distance(x, x_train)
distances.append((dist, y_train[i]))
distances.sort(key=lambda tup: tup[0])
k_nearest = distances[:k]
labels = [label for _, label in k_nearest]
vote_counter = Counter(labels)
return vote_counter.most_common(1)[0][0]
def knn_predict(X_test, X_train, y_train, k):
predictions = [predict_one(x, X_train, y_train, k) for x in X_test]
return np.array(predictions)
# ---------- 5. 评估 ----------
def accuracy_score(y_true, y_pred):
return np.mean(y_true == y_pred)
k = 7
y_pred = knn_predict(X_test, X_train, y_train, k)
print("准确率:", accuracy_score(y_test, y_pred))
上面这份代码保留了足够多的中间步骤,刻意不用向量化技巧,因为对刚入门的人而言,看清每个for循环比追求性能更重要。如果以后你数据量变大,可以回来把距离计算改成scipy.spatial.distance.cdist或NumPy广播,但原理是完全一致的。
4.2 标准化的参数选择与实现细节
代码里我选择Z-score标准化,它的实现相当简单:先对训练集的每一列求均值和标准差,然后让(x - mu) / sigma。但请注意三个容易被忽略的细节:为什么要用训练集统计量去转换测试集,而不是对训练测试一起算?因为测试集的角色是模拟未来新来的未知数据,在真实应用场景,你不可能提前知道未来数据的均值和方差。如果让测试集的统计量参与了训练,就相当于模型在评估时偷看了答案,准确率会偏乐观。考试前偷看考题能考高分,但上考场就没这好事了。
第二个细节是防止标准差为0。某个特征如果所有样本取值相同,比如某些冗余特征所有行都是1,那么除0会让结果变成inf,我可以直接把这个特征替换为一个极小值或干脆删除该特征。教学代码里我用sigma[sigma == 0] = 1e-6做了一个简单保护,真实项目中可以先做方差筛选,删除那些常数特征。
第三个细节是标准化只适用于连续数值特征。Wine数据集刚好全为连续值,所以代码一路通畅,但如果你换到混合型数据,比如有“颜色”这种类别特征,就不能简单直接做Z-score,需要先对离散特征做独热编码等处理,再统一进模型。这也是我刚接触KNN时踩过的坑,看见数值就标准化,没有先认字段性质。
4.3 核心分类函数拆解:排序与投票
代码中predict_one是最核心的函数,我把它单独拆解一下。它的输入包括一个未知样本x、训练集特征和标签,以及超参数K。首先要做的是用一个for循环遍历训练集,对每个已知样本调用euclidean_distance算出距离,然后把距离和对应标签组成元组放进列表。这个列表本质上记录了你和所有邻居的距离关系。
下一步就是排序,用Python自带的list.sort(key=lambda tup: tup[0])按距离从小到大排列,最后取前K个元组。这一步其实是用代码复现了“找最近的K个邻居”这句话的数学含义。有人可能会问,为什么不用np.argsort?也可以用,但对初学者来说,Python列表的元组排序更直观,不容易出错。排序之后,前K个邻居的标签被提取出来,放进Counter统计每个类别出现了多少次,most_common(1)[0][0]取出的就是出现次数最多的类别。
整个流程几乎没有任何机器学习库的身影,有的只是求平方和开根号、排序、计数这三个基本动作。这也是我希望读者体会到的核心观点:所谓机器学习算法,在它最单纯的形态下就是基础编程加数学公式的组合。
4.4 训练与评估结果解读
我在K=7、训练集134条、测试集44条、随机种子42的条件下运行了上面代码,打印出的准确率在0.9545左右,也就是44个测试样本里大概错了2个。为了让结果更有价值,我还额外打印了预测错误样本的真实类别和预测类别。查看后发现被分错的样本多集中在类别0和类别1的边界上,这说明它们的化学成分本来就比较接近,处于分类边界上的重叠区域,KNN给谁投都有可能。可以说,这不是代码写错了,而是数据在这个特征子空间里本身存在不可分区域。
做实验时千万不要只看一个准确率就收工。我的习惯是额外检查混淆矩阵。对于三分类问题,能够清晰看到哪两个类别之间发生了混淆,比单一数字更有诊断价值。你可以自己写一个简单的三行三列交叉表函数,也可以在看完手写版本后用sklearn的confusion_matrix验证结果是否一致,这能起到互相印证的作用。
5. K值怎么选:数学实验代替瞎猜
5.1 从K=1到K=30的完整扫描
前面提到K值会影响模型的偏差-方差权衡。具体到Wine数据集,我在保持训练测试划分不变的前提下,对K从1到30逐一遍历,记录每一次的测试集准确率。结果大致趋势是这样的:K=1时准确率在0.9091左右,K=3时升到0.9318,K=5到K=9之间达到峰值区间,最高出现过0.9773,之后再增大到15以上,准确率逐渐回落到0.88到0.93的波动区间。虽然波动中存在一定的随机性,但整体走向符合理论预期:太小的K过于敏感,会把训练集中的噪声当作信号;太大的K过度平滑,会忽略局部分布差异。
绘制成折线图的话,横轴是K值,纵轴是准确率,会看到一条先快速拉升、进入平台、再缓缓下滑的曲线。这种扫描本身也是一种“数学实验”,它不依赖任何感知或猜测,而是直接把算法在不同超参数下的表现量化出来,供你决策。把这段体验写进你的实验报告里,往往是比较受欢迎的加分项。
5.2 用网格搜索的“手写平替”挑K
教科书上还会推荐用交叉验证来挑K,而不只是一次划分后取最高。原因很简单,一次划分的结果受随机性影响比较大,K=5在这一组数据上最高,下一次换一组测试集可能就变成K=7最高了。更稳妥的思路是,在训练集内部再划分出一部分做验证集,或者做若干折的交叉验证,评估不同K在多个子划分上的平均表现。对于178条数据的小样本,推荐做5折交叉验证:把训练集分成5份,每次拿其中1份当验证集,剩下4份做训练,循环5次后取平均准确率,选出平均表现最好的K。
虽然sklearn里GridSearchCV一行就能完成,但如果你希望完整理解这一过程的原理,我建议你手写一个简单版本。值得注意的是,K值没有必要取太大,理论上不应超过总样本的平方根量级。Wine训练集134个样本,sqrt大约11.6,所以K的选择范围其实大致就是1到11,再往上增加邻域规模,模型所参考的信息就过于宏观了。
5.3 扩展到多类别的投票注意事项
Wine数据是三分类问题,平票概率相比二分类会低一些,但仍可能在K个邻居中出现1:1:1这种完全打平情况,也可能是1:1:0这种局部打平。如何处理平票需要提前规划。第一种办法是取K为奇数,但奇数只能化解二分类问题,不能保证多分类平票绝对消失。第二种办法是设定“先到先得”的规则:在距离相同的情况下,按原始列表顺序最先出现哪个类别就选哪个。第三种更合理,是把距离也纳入投票权重的考量,比如距离越近的邻居票权越大,但这就升级成KNN的加权变体。我在入门代码里选择简单多数,并用Counter.most_common的默认顺序处理相同票数,这样代码和解释都比较直接。
如果你后续想要参加期末考试或更深层研究,了解“距离加权投票”很有价值。比如可以用1 / (distance + eps)作为权重,对每个距离最近的K个样本累加权重,最后选择权重最大的类别。这样做的好处是离得近的样本话语权更大,能缓解边界样本被远距离多数类“淹没”的问题。数学上修改并不复杂,也算一个很自然的KNN扩展点。
6. 常见问题与排查技巧实录
6.1 shape不匹配导致的距离计算报错
手写代码最常见的错误就是传给距离函数的两个样本维度不一致。Wine数据原始维度是13,但如果某些操作中不小心把一个样本写成了单个数字,也就是shape为()而不是(13,),那么sum((a-b)**2)结果就会完全乱掉。排查时我建议先打印x_train.shape和x_test.shape,如果是(13,)和(1, 13)的这种差异,其实也会触发广播到不同维度。在进入predict_one之前,加上一行assert x.shape == X_train.shape[1:],就能在第一时间暴露这类问题。还有一个非常隐蔽的情况:用load_wine()读出来的是二维ndarray,但如果你用了wine.data[:, 1]取出了一列再传进去,得到的一维数组长度就不是13了,这会让距离公式变得完全不可解释。
6.2 忘记洗牌导致分类结果集体走偏
最初用全量数据直接取前75%当训练集,后25%当测试集时,因为Wine数据里类别是按0、1、2的顺序排列的,靠后的样本全为类别2,所以测试集里可能基本没有类别0和类别1,模型根本没见过某些类别,预测结果自然乱套。这个问题在代码不报错的情况下很难发现,因为它只表现为“准确率骤降”,所以我在每次划分数据前都会固定好随机种子并执行一次随机洗牌,把顺序打乱。常做交叉验证时,每次shuffle的策略要保持一致,否则不同K之间的比较就不可信了。
6.3 标准化贯穿全流程,别让特征“偷看未来”
我在带学生时,最常见的错误之一是先对整个X做完标准化,再拆分训练测试集。这样做的本质是让测试集的统计信息在训练期间就已经被算法“看见”,测试准确率会有轻微虚高。正确做法永远是先拆分,再只在训练集上计算均值和标准差,最后将同样的参数应用到测试集。这个细节在面试里经常被单独拎出来问,叫做数据泄漏问题。别小看这一点,实际生产环境里数据泄漏是模型评估过于乐观的常见原因。验证你是否有泄漏的办法也很直接:对测试集再单独打印其标准化后的分布,如果均值为0、标准差为1,说明你把测试集统计量重复计算了一遍,这就肯定有问题。
6.4 KNN在大数据集上慢得离谱怎么办
很多人在完成手写KNN后,第一反应是拿它去跑几千几万个样本的任务,发现预测一段数据要等半天。这里要明白KNN的预测时间复杂度是O(N·M·D),N是训练样本数,M是待预测样本数,D是特征维度。传统KNN是“懒惰学习”,训练阶段不做任何事,所有计算都堆积在预测阶段,所以每次预测都要和全部训练样本逐一算距离。入门阶段用for循环实现是为了清晰,但如果以后样本量变大,建议用两种优化方式:第一,把距离计算向量化,利用NumPy的广播机制一次性算出所有距离;第二,使用KD树或Ball树做近邻检索。需要说明,这些优化属于工程扩展,不影响算法原理本身。
6.5 平票、相同距离和边界情况的处理策略
平票问题不止停留在理论上,我在Wine实验里就曾经在K=4时遇到过某一样本两个类别各得2票的情况。解决办法最简单的是始终使用奇数K,虽然三分类问题时不会彻底消灭所有平票可能,但确实能把概率降低不少。如果在真实项目里遇到距离相同且类别分布打平,可以用一个很小的规则:比较平票类别的最近邻居距离,距离更近的那个类别胜出。如果连距离都一样,干脆按类别顺序取第一条。虽然这个处理看起来很粗糙,但这类情况本身在数据集中出现频率极低,对整体准确率的影响几乎可以忽略,你只要保证代码不报错、规则不隐晦就好。
结尾
最后再分享一点我在日常教学和实验中的体会:KNN是“用空间换时间、用记忆换推理”的代表,它没有显式训练参数,却能在小样本、低维度的分类任务里跟许多复杂模型打得有来有回。通过纯Python手写一遍后,你再回去看sklearn的文档,会觉得很多参数含义变得清晰多了。如果这篇文章帮你在“数学公式-代码实现-KNN算法本质”这条链路上打通了一环,后续可以继续挑战自己用距离加权版本、KD树实现等进一步优化方向,也可以尝试把这个手写模型搬到鸢尾花或手写数字数据集上,看看不同特征维度下KNN的表现差异。手写KNN值得花一晚上认真做一次,而且做完了基本不会忘。
