1. 距离度量在机器学习中的核心地位
距离度量是机器学习算法中最基础也最重要的数学工具之一。就像木匠需要尺子测量木材长度一样,机器学习模型需要距离函数来量化数据点之间的相似程度。在实际项目中,我经常遇到这样的场景:当特征工程完成后,面对同样的数据集,选择不同的距离度量会导致聚类或分类结果产生显著差异。
以电商用户分群为例,使用欧氏距离可能会把消费金额相近的用户归为一类,而采用曼哈顿距离则可能更关注用户购买频次的相似性。这种选择不仅影响模型效果,更直接关系到业务解读的合理性。因此,深入理解不同距离度量的特性和适用场景,是每位机器学习工程师的必修课。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 三大距离度量的数学本质
2.1 欧氏距离:最直观的空间度量
欧氏距离(Euclidean Distance)源于我们日常的几何空间认知,计算公式为:
code复制d(x,y) = √(Σ(xi - yi)²)
这个公式计算的是n维空间中两点之间的直线距离。在二维情况下,就是中学学过的勾股定理。我在实际应用中发现几个关键特性:
- 各维度差异会被平方放大,这意味着某个特征上的显著差异会主导整个距离计算
- 对特征的尺度非常敏感,使用时必须进行标准化处理
- 计算复杂度相对较高,特别是处理高维数据时
重要提示:当特征量纲不统一时,务必先做标准化(Z-score或MinMax),否则数值大的特征会完全主导距离计算。
2.2 曼哈顿距离:城市街区的智慧
曼哈顿距离(Manhattan Distance)又称出租车距离,计算公式为:
code复制d(x,y) = Σ|xi - yi|
得名于纽约曼哈顿整齐的街区布局,就像出租车只能沿着街道行驶一样。我的使用经验表明:
- 对异常值比欧氏距离更鲁棒,因为使用的是绝对值而非平方
- 在具有大量分类特征的数据集上表现更好
- 计算效率更高,适合实时性要求强的场景
典型应用案例是推荐系统中用户行为的相似度计算。比如用户对商品的点击、收藏、购买等行为次数,使用曼哈顿距离比欧氏距离更能反映真实的用户相似度。
2.3 切比雪夫距离:棋盘上的王者
切比雪夫距离(Chebyshev Distance)源于国际象棋中王移动的规则,计算公式为:
code复制d(x,y) = max(|xi - yi|)
``
