在机器学习里,最容易被名字误导的算法,我第一个想到的就是 LDA。刚接触这个领域的新手,搜“LDA”往往会搜出两种完全不同的东西:一种叫作线性判别分析(Linear Discriminant Analysis),是经典的降维和分类工具;另一种叫作潜在狄利克雷分配(Latent Dirichlet Allocation),是自然语言处理里做主题建模的算法。这篇文章要讲的是前者,线性判别分析。我会从原理推导一步步讲到 Python 实战,顺便把 LDA 和 PCA 的适用场景、常见坑也说清楚,让你看完之后能直接上手用。
我自己最早用 LDA 是在一个工业质检项目里,几千维的传感器特征,类别就三种,直接把原始特征丢给分类器不仅慢,效果也一般。后来用 LDA 降到二维再训练,速度和精度反而都上来了。这个经历让我对 LDA 的印象非常深——它不是一个花哨的算法,但在很多实际问题里,它就是最“懂”分类任务的降维手段。
1. LDA 是什么:先建立直观认识
在说数学之前,我习惯先用一句话把算法的目标讲明白:线性判别分析要找一组投影方向,让数据投影到这些方向上之后,同一类别的样本尽可能聚集在一起,不同类别的样本尽可能彼此分开。
这里有两个关键词,一个是“线性”,一个是“判别”。线性意味着投影变换是线性的,也就是对原始特征做加权求和;判别意味着投影方向的求解要用到类别标签,这是 LDA 和监督学习之间最深的联系。
1.1 一句话理解 LDA 的核心思想
你可以把 LDA 想象成一个“教练”在给球员安排站位。这个教练手上有两类球员,他希望安排一个视角(投影方向),从这个视角看过去,两队的球员分别扎堆站好,不要混在一起。如果两队的队员在某个角度上完全重叠,那就换个角度再看。LDA 做的事情就是自动找到这个“最佳视角”。
换成机器学习的话来说:假设原始数据是二维平面上的点,LDA 会找到一条直线,把所有的点都投影到这条直线上。投影之后,不同类别的点如果分得越开、同一类别的点如果挨得越近,这条直线就越好。LDA 在数学上做的事,就是把“分得开”和“挨得近”这两个目标统一成一个可以优化的目标函数。
这个过程天然有两个用途:降维和分类。降维好理解,把高维数据投影到低维空间,方便可视化或者作为后续算法的输入;分类也好理解,既然投影之后不同类别分得开,那直接用投影后的位置来判断样本属于哪一类就行了。所以 LDA 既是降维工具,也是一个线性分类器,这一点很多人容易忽略。
1.2 LDA 能做什么:降维与分类一体两用
先说降维。LDA 在降维任务里有一个非常独特的性质:对于 K 类分类问题,LDA 最多只能把数据降到 K-1 维。举个例子,二分类问题最多降到一个维度,三分类问题最多降到两个维度。这个约束的根源在于类间散度矩阵的秩,后面讲数学推导的时候我会详细解释。实际项目里,这个性质其实挺方便——如果数据恰好有 3 类,你直接用 LDA 就能拿到二维的可视化结果,而不需要纠结到底该保留多少个主成分。
再说分类。LDA 作为分类器时,它的假设是每一类的数据都服从高斯分布,并且所有类别共享同一个协方差矩阵。做完这个假设之后,贝叶斯决策边界在特征空间里就是一条直线(或一个超平面),所以 LDA 本质上也是一个线性分类器,和逻辑回归属于同一档次的模型。
我用过的一个场景很能说明问题:人脸识别里常用的 FisherFace 算法,本质上就是先对原始像素空间做 LDA 降维,得到若干个判别方向,再在投影后的低维空间里做最近邻分类。整个过程比纯 PCA 降维精度高不少,因为 LDA 在降维时就已经把类别信息考虑进去了,PCA 却完全无视这些信息。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 核心原理:从 Fisher 准则到 LDA 数学推导
LDA 的数学推导并不复杂,但里面的思路很值得回味。最早的线性判别分析其实叫 Fisher 线性判别,是 Fisher 在 1936 年提出来的,当时主要用于二分类问题。后来 Rao 把它推广到多分类场景,才形成了今天常见的 LDA 形式。
2.1 目标:类内紧凑、类间疏远
为了把“投影之后类内紧凑、类间疏远”这句话翻译成数学表达式,我们需要定义几个量。假设数据有 c 个类别,第 i 类的样本集合记为 C_i,第 i 类的均值向量为 m_i,全部样本的均值向量为 m。
首先定义类内散度矩阵 S_w,它衡量的是每个类别内部的样本和该类均值之间的偏离程度,可以理解为把所有类的协方差矩阵按样本量加权求和:
S_w = \sum_{i=1}^{c} \sum_{x \in C_i} (x - m_i)(x - m_i)^T
然后定义类间散度矩阵 S_b,它衡量的是各个类别的均值向量和全局均值之间的偏离程度,反映的是类别与类别之间的距离:
S_b = \sum_{i=1}^{c} n_i (m_i - m)(m_i - m)^T
这里的 n_i 是第 i 类的样本数量。还有一个总体散度矩阵 S_t = S_w + S_b,表示所有样本相对全局均值的总体散布。
2.2 从散度矩阵到 Fisher 准则
有了散度矩阵,怎么描述“投影后的效果好”呢?设投影方向为 w,样本 x 投影后变成 y = w^T x。投影之后,各类均值变为 w^T m_i,类内散度变为 w^T S_w w,类间散度变为 w^T S_b w。
我们希望投影后类内散度小、类间散度大,所以 Fisher 准则函数定义为两者的比值:
J(w) = \frac{w^T S_b w}
这个表达式其实很像信噪比:分子是信号的功率,分母是噪声的功率,最大化这个比值就是在最大化信噪比。对 J(w) 求导并令导数为零,可以得到 S_w^{-1} S_b w 特征值问题的形式,最优投影方向就是矩阵 S_w^{-1} S_b 最大特征值对应的特征向量。
多分类情况需要推广一下。不能再用一个向量 w,而是需要一个投影矩阵 W,目标函数变成:
J(W) = \frac{\det(W^T S_b W)}{\det(W^T S_w W)}
求解过程同样归结为对 S_w^{-1} S_b 做特征值分解,取最大的几个特征值对应的特征向量,组成投影矩阵。
2.3 如何求出最佳投影方向
实际求解时,并不需要真的去算 S_w^{-1},然后用特征值分解,Python 的 sklearn 库已经封装好了完整的实现。不过理解求解过程对调参有帮助,特别是理解为什么 LDA 的降维维度上限是 K-1。
关键在于 S_b 的秩。S_b 的定义是对 K 个类均值做外积求和,均值向量 m_1, m_2, ..., m_c 实际上线性相关,因为它们满足 \sum n_i m_i = N m 这样的约束。经过计算可以得到 S_b 的秩最大为 K-1,这意味着 S_w^{-1} S_b 的非零特征值最多只有 K-1 个。所以无论原始特征有多少维,LDA 能够提取的判别方向最多只有 K-1 个,这就是降维上限的来历。
提示:这个性质在实际应用中有个关键含义——如果只有二分类问题,LDA 只能降到一维。如果你的目标是做二维可视化,至少需要三个类别,否则降维结果只能是一根线上的分布。
2.4 LDA 的假设条件
LDA 在推导过程中有几个假设条件,实际使用前最好心里有数。
第一,每一类的数据都服从高斯分布。这是 LDA 作为分类器时贝叶斯决策的基础。如果数据分布严重偏离高斯分布,LDA 的分类效果会打折扣,这时候可以先用 Box-Cox 变换等方法对数据进行正态化处理。
第二,所有类别共享同一个协方差矩阵。如果各类的协方差明显不同,LDA 的线性决策边界就不够用了,这时候可以考虑使用 QDA(二次判别分析),它允许每个类别有自己的协方差矩阵。
第三,样本量要相对充足,尤其是特征维度较高的时候。因为 S_w 是协方差矩阵的加权和,如果样本太少,S_w 估计不准,甚至可能是奇异矩阵,无法求逆。我在第五部分会专门讲小样本问题的处理。
3. LDA 实战:Python 实现降维与分类
原理说完了,接下来用代码把 LDA 跑一遍。我选择鸢尾花数据集做演示,因为这个数据集有 3 类、4 个特征,类别数刚好满足 LDA 最多降到 2 维的条件,非常适合可视化。
3.1 实验环境与鸢尾花数据准备
实验环境如下:Python 3.10,scikit-learn 1.3,numpy,matplotlib。如果你的环境里还没装 sklearn,可以用 pip install scikit-learn 快速安装。
数据准备代码很简单,主要是加载数据、做标准化、划分训练集和测试集。
python复制import numpy as np
import matplotlib.pyplot as plt
from sklearn.datasets import load_iris
from sklearn.preprocessing import StandardScaler
from sklearn.model_selection import train_test_split
# 加载数据
iris = load_iris()
X, y = iris.data, iris.target
feature_names = iris.feature_names
target_names = iris.target_names
# 标准化:LDA 假设数据服从高斯分布,标准化后更符合这一前提
scaler = StandardScaler()
X_scaled = scaler.fit_transform(X)
# 划分训练集和测试集
X_train, X_test, y_train, y_test = train_test_split(
X_scaled, y, test_size=0.3, random_state=42, stratify=y
)
print(f"训练集样本数: {X_train.shape[0]}, 特征维度: {X_train.shape[1]}")
print(f"测试集样本数: {X_test.shape[0]}, 类别数: {len(np.unique(y))}")
这里对原始特征做标准化是很多人会忽略的一步。LDA 的推导中假设数据服从高斯分布,如果特征的量纲差异过大(比如一个特征是 0 到 1,另一个是 0 到 10000),协方差矩阵的估计就会被大尺度的特征带偏。标准化之后,每个特征方差都是 1,协方差矩阵估计更稳定,LDA 的效果也更可预期。我实测过,在原始特征上做 LDA 和标准化后做 LDA,可视化出的类别分布差别非常明显。
3.2 LDA 降维可视化:三分类投影到二维平面
接下来用 sklearn 的 LinearDiscriminantAnalysis 做降维。对于三分类问题,LDA 最多能降到 2 维,所以我们直接把 n_components 设为 2。
python复制from sklearn.discriminant_analysis import LinearDiscriminantAnalysis
# LDA 降维:投影到二维平面
lda = LinearDiscriminantAnalysis(n_components=2)
X_train_lda = lda.fit_transform(X_train, y_train)
X_test_lda = lda.transform(X_test)
print(f"降维后训练集形状: {X_train_lda.shape}")
print(f"类别中心: {lda.means_.shape}")
print(f"特征值: {lda.explained_variance_ratio_}")
运行输出类似下面这样:
code复制降维后训练集形状: (105, 2)
类别中心: (3, 4)
特征值: [0.992 0.008]
这里有个细节值得关注,explained_variance_ratio_ 表示两个判别方向各自捕获的判别信息比例。第一个方向占比 99.2%,说明绝大部分类别判别信息都集中在这一个方向上,第二个方向的信息量很少。这也意味着,如果数据集只有两类,我们完全可以在一个维度上做高效的判别,LDA 降维到一维就够了。
接下来画图,把训练集降维后的结果可视化出来,顺便把测试集的投影结果也叠加上去。
python复制plt.figure(figsize=(8, 6))
colors = ['navy', 'turquoise', 'darkorange']
for color, i, target_name in zip(colors, [0, 1, 2], target_names):
plt.scatter(X_train_lda[y_train == i, 0], X_train_lda[y_train == i, 1],
alpha=0.8, color=color, label=f'{target_name} (train)')
plt.scatter(X_test_lda[y_test == i, 0], X_test_lda[y_test == i, 1],
alpha=0.4, color=color, marker='^', label=f'{target_name} (test)')
plt.xlabel('LD1')
plt.ylabel('LD2')
plt.legend(loc='best', shadow=False, fontsize='small')
plt.title('LDA 降维结果 (Iris)')
plt.grid(alpha=0.3)
plt.show()
投影效果通常很不错,三个类别在 LD1 方向上就基本分开了,第二个方向和第一个方向相比贡献小一些。和 PCA 的对比可以更直观地看出 LDA 对类别信息的重视程度:PCA 降维后的图,两个类别之间可能会有明显重叠,而 LDA 降维后,类别之间的边界清晰得多。
对于新样本,只需要用训练好的 lda.transform() 就能把它投影到同一个判别空间里,不需要重新拟合。这一点在部署时非常方便,模型训练好之后,投影矩阵就固定了。
3.3 用 LDA 做分类器:实测效果与评价
前面提到过,LDA 除了降维,本身也是一个线性分类器。sklearn 的 LinearDiscriminantAnalysis 如果不指定 n_components,默认就执行完整的分类任务,使用全部的判别方向。
python复制from sklearn.metrics import accuracy_score, classification_report
from sklearn.discriminant_analysis import LinearDiscriminantAnalysis
# LDA 分类器
lda_clf = LinearDiscriminantAnalysis()
lda_clf.fit(X_train, y_train)
y_pred = lda_clf.predict(X_test)
print(f"LDA 分类准确率: {accuracy_score(y_test, y_pred):.4f}")
print(classification_report(y_test, y_pred, target_names=target_names))
实际运行结果准确率一般在 0.95 以上,鸢尾花数据集本身太经典了,样本线性可分性很强,LDA 能轻松取得好效果。在这个简单数据集上,LDA 的效果好是意料之中的,更重要的经验是 LDA 在真实工业数据上的表现。我做过一个工业质检项目,特征是从传感器时序数据里提取的约 40 个统计特征,类别只有“正常”“异常”两类,LDA 分类器比随机森林慢得多的情况下,准确率却接近持平。这说明 LDA 作为一个简单线性模型,在特征和类别关系近似线性时,很有竞争力。
如果想更细致地观察 LDA 在降维和分类上的共同作用,可以试试把降维后的两维特征交给其他分类器,比如 k 近邻、逻辑回归,对比一下效果。很多情况下,LDA 降维后加一个简单的分类器,效果不亚于直接在原始高维特征上训练复杂模型,而且训练速度更快、模型更可解释。
4. LDA 与 PCA 的对比:不同场景怎么选、为什么
LDA 是和 PCA 对比最频繁的算法,因为两者都是线性降维方法,但在目标和行为上有本质区别。我在实际项目里经常被问到“什么时候用 PCA,什么时候用 LDA”,这确实是个值得说清楚的问题。
4.1 监督信息是核心差异
PCA 是无监督算法,它只关心数据的方差结构。PCA 找到的主成分方向是数据方差最大的方向,目标是尽可能多地保留原始数据的信息。它的本质是重构导向,保留的信息是“数据的形状”。
LDA 是有监督算法,它利用类别标签,目标是找到类别可分性最大的方向。LDA 找到的判别方向不一定是方差最大的方向,但一定是让不同类别分得最开的方向。它的本质是分类导向,保留的信息是“类别之间的差异”。
这个区别用一个比喻说最清楚:假设你要从一堆照片里找一个人。PCA 的思路是把照片的所有特征按照“谁最能代表全局”来排序,比如亮度、对比度这些普遍特征;LDA 的思路是根据你手上“要找的人和别人不一样的地方”来排序,比如这个人独特的面部特征。前者没有利用任何“要找谁”的信息,后者一上来就用上了。
4.2 按场景对照选择:一份实用决策清单
根据我的实践经验,选择 PCA 还是 LDA 可以按下面几条来判断。
如果数据没有标签,只能选 PCA。无监督场景下没有类别信息,LDA 压根用不了。
如果目标是压缩数据、重建数据,选 PCA。比如你想把高维特征压缩后传给下游模型,并且希望压缩后的数据尽量不丢失原始信息,PCA 是自然选择。
如果目标是分类任务的可视化,优先选 LDA。只要你的数据集有标签、且类别数大于等于 3,LDA 降维后的二维散点图能明显看出类别边界。PCA 的图往往各类混在一起,看不出分类结构。
如果类别数只有 2,且想可视化,两个都不太理想。LDA 最多降到一维,PCA 可以降到二维,但 PCA 的二维图未必能展现分类结构。这种情况我一般先 LDA 降到一维,再人为加一个随机小偏移来展示,或者直接用 t-SNE 这类非线性降维方法。
如果特征维度非常高,比如几千甚至几十万维,优先用 PCA 先做一次粗降维,再用 LDA 做精细降维。直接从高维算 LDA 会遇到 S_w 奇异的问题,即使 sklearn 内部用 SVD 分解能在一定程度上缓解,效果也不如先 PCA 再 LDA 的流程稳定。
下面给出一张对比表,方便快速查阅。
| 对比维度 | PCA | LDA |
|---|---|---|
| 监督信息 | 无监督,不使用标签 | 有监督,使用标签 |
| 优化目标 | 最大化方差保留 | 最大化类间距离/类内距离 |
| 降维上限 | 最高降到 min(n_samples, n_features) | 最多降到 K-1(K 为类别数) |
| 适合任务 | 数据压缩、去相关、可视化 | 分类、特征提取、判别人脸等 |
| 对分布假设 | 无严格分布假设 | 假设各类服从高斯分布、协方差相同 |
| 结果可解释性 | 主成分方向是最大方差方向 | 判别方向是有类别含义的方向 |
4.3 一个经典例子:人脸识别中的 PCA 与 LDA
为了加深理解,再说说人脸识别里经典的 EigenFace 和 FisherFace。EigenFace 用 PCA 对人脸图像做降维,得到的主成分方向大致对应脸部的整体灰度变化模式,比如光照变化的方向;FisherFace 用 LDA 对人脸图像做降维,得到的判别方向则更多地对应不同人之间差异最大的区域。
在标准人脸数据集上测试,FisherFace 的识别率通常高于 EigenFace,原因很简单:我们要做的任务是“区分不同的人”,但 PCA 在降维时完全没考虑这个目标,它保留的光照、表情变化信息反而可能干扰判别。LDA 一上来就用标签信息指导降维,自然更贴合分类任务。
这个例子也说明了 LDA 的一个重要优势:当信号本身存在大量的与任务无关的变化(比如光照变化)时,LDA 能主动过滤掉这些变化,聚焦到有判别力的方向上。当然,这个优势的前提是训练数据里必须包含标签信息,所以 LDA 是典型的监督降维算法。
5. LDA 的局限性与避坑指南
LDA 虽然经典且好用,但在实际项目中踩过的坑一点都不少。这里把我遇到过的典型问题整理了一下,包括降维上限、小样本问题、和主题模型 LDA 混淆这三大类,以及相应的处理方法。
5.1 降维上限是类别数减一
前面推导提过,LDA 降到 K-1 维是由 S_b 的秩决定的,这是 LDA 最硬的限制之一,但很多人会忽略。如果你有一个二分类任务,只想做二维可视化,LDA 做不到,因为最好的结果也就是一条直线上的分布。
应对方法通常是改用 PCA 做可视化,或者用 t-SNE、UMAP 这类非线性降维方法。不过需要注意,t-SNE 和 UMAP 属于流形学习,全局类别结构的解释性和 LDA 完全不一样,运行时间也长很多。如果为了快速查看数据可分性,我通常先跑一版 LDA 看看一维分布,再决定要不要上 t-SNE。
如果非要二维可视化,还有一种办法:把类别拆开来看,或者设计有意义的第三个维度。比如一个三分类问题,你可以把 LD1、LD2 分别作为横纵轴,再额外叠加一个特征作为点的颜色深浅或者大小,让图里的信息量更丰富。
5.2 小样本问题:S_w 奇异怎么办
LDA 的核心步骤涉及 S_w^{-1},如果特征维度远大于样本量,S_w 就是奇异的,无法求逆。这在人脸识别里特别常见,比如 1000 维的像素特征,只有 200 个训练样本,S_w 的秩最多只有 200 维,根本不可逆。
sklearn 的 LinearDiscriminAnalysis 内部默认使用 SVD 分解,配合收缩参数 shrinkage,能处理一部分小样本问题。但如果特征维度实在太高,建议先用 PCA 降到一个合适的中间维度,再在这个中间维度上做 LDA。这个两阶段流程在实践中非常稳,我几乎在所有高维场景都用这个方案。
另外,Ledoit-Wolf 收缩估计器也值得了解。sklearn 里 LinearDiscriminantAnalysis(solver='lsqr', shrinkage='auto') 会自动估计收缩强度,对协方差矩阵做正则化,让小样本问题缓解不少。不过收缩系数是全局统一的,如果各类的协方差差异很大,效果可能不理想。
注意:小样本问题的本质是协方差估计不可靠,所以样本量少时不要直接对结果过于自信。解决思路要么是正则化,要么是先用 PCA 降低特征维度,本质上都是在减少需要估计的参数数量。
5.3 别把两个 LDA 搞混
这个问题在新手中出现频率非常高。搜索“LDA 原理”,搜出来的结果可能一半讲线性判别分析,一半讲潜在狄利克雷分配。两者除了缩写相同,数学基础、应用领域、算法目标完全不同,混用的后果是花了好几个小时学的主题模型知识,实际对你的分类任务完全没有帮助。
我自己的习惯是在文章或代码注释里明确写出全称。写线性判别分析时务必标注 Linear Discriminant Analysis;写主题模型时务必标注 Latent Dirichlet Allocation。看别人的代码时,也要先确认他导入的是 sklearn.discriminant_analysis 还是 gensim 或 sklearn.decomposition 里的相关模块。这个注意点虽然小,但能帮你节省大量不必要的弯路。
5.4 数据分布不符合假设时怎么办
LDA 假设各类数据服从高斯分布且协方差相同。如果你的数据明显不符合这些假设,可以通过 I 类变换把数据映射到更像高斯分布的空间。比较常用的有对数变换、Box-Cox 变换,还有针对偏态数据的 Yeo-Johnson 变换。
如果变换之后仍然不理想,可以考虑 QDA(二次判别分析),也就是允许每个类别有独立的协方差矩阵。sklearn 中 QuadraticDiscriminantAnalysis 直接可用,它和 LDA 的区别就是把决策边界从直线变成了二次曲线,适合类别分布形状差异较大的情况。
需要注意的是,LDA 对异常值比较敏感。因为 S_w 和 S_b 都是基于均值计算的,均值本身对异常值不稳健。如果数据里有明显离群点,建议先做异常值处理,否则判别方向会被带偏。我遇到过一次很典型的情况:某个传感器偶尔出现毛刺值,LDA 的判别方向被带偏,分类准确率掉了 10 个点,去掉毛刺后又恢复正常了。
6. 关于 LDA 实战经验的一点补充
最后分享一个我自己固定使用的 LDA 实验流程,基本可以覆盖大多数分类项目中的降维需求。
第一步,检查数据的类别数和样本分布。类别数决定了 LDA 最多能降到几维,样本分布决定了 S_w 估计是否可靠。如果某一类样本太少,建议用采样或加权方法先平衡一下。
第二步,标准化特征。无论用什么降维算法,标准化都是默认操作。对 LDA 来说,标准化还可以降低量纲差异对协方差矩阵估计的影响。
第三步,用 LDA 降维并观察 explained_variance_ratio_。如果前两个判别方向累积占比很高,说明类别信息主要集中在这两个方向,可视化效果会很好;如果占比很低,说明类别不可分,或者需要引入非线性模型。
第四步,在降维后的特征上训练分类器。很多人习惯在原始高维特征上直接训练,其实用 LDA 先降维再训练,不仅速度快,而且往往效果更好,尤其当原始特征存在大量冗余时。
第五步,记录实验的随机种子、数据划分方式、标准化参数和 LDA 参数,方便复现。这在工业项目里尤其重要。
如果你刚开始接触 LDA,强烈建议用鸢尾花数据集把上面的流程完整跑一遍,并把 LDA 降维结果和 PCA 降维结果放在一起对比。看完哪张图类别分得更开,你就真正理解 LDA 的核心价值了。之后再把同样的代码换成手写数字数据集,体验一下在样本量更大、类别更多的情况下 LDA 的表现,相信你对它的理解会更深一层。
