1. 从过拟合困局出发:LASSO到底改了什么
做机器学习的人,不管是在校复习还是在项目里跑模型,几乎都会碰到这个经典场景:手里的训练集只有两百行,特征却有两千列,特征之间还七拐八拐地相关。用普通线性回归去拟,训练集R²能到0.99,一到验证集就崩;用逐步回归手动筛变量,又得人工定阈值、反复调p-value,工程上一圈跑下来速度慢不说,选出来的结果换个数据划分就不稳定。
这时候LASSO基本是首选思路之一。它的全称是Least Absolute Shrinkage and Selection Operator,翻译过来叫“最小绝对值收缩与选择算子”,核心就干两件事:一是把回归系数往零的方向收缩,二是把其中一部分系数精确压成零。压成零的那些特征,等于模型自动帮你删掉了;没被压成零的,就是留下的“有效变量”。所以LASSO常被形容成一种内嵌了特征选择的回归方法。
我第一次认真用LASSO是处理一个客户流失预测的活儿。当时业务方丢过来一张宽表,里面光用户行为衍生变量就有三百多个,还有很多是不同时间窗口的统计值,相互之间严重冗余。一开始我用L2正则化的岭回归,模型效果还行,但业务方不满意:他们需要一份“哪些因素最影响流失”的清单,把几十个非零系数拿去做运营策略,根本没法落地。后来换成LASSO,λ调到合适位置,系数表一下就清爽了,留下来的变量业务含义也都说得通。从那以后我对它的定位就很明确:它不只是个防过拟合工具,更是一台“变量筛选器”。
这篇内容我会从原理、求解、调参到实际应用的坑一路讲下去。适合三类人看:一是正在做期末复习或者面试突击的学生,想把LASSO和岭回归的区别讲清楚;二是特征很多、模型频繁迭代的从业者,想知道怎么把这个算法真正用出效果;三是刚开始跑机器学习项目,想找一个可复现流程的新手。
1.1 LASSO改的是回归目标函数,不是改模型结构
很多人误以为LASSO是一种全新的模型,其实它的骨架仍然是线性回归,只是在目标函数后面增加了一项惩罚。线性回归本来想最小化残差平方和,LASSO变成了最小化下面这个东西:
[
\min_{\beta} \left{ \frac{1}{2n}\sum_{i=1}^{n}(y_i - x_i^T\beta)^2 + \lambda \sum_{j=1}^{p}|\beta_j| \right}
]
这里的 (\lambda) 是个非负的调节参数,越大表示对系数的“惩罚”越狠。( p ) 是特征数量。如果 (\lambda = 0),它就是普通最小二乘。随着 (\lambda) 增大,越来越多的系数会被推向零。
这跟“给模型加了一个约束”可以等价理解。用拉格朗日乘子把上面的目标函数改写回约束形式:
[
\min_{\beta} \frac{1}{2n}\sum_{i=1}^{n}(y_i - x_i^T\beta)^2 \quad \text{s.t.} \quad \sum_{j=1}^{p}|\beta_j| \le t
]
(\lambda) 和 (t) 是一一对应的。(\lambda) 越大,约束半径 (t) 越小,系数被限制在一个以原点为中心的菱形区域里。
1.2 岭回归用L2,LASSO用L1,差别到底在哪
如果惩罚项从绝对值范数换成平方范数,就成了岭回归:
[
\min_{\beta} \left{ \frac{1}{2n}\sum_{i=1}^{n}(y_i - x_i^T\beta)^2 + \lambda \sum_{j=1}^{p}\beta_j^2 \right}
]
岭回归能把系数缩小,但不会精确到零。这带来一个实际问题:变量一个都没筛掉,只是“重量变轻了”。
LASSO用L1范数的结果则完全不同。简单说,L2惩罚的等值面是圆球形,L1惩罚的等值面是带尖角的菱形。尖角刚好落在坐标轴上,所以最优解更容易出现在“某个系数恰好等于0”的位置。这个几何直觉,是理解LASSO的核心,下一节我会展开讲。
我当时踩过一个坑:刚接触LASSO时以为它和岭回归差不多,无非是把损失函数里的平方换成了绝对值。直到项目里需要变量清单时才发现,岭回归给不出清单,LASSO能给。这俩看似只差一个符号级别的小改动,实际行为差得非常远。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 菱形与圆形的博弈:L1惩罚项的几何直觉和数学推导
要搞清楚为什么LASSO能把系数压成零,不能只背“L1比L2更容易稀疏”这句话。我推荐从两个变量的小例子入手,理解了二维的几何图像,高维也就八九不离十了。
假设只有两个特征,模型要估计的系数是 ((\beta_1, \beta_2))。普通最小二乘没有惩罚项,解出来的点可能落在任意位置;加了惩罚后,问题变成了“在满足惩罚约束的区域里,找残差平方和最小的点”。
注意看两件事:
- 残差平方和的等高线,在没有惩罚项时是一圈一圈的椭圆,中心是OLS解。
- 惩罚约束区域一个是有棱有角的菱形(L1),一个是光滑的圆形(L2)。
如果椭圆的中心刚好落在菱形内部,那最优解就是OLS解本身,没有变量被压缩。但实际数据里这种情况很少。多数时候,椭圆中心和约束区域边界相切。菱形有四个角,角的坐标是“一个系数为0、另一个系数为正或负”。当椭圆等高线第一次碰到约束区域时,非常容易碰到这些角,于是某个系数的估计就正好是0。圆形没有这种角,你很难碰到“某个坐标恰好等于0”的位置,所以岭回归收缩后系数会很小,但几乎不会彻底变零。
这个过程可以再用正交设计的情形精确推导。如果特征之间是正交的,那么每个系数可以单独求解,LASSO的解就是OLS解经过软阈值处理:
[
\hat\beta^{\text{LASSO}}_j = \operatorname{sign}(\hat\beta^{\text{OLS}}_j) \cdot \max\left(0, |\hat\beta^{\text{OLS}}_j| - \lambda_j\right)
]
意思是:把OLS系数往零方向削减 (\lambda_j) 这么多;如果减小到负数方向越过了零,就直接变成0。岭回归对应的则是“按比例压缩”而不是“减掉一个常量”,所以除非本来就等于0,否则压缩后的结果不会是0。
2.1 更直观的“预算”观点
也可以用“预算”的语言来理解。L1约束相当于告诉你:所有系数绝对值之和不能超过某个额度 (t)。如果你有十个候选变量,每个都想分一点预算,最后就会有一堆系数分摊到很小的值。但优化的逻辑是“把预算花在最能降低损失的特征上”,于是某些解释力弱的特征干脆一分钱预算都不给,系数就变成0。L2约束呢,相当于不能超过一个平方半径,它没有“单项清零”的激励,更像把所有变量一起压小。
正则化也因此被看作一种“复杂度预算”。模型越复杂、非零系数越多,需要花的预算越多。LASSO在花预算这件事上特别精打细算,它倾向于挑出少数几个重要变量。
2.2 群体效应与“选择器”身份
LASSO这种清零能力让它天然承担了特征选择功能。但它选择的方式和逐步回归不一样:逐步回归按某个统计显著性顺序一个一个往里加变量或往外删变量,是离散的、0/1的决定;LASSO则是在连续优化过程中,让系数平滑地滑向0,再在某个λ下稳定为0。连续优化的好处是计算上可控,不用做大量的子集搜索。
代价也很明显:相关性强的变量组里,LASSO通常只会随机挑一个代表性变量,不会像岭回归那样把一整组变量都保留下来。这一点做特征工程的时候必须心里有数,后面我专门讲。
3. 坐标下降法拆解:手写LASSO比调用库更能理解的三个细节
LASSO的目标函数不是处处可导的,因为在 (\beta_j = 0) 的地方绝对值函数有个尖点。你不能直接套用普通梯度下降往下走。常用的求解方法有好几种:坐标下降法、最小角回归LARS、近端梯度法、ADMM等。对大多数做应用的人来说,最值得理解的是坐标下降法,因为sklearn里的Lasso主要就是用坐标下降实现的。
坐标下降法的想法很朴素:既然不能一次性求出所有系数,那就一次固定其他系数,只更新一个系数。反复轮换,直到收敛。
固定 (j) 以外的所有系数时,当前残差可以写成:
[
r_i^{(j)} = y_i - \sum_{k \neq j} x_{ik}\beta_k
]
那关于 (\beta_j) 的目标函数就变成一个单变量的带绝对值的二次函数:
[
\frac{1}{2n} \sum_{i=1}^{n} (r_i^{(j)} - x_{ij}\beta_j)^2 + \lambda |\beta_j|
]
单变量优化是可以直接写出解析解的。把二次项和绝对值项合并,用软阈值算子表达:
[
\beta_j = S\left(\frac{\sum_i x_{ij} r_i^{(j)}}{\sum_i x_{ij}^2}, \frac{n\lambda}{\sum_i x_{ij}^2}\right)
]
其中软阈值算子定义为:
[
S(z, \gamma) = \operatorname{sign}(z)(|z| - \gamma)_+
]
((x)_+) 表示当 (x < 0) 时取0。这个公式我再解释一下:(z) 是当前单变量最小二乘方向上的解,(\gamma) 是阈值。如果 (z) 离0比阈值还近,直接置为0;否则向0方向收缩 (\gamma)。
3.1 手写一个能跑的坐标下降LASSO
下面这段Python代码是一个演示性质的最小实现。我建议你把它跑一遍,比直接调库更能理解坐标下降的细节。
python复制import numpy as np
def soft_threshold(z, gamma):
if z > gamma:
return z - gamma
if z < -gamma:
return z + gamma
return 0.0
def lasso_cd(X, y, lam, max_iter=5000, tol=1e-6):
# X, y 需要已经中心化/标准化,代码里不做截距处理
n_samples, n_features = X.shape
beta = np.zeros(n_features)
# 预先算好每列的二范数平方,避免重复计算
norm_cols = np.einsum('ij,ij->j', X, X)
for _ in range(max_iter):
beta_old = beta.copy()
for j in range(n_features):
# 去掉第 j 个特征之后当前残差
residual = y - X @ beta + X[:, j] * beta[j]
z = X[:, j] @ residual / norm_cols[j]
gamma = lam * n_samples / norm_cols[j] # 注意,这取决于损失函数是否除以 n
beta[j] = soft_threshold(z, gamma)
# 判断收敛
if np.max(np.abs(beta - beta_old)) < tol:
break
return beta
注意一个细节:目标函数里如果带 (\frac{1}{2n}),那么 (\gamma) 里要乘 (n);如果你写的是 (\frac{1}{2}|y - X\beta|^2) 而不除以样本量,阈值计算就不同。很多实现矛盾就出在这个“除以n”上,跑出来的结果和sklearn对不上,大多是目标函数写法没对齐。
还有一个容易错的地方:截距项不做惩罚。绝大多数库在内部会先把X和y中心化,再求解不带截距的LASSO。中心化处理完之后,截距等于 (y) 的均值减去 (X) 均值点乘系数。手写实现如果不做这一步,对小数据集可能看不出问题,但遇到稀疏矩阵或数据均值非零时,结果和别人对不上。
3.2 工程实现里的热启动和Active Set
实际库里的坐标下降不会像我上面的代码那么傻乎乎地每轮遍历所有特征。当 (p) 很大时,每一轮都扫全量特征很浪费。比较成熟的做法是:
- 用Active Set思路:一轮迭代中只更新那些“可能非零”的变量;连续好几轮非零变量集合不变,就认为收敛。
- 用热启动:在求整条正则化路径时,先用比较大的λ跑出一个稀疏解,再把解作为相邻较小λ的初始值,这样坐标下降收敛极快。
- 结合强规则:先用相关系数筛选出一部分候选特征做精确求解,对不满足条件的特征直接赋0,然后再验证是否有遗漏。
这些经验不是让你自己重新造轮子,而是在用工具时知道它在干什么。例如sklearn的Lasso默认warm_start=False,如果你手动调参时能利用好warm_start机制,会在网格搜索中省不少时间。
4. 把λ变成可操作的选择:交叉验证与路径图
LASSO里最重要、也最容易被滥用的超参数就是 (\lambda)。它是正则化的强度。很多人默认用LassoCV帮它选一个λ就完事了,实际上做法糙一点没关系,但至少要理解λ是怎么被选出来的。
先明确一下:sklearn里Lasso的参数叫alpha,对应的就是公式里的λ。别被名字带偏。
调λ的标准流程是交叉验证。整体思路分成两层:
- 把训练数据切成K折,对每个候选λ,用其中K-1折训练,剩下1折算误差。每个λ得到K个误差,汇总成一个均值和标准误。
- 最终选择误差最小的λ,或者选择“误差在极小值一个标准误范围之内、但模型更简单”的λ。
后一种叫做 one standard error rule(1SE规则)。如果你用的是R语言的glmnet,这个规则是现成的:cv.glmnet返回结果里有lambda.min和lambda.1se两个标准选项。lambda.1se往往比lambda.min更大,意味着惩罚更强,选出来的变量更少,但精度没有显著下降。
我在实际项目中的习惯,是把lambda.min和lambda.1se两个模型都跑出来,放进下游业务流程里做一次对比。如果业务方每次都要投入大量人工去核查每个特征,那我会更倾向于选1SE对应的模型,因为少几个干扰特征,运营和风控团队解释起来成本低很多;如果纯粹拼离线AUC,那lambda.min通常更稳一点。
4.1 怎么看一张LASSO路径图
路径图是理解λ变化对系数影响的好工具。横轴一般是 (\log(\lambda)),左边λ小、右边λ大;纵轴是每个特征对应的系数估计。当λ从右往左逐渐减小时,惩罚变轻,越来越多的变量从0变成非0,系数值也逐渐放大。
看路径图时有几个经验:
- 在右侧,只有少数几个变量系数非0,这些通常是和目标相关性最强的核心特征。
- 随着λ减小进入左侧,曲线开始“分叉”变多,说明进入了一些弱相关或强相关的冗余变量。
- 如果你看到两条系数曲线从某个λ开始几乎重合,甚至不停交叉,那通常是这两个特征高度相关。LASSO在这种位置只会保留其中一条,别急着解读成“另一个特征没有用”。
4.2 一个典型操作流程
下面是我常用的一种做法,供参考:
- 把原始特征全部做标准化。这一步很重要,因为LASSO的惩罚项对所有系数一视同仁,不标准化的话量纲大的特征受惩罚小,容易被优先选中,结果会骗人。
- 在训练集上用5折或10折交叉验证,评估指标根据问题选。回归用MSE,分类用LogLoss/AUC。
- 画出误差均值随λ变化的曲线,观察最小值和1SE位置。
- 用选定的λ重新在全量训练数据上拟合模型。
- 观察非零系数对应的变量名单,逐个做一次业务合理性检查。
这里尤其要强调:标准化不能只在脚本里做一次然后忘了。如果上线后inference阶段新来的数据没有用同样的scaler做变换,系数就不可能正确复原。最好把整个预处理和模型串成Pipeline,而不是单独保存系数。
4.3 交叉验证中容易泄露信息的操作
我见过不少人在做特征工程时先在整个数据集上做标准化/填补,再切训练集和测试集。这个流程在LASSO面前会产生轻微但真实的“信息泄露”:标准化用的均值和方差已经见了测试集,虽然线性模型对这种泄露没那么敏感,但严谨的做法是先切分,再用训练集fit transform,再用同一个预处理模型transform测试集。
如果是用交叉验证来选λ,更要注意不要“用完整数据选完特征再CV”。有的做法是先用LASSO在全量数据上筛出十几个特征,然后只用这些特征做CV。这一步会让CV误差虚低,因为你筛特征的时候已经偷偷看到了所有验证折的数据。正确的是把特征选择放进每一折的训练内部。好在sklearn的Pipeline帮我们做了这件事,至少不会犯特别低级的错误。
5. 那些选了又没选出来的变量:LASSO在真实模型中的边界
用顺手之后,LASSO很容易被当成“特征自动筛选黑箱”。但真实数据里它有不少反直觉的行为。如果你要把它的结果汇报给业务方,或者拿去做特征清单,必须知道这些边界。
5.1 高度相关变量组里的“随机选择”
这是LASSO最典型的特征。假设你有一组真实有效的变量 (x_1, x_2) 都跟目标有因果关系,而且两者高度相关。LASSO的惩罚项约束预算有限,它大概率只选其中一个,把另一个压成0。换个数据重跑一遍,可能选中的是另一个。
这意味着什么?LASSO选出来的“重要变量”,不适合直接解释成“唯一真实的影响因素”。它更像在一组等价信息中挑了一个代表。如果业务上需要所有强相关变量都有解释,考虑弹性网(Elastic Net)会更合适。弹性网在L1之外加了一点L2惩罚,能尽量避免只保留一个随机代表的问题。
5.2 p >> n 场景下的稳定性问题
当特征数远大于样本数,比如基因表达数据里几万列、几十行,LASSO能选出看起来很有意义的一小撮变量,但样本一波动,选中的名单变化可能非常大。有一个直观的解释:变量间的相关结构在p >> n时很难被样本精确估计,微小扰动就能改变最优解的落点。
实际工作中我不太信单次LASSO的名单。一个做法是Bootstrap稳定性筛选:有放回地抽样上百次,每次跑一遍带交叉验证的LASSO,统计每个特征被选中的频率。被选频率超过80%的特征,才是真正值得投入下游的特征。低于30%的,基本是噪声或冗余变量。
这个操作还能帮你识别“随机代表”问题:如果一组强相关变量在不同Bootstrap样本里轮换被选,但总选中率都不算低,那不是它们不重要,而是模型在等价变量里摇摆。
5.3 预测模型和归因解释是两个层面
很多机器学习的课程作业会鼓励你从系数大小去解释“哪个变量最影响结果”。实际项目里这个解释要非常谨慎。LASSO的系数是“在最小化预测误差过程中收缩后的结果”,系数已经被偏置了,并不是因果效应。
比如在一个营收预测模型里,某营销活动标记特征系数很大,可能只是因为活动时间和另一个隐藏驱动因素相关。用在预测上没问题,但如果决策层说“那就砍掉所有非活动相关支出”,这个决定会被系数误导。要做归因,至少得配合领域知识或专门的因果推断方法,不能因为用了LASSO就自动获得“因果筛选”的能力。
5.4 自适应LASSO和弹性网存在的意义
LASSO的系数估计会有“过度收缩”:它对所有非零系数都用一个统一的惩罚强度。对于真正的大系数,这个统一惩罚会让它比真实值偏小,造成所谓“估计偏差”。
针对这个问题有两个常用改进:
- 自适应LASSO:先用一个初步估计给每个特征分配不同权重,重要特征惩罚小一点,不重要特征惩罚大一点。这样能改善选择一致性和系数偏差。
- 弹性网:损失函数变成 (\lambda(\alpha|\beta|_1 + (1-\alpha)|\beta|^2)) 之类, (\alpha) 控制L1和L2的混合比例。当特征分组高度相关时,弹性网的组效应更稳定。
纯LASSO适用于变量之间相对独立、你想得到一个干净可解释的稀疏模型的场景。如果特征工程后存在大量相关衍生变量,又希望群体信息被保留,弹性网通常是更稳的起点。
6. 一版可复现的演示与调参心得
纸上谈兵再多,不如直接在数据上试一遍。下面给一个模拟数据的小演示,可以对照着看LASSO在“真变量已知”的情况下表现如何。
先构造数据:200个样本,100个特征,其中10个特征有真实信号,其余90个是噪声。为了让情况更真实,我让这10个有信号的特征彼此存在中等程度相关性。
python复制import numpy as np
from sklearn.linear_model import LassoCV, Lasso
from sklearn.model_selection import train_test_split
from sklearn.preprocessing import StandardScaler
from sklearn.pipeline import Pipeline
np.random.seed(42)
n_samples, n_features = 200, 100
# 真实有信号的10个变量
true_idx = np.arange(10)
X = np.random.randn(n_samples, n_features)
# 让前10个变量之间有相关性
X[:, :10] += 0.8 * np.random.randn(n_samples, 1)
beta_true = np.zeros(n_features)
beta_true[:10] = np.array([1.5, -1.2, 1.0, -0.8, 0.6,
-0.5, 0.4, -0.3, 0.3, 0.2])
y = X @ beta_true + np.random.randn(n_samples) * 0.5
X_train, X_test, y_train, y_test = train_test_split(
X, y, test_size=0.3, random_state=1
)
pipe = Pipeline([
("scale", StandardScaler()),
("lasso", LassoCV(cv=5, random_state=0, max_iter=100000))
])
pipe.fit(X_train, y_train)
lasso = pipe.named_steps["lasso"]
print("selected alpha:", lasso.alpha_)
print("number of nonzero coef:", np.sum(lasso.coef_ != 0))
print("selected features:", np.where(lasso.coef_ != 0)[0])
print("test R2:", pipe.score(X_test, y_test))
我跑出来的结果大致是:模型会在100个特征里选出10到15个,前10个真实特征基本都能覆盖,但有时会漏掉信号弱的0.2系数特征,同时多选两三个噪声特征。别因为LASSO多选了一两个噪声就紧张——交叉验证选λ的目标是最小化预测误差,不是在“完美恢复真相”。预测误差视角下,多一个弱变量带来的损失往往比漏掉一个真变量的损失小。
看完这个结果,还有个值得练习的操作:把 LassoCV 换成一系列固定alpha,重复做交叉验证,观察每个alpha下的非零特征数量。你会发现alpha从大到小变化时,变量数量并不是均匀增长的,而是每次有几个变量同时“被激活”。这能帮你理解路径图上变量进入模型的顺序,也能帮你判断哪些特征处在“临界位置”。如果一个特征的系数在λ稍微增加一点时就被清零,说明它的边际贡献本来就很弱。
最后分享一个我自己的经验:用LASSO选完变量后,我会把剩下变量的系数方向整理出来,逐个和业务常识对照。如果某个特征的系数符号和业务直觉完全相反,先别急着怀疑算法,多数情况是这里存在多重共线性或者代理变量问题。这种“模型输出 + 业务校对”的步骤,才是LASSO在真实项目中真正体现价值的地方。
