逻辑回归的成本函数,很多人学到这里就开始糊涂。网上教程一上来就给一个大公式,然后说这就是交叉熵,但没人告诉你它到底怎么来的,为什么长这样,更没人告诉你为什么不能直接用线性回归那套最小二乘。结果就是考试会代公式,换个数据就不会了。这篇文章直接把这个成本函数从零推导到代码实现,把里面每一个“为什么要这样弄”都讲清楚,看完你也能手推。
1. 逻辑回归到底在做什么
在碰成本函数之前,得先把逻辑回归本身想明白。逻辑回归这名字特别坑,它名字里有“回归”,干的却是分类的活。它做的事情就是预测某件事发生的概率,比如用户会不会点击广告、邮件是不是垃圾邮件、病人有没有患病。输入是特征,输出是0到1之间的一个概率值。
1.1 从线性回归到逻辑回归的跨越
线性回归输出的是一个连续值,可能是个负数,也可能大于1,这没法直接当概率用。逻辑回归的做法是先算一个线性组合,就是标准的线性回归输出,然后把结果丢进sigmoid函数里,压缩到0到1之间。
sigmoid函数的数学形式是:
text复制sigmoid(z) = 1 / (1 + e^(-z))
z等于整个线性组合,可以写成theta^T * x。这样一来,逻辑回归模型输出的是:
text复制h(x) = 1 / (1 + e^(-theta^T * x))
这个h(x)的含义就是给定特征x时,预测结果为1的概率。这个映射关系是理解后续所有推导的地基。sigmoid函数有一个很妙的性质:单调递增,且处处可导,导数是sigmoid(z) * (1 - sigmoid(z)),这个性质后面推导梯度时会派上大用场,必须记住。
1.2 决策边界与分类规则
计算出概率之后,通常以0.5为分界去做分类决策:概率大于等于0.5,判断为正类,也就是1,小于0.5判断为负类,也就是0。把概率等于0.5的点找出来,解theta^T * x等于0,这组点的集合就是决策边界。
不同特征组合下,决策边界可以是直线、圆或更复杂的形状。这取决于你构造的特征。比如只用x1和x2两个特征,决策边界就是一条直线;如果加入x1的平方、x2的平方,决策边界就是一个圆。这个特性决定了逻辑回归并非只能学线性分类器,关键在于你怎么设计特征。
决策边界本身只是顺带一提,重点是成本函数的定义都要围绕“预测概率与真实标签的接近程度”这个核心来展开。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 为什么线性回归的成本函数不能直接搬过来
线性回归的成本函数也叫均方误差,MSE,公式是预测值与真实值之差的平方再取平均。很多初学者会想,逻辑回归不也是用梯度下降训练吗,为什么不能直接沿用MSE?
这个问题问得特别好,因为一旦搞懂了,你也就理解了交叉熵损失存在的意义。
2.1 非凸问题的致命陷阱
直接套用MSE会产生一个严重的问题:成本函数不再是一个凸函数。凸函数长什么样?像是山谷,只有一个最低点,从任意位置往下走都能滑到谷底。非凸函数则像连绵的山脉,有许多“锅底”一样的局部低谷。
把sigmoid代入MSE后,成本函数关于参数theta是非凸的。这意味着用梯度下降优化时,最终停在哪里极大程度上取决于参数初始化位置。运气不好,收敛到了局部最优点,模型效果就很差,而且你根本意识不到还有更好的解存在。
交叉熵成本在这点上完全不同。以交叉熵为目标函数时,整个问题是凸优化问题,无论参数从哪里初始化,梯度下降都能找到全局最优解。这才是它被广泛使用的根本原因。
2.2 单一样本带不动梯度
MSE在逻辑回归上还有另一个实际训练层面的问题——梯度消失。sigmoid函数在两头特别平缓,自变量很大或很小时,函数曲线几乎是一条水平线,导数趋近于0。
如果用MSE,误差项再乘上sigmoid的导数,在预测极端自信的错误场景下,梯度几乎为零,参数几乎不更新。说白了就是学不动,模型遇到自己错得很离谱的样本时,反而无法从中吸取教训,训练效率极低。
交叉熵同样会乘以sigmoid的导数,重要区别是交叉熵的误差项分子上多了一个1 / (h(x)(1-h(x)))项,刚好和sigmoid导数里的h(x)(1-h(x))约掉,剩下的梯度仅和预测与真实差距成正比。你错得越离谱,梯度就越大,更新就越猛,这才是合理的训练信号。
3. 交叉熵成本函数怎么推导出来的
交叉熵成本函数不是拍脑袋定出来的,它有一套非常优雅的概率学推导。理解了推导过程,你就能看清楚公式里每一项的来龙去脉。
3.1 从极大似然估计出发
核心思路是这样的:我们把每个样本的预测结果看作一个概率分布,用极大似然估计的思想找出最有可能产生这批数据的参数。
单看某一个样本i,它的真实标签是y_i,y_i只能取0或1。模型给出的预测概率h(x_i)表示预测为1的概率,那么预测为0的概率自然就是1 - h(x_i)。把这两者合起来写成一个式子:
text复制P(y_i | x_i; theta) = h(x_i)^y_i * (1 - h(x_i))^(1 - y_i)
当y_i=1时,式子变成h(x_i);当y_i=0时,式子变成1 - h(x_i)。这个写法很巧妙,用一个公式同时覆盖了两种标签。
把所有m个样本的概率乘起来,得到整个训练集的似然函数:
text复制L(theta) = PI_{i=1}^{m} h(x_i)^y_i * (1 - h(x_i))^(1 - y_i)
乘法运算在优化时不好处理,取对数把乘法变加法,对数函数又是单调增函数,最大化对数似然等价于最大化似然,于是可以得到:
text复制log L(theta) = sum_{i=1}^{m} [ y_i * log(h(x_i)) + (1 - y_i) * log(1 - h(x_i)) ]
3.2 负对数似然与成本函数的定义
机器学习里习惯上把问题定义为最小化成本函数,而不是最大化一个目标。所以对上面的对数似然取负号,就得到最终的成本函数形式:
text复制J(theta) = - (1/m) * sum_{i=1}^{m} [ y_i * log(h(x_i)) + (1 - y_i) * log(1 - h(x_i)) ]
多了一个负号之后,最大化对数似然的问题就转化成了最小化负对数似然的问题。前面乘以1/m是为了求平均,方便在不同样本量间比较成本值,也方便调整学习率,不放对结果没有本质影响。
注意这个公式在预测概率h(x_i)趋近于0时,log(0)会导致数值计算问题。实际工程中,通常会在log里面加一个小数epsilon,比如1e-10,防止出现无穷大。
3.3 为什么叫“交叉熵”
交叉熵这个概念来自信息论。真实标签的分布和模型预测分布之间的差异程度,可以用交叉熵衡量。两个分布越接近,交叉熵越小;差异越大,交叉熵越大。成本函数本质上就是惩罚模型预测分布与真实标签分布之间的差异。
这个视角还有一个实际价值:它解释了为什么逻辑回归经常输出“校准良好”的概率预测。因为成本函数优化的是整个概率分布,而不是只关心分类边界的情况,所以得到的概率值大体能反映真实的不确定性。当然这依赖特征充分度等现实条件,并非绝对,但逻辑回归确实因此成为很多业务场景里预估CTR或转化率的基础模型。
4. 梯度下降与代码实现
成本函数是目标,梯度下降是达成目标的手段。二者是组合使用的关系。
4.1 关键推导:成本函数对参数的偏导
我们在梯度下降每一步需要对所有参数求偏导,这个推导结果是理解整个训练过程的关键。已知sigmoid的导数是sigmoid(z) * (1 - sigmoid(z)),利用链式法则,成本函数对第j个参数theta_j求偏导,经过一系列代数化简,最终得到非常简洁的表达式:
text复制dJ/d(theta_j) = (1/m) * sum_{i=1}^{m} (h(x_i) - y_i) * x_{ij}
这个式子是不是特别眼熟?它和线性回归梯度下降的公式长得几乎一模一样。但是千万别高兴太早,二者有本质不同:这里的h(x_i)经过了sigmoid非线性变换,而线性回归里的h(x_i)就是线性组合本身。所以虽然公式长得像,但逻辑回归对应的梯度下降走的完全是另一条轨迹,正是因为logistic假设下的交叉熵损失把非线性项约掉了。
推导过程不难,重要的是理解其中的约分技巧。用链式法则展开时,对数项的导数会带来1/h(x_i)和1/(1-h(x_i))这种分母项,sigmoid的导数会带来h(x_i)(1-h(x_i))这一项,二者相乘后刚好抵消,剩下的就是预测值与真实值之差。这个“巧合”才是好多教材没点破的地方。
4.2 从头实现一个逻辑回归
用Python从零实现一个最精简版本的成本函数和梯度下降,只需要numpy就够了。不依赖scikit-learn,方便理解底层。
python复制import numpy as np
class LogisticRegression:
def __init__(self, lr=0.01, epochs=1000):
self.lr = lr
self.epochs = epochs
self.theta = None
def sigmoid(self, z):
return 1 / (1 + np.exp(-z))
def cost(self, h, y):
eps = 1e-15
return -np.mean(y * np.log(h + eps) + (1 - y) * np.log(1 - h + eps))
def fit(self, X, y):
m, n = X.shape
X = np.c_[np.ones((m, 1)), X] # 加一列全1,对应偏置项
self.theta = np.zeros(n + 1)
for _ in range(self.epochs):
z = X.dot(self.theta)
h = self.sigmoid(z)
gradient = X.T.dot(h - y) / m
self.theta -= self.lr * gradient
if _ % 100 == 0:
print(f"epoch {_}, cost {self.cost(h, y):.6f}")
def predict_proba(self, X):
X = np.c_[np.ones((X.shape[0], 1)), X]
return self.sigmoid(X.dot(self.theta))
def predict(self, X, threshold=0.5):
return (self.predict_proba(X) >= threshold).astype(int)
这一段代码看着短,里面藏着几个值得细讲的细节。一个是加偏置列的做法,把偏置项和特征参数统一成向量形式,代码简洁;另一个是成本函数里log加的epsilon,防止极端概率导致数学错误;还有一个是梯度算式的向量化写法,X.T.dot(h - y)一步完成所有参数梯度的累积计算,比循环快得多。
用这个类训练模型后,观察每个epoch的成本值变化。正常情况下,成本值应该逐渐下降并趋于平缓。如果成本值出现增大或剧烈震荡,一般就是学习率设置过大,需要调小。
4.3 scikit-learn实战中的成本函数
实际开发中通常不会自己手动写逻辑回归,直接用scikit-learn更方便稳妥。
python复制from sklearn.linear_model import LogisticRegression
model = LogisticRegression(C=1.0, solver="lbfgs", max_iter=1000)
model.fit(X_train, y_train)
这里有个很重要的点:solver参数。scikit-learn的LogisticRegression支持多种优化器,包括lbfgs、liblinear、newton-cg、sag等。它们最终优化的目标是一样的,就是交叉熵损失加正则项,但数值求解的路径各不同。对于小规模数据lbfgs是首选;对于大规模数据可以考虑sag或saga;liblinear对L1正则支持更好。样本量不大时没必要在这上面纠结太多,lbfgs一般就够用。
C参数与成本函数的关系也非常紧密。C是正则化强度的逆,C越小正则惩罚越强,C越大模型越倾向于拟合训练数据。实际调参时通常对C取对数尺度搜索,比如从0.001到1000之间。
5. 成本函数中的正则化
成本函数未必只有“数据拟合”这一项。实际建模中,如果特征维度很多或特征之间存在强相关性,模型很容易过拟合。解决思路是在成本函数里加一项惩罚项,把参数往零的方向压缩。
5.1 L2正则化下的成本函数与梯度更新
加了L2正则之后的成本函数长这样:
text复制J(theta) = 原始交叉熵项 + (lambda / (2m)) * sum_{j=1}^{n} theta_j^2
注意正则项一般从theta_1开始累加,不对偏置项theta_0做惩罚,因为偏置大小不影响决策边界的复杂度。实际实现中很多库默认也不惩罚拦截项。
对应的梯度更新规则也变了。除偏置项之外,每个参数的梯度都需要额外加上(lambda / m) * theta_j。写成更新公式:
text复制theta_j = theta_j - lr * [ (1/m) * sum (h(x_i) - y_i) * x_ij + (lambda / m) * theta_j ]
把theta_j提取出来,可以看作每次迭代在原有梯度更新基础上,先对权重乘以一个稍微小于1的系数,再进行常规更新。这相当于每次都对权重做一定程度的“缩减”,所以L2正则也叫权重衰减。
5.2 L1与L2正则的差异
| 特性 | L2正则 | L1正则 |
|---|---|---|
| 惩罚形式 | 参数平方和 | 参数绝对值之和 |
| 参数分布 | 把参数压缩到接近0但不等于0 | 会把不重要的参数直接压缩到0 |
| 稀疏性 | 无 | 有,天然做特征选择 |
| 优化难度 | 处处可导,优化简单 | 在0点处不可导,优化需要特殊算法 |
| 实际场景 | 大多数情况默认选择 | 特征维度极高、需要筛选时使用 |
在scikit-learn的LogisticRegression里,通过penalty参数选择l1还是l2。用L1时solver建议选liblinear或saga,因为lbfgs并不支持L1惩罚。
正则化强度与成本函数的关系图是一条U型曲线:正则太弱过拟合,训练成本低但验证成本高;正则太强欠拟合,训练成本和验证成本都高。找到中间的平衡点,通常用交叉验证搜索C参数。
6. 踩坑经验与常见问题实录
不管是期末考试实操题还是真实业务建模,逻辑回归和它的成本函数在实际使用中存在不少让人头疼的坑。下面把高频问题整理成速查清单,都是实操里容易踩中的。
6.1 标签值不是0和1会造成成本误导
逻辑回归的成本函数严格依赖y取值0和1。如果数据里把正类标成1、负类标成-1,或者正类是2、负类是1,公式直接失效。成本函数计算的是“标签是1还是0”对应的对数概率,标签一改,所有项都会错。
解决方案是送入模型之前,用工具把标签统一成0和1。用sklearn的LabelEncoder或自己写个map,训练前和验证前都要做相同的标签映射,尤其是验证集里出现训练集没有的新类别时,要先检查编码是否完整。
6.2 学习率过大导致成本不降反升
自己手写梯度下降时,学习率没有固定的万能值。lr等于0.01在某个数据集上没问题,换一个数据集直接就发散。判断方法是看每一轮的成本输出:如果成本值出现周期性波动或持续上升,马上就想到是学习率太大。
更稳妥的做法是把学习率调小到成本值平滑下降为止,或者加入衰减策略,在训练后期自动把学习率缩小。实际测试中lr从0.001开始往往是个比较稳的起点。
6.3 特征尺度不统一让梯度震荡
逻辑回归对特征尺度比较敏感。一个特征取值范围0到1,另一个特征取值范围0到10000,梯度更新时大尺度特征对应的参数更新会非常剧烈,小尺度特征对应的参数又几乎不动,形成震荡或收敛极慢的现象。
解决方法是做特征标准化,用z-score,让每个特征有大约0均值和单位方差。scikit-learn里用StandardScaler。要注意fit scaler只用训练数据,然后同样应用到测试集,不允许用测试集统计量去fit,否则会造成数据泄漏。
6.4 类别不平衡时概率阈值要调整
正负样本比例悬殊时,比如正样本只占1%,模型学到的预测概率会整体偏小。这时候拿0.5当分类阈值,召回率会惨不忍睹。这不是成本函数本身错误,而是默认的贝叶斯最优决策阈值建立在类别先验近似相等这个前提上。
实际处理分几层。数据层面可以用class_weight='balanced',它内部会调整损失权重,让少数类的错误产生更大的惩罚。scikit-learn里直接传这个参数就行。更精细的做法是训练后用验证集重新搜索最优阈值,比如尝试0.3、0.4、0.5、0.6,画PR曲线找那个F1最高的点,把分类决策点改到那里。
6.5 数据完全可分时模型不收敛
当样本在特征空间里完全线性可分时,逻辑回归的参数会无限变大,因为决策边界稍微扩大一点点,样本概率就被推向极端,交叉熵成本还能继续下降。这在理论上表现为无最优解,实践上表现为梯度下降很久成本还是降不完。
解决办法就是加正则。这也是为什么scikit-learn的LogisticRegression默认就带L2正则,C默认是1.0。正则项强制参数保持在一个合理范围,避免这种情况。初学阶段遇到不收敛,加正则化基本能解决。
7. 期末复习时的理解技巧与最后建议
期末考这种知识点最大的幸福在于考点集中。成本函数考来考去就几个点:能不能用MSE、交叉熵公式会不会写、梯度推导会不会推、正则项怎么加。抓住这些核心,应付考试甚至面试都够用了。
理解时有个技巧我们自己带人也常用。把h(x)看成模型对“正类概率”的判断,交叉熵就是在问:当真实标签为1时,你对1的概率判断有多大,准确来说这个概率的对数有多大;当真实标签为0时,你给出的1的概率越小越好。成本是这两部分按样本占比求平均。这样想就比死记公式轻松多了。
推导向量化时不要怕矩阵符号。X是(m,n)维矩阵,theta是(n,1)维向量,h是(m,1)维预测,y是(m,1)维标签。h - y得到预测残差向量,X.T.dot残差得到(n,1)维梯度。整个训练过程没有显式的循环,这是将成本、梯度、更新规则串成一条线的最短路径。
代码实践上,我自己的经验是先手写一个不带正则的朴素版本,确认成本下降趋势正常,再加正则,再用库函数。梯度验证也可以用数值梯度做检查:算一个很小的epsilon,比如1e-5,然后用(f(theta+eps) - f(theta-eps)) / (2*eps)近似梯度,和解析梯度对比。如果两者差超过1e-3量级,大概率推导出了错。这个策略我几乎每次手写模型都会用。
最后分享一个特别实用的习惯:无论用什么机器学习模型,训练之前都把成本函数的公式手写出来,哪怕已经在代码库里用过一百遍。因为写出来的过程就是在审视模型目标的过程,成本函数搞错了,后面所有调参都是白费力气。
