复习机器学习复习到第3-4章,很多人会发现难度突然开始向“推导”倾斜。前面还在讲“什么是监督学习”“怎么评估模型”,从第3章开始就必须真正动手推损失函数,第4章又开始换一套逻辑,用树结构做判断。这两个章节,恰好是机器学习路上的第一个分水岭,也是期末笔试、面试手撕算法的高频来源。这篇内容按大多数入门教材的经典结构,把第3章线性模型和第4章决策树串成一张完整的复习地图,同时会把公式背后的来源、不同算法的选择理由、实际工程里容易踩的坑一并讲清楚。如果你的教材章节号刚好不同,也别急着划走,后面提到的复习思路和排查方法可以直接平移过去。
1. 先把第3章和第4章的复习地图铺开
1.1 “第3-4章”到底在说什么
先说个现实问题:只看“机器学习3-4章”这几个字,其实没法判断具体内容。不同教材的章节编排差得挺远,有的把KNN放第3章,有的把朴素贝叶斯放第4章,网上搜出来的复习资料很容易对不上号。
国内比较常见的经典教材结构,是把第3章设为线性模型,第4章设为决策树。我下面按这个主流路线来讲,因为这两章的知识密度高,而且几乎所有学校的期末卷子在问答、计算、推导题里都会从这里出题。
如果你们老师的PPT没有严格按这个顺序上课,也没关系,你需要观察的往往不是第几章,而是“这份复习资料是不是在讲同一组算法”。线性回归、对数几率回归、线性判别分析,基本可以看成第3章的家族;ID3、C4.5、CART,就是第4章的家族。先把顶层地图对齐,再往下背细节,才不会被教材版本带偏。
1.2 两章的一条主线:数据长什么样,模型就长什么样
第3章和第4章虽然一个是“线性加权”,一个是“树形判断”,但本质上都在回答同一个问题:给定特征,如何预测标签。
第3章的核心假设是输出和特征之间满足线性关系,或者经过一个链接函数后满足线性关系。它适合特征量纲比较整齐、关系相对平滑、样本量不算太小的场景。第4章则完全换了一种哲学,不假设分布,也不要求线性,而是用一整套“if-then”规则不断把数据切分,直到每个子区域尽可能纯净。
把两章放在一起复习有额外好处。第3章对应的模型通常方差小、偏差稍高,不容易过拟合;第4章的完整决策树则相反,容易过拟合但解释性强。很多期末大题都是让你比较这两类模型,所以复习时别只盯着单独某个算法,要主动去对比损失函数、优化方式、偏差方差特征。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 线性回归与逻辑回归:公式记不住,就从损失函数反推
2.1 线性回归为什么偏要最小化均方误差
第3章开头一般先从一元线性回归讲起。模型长这样:
[
f(x)=wx+b
]
问题是怎么确定 (w) 和 (b)。教科书直接给出了最小二乘法,也就是让预测值和真实值的均方误差最小:
[
E(w,b)=\sum_{i=1}^{m}(y_i-wx_i-b)^2
]
很多同学背公式没问题,但一旦被问到“为什么用均方误差,不用绝对误差”,就容易卡住。朴素的解释是平方误差方便求导,而且处处可导。更深一层,如果假设误差项服从均值为0、方差恒定的高斯分布,那么最大似然估计解出来的目标函数,就是最小化均方误差。这说明最小二乘不只是“顺手选的”,它在统计上有明确的概率背景。
真正实操时,还要注意一个容易被忽略的点:均方误差对大误差样本特别敏感。如果你数据集里有明显异常点,一个点就能把回归直线拉歪,这也为后续引入正则化埋下伏笔。
2.2 把式子写成矩阵形式,才能理解“正规方程”
到了多元线性回归,最好别再用分量形式一个个写。把 (N) 个样本全部放进矩阵,目标是损失:
[
L(\theta)=|y-X\theta|^2
]
对 (\theta) 求导并令导数为零,得到:
[
\theta=(X^TX)^{-1}X^Ty
]
这个公式表面好看,但里面有个隐藏前提:(X^TX) 必须可逆。实际数据经常出现特征维度很高,或者特征之间线性相关的情况,(X^TX) 就是奇异的。这时候直接用 sklearn 的 LinearRegression 也能跑,因为底层会走最小二乘的 SVD 分解,而不是笨拙地去求逆。复习时最好能把这个点答出来:当 (X^TX) 不可逆时,可以加入正则项,或者使用伪逆求解。
我自己的复习习惯是把“线性回归”当作所有模型的起点,每次学新模型都问三个问题:目标函数是什么?怎么优化?有没有闭式解?这三个问题能帮你把后续逻辑回归、SVM的推导都串起来。
2.3 分类问题为什么不用线性回归硬拟合
考试里特别容易出现一道题:给你一组分类数据,问能不能直接用线性回归做分类。
答案是不能,原因其实很直观。线性回归输出的是一个连续实数,范围没有限制,你想把它解释成概率时必须人为设阈值。更麻烦的是,如果某个类别的样本在特征空间中明显偏多,线性回归为了拟合这些远端样本,会把决策边界拉得非常歪,导致边界附近的点全被分错。这类问题在教科书里叫“回归模型对分类任务的偏移效应”。
那怎么解决?需要一个函数把线性输出压缩到0到1之间,并且最好在中间区域变化敏感,在两端趋于饱和。Sigmoid函数正好满足这些条件,于是就有了对数几率回归,也就是大家常说的逻辑回归。
[
p(y=1|x)=\frac{1}{1+e^{-(w^Tx+b)}}
]
逻辑回归的“逻辑”不在“回归”两个字上,它做的是分类。
2.4 从极大似然到交叉熵,逻辑回归损失是怎么长出来的
逻辑回归不能再用均方误差,原因是模型输出变成了概率,标签成了0或1。如果你硬套均方误差,目标函数会变成非凸函数,梯度下降很容易被困在局部最优。
正确做法是从概率角度看。对单个样本,模型输出:
[
P(y|x)=p^y(1-p)^{1-y}
]
对所有样本取 log 后再取相反数,就是负对数似然损失。稍微整理后,每个样本的损失是:
[
L=-[y\log p + (1-y)\log(1-p)]
]
这就是二分类交叉熵。对比一下均方误差和交叉熵在逻辑回归上的表现:交叉熵在预测概率极端错误时,梯度会很大,能推动参数快速修正;均方误差在输出饱和区梯度几乎消失,学起来很慢。
2.5 动手推一遍梯度,笔试才不会慌
很多人记住交叉熵长什么样,但一道“请写出逻辑回归损失对 (w) 的梯度”就把人难住了。其实推导步骤很短:
先算 (p) 对线性输出 (z=w^Tx+b) 的导数,sigmoid 的导数性质是:
[
\frac{\partial p}{\partial z}=p(1-p)
]
再把损失对 (p) 求导:
[
\frac{\partial L}{\partial p}=-\frac{y}{p}+\frac{1-y}{1-p}
]
用链式法则相消后,会得到一个非常干净的结论:
[
\frac{\partial L}{\partial w}=(p-y)x
]
这个式子太重要了。它说明逻辑回归的梯度,本质上是“预测概率与真实标签的差”乘以特征,误差越大,参数更新越猛。做题时只要记住这个简洁形式,许多问答题都能迎刃而解。
3. 多分类、softmax和类别不平衡:扩展点最能拉开差距
3.1 多分类解法:OvO、OvR,怎么选不亏
单个逻辑回归只能做二分类,遇到三分类以上,就有两套经典方案。
OvR(One vs Rest)也叫一对多,训练时把其中一类当作正样本,其余所有类都当作负样本。三类问题就需要训练三个分类器,每个分类器负责回答“是不是第K类”。预测时选置信度最高的分类器作为最终类别。
OvO(One vs One)是两两配对,每次只取其中两类来训练。四个类别会产生6个分类器,预测时让所有分类器投票,票数最高的胜出。
从计算角度看,类别数比较多时,OvO需要训练的分类器数量会爆炸,因为它复杂度是 (K(K-1)/2),而OvR只需要 (K) 个分类器。但OvO每个分类器训练时只用到两类样本,单任务更快,而且在类别不平衡更严重的时候往往更稳。工业里如果类别数不多,不少人会优先试OvR,因为它好实现,部署时也容易解释。
3.2 softmax:把逻辑回归直接推向多分类
除了“训练多个二分类器”,还可以直接改造逻辑回归的输出层,让它同时输出K个概率,这就是softmax回归。softmax把每个类别的线性得分 (z_k=w_k^Tx+b_k) 做指数归一化:
[
p_k=\frac{e^{z_k}}{\sum_{j=1}^{K}e^{z_j}}
]
这里推荐一个数值稳定性技巧:实际计算时不要直接算 (e^{z_k}),而是先对全体得分做减最大值处理,也就是令 (z_k'=z_k-\max(z))。因为指数函数在输入比较大时会爆炸,减去最大值后,最大变成0,分母至少是1,数值不会溢出。这个细节在框架底层早就处理好了,但手写代码时容易踩。
3.3 类别不平衡:为什么准确率会骗人
第3章末尾通常会讲一个容易被考试忽略,但在真实业务里极其常见的问题:类别不平衡。
假设银行反欺诈数据里,99%样本是正常交易,1%是欺诈。你做一个模型,永远输出“正常”,准确率高达99%。这个模型看起来厉害,实际却一点用也没有。
所以评估时不能只看 accuracy。要至少看精确率、召回率和F1值。精确率回答“预测成正类的样本里有多少是真正的正类”,召回率回答“真实正类里面有多少被找回来了”。在不平衡场景下,F1值比准确率更能反映模型价值。
3.4 处理不平衡的手段怎么排序
处理类别不平衡没有万能顺序,但常见的重要手段可以排个序。
第一,换评估指标,不要盯着准确率调参。第二,尝试调整分类阈值,而不是一上来就改数据。很多模型输出的是概率,把默认的0.5阈值往上调或者往下调,可能比改动训练数据更快解决问题。第三,采用重采样,对小类做过采样,或者对大类做欠采样。第四,给少数类样本更高的损失权重,对应到sklearn里就是 class_weight='balanced',它可以自动按类频率放大损失。
我在实际项目里见过不少同学一见到不平衡就急着塞SMOTE,结果噪音越来越多。其实先调阈值和类别权重,往往已经能解决大部分问题。只有当你确认是数据分布本身有问题时,再考虑生成少数类样本。
4. 决策树算法:ID3、C4.5、CART到底怎么选特征
4.1 决策树分裂的本质:让每个子节点越来越“纯”
第4章从决策树开始,思路和线性模型完全不一样。算法会从根节点出发,每次挑一个特征,按特征取值把样本切到不同的子节点,然后重复这个过程,直到节点里的样本属于同一个类别,或者达到停止条件。
这里最关键的问题就是:这么多特征,优先选哪个切?判断标准叫“纯度”。如果一个节点里全是同一类别的样本,纯度最高;如果两类各占一半,纯度最差。
从混乱到有序,需要一个量化指标,于是信息熵被引入。信息熵是描述随机变量不确定性的指标,计算公式:
[
Ent(D)=-\sum_{k=1}^{K}p_k\log_2p_k
]
如果某类别概率为1,熵为0;如果所有类别概率相等,熵最大。决策树分裂的目标,就是让分裂后各个子节点的加权熵,比分裂前下降得越多越好。
4.2 信息增益、增益率、基尼指数,三种规则对比
ID3算法用的就是信息增益,它等于分裂前的信息熵减去分裂后子节点信息熵的加权和。挑选信息增益最大的特征作为当前最优划分特征。
C4.5算法是ID3的升级版,它不直接用信息增益,而用增益率。为什么要改?因为信息增益天然偏向取值很多的特征。
举一个极端例子,如果把样本ID当作特征,ID3一定会优先选ID,因为每个ID对应唯一一个样本,分裂后每个节点只有一条数据,每个节点纯度高到爆炸,信息增益非常大。但这种划分完全没有泛化能力。C4.5用特征的固有值对信息增益做归一化,相当于给“取值数量非常多”的特征加一盆冷水。
CART决策树走的是另一条路,用基尼指数。基尼指数衡量从节点中随机抽两个样本,它们的类别不一致的概率。Gini系数越低,节点越纯。CART的优点是计算量比对数小,不用算log,所以实际工程中应用最广。
| 指标 | 代表算法 | 公式倾向 | 特点 | 缺点 |
|---|---|---|---|---|
| 信息增益 | ID3 | (Gain(D,a)=Ent(D)-\sum \frac{ | D_v | }{ |
| 增益率 | C4.5 | (Gain_ratio=\frac{Gain}{IV(a)}) | 加入固有值惩罚,抑制多值属性 | 会偏向取值少的属性,常和启发式结合 |
| 基尼指数 | CART | (Gini(D)=1-\sum p_k^2) | 计算快,无需算对数,工程最常用 | 连续值要额外排序 |
4.3 手算一个5分钟小例子
光看公式容易晕,我用一个微型数据集演示一下“信息增益怎么算”。假设样本根据两个特征决定是否出门运动,类别分为“运动”和“不运动”,两类样本各占一半,所以根节点熵是1。
比较“天气”和“是否有风”两个特征。按“是否有风”切分,有风的样本全部是“不运动”,子节点熵是0;无风的样本里,4条运动、1条不运动,熵约为0.722。加权后,子节点总体熵约为0.451。信息增益等于:
[
1-\frac{3}{8}\times0-\frac{5}{8}\times0.722\approx0.549
]
按“天气”切分时,如果天气为晴天的4条样本里3条运动1条不运动,雨天4条样本里1条运动3条不运动,两边的熵都是0.811。加权后子节点总体熵差不多还是0.811,信息增益只有0.189。所以这一步明显应该优先选“是否有风”。
这类手算题在期末非常喜欢出现,做题诀窍是先求根节点熵,再算每个属性划分后的加权熵,最后做差。每一步写出过程,基本就能拿全分。
4.4 贪心算法也可以讲出道理
决策树学习的本质是递归地选择最优划分属性。严格说,找到一棵全局最优的决策树是NP难问题,所以学界和工程界都用贪心策略,每一步只看当前节点哪个分裂收益最大,不计较两步以后会不会更好。
这也是决策树容易过拟合的根源之一:只要一直切下去,它总能构造出一棵完美拟合训练集的树。学习的时候,别只记住“信息增益大就选它”,要能解释为什么要这么选:因为局部最优是可控的,而且全局最优的复杂度根本不可接受。能把这个理由讲清楚,面试官通常不会继续追问太偏的方向。
5. 剪枝、连续值与缺失值处理:决策树从“能跑”到“能上线”
5.1 预剪枝和后剪枝,到底该选哪个
第4章真正的难点其实是决策树的工程化细节,尤其是防止过拟合。最有效的办法是剪枝,分为预剪枝和后剪枝。
预剪枝是在构造树的过程中提前停止。比如当节点样本数小于某个阈值,或者划分后验证集准确率不升反降,就不再继续分裂。优点是训练速度快,缺点是“目光短浅”。某些分裂即使当下让验证集准确率下降,但继续往下分裂几层后,整体准确率反而可能上升。预剪枝容易错过这种机会。
后剪枝是先把整棵树生成完,然后自底向上对内部节点做检查,如果合并成一个叶子节点能让验证集误差更小,就把这棵子树替换成叶子。
实验里,后剪枝通常比预剪枝保留更多结构,泛化能力也更好,但代价是要先生成完整树再回头做检查,时间成本更高。工程上,比如 sklearn 的决策树主要通过 max_depth、min_samples_leaf 这类参数实现预剪枝效果,而真正的后剪枝需要配合 cost_complexity_pruning 来做。
5.2 连续值怎么处理:二分法就够了
很多入门的例子都是“天气=晴/雨”“是否运动=是/否”这种离散特征,可真实数据大多包括“年龄”“收入”“温度”这种连续值。
C4.5给出的经典方案叫二分法。先把连续特征的取值从小到大排序,对任意相邻取值的中间点,都可以作为候选划分点。扫描所有候选点,计算用每个候选点做二分类后的信息增益,取最大增益对应的点作为最终切分点。
这意味着连续特征在决策树里会被处理成“是否小于等于某个阈值”。同一连续特征在树的不同分支上可以被重复使用,而且阈值可能不同,这一点很容易答错。以前有同学以为每个特征只能用一次,实际只有离散特征在ID3/C4.5里不能用,连续特征完全可以多次参与划分。
5.3 缺失值处理:为什么不能直接扔掉样本
如果一份样本在某些特征上取值缺失,很多新手会直接删行,这在数据量本来就不大的时候非常浪费。决策树算法专门有一套应对逻辑,C4.5的思路分两个层面。
第一,如何选择划分属性。做法是把缺失值样本先放到一边,只用那些在该属性上没有缺失的样本计算信息增益,再乘上一个权重系数,这个系数等于“未缺失样本占比”。第二,选好属性后,缺失样本究竟进入哪个分支。C4.5的做法是根据其他正常样本在各分支上的分布比例,把这个缺失样本按不同概率同时分到不同分支。
这个思路在真实项目里有很强的借鉴意义。遇到缺失值,不要无脑填平均值,也可以让模型自己学着“分配”。当然,工程上很多集成模型本身能容忍缺失,所以如果你后面要直接用 LightGBM,可以不用手动清洗得那么干净。
5.4 为什么后来大家很少用“单棵不剪枝树”
如果只看考试,你可能以为决策树就是一种独立算法,实际用到项目里,单棵完整决策树几乎不会直接上生产。
因为单棵树方差大,训练集稍微换一批,树的结构可能完全不同。要降低这种不稳定,一般从两个方向改造:一个是Bagging思路的随机森林,让多棵树并行投票来降低方差;另一个是Boosting思路的梯度提升树,让多棵树串行去拟合残差,用来降低偏差。
第4章书里如果后面提到随机森林,通常也是把决策树当做基学习器。复习时先不急着钻研集成学习,能说明白单棵树是怎么训练、怎么剪枝,已经算把基础打扎实了。
6. 高频问题排查:期末和调参最易踩的坑
6.1 一道例题就能暴露问题
复习到第3-4章时,我强烈建议先做一次“自测”。拿一份公开的鸢尾花数据,不调用任何现成框架,分别实现一个线性模型和一个简单决策树雏形。
你会发现很多问题只有在动手时才会暴露。比如逻辑回归里,特征没有做标准化,梯度下降收敛慢得让人以为死循环;决策树里选的属性全是连续值,如果不做排序预计算,训练慢到无法忍受;分类问题时没有设置 random_state,重复训练结果每次都不同。
| 现象 | 可能原因 | 处理思路 |
|---|---|---|
| 逻辑回归在梯度下降中损失一直不降 | 学习率太大/特征尺度不统一 | 先做标准化,再调小学习率 |
| 决策树在训练集满分,验证集一塌糊涂 | 没有剪枝,树过深 | 限制 max_depth 或做后剪枝 |
| 准确率90%以上,业务却完全不可用 | 数据极端不平衡 | 看混淆矩阵,查召回率/F1 |
| 连续特征在树里只出现一次 | 理解有误,连续特征允许重复使用 | 强制允许特征复用 |
| 逻辑回归输出概率集中在0.5附近 | 特征不够或模型太弱 | 增加特征交叉,或换更强模型 |
| 树模型训练很慢 | 连续特征每次排序没有缓存 | 工程上用直方图近似(LightGBM) |
6.2 期末答题最容易丢分的三个细节
第一个细节是把信息增益和信息增益率的使用场景写反。ID3才是直接用信息增益,C4.5是用增益率,CART用基尼指数。这种知识点只要记住“谁的缺陷由下一个版本解决”就不会错:ID3的缺陷是偏好多值属性, C4.5用增益率修正;C4.5的缺陷是计算效率低,CART用基尼指数替换了熵。
第二个细节是写梯度公式时漏符号。逻辑回归梯度是 ((p-y)x),推导时先看损失是负对数似然,天然带负号,求导后依然是预测减真实。很多同学在这种地方手一抖,面试官一眼就能看出来基础不牢。
第三个细节是混淆分类阈值和过采样。遇到不平衡数据,优先调阈值并不是投机取巧,它本质上是在对概率输出做决策校准。如果题目问“如何处理不平衡”,最好写完整:先换评估指标,再调整阈值或损失权重,最后才考虑重采样。
6.3 实际调参时如何最省时间
如果是为考试复习,不需要背sklearn所有参数。考试更看重对算法机理的理解。但做项目时,线性模型和树模型各自有一组核心参数:
线性模型优先看正则化强度C,以及是否开启 class_weight。树模型优先看 max_depth、min_samples_leaf、max_features。max_depth 控制树的整体复杂度,min_samples_leaf 控制每个叶子最少样本数,max_features 影响每棵树随机抽取的特征数量,对随机森林尤其重要。
我习惯的调参顺序是先粗粒度固定学习率或最大深度,再观察训练集和验证集误差差值。如果训练集误差低但验证集高,就是过拟合,需要加正则、加深参数限制。如果两边的误差都高,说明模型容量不够,需要加特征或换更强的模型。这套诊断思路,比盲目网格搜索有用得多。
7. 用20行代码把两章串成闭环实验
前文讲了很多原理,真正落地时只需要一个非常小但完整项目。我推荐用鸢尾花数据集做一次对比实验,因为它是经典多分类数据,能同时覆盖线性逻辑回归和决策树。
训练流程很标准。先划分训练集和测试集,建议设置 random_state 保证结果可复现。然后分别实例化逻辑回归和决策树分类器。逻辑回归默认有L2正则,适合拿来体现“线性模型”;决策树需要限制 max_depth,比如设为3,避免直接长成完全过拟合的树。最后输出准确率和混淆矩阵。
在这个对比里能看到什么?在简单数据集上,逻辑回归和决策树准确率可能都很高,但决策树更容易被少量噪声带偏。如果换成高维稀疏数据,逻辑回归往往更强;如果换成特征之间存在明显非线性关系的表格数据,决策树天然占优。
动手实践时不要把调参当作核心目标,更重要的是体会模型的归纳偏置。线性模型天然认为类别边界是直线/超平面,决策树则认为边界可以是一堆平行于坐标轴的阈值组合。
第四章后如果继续学集成,你就会理解:单棵决策树效果有限,但随机森林和梯度提升树能把它的“弱”弥补回来。这也是为什么工程里直接使用裸树的场景越来越少,可考试里的手算“信息增益”依然年年出现。原理永远是树模型家族的地基,地基稳了,后面的提升树、XGBoost、LightGBM学起来都会顺利很多。
复习到这里的同学,如果时间有限,建议把精力集中在这几个交付物上:能默写线性回归正规方程和逻辑回归梯度、能徒手计算一个小数据集的信息增益、能说清楚C4.5与CART的差异、能解释为什么树需要剪枝。以上四件事都能独立完成,这两个章节就算真正稳住了。
