1. 机器学习期末复习指南:从贝叶斯到降维的核心要点
作为一名经历过无数次机器学习考试洗礼的老司机,我深知期末复习时的焦虑——尤其是面对西瓜书这样内容庞杂的教材时。今天我就带大家用最短的时间,抓住机器学习期末考最核心的七大主题,特别是那些教授们最爱出题的知识点。我会用最直白的语言解释概念,配上实际案例和记忆技巧,保证你看完这篇就能上考场不慌。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 正则化:L1与L2的本质区别与应用场景
2.1 正则化的数学本质
想象你在收拾行李箱:L1正则化就像严格限制行李件数(绝对值之和),逼你只带最必需品;L2则是限制总重量(平方和),允许你多带几件轻便物品。这就是它们的数学本质:
- L1正则化:||w||₁ = |w₁| + |w₂| + ... + |wₙ|
- L2正则化:||w||₂ = √(w₁² + w₂² + ... + wₙ²)
考试常考这两种正则化对权重向量的影响。记住这个例子:当特征相关性高时,L1会随机选择一个特征将其权重降为0,而L2会给所有相关特征分配相似的小权重。
2.2 为什么L1能产生稀疏解?
这要从优化过程理解:L1在坐标轴交点处更容易达到极值点。实际应用中,这个特性让L1成为特征选择的利器。比如在文本分类中,用L1可以自动筛选出最重要的关键词,其余特征的权重直接归零。
记忆技巧:把L1想象成严厉的班主任——不重要的特征直接给零分淘汰
2.3 L2防止过拟合的机制
L2通过惩罚大权重值,迫使模型参数更加平滑。这就像给模型戴上了"紧箍咒",防止它在训练数据上"为所欲为"。实际使用时,λ参数的选择很关键:
- λ太大:模型欠拟合(约束过强)
- λ太小:模型可能过拟合(约束不足)
建议画一个λ与验证集误差的关系图,选择误差最低点对应的λ值。
3. 贝叶斯分类器:从理论到实践
3.1 朴素贝叶斯的"朴素"在哪里?
这个"朴素"的假设是:所有特征条件独立。虽然现实中很少成立,但这个假设大大简化了计算:
P(y|x₁,...,xₙ) ∝ P(y)∏P(xᵢ|y)
考试常见题型是计算后验概率。记住这个例子:判断水果是苹果(y=1)还是橙子(y=0),已知:
- P(y=1)=0.6
- P(红色|y=1)=0.8, P(红色|y=0)=0.1
- P(圆形|y=1)=0.9, P(圆形|y=0)=0.8
当一个水果是红色且圆形时,计算它是苹果的概率。
3.2 拉普拉斯平滑的妙用
遇到零概率问题时(比如某个特征值在训练集中从未出现),拉普拉斯平滑就是救命稻草:
P(xᵢ|y) = (count(xᵢ,y)+α)/(count(y)+αn)
其中α通常取1。这个技巧在文本分类中特别重要,避免因为某个词未出现过就直接判定概率为零。
4. 集成学习:Boosting vs Bagging深度解析
4.1 Boosting的工作机制
Boosting就像错题本学习法:每次重点关注之前做错的题目。其核心步骤:
- 初始化样本权重为1/m
- 训练弱分类器
- 计算错误率ε
- 更新样本权重:增加错分样本权重
- 计算该分类器权重α=1/2ln((1-ε)/ε)
- 重复2-5步直到达到T个分类器
- 加权组合所有分类器
AdaBoost是最经典的Boosting算法,考试常要求手推α的计算过程。
4.2 Bagging的统计学基础
Bagging的核心是bootstrap采样:从m个样本中有放回地抽取m次。一个有趣的现象:约36.8%的样本不会被抽到,这些样本称为"out-of-bag"样本,可用来做验证。
随机森林是Bagging的典型应用,考试常考这两个问题:
- 为什么随机森林要随机选择特征?
- 为什么不需要剪枝?
4.3 对比表格:Boosting与Bagging的九大区别
| 对比维度 | Boosting | Bagging |
|---|---|---|
| 样本选择 | 固定训练集 | Bootstrap采样 |
| 样本权重 | 动态调整 | 均匀权重 |
| 基学习器权重 | 按准确率加权 | 平均权重 |
| 生成方式 | 顺序生成 | 并行生成 |
| 目标 | 降低偏差 | 降低方差 |
| 过拟合风险 | 较高 | 较低 |
| 对噪声敏感度 | 高 | 低 |
| 典型算法 | AdaBoost, GBDT | 随机森林 |
| 计算效率 | 较低 | 较高 |
5. 聚类分析:从K-means到DBSCAN
5.1 聚类性能评估指标
考试最常考的三种评估方式:
-
外部指标(有真实标签):
- Jaccard系数
- FM指数
- Rand指数
-
内部指标(无真实标签):
- DB指数(值越小越好)
- Dunn指数(值越大越好)
-
距离度量:
- 连续型:闵可夫斯基距离
- 离散型:VDM距离
5.2 K-means的局限与改进
传统K-means有两个致命伤:
- 需要预先指定K值
- 对初始中心点敏感
改进方案:
- 肘部法则确定K值
- K-means++优化初始中心选择
- 二分K-means避免局部最优
5.3 密度聚类DBSCAN的核心参数
掌握这两个关键参数:
- ε:邻域半径
- MinPts:核心点的最小邻域样本数
考试常给一个二维点集,要求判断各点类型(核心点、边界点、噪声点)。
6. 降维技术:PCA与LDA对比
6.1 PCA的数学推导步骤
这是考试大题高频考点,务必掌握:
- 中心化数据
- 计算协方差矩阵
- 特征值分解
- 取前k大特征值对应特征向量
- 投影到新特征空间
记忆口诀:"中协特投"(中心化→协方差→特征值→投影)
6.2 PCA vs LDA的本质区别
| 维度 | PCA | LDA |
|---|---|---|
| 目标 | 最大方差 | 最大类间离散/类内离散 |
| 监督 | 无监督 | 有监督 |
| 适用场景 | 探索性分析 | 分类任务 |
| 投影方向数 | ≤特征数 | ≤类别数-1 |
| 对分布假设 | 无 | 数据服从高斯分布 |
6.3 奇异值分解(SVD)的妙用
SVD的公式:A = UΣVᵀ
在推荐系统中,SVD可用于:
- 矩阵补全(解决稀疏问题)
- 降维(取前k个奇异值)
- 潜在语义分析
7. 期末必考题型与解题技巧
7.1 高频计算题类型
- 贝叶斯概率计算(必考)
- 信息增益/增益率计算(决策树)
- SVM对偶问题推导
- 神经网络反向传播计算
- PCA投影计算
7.2 概念辨析题准备
这些概念对比要烂熟于心:
- 生成模型 vs 判别模型
- 硬间隔 vs 软间隔
- 精确率 vs 召回率
- 协方差 vs 相关系数
- 过拟合 vs 欠拟合
7.3 时间分配建议
根据我的监考经验,合理的时间分配应该是:
- 选择题(30分钟)
- 填空题(20分钟)
- 简答题(40分钟)
- 计算题(60分钟)
- 检查(30分钟)
最后分享一个考场小技巧:遇到推导题时,先把相关公式都写出来,即使后面没时间计算,也能拿到步骤分。我在实际考试中发现,很多同学在PCA推导题上丢分,不是因为不会,而是跳步太多导致阅卷老师找不到关键得分点。
