1. 为什么“用XGBoost赢下Kaggle”不是一句口号
经常刷数据竞赛论坛的人,对一句话应该很熟:XGBoost 是 Kaggle 的标配。这个说法听起来像句口号,但如果你真的把近几年表格类比赛的 Top 方案翻一遍,会发现 XGBoost 出镜率极高,它和 LightGBM、CatBoost 一起,几乎承包了结构化数据比赛的核心骨架。这篇文章不打算讲那些网上随便搜得到的 API 文档,而是想老老实实拆一遍,为什么大家都在用 XGBoost、它和传统 GBDT 到底差在哪、拿到一个赛题后怎么用 XGBoost 搭一个稳健的基线,以及我踩过的那些坑。
如果你正准备打第一场 Kaggle,或者已经进过几次比赛但每次都停在 baseline,这篇文章就是写给你的。我会把从数据预处理到交叉验证、从调参到提交的完整链路走一遍,并拿一个真实赛题做演示。目标是让你看完以后,能直接套一套流程在自己的比赛上,而不是只记住几个函数名。
1.1 从GBDT到XGBoost:它到底改了什么
网上关于“XGBoost 和 GBDT 区别”的讨论特别多,但很多都停留在“XGBoost用了二阶导数、加了正则化”这种概念层面。这里我用自己的理解讲透一点。
传统 GBDT 每一轮迭代,会计算损失函数在当前模型下的负梯度,然后用一棵回归树去拟合这个“梯度”,本质上是把梯度下降搬到了函数空间。这个方法有效,但它只用了一阶信息,对每个叶子节点的最优权重没有一个显式的解析解,只能靠步长一步步逼近。
XGBoost 做的第一个关键改变,是对损失函数做二阶泰勒展开。也就是每一轮不仅看一阶导数,还看二阶导数(Hessian),这样当我们要决定叶子节点权重时,可以直接通过二阶信息算出一个近似最优值。这个改动带来的直接好处是收敛更快,每一步的方向更准,尤其在损失函数本身不是平方损失时,优势更明显。
第二个关键改变是目标函数里加了正则项。传统 GBDT 只优化“损失项”,XGBoost 在目标函数里显式加入了对叶子节点数量、叶子节点权重大小的惩罚:
目标 = 训练损失 + 叶子数惩罚 + 叶子权重平方惩罚
这个惩罚项在代码里就对应 gamma、lambda、alpha 这些参数。它让模型不再无所顾忌地往复杂里长,从算法层面控制过拟合。这个设计在数据噪声大、特征多的比赛里非常有用。
第三个容易忽略的改变,是 XGBoost 原生支持缺失值。它在训练树的时候会自动学习“缺失值该往左走还是往右走”,不需要你提前填充成中位数或者均值。我见过很多新手花大量时间填缺失,填完以后分数反而没提升,原因就是“缺失”本身可能就带着信息,XGBoost 能自己学这个信息。
1.2 树分裂背后的“算账逻辑”
理解了 XGBoost 在宏观上做了什么,再看它内部是怎么选分裂点的。网上很多公式看起来很吓人,我换成大白话:
XGBoost 在决定“某个特征、某个阈值是否要作为分裂点”时,会分别计算分裂前和分裂后的目标函数值。分裂前是一整堆样本的损失,分裂后分成左右两个节点,损失会减小。但每次分裂也会引入复杂度惩罚。所以分裂增益大致可以理解成:
分裂收益 = 左子树收益 + 右子树收益 - 不分裂时的收益 - 复杂度成本
只有当这个增益大于 0,分裂才被采纳;增益越大,越优先考虑。这里面每个节点的“收益”都用一阶导数和二阶导数来近似计算,所以 XGBoost 本质上是在做一件很朴素的事:每次找一个能最大程度降低目标函数的分裂方案。
这也是 XGBoost 和普通贪心树算法的不同:它不只是看“分完以后纯度提升多少”,而是看“目标函数整体下降多少”,并且打断了很多没有意义的细碎分裂。实操中反映出来的现象就是,用同样一组超参数,XGBoost 往往比传统 GBDT 更不容易过拟合,对异常值的敏感度也更低。
1.3 什么比赛选XGBoost稳赚不赔
XGBoost 适用范围没有一些人想的那么“万能”。它适合的是表格型数据,也就是特征可以整理成二维矩阵的数据场景。最常见的几类是:
- 回归任务:预测房价、用户消费金额、商品销量、Elo 这种忠诚度分数。
- 二分类/多分类:风控违约预测、广告点击率预测、用户流失预测。
- 排序任务:搜索排序、推荐排序,这类比赛经常把 XGBoost 作为单模型种子。
但它不适合图像、语音、文本序列这类非结构化数据。这些任务里树模型拿不到像素之间的空间结构,也拿不到句子里的时序依赖,CNN/Transformer 才是主流。所以如果你看到一份比赛数据是 ImageNet 风格的图片,就别硬套 XGBoost 了。
我的经验是:只要比赛主办方给的是结构化表格,先跑一个 XGBoost 基线永远不亏。一方面它训练速度快,能快速验证特征;另一方面它调优空间大,从默认参数到精细调参可以一步步带你理解数据。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 打比赛前先把地基打好:环境、数据与验证方案
2.1 环境准备:XGBoost安装与Kaggle注册
本机装 XGBoost 很简单,直接:
bash复制pip install xgboost
如果下载速度慢,用国内镜像源,我习惯用清华的 PyPI 镜像:
bash复制pip install xgboost -i https://pypi.tuna.tsinghua.edu.cn/simple
装完以后检查一下版本,避免某些老教程里的参数已经过期:
python复制import xgboost as xgb
print(xgb.__version__)
我建议用 1.7 以上的版本,新版本对 early_stopping_rounds、iteration_range 这些接口支持得更稳定,不会出现莫名其妙的警告。
Kaggle 的账号注册流程本身不复杂,用邮箱注册后进入比赛主页,点 “Join Competition” 并同意规则,就可以下载数据和提交结果。比赛中要交的东西一般是一份 CSV 文件,里面包含预测结果,提交后系统会自动算出公开榜分数。第一次玩的人容易忽略的是:每场比赛对提交文件的格式要求不一样,有的要求有两列,有的只要提交概率值,一定要先看 sample_submission.csv,再套自己的结果。
本地跑不动或者不愿配置环境的,直接用 Kaggle Notebook 也行,它自带 XGBoost,还能开 GPU,对新手非常友好。我在本地一般会建一个固定的项目文件夹,里面放 input、output、code 三个子目录,数据放 input,提交文件放 output,脚本放 code。这个习惯帮我省了很多整理时间,因为你打比赛一定会反复迭代几十版代码,没有目录结构很快就会乱。
2.2 5折交叉验证为什么是万金油
Kaggle 社区里最流行的验证方式,就是 5 折交叉验证,也就是把训练数据随机平均切成 5 份,轮流拿其中 4 份训练、1 份验证,最后把 5 次的验证结果拼起来,计算一个整体分数。这里的核心思想是:不把数据的好坏压在某一次划分上,而是让每一行数据都有机会被验证到。
很多人会问,为什么偏偏是 5 折,不是 3 折或者 10 折?从经验来说,3 折每折验证集太大,验证分数波动会很明显;10 折每折数据太少,训练集容量下降,训练时间也成倍增加。5 折是偏差和方差的折中点,在很多比赛里都被验证是稳定的折数。
使用 KFold 时注意一点:如果是分类任务,建议用 StratifiedKFold,保证每一折里正负样本比例和整体一致;如果是回归任务,普通 KFold 就够。如果数据里有明显的分组结构,比如同一个用户的若干条记录不能同时出现在训练集和验证集,那就要用 GroupKFold,否则会造成信息泄漏,验证分数虚高。
下面这段代码是我每次打比赛都会先写好的验证骨架:
python复制from sklearn.model_selection import KFold
kf = KFold(n_splits=5, shuffle=True, random_state=2024)
for fold, (tr_idx, va_idx) in enumerate(kf.split(X)):
print(f"fold {fold + 1}: train size {len(tr_idx)}, valid size {len(va_idx)}")
shuffle=True 很重要,不洗牌的话,数据如果本身按类别排序,前面几折可能都是同一个类别,验证分数就会失真。
2.3 回归与分类任务的验证指标怎么选
验证方式定了以后,还要选对评估指标。Kaggle 每个比赛都会在页面明确写清楚评分标准,比如回归常用 RMSE、MAE,分类常用 LogLoss、AUC。很多人忽略的是:XGBoost 内部的 eval_metric 可以设成和比赛指标一样,这样 early stopping 才能直接找到最优迭代次数。
比如回归任务:
python复制params = {
'objective': 'reg:squarederror',
'eval_metric': 'rmse'
}
二分类任务:
python复制params = {
'objective': 'binary:logistic',
'eval_metric': 'logloss' # 或 auc
}
这里的 eval_metric 只影响训练过程中打印和早停的判断,不影响模型本身的损失函数。objective 才是真正决定模型优化的目标。如果你想优化的指标是 LogLoss,就一定不要让模型用 RMSE 去做损失函数再算 LogLoss,直接让 objective 和比赛指标靠近就行。
3. 一套能用三年的XGBoost建模流程
3.1 特征工程三板斧:缺失值、类别特征、数值分布
很多人一开始打比赛就急着调参,实际上一个基线模型从 3.8 的误差降到 3.6,靠的往往不是调参,而是特征工程。
第一板斧是缺失值。虽然 XGBoost 自己会处理缺失,但我的习惯是先把缺失率统计一遍。缺失率超过 80% 的特征,除非业务上特别重要,否则我通常会直接删掉。缺失率中等的特征,我倾向保留“缺失标记”,也就是额外加一列 is_missing,然后用合理值填充,比如数值列填 -999、类别列填 "missing"。这样做的好处是,模型既能学到“缺失本身就是一种状态”,又不至于因为完全不管缺失导致树结构不稳定。
第二板斧是类别特征。XGBoost 不像 LightGBM 那样原生支持类别特征,所以需要先做编码。常见做法是:类别数量少(比如小于 20),用 one-hot;类别数量多,用 label encoding 或 frequency encoding。很多人担心 label encoding 会给类别强加上不存在的顺序关系,但在 XGBoost 里,这种顺序关系会体现在“小于阈值的往左走”,实践中效果并不差,尤其是在高基数类别上,它比 one-hot 省很多维度。更进阶的做法是 target encoding,用目标变量的均值给类别编码,但要做好交叉验证防止泄漏。
第三板斧是数值分布。树模型不要求特征正态分布,但极端异常值会拖拽树的分裂点。对于金额、次数这类右偏长尾特征,我一般会做 log1p 变换,也就是 np.log1p(x),这样能明显降低某些极端大值对分裂点的影响。在 Elo 比赛里,交易金额就经常是长尾分布,直接不处理和使用 log1p,本地验证分数能差不少。
3.2 核心超参数速查表与调参顺序
XGBoost 参数很多,但真正影响比赛结果的,其实就那么几个。我把它们整理成一张表,方便你查:
| 参数 | 作用 | 常见范围 | 备注 |
|---|---|---|---|
eta / learning_rate |
每棵树的学习步长 | 0.01 ~ 0.3 | 越小越稳,但需要更多树 |
max_depth |
单棵树最大深度 | 3 ~ 10 | 深度越大越容易过拟合 |
min_child_weight |
叶子节点最小样本权重和 | 1 ~ 20 | 越大越保守 |
subsample |
每棵树随机采样行比例 | 0.5 ~ 1.0 | 小于 1 能减少过拟合 |
colsample_bytree |
每棵树随机采样特征比例 | 0.5 ~ 1.0 | 类似随机森林的列采样 |
lambda |
L2 正则权重 | 0 ~ 10 | 越大越保守 |
alpha |
L1 正则权重 | 0 ~ 10 | 一般用于稀疏特征 |
gamma |
节点分裂所需最小损失减少 | 0 ~ 10 | 越大分裂越少 |
num_boost_round |
最大迭代树数量 | 视 eta 而定 | 配合早停使用 |
调参顺序我建议遵循“从粗到细”的逻辑。第一步用 eta=0.1、max_depth=6 这种偏中等的参数跑一个 baseline,确认数据流程没问题;第二步固定 eta=0.1,搜索 max_depth 和 min_child_weight;第三步固定树结构,调 subsample 和 colsample_bytree;第四步调正则化参数 lambda 和 alpha;最后把 eta 降到 0.01 或 0.05,并把 num_boost_round 放大到几千轮,配合 early stopping。
不要一上来就网格搜索全参数。XGBoost 参数之间有不少交互效应,全参数网格搜索会爆炸,而且你根本不知道是哪个参数起了作用。
3.3 快速调参:先网格后随机,配合早停
如果时间不多,我用的最快路径是:先跑一次默认参数熟悉数据,然后用 GridSearchCV 在 max_depth 和 min_child_weight 上做小范围搜索。注意这里的 cv 参数最好和图里的验证方案一致,比如用 5 折。
python复制from sklearn.model_selection import GridSearchCV
import xgboost as xgb
model = xgb.XGBRegressor(
objective='reg:squarederror',
eval_metric='rmse',
learning_rate=0.1,
n_estimators=500,
early_stopping_rounds=50
)
param_grid = {
'max_depth': [4, 6, 8],
'min_child_weight': [1, 5, 10]
}
search = GridSearchCV(
model,
param_grid,
cv=5,
scoring='neg_root_mean_squared_error',
verbose=1
)
search.fit(X, y)
scoring='neg_root_mean_squared_error' 是因为 sklearn 的评分规则是“越大越好”,所以 RMSE 要取负号。搜索完以后,再在 subsample 和 colsample_bytree 上随机搜索,最后调正则化。整个过程跑完一般也就几分钟到半小时,取决于数据量。
这里我强烈建议用 early_stopping_rounds,而不是手动设一个 n_estimators=500 然后硬跑。因为树模型迭代太多次几乎一定会过拟合,早停能在验证分数不再下降时自动截断,省时间还省心。在 sklearn 的 XGBRegressor 接口里,你传入验证集的方法是这样:
python复制model.fit(
X, y,
eval_set=[(X_valid, y_valid)],
verbose=False
)
拿到 best_iteration 以后,再决定要不要微调。
3.4 特征重要性与过拟合自查
调完一组参数之后,我第一件事就是画特征重要性,常见的有 weight、gain、cover 三种计算方式。weight 是特征被用来分裂的次数,gain 是特征分裂带来的平均增益,cover 是特征分裂覆盖的样本量。我一般看 gain,因为一个特征即使被用了很多次,如果增益都很小,那它可能只是噪声。
如果发现排名前列的特征里有明显的业务无关噪声特征,比如用户 ID、随机生成的字符串,我会把它删掉再训练一轮。特征重要性图还有一个作用,就是帮你判断特征工程方向:如果某几个业务特征完全没进前二十,要么是这个特征确实没用,要么是编码方式不对。
过拟合自查的标准方法很简单:看训练集分数和验证集分数的差距。如果训练 RMSE 已经很低,验证 RMSE 却很高,说明模型把数据背下来了。这时候别继续加树,而是往保守方向调:减小 max_depth、加大 min_child_weight、缩小 subsample、调低 eta。我见过有人为了提升一点点验证分数,把 max_depth 调到 15,然后验证集分数立刻爆炸,这就是典型的没理解“树模型复杂度”和“正则项”的关系。
4. 完整实战:复现一个Kaggle回归赛题(Elo)
4.1 赛题理解与数据形态
Elo Merchant Category Recommendation 是一个很有代表性的回归比赛,任务是预测每个用户对商户的忠诚度分数,本质上是根据用户历史交易行为预测一个连续值。它比很多合成数据比赛更接近真实业务,因为数据里既有用户特征,又有历史交易明细、商户信息、新商户交易记录,非常考验特征工程功底。
这个比赛的数据大概是这样的:
train.csv:包含card_id、匿名特征feature_1到feature_15,以及目标target。historical_transactions.csv:用户历史交易记录,包括商户 ID、交易类别、购买金额、授权标志、购买日期等。new_merchant_transactions.csv:用户在新商户上的交易记录。merchants.csv:商户信息,比如商户类别、平均购买量、城市等。sample_submission.csv:提交格式参考。
目标指标是 RMSE,数值越小越好。这个赛题里,真正拉开差距的并不是模型选择,而是谁能从交易明细里挖出更有效的用户行为特征。
4.2 特征工程里真正影响分数的操作
面对这种多表数据,第一步不是急着建模,而是想清楚:预测目标是“用户的忠诚度”,那么哪些信息能反映忠诚度?我的思路是三个维度:
第一个维度是用户整体消费习惯。从 historical_transactions 和 new_merchant_transactions 中,按 card_id 聚合出:交易总次数、总金额、平均单笔金额、金额标准差、最大单笔金额、授权交易占比。这些特征反映用户是不是一个“大额低频”或者“小额高频”的人。
第二个维度是时间特征。忠诚度的核心表现之一是“最近还在不在消费”。所以我构造了:最近一次交易距参考日的时间差、最早交易距参考日的时间差、最近一个月交易次数、交易间隔的平均值和标准差。用户如果超过半年没有交易记录,忠诚度大概率偏低。
第三个维度是商户侧特征。从 merchants.csv 里把商户的平均购买额、商户活跃度取出来,再和用户交易记录做链接,统计用户常去的商户类型、用户在每个商户的平均消费金额。比如一个用户经常在高档商户消费,可能忠诚度不一定高,但用户如果长期在同一个类别的商户消费,说明消费习惯稳定,忠诚度就会偏高。
具体的特征工程代码每个比赛都不一样,这里给一个通用的聚合模板:
python复制import pandas as pd
import numpy as np
hist = pd.read_csv('historical_transactions.csv')
agg_funcs = {
'purchase_amount': ['sum', 'mean', 'std', 'max', 'min', 'count'],
'category_1': ['nunique'],
}
hist_group = hist.groupby('card_id').agg(agg_funcs)
hist_group.columns = ['_'.join(col).strip() for col in hist_group.columns.values]
hist_group = hist_group.reset_index()
注意 purchase_amount 在很多比赛数据里不是原始金额,而是被处理过的值,经常有负数。我的习惯是先取 abs 再做 log1p,这样比直接平方或者保留负数更稳定。
4.3 XGBoost + 5折交叉验证代码框架
当我整理好特征,得到训练集 X、目标 y、测试集 X_test 以后,剩下的事情就交给 XGBoost 和 5 折交叉验证了。下面这套代码框架我用了很多次,稍微改改就能复用到其他比赛:
python复制import pandas as pd
import numpy as np
import xgboost as xgb
from sklearn.model_selection import KFold
from sklearn.metrics import mean_squared_error
# 假设你已经构造好 X, y, X_test
# 特征列名列表
feature_cols = [c for c in X.columns if c not in ['card_id', 'target']]
params = {
'objective': 'reg:squarederror',
'eval_metric': 'rmse',
'eta': 0.05,
'max_depth': 6,
'min_child_weight': 5,
'subsample': 0.8,
'colsample_bytree': 0.8,
'lambda': 1.0,
'alpha': 0.0,
'seed': 2024
}
kf = KFold(n_splits=5, shuffle=True, random_state=2024)
oof = np.zeros(len(X))
pred = np.zeros(len(X_test))
for fold, (tr_idx, va_idx) in enumerate(kf.split(X)):
X_tr, X_va = X.iloc[tr_idx], X.iloc[va_idx]
y_tr, y_va = y.iloc[tr_idx], y.iloc[va_idx]
dtr = xgb.DMatrix(X_tr[feature_cols], label=y_tr)
dva = xgb.DMatrix(X_va[feature_cols], label=y_va)
dtest = xgb.DMatrix(X_test[feature_cols])
model = xgb.train(
params,
dtr,
num_boost_round=5000,
evals=[(dva, 'valid')],
early_stopping_rounds=100,
verbose_eval=500
)
best_iter = model.best_iteration
oof[va_idx] = model.predict(
dva, iteration_range=(0, best_iter + 1)
)
pred += model.predict(
dtest, iteration_range=(0, best_iter + 1)
) / kf.n_splits
rmse = np.sqrt(mean_squared_error(y, oof))
print(f'OOF RMSE: {rmse:.5f}')
sub = pd.DataFrame({
'card_id': test['card_id'],
'target': pred
})
sub.to_csv('submission.csv', index=False)
这套代码有几个关键点:第一,oof 数组保存的是每一折验证集上的预测,最后统一计算一个整体 RMSE,这比看每一折的平均分更接近真实水平;第二,预测时用 iteration_range 限制在最优迭代数以内,避免把后面的过拟合树也加上;第三,5 折的测试集预测取平均,相当于一个非常轻量的集成,能降低单折波动。
4.4 复现结果与复盘
在这类比赛里,如果只用数据自带的 feature_1 到 feature_15,不做任何交易明细聚合,XGBoost 的本地 OOF RMSE 大概会在 3.85 左右,排名会非常靠后。当我加入历史交易聚合特征后,分数能明显降到 3.65 附近;再进一步加入商户侧聚合特征和时间窗口特征,可以压到 3.60 左右;如果最后用 5 折交叉验证配合多随机种子取平均,分数还有进一步下降空间。
这部分提升,模型几乎没有换过,XGBoost 一直是最核心的单模型。所以我想强调一个观点:XGBoost 给你的不是一个魔法,而是一个稳定高效的“容器”。你能不能在比赛中脱颖而出,取决于你有没有往这个容器里放进更干净、更有业务含义的特征。
5. 常见问题与避坑经验
5.1 训练分数很好,验证分数很差
这是树模型比赛里最常见的问题。碰到这种情况,先不要急着加数据或者换模型,先检查是不是模型太复杂。我一般按这个顺序排查:
max_depth是不是太高?大于 8 就要小心。eta是不是偏大、同时树的数量又太多?- 有没有跑满全量
num_boost_round而没有使用早停? subsample和colsample_bytree是不是都等于 1.0,完全没有随机性?
把这些参数往保守方向调,通常验证分数会逐渐回归正常。如果你已经用了合理的参数,但差距仍然大,那就考虑是不是特征里混入了太多噪声,试着把特征重要性排名靠后的特征删掉一部分,往往有奇效。
5.2 随机种子的影响被很多人低估
XGBoost 在训练时因为行采样和列采样,本身就带随机性。换一个随机种子,验证分数可能会有波动。我在比赛中不会只跑一个种子,至少会用 3 个种子各跑一遍,然后把测试集预测结果平均。这个操作几乎不需要额外时间,但能让提交结果更稳定,尤其是当你和一个别人只跑了一次的结果相差 0.001 的时候,多种子平均经常能帮你往前挪几名。
同样,KFold 的 random_state 我也建议设置成固定值,方便复现和比较不同特征版本的效果。如果两个特征方案用了不同随机种子,你很难判断分数差异到底是来自特征还是来自随机波动。
5.3 时间序列比赛不能直接随机K折
有些比赛的数据带有明确时间顺序,比如按日期排序的销售预测。这时候如果还直接随机 K 折,就会出现“用未来数据预测过去”的泄漏,验证分数会虚高,但真正提交到线上会崩。这种赛题建议用 TimeSeriesSplit,或者自己按时间切分,确保训练集时间永远早于验证集。
判断方法很简单:看你的特征里有没有“日期”或者“时间窗口”。只要有,就默认不能随机 K 折,除非比赛官方明确说可以做全局 shuffle。我记得有一次比赛,有人随机 K 折本地 RMSE 非常漂亮,结果公开榜分数惨不忍睹,就是因为用了未来信息。
5.4 LightGBM vs XGBoost到底怎么选
这几年大家经常把 XGBoost 和 LightGBM 放在一起比。我的体感是:
| 维度 | XGBoost | LightGBM |
|---|---|---|
| 训练速度 | 中等 | 更快,尤其大样本 |
| 内存占用 | 中等 | 更少 |
| 原生类别特征 | 不支持,需编码 | 支持 |
| 历史策略 | 预排序 | 直方图算法 |
| 小数据稳定性 | 更稳 | 容易过拟合 |
| 调参经验 | 资料多 | 资料略少 |
如果数据集不到几十万行,我优先用 XGBoost,因为它在中小数据上更稳定,参数更好理解。如果数据量大到单次训练要跑很久,我会切到 LightGBM 提升迭代速度。但绝大多数比赛的最终方案都是两个模型同时上,再做模型融合,因为它们的差异性能带来额外提升。
6. 写在最后:竞赛里比模型更重要的三件事
写了这么多,最后说几句不太会写进教程的实话。我在前面提到 XGBoost 是标配,但它只是工具。真正让你在 Kaggle 上拿到好成绩的,我总结下来是三件事:
第一,你对业务的理解深度。Elo 这个比赛,如果不懂“消费频次、消费金额、最近购买时间”这些行为指标和忠诚度的关系,你连特征都构造不出来。先花时间读懂赛题,比你多调十组参数有用得多。
第二,交叉验证的纪律性。用稳定的验证方案评估每一个特征版本,不随便换随机种子,不因为一次验证分数好看就盲目上线。我见过太多人本地 3.62,提交以后公开榜 3.71,原因是验证方案和数据分布有偏差,这种问题只能靠制度和经验来规避。
第三,早点提交 baseline,然后小步迭代。很多人喜欢憋一个完美模型再提交,但 Kaggle 的提交次数有限,早提交能让你确认数据读取、ID 对齐、提交格式都没问题,后面迭代才有底气。我也习惯每换一个特征版本就记录分数和备注,这样复盘的时候能清楚知道哪个改动起了作用。
最后再分享一个我在实战里形成的小习惯:每次跑完模型,除了保存 OOF RMSE,一定要把 feature importance 导出来存一份。这个东西不仅是调参依据,写复盘报告的时候也是最好的素材。毕竟,决定你下一场比赛高度的,往往不是这一场的名次,而是你从这场的每一次迭代里总结出了什么。
