第十五期线上培训开始报名,这期的主题定得挺刺激:"用机器学习训练激进抄底模型,让量化系统更聪明。"说实话,看到"激进抄底"这四个字我就知道这次报名人数不会少。在量化这个圈子里,抄底策略永远是热门话题,但大多数人试图用传统技术指标来做超跌反弹,效果始终不稳定。这期培训的核心思路,是把"抄底"从规则驱动变成数据驱动,用机器学习从历史行情里学出"什么位置、什么信号下,反弹概率最高"。
我自己跑量化这几年,最大的感触是:机器学习在量化里的应用,门槛不在算法,而在你能不能把一个模糊的交易直觉,翻译成一个清晰、可计算、可验证的数学问题。这期培训讲的就是这套完整流程——从数据清洗、特征工程、模型训练到回测验证。不管你是刚入门想搭一个自己的交易辅助工具,还是已经在跑策略但想知道怎么把机器学习嵌进去,这个主题都值得花时间跟着过一遍。下面这篇文章,我就把这类"抄底模型"从0到1的核心环节拆开细讲,大部分内容也是这次培训会重点带练的部分。
1. "激进抄底"的本质:先想清楚你到底在预测什么
1.1 抄底策略的量化翻译
"激进抄底"在交易里的直觉描述是:一只股票连续大跌,跌到某个位置,市场情绪极度悲观,然后出现一波快速反弹。人做这个判断靠的是盘感和经验,机器没有盘感,它只能靠概率。所以要想让机器学习来干这事,第一步不是选模型,而是把"抄底"变成一个具体的预测任务。
我的做法是做二元分类:给定股票在某一天的快照数据,预测未来N个交易日内,该股票的最大涨幅是否超过某个阈值。比如未来5个交易日内,最高价相对当天收盘价上涨超过8%,就算正样本,没达到就算负样本。这个设计思路的关键在于,我们是在预测"反弹是否会发生",而不是预测"明天的收盘价是多少"。前者对噪声更鲁棒,也更容易构造训练数据,后者几乎是个不可能精确完成的任务,就算模型勉强拟合了,实盘也大概率失效。
1.2 三类标签方案怎么选
标签怎么打,直接决定模型学到什么。除了上面说的二元分类,还有另外两种常见的标签方案,我做了一个对比:
| 标签方案 | 定义方式 | 优点 | 缺点 | 适用场景 |
|---|---|---|---|---|
| 二元分类 | 未来N日最大涨幅≥阈值记为1 | 任务清晰,训练简单,正负样本直观 | 阈值设定影响结果较大;丢失涨幅幅度信息 | 筛选"是否值得参与"的候选池 |
| 回归 | 直接预测未来N日收益率 | 保留幅度信息,可排序 | 极端值干扰大,模型噪声高 | 当你想做更精细的仓位管理时 |
| 三柱线法(Triple-Barrier) | 同时设定止盈、止损、时间三条屏障 | 贴合实际交易,自动处理平仓点 | 实现复杂,参数多,调参成本高 | 策略与出场逻辑绑定时优先使用 |
从我自己的实践经验来看,一开始做模型探索时,二元分类是最省力的。先把"能不能抄底"变成一个概率分数,后面再叠加仓位管理和止损逻辑,整个系统会清晰很多。三柱线法听起来很专业,但如果你连基础的特征体系和验证流程都没跑通,直接上这种复杂标签会把问题搞复杂,出了问题都分不清是模型错了还是标签错了。
1.3 时间窗口的选择逻辑
标签里的"未来N日"涉及交易频率问题。用5日窗口,出来的信号偏短线,交易次数会比较多,对交易成本和滑点也更敏感;用20日窗口,信号更偏波段,次数少但单次空间可能更大。激进抄底这个策略本身就偏短线,我建议从5日或10日起步,不要一上来就做20日。窗口拉长会让训练样本之间的重叠更严重,带来数据泄漏问题,这部分后面我会专门讲。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 数据工程:抄底模型90%的工作量都在这里
2.1 数据准备不是下载几张K线图
很多新手一上来就去下载股票日线数据,然后直接喂给模型,这基本等于在垃圾堆里找金子。我个人整理数据时有三个硬性要求:
第一,必须用前复权价格。因为分红送转会让股价出现人为的跳空缺口,不复权的数据在模型眼里就是异常值。第二,股票池要做清洗。ST、退市整理、上市不满60个交易日的次新股、长期停牌的股票,都要优先剔除。第三,训练集和测试集必须严格按时间切分,绝对不能随机打乱。金融数据是强时序数据,今天的数据和明天的数据天然存在相关性,随机打乱等于让模型偷看未来。
2.2 特征工程:把"超跌"翻译成模型能懂的语言
什么是"超跌"?人眼看起来是跌多了,但模型不知道什么叫"多"。它需要的是数字化的特征。我常用的特征可以分成三类:
第一类是基础量价特征,包括过去5日、10日、20日的累计收益率、波动率、成交量的变化率。这组特征描述的是"近期发生了什么"。第二类是超跌特征,也是最核心的一组:区间最高点回撤幅度(从过去120日最高点到当前价的跌幅)、当日收盘价与20日均线的乖离率、RSI(相对强弱指标)、当前价落在布林带下轨下方多远的程度。第三类是资金情绪特征,比如换手率、成交额放大倍数、大单净流入占比。这组特征用来判断下跌过程中是否有资金在悄悄进场。
做特征的时候有两条红线要守。一条是用滚动窗口计算,只能用过去的数据,比如"过去20日收益率"用的是第T-20到第T天的数据,T+1之后的任何信息都不准出现在特征里。另一条是计算时要用全市场统一处理,不能针对单只股票单独拟合,避免未来信息从标准化环节漏进去。
2.3 样本重叠与防泄漏处理
抄底模型最常见的隐性坑,是样本重叠带来的数据泄漏。假设你用5日窗口做标签,那么第T天和第T+1天的样本,它们的标签区间会重叠4天。这会导致验证集里看似独立的两个样本,其实共享了大量未来信息,模型评估结果虚高得离谱。
解决这个问题,我一般有两个办法:一是把采样间隔拉大到和标签窗口一致,比如标签设5日,就每5个交易日采一个样本,让相邻样本的重叠程度大大降低;二是在验证时按时间块做分组切分,让验证集". 里的一整块时间在训练里完全不可见,再用分组指标(如GroupKFold配合时间组)做评估。如果这一步不做扎实,后面模型表现再好都可能是海市蜃楼。
3. 模型选型与训练:LightGBM为什么是起步首选
3.1 为什么不用神经网络做起步
每次线下交流都有人问:现在深度学习这么火,为什么不直接用LSTM?我的回答很直接:如果数据量不大,任务又集中在表格型特征上,梯度提升树(Gradient Boosting Decision Tree,GBDT)在绝大多数情况下都比神经网络更实用。
神经网络需要海量数据,金融数据的信噪比又极低,很容易把噪声当成规律学进去。而GBDT这类模型对特征量纲不敏感,能自动处理特征交互和非线性关系,还不需要做特别复杂的数据归一化。它训练快,调参难度低,输出还可以直接拿到特征重要性做解释。对一个"要先验证策略逻辑是否有效"的起步阶段来说,LightGBM是实用性最强的选择。
| 对比维度 | LightGBM | XGBoost | LSTM |
|---|---|---|---|
| 表格特征支持度 | 极好 | 极好 | 一般,需要特征工程配合 |
| 训练速度 | 很快 | 较快 | 慢 |
| 可解释性 | 强(特征重要性) | 强 | 弱 |
| 对小样本的适应性 | 好 | 好 | 差,容易过拟合 |
| 实现复杂度 | 低 | 低 | 高 |
3.2 核心参数:从一套稳妥的底参开始
LightGBM需要调的参数不算多,但每调一个都得知道它影响什么。我常用的底参是这样的:
python复制import lightgbm as lgb
params = {
"objective": "binary",
"metric": "auc",
"boosting_type": "gbdt",
"num_leaves": 31,
"max_depth": -1,
"learning_rate": 0.05,
"feature_fraction": 0.8,
"bagging_fraction": 0.8,
"bagging_freq": 1,
"min_data_in_leaf": 100,
"scale_pos_weight": 5,
"verbosity": -1,
"num_threads": 8,
}
这段参数里面,scale_pos_weight是抄底模型里最关键的参数之一。因为超跌反弹在现实中本来就是少部分情况,正负样本比例可能达到1比5甚至1比10。这个参数的作用是给正样本更大的权重,让模型不会为了降低整体损失而把所有样本都预测成负样本。min_data_in_leaf设成100是很标准的防过拟合手段,尤其在金融数据里,叶子节点太少很容易把细碎的噪声也学进去。
我自己跑下来一个经验:先固定learning_rate为0.05,用早停法(Early Stopping)自动决定树的数量,再去调num_leaves和min_data_in_leaf。不要在开始就追求极限精度,模型的稳定性比模型在训练集上的准确率重要得多。
3.3 训练流程:留一块"未来数据"做试金石
训练过程里最忌讳的是把所有数据都拿去训练,然后同一个数据集上评估。正确的做法是预留出时间上完全独立的一段数据,比如用2018到2023年的数据做训练和验证,用2024年至今的数据做最后的样本外测试。这段样本外数据在整个调参过程中都不能碰,等所有参数都调完了、特征也固定了,才用它做一次"终考"。
验证集上的AUC能到0.62到0.68,已经是一个值得继续做下去的模型了。很多人听到这个数字觉得低,但金融数据的R平方先天就低,能稳定跑出0.6以上的AUC,再叠加交易层面的过滤条件,实盘效果就可能非常可观。相反,如果你在训练集上看到0.95的AUC,先别高兴,大概率是数据泄漏了。
4. 回测验证:防止模型在历史数据里作弊
4.1 未来函数是最隐蔽的陷阱
回测中最常见也最隐蔽的问题是未来函数。一个经典案例是:有人用"当时还没公布"的财务数据做特征,回测曲线漂亮得不行,一上实盘马上原形毕露。在抄底模型里,未来函数更容易出现在数据预处理环节。比如你用了全样本的均值和标准差做标准化,这等于让T日的特征值包含了T日之后所有样本的统计信息,模型在训练时已经偷看了答案。
我的习惯是,所有标准化操作都在每个时间窗口内部完成。简单说,就是训练集的数据只在训练集上计算均值方差,验证集和测试集用训练集的统计量做变换。看起来是小细节,但对回测结果的可信度影响是决定性的。
4.2 交易约束与成本模拟:让回测说人话
很多回测框架跑出来的收益曲线都很性感,但一扣掉交易成本和真实交易约束就变得骨感。抄底策略本身交易频率不低,手续费和滑点的影响会被成倍放大。做回测时至少要考虑三件事:
第一,涨跌停不能成交。模型选出的"最优抄底标的"如果第二天直接一字跌停,你根本买不进去,这个信号就是废的。第二,停牌股不可交易,数据缺失的时间段里不能忽略它,要在撮合时判断是否可成交。第三,成本要按双边计算,佣金、印花税、滑点加起来,一次完整买卖的成本至少要按0.4%到0.8%来估算,我的做法是保守取0.6%。
如果你不想动太多底层代码,用现成的回测框架也行,但一定确认框架支持设置涨跌停不可成交。我自己实测下来,很多开源框架默认没开这个选项,跑出来的收益至少虚高30%,这是普遍的坑。
4.3 Walk-Forward验证:更贴近实战的评估方式
普通的时间序列切分只能做一次验证,而Walk-Forward(滚动前推)验证能让模型评估更贴近真实的实盘环境。做法是把时间轴切成多个窗口:先用第一个窗口训练模型,然后在紧接着的下一个窗口做预测;接着把前面窗口和第一个未来窗口合起来重新训练,再去预测更后面一个窗口,以此类推。
滚动前推的好处是模拟了"模型不断用新数据更新"的真实状态,也更能检验模型在不同市场环境下的适应能力。如果你发现模型在2022年的震荡下跌市里表现很差,但在2020年的反弹市里很好,那说明模型对市场风格有明显的依赖,需要加入更多市场状态相关的特征,或者在策略层面对模型输出的信号施加额外的过滤条件。
5. 常见问题与排查技巧实录
5.1 训练集表现好、测试集崩盘是什么原因
这是找我咨询最多的问题,没有之一。遇到这种情况,我的排查顺序非常固定:
先查特征里有没有包含未来信息。最省事的办法是随机打乱训练集的特征列做一次训练,如果AUC几乎没掉,说明模型依赖的是纯序列信息而非特征本身,那就要怀疑特征里藏了未来函数。再查样本是否有重叠。标签窗口和采样频率不对齐,会导致验证集和训练集之间存在信息交叉。最后才考虑模型过拟合问题。模型过拟合的表现通常是训练AUC极高、验证AUC极低,但前提是你把前面两个结构性漏洞排除了。
5.2 极端下跌样本太少怎么办
抄底模型天然面临正样本稀疏问题。真正的极端超跌场景在历史上本来就不多,而机器学习恰恰需要大量样本来学习模式。针对这个我已经形成了一套组合打法:
第一,用scale_pos_weight给正样本加权重;第二,对正样本做轻度过采样,但不要用SMOTE这类生成合成样本的办法,因为金融时序数据是强相关的,凭空插值只会制造出不符合市场逻辑的虚假样本;第三,如果你确实缺少暴跌样本,可以降低标签的涨幅阈值,比如从8%降到5%,扩大正样本的覆盖范围,代价是信号强度会变弱。
5.3 回测完美但实盘失效,真实原因可能是什么
回测和实盘的差距永远是量化里的终极问题。我自己踩过的坑里,最常见的三类是:
信号延迟:模型用的是日线收盘数据,但实盘时你只能在尾盘集合竞价附近下单,或者第二天开盘买入。这一夜之间的价格变化会让信号质量大幅下降。解决方案是在模型预测时额外加入一条约束,比如只预测"收盘后模型打分最高的前3只票,次日开盘涨幅不超过2%才买入",这样相当于给模型信号加了实盘约束。
滑点大于预期:抄底模型买的位置通常是流动性相对不足的时候,一个单子打下去,实际成交价可能比预期的更差。应对办法是用限价单,并且把回测里的滑点成本调高一倍来测试模型是否还能存活。
持仓心态问题:模型给出了高概率信号,但买入后连续三天阴跌,人很容易拿不住。这个其实可以通过组合持仓来缓解,单只票的仓位控制在总资金的10%以内,靠整体概率取胜,而不是押注单一标的。
5.4 正面收益的模型也需要持续监控
模型上线运行不代表一劳永逸。市场风格在变,模型学到的规律也会逐渐失效。我自己的习惯是每隔两周跑一次模型在最近数据上的表现,重点跟踪两个指标:AUC是否还保持在合理区间,以及预测打分的分位数分布是否出现明显偏移。如果模型的打分越来越集中在中间区间,说明它开始失去区分度了,这时候就需要重新训练或者调参。监控这块往往是最枯燥但最保命的环节,千万别省。
6. 写在最后:从模型到交易系统之间还差几步
把模型训练完,其实是整个体系里最容易的一环。从模型到能跑的量化系统,中间至少还差三道工序:信号过滤、仓位管理和风控止损。
信号过滤方面,模型输出的概率只是一个单调的排序分数,需要人为设定一个阈值来决定哪些票进入候选池。我的习惯是选模型打分最高的前1%到2%的样本,再叠加上流动性过滤和涨跌停过滤。仓位管理方面,激进抄底策略绝对不能单票重仓,单票上限我一般控制在15%以内,同时持仓只数不少于5只,让单只票的风险尽量稀释。风控止损方面,买入后如果两天内浮亏超过5%,无条件止损退出。这是这条策略的底线,宁可错过后面的反弹,也要把本金保住。
这期培训课程里,我会带学员把这整套流程从头到尾过一遍,从数据处理开始,到特征构建、模型训练、回测验证,最后把一个完整的激进抄底模型跑起来。经验这东西,光看别人做和自己实操完全是两码事,只有亲手踩过坑,模型才能真正变成自己的武器。如果你也对这个方向感兴趣,建议先把基础的数据处理和特征工程练熟,这比任何模型参数都重要。
