1. 先厘清量化策略的版图:每一类策略到底在赚什么钱
经常有人在后台问我:想做量化,第一步是不是得先把Python学得滚瓜烂熟?我的回答通常是一句反问:你打算赚哪种钱?这个问题想不清楚,代码写得再漂亮,最后多半还是在给券商和交易所交手续费。
量化交易策略本质上不是一堆指标和代码的堆砌,而是把一套可重复、可验证的交易逻辑用程序表达出来。这套逻辑必须回答三个问题:为什么这个价格会涨跌、什么时候触发买卖、错了怎么办。市面上流传的“常见策略”看起来花样很多,但拆开来看,赚的钱基本来自这么几个地方:市场参与者的情绪惯性、资产价格的暂时失衡、信息扩散的时间差、以及有人愿意为流动性付出溢价。搞明白策略赚的是哪一类钱,才能搞明白它在什么行情下有效、什么行情下会失灵。
先给一张我常用来给新人做科普的量化策略版图,按决策逻辑来切分要比按品种切分清晰得多:
| 策略大类 | 核心赚钱逻辑 | 典型时间周期 | 主要风险来源 |
|---|---|---|---|
| 趋势跟踪类 | 价格沿既有方向继续运行 | 日线级到周线级 | 震荡行情中反复止损 |
| 均值回归类 | 价格过度偏离后回归中枢 | 分钟级到日线级 | 单边行情下“接飞刀” |
| 统计套利类 | 相关资产价差回归长期均衡 | 高频到日内 | 协整关系瓦解 |
| 事件驱动类 | 信息公布后的预期差修复 | 数日到数周 | 事件不确定性 |
| 高频与做市类 | 为市场提供流动性换取价差 | 毫秒到秒级 | 技术系统风险、逆向选择 |
| 多因子选股类 | 横截面上因子风险溢价 | 月度调仓为主 | 因子拥挤、风格切换 |
工具是可以互相叠加的,比如一个CTA策略可以同时包含趋势和套利成分。但如果连自己主要吃的是哪种“市场beta”都说不清楚,后面的参数优化、绩效归因都会变成无源之水。
我之所以把“分类”放在全文最前面,是因为在实际带人做策略的过程中,发现大多数亏损并非策略本身失效,而是使用者在错误的行情里用了错误的策略类型。量化圈有句老话:没有万能的圣杯,只有错配的周期。开篇先把地图铺开,后面的每一类策略细节才有落脚点。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 主流策略逐个拆解:核心逻辑、代码骨架与失效边界
这一部分我会把六类主流策略逐一说透。每一类都会讲清楚它最底层的假设、实际操作中的标准做法、以及普通人最容易忽略的失效场景。
2.1 趋势跟踪:市场惯性的钱,赚得最辛苦也最稳定
趋势跟踪是历史最悠久、逻辑最朴素的量化策略:价格一旦形成方向,就会在惯性作用下继续运行一段时间。均线交叉、唐奇安通道突破、动量因子都是这个思路的变体。
核心假设是市场存在“羊群效应”,趋势的形成需要时间,而多数交易者对信息的反应是渐进的,这就给了后来者搭乘趋势的机会。一个最传统的突破策略长这样:
python复制# 唐奇安通道突破策略
# 数据:日线OHLCV
import pandas as pd
def donchian_signal(df, lookback=20):
df['upper'] = df['high'].rolling(lookback).max()
df['lower'] = df['low'].rolling(lookback).min()
df['signal'] = 0
# 突破上轨开多
df.loc[df['close'] > df['upper'].shift(1), 'signal'] = 1
# 跌破下轨反手做空(期货/两融账户适用)
df.loc[df['close'] < df['lower'].shift(1), 'signal'] = -1
return df
注意我用了 shift(1),这是回测里避免未来函数的关键细节。用当天的最高价去和当天的唐奇安上轨比,逻辑上没问题,但成交只能发生在信号确认之后,所以实际买入应该用次日开盘价。
趋势策略真正考验人的不是入场信号,而是震荡期的连续磨损。价格在通道上下沿之间来回扫的时候,策略会连续触发止损,资金曲线形成一段很长的横盘或阴跌。我早期跑股指期货5分钟趋势策略时,曾经连续21个交易日没有盈利,单笔亏损虽然不大,但心理压力非常大。后来才明白趋势策略的管理核心是仓位尺度和品种分散,而不是寻找更灵敏的入场指标。
经典的趋势跟踪体系会做两件事:一是多品种同时持有,比如同时跑螺纹钢、PTA、豆粕、股指期货,用品种间的低相关性平滑资金曲线;二是用波动率倒数确定仓位,波动大时少做,波动小时多做,比如ATR(平均真实波幅)仓位管理:
python复制# 基于ATR的仓位计算:目标波动率固定法
def position_size(capital, atr, risk_pct=0.01, price=100):
# 每笔允许亏损占总资金1%
loss_per_unit = atr # 假设以1倍ATR为止损距离
size = (capital * risk_pct) / loss_per_unit
return math.floor(size)
趋势策略的失效场景非常明确:当市场进入低波动的窄幅震荡时,它会反复止损。这个不是策略bug,而是盈利模式的必然成本。你要赚到单边大行情的钱,就得忍受震荡期的“磨损税”。
2.2 均值回归:赚“过度反应”的钱,风险是接飞刀
如果说趋势策略在赌“惯性延续”,均值回归就是在赌“物极必反”。它基于一个统计直觉:价格短期内偏离合理中枢太远,大概率会被拉回来。布林带、RSI超买超卖、配对交易都是这个逻辑。
我在商品期货上做得比较多的是跨期套利,本质就是同一品种不同月份合约的价差回归。比如近月合约因为短期供求紧张被拉得很高,远月合约反应平淡,价差超出了历史统计区间,就做空近月、做多远月,等价差收敛后平仓。这种策略不赌绝对涨跌,只赌两者相对关系的回归,风险敞口要小得多。
python复制# 布林带均值回归信号(简化版)
df['mid'] = df['close'].rolling(20).mean()
df['std'] = df['close'].rolling(20).std()
df['upper'] = df['mid'] + 2 * df['std']
df['lower'] = df['mid'] - 2 * df['std']
df['signal'] = 0
df.loc[df['close'] < df['lower'], 'signal'] = 1 # 触及下轨买入
df.loc[df['close'] > df['upper'], 'signal'] = -1 # 触及上轨卖出
注意,均值回归策略最怕的是“回归迟迟不来”。2020年4月原油期货出现负价格那一段,很多做价差回归的账户被打得措手不及,因为极端行情下“合理价差”的锚本身会失效。做均值回归必须设置硬性止损,不要用“总会回归”来安慰自己。统计套利里有一个“协整关系瓦解”的概念,说的是两个资产过去十年的价差规律可能在某一天彻底失效,比如企业基本面突变或者市场制度改变。这种风险是模型内无法预知的,只能通过仓位上限来控制。
业余选手容易犯的错是把均值回归用在单边趋势很强的品种上。一跌就买、越跌越买,遇到趋势下跌会直接扛到爆仓。判断一个品种适合趋势还是适合回归,可以观察价格序列的自相关系数:自相关为正的趋势性强,自相关为负的适合做回归。
2.3 统计套利与多因子选股:把预测变成横截面比较
多因子选股和统计套利本质上是同一套思路的两种用法。简单说就是:不预测单只股票明天涨跌,而是定期在全市场范围内比较“谁更值得买”。它赚的是横截面上因子暴露的确定性溢价,比如低估值股票长期跑赢高估值、小市值股票长期跑赢大市值等。只要这些溢价没有消失,统计意义上就能赚钱。
操作框架大致四步:选因子、算因子暴露、打分排序、构建组合。举个例子,如果我想构建一个“低估值+高动量”的月度调仓组合:
python复制# 伪代码:多因子打分流程
scores = pd.DataFrame(index=stock_pool)
# 价值因子:用EP(盈利收益率)排序,越高越好
scores['value'] = rank(earnings_yield, ascending=True)
# 动量因子:过去12个月涨幅(剔除最近1个月),越高越好
scores['momentum'] = rank(mom_12m, ascending=True)
# 等权合成
scores['total'] = scores.mean(axis=1)
# 取总分最高的前30只
portfolio = scores.nlargest(30, 'total')
因子构建的门槛不在代码,而在数据处理。做多因子的人都知道,原始数据里最坑的是幸存者偏差:如果用今天还在上市交易的股票去回测五年前的数据,那些已经退市的垃圾股被忽略了,回测收益会虚高得离谱。正确做法是使用历史时点的股票池快照,也就是当时的全部已上市公司,包括后来退市的。中证指数公司会公布历史成分股,很多第三方数据源也可以回溯当时的状态。
多因子策略的另一个进阶问题是因子之间的相关性。估值因子和动量因子常常会同时选出一批股票,表面上看你是多因子分散,实质上还是单因子暴露。做正交化处理或用多因子回归剥离共同风险,是专业团队和业余选手的分水岭。
2.4 事件驱动类策略:赚信息定价效率的钱
事件驱动策略是很多个人投资者容易忽略的一块,但它恰恰是量化里最贴近“基本面研究”的领域。盈利的逻辑是:某件影响资产价格的事件发生后,市场价格需要一段时间才能充分消化信息,中间存在一个可以利用的定价偏差窗口。比如财报超预期、并购重组获批、行业政策落地、指数调仓生效等。
把这个逻辑程序化,最大的难点是把事件变成可量化的规则。以A股业绩预告为例,我可以把“预告净利润同比增速超过50%且此前市场预期不高”定义为一个事件,然后统计事件发生后5个交易日的超额收益。一个粗糙的样本:
python复制# 伪代码:事件研究法流程
# 1. 遍历历史业绩预告,筛选增速>50%的公司
events = filter(profit_growth > 0.5)
# 2. 计算事件后5日的累计异常收益(减去市场基准)
car = []
for e in events:
stock_ret = stock_price_after(e, days=5)
mkt_ret = index_price_after(e, days=5)
car.append(stock_ret - mkt_ret)
# 3. 检验平均累计异常收益是否显著为正
# 若显著为正,则说明该事件存在可套利窗口
这里有一个重要的实操心得:事件驱动策略的容量往往不大。一个消息出来,市场在几秒到几分钟内就会完成大部分反应,量化的优势在于快速识别和批量处理,而不是长期潜伏。个人做事件驱动,更适合把触角放在市场反应不够充分的细分事件上,比如北向资金持股变动、大宗交易折价率变化等,这些相比热门财报更容易出现定价滞后。
2.5 高频与做市策略:个人玩家基本别碰
高频交易和做市策略在专业机构里占据半壁江山,但我对个人投资者的建议一向非常直接:不要碰。
原因很简单,高频交易赚的钱来自三块:速度、信息、微结构优势。交易所的撮合机制决定了谁的订单先到谁先成交,而这依赖的是物理距离、硬件设备和极低的网络延迟,不是策略水平。做市商赚的是买卖价差,但他们同时承担着“被知情交易者逆向选择”的风险,必须有大量的订单流数据分析和风控体系支撑。个人做市的结果往往是给专业的流动性提供商当对手盘。
我见过一些“以高频自居”的个人交易者,实际上做的是分钟级甚至秒级的抢帽子,靠手续费返还勉强活着。这类策略的收益天花板由资金量决定,一旦资金变大,冲击成本会立刻吃掉收益。如果你对这类策略感兴趣,更合理的路径是先把它当作市场微观结构的研究课题来学习,而不是当成印钞机。
2.6 CTA与多品种配置策略:普通投资者最值得深耕的方向
这里单独给CTA(管理期货)策略一些篇幅,因为它是我认为普通投资者性价比最高的切入点。CTA策略的本质是“做多波动率”,通过在多个期货品种上分散持有趋势头寸来获利。它和股票市场的相关性极低,这也是它在资产配置中被称为“危机alpha”的原因。
一个最简单的商品期货CTA骨架可以是:对螺纹钢、铜、豆粕、PTA等8-10个品种分别计算20日均线和60日均线,金叉做多、死叉做空(或空仓),每个品种投入等额资金,然后定期再平衡。策略逻辑并不复杂,但因为在多品种上分散,资金曲线会比只做一个品种平滑得多。
有一个细节值得注意:CTA策略在品种选择上要留出足够的流动性余量,避免在成交量枯竭的品种上进出。回测中看起来很好的品种,实盘可能连单都成不了。判断流动性,可以看该品种主力合约过去20日的平均成交额,至少要保证你单次下单量不超过该数值的1%。
3. 从策略想法到可回测程序:一个通用开发骨架
前面讲了策略分类和各自的核心逻辑,但这还停留在“看懂”的阶段。真正做过量化的人都知道,把一个想法变成一条可靠的回测曲线,中间有大量工程化的细节。这一节我来讲讲我的开发骨架,它适用于绝大多数中低频策略。
3.1 数据层:清洗与对齐是最耗时间的环节
量化策略研发大概有60%时间花在数据上,这个比例一点都不夸张。行情数据源、复权因子、分红除权数据、财报时间戳,任何一环出错都会让回测结果失真。我见过有人用不复权的价格跑十年历史回测,策略信号满天飞,复盘一看全是除权跳空造成的假突破。
数据层的标准流程是:去重、去异常、对齐时间戳、生成复权价格。这里只说一个容易踩的坑——前复权和后复权不能混用。后复权价格适合计算收益和画图,但它会引入很大的价格基数从而影响止损价位计算;前复权价格适合模拟当前视角下的回测,但早期数据的负价格问题要特别小心。最稳妥的方案是:价格序列统一用后复权做因子计算,信号计算完成后,用真实成交价模拟订单。
3.2 信号层:把想法翻译成无歧义的规则
信号层是把策略想法变成明确触发规则的翻译过程。规则必须是无歧义的:某一时刻“持有多头/空头/空仓”必须唯一确定。我一般会把信号函数写成纯函数,输入是某个时点之前的数据快照,输出是该时点的目标仓位。这样做的好处是天然规避了未来函数。
回测中的未来函数分很多种,最隐蔽的不是“用未来数据计算指标”,而是“用未来才知道的股票池回测历史”。比如用今天的成分股去回测过去的指数增强策略,结果必然虚高。所以我特别强调,数据快照的时间截断在构建信号层时就该完成。
3.3 撮合层:摸拟滑点、手续费与涨跌停限制
撮合层决定了回测结果的“水分”有多大。很多人回测结果看起来很漂亮,一上实盘就崩塌,原因多半出在撮合层过度乐观。
标准做法是:信号在收盘后产生,次日开盘价成交。同时要在成交价上叠加双边滑点,比如股票按成交价加0.1%,期货按最小变动价位加一跳。手续费按交易所实际标准上浮一定比例。涨跌停当日无法成交的,必须让策略顺延到次日。这一条单独拿出来说,是因为忽略涨跌停限制会让回测中的收益被严重高估——你算出来今天能卖出,实际上开盘就已经一字跌停封死,根本跑不掉。
python复制# 成交价模拟:包含滑点与涨跌停约束(伪代码)
execute_price = next_open_price
if limit_up:
order = cancelled # 涨停板买入无法成交
elif limit_down:
order = cancelled # 跌停板卖出无法成交
else:
fill_price = next_open_price + slippage * direction
3.4 绩效层:夏普比率不是万能指标
绩效指标是回测的最后一层,也是最容易自欺欺人的一层。很多人只看总收益率,这是典型的新手认知。一个策略如果靠某一次极端行情贡献了大半利润,那它可能不是策略强,而是运气好。
我常用的几个评估指标:年化收益率、最大回撤、夏普比率、卡玛比率(年化收益/最大回撤)、胜率、盈亏比和换手率。其中卡玛比率是我最看重的,因为它直接反映了投资者真实的持有体验。一个年化50%但最大回撤40%的策略,和年化15%但最大回撤5%的策略,对多数资金管理者来说后者反而更优。回撤的感觉是“实盘亏钱会超过回测预期”,因为在回测中你可以轻松地持有,在实盘连续亏三个月时拿不拿得住完全是另一回事。
4. 回测跑赢还不够:过拟合识别与样本外验证的实战方法
策略开发圈里流传一句话:回测曲线越漂亮,实盘打脸越快。这里面最核心的原因就是过拟合。我也踩过类似的坑,用一个很复杂的机器学习模型跑出极好的回测,结果一上实盘连续亏损,复盘时才发现模型把历史行情的噪声全背了下来。
4.1 过拟合的三个典型信号
第一个信号是参数高原现象。做一个移动均线策略,参数从20日到80日,如果只在你选定的30日附近表现好,换到50日就崩盘,那你的策略大概率是过拟合的。反之,如果20-60日区间内的走势都比较接近,说明策略对参数不敏感,更可能在实盘中站稳。
第二个信号是样本内外表现差距过大。我习惯把数据切成三段:前60%做参数寻优,中间20%做验证,最后20%做“最终考卷”。如果在调参的样本上收益很好,但一放到验证段就平庸甚至亏损,说明策略无法泛化。
第三个信号是绩效对成本极其敏感。把滑点和手续费从单边万分之二提高到千分之一,策略收益就从正变负,说明策略本质上在赚假设中的交易成本优势,真实市场上根本不存在这样的优势。
4.2 参数寻优的正确姿势与Walk-forward方法
参数寻优的正确姿势不是“找到一组最优参数”,而是“找到一片稳健的参数平原”。寻优完成后,不要直接拿历史最优参数上实盘,要用Walk-forward(滚动前进验证)方法模拟真实操作节奏:每三个月用过去两年的数据重新校准参数,然后未来三个月用该校准后的参数做样本外交易,如此滚动。这种方法模拟的是实盘的可重复操作流程,结果更接近真实表现。
一个很容易被忽略的洁癖:参数寻优时的数据切分要和真实投资操作的时间点严格对齐。如果你用包含未来信息的全样本去选参数,哪怕只用了未来一天的涨跌排序来挑选组合,看起来是样本外验证,实际上已经被数据窥探污染了。
4.3 实战中的“隐性过拟合”:策略选择偏差
除了参数层面的过拟合,还有更高维度的策略选择偏差。你开发了20个策略,历史回测都各自能看,最后选择最漂亮的那一个上线,这本身就是过拟合。很多团队直到实盘亏钱才意识到:他们上线的只是那20个里运气最好的一个。
应对策略是建立策略白名单制度:事先定义好筛选标准,包括收益、回撤、样本外表现等,然后一视同仁地评审所有候选策略,而不是等看到回测曲线之后再反向修改筛选标准。还有一个小技巧:在同一个逻辑前提下,多测试不同的入场过滤条件,如果过滤器的存在对最终收益影响很小,果断剔除它。参数越少、规则越简单的策略,在实盘中的鲁棒性往往越好。
5. 策略不是全部:从回测到实盘,最容易被忽略的三个环节
策略模型本身再优秀,也只占量化投资体系的一部分。真金白银的市场里,执行、风控和心态共同决定成败。我接触到的个人量化爱好者中,策略水平参差不齐,但最终亏损的原因往往高度集中在这三个环节。
5.1 通道与接口执行差异:回测永远没有实盘那么“顺滑”
回测是理想化的假设:信号产生就能成交、成交量无限充裕、价格不受自己订单影响。实盘里,你的订单会推动价格、会遭遇部分成交、会因为网络延迟错过最佳价位。我不建议一上来就重仓跑实盘,正确路径是先用小资金或者仿真交易跑一段时间,确认实际成交滑点和回测假设之间的差距在可控范围内。一般来说,实盘的成交率会比回测低5-10个百分点,这个差异会直接啃噬高频换手策略的利润。
5.2 风控参数要写在程序里,不要写在脑子里
很多个人交易者做回测的时候想得起止损,上了实盘满脑子都是“再扛一扛就回来了”。量化交易的核心优势之一就是制度化的风险执行。开仓前就确定仓位上限、单笔最大亏损、单日最大回撤,并用程序硬编码,避免盘中情绪干扰。这一点做不到,量化交易和主观交易的差别只剩下“用代码下单”这个形式了。
5.3 策略需要维护周期,不存在“一劳永逸”
市场环境会变,策略的有效性也会衰减。一个基于低波动率因子的选股策略,在市场风格转向高波动时可能持续跑输基准。所以实盘策略要养成做日志和绩效归因的习惯:每周记录策略净值、基准净值、换手率、滑点成本等数据,按月对比策略表现与历史回测预期是否一致。一旦发现实际收益持续偏离预期超过两个标准差,就该启动策略复审流程,检查是市场环境改变了还是策略本身出现了问题。
回头看我这些年的量化经历,最深刻的体会是:量化交易不是用来预测市场的,而是用来在不确定的市场中建立纪律的。与其花几个月打磨一个所谓的“完美策略”,不如先把开发、回测、风控、上线的闭环跑通,让整个系统在真实的交易环境中稳定迭代。策略可以慢慢丰富,系统必须先能存活。这个顺序一旦搞反,后面的路都会很被动。
