vectorbt案例学习系列写到第4篇,这次聊配对(套利)交易。选这个题有两个原因:一是配对交易是均值回归策略里最有代表性的一种,天然适合用vectorbt的矩阵化思路来批量回测;二是我在真正用vectorbt跑配对策略的过程中,踩过几个文档里不会写清楚的坑,比如协整检验的滚动窗口怎么定、信号应该用状态还是用边缘触发、参数估计阶段怎么避免前视偏差——这些都值得单独拿出来记录。
先给还没接触过这个策略的朋友一句话总结:配对交易,或者说统计套利,逻辑本身不复杂——找两只长期走势高度相关的标的,当它们的价差偏离到极端时,做空相对贵的、做多相对便宜的,等价差回归到均衡区间后平仓离场。难点从来不在策略逻辑本身,而在两件事:一个是怎么在几十上百个候选标的中快速找出真正协整的配对并确定参数;另一个是怎么把这些配对的历史回测、阈值扫描、成本敏感性测试一次性算完。说白了,这是一个既考验统计功底、又考验工程效率的策略类型,而vectorbt恰好把第二件事做到了极致。
如果你是第一次接触vectorbt,建议先把官方文档里的Quickstart过一遍,搞清楚它和普通Pandas回测在思路上有什么本质差异。如果已经跑过基础Demo,那这篇内容可以直接拿去用。
1. 配对交易回测的痛点:Pandas循环为什么让人崩溃
1.1 两层循环的回测结构
用Pandas写配对回测,最直观的写法是两层循环:外层遍历所有候选配对,内层逐日计算价差、持仓状态、收益、累计净值。听起来没什么问题,但一旦深入到细节,痛点立刻冒出来。
首先是代码复杂度。10只股票能组成45个配对,每个配对500个交易日,循环跑下来勉强能接受;但当你把候选池扩到50只股票,就是1225个配对,再叠加参数扫描,计算量直接大两个数量级。更麻烦的是,循环里每一步都要做状态判断——当前有没有持仓、今天是不是触发开仓、是否碰到止损线、价差是不是已经回归——这种逐行if-else写出来很容易,调试起来却非常痛苦。你往往要打印出中间状态才能定位到某一天某一对到底发生了什么。
其次是窗口计算的割裂。配对交易的很多计算天然不是逐行的,而是窗口的:滚动均值、滚动标准差、滚动协整系数,都需要当前时点之前的整段历史。Pandas的rolling能处理标准窗口,但一旦遇到“每个配对有自己不同的滚动窗口长度”(比如根据半衰期动态决定),代码就会失控:你要在每个配对循环里分别算窗口,再做rolling,还要保证最后所有配对的时间轴严格对齐。拼接结果时稍微马虎一点,索引错位就能让你排查半天。
1.2 矩阵化方案的优势:速度与可扩展性
vectorbt的思路和传统循环完全不同。它把“每个配对”当成矩阵的一列,把“每个交易日”当成矩阵的行,信号计算、组合构建、绩效统计全部在同一组矩阵运算里完成。你不需要告诉程序“先跑A配对再跑B配对”,只要保证每个配对的价差数据、开平仓信号都对齐到相同的行列结构,vectorbt会在一次调用里把上百个配对的结果全部算完。
这套设计带来的好处用一张表能看得很清楚:
| 维度 | 传统Pandas循环 | vectorbt矩阵化 |
|---|---|---|
| 代码结构 | 双层循环 + 逐行状态机 | 矩阵运算 + 信号矩阵 |
| 配对数量扩展 | 代码不变,运行时间线性增长 | 列数扩展,向量化一次完成 |
| 参数扫描 | 需要额外加循环嵌套 | 通过增加信号列/组合一次性完成 |
| 调试难度 | 中间状态需要手动打印核对 | 每对结果独立成列,方便横向对比 |
| 性能 | 随计算量线性恶化 | 底层用NumPy和Numba加速 |
这里顺便提一句,vectorbt开源版的核心是用Numba做JIT加速,所以同样是滚动计算,它的执行效率比原生Pandas逐行循环高很多。它不是“换了个写法”,而是把回测引擎编译成了机器码级别的循环,性能自然不在一个量级。第3节里你会看到,构造好信号矩阵之后,整个回测过程其实只需要一行Portfolio调用。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 协整筛选与价差构造:喂给vectorbt之前的三步准备工作
在把数据丢进vectorbt之前,有一堆统计层面的准备工作要先做。这部分看起来不像是“回测”,但它的结果直接决定了回测有没有意义。我习惯分成三步:协整检验、半衰期估计、生成z-score信号。
2.1 先协整再相关:为什么相关系数高的配对不一定能赚钱
很多初学者上来先算相关系数,觉得两只股票走势很像就能配对。这是典型的误区。相关性衡量的是“过去同步性”,而配对交易的赚钱基础是“未来的价差会回归均值”,这要求价差序列本身具备平稳性,统计上叫协整关系。举个极端例子:两只股票长期同步上涨,但价差一路扩大、从不回头,它们之间的相关系数可以依然很高——但你如果按配对逻辑做多价差,账户会亏到怀疑人生。
判断协整的常用方法是Engle-Granger两步法:先对两只股票的价格序列做线性回归,得到残差序列(也就是价差),再对残差做单位根检验。statsmodels里直接提供了现成接口,返回协整p值,p值越小说明协整关系越可靠。实际筛选中,我一般要求p < 0.05,同时把半衰期也纳入过滤条件,避免选到“逻辑成立但一辈子不回归”的配对。
用代码做这件事很直接:
python复制import itertools
import numpy as np
import pandas as pd
from statsmodels.tsa.stattools import coint
# prices: 每列一只股票,index为交易日
assets = ["600000.SH", "600036.SH", "601166.SH"]
pairs = list(itertools.combinations(assets, 2))
rows = []
for a, b in pairs:
# coint返回(统计量, p值, 临界值)
_, pvalue, _ = coint(prices[a], prices[b])
rows.append((a, b, pvalue))
result = pd.DataFrame(rows, columns=["资产1", "资产2", "p_value"])
result = result.sort_values("p_value")
print(result[result["p_value"] < 0.05])
这段只是在正式回测前做标的筛选,用普通循环完全没问题,因为候选池最多几百个配对,耗时不会成为瓶颈。真正的性能压力在后面的逐日回测和参数扫描,那才是vectorbt要上场的地方。
2.2 半衰期:用AR(1)系数决定均值回归周期
半衰期的含义是:价差在偏离均衡位置后,平均需要多久才能恢复到一半偏离程度。计算方法是先对价差序列做一阶自回归:
[
spread_t - spread_{t-1} = a + b \cdot spread_{t-1} + \varepsilon_t
]
其中b通常是负数,半衰期由 (-ln(2) / b) 得到。
这个指标有两个实际用途。一是过滤配对:半衰期太长的配对意味着回归速度很慢,资金压在里面几个月甚至一年都不动,性价比很低;二是决定滚动窗口长度:后面算z-score时,滚动均值和滚动标准差的窗口通常取3倍半衰期左右。窗口太短,统计量噪声大;窗口太长,信号反应太迟钝,等你开仓时价差可能已经回归了。
代码实现很简单:
python复制def estimate_half_life(spread):
spread_lag = spread.shift(1)
spread_lag.name = "lag"
delta = spread.diff()
delta.name = "delta"
df = pd.concat([delta, spread_lag], axis=1).dropna()
beta = np.polyfit(df["lag"], df["delta"], 1)[0]
return -np.log(2) / beta
一个容易被忽略的细节是:半衰期本身也会随时间变化,不是一个恒定值。所以稳健的做法是用滚动窗口估计半衰期,观察它的稳定性,而不是拿全样本算一次就当作永恒真理。
2.3 生成z-score信号:进出场规则怎么定义
有了价差和滚动窗口,下一步就是把价差标准化成z-score,并设置进出场阈值。标准写法是:
[
z = \frac{spread - rolling_mean}{rolling_std}
]
当z低于-2时,说明价差被严重低估,做多价差;当z回到-0.5以上时,说明价差已经修复,平仓离场。这里的-2和-0.5是经验值,实际项目中最好通过参数扫描来确定,我在第3节会讲具体做法。
有一个极其关键的细节:信号必须用“边缘触发”而不是“状态触发”。
如果直接把 z < -2 当作入场信号,那么只要z一直待在-2下方,每一根K线都会产生一个新的开仓信号。回测引擎会认为你每天开一次仓,开仓、平仓、再开仓层层叠加,最终的收益曲线完全失真。正确做法是只在“z从上方穿越-2”的那一刻开仓:
python复制z = (spread - spread.rolling(window).mean()) / spread.rolling(window).std()
entry = (z < -2) & (z.shift(1) >= -2)
exit_ = (z > -0.5) & (z.shift(1) <= -0.5)
这个细节看起来简单,但它直接决定了回测结果是否可信。我在第5节还会用一个具体案例再展开一次,因为这是配对回测里最隐蔽也最常见的错误。
3. 把十几对价差一次性塞进vectorbt批量回测
3.1 多对价差矩阵的构造
前面筛选出来的每一对资产,都有自己的beta、半衰期、滚动窗口。这些参数在进入vectorbt之前都要算好,然后你会得到一个关键的数据结构:以交易日为行、以“资产对”为列的价差DataFrame,以及与之完全对齐的entry DataFrame和exit DataFrame。
构造方式类似这样:
python复制import vectorbt as vbt
# 假设coint_pairs是上一轮筛选出来的配对列表,每项包含(a, b, beta, half_life)
spread_dict = {}
entry_dict = {}
exit_dict = {}
for a, b, beta, half_life in coint_pairs:
spread = prices[a] - beta * prices[b]
window = max(int(3 * half_life), 20) # 防止窗口过小
spread_mean = spread.rolling(window).mean()
spread_std = spread.rolling(window).std()
z = (spread - spread_mean) / spread_std
col = f"{a}_{b}"
spread_dict[col] = spread
entry_dict[col] = (z < -2) & (z.shift(1) >= -2)
exit_dict[col] = (z > -0.5) & (z.shift(1) <= -0.5)
spread_df = pd.DataFrame(spread_dict)
entry_df = pd.DataFrame(entry_dict)
exit_df = pd.DataFrame(exit_dict)
到这里,所有配对的数据都已经整整齐齐地排成了相同行列数的DataFrame。接下来回测只需要一行:
python复制pf = vbt.Portfolio.from_signals(
spread_df,
entries=entry_df,
exits=exit_df,
direction="longonly", # 新版本可能是"long",以你的版本文档为准
fees=0.0005,
slippage=0.0005,
freq="D"
)
然后你就能直接用 pf.total_return()、pf.max_drawdown()、pf.sharpe_ratio() 拿到每一对的结果。这份代码和“只回测一个配对”的代码几乎一模一样——唯一的区别是数据结构从单序列变成了多列DataFrame。这就是vectorbt最让人舒服的地方。
3.2 Portfolio.from_signals的关键参数与简化假设
from_signals 是vectorbt开源版里最常用的组合模拟函数。对配对交易来说,最省事的做法是把价差当成一个合成资产,让组合持有这个合成资产的头寸,参数上要关注这几个:
price:合成资产的价格序列,也就是价差本身。entries:开仓信号,布尔型DataFrame。exits:平仓信号,布尔型DataFrame。direction:交易方向。只做多价差用longonly;想同时做多和做空价差,需要写更复杂的信号逻辑。fees/slippage:交易成本,单位是比例。freq:时间频率,用于计算年化指标。
这里必须说清楚一个取舍:把价差当合成资产,回测的是“价差本身的涨跌”,并不是两只股票各自的市值收益。它的隐含前提是,你把两只股票按固定比例构建成一个对冲组合,每次开仓都按回归系数执行。这种简化在策略筛选阶段完全够用,优点是直观、快速,一行就能对比百来个配对的优劣;缺点是它忽略了资金占用、保证金、做空限制等实盘细节。
如果你需要更精确的实盘口径,那就得走多资产组合路线,分别在两个标的上生成多空订单,再放到 from_orders 里去拟合。开源版也能做到,但数据结构的复杂度会明显上升。我个人的工作流是:先用合成资产法快速筛选出潜力配对,再用精确法对少数几对做二次验证。这样既不会在初期被繁琐的订单逻辑拖慢节奏,也不会在最终评估时被简化假设误导。
3.3 阈值扫描:进出场参数不是拍脑袋定的
配对交易里,入场阈值和出场阈值的设定对结果影响极大,不同市场、不同标的的“最佳参数”差异很大。与其凭经验猜,不如直接让vectorbt跑一组候选阈值,横向对比。
做法很简单:把不同阈值下生成的信号按列堆叠起来,一次性回测。核心代码如下:
python复制param_results = []
for te in [1.8, 2.0, 2.2]:
for tx in [0.3, 0.5, 0.8]:
entry = (z < -te) & (z.shift(1) >= -te)
exit_ = (z > -tx) & (z.shift(1) <= -tx)
pf = vbt.Portfolio.from_signals(
spread, entries=entry, exits=exit_,
direction="longonly", fees=0.0005, freq="D"
)
param_results.append({
"entry_th": te,
"exit_th": tx,
"total_return": pf.total_return(),
"sharpe": pf.sharpe_ratio(),
"max_drawdown": pf.max_drawdown(),
"n_trades": pf.trades.count()
})
param_df = pd.DataFrame(param_results)
print(param_df)
这样得到的表格就是一张直观的参数地图:哪些组合能赚钱、哪些组合碰巧是几十笔交易里的运气、哪些组合交易次数少到根本不值得参考,一目了然。实际项目中,我还会把不同组合的净值曲线都画出来,肉眼确认一下曲线的形态,避免只盯着一个孤零零的收益率数字做判断。
4. 回测结果怎么读:收益率之外还要盯住哪些数字
很多人跑完回测,只盯着 total_return 一个数字,这其实是危险的做法。配对交易是低频策略,一年下来几十笔交易很正常,统计上的噪声很大,光看总收益很容易被误导。我一般会同时检查下面几个维度。
4.1 交易次数与胜率的统计陷阱
配对策略的样本量天然不大。一组参数跑下来,如果只产生了20笔交易,胜率65%和胜率50%之间的差异,可能只是两三笔盈亏互换带来的,完全谈不上统计显著。所以我对比参数时,会额外加一个约束:交易次数不低于30笔,再去看收益和回撤。
pf.trades.count() 可以直接拿到每对的总交易笔数,pf.win_rate() 给胜率。把这两个指标和收益放在一起看,能避免很多“过拟合却自以为找到圣杯”的错觉。
4.2 成本敏感性:三档费率测试
配对交易每次开平仓要操作两只标的,手续费和滑点会被成倍放大。尤其是当价差波动本身不大时,交易成本几乎决定了策略的死活。我习惯把费率分成三档测试:理想情况(零费率)、正常情况(单边万五)、保守情况(单边千二)。
如果某组参数只在零费率下赚钱、在正常费率下收益接近归零,那就说明策略的毛利太薄,实盘没有操作价值。反过来,如果策略在保守费率下依然能留下不错的收益,那它才值得进入下一轮研究。
4.3 滚动外推:样本内协整不代表样本外有效
这是配对交易最容易被忽视的问题:你用来筛选配对的样本,和用来回测的样本,如果完全重叠,那回测结果天然包含前视偏差。更隐蔽的问题是,即便你严格按时间分割,静态的协整关系也可能在市场结构变化后失效。
我常用的补救办法是滚动协整检验:在样本内每隔一段时间重新做一次协整p值计算,看看这组配对在历史上是否一直保持协整。如果某些阶段p值长期在0.05附近徘徊甚至突破,那就说明这些配对只是最近才“看起来协整”,回测里体现出来的收益很可能不具备持续性。
5. 实盘级回测最容易踩的四个坑
这一节是全文最想写的部分。以下四个坑,我在不同阶段、不同项目里都真实遇到过,每一个都曾让我的回测结果与实盘产生严重偏离。
5.1 参数估计的前视偏差:最隐蔽的错误
很多人做配对回测时会这么做:用全样本数据回归出beta,然后用这个beta计算整个历史区间的价差和信号,再跑回测。看着结果很漂亮,但这里面藏着致命的前视偏差——在历史上的任何一天,你根本不可能知道未来数据算出来的beta值。
正确做法是滚动估计:在t日生成开仓信号时,只能用t日之前的数据估计beta,然后用t日的价差形成信号,t+1日开盘交易。在vectorbt里,这要求在进入回测引擎之前就把“滚动beta”计算好,而不是把整个序列当作输入。这个步骤绕不开,因为vectorbt本身不做参数估计,它只负责在给定信号和价格的情况下跑组合。
一个检查前视偏差的简单方法:把回测的净值曲线第一年截掉,看看剩余区间是否依然盈利。如果策略的收益高度依赖前几个月的表现,大概率是参数估计过程出了问题。
5.2 状态信号与边缘信号:重复开仓问题
这是我在第2节里提到的坑,但值得用具体例子再说一次。假设z-score在-2下方持续了10天,如果用 z < -2 作为入场信号,vectorbt会在每个交易日都生成一条开仓记录。而这些记录之间没有平仓信号,于是交易记录里就会出现“持仓中再次开仓”的诡异情况,净值计算完全失真。
解决方式就是“边缘触发”:只有在上一个交易日z大于等于-2、当日z小于-2时才开仓。如果你用的是 vbt.SignalBuilder 这类信号构建工具,也要注意设置相关的“首次触发”行为。大量初学者在这里翻车,但往往因为净值曲线看起来还在涨,所以问题被忽略了——直到实盘时才发现信号频率完全对不上。
5.3 停牌、涨跌停与不可交易时段
回测层面容易忽略的另一个问题是:你用的历史价格里,可能有停牌日、涨跌停日,或者流动性极差的时段。在这些日子里,你的开平仓信号在现实世界中根本执行不了,或者只能以很差的价位成交。
处理方式有两个层面。一是数据清洗:把停牌日、无成交记录的行直接从回测区间中剔除,或者用前收盘价填充但禁止信号触发。二是成交约束:在组合构建阶段加入最小成交量和最大冲击成本限制。vectorbt开源版原生不提供涨跌停拦截,需要自己在信号生成前把不可交易日的信号置为False。虽然多几行代码,但这一步不做,很多“高收益策略”在实盘第一天就会露馅。
5.4 资金占用、对冲比例与做空约束
最后是一个容易被简化假设掩盖的问题。合成资产法回测时,价差组合的资金占用是隐含的;但实盘中,做多端和做空端都需要真金白银,尤其在一些对做空有限制、融券成本不低的市场里,做空端的费用和保证金占用会严重侵蚀收益。即便在支持做空的市场,按回归系数固定比例开仓,也会因为股价变化导致实际对冲比例漂移,需要定期再平衡。
我的建议是:在完成初筛和参数扫描之后,把胜出的少数配对单独拿出来做精确回测,把资金占用、成本、做空限制、再平衡周期都建模进去。不要在一开始就用最复杂的模型,但从初筛到上实盘的每一层简化,你都得清楚知道它省略了什么。
vectorbt能帮你把回测跑得飞快,但它不会替你做统计检验,也不会替你判断哪些配对在未来的市场里依然有效。工具的价值在于把“验证想法”的成本大幅降低,让你有更多时间去做真正重要的思考——筛选指标、验证逻辑、理解市场结构。我自己的习惯是:先接受简化模型带来的高效,再用精确模型确认关键结论,最后把每一步的前提都白纸黑字写下来,交给未来的自己检查。
