做宏观金融实证的都知道,顶刊上那些“金融周期与资产价格”类的文章,看着模型高级、图表漂亮,但真要自己动手复现一遍,光是数据口径和模型设定就能磨掉半条命。这篇东西就是把我用Matlab复现《金融研究》级别论文“金融周期如何影响房地产价格”的完整过程整理出来——从金融周期指标的构建,到TVP-VAR模型的估计,再到时变脉冲响应图的输出,全链路都过一遍。内容偏实操,不堆理论公式,适合正在写宏观金融方向论文、或者想快速上手时变参数向量自回归模型的同学参考。前提是你机器上已经装好Matlab,R2020b及以后版本都可以,不需要额外的经济计量工具箱,核心代码靠基础功能加少量自写函数就能跑起来。
1. 研究设计拆解:金融周期变量与模型选型
1.1 金融周期到底是什么,为什么能影响房价
金融周期这个概念这几年在宏观和货币经济学里被反复讨论,通俗讲,它指的是信贷、杠杆、资产价格这些金融变量在中长期内呈现出来的共同波动。它和传统经济周期的区别在于,周期长度更长、幅度更大,而且底部往往对应金融危机。做实证时,我们一般不会直接用某一个指标来代替金融周期,而是把社会融资规模、信贷余额、信贷占GDP的比重、实际房价、股票价格、利差、居民杠杆率等变量合成一个综合指数,再进入模型。
为什么金融周期对房地产价格的影响是顶刊关注的重点?核心机制在于:金融周期上行阶段,银行放贷意愿强,居民加杠杆买房的约束放松,资金会明显流向房地产,推高房价;反过来,房价上涨会提升抵押品价值,企业和居民的融资约束进一步放宽,这又强化了信贷扩张。这种金融变量和房价之间的正反馈,使得金融周期对房价的影响往往呈现“非对称、时变”的特征,普通线性固定系数模型很难刻画出来。
1.2 模型选择:为什么是TVP-VAR而不是普通VAR
如果你只是想知道“金融周期对房价有没有显著影响”,那用普通VAR就够了,跑一个格兰杰因果检验或者脉冲响应,结论很快就能出。但这类论文想回答的问题更细:影响大小是不是随经济状态在变?在信贷扩张期和紧缩期,传导力度差多少?政策收紧之后,传导路径会不会发生结构变化?
这些问题促使我选择TVP-VAR模型。TVP-VAR的全称是Time-Varying Parameter Vector Autoregression,核心特征就是允许回归系数和扰动项方差都随时间变化。它跟普通VAR比,最大的优势是能捕捉经济结构渐变的过程:系数矩阵不再是一个固定常数,而是每条样本点上都有一个估计值。你在做脉冲响应时,可以选择任意一个时点,看这个时点上变量之间的动态关系,而不是只给一个“平均响应”。
选择这个模型的另一个原因是它的结果叙事能力强。普通VAR只能画出一条脉冲响应曲线,而TVP-VAR可以画出一整个三维曲面:横轴是响应期数,纵轴是时间,颜色或高度代表响应强度。这种图一出来,审稿人一眼就能看到“金融周期冲击对房价的传导在不同年份有明显差异”,故事性比单条曲线强太多了。
1.3 变量、样本与滞后阶数的基本设定
我复现时用的数据是季度频率,样本跨度从1990年一季度到2023年四季度。为什么用季度不用年度?因为年度数据样本量太少,时变参数模型需要足够多的观测点才能保证后验估计稳定。季度数据的好处是样本量够,坏处是季节性波动需要处理,建模前我都会做季节性调整。
核心变量我选了四个:实际房价同比增速、金融周期指数、信贷增速、实际短期利率。房价指标直接取销售价格指数或百城价格指数,用GDP平减指数调整为实际值,再取对数。金融周期指数按下一章的方法合成。信贷增速用金融机构人民币贷款余额同比增速,也做了实际化处理。短期利率用7天银行间质押式回购加权利率或一年期国债收益率,实际化处理时减去通胀预期。滞后阶数我用BIC准则筛选,季度数据通常落在2阶,少数样本短的情况下用1阶更稳。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 数据准备与金融周期指数构建
2.1 指标选取与预处理
数据预处理这一步看着简单,其实最容易出问题。尤其在国内宏观数据里,口径调整特别频繁,同一指标在不同年份统计方式可能变过好几次。我的建议是:尽量用连续发布、口径统一的指标,并做一下交叉验证。
具体到Matlab实现,第一步是导入数据。我会把Excel里的原始数据读进来,统一变成列向量,并检查缺失值。季度数据缺失的常见原因是部分指标只有年度数据,这时需要用插值法补齐。我自己比较喜欢用二次插值或三次样条插值,因为线性插值做出来的季度趋势太死板,进入模型后会影响主成分结构。
第二步是价格调整。所有名义变量,包括房价、信贷、社融,都要先除以GDP平减指数,得到实际值再取对数。这个步骤不能省,否则金融周期指数里混入通胀成分,估计出来的“金融周期”可能实际是“物价周期”。
第三步是处理极端值。我习惯对样本期内的异常值做1%和99%分位的缩尾处理,尤其是2008年前后、2020年一季度这种极端波动期,如果不缩尾,第一主成分很容易被少数样本主导。
2.2 用主成分合成金融周期指数
金融周期指数构建我采用的是主流做法:对多个金融变量提取第一主成分。在Matlab里,这个过程比较简洁,核心代码是这样的:
matlab复制% X是n行k列的原始指标矩阵,每一列是一个金融变量
% 1. 标准化
X_std = (X - mean(X)) ./ std(X);
% 2. 主成分分析
[coeff, score, latent] = pca(X_std);
% 3. 提取第一主成分作为金融周期指数
fci_raw = score(:, 1);
% 4. 如果希望指数更平滑,可以做移动平均
fci_smooth = movmean(fci_raw, 5);
% 5. 解释力检查
explained = latent(1) / sum(latent) * 100;
fprintf('第一主成分解释力: %.2f%%\n', explained);
这里的latent返回的是特征值,explained表示第一主成分解释的方差占比。我复现下来的经验是:如果第一主成分解释力低于40%,说明你选的指标太杂,或者有几个指标和其他指标走势完全反向,这时要重新考虑指标组。
2.3 BP滤波提取金融周期成分的替代方案
除了主成分,顶刊论文里还有一种常见做法:先分别对各指标做BP滤波,提取周期成分,再合成指数。BP滤波的好处是可以把金融周期限定在特定频段,比如8到32个季度,这样得到的指数更符合“周期”的定义,而不是混入短期的金融波动。
Matlab里做BP滤波,可以用自带的bandpass函数,但它对边界数据比较敏感。样本首尾两年容易产生假性波动,我的解决方案是在滤波之前把样本向前向后各扩展15到20个季度。扩展方法可以用AR模型外推,也可以直接复制端值。滤波完之后再把扩展部分切掉,只保留原始样本区间。
不过在实操中,我对比过BP滤波和纯主成分,两者得到的金融周期指数走势高度相似,相关系数通常在0.8以上。如果你只是复现论文,不打算深究周期频段,用主成分就够了,能省不少事。
3. TVP-VAR模型原理与Matlab实现
3.1 模型设定与状态空间表达
TVP-VAR的模型设定,我尽量用大白话讲清楚。它的观测方程看起来跟普通VAR差不多,但所有系数都带了时间下标t。具体可以写成:
y_t = c_t + B_{1t} y_{t-1} + B_{2t} y_{t-2} + ... + B_{pt} y_{t-p} + u_t
这里的B_{1t}到B_{pt}是随时间变化的系数矩阵。同时扰动项u_t的协方差矩阵也随时间变化,而不是固定不变。
状态方程则描述系数是怎么演化的,最常用的是一阶随机游走:
beta_t = beta_{t-1} + v_t
这个设定意味着经济结构的冲击是永久性的,至少在样本期内不会自动回到某个均值。在宏观实证里,这个假设比较合理,因为制度变化、金融创新、杠杆结构调整往往都是永久性冲击。如果使用均值回归过程,模型会默认冲击影响最终衰减到零,这不符合信贷周期和房价周期的经验表现。
自回归系数的估计顺序一般是:先估计系数beta_t,再估计协方差矩阵里的非对角线参数A_t,然后再估计随机波动率h_t,最后估计状态方程的扰动方差Q。这个顺序决定了MCMC抽样的模块划分,写代码前一定要画清楚。
3.2 先验设定与训练样本
MCMC估计需要设置先验。这里的“先验”就是你在看到数据之前,对这些参数取值的主观判断。很多初学者会把先验方差设得非常大,觉得这样更“客观”。但实际上,过度分散的先验在TVP-VAR这种高维状态空间模型里,非常容易导致抽样发散,后验分布根本跑不出来。
我的做法是:用样本前10年做普通VAR估计,把估计出的系数均值作为beta先验均值,把系数协方差矩阵放大10倍作为先验方差。这样先验跟数据在同一个量级上,MCMC收敛速度会明显加快。随机波动率的先验我通常设成IG分布,形状参数和尺度参数都取0.01,这个设置在很多顶刊复现代码里都能看到。
3.3 Matlab代码框架
下面给出一个TVP-VAR核心MCMC循环的代码框架。这不是完整代码,但把主逻辑都列了出来,你可以照着补全细节。
matlab复制% ===== TVP-VAR Gibbs抽样主循环 =====
% beta_store: nCoeff x nDraws
% a_store: nA x nDraws
% h_store: nObs x nDraws
% Q_store: nCoeff x nDraws
for iter = 1:nDraws
% 1. 抽样系数beta_t:使用FFBS算法
% 输入: Y, X, A, Sigma, Q, beta_prev
% 输出: beta_sim (nObs x nCoeff矩阵)
beta_sim = drawBeta(Y, X, A_sim, h_sim, Q_sim, beta_init);
% 2. 抽样协方差矩阵的非对角线元素A_t
% 对每个方程依次做条件后验抽样
a_sim = drawA(Y, X, beta_sim, h_sim, S_prior);
% 3. 抽样随机波动率h_t
% 通常用独立Metropolis-Hastings算法
h_sim = drawStochasticVolatility(Y, X, beta_sim, a_sim, W_prior);
% 4. 抽样状态方差Q
% 对beta的差分平方和求逆伽马分布
Q_sim = drawQ(beta_sim, Q_prior);
% 存储
beta_store(:, iter) = beta_sim(end, :)';
a_store(:, iter) = a_sim;
h_store(:, iter) = h_sim;
Q_store(:, iter) = Q_sim;
end
实际实现的时候,drawBeta这个函数最费功夫。它内部要做卡尔曼滤波和平滑,也就是FFBS,前向滤波得到系数的条件分布,后向采样得到全样本的系数路径。Matlab里没有现成函数,一般要自己写。如果你不想从零写,可以在MathWorks File Exchange上搜“TVP-VAR Bayesian”,有很多成熟版本,但拿回来要先读明白,确保用的是Primiceri(2005)那一套框架。
3.4 收敛诊断:别只看trace plot
MCMC跑完之后,最重要的一步是检查收敛性。常见做法是画trace plot看抽样路径是否平稳,但这个方法有误导性。更可靠的做法是算Geweke诊断值、无效因子和有效样本量。
Matlab里可以用贝叶斯分析常用的coda工具包,或者自己写。无效因子这个指标特别值得关注,它衡量的是MCMC抽样中自相关造成的有效样本损失。如果无效因子小于20,说明抽样效率不错;如果大于50,那你的有效样本量已经严重不足,需要增大迭代次数或者改进抽样器。
我自己复现时,通常会先跑一次5000次迭代的短链,把无效因子算出来,根据结果决定最终迭代次数。正式跑的时候是5万次迭代,丢弃前1万次作为burn-in。这样可以保证剩下的有效样本足够支撑脉冲响应图的置信区间。
4. 脉冲响应计算与结果解读
4.1 时变脉冲响应函数的计算逻辑
TVP-VAR最吸引人的地方就是能做时变脉冲响应分析。计算思路并不复杂:选定一个时点t,抽取这个时点上的系数矩阵B_{1t}到B_{pt},把它们当作普通VAR的系数,然后给金融周期指数一个标准差的正向冲击,递归计算出未来若干个季度房价增速的反应路径。
不同时点重新抽取系数,再计算一组新的响应路径。把每一个时点的响应路径并列放一起,就形成了时变脉冲响应曲面。需要注意的是,冲击的识别问题。如果不加约束,普通的Cholesky分解的响应结果对变量顺序敏感。我在复现时采用了一个符合经济学直觉的顺序:利率排第一,金融周期排第二,信贷增速排第三,房价增速排最后。这意味着金融周期冲击对房价的影响,允许在当期通过利率和信贷渠道传导,但房价对其他变量的当期影响设为零。这个顺序在金融周期与房价的文献里很常见。
4.2 三维脉冲响应图绘制技巧
Matlab里绘制三维脉冲响应图,我用的是surf函数。核心代码如下:
matlab复制% time_index: 时间轴,可以是年份
% horizon: 响应期数,比如1到12个季度
% response_matrix: 时点x响应期数的响应值矩阵
surf(horizon, time_index, response_matrix)
xlabel('响应期数(季度)')
ylabel('时间')
zlabel('房价响应(%)')
colormap(parula)
colorbar
view(-40, 30)
shading interp
这里有几个参数我实际调过:视角view(-40, 30)一般是默认比较舒服的角度,不会遮挡关键峰值。shading interp可以让曲面颜色平滑过渡,出图效果比默认的网格好看很多。画完之后,建议把图像的字体统一设成8到9磅,图片尺寸控制在页面三分之一宽度左右,这样放进论文里大小合适。
4.3 结果解读:不能只说“显著正向”
拿到脉冲响应图之后,最重要的不是写“金融周期冲击显著推高房价”,而是讲清楚影响的时变特征。
按我复现得到的典型结果来看,金融周期一个标准差正向冲击,对房价的影响通常在4到6个季度内达到峰值,响应幅度在0.5%到1.5%之间。关键在于不同年份的峰值差异:在信贷扩张阶段,响应峰值明显更高,传导速度也更快;在信贷紧缩阶段,峰值更低,甚至会由正转负。这背后的逻辑是:当金融体系杠杆已经很高时,继续加杠杆对房价的边际推动力会减弱,而且紧缩环境下信贷渠道传导受阻。
另一个可以做深度分析的方向是分析“金融周期冲击对房地产价格的贡献份额”。TVP-VAR可以做预测误差方差分解,把房价波动的来源拆成金融周期、信贷、利率等几个部分。如果在某些时间窗口,金融周期对房价预测误差的贡献率能到20%以上,这个数字写进论文就很有说服力。
4.4 稳健性检验
顶刊审稿人对稳健性的要求非常高。我的建议是至少做三组稳健性检验:一是替换金融周期指数构建方法,比如把主成分换成等权重加权或BP滤波;二是调整变量顺序,看脉冲响应图是否发生较大变化;三是缩短或扩展滞后阶数。如果核心结论没变,就可以在论文里写一句“上述结果在替换变量测度、调整识别顺序和滞后结构后保持稳健”,这比做一堆花哨的模型更让审稿人放心。
5. 实操中常见的报错与避坑记录
5.1 数据不足导致MCMC发散
我最初用1998年到2018年的季度数据跑,结果beta的抽样路径一直不稳定,某些系数在正负之间来回跳。后来检查发现,样本期太短,而TVP-VAR要估计的参数非常多,信息量不足以识别时变参数。解决办法有两个:一是延长样本,尽量从1990年开始;二是让状态方差的先验更小,把时变幅度控制住。按我的经验,状态方程扰动项的先验方差不要超过0.01,否则抽样路径非常容易漂移。
5.2 先验设置太分散导致局部吸收
有段时间我把先验方差设成默认的100,结果MCMC陷入几个不同的局部吸收状态,后验分布极不稳定。后来换成训练样本先验,问题马上缓解。这里想说一个道理:贝叶斯方法里“无信息先验”听起来很客观,但在高维状态空间模型里,完全无信息先验的后果就是后验极不规则,抽样很难收敛。实际操作中,适度信息先验反而是更稳的选择。
5.3 中文乱码和图片输出问题
Matlab在Linux或者新版macOS上直接输出中文标签,经常变成一个个方框。我最初没注意,结果导出PNG之后发现图上全是乱码,返工了好几轮。之后我定了个规矩:所有实证图表一律用英文标签。一方面避免乱码问题,另一方面投稿国际期刊时也少一步处理。如果你一定要用中文标签,记得先用set(groot, 'DefaultAxesFontName', 'SimHei')把字体指定好,导出图片时用print函数设置高分辨率,比如print('fig1', '-dpng', '-r300')。
5.4 运行时间优化
TVP-VAR的MCMC运行时间是大问题。如果变量数多、滞后阶数大、迭代次数高,跑一次可能要几个小时。我的经验是:先用5000次迭代,加一个10秒倒计时,测试程序是否正常;确认无误后再跑正式长度。同时,代码里尽量少用for循环嵌套,能用矩阵运算就用矩阵运算。Matlab的矢量化能力很强,很多循环版本需要一小时的计算,矢量化之后十分钟就能跑完。
下面这个表格是实操中最高频的几类问题,我直接整理成了速查表:
| 问题表现 | 可能原因 | 处理思路 |
|---|---|---|
| beta抽样路径发散 | 样本过短或Q先验过大 | 延长样本、缩小Q先验方差 |
| 脉冲响应置信区间过宽 | MCMC有效样本不足 | 增加迭代次数、降低自相关 |
| 主成分第一主成分解释力过低 | 指标选取太杂或方向不一致 | 检查指标方向、剔除异常变量 |
| 图形中文乱码 | 系统字体不支持 | 改用英文标签或指定中文字体 |
| 运行时间过长 | 循环嵌套过多 | 矢量化矩阵运算、减少迭代次数 |
| 不同时点响应差异不明显 | 模型过度限制时变幅度 | 适当放宽Q先验、检查变量平稳性 |
写在最后的实操体会
复现顶刊论文,最耗时间的往往不是代码本身,而是数据口径和模型设定的来回对齐。我在做金融周期指数时,光是GDP平减指数和房价指数口径统一就花了不少功夫。给想走这条路的同学一个建议:先把指数、变量、样本期完全确定下来,存档成一个干净的Excel,再开始跑模型,千万不要边建模边换数据口径。那样的话,一旦结果不理想,你根本分不清是模型问题还是数据问题。最后再补充一句,跑完主模型之后,一定要做一版分时间段的脉冲响应对比,比如把样本分成信贷扩张期和紧缩期,分别展示传导差异。这个步骤看起来只是加分项,但往往是论文能否让人眼前一亮的真正分水岭。
这篇文章后续还可以继续扩展城市层面面板数据,做带随机波动率的TVP-VAR,或者引入更多金融子市场指标。但基础的复现流程就是上面这些,希望对你上手机器学习和宏观实证都有点实际帮助。
