做过多变量时间序列预测的人都有体会:数据不缺,特征工程也做了好几轮,但模型预测精度就是卡在一个瓶颈上不去。如果一直只用单变量时间序列的思路,或者只上一个普通的LSTM,往往会忽略掉两个非常关键的信息维度——局部模式的自动提取和上下文双向关系。近两年我在风电功率短期预测和工业传感器趋势预测这几个场景里反复试过不同组合,最终在Matlab环境里把CNN和BiLSTM串成一套端到端模型,才把预测误差明显压下去。这篇文章就把这个组合从原理、数据准备、Matlab代码实现到常见坑位完整讲一遍,适合做电力负荷预测、气象预报、设备故障趋势预测等多变量时间序列任务的朋友直接参考。
1. 核心思路:为什么CNN和BiLSTM偏偏适合搭在一起
1.1 CNN在时间序列里的真角色:局部特征扫描器
很多人一提CNN就想到图像分类,觉得卷积只适合处理二维像素矩阵。这是个很大的误解。在时间序列预测里,CNN同样可以发挥关键作用,只不过它扫描的对象从“空间邻域”变成了“时间邻域”。
拿一个多元时间序列样本来说,比如输入特征包括温度、湿度、风速、气压四个维度,每个时间步这四个值构成一组输入。卷积核本质上就是一个滑动的特征提取器,它会沿着时间轴滑动,在每个窗口内把多个特征维度的信息做加权融合。这种做法有两个直接好处:第一,无需手工设计滞后变量或交互特征,卷积核自动学习局部时间窗口内的组合模式;第二,多个卷积核并行扫描,可以同时捕捉不同尺度的局部依赖关系。
这种能力在电力负荷预测里尤其好用。比如空调负荷往往在温度突变之后半小时到一个小时才明显上升,这种“温度变化趋势引发负荷变化”的模式,传统LSTM虽然能学,但需要大量训练数据来隐式记忆。CNN在输入层附近就把这类短时局部模式提取出来了,相当于先做了一轮特征抽象,再交给循环网络去学习长程依赖,整体负担小很多。
在实际网络结构里,卷积层通常堆叠一到两层,后面接ReLU激活函数,中间穿插池化层用于降低时间分辨率。值得注意的是,池化层在这里不是单纯为了压缩计算量,而是主动舍弃部分细粒度信息、保留更有判别力的高层特征。这个设计选择对时序任务很关键,因为时间序列里的噪声往往集中在高频细节上,池化相当于自带了一层噪声滤波。
1.2 从LSTM到BiLSTM:双向信息带来的收益
LSTM解决的是普通RNN在长序列上的梯度消失问题,它靠门控机制记忆长期信息。但在很多时间序列场景里,当前时刻的状态不仅受过去影响,也可能受“未来趋势”影响。这里的“未来”不是指用未来数据作弊,而是在给定一段完整的历史序列时,某个中间时刻的隐含状态如果既能结合前面时刻的信息,又能参考后面时刻的上下文,会让整体表征更加稳健。
BiLSTM就是在LSTM基础上加了一个反向传播方向的结构。它用两个独立的LSTM层分别按时间正序和逆序处理输入序列,然后把两个方向的隐状态拼接或者求和作为最终输出。这样每个时间步的表示都同时包含了前后文信息。
举个具体例子就明白了。预测设备故障时,一个振动信号异常升高,如果只看过去的信息,模型可能只会判定“信号偏高”;但如果结合后续几分钟的连续上升趋势,模型更容易判断这是“故障前兆”而不是“瞬时尖峰”。这就是双向上下文的价值。不过也要注意,BiLSTM只适用于离线训练和那些可以整体拿到完整序列的预测任务。如果场景要求严格实时,每来一个点就必须立刻输出,反向通道在推理阶段就可能等不到完整的未来上下文,这时要么用普通LSTM,要么就用定长窗口配合合理的“未来范围”。
1.3 为什么这套组合能打
CNN负责在输入层面抓取局部模式,BiLSTM负责在时间维度上建模双向长程依赖,两者分工不同,但互补性很强。单用CNN会丢失长程记忆;单用BiLSTM则容易淹没在高维原始特征里,训练收敛慢、局部模式也学不干净。把它们串起来,等于先把原始多变量序列“拧干”成高层次的局部特征,再交给BiLSTM做时序推理,整体网络更容易收敛,泛化能力也更强。
这套组合适用的场景也很清晰:输入是多个变量、输出是未来某个时刻或某段时间的预测值、样本之间存在明显时间依赖,同时样本量不至于太小。我个人在风电功率预测实验里对比过,在同样的训练集和验证集下,CNN-BiLSTM比普通LSTM的RMSE平均下降大约6%到9%,比纯CNN更是好出一截。如果数据量特别少,比如只有几百个样本,深层的CNN-BiLSTM反而容易过拟合,这种情况优先考虑简化结构或者用较浅的CNN做特征提取。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 数据处理:预测之前先解决“喂什么”的问题
2.1 Matlab工具准备与数据载入
在Matlab里做这个任务,需要确保安装了Deep Learning Toolbox。从R2019b之后序列输入层、卷积一维层、双向LSTM层这些基础层都已经原生支持,不用额外装第三方工具包。如果用的是2021a以后的版本,convolution1dLayer、maxPooling1dLayer这类一维卷积层已经非常成熟,直接在层数组里使用即可。
数据载入这一步,最实用的函数是readmatrix。它能直接读取csv、txt等文本格式的数据文件,自动识别数值列。比如你的数据文件格式是:
| 时间 | 温度 | 湿度 | 风速 | 气压 | 功率 |
|---|
每一列代表一个特征,其中“功率”是我们要预测的目标变量,其余是输入特征。读入之后先分开特征矩阵和目标变量,同时注意检查缺失值和异常值。对时间序列任务,缺失值我一般不用全局均值填充,而是用前向填充或者线性插值,因为这能在最大程度上保留时间连续性,避免引入虚假的跳变信号。
2.2 滑动窗口:选好滞后步长和预测步长
多变量时间序列建模的关键一步,是把原始序列切成“样本对”。给定滞后步长lag,我们取序列中连续的lag个时刻的多维特征作为输入,对应下一个时刻的目标值作为输出。这个窗口每向后滑动一步,就生成一个新样本。
滞后步长的选择直接影响模型性能。步长太短,模型看不到足够的趋势信息;步长太长,样本数量骤减,而且训练时间大幅增加。实际操作中,我通常先用自相关函数(ACF)和偏自相关函数(PACF)观察目标变量的自相关衰减情况,粗略估计影响范围,再结合具体任务的业务周期来判断。比如风电功率预测中,如果数据是15分钟一个采样点,滞后步长取16到32之间的值往往会比较合理,这对应4到8小时的历史信息。负荷预测如果是小时级数据,滞后24通常是个好起点,因为能覆盖到一天内各个时段的相似状态。
窗口滑动会产生一个问题:相邻样本之间高度重叠,训练集内部存在强相关性。这个不能完全避免,但需要注意,划分训练集和测试集时绝不能随机打乱,而必须按照时间顺序切分。否则训练集里混入未来信息,验证结果虚高,上线后模型立刻“现出原形”。
2.3 归一化处理的顺序陷阱
归一化几乎是所有神经网络训练的必要环节,但时间序列归一化有个特别容易踩的坑:必须先用训练集的统计量去做归一化,再用同一套统计量去处理验证集和测试集。有些初学者把整段数据放在一起计算均值和标准差,然后再切分,这会造成数据泄漏。因为测试集的均值、标准差被“偷看”了,相当于模型在训练时就间接接触到了测试集的分布信息,评估结果自然不客观。
更稳妥的做法是:先切分,后归一化。具体而言,用训练部分计算每个特征的均值和标准差,保存下来,然后对训练集、验证集、测试集分别应用相同的变换。在Matlab里实现很简单,先用mean和std算训练集的统计量,再用广播减法除法处理所有集合。后面预测完成以后,要把预测值反归一化回原始量纲时,同样需要用训练集目标变量的均值和标准差。
3. 核心实现:模型构建与训练全流程
3.1 网络结构逐层拆解
这里给出一个通用且验证有效的CNN-BiLSTM结构,用于“多变量时序回归预测”。整体网络从输入到输出依次是:序列输入层、一维卷积层、ReLU、最大池化层、第二层一维卷积层、ReLU、最大池化层、双向LSTM层、全连接层、回归输出层。
第一层sequenceInputLayer的参数是输入特征数量,也就是多变量特征的维度。它接收的每个样本是“特征数×时间步长”的矩阵。要注意Matlab对序列数据维度的定义:第一个维度是特征通道,第二个维度是时间,这和图像数据“高度×宽度×通道”的排列习惯完全不同,初学者经常在这里把数据维度搞反。
第一层卷积使用3个时间步长的卷积核,输出32个通道。这个“小卷积核”设计是有讲究的。时间序列不像图像,过大的卷积核会跨越多步造成过度平滑,反而把局部突变信息抹掉了。3步的窗口既能覆盖相邻时刻的相互影响,又不至于丢失细节。第二次卷积用同样的3步卷积核,但输出通道数提高到64,这样网络越深特征表示能力越强。
池化层这里使用步长为2的最大池化,把时间维长度减半。这意味着如果输入滞后步长是32,经过两次池化后,进入BiLSTM的时间步长就变成了8。这个压缩过程强制模型只保留最关键的时刻信息,同时显著降低BiLSTM层的计算量。但是要注意,如果滞后步长本来就比较小,比如只有8或10,那么两层池化就会把时间步长压到2或3,这样BiLSTM能建模的时间依赖就非常有限了。这种情况下应当只保留一层池化,或者干脆去掉池化。
BiLSTM层设置128个隐含单元,输出模式选择last。因为我们这里做的是“用过去一段序列预测未来一个点”的回归任务,所以只需要最后一个时间步的输出。如果你想做序列到序列的多步预测,则要设置OutputMode为sequence,具体区别我会在下一节展开。
3.2 训练选项与超参数配置
网络结构定下来之后,训练选项是决定模型成败的第二个关键因素。这里给出我在实际项目中常用的一套参数:
matlab复制options = trainingOptions('adam', ...
'MaxEpochs', 120, ...
'MiniBatchSize', 64, ...
'InitialLearnRate', 0.005, ...
'LearnRateSchedule', 'piecewise', ...
'LearnRateDropPeriod', 40, ...
'LearnRateDropFactor', 0.2, ...
'ValidationData', {XTest, YTest}, ...
'ValidationFrequency', 20, ...
'Plots', 'training-progress', ...
'Shuffle', 'never', ...
'Verbose', true);
优化器我基本固定用Adam,它对时间序列回归任务的适应性很好,基本不需要手动调整动量参数。初始学习率0.005对于这个规模的网络通常足够,但如果发现训练Loss震荡严重,可以降到0.002或者0.001。LearnRateDropPeriod设为40的意思是每40个epoch学习率乘以0.2,这样前期快速收敛,后期精细打磨,比固定学习率更容易拿到好结果。
Shuffle这里必须设成never。原因是时序数据存在时间顺序,每个batch内外的样本顺序如果被打乱,虽然不影响单个样本的输入输出关系,但会破坏验证集切分的时间逻辑,也会给训练过程引入不必要的随机性。这个细节很多人忽略。
MiniBatchSize的选择取决于显卡显存和序列长度,一般从32到128之间调整。如果训练过程中内存不足,优先降低batch size而不是减少滞后步长。
3.3 一份可直接跑的完整代码
结合前面的数据准备和网络设计,下面给出一份完整的可运行脚本。示例数据是一个单纯的CSV,假设最后一列是目标变量,前面所有列是特征。
matlab复制%% 1. 读取数据
data = readmatrix('series_data.csv');
X = data(:, 1:end-1);
Y = data(:, end);
N = size(data, 1);
%% 2. 按时间顺序切分训练/测试集
numTrain = floor(0.8 * N);
X_train = X(1:numTrain, :);
Y_train = Y(1:numTrain, :);
X_test = X(numTrain+1:end, :);
Y_test = Y(numTrain+1:end, :);
%% 3. 用训练集统计量归一化
muX = mean(X_train, 1); sigmaX = std(X_train, 0, 1);
muY = mean(Y_train); sigmaY = std(Y_train);
XN_train = (X_train - muX) ./ sigmaX;
YN_train = (Y_train - muY) ./ sigmaY;
XN_test = (X_test - muX) ./ sigmaX;
YN_test = (Y_test - muY) ./ sigmaY;
% 防止除零
sigmaX(sigmaX == 0) = 1;
%% 4. 滑动窗口生成样本
lag = 24;
numFeatures = size(XN_train, 2);
numTrainSamples = length(XN_train) - lag;
numTestSamples = length(XN_test) - lag;
XTrain = cell(numTrainSamples, 1);
YTrain = cell(numTrainSamples, 1);
for i = 1:numTrainSamples
XTrain{i} = XN_train(i:i+lag-1, :)'; % 特征数 x lag
YTrain{i} = YN_train(i+lag);
end
XTest = cell(numTestSamples, 1);
YTest = cell(numTestSamples, 1);
for i = 1:numTestSamples
XTest{i} = XN_test(i:i+lag-1, :)';
YTest{i} = YN_test(i+lag);
end
%% 5. 定义网络结构
layers = [
sequenceInputLayer(numFeatures)
convolution1dLayer(3, 32, 'Padding', 'same')
reluLayer
maxPooling1dLayer(2, 'Stride', 2)
convolution1dLayer(3, 64, 'Padding', 'same')
reluLayer
maxPooling1dLayer(2, 'Stride', 2)
bilstmLayer(128, 'OutputMode', 'last')
fullyConnectedLayer(1)
regressionLayer
];
%% 6. 训练
options = trainingOptions('adam', ...
'MaxEpochs', 120, ...
'MiniBatchSize', 64, ...
'InitialLearnRate', 0.005, ...
'ValidationData', {XTest, YTest}, ...
'ValidationFrequency', 20, ...
'Plots', 'training-progress', ...
'Shuffle', 'never', ...
'Verbose', true);
net = trainNetwork(XTrain, YTrain, layers, options);
%% 7. 预测与反归一化
YPred = predict(net, XTest);
YPred = YPred * sigmaY + muY;
YReal = cell2mat(YTest) * sigmaY + muY;
%% 8. 画图对比
figure;
plot(YReal, 'LineWidth', 1.2); hold on;
plot(YPred, 'LineWidth', 1.2);
legend('真实值', '预测值');
xlabel('测试样本序号');
ylabel('目标值');
title('CNN-BiLSTM 预测效果');
grid on;
这套代码在Matlab R2021a及以后版本可以直接运行。如果你用的是更老的版本,convolution1dLayer可能被称为convolution1dLayer的前身,或者在2019a之前根本没有内置支持,需要手动安装第三方实现。建议尽量用新版本。
4. 效果评估与多步预测实战
4.1 评估指标:RMSE、MAE、R2一个都不能少
模型训练完成后,评估不能只看Loss曲线。Loss曲线是训练过程的反馈,真正衡量预测效果要靠测试集上的一组回归指标。我常用的有三个,各有侧重。
RMSE(均方根误差)对较大误差更敏感。在风电功率预测这类场景里,少数几个严重错误的预测点可能对电网调度产生较大影响,因此RMSE是一个很合适的评估指标。MAE(平均绝对误差)更关注预测的整体平均偏差,它不会因为少数极端点而被放大,更适合在误差分布比较均匀的时候使用。R2则是一个相对指标,它衡量模型相对“直接用均值预测”提升了多少,越接近1说明模型解释力越强。
这三个指标在Matlab里实现都非常简单,不需要额外工具箱:
matlab复制YReal = YReal(:);
YPred = YPred(:);
RMSE = sqrt(mean((YReal - YPred).^2));
MAE = mean(abs(YReal - YPred));
SS_res = sum((YReal - YPred).^2);
SS_tot = sum((YReal - mean(YReal)).^2);
R2 = 1 - SS_res / SS_tot;
需要注意的是,计算这些指标前,一定要先把预测值和真实值反归一化回原始量纲,再用原始量纲计算。如果直接拿归一化后的数据计算RMSE,数值虽然也能看,但无法对应到业务上的物理意义,比如“功率误差”是多少千瓦。
4.2 从单步预测到多步预测:递归策略
上面的代码实现的是单步预测,也就是给定过去lag个时刻的输入,预测未来第lag+1个时刻的目标值。很多实际业务需要的是多步预测,比如提前12小时预测未来每个小时的负荷。
多步预测最简单有效的实现方式是“递归预测”:把预测出的第一个未来值作为已知输入的一部分,滚动预测下一个值。具体来说,假设滞后步长是24,先预测出第25个时刻的值,然后把这一个预测值和原来序列中的第2到第24个时刻的真实特征组合成新的输入窗口,预测第26个时刻的值,如此循环。
这个策略的代价是误差会随预测步数累积。第一步的预测误差会进入第二步的输入,导致误差被放大。缓解这个问题有几种做法:一种是在递归预测过程中加一点小噪声,模拟真实数据的不确定性,提高滚动预测的稳定性;另一种是把网络改成序列到序列结构,一次输出多步预测值。后者在Matlab里更简单直接,只需要把bilstmLayer的OutputMode改为sequence,改动输出层结构,数据构造方式也要相应调整,让每个训练样本的标签是一个长度等于预测步长的向量。
4.3 可视化与结果解读
训练过程那张Loss曲线只是“体检报告”,预测对比图才是给业务方看的“成绩单”。画图时建议只取测试集最后一段的100到200个点,而不是全部展示。因为点太多会挤成一团,看不出预测和真实的匹配程度。把局部放大了,才能直观判断模型是否捕捉到了趋势拐点、峰谷形状是否对齐。
除了预测值和真实值的对比图,我还习惯额外画一张误差分布直方图。如果误差大致符合零均值的正态分布,说明模型没有明显的系统性偏差;如果直方图明显偏向正方向或负方向,说明模型存在欠预测或过预测的系统性趋势,这往往是因为网络没有捕捉到期规律,可以考虑增加滞后步长或者调整特征组合。
再进一步,可以按不同时段统计误差。比如在风电预测里,白天的预测误差可能比晚上大,因为在不同天气系统切换时段,功率波动本身就剧烈。如果你发现某个时段的误差特别突出,可以考虑单独收集该时段的样本做针对性训练,或者引入额外的时点特征。
5. 常见问题与排坑经验
5.1 训练不收敛或Loss震荡
这个是最常见的问题。如果训练过程一直不收敛,首先要检查输入数据是否归一化到位。特征之间的量级差异过大,比如温度是几十,风速是几,气压是上千,这种差异极大损害梯度下降的效率。确认归一化后,再看学习率。学习率太高会导致Loss震荡发散,太低则收敛极慢,甚至卡在局部极小值。
我自己的排查习惯是:先固定一个训练配置,把网络打印出来,确认每层的输入输出维度是否匹配。维度不匹配的情况下,Matlab会直接报错,但如果只是“能跑但效果差”,就要靠经验判断。通常先试初始学习率0.001或0.005,在plots='training-progress'里观察训练曲线。如果曲线在20个epoch内就平滑下降,继续训练即可;如果震荡剧烈,降低学习率;如果几乎不动,则提高学习率或检查数据是否大部分为零。
5.2 过拟合与欠拟合
过拟合的典型表现是训练集Loss持续下降,但验证集Loss先降后升,出现明显的“剪刀差”。解决过拟合,可以从这几个方面入手:减少网络层数或隐藏单元数、增加Dropout层、增大训练数据量、提前终止训练。
在CNN-BiLSTM结构里,Dropout通常加在BiLSTM层之后,因为LSTM的隐含状态维度较大,是最容易过拟合的位置。Matlab的dropoutLayer(0.2)表示随机丢弃20%的神经元输出。注意Dropout只在训练阶段起作用,预测阶段自动被关闭,这是Matlab内部已经处理好的。
欠拟合则是另一番光景:训练集和验证集Loss都偏高,且验证Loss和训练Loss差不多,说明模型容量不够。这时应当增加BiLSTM的隐含单元数,比如从64调到128,或者增加一层卷积层来增强特征提取能力。但DELAY是,每一步增加容量都要配套监控过拟合倾向,否则这个坑跳过去又踩另一个。
5.3 数据泄漏与边界问题
数据泄漏在时间序列任务里是隐蔽性最强的问题。除了归一化泄漏,还有一个容易被忽略的点:窗口滑动的边界。比如在构造训练样本时,如果把整个数据集(包括未来部分)都用来生成窗口,再切分训练集和测试集,那么测试集靠近切分边界的那几个样本,其输入窗口中可能混入了原本属于训练集时段的数据。虽然这不算严格的数据泄漏,但它会让测试效果偏乐观,因为模型在训练时就已经见到过测试集开头一小段的原始特征。
正确做法是先按时间切分原始数据,再分别对训练部分和测试部分构造滑窗样本。我之前在代码里正是这样处理的,先切分、后建窗。这个顺序不要颠倒。
5.4 Matlab实现中的两个具体坑
第一个坑是关于cell2mat的。预测出来的结果如果是cell数组,里面每个元素是一个1×1的数值,直接cell2mat没有问题。但如果网络输出层的尺寸设置成了大于1的列向量,那么cell2mat得到的结果维度就不是简单的一维向量,画图前需要先用reshape或(:)展平。
第二个坑是maxPooling1dLayer的池化核尺寸和步长的关系。如果输入序列时间步长恰好不能被池化核整除,Matlab会报错或者静默截断最后几个步长的数据。在定义网络前,先算一下经过所有池化层后时间维度的长度。比如滞后步长是24,经过两次步长为2的最大池化后,长度变成6,如果池化核尺寸不匹配,就可能出问题。稳妥的做法是在卷积层使用Padding='same',池化层则尽量保持输入时间步长为2的整数幂。
还有一个值得说的经验:Matlab的BiLSTM训练比较吃内存。假如滞后步长较大、训练样本数很多,可以先把数据保存成single类型来减少显存占用。方法很简单,读取数据后调用data = single(data);,在精度上几乎无损失,但训练速度可能快10%到20%。
做完了这个流程,如果你自己去跑一遍,会发现CNN和BiLSTM的组合并不神秘,关键还是数据构造、层参数、训练配置这几块能不能落实到位。我自己在多个数据集上反复实验,最大的感受是:模型结构带来的提升是有限的,真正拉开差距的往往是处理数据时的细节——窗口怎么滑、归一化顺序有没有搞错、测试集有没有泄漏。这些看起来不起眼的小事,决定了最终预测值的可靠程度。后续如果你想进一步提升精度,可以在这个基础上考虑添加注意力机制,或者把普通的滑窗数据改成带时间编码的样本,这些都是CNN-BiLSTM框架上很好的扩展方向,尤其适合那些目标是做出真正能落地使用的预测系统的朋友继续深挖。
