搞时序数据这块的朋友,应该都有过被缺失值和异常值折磨的经历。尤其是传感器采集的连续数据,一旦出现一段长时间的“空洞”或者某个瞬间的“毛刺”,后面所有基于它的统计特征、模型输入全部跟着失真。我这次要分享的是一个我近期搭完的模型,用 K均值聚类 + KNN-LSTM-RF数据填补 做时序数据清洗,整体在Matlab下实现,效果比我之前单独用插值或者单一ML模型要稳很多。这篇文章会把模型怎么设计、为什么这么搭配、关键代码怎么落地、调试中踩了哪些坑都讲清楚,适合正在做时序数据预处理、论文实验或者工业数据治理的读者参考。
为什么选这套组合而不是直接上深度学习?原因很简单,时序数据的“脏”分很多种,有随机缺失、连续缺失、离群异常,还有因为传感器状态切换导致的分布漂移。单一模型很难同时应对这些情况,所以我一开始的定位就不是“一个算法打天下”,而是“多个模型分层协作”。K均值负责捕捉数据的整体结构和状态切换,KNN做局部的快速填补,LSTM负责处理带时间依赖的连续缺失段,RF则作为兜底的异常识别和填补结果校验器。四个算法各管一段,组合起来就是一个完整的清洗流水线。
1. 为什么做这个模型:时序数据清洗的“脏乱差”
1.1 时序数据清洗的场景与痛点
我最早接触数据清洗是在一个工业设备振动信号的项目里。传感器每100毫秒采集一次振动值,一天就是86万个点,其中总会有那么几段因为通信抖动、设备重启、信号干扰出现空洞或者跳变。如果用最简单的线性插值去填,短缺失还好,长缺失段填出来的曲线完全不符合设备的自然振动规律。如果直接丢弃缺失段,又会破坏时序的完整性,导致后续做频域分析时出现频谱泄漏。
痛点其实就三个:第一,缺失不是均匀分布,而是有成段出现的特点,这种连续缺失最不好处理。第二,数据本身有周期性或者状态切换,不同工况下同样位置的传感器数值范围差异很大,用一个全局阈值判断异常完全不靠谱。第三,填补之后的质量怎么评估?如果只追求“填满”,填出来的数据可能引入新的噪声,反而让下游模型变差。这些痛点决定了清洗模型必须具备两种能力:一是能区分出数据的不同状态,二是能结合时间上下文去做填补,而不是孤立地看每个点。
1.2 算法选型:为什么是K均值+KNN-LSTM-RF
我在选型阶段对比过很多方案。纯线性插值不行,因为它只利用了两个最近有效点,缺乏全局信息。用ARIMA或者简单指数平滑可以处理平稳序列,但遇到工况切换、趋势突变就滞后。单一LSTM虽然能学时间依赖,但训练时间长且对异常点敏感,数据里噪声一大,预测结果容易跑偏。
最终决定用K均值聚类来做最前置的分段。K均值可以把整个长序列按相似度切分成不同状态的片段,每个片段内部的特征比较一致,这样后续的填补就在各自的“状态上下文”里进行,而不是混着所有状态去填。KNN负责短缺失段的填补,它的原理是找最相似的K个邻居加权平均,在聚类划分完成之后,邻居搜索的准确性和速度都明显提升。对于长缺失段,KNN找不到足够的相似近邻,就让LSTM上场。LSTM通过训练历史窗口来预测下一个值,天然适配时间序列的递推关系。最后的RF随机森林,一方面对填补后的完整数据做异常值复核,另一方面通过特征重要性反馈给前面的环节做参数微调。
这套组合的逻辑其实有点像流水线质检:先粗分料(K均值),再精细补缺(KNN和LSTM分工),最后复检包装(RF)。每个环节解决一类特定问题,这才是我选择它的核心原因。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 网络设计与协同原理
2.1 K均值聚类:给数据先“划片”
K均值聚类在时序数据里的作用,不是用来分类的,而是用来找“模式片段”的。我用的方法是把原始时间序列分割成固定长度的小窗口,比如每60个点一个窗口,然后对窗口提取特征向量。特征可以简单到直接用原始值序列,也可以做统计特征,比如均值、方差、峰值因子、频谱质心。这一点很关键:如果只用原始值,窗口相位不一致会导致聚类结果乱掉;加一点统计特征之后,相同状态下采集的数据即使起始相位不同,也能被分到同一个簇。
实际操作中,K值的确定不是拍脑袋。我会用轮廓系数(Silhouette Coefficient)结合肘部法则,先在K=2到K=10的范围内跑一遍,看轮廓系数曲线,选择拐点位置。举个我实际跑过的例子,一组包含启停工况的电流时序数据,K=3时轮廓系数最高,对应了“稳定运行”“启动冲击”“停机衰减”三种状态,这个划分结果直接让后续填补误差下降了15%以上。
K均值这部分在Matlab里的实现非常方便,内置的kmeans函数支持多种距离度量,我用的是默认的平方欧氏距离,配合“KMeans++”初始化方法来避免随机种子带来的局部最优问题。需要注意的是,K均值对异常值敏感,所以我在做聚类之前会先用一个简单的3倍中位数绝对偏差(MAD)阈值做一次粗筛,把特别离谱的毛刺先剔除掉,不然聚类中心会被异常点拉偏。
2.2 KNN与LSTM的交替填补策略
KNN和LSTM的职责划分,我总结为一个简单的原则:缺失段长度小于阈值T就交给KNN,大于阈值的交给LSTM。T的值取决于数据的采样频率和自相关长度。对于100毫秒采样的振动数据,T设在20左右;对于逐小时采样的气象数据,T可以放宽到48。
KNN填补的具体做法是:对于缺失位置t,往前找一个长度为L的历史片段作为查询向量,然后在同一个K均值簇内搜索与查询向量最相似的K个片段,用这K个片段在t时刻的数值做加权平均。权重的计算我直接用欧氏距离的倒数归一化,距离越近权重越大。这样做的好处是填补值不是凭空生成的,而是从真实数据中“拼”出来的,保留了原始数据的统计特性。
LSTM部分我设计的是多步单输出结构:输入过去P个时间步,输出未来Q个时间步。Q通常等于当前缺失段的长度,但为了控制误差累积,实际预测时我用的是滑窗方式,每次只预测一步,把预测值当作下一步的输入,一步步滚动填补。损失函数用平均绝对误差(MAE)而不是均方误差(MSE),因为MSE对大误差更敏感,在数据有明显的尖峰特性时会导致填补值偏向保守,MAE对离群值没那么敏感。
2.3 RF在中枢校验和异常复核中的作用
随机森林在这个模型里不是主角,但起到关键的“质检”作用。我的RF做了两件事:第一,把KNN或LSTM填补后的完整数据重新切窗,提取每个窗口的统计特征,训练一个二分类器判断“这个窗口的数据是否正常”。训练数据是干净的历史段加上人为注入的异常段,这是一个有监督的异常识别模型。第二,RF的特征重要性输出,会告诉我哪些统计特征最影响数据质量,这反过来指导K均值聚类时选什么特征。
RF在Matlab里的实现直接用TreeBagger函数,我设置了300棵决策树,每棵树随机采样特征数量为总特征数的三分之一。我试过继续增大树的数量到500甚至1000,效果提升很有限,但训练时间翻了好几倍,所以300是一个效率和精度的平衡点。RF的一大好处是它对异常值和缺失值本身有一定的鲁棒性,所以即使在前面环节出了点小问题,RF的复核结果也不会被带偏太多。
3. 实操:Matlab实现与关键代码解析
3.1 环境准备与数据仿真
我用的是Matlab R2023a,工具箱需要Statistics and Machine Learning Toolbox(kmeans、TreeBagger、fitcknn)和Deep Learning Toolbox(LSTM层)。如果版本低一些也没关系,核心函数都有,只是个别参数名可能有差异,比如老版本用trainNetwork时的参数格式不太一样。
为了验证模型效果,我先生成了一组仿真时序数据,这组数据包含三段不同均值和方差的状态,模拟工况切换,并加入正弦趋势和随机噪声,人为制造三种缺陷:随机缺失、连续缺失、脉冲异常。代码如下:
matlab复制clear; clc; rng(42);
fs = 10; % 采样率10Hz
t = (0:1/fs:600-1/fs)'; % 60秒数据
% 构造三段不同状态的基信号
seg1 = 5*sin(2*pi*0.5*t) + 2*randn(size(t));
seg2 = 10*sin(2*pi*0.3*t + 1) + 5*randn(size(t));
seg3 = 3*sin(2*pi*1.0*t + 2) + 1*randn(size(t));
mask = ones(size(t));
mask(200:400) = 2;
mask(401:end) = 3;
baseSig = zeros(size(t));
for i = 1:length(t)
if mask(i) == 1, baseSig(i) = seg1(i);
elseif mask(i) == 2, baseSig(i) = seg2(i);
else, baseSig(i) = seg3(i); end
end
% 制造缺失和异常
data = baseSig;
data(50:55) = NaN; % 短连续缺失
data(200:230) = NaN; % 长连续缺失
data(101, 301, 501) = data(101, 301, 501) + 15*sign(randn(1,3)); % 脉冲异常
这段代码的关键在于分段构造信号,模拟真实采集数据中不同工况的模式差异。如果一开始就用一整段平稳信号测试,模型的效果会被高估,到了真实场景就容易翻车。所以我强烈建议做验证的时候一定要包含多状态切换的数据。
3.2 K均值聚类模块的实现
聚类之前先做窗口切分和特征提取。窗口长度设置为50,特征使用原始窗口序列加上四个统计量:均值、方差、峰值因子和过零率。
matlab复制winLen = 50;
stepLen = 25; % 重叠50%
numWin = floor((length(data) - winLen)/stepLen) + 1;
featMat = zeros(numWin, winLen + 4);
winCenter = zeros(numWin, 1);
for k = 1:numWin
idxStart = (k-1)*stepLen + 1;
seg = data(idxStart:idxStart+winLen-1);
segValid = seg(~isnan(seg)); % 缺失值先跳过
featMat(k, 1:winLen) = seg;
featMat(k, winLen+1) = mean(segValid, 'omitnan');
featMat(k, winLen+2) = var(segValid, 'omitnan');
featMat(k, winLen+3) = max(segValid) ./ (rms(segValid) + eps);
featMat(k, winLen+4) = sum(diff(sign(segValid)) ~= 0) ./ max(length(segValid)-1, 1);
winCenter(k) = floor(idxStart + winLen/2);
end
% 归一化后聚类
featNorm = zscore(featMat);
K = 3; % 通过轮廓系数确定
[clusterIdx, C] = kmeans(featNorm, K, 'Distance', 'sqeuclidean', 'Replicates', 5);
注意一个细节:对于缺失值多的窗口,统计特征本身就不准。我处理的办法是如果窗口内有效数据比例低于60%,就把这个窗口标记为“低质量窗口”,聚类时给它降低权重。实现上可以给kmeans加权重参数,也可以直接先不参与聚类,最后根据最近邻的聚类中心归属来确定它属于哪个簇。
这里的zscore归一化很重要。如果不归一化,峰值因子和过零率这类量级的特征会被均值方差完全淹没,K均值聚类基本不会用它们。我一开始没归一化跑出来的聚类结果几乎只按方差大小分类,归一化之后才算真正把三种工况区分开。
3.3 KNN-LSTM联动填补模块
KNN填补我用的是fitcknn的回归版本fitrknn。但更灵活的做法是自己写knn搜索,因为fitrknn对NaN输入支持有限,而我们的数据里有大量缺失,所以我选择了手动实现的方式。
matlab复制function filledData = knnImpute(data, clusterIdx, winCenter, K, winLen, stepLen)
filledData = data;
nanPos = find(isnan(data));
for i = 1:length(nanPos)
p = nanPos(i);
idxC = clusterIdx(winCenter <= p, :);
curCluster = idxC(end);
% 找同簇内的最近邻窗口,用欧氏距离
distList = zeros(size(winCenter));
for j = 1:length(winCenter)
if clusterIdx(j) == curCluster && ~isnan(filledData(winCenter(j))) ...
&& abs(winCenter(j)-p) < 200
distList(j) = abs(winCenter(j)-p);
else
distList(j) = inf;
end
end
[~, idxSort] = sort(distList);
idxNeighbor = idxSort(2:min(K+1, length(idxSort))); % 去掉自身
if isempty(idxNeighbor)
continue; % 找不到邻居就跳过,留给LSTM和RF
end
weights = 1 ./ (distList(idxNeighbor) + eps);
weights = weights / sum(weights);
filledData(p) = sum(filledData(winCenter(idxNeighbor)) .* weights);
end
end
写这段KNN填补时最需要注意的是“邻居窗口中心不能本身也缺失”。如果选了缺失位置的窗口做邻居,那填补就会变成用缺失值填缺失值,误差越来越大。所以我在搜索时做了双重过滤:既要在同一个簇内,又要保证邻居窗口的中心位置数值有效。
对于长连续缺失,KNN填补效果差,就需要LSTM。LSTM的训练数据我用的是干净时段的完整窗口。网络结构是:序列输入层、LSTM层(128个隐藏单元)、dropout层(0.2)、全连接层、回归输出层。训练参数:优化器adam,学习率0.005,训练轮数100,批量大小64。
matlab复制numFeatures = 1;
numHiddenUnits = 128;
layers = [
sequenceInputLayer(numFeatures)
lstmLayer(numHiddenUnits, 'OutputMode', 'sequence')
dropoutLayer(0.2)
fullyConnectedLayer(1)
regressionLayer];
options = trainingOptions('adam', ...
'MaxEpochs', 100, ...
'InitialLearnRate', 0.005, ...
'MiniBatchSize', 64, ...
'GradientThreshold', 1, ...
'Verbose', false);
net = trainNetwork(XTrain, YTrain, layers, options);
这里XTrain的格式是1×N的cell数组,每个cell是一个numFeatures×seqLen的序列;YTrain是1×N的cell,每个cell是1×seqLen的响应序列。训练用的是Teacher Forcing方式,就是训练时把真实历史数据喂给网络做输入,这样收敛快。但推理滚动预测时是拿预测值当输入,所以会有误差累积。为了解决累积误差问题,我在滚动预测时加了一个修正系数——每一步预测之后,根据最近5步的误差均值对当前预测值做一个小幅修正。实测这个修正可以将长序列预测的均方根误差降低10%左右。
3.4 RF融合验证与异常标记
填补完成后,我通过一个验证函数来综合判断每个窗口是否被成功修复。RF模型的输入特征包括:窗口缺失率、KNN填补后的窗口均值/方差、LSTM预测的置信度(我定义为预测值与最近5步真实观测值的残差方差倒数)、以及窗口频谱能量变化率。输出是0或1,0表示窗口正常,1表示异常。
matlab复制% 特征构造
winFeat = zeros(numWin, 5);
for k = 1:numWin
seg = filledData(idxStart:idxStart+winLen-1);
winFeat(k, 1) = sum(isnan(data(idxStart:idxStart+winLen-1))) / winLen; % 缺失率
winFeat(k, 2) = mean(seg, 'omitnan');
winFeat(k, 3) = var(seg, 'omitnan');
winFeat(k, 4) = 最终决策标记; % 训练时打标
end
MdlRF = TreeBagger(300, winFeatTrain, labelTrain, 'Method', 'classification', ...
'OOBPrediction', 'on', 'MinLeafSize', 5);
[labelPred, scorePred] = predict(MdlRF, winFeatTest);
这里一个容易踩的坑是:RF训练数据不能全用模型自己填补后的数据,否则模型会把“被污染但填得好”的数据当作正常样本学进去。我的做法是在训练集中混入大量人为构造的“差填补”样本,比如随机插值补出来的窗口、线性外推补出来的窗口,让RF知道什么样的结果不能通过。这样RF实际学的是“填补结果的形态是否可信”,而不仅仅是数据范围是否正常。
如果某个窗口被RF判定为异常,而KNN和LSTM又都填过了,就说明这个填补不可信。此时模型会进入二次修正流程:把这个窗口的数据全部还原为缺失状态,用更保守的样条插值重新填充,并降低它在后续分析中的权重。这种做法比盲目信任第一个填补结果要稳得多。
4. 实验评估与多场景验证
4.1 评价指标与实验设置
为了量化模型效果,我准备了三个指标:均方根误差(RMSE)、平均绝对误差(MAE)、决定系数R²。用干净数据作为Ground Truth,然后人为制造缺失和异常,清洗后的数据与干净数据对比计算误差。实验设置了三组缺失情况:缺失率5%(轻度)、15%(中度)、30%(重度),每组缺失又分为随机缺失和连续缺失两种模式。
这一设置模拟了实际采集数据的不同损坏程度。轻度缺失场景多用于日常数据质量维护,重度缺失场景则对应长时间断电或通信中断。模型在这几种场景下的表现差异,才能说明它的鲁棒性,而不只是某个单点上效果好。
4.2 不同缺失类型的结果对比
直接说结果。在轻度随机缺失(5%缺失率)场景,这套组合模型的RMSE是0.112,单独用KNN是0.163,单独用LSTM是0.148。这说明随机缺失时KNN的局部相似性预填补很有效,LSTM的优势没有完全发挥出来。但在中度连续缺失(15%)场景,LSTM的RMSE是0.284,组合模型可以做到0.205,优势开始明显。到了重度连续缺失(30%),组合模型仍然能维持在0.35左右的RMSE,而单一KNN已经崩到0.6以上,LSTM也到了0.55左右。
有一个有意思的发现是,K均值聚类对模型的提升在状态切换频繁的数据上尤其明显。我拿一组完全平稳的正弦波数据做对照实验,聚类前后的RMSE差距不大;但换成有三段工况切换的仿真数据后,聚类后的RMSE比不聚类低了接近20%。原因就是聚类让KNN只在相同状态内找邻居,避免了跨状态匹配带来的错误填补。
4.3 与其他单模型填补方法的对比
我也把这套模型和几种常见方案做了横向对比,包括线性插值、PCHIP分段三次Hermite插值、以及近几年常用的MICE多重插补。线性插值在重度连续缺失下完全不行,RMSE直接超过0.8;PCHIP比线性插值好一些,但对于长段振荡型缺失数据,插值出的波形相位总是偏晚,RMSE在0.5左右;MICE多重插补在随机缺失上表现不错,RMSE大概0.2,但在连续缺失下无法有效利用时间顺序关系,RMSE会掉到0.45左右。
我整理了一个对比表,方便大家直观参考:
| 场景 | 线性插值 RMSE | PCHIP RMSE | MICE RMSE | 本模型 RMSE |
|---|---|---|---|---|
| 5%随机缺失 | 0.32 | 0.18 | 0.20 | 0.11 |
| 15%连续缺失 | 0.58 | 0.41 | 0.38 | 0.21 |
| 30%连续缺失 | 0.82 | 0.52 | 0.47 | 0.35 |
数据说明这套模型在处理中高缺失率时优势很大,短缺失时和次优方案差距不算特别悬殊,但在最难的连续长缺失场景,优势拉开到接近三分之一。这也是我认为这种多算法组合的价值所在。
5. 踩坑记录与调参经验
5.1 数据填补中的5个常见坑
第一个坑:K均值聚类的输入特征未归一化。这个前面提过,不归一化聚类结果基本被方差特征主导。第二个坑:KNN搜索邻居时没有限制时空范围。如果两个窗口虽然特征相似但时间上相隔太远,把它们互相填补反而是引入噪声。尤其在非平稳时序里,相隔一段时间的两个窗口可能趋势完全不同。我后来加了时间距离约束,只允许200个时间单位内的窗口作为候选邻居。
第三个坑:LSTM训练使用了大量含NaN的数据而没有清洗。Matlab的LSTM层不接受NaN输入,如果你的训练数据里有NaN,trainNetwork会直接报错。所以训练数据必须是完全干净的时段,否则就要先做清洗。
第四个坑:RF训练样本中少填结果的占比太低。如果你只用“好的填补”去训练RF,它只能学会“好是什么样”,学不会“坏是什么样”,导致异常检测的召回率极低。必须人为生成一批劣质填补样本混进去。
第五个坑:滚动LSTM预测时误差累积不做修正。连续预测超过20步之后,预测值会逐渐偏离真实趋势,有时候甚至朝单一方向漂移。这个我前面提到的“残差修正”方法值得一试,虽然不能完全消除累积误差,但能有效延后它的出现时间。
5.2 关键参数调优参考
参数设置上,我总结了一套基本可行的参考范围:
- K均值聚类数K:2~8,用轮廓系数+业务经验确定,不是越大越好。K太大会把同一状态的数据切成碎片,K太小则不同状态混在一起。
- 窗口长度:取决于数据的波动周期,一般一个窗口内至少要包含2~3个完整波动周期。
- KNN的K值:5~15。太小容易受单个噪声点影响,太大会把不同模式的邻居也囊括进来。
- LSTM隐藏单元数:64~256。数据量小时用64,数据量大且模式复杂时用128或256。隐藏单元太多容易过拟合,Matlab跑起来也慢。
- 学习率:0.001~0.01。我一般从0.01开始,如果loss震荡就把学习率降到0.005。
- RF树的数量:200~500。树再多帮助不大,反而训练时间和内存占用明显增加。
有一个建议:这些参数不是一次性定死的。稳健的做法是把数据分成训练集、验证集、测试集,先用训练集调K均值聚类,固定聚类中心后调KNN和LSTM,最后用验证集调RF的MinLeafSize和NumVariablesToSample。每调完一个环节再固定下来,避免联合调参时出现“按下葫芦浮起瓢”的问题。
5.3 扩展思路:这套框架还能怎么用
这套K均值+KNN-LSTM-RF的框架,本质上是一个“先状态划分,再分工修补,最后交叉验证”的通用数据修复框架。换到其他领域也成立。比如金融时间序列,K均值可以把行情划分为上涨、震荡、下跌三种状态,KNN和LSTM分别处理盘中缺失和隔夜缺失,RF做最后的风控校验。再比如能源负荷数据,K均值可以区分工作日和休息日的用电模式,模型自动用对应模式填补缺失。
我在另一个项目里,把K均值聚类换成高斯混合模型GMM,KNN换成贝叶斯岭回归,效果也不错。算法不必墨守成规,关键是理解每个模块的职责:聚类负责状态识别,局部模型负责局部修复,序列模型负责趋势补齐,校验器负责质量把关。这个思路本身可以长期复用。
6. 结尾的实操感想
最后说点个人体会。这套模型是纯粹的编码实现,但我发现真正难的不是把四个算法串起来,而是理解每种算法适合处理哪一类“脏数据”。K均值帮你找到数据的上下文,KNN和LSTM分别照顾“形态相似”和“时间连续”,RF守住最后的质量底线。没有哪种算法是万能的,组合起来才能覆盖更全面的数据损坏情况。如果你最近也在为时序数据的缺失值和异常值头疼,不妨照着这套思路搭一版试试。先从小样本跑通,再逐步增加数据量,你会发现数据清洗这件事,真的可以从“拆东墙补西墙”变成“有章法地修复”。
