我最早把苍鹰优化算法(Northern Goshawk Optimization,NGO)和LSTM模型放在一起做时间序列预测,纯粹是因为手头有一批单列的水文观测数据,缺特征、缺辅助变量,唯一能指望的就是历史值本身。当时用常规的网格搜索调LSTM超参数,一个参数组合几十分钟,整批数据跑下来一整天都不够。后来转念一想,既然LSTM的超参数对预测精度影响这么大,不如让优化算法自己去寻优,这才把NGO引入到项目里。
这篇文章就围绕这套实践来写:先说清楚为什么选择NGO+LSTM这个组合,再拆解NGO的数学原理和位置更新逻辑,然后逐步落到数据切分、归一化、滑动窗口构造、优化流程设计、代码实现和实测结果上。整个内容适配单输入单输出的单列时间序列预测任务,数据格式就是一列数值,没有任何额外特征,不管是做水温预测、电力负荷预测、交通流量预测还是股价走势拟合,这套框架都能直接套用。
1. 为什么是NGO+LSTM:单列时间序列的预测困局与破局思路
单列时间序列的预测任务看起来简单,实际上非常尴尬。输入只有一列数,拿不到外部特征,也没有多变量交叉信息,模型只能从历史序列自身提取规律。LSTM的优势在于能记住长短期依赖,门控机制对序列数据非常友好。但LSTM不是一个即插即用的模型,它的预测性能对超参数极其敏感:隐藏层神经元数量、学习率、批大小、训练轮数、正则化系数,随便改动一个,结果就可能天差地别。
我用一组公开的月度电力负荷数据做过一个简单的实验。固定LSTM架构为单层64个神经元,学习率分别设成0.001和0.005,批大小分别是32和64,结果测试集的RMSE差距能到20%以上。这说明什么?超参数选不好,LSTM的时序建模能力根本发挥不出来。但超参数搜索空间很大,网格搜索的时间成本又过高,遗传算法和粒子群算法收敛速度也不稳定,这才引出了NGO。
NGO是2022年前后提出的一种元启发式优化算法,核心思想模拟苍鹰捕猎的过程,分为全局搜索和局部开发两个阶段,位置更新规则简单、参数少、收敛速度快。相比粒子群算法,NGO的逃逸机制能让种群跳出局部最优;相比遗传算法,NGO不需要设置交叉率和变异率,调参负担小很多。因此我决定用NGO来搜索LSTM的最优超参数组合,本质上把"超参数选择"问题转化成了"连续空间寻优"问题。
这套方案的破局之处在于:LSTM负责时序建模,NGO负责自动寻优,两者分工明确。我只需要定义好搜索空间的上下界和适应度函数,NGO就能在十几次迭代里找到一个相当可用的参数组合,完全不需要手工反复尝试,而且每次实验都有比较稳定的复现结果。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. NGO算法核心机制拆解:捕猎逃逸与两阶段位置更新
2.1 第一阶段:全局侦察与猎物识别
NGO的第一阶段模拟苍鹰在高空发现猎物并快速接近的过程。在算法上,这一阶段负责全局搜索,帮助种群探索更广阔的解空间。具体公式如下:
初始化阶段,种群规模设为N,每个个体代表一组LSTM超参数,维度为D。第i个个体在第t次迭代的位置记为X_i(t)。在第一阶段,算法会在当前种群中随机选取一个个体作为"猎物",记为X_p,选择公式是:
X_p = X_k,其中k是从[1, N]中随机选取的下标,且k ≠ i。
然后,基于猎物位置更新当前个体的位置:
X_i_new(t+1) = X_i(t) + r * (X_p - I * X_i(t))
其中r是[0,1]之间的随机数,I是随机取1或2的整数。I的作用是让个体在追踪猎物时产生步长差异,避免种群同质化。更新后判断:如果新位置的适应度比原位置更好,就替换;否则保留原位置。这里用的是贪心策略,保证整个种群一直朝适应度更优的方向移动。
2.2 第二阶段:局部攻击与精确开发
第二阶段模拟苍鹰猎物已经暴露、开始低空追击和精确捕获的过程。这一阶段更侧重局部搜索,也就是在当前最优解的附近做精细调整。这一阶段的位置更新公式先计算猎物逃走后的位置范围,然后让个体在最优值附近变化。
假设当前全局最优位置为X_b,则第二阶段的位置更新为:
X_i_new(t+1) = X_i(t) + r * (X_b - I * X_i(t)) * Levy
这里的Levy是莱维飞行因子,本质上是带有重尾分布的随机步长。为什么要引入Levy飞行?因为纯随机游走很容易让个体被困在局部最优附近,而莱维飞行的长尾跳跃可以让个体偶尔跳出一个较大的步长,重新获得探索能力。在具体实现中,可以用 Mantegna 算法来生成Levy步长。
在第二阶段的末尾,同样执行贪心判断,保留适应度更好的位置。整个NGO的迭代过程就是把第一阶段和第二阶段交替执行,直到达到预设的最大迭代次数。
2.3 逃逸概率p的作用与收敛性之间的关系
NGO和许多群智能算法不太一样的地方在于,它引入了一个逃逸概率p,默认值一般取0.1。每当进入第二阶段之前,算法会生成一个[0,1]的随机数,如果这个随机数小于p,就把猎物位置重新随机化一次。这个机制模拟的是猎物在被攻击过程中突然逃走、苍鹰需要重新锁定的行为。
逃逸概率的引入有一个非常实际的好处:种群不会过早收敛。我测试过p=0和p=0.1两种情况,p=0时算法在10次迭代内基本就聚集到了一个点,后续的迭代完全失去探索能力;p=0.1时,会有约10%的个体在每次迭代中被强制"重置视野",整个种群的多样性维持得更好。
当然,p不是越大越好。p太大本质上变成了随机重启,收敛速度急剧下降。建议在0.05到0.15之间调整,我用0.1作为默认值,匹配大多数时间序列预测任务都表现稳定。
3. 单输入单输出预测模型的数据处理与样本构造
3.1 数据归一化:不能在全局混着用
做LSTM时间序列预测,归一化是第一步,但这一步最容易埋坑。很多人直接把整个序列丢给MinMaxScaler,先归一化再切分训练集和测试集。这种做法在回归预测问题上是错误的:归一化的均值和最大值最小值如果包含了未来数据的信息,就等同于把未来的统计信息泄露到了训练阶段,测试结果会虚高。
正确的做法是先按时间顺序切分原始数据,例如前80%作为训练集,后20%作为测试集。然后在训练集上拟合MinMaxScaler,用这个已经拟合好的scaler分别转换训练集和测试集。验证集的归一化同样使用训练集上拟合的scaler,不能用验证集自身重新计算。
在实际的NGO优化过程中,还有一层更隐蔽的泄漏问题。NGO要在验证集上评估每一组超参数的适应度,如果每一轮优化都用不同的scaler重新计算验证数据,那不同个体的评估结果就没有可比性。因此整个NGO优化过程中,数据的缩放参数必须固定,从优化开始到结束只用训练集拟合一次scaler。
3.2 滑动窗口法构造输入输出样本
单输入单输出预测的样本构造必须用滑动窗口。设定一个窗口长度time_step,用前time_step个时刻的观测值预测第time_step+1个时刻的值。比如time_step=12,那么输入形状是(样本数, 12, 1),输出形状是(样本数, 1)。
窗口长度的选择对预测结果有直接影响,这个参数甚至可以和LSTM超参数一起交给NGO优化。一般来说,窗口太短(比如2~3步)模型看不到足够的长期趋势;窗口太长(比如远超一个周期)会把噪声也塞进输入。涉及周期数据时,time_step至少要覆盖一个完整周期,例如日流量数据按周为周期,time_step至少要取7。
我在实际数据上跑过一组对比,窗口长度取12和取24,在月度数据上RMSE差异不大,但在日度数据上取24明显优于取12。这说明窗口长度和数据本身的采样频率强相关,最稳妥的做法就是把它设置为NGO的一个待优化维度,让算法自己找合适的值。
3.3 训练集、验证集和测试集的三段式切分
在NGO优化LSTM超参数时,数据的切分要比普通训练更精细。我建议采用训练集、验证集、测试集三段式切分。形态如下:
- 训练集占60%,用于LSTM的实际训练;
- 验证集占20%,用于NGO中每组超参数的适应度评估;
- 测试集占20%,在优化结束后仅评估一次,用于最终效果报告。
为什么要单独的验证集?因为NGO寻优依据的是验证集上的误差,如果直接用测试集做适应度函数,优化过程会把测试集的信息"记住",最终结果会有严重的过拟合倾向。三段式切分能隔离NGO优化和最终评估,让结果更可信。
在切分时还要注意,时间序列数据绝对不能随机打乱,必须按时间顺序依次取前段、中段和后段。这一点与一般机器学习任务有本质区别,因为LSTM依赖样本之间的时间连续性和因果顺序,打乱样本等于破坏了序列的时序状态。
4. NGO优化LSTM的完整流程设计与适应度函数
4.1 优化变量的编码方式与搜索空间
使用NGO优化LSTM,首先要把需要优化的超参数编码成个体的位置向量。我实际编码的维度一般包括:
- 隐藏层神经元数量(取值范围:16到128,步长为1的整数)
- 学习率(取值范围:0.0001到0.01,对数尺度)
- LSTM层数(取值范围:1到3,整数)
- 批大小(取值范围:16到64,整数)
- 训练轮数(取值范围:30到150,整数)
- 滑动窗口长度(取值范围:6到30,整数)
NGO本身的更新公式是连续的,但LSTM超参数大部分是离散整数,这里需要做一步取整处理。我的做法是在NGO更新完位置之后统一取整,再交给LSTM训练。学习率这类连续参数则直接使用浮点数,不取整。
搜索空间设置要给出合理的上下界,这一步很关键。比如神经元的取值范围设到256甚至512,训练时间会成倍增加,完全没有必要,因为单列序列数据的复杂度通常有限,128个神经元已经能覆盖大部分场景。学习率的设置也是,范围太大会导致LSTM训练不收敛,太小则收敛太慢,NGO迭代几十轮都优化不出来。
4.2 适应度函数的选择:验证集RMSE还是MAPE?
适应度函数是NGO优化的唯一评价指标,它必须能真实反映一组超参数的好坏。我最常用的是验证集上的均方根误差(RMSE),因为它对误差的平方加权,能放大较大偏差,并且量纲和原始数据一致,方便观察。在某些业务场景中,如果更关注预测偏差的百分比,可以使用平均绝对百分误(MAPE)。
这里有一个很重要的经验:NGO适应度函数评估的是"验证集RMSE",LSTM每个个体都需要完整训练一次,计算量相当大。因此适应度函数里不能做过多的指标计算,每多一次前向推理都会拖慢整体优化速度。我一般只计算RMSE,不做复杂的多目标加权。如果确实需要考虑多个指标,建议先对每个指标做归一化再加权,否则量纲差异会主导适应度排序。
在具体实现时还有一个细节:LSTM训练是随机初始化的,同一组超参数每次训练出的RMSE会有波动。我建议每轮评估时固定随机种子(随机种子设为常数,比如42),这样同一组超参数的评价结果可复现,NGO的优化轨迹也比较平滑。不固定随机种子的话,适应度波动会把NGO的收敛过程彻底扰乱。
4.3 整体优化流程:从初始化到迭代收敛
NGO优化LSTM的整体流程可以总结为下面几步:
- 数据预处理:读取单列时间序列,按时间顺序切分成训练集、验证集、测试集;在训练集上拟合并固化scaler的归一化参数。
- 初始化NGO种群:随机生成N个个体,每个个体的位置对应一组LSTM超参数。
- 对每个个体:解码超参数,构造滑动窗口数据,训练LSTM模型,在验证集上计算RMSE作为适应度。
- 进入NGO主循环,每个迭代执行第一阶段全局搜索和第二阶段局部开发,然后更新种群位置。
- 贪心原则:每次更新后代个体在验证集上的适应度优于原个体,则替换,否则保留。
- 达到最大迭代次数后,取种群中适应度最优的个体,解码成最终的LSTM超参数。
- 用最优超参数在"训练集+验证集"的合并数据上重新训练LSTM,最后在测试集上评估一次,输出预测结果。
第7步容易被忽视但很重要。NGO寻优时用的是验证集,最终部署时应该把验证集也并入训练数据,用全部可用历史数据重新训练LSTM,这样模型能多学一点信息,测试集上的表现也通常略好于只用训练集训练的结果。
5. 核心代码实现:NGO类、LSTM训练与主循环
5.1 NGO优化器的Python实现
下面这版NGO实现是我实际使用中整理出来的精简版本,将每个个体的位置、适应度和更新逻辑封装在一个类中,方便直接复用。
python复制import numpy as np
class NGO:
def __init__(self, dim, lb, ub, pop_size, max_iter, fitness_func):
self.dim = dim
self.lb = np.array(lb)
self.ub = np.array(ub)
self.pop_size = pop_size
self.max_iter = max_iter
self.fitness_func = fitness_func
self.p = 0.1
# 随机初始化种群
self.positions = np.random.uniform(lb, ub, (pop_size, dim))
self.fitness = np.full(pop_size, np.inf)
self.best_pos = None
self.best_fit = np.inf
def levy_flight(self):
beta = 1.5
sigma = (np.math.gamma(1 + beta) * np.sin(np.pi * beta / 2) /
(np.math.gamma((1 + beta) / 2) * beta * 2 ** ((beta - 1) / 2))) ** (1 / beta)
u = np.random.normal(0, sigma)
v = np.random.normal(0, 1)
return u / (np.abs(v) ** (1 / beta))
def clip(self, positions):
return np.clip(positions, self.lb, self.ub)
def optimize(self):
# 初始化适应度
for i in range(self.pop_size):
self.fitness[i] = self.fitness_func(self.positions[i])
idx = np.argmin(self.fitness)
self.best_pos = self.positions[idx].copy()
self.best_fit = self.fitness[idx]
for t in range(self.max_iter):
for i in range(self.pop_size):
# 第一阶段:全局搜索
k = np.random.choice([j for j in range(self.pop_size) if j != i])
I = np.random.choice([1, 2])
r = np.random.rand(self.dim)
new_pos = self.positions[i] + r * (self.positions[k] - I * self.positions[i])
new_pos = self.clip(new_pos)
new_fit = self.fitness_func(new_pos)
if new_fit < self.fitness[i]:
self.positions[i] = new_pos
self.fitness[i] = new_fit
# 第二阶段:局部开发
r2 = np.random.rand(self.dim)
I2 = np.random.choice([1, 2])
levy = self.levy_flight()
new_pos2 = self.positions[i] + r2 * (self.best_pos - I2 * self.positions[i]) * levy
new_pos2 = self.clip(new_pos2)
# 逃逸概率
if np.random.rand() < self.p:
# 随机跳跃到搜索空间中的任意位置
new_pos2 = np.random.uniform(self.lb, self.ub, self.dim)
new_fit2 = self.fitness_func(new_pos2)
if new_fit2 < self.fitness[i]:
self.positions[i] = new_pos2
self.fitness[i] = new_fit2
# 更新全局最优
idx = np.argmin(self.fitness)
if self.fitness[idx] < self.best_fit:
self.best_fit = self.fitness[idx]
self.best_pos = self.positions[idx].copy()
return self.best_pos, self.best_fit
这段代码有几个需要注意的细节。首先,每一代更新完所有个体之后再去更新全局最优值,而不是在个体循环内部反复更新,因为best_pos会在同一轮迭代中被很多个体同时引用,频繁更新会让搜索轨迹变得不稳定。其次,逃逸概率触发后采用随机重置,而不是在原位置附近扰动,这样才能模拟"猎物彻底逃走"的语义。
5.2 LSTM超参数解码与模型训练封装
在NGO评估每一个个体时,需要把个体的位置向量解码成LSTM模型的超参数,并完成训练、验证和RMSE计算。下面是核心的decode和fit函数:
python复制import numpy as np
from tensorflow.keras.models import Sequential
from tensorflow.keras.layers import LSTM, Dense, Dropout
from tensorflow.keras.optimizers import Adam
from sklearn.metrics import mean_squared_error
from sklearn.preprocessing import MinMaxScaler
def decode_hyperparams(pos):
# 将NGO的位置向量解码为LSTM超参数字典
hidden_units = int(np.clip(round(pos[0]), 16, 128))
learning_rate = float(np.clip(pos[1], 1e-4, 1e-2))
num_layers = int(np.clip(round(pos[2]), 1, 3))
batch_size = int(np.clip(round(pos[3]), 16, 64))
epochs = int(np.clip(round(pos[4]), 30, 150))
time_step = int(np.clip(round(pos[5]), 6, 30))
return {
"hidden_units": hidden_units,
"learning_rate": learning_rate,
"num_layers": num_layers,
"batch_size": batch_size,
"epochs": epochs,
"time_step": time_step,
}
def create_dataset(data, time_step):
X, y = [], []
for i in range(len(data) - time_step):
X.append(data[i:i + time_step])
y.append(data[i + time_step])
return np.array(X), np.array(y)
def build_lstm_model(hidden_units, num_layers, learning_rate):
model = Sequential()
for i in range(num_layers):
if i == num_layers - 1:
model.add(LSTM(hidden_units, return_sequences=False))
else:
model.add(LSTM(hidden_units, return_sequences=True))
model.add(Dropout(0.2))
model.add(Dense(1))
model.compile(optimizer=Adam(learning_rate=learning_rate), loss="mse")
return model
def evaluate_hyperparams(pos, train_data, val_data, train_scaler):
hp = decode_hyperparams(pos)
time_step = hp["time_step"]
X_train, y_train = create_dataset(train_data, time_step)
X_val, y_val = create_dataset(val_data, time_step)
model = build_lstm_model(hp["hidden_units"], hp["num_layers"], hp["learning_rate"])
np.random.seed(42)
history = model.fit(
X_train, y_train,
epochs=hp["epochs"],
batch_size=hp["batch_size"],
validation_data=(X_val, y_val),
verbose=0,
)
val_pred = model.predict(X_val, verbose=0)
# 反归一化,将预测值和真实值恢复到原始尺度
y_val_inv = train_scaler.inverse_transform(y_val.reshape(-1, 1))
val_pred_inv = train_scaler.inverse_transform(val_pred.reshape(-1, 1))
rmse = np.sqrt(mean_squared_error(y_val_inv, val_pred_inv))
return rmse
这里有一个值得强调的细节:验证集的归一化。在evaluate_hyperparams中,训练数据和验证数据传入的都是原始值,但我在调用前必须保证train_scaler是在纯训练数据上拟合的。进入create_dataset之前,train_data和val_data都是已经归一化过的值,因为scaler.transform之后的数组才能同时保证数据分布一致和评价基准一致。
5.3 完整主流程示例
最后贴一个完整的主流程示例,把数据读取、初始化、NGO优化、最终训练和测试集预测串起来。这个示例使用的是单列CSV数据,其中第0列为时间,第1列为观测值。
python复制import pandas as pd
from sklearn.preprocessing import MinMaxScaler
# 1. 读取数据
df = pd.read_csv("time_series_data.csv")
data = df.iloc[:, 1].values.reshape(-1, 1).astype(float)
# 2. 切分训练集、验证集、测试集(6:2:2)
train_end = int(len(data) * 0.6)
val_end = int(len(data) * 0.8)
train_data_raw = data[:train_end]
val_data_raw = data[train_end:val_end]
test_data_raw = data[val_end:]
# 3. 归一化
scaler = MinMaxScaler(feature_range=(0, 1))
train_data_scaled = scaler.fit_transform(train_data_raw)
val_data_scaled = scaler.transform(val_data_raw)
test_data_scaled = scaler.transform(test_data_raw)
# 4. 定义维度
dim = 6
lb = [16, 0.0001, 1, 16, 30, 6]
ub = [128, 0.01, 3, 64, 150, 30]
# 5. 创建适配器:把原始参数传给evaluate_hyperparams
def fitness_fn(pos):
return evaluate_hyperparams(pos, train_data_scaled, val_data_scaled, scaler)
# 6. 运行NGO优化
ngo = NGO(dim=dim, lb=lb, ub=ub, pop_size=8, max_iter=15, fitness_func=fitness_fn)
best_pos, best_fit = ngo.optimize()
print("最优超参数:", decode_hyperparams(best_pos))
print("最优验证集RMSE:", best_fit)
# 7. 用最优超参数在训练+验证集上重新训练
best_hp = decode_hyperparams(best_pos)
combine_data = np.concatenate([train_data_scaled, val_data_scaled], axis=0)
X_combine, y_combine = create_dataset(combine_data, best_hp["time_step"])
final_model = build_lstm_model(best_hp["hidden_units"], best_hp["num_layers"], best_hp["learning_rate"])
final_model.fit(X_combine, y_combine, epochs=best_hp["epochs"], batch_size=best_hp["batch_size"], verbose=0)
# 8. 测试集评估
X_test, y_test = create_dataset(test_data_scaled, best_hp["time_step"])
test_pred = final_model.predict(X_test, verbose=0)
test_pred_inv = scaler.inverse_transform(test_pred.reshape(-1, 1))
y_test_inv = scaler.inverse_transform(y_test.reshape(-1, 1))
test_rmse = np.sqrt(mean_squared_error(y_test_inv, test_pred_inv))
print("测试集RMSE:", test_rmse)
运行这段代码时,要注意LSTM在CPU上训练会比较慢,建议在NGO的pop_size和max_iter上先做小规模验证,比如pop_size=4、max_iter=5,确认整个流程没问题后再增加迭代次数。
6. 实测过程中的避坑经验与方法选择心得
6.1 归一化后验证集RMSE看起来很小,反归一化后却很大
这个问题我在早期实验中经常遇到。原因并不复杂:LSTM在归一化后的尺度上训练,默认使用均方误差作为损失函数,相当于对归一化后的误差进行优化。如果验证集的真实值整体偏小,归一化后的误差天然看起来小,但反归一化回原始尺度后,绝对误差会暴露出来。因此适应度函数里必须做反归一化后再计算RMSE,不能直接使用归一化尺度上的误差。
如果你用的是MinMaxScaler,反归一化公式是:
原始值 = 归一化值 * (data_max - data_min) + data_min
data_max和data_min是训练集的最小值和最大值。只要scaler是从训练集上拟合的,这个转换就是合法的,千万不要用整个数据的最大值和最小值去反归一化,否则测试集的信息就等于提前参与了评估。
6.2 批量大小和训练轮数:优化维度里最容易踩的连续性陷阱
NGO的位置更新是连续的操作,但批量大小、训练轮数这些参数本质上是整数。直接round取整一般没问题,但要注意round(7.5)在Python里会得到8,因为Python的round采用银行家舍入。在超参数场景里,round(7.5)到底取7还是8对模型影响不大,真正需要警惕的是取整后的值不能超过上界或者低于下界,NGO的clip函数要放在取整之后执行,顺序颠倒在极端情况下会产生数组越界或维度不匹配的错误。
还有一点:优化维度中是否包含训练轮数需要谨慎。训练轮数本质上是一个"计算量"参数,优化它会显著延长整体运行时间。如果单组LSTM训练本来就需要较长时间,建议把训练轮数固定为一个经验值(比如100),只优化隐藏层神经元数、学习率、批大小和窗口长度这四个核心参数。这样计算量直接下降一个量级,NGO的收敛效果也不会损失太多。
6.3 提前终止是否应该用在NGO适应度评估里
我在一开始使用EarlyStopping回调,当验证集loss连续5轮不下降就提前终止训练。后来发现这个策略在NGO优化场景下非常不稳定。原因是EarlyStopping在验证集上做监控,而NGO的适应度函数本来就要用验证集评估,相当于在同一个数据上做了一层额外的早停判断,导致某些个体训练轮数明显不足,适应度偏低,误导NGO的搜索方向。
更稳妥做法是关闭EarlyStopping,固定训练轮数。因为NGO优化的是超参数,每个个体的训练轮数已经在超参数中显式给出了,再做早停只会引入额外的不确定性。我在关闭EarlyStopping后,NGO的收敛曲线明显平滑,最终测试集的结果也更稳定。
6.4 多起点NGO:一种不用改算法就能提高稳定性的技巧
如果条件允许,我最推荐的做法是做3到5次独立运行NGO,每次使用不同的随机种子初始化种群,然后取多次运行中验证集RMSE最小的那组超参数作为最终结果。这个方法没有增加算法本身的复杂度,但能有效避免单次运行因初始种群位置不佳而陷入局部最优的问题。
我在这套水文数据预测项目里试过单次运行和5次运行取最优两种情况:单次运行的测试集RMSE波动范围相对较宽,5次运行取最优的RMSE稳定性提升明显,整体最优结果也比单次运行的最好结果好一些。NGO本身收敛速度快,5次小规模运行的时间成本完全可以接受。
6.5 全局随机种子与TensorFlow环境的配合
最后特别提醒一点:固定随机种子在TensorFlow中不能像传统sklearn那样简单设一个np.random.seed就完事。在Keras模型训练中需要同时设置Python随机种子、NumPy随机种子和TensorFlow随机种子,否则模型初始化的权重仍然会有随机性,同一组超参数每次评估的结果仍会波动。
python复制import os
import random
import numpy as np
import tensorflow as tf
os.environ["PYTHONHASHSEED"] = "0"
random.seed(42)
np.random.seed(42)
tf.random.set_seed(42)
这段设置放在程序最前面,可以保证在同样硬件和库版本环境下,同一组超参数评估结果基本一致。需要承认的是,在某些GPU环境或TensorFlow 2.5以上版本中,即使设了种子,算子级别的微小随机仍然无法完全消除,但在工程实践中,固定种子的波动已经从"不可接受"降到了"可以忽略"的水平。
7. NGO+LSTM这套组合的适用边界与后续扩展思路
用NGO去优化LSTM超参数,这套方法并不是所有时间序列问题的万能药。根据我这几个月的使用体会,它的优势区间是单列或少量列时间序列、数据量在几千条到几万条、需要批量试验不同超参数组合的场景。如果数据量特别大(比如百万级序列),单次LSTM训练时间已经很长,这时候跑NGO的代价会急剧上升,反而建议用固定架构训练或者改用更轻量的时序模型。
后续扩展有一件特别值得做的事:把NGO换掉,测试其他群智能算法的对比效果。比如可以用粒子群算法、灰狼优化算法、鲸鱼优化算法作为对照组,各自跑相同的搜索空间和相同迭代次数,在验证集RMSE上做对比。这类对比实验的结果放在论文里非常有说服力,放在工程报告里也能量化展示NGO的收敛优势。
另外,这套NGO+LSTM框架的代码是可以直接平移到多输入单输出场景的。只要把create_dataset函数中的输入从单列改成多列,比如加上天气温度、湿度、节假日标记等外生变量,LSTM输入维度就能自然扩展。优化变量的维度不需要变化,NGO只优化超参数,特征扩展完全发生在数据处理层,整个优化框架不用改一行代码。
我在实际项目中还尝试过用NGO同时优化数据预处理阶段的参数,比如滑动窗口长度、差分阶数、平滑系数,效果也不错。这种做法把数据处理和模型训练放在同一个优化闭环里,搜索空间更大,效果提升也更明显,代价是每次评估的时间进一步增加。建议先把模型超参数这一层优化到位,再考虑往上扩展。
