做新能源并网优化的人,几乎都躲不开一个问题:全年的风、光数据随机性太强,直接扔给优化模型,计算量根本扛不住;可如果只取几个“平均日”,又会把极端天气和季节差异全抹掉。Copula + KMeans 的组合,正好是解决这类问题的经典思路——先用 Copula 把风速和光照之间的相关性“学”出来,生成成千上万条接近真实的场景,再用 KMeans 把这些场景削成少数的典型代表,每类带一个概率,拿去做随机规划、容量配置、调度优化都好用。
这篇文章就围绕“春夏秋冬四季的风光场景生成与聚类削减”这套流程来写。内容不绕弯子,直接讲清楚为什么用 Copula、为什么聚类选 KMeans、四季差异怎么体现在参数里,以及完整的 Matlab 代码怎么组织。适合正在做风光出力场景分析、微电网优化、储能容量配置的研究生和工程师,哪怕你之前没接触过 Copula,看完也能把代码跑起来。
1. 为什么要做场景生成和聚类削减
1.1 随机规划里的“场景”到底是什么
做风光并网优化的人应该都有印象,随机规划里最核心的输入就是“场景集”。所谓场景,就是一组带概率的风速、光照或出力曲线,用来表示未来可能出现的典型运行状态。理想情况下,我们当然希望把一整年的时序数据全部灌进优化模型,但这样模型规模会爆炸,尤其涉及整数变量时,求解器直接卡死。
所以工程上通用的做法是:先生成足够多的初始场景,尽量还原真实随机性,然后再用削减算法去掉冗余场景,保留少数有代表性的典型场景。生成负责“像”,削减负责“精”,两者配合,场景集才能在可控计算量下保持统计特征。
1.2 四季风光数据为什么不能混在一起建模
很多人一开始图省事,把全年数据放一起拟合分布,结果发现春季和冬季的风速分布差异极大,强行用一个参数集拟合,出来的场景既不“春”也不“冬”,两头不靠。
风速在冬季通常更强,形状参数和尺度参数都明显变化;光照则受日照时长和太阳高度角影响,夏季辐射强、冬季弱。如果场景生成不区分季节,聚类削减出来的典型场景会丢失季节边界,后续优化结果自然偏保守或偏冒进。所以建议严格按春夏秋冬四个季节分别建模,每个季节单独估计边际分布参数、Copula 相关参数,再各自生成和削减。这也是这个项目标题里把“四季”单独拎出来的原因。
1.3 方法选型的逻辑:Copula 负责“像”,KMeans 负责“精简”
为什么风速和光照的相关性要用 Copula 而不是直接用联合正态分布?因为风速和光照的边际分布本来就不是正态的,风速一般用 Weibull 拟合,光照用 Beta 拟合。如果强行假设二维正态,边际分布对不上,相关性结构也会失真。
Copula 的核心思想是把“边际分布”和“相关结构”分开建模:先用各自分布描述单变量特征,再用 Copula 描述变量之间的依赖关系。这就像分别选好两件衣服,再决定怎么搭配,而不是笼统地买一套“均码套装”。
场景削减方面,KMeans 是最适合当“第一刀”的算法。它计算快、实现简单、Matlab 自带函数,能从几千条原始场景里快速聚出几个稳定类别。虽然后向消去法在理论上能保证场景概率距离最优,但计算复杂度高,初始场景一多就非常慢。KMeans 做初步削减,再从簇内做精细化处理,是工程上很顺手的组合。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 核心数学原理与建模细节
2.1 风速与光照的边际分布建模
风速的常用模型是两参数 Weibull 分布,概率密度函数为:
f(v) = (k/c) * (v/c)^(k-1) * exp(-(v/c)^k)
其中 k 是形状参数,控制分布形态;c 是尺度参数,控制整体大小。拟合时可以直接用 Matlab 的 fitdist(hist_wind, 'wbl'),从历史风速数据中得到 k 和 c。
光照强度折算成 0 到 1 的“光照比例”后,常用 Beta 分布描述:
f(x) = (x^(a-1) * (1-x)^(b-1)) / B(a, b)
a 和 b 控制分布形态,可以通过历史数据的均值和方差反推,公式是:
a = m * (m * (1-m) / s^2 - 1)
b = (1-m) * (m * (1-m) / s^2 - 1)
其中 m 是样本均值,s^2 是样本方差。
注意:Beta 分布的取值区间是 (0,1),不包含 0。但光伏夜间出力就是 0,所以不能把全天 24 小时的光照数据直接塞进 Beta 分布。建议只对白天时段建模,或者把夜间处理成固定 0 值,再把白天比例映射到 (0,1] 区间。
2.2 四季参数差异和处理方式
下面这组参数是我在示意案例里常用的初始值,能体现出季节差异。实际项目一定要用当地历史数据重新拟合,千万别直接抄。
| 季节 | Weibull 形状 k | Weibull 尺度 c | Beta a | Beta b | 高斯 Copula rho |
|---|---|---|---|---|---|
| 春季 | 2.0 | 6.0 | 2.5 | 2.5 | 0.30 |
| 夏季 | 2.0 | 5.2 | 4.0 | 2.2 | 0.10 |
| 秋季 | 2.1 | 6.2 | 2.2 | 2.8 | 0.25 |
| 冬季 | 2.4 | 7.5 | 1.6 | 3.4 | 0.20 |
冬季风速整体偏大(c 大),夏季风速平稳(c 小);夏季光照明显偏强(Beta 分布 a/b 比值大),冬季光照弱。相关系数 rho 也随季节变化,夏季光伏强而风电可能不强,二者相关性低,冬季同理。把季节差异拆到参数上,后续生成出来的场景就不会“四季如春”。
2.3 Copula 相关结构建模
Copula 的种类很多,高斯 Copula、t Copula、Clayton、Gumbel、Frank 都常用。对于风电-光伏联合场景,高斯 Copula 是最容易上手、也是默认选择,因为它只需要一个相关矩阵,参数估计稳定。
如果只有两个变量(风速、光照),高斯 Copula 的参数就是一个相关系数 rho。实际估计时,可以把历史风速和光照先变换成均匀分布 U,再调用 copulafit('Gaussian', U) 得到 rho。变换这一步很关键,不能直接把原始风速和光照丢进 copulafit,因为 Copula 的输入必须是 (0,1) 区间上的均匀分布样本。
具体做法是:用经验累计分布函数做变换。对 n 个历史样本,先对风速排序得到秩,然后 U = rank / (n+1),这样 U 能均匀分布在 (0,1) 且不会出现 0 或 1,避免边界问题。
另外也可以用 Kendall 秩相关系数 tau 快速估算 rho,公式是:
rho = sin(pi * tau / 2)
这个公式对于高斯 Copula 是精确的,所以在代码里可以先用它初始化 rho,再用 MLE 精修。
2.4 联合抽样与逆变换
生成场景的时候,核心流程是先在 Copula 空间抽均匀样本,再用逆变换映射回物理变量空间。具体分四步:
- 用
copularnd('Gaussian', rho, N)生成 N 组 (u1, u2),两组变量都服从 U(0,1),而且已经带上了由 rho 决定的相依结构。 - 对 u1 做 Weibull 逆累积分布变换:
v = wblinv(u1, c, k),得到风速样本。 - 对 u2 做 Beta 逆累积分布变换:
s = betainv(u2, a, b),得到光照比例样本。 - 再用风力机功率曲线、光伏阵列模型把风速和光照比例转成出力。
这里的底层原理可以理解成:Copula 保证了“排序上的相关性”,而逆变换把均匀分布映射回真实物理分布,同时不改变这个相关性。整个过程比直接对原始数据抽样要准确得多。
2.5 KMeans 聚类的原理与 K 值选择
KMeans 本质上是在最小化簇内欧氏距离平方和,也就是让每个样本到它所属簇中心的距离尽量小。Matlab 的 kmeans 函数默认使用 k-means++ 初始化,并可以通过 Replicates 参数多次运行、取最优结果来避免局部最优。
但 KMeans 对特征量纲非常敏感。风速可能是 0 到 12 m/s,光照比例是 0 到 1,如果直接拼在一起聚类,风速会主导整个距离计算。所以聚类前必须标准化,用 zscore 把每个特征变成均值为 0、方差为 1,再送入 KMeans。
选择 K 值最常用的两个工具是肘部法则和轮廓系数。肘部法则的做法是:对 K=1 到 10 分别跑 KMeans,记录簇内误差平方和 SSE,画出来找拐点。轮廓系数则直接看每个样本聚类得是否“内聚且分离”,数值越接近 1 越好。
3. Matlab 完整实现与代码解析
3.1 整体代码结构
我建议把代码拆成三层:参数定义层、场景生成层、聚类削减层。最外层脚本负责四个季节的循环,这样结构清楚,后面调参也方便。
matlab复制% 主脚本:四季风光场景生成与聚类削减
clear; clc; rng(42);
N = 5000; % 每个季节生成的初始场景数
K = 5; % 每个季节保留的典型场景数
% 季节参数定义
sp.spring.wind_k = 2.0; sp.spring.wind_c = 6.0;
sp.spring.solar_a = 2.5; sp.spring.solar_b = 2.5;
sp.spring.rho = 0.30;
sp.summer.wind_k = 2.0; sp.summer.wind_c = 5.2;
sp.summer.solar_a = 4.0; sp.summer.solar_b = 2.2;
sp.summer.rho = 0.10;
sp.autumn.wind_k = 2.1; sp.autumn.wind_c = 6.2;
sp.autumn.solar_a = 2.2; sp.autumn.solar_b = 2.8;
sp.autumn.rho = 0.25;
sp.winter.wind_k = 2.4; sp.winter.wind_c = 7.5;
sp.winter.solar_a = 1.6; sp.winter.solar_b = 3.4;
sp.winter.rho = 0.20;
seasons = {'spring', 'summer', 'autumn', 'winter'};
results = struct();
for i = 1:length(seasons)
sname = seasons{i};
p = sp.(sname);
% 1) Copula 联合抽样
U = copularnd('Gaussian', p.rho, N);
wind_mean = wblinv(U(:,1), p.wind_c, p.wind_k);
solar_mean = betainv(U(:,2), p.solar_a, p.solar_b);
% 2) 聚类特征标准化
feat = [wind_mean, solar_mean];
feat_std = zscore(feat);
% 3) KMeans 聚类
idx = kmeans(feat_std, K, 'Replicates', 20);
% 4) 计算每个典型场景的概率
prob = accumarray(idx, 1, [K, 1]) / N;
% 5) 还原典型日 24 小时出力曲线
[wind_p, solar_p] = restore_typical_curve(feat, idx, sname, sp);
results.(sname).prob = prob;
results.(sname).wind_power = wind_p;
results.(sname).solar_power = solar_p;
end
3.2 Copula 联合抽样为什么用日尺度特征
有人可能会问:为什么这里生成的是“日均风速”和“日均光照”而不是 24 小时的序列?因为如果直接构造 48 维 Copula(24 小时风速 + 24 小时光照),模型复杂度和参数估计难度都会急剧上升,而且很容易出现相关矩阵不正定的问题。
更稳妥的做法是把相关性建模放在“日尺度”上:用 Copula 生成每个季节的日均风速和日均光照,然后用季节性的 24 小时形态模板展开成时序曲线。形态模板可以从历史数据统计得到,比如计算每个季节各时刻风速占全天总风能的平均比例、光照在白天时段的典型分布。这样既保留了风速-光照的相关性,又不会让时序失真,工程上非常实用。
3.3 时序形态展开与出力转换
形态模板展开这一步,代码可以写成独立函数:
matlab复制function [wind_curve, solar_curve] = restore_typical_curve(feat, idx, sname, sp)
K = max(idx);
hours = 0:23;
% 示意形态模板,实际应由历史数据统计得到
wind_shape = 1 + 0.3 * sin(2 * pi * (hours - 6) / 24);
solar_shape = max(0, sin(pi * (hours - 6) / 12));
solar_shape(hours < 6 | hours > 18) = 0;
wind_curve = zeros(K, 24);
solar_curve = zeros(K, 24);
for k = 1:K
members = find(idx == k);
wind_curve(k, :) = mean(feat(members, 1)) * wind_shape;
solar_curve(k, :) = mean(feat(members, 2)) * solar_shape;
end
% 风力机出力转换:切入风速 3 m/s,额定风速 12 m/s,切出风速 25 m/s
Pn = 1.0; % 归一化额定功率
wind_power = zeros(K, 24);
for k = 1:K
v = wind_curve(k, :);
pw = zeros(1, 24);
pw(v >= 3 & v < 12) = Pn * (v(v >= 3 & v < 12) - 3) / (12 - 3);
pw(v >= 12 & v < 25) = Pn;
wind_power(k, :) = pw;
end
% 光伏出力近似等于光照比例乘以额定容量(归一化处理)
solar_power = solar_curve; % 已经归一到 0~1 区间
wind_curve = wind_power;
solar_curve = solar_power;
end
这里的光照形态模板用的是半正弦近似,只代表白天有光照、中午最强、早晚为零的基本特征。实际项目里,solar_shape 应该根据当地经纬度和云量统计结果生成。风速形态模板也应该来自数据,而不是简单拍一个正弦波。形态模板越贴合实际,生成出来的 24 小时场景就越可信。
3.4 用历史数据估计 Copula 参数
上面代码里 rho 是手动指定的。如果有历史风速和光照数据,我们应该在代码开头加一段自动估计。
matlab复制% 假设 hist_wind 和 hist_solar 是某一季节的历史观测向量,长度相同
n = length(hist_wind);
% 经验 CDF 变换到均匀分布
[~, rank_w] = sort(hist_wind);
[~, rank_s] = sort(hist_solar);
Uw = rank_w / (n + 1);
Us = rank_s / (n + 1);
% 用 copulafit 估计高斯 Copula 参数
rho_hat = copulafit('Gaussian', [Uw, Us]);
% 也可以先用 Kendall tau 初始化
tau_wind_solar = corr(hist_wind, hist_solar, 'Type', 'Kendall');
rho_init = sin(pi * tau_wind_solar / 2);
这里要注意,copulafit 接受的输入必须是 (0,1) 区间的经验分布样本,用排序法构造 U 是最稳妥的。排序法的好处是不会出现 0 或 1,因为除以 n+1 而不是 n。
3.5 聚类结果的可视化
聚类削减做完,强烈建议画两张图,一张看四季典型场景的分布,一张看削减前后统计特征是否一致。
matlab复制% 比较削减前后的期望风速
orig_mean_wind = mean(wind_mean);
reduced_mean_wind = sum(results.spring.prob .* mean(results.spring.wind_power, 2));
% 聚类轮廓系数辅助选 K
for kk = 2:8
idx_tmp = kmeans(feat_std, kk, 'Replicates', 20);
sil(kk) = mean(silhouette(feat_std, idx_tmp));
end
plot(2:8, sil(2:8), '-o');
如果削减后的期望出力与原始样本期望出力偏差超过 5%,通常说明 K 取小了,或者聚类特征构造不合理,需要回头调整。
4. 常见问题与排查技巧实录
4.1 风速出现负值或异常大值
风电场景生成中,用 Weibull 逆变换 wblinv 不会生成负值,因为 Weibull 分布的定义域就是非负实数。但如果有人图省事用正态分布近似风速,就会冒出负值,这是新手非常容易踩的坑。记住:风速用 Weibull,光照比例用 Beta,光伏出力才可能有零值。
另外 wblinv 的参数顺序是 wblinv(p, A, B),A 是尺度参数,B 是形状参数。而 fitdist(hist, 'wbl') 返回的 pd.A 是尺度、pd.B 是形状,正好一一对应,别传反了。
4.2 kmeans 结果不稳定,每次跑都不一样
KMeans 的结果受初始中心点影响,即使有 k-means++ 初始化,也可能陷入局部最优。解决方法是设 'Replicates', 20 或更大,让 Matlab 从多组初始点运行并保留最优划分。同时脚本开头固定 rng(42),保证实验可复现。如果你发现复现不了,大概率是上次运行时的随机数种子被中间代码消耗了,建议把随机数设置放在 KMeans 调用前几行。
4.3 聚类结果被单个特征主导
风速的单位是 m/s,数值可能到 12;光照比例只有 0 到 1。不标准化直接聚类,光照在欧氏距离里的贡献几乎可以忽略,聚类结果实际上只按风速分群。这会让“晴天”和“阴天”的光照差异无法体现。所以在 kmeans 之前一定要 zscore 标准化。
如果做标准化之后发现某个季节的典型场景里风速很低但光照很高,这种异常组合反而可能是好事,说明聚类有效捕捉到了季节特征。
4.4 场景削减后的概率总和不为 1
概率计算最稳妥的方式是:
matlab复制prob = accumarray(idx, 1, [K, 1]) / N;
如果用 histcounts(idx, 1:K+1),要确认边界写法正确,否则最后一个簇可能被丢掉。另外,如果 KMeans 出现空簇,accumarray 会自动补 0,概率总和仍为 1,但空簇说明 K 偏大了,建议先降 K 试试。
4.5 直接对 24 小时序列聚类导致维数灾难
有些项目一开始就把每天 24 个风速值拼成 24 维向量,再丢进 KMeans。虽然能跑,但样本量不够时,高维空间下距离度量会变得很不稳定,聚类结果也很难解释。我建议先走“日特征 + 形态模板”思路,用日均风速和日均光照做聚类,再还原时序曲线。等基础流程跑通了,再根据需要升级为更复杂的时序 Copula。
4.6 copulafit 报错或参数估计不稳定
如果 copulafit 一直报错,先检查输入是否真的是 (0,1) 区间的均匀样本。直接把风速原始数据塞进去,是一定会出问题的。其次,如果 rho 相关矩阵不正定,可以考虑用 nearestSPD 之类的函数做最近正定矩阵修正,或者改用 copulafit 时指定 'Approximate' 方法。
经验是:先用 Kendall tau 转 rho 作为初值,再交给 MLE 精修。如果两者差别很大,说明数据里可能有异常值,建议先做数据清洗,而不是硬调算法。
5. 方法扩展与实际应用建议
5.1 从二维扩展到多个风电场和光伏电站
这套方法最自然的扩展方向是多风电场、多光伏电站的联合场景生成。二维 Copula 变成多维 Copula,只需要把相关矩阵扩成 n 维,抽样时用 copularnd('Gaussian', rho_matrix, N) 即可。但有几个坑要提前知道:
- 维度越高,相关矩阵不正定的风险越大。
- 单个变量的异常值会被 Copula 的联合结构放大。
- 高维下用椭球 Copula(高斯、t)更稳定,Archimedean 族在高维下很难构造。
如果场站数量超过 5 个,建议考虑因子 Copula 或 R-Vine Copula,但那是另一个层次的问题,日常项目用高斯 Copula 就够了。
5.2 从日尺度扩展到小时级时序相关
我在前面建议用“日特征 + 形态模板”来生成 24 小时曲线,这个方案已经能满足大多数随机优化需求。但如果你确实需要小时级上的风速-光照联合时序,可以用“分块抽样 + 时间耦合修正”的思路:先按日特征抽样,再用 AR(1) 模型为每个典型日生成风速小时序列,最后用光照模板叠加云量随机扰动。这种方法比直接构造 48 维 Copula 稳定得多。
5.3 场景集在随机优化里的下游应用
有了四季各自的典型场景和概率,下游可以做很多事情:
- 微电网容量配置:把场景概率作为约束条件,优化风机、光伏、储能容量。
- 日内调度:用典型场景做两阶段随机规划,第一阶段决定机组启停,第二阶段根据场景做经济调度。
- 电力市场出清:用削减后的场景计算期望收益和风险指标。
- 可靠性评估:保留概率大的典型场景,再补充少量极端场景作为备用校验。
关键在于场景概率要能反映真实季节分布。如果你有全年 8760 小时数据,可以按春、夏、秋、冬的天数比例,给每个季节的场景集加权,这样全年场景集的统计特征会更接近真实。
5.4 我个人调试这套代码的几点体会
我在实际跑这套流程时,最大的感触是:方法本身不复杂,但数据预处理决定了结果下限。特别是光照零值处理——把夜间 0 值混进 Beta 分布拟合,会让白天的光照比例整体被压得偏低,生成出来的夏季场景反而像阴天。另一个高频坑是聚类前忘了标准化,导致场景削减后的典型曲线看起来只是风速的单调分档,光照信息几乎丢失。
所以如果你正在做类似的风光场景分析,我建议先把历史数据的质量检查做扎实:每个季节的样本量是否足够、光照零值占比有多高、风速和光照的散点图有没有明显离群点。之后再跑 Copula 和 KMeans,你会发现整个过程顺畅得多。等到基础流程稳定了,再根据数据特点升级成 t-Copula、K-medoids 或者更复杂的时空联合模型,效果会好很多。
