说起风光场景生成,很多做电力系统随机规划的朋友应该都碰到过这个组合问题:手头有三五年以上的风功率和光伏功率历史数据,论文里需要一个能反映不确定性的典型场景集,于是想到了 Copula 方法和 Kmeans 方法。结果一上手就发现,事情没那么舒服——风、光各自的概率分布不一样,两个变量之间的相关结构还会随季节变,直接丢进一个全局模型里,出来的场景要么把冬季大风配成了夏季强辐照,要么聚类之后代表性场景和原始样本分布差得离谱。
这篇内容就是围绕“春夏秋冬四季的风光场景生成和聚类削减”来展开的。我会把 Copula 拟合、多层采样、Kmeans 聚类削减这一整套流程,按实际做项目的顺序拆开讲清楚,并给出可以直接迁移的 Matlab 代码框架。适合正在做风电光伏出力场景模拟、随机优化调度、电力系统规划和可靠性分析的研究生或工程师,尤其是那种“模型已经看懂了,但代码不知从哪下手”的阶段。
1. 把四季拆开之前,先想清楚你研究的场景到底是什么
1.1 风、光联合建模的第一个坑:别把相关结构一刀切
很多人第一次做风光场景,直接把三年的风速、辐照度或者功率数据倒进一个矩阵,算一个相关系数,再套 Copula,最后 Kmeans 聚类。这样流程是能跑通,但结果往往经不起推敲。
为什么?因为风功率和光伏功率不是简单的一维独立变量,它们的联合分布有明显的时间尺度特征。春夏秋冬,大气环流形势不同,风资源的大小和稳定性不同,太阳辐照度的均值与方差也不同。更关键的是,风速和辐照度之间的相关关系在四季会有明显变化:有的季节风大光弱,有的季节风和光可能接近独立,甚至出现负相关。你用一个全局 Copula 参数去描述一整年的依赖结构,其实是把这些差异强行平均了,得到的场景既不贴近春季的真实出力特征,也不贴近冬季的真实出力特征。
所以在动手写代码前,我建议你先回答一个问题:你生成的场景是用来代表“某一时段的随机出力”,还是代表“一整年的典型运行方式”?如果跟调度、备用容量、季节性电量平衡相关,那就必须分季节建模,否则削减出的典型场景把冬天和夏天的特性混在一起,后端的随机优化结果会失真。
1.2 春夏秋冬分开建模的工程理由
这里说的“分四季”,不是简单地把数据文件按1到12月切成四段。工程上是为了让每个季节内的样本更“同质化”。同一季节内,风光的统计特性相对稳定,Copula 的假设更容易成立。
举个例子:冬季常常是风资源较好、辐照度较弱的时段,风、光功率可能呈正相关或弱相关;夏季则往往辐照度强、风速偏小,而且云雨过程对辐照的影响很大,这时候风、光之间可能是弱相关甚至负相关。如果混在一起,Kmeans 聚类时会把本不该同时出现的高风高光场景也当成合理场景保留下来,削减出来的典型场景数量本来就少,每一类都被平均得面目全非。
实际操作时还有一个好处:分季节后,每个季节内部数据的边缘分布更加稳定。风速在冬天整体偏大,夏天整体偏小,如果合在一起用同一个威布尔分布去拟合,拟合优度会很差。分开拟合后,每个季节的边缘参数一目了然,做灵敏度分析也方便。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 边缘分布搭建:Copula 之前的准备工作决定成败
2.1 数据要有多少年,预处理做到什么程度
Copula 模型的本质是先估计每个变量的边缘分布,再用一个相关结构把它们连接起来。这意味着每个变量的边缘分布估计必须可靠,否则后面的 Copula 参数再准也白搭。
根据我的经验,如果按四季拆分,每个季节大约只有全年样本的四分之一。用一年数据去拟合一个季节的边缘分布,几乎不可能得到稳定参数,至少需要连续三年以上的小时级或日级数据。如果你手头只有两年,建议优先保证单日采样点数不要太密,否则有效样本数被时间分辨率稀释了。
预处理阶段有几个很容易被忽略的问题:
- 风电和光伏数据源的时间戳要对齐,不能一个小时有风、下一个小时缺光;
- 异常值按物理常识剔除,比如风速为负、辐照度在白天却突变到超过理论辐照上限;
- 如果研究的是功率场景,要注意风机和光伏的额定容量是否发生变化,若有扩容,先把功率归一化再建模;
- 对于光伏,夜间辐照度为零的情况需要单独处理。如果你直接把这些零点放进 Beta 分布拟合,肯定会失败,因为 Beta 分布要求数据落在开区间 (0,1) 内。常见做法是选择白天有辐照的时段来建模,或者采用“零值概率+连续分布”的混合模型,前者代码简单,后者更严谨但实现复杂度高。
2.2 用参数分布还是直接用经验分布
很多风光场景生成的论文里,风速边缘分布常用两参数或三参数威布尔分布,太阳辐照度常用 Beta 分布。如果你的目标是要发表论文,这套参数化方案有物理依据,也方便和其他文献对比。但如果只是想把工程流程跑通,或者你的数据形态明显不属于这些典型分布,直接用核密度估计或经验分布做边缘,往往更省事。
Matlab 里用参数分布很简单:
matlab复制pd_wind = fitdist(wind_speed, 'wbl'); % 威布尔分布拟合风速
pd_solar = fitdist(solar_irr, 'beta'); % Beta 分布拟合辐照度
但要注意,fitdist 要求数据不能超出分布支撑范围。Beta 分布的数据必须落在 (0,1) 内,所以辐照度或者归一化功率不能出现刚好等于 0 或 1 的值。核密度估计没有这个限制,对应代码是:
matlab复制pd_wind = fitdist(wind_speed, 'kernel', 'Kernel', 'epanechnikov');
pd_solar = fitdist(solar_irr, 'kernel', 'Kernel', 'epanechnikov');
使用核密度也有代价。默认高斯核会在负半轴上拖出一个尾巴,这对风速这类非负变量不太友好,生成场景时可能出现负值。我的做法是生成完场景后再用 max(value, 0) 或直接剔除物理上不可能的结果,但这毕竟是权宜之计。如果你的研究偏向严格的理论推导,建议还是优先考虑威布尔分布和 Beta 分布,并用概率图做一次拟合优度检验。
2.3 把边缘分布转换成均匀分布样本的关键细节
Copula 拟合的第一步,是把原始观测数据通过累积分布函数映射到 [0,1] 区间:
matlab复制u_wind = cdf(pd_wind, wind_speed);
u_solar = cdf(pd_solar, solar_irr);
这里的坑在于,经验分布或某些参数分布会在数据最大值处产生接近 1 的 CDF 值,而后面调用 copulafit 时,如果输入正好是 1,算法内部算逆正态或逆 t 分布时会得到无穷大,整个矩阵就出现 NaN。所以我在处理时都会加一个保护:
matlab复制u_wind = min(max(u_wind, 1e-6), 1 - 1e-6);
u_solar = min(max(u_solar, 1e-6), 1 - 1e-6);
这行保护代码不是凑数,而是在数值上避免边界奇异性。要注意,如果你用 ecdf 直接计算经验CDF,最后一个数据点的 CDF 值一定是 1,这个保护就更不可少。用参数化分布时,理论 CDF 很少正好等于 1,但为了代码鲁棒性,建议还是加上。
3. Copula 家族的选择与四季参数拟合
3.1 Matlab 里 Copula 参数到底在拟合什么
在 Matlab 中,核心函数是 copulafit 和 copularnd。copulafit 的输入不是原始的风速和辐照度,而是上一步得到的均匀分布序列 u_wind 和 u_solar。
matlab复制rho = copulafit('Gaussian', [u_wind, u_solar]);
这一步得到的是一个相关矩阵。对二元情况,就是一个 2×2 的矩阵,对角线为 1,非对角线为你要的相关参数。如果是 t Copula,还会多一个自由度参数:
matlab复制[rho, nu] = copulafit('t', [u_wind, u_solar]);
Archimedean Copula,比如 Clayton、Frank、Gumbel,拟合返回的是单个参数 θ。这些族的性质差异很大:
| Copula 类型 | 是否支持负相关 | 尾部特征 | 适用场景 |
|---|---|---|---|
| Gaussian | 支持 | 无尾部相关 | 通用稳健,最常用的起点 |
| t | 支持 | 有对称尾部相关 | 需要刻画极端同时出现时使用 |
| Clayton | 通常不适合负相关 | 下尾相关强 | 适合低出力同时发生的场景 |
| Gumbel | 通常不适合负相关 | 上尾相关强 | 适合高出力同时发生的场景 |
| Frank | 支持正负相关 | 尾部相关弱 | 相关性较弱时比较稳 |
实际拟合四季数据时,我的经验是:先对每个季节分别计算 Kendall 秩相关系数,看正负和大小,再决定候选 Copula 族。如果某季节风、光呈负相关,就不要把 Clayton 或 Gumbel 放进候选列表,因为这类 Archimedean Copula 的设定本身就偏向正相关,硬拟合会返回异常参数或者让优化不收敛。
3.2 用对数似然和 AIC 选择 Copula 类型
不要凭感觉选 Copula。Matlab 提供了 copulaloglik,可以直接算某个 Copula 在给定参数下的对数似然值:
matlab复制logL = copulaloglik('Gaussian', rho, [u_wind, u_solar]);
对不同族计算后,用 AIC 或 BIC 比较:
matlab复制AIC = 2 * k - 2 * logL;
BIC = log(n) * k - 2 * logL;
其中 k 是 Copula 的参数个数,n 是样本数量。AIC 或 BIC 越小,说明该 Copula 对数据的解释能力越好。这个步骤不能省,因为不同季节最优的 Copula 族往往不一样。我遇到过不少项目,冬季最适合 Gumbel,夏季反而是 Frank 或 Gaussian 更优。这也是为什么我最后会把每个季节的 Copula 族和参数分别保存,而不是全局只用一个族。
3.3 拟合四季 Copula 的代码结构
这里给一个可直接改的模板思路。首先把原始数据按季节拆分,然后分别计算均匀化序列和 Copula 参数。
matlab复制monthNum = month(timeVec);
seasonCode = zeros(size(monthNum));
seasonCode(ismember(monthNum, [3 4 5])) = 1; % 春季
seasonCode(ismember(monthNum, [6 7 8])) = 2; % 夏季
seasonCode(ismember(monthNum, [9 10 11])) = 3; % 秋季
seasonCode(ismember(monthNum, [12 1 2])) = 4; % 冬季
seasonName = {'Spring', 'Summer', 'Autumn', 'Winter'};
for s = 1:4
idx = find(seasonCode == s);
wind_s = wind_speed(idx);
solar_s = solar_irr(idx);
pdW = fitdist(wind_s, 'wbl');
pdS = fitdist(solar_s, 'beta'); % 根据数据情况也可用 'kernel'
uW = min(max(cdf(pdW, wind_s), 1e-6), 1 - 1e-6);
uS = min(max(cdf(pdS, solar_s), 1e-6), 1 - 1e-6);
% 候选 Copula 比较
familyList = {'Gaussian', 't', 'Frank'};
bestAIC = inf;
bestFamily = '';
bestParam = [];
for i = 1:length(familyList)
try
param = copulafit(familyList{i}, [uW, uS]);
logL = copulaloglik(familyList{i}, param, [uW, uS]);
k = numel(param);
aicVal = 2 * k - 2 * logL;
if aicVal < bestAIC
bestAIC = aicVal;
bestFamily = familyList{i};
bestParam = param;
end
catch
warning('Copula family %s failed for %s', familyList{i}, seasonName{s});
end
end
fprintf('%s最优Copula: %s, AIC=%.2f\n', seasonName{s}, bestFamily, bestAIC);
end
注意这段代码里我把冬季映射到 12、1、2 月,这里有个跨年问题:12 月和次年 1、2 月是连续的冬季,但你的数据如果按年份存储,年份字段会跳变。如果你后续要分析时间连续性,比如对场景序列做时序校验,最好把冬季单独定义为一个“季节对象”,不要被自然年的边界限制住。
4. 从 Copula 采样到 Kmeans 聚类削减的完整流程
4.1 采样数量与反变换回物理空间
Copula 拟合完之后,场景生成的直观做法是从每个季节的 Copula 中抽取大量样本,再把这些均匀分布样本反变换回风速和辐照度或功率空间。比如对春季采样 5000 个场景:
matlab复制N_season = 5000;
U_sim = copularnd('Gaussian', rho_spring, N_season);
wind_sim = icdf(pdW_spring, U_sim(:,1));
solar_sim = icdf(pdS_spring, U_sim(:,2));
采样数量没有绝对标准,我的经验是:如果后面要做 Kmeans 削减到 5 到 10 个场景,初始采样数最好不小于 2000,常规研究用 5000 到 10000 比较稳。采样太少,聚类中心会过度依赖随机抽取的样本落在哪个区域,结果复现性差;采样太多,又会增大 Kmeans 的计算时间,不过对二元变量来说 10000 个样本的计算量完全可以接受。
注意一个细节:如果边缘分布是威布尔或 Beta,用 icdf 反变换得到的场景值天然符合物理范围。如果边缘分布是核密度估计,则可能出现不合理的负风速,需要在代码里过滤或截断。
4.2 Kmeans 为什么能把 5000 个场景削减成 5 个
很多人把 Kmeans 理解为简单的“数据分类”,但在场景削减里,它做的是另一件事:把大量连续样本压缩成若干离散的“典型场景”,每个典型场景附带一个概率权重。
具体操作分为三步:
- 把每个采样场景作为一行,组成一个 N × 2 或 N × 24 的矩阵;
- 调用 Kmeans 指定削减后的场景数 K,得到每个样本的簇标签和聚类中心;
- 统计每类样本数量占总数量的比例,作为该典型场景的出现概率。
聚类中心的物理含义就是削减后的典型场景,而每个簇内样本点的数量比例就是对应的概率。后面做随机优化时,可以直接把这 K 个场景和概率传给优化模型,不用再背着原始的大规模样本集。
4.3 削减数量 K 怎么定
K 值不是越大越好,也不是越小越好。削减后的场景数,本质上是你打算在目标函数里枚举多少种不确定情况。K 越大,场景代表性越强,但优化规模成倍增长;K 太小,又可能丢失极端场景。
我常用的做法是这样:对 K=3 到 K=20 分别做一次削减,然后比较削减前后场景集的均值、方差,以及典型场景和原始样本间的平均距离误差。当 K 超过某个值后,误差下降会明显变缓,这个拐点就是相对合适的削减数量。实际论文里 K 取 5、10、15 都很常见,关键是要在文中说明你这么选的依据。
下面是一段 Kmeans 削减与概率计算的代码片段:
matlab复制function [sceneCenter, sceneProb] = reduceKmeans(sceneMat, K)
% sceneMat: N 行,每行一个场景
% K训练 削减后典型场景数
rng(42); % 固定随机种子,保证可复现
[idx, center] = kmeans(sceneMat, K, 'Replicates', 20, 'Distance', 'sqeuclidean');
sceneCenter = center;
sceneProb = accumarray(idx, 1) / length(idx);
end
'Replicates', 20 是很有用的选项,它让 Kmeans 从多个随机初始中心点开始迭代,避免落入局部最优。我在实际项目里通常把 Replicates 设成 20 或 30,虽然会多花几百毫秒时间,但稳定性提升很明显。
4.4 削减后怎么验证结果是否可信
削减完不能直接拿去用,先做两个最简单的检查。
第一,检查削减前后的一二阶矩。原始 5000 个场景的均值向量和协方差矩阵,应该和削减后 K 个场景按概率加权算出的均值向量和协方差矩阵比较接近。如果均值差得离谱,说明 K 太小或 Kmeans 没有收敛好。
第二,画散点图看覆盖。把原始采样场景画成浅色散点,把削减后的典型场景用深色大圆点标出来并叠加上去。如果大圆点明显偏向一侧,说明聚类不均匀,某些区域被过度代表,某些区域被忽略了。
这个图形化的方法虽然朴素,但比任何抽象指标都更能说明问题。期刊审稿人大概率会问你怎么证明削减有效,你拿出均值差、协方差差和可视化图,说服力就足够了。
5. 把完整流程整合成一套可运行的 Matlab 主程序
5.1 主程序框架示例
将前面的步骤串起来,主程序可以有如下结构:
matlab复制clear; clc; rng(2025);
% 1. 读数据
data = readmatrix('wind_solar_history.csv');
t = datetime(data(:,1), data(:,2), data(:,3), data(:,4), data(:,5), 0);
wind = data(:,6);
solar = data(:,7);
% 2. 拆季节
monthNum = month(t);
seasonCode = zeros(length(monthNum),1);
seasonCode(ismember(monthNum, [3 4 5])) = 1;
seasonCode(ismember(monthNum, [6 7 8])) = 2;
seasonCode(ismember(monthNum, [9 10 11])) = 3;
seasonCode(ismember(monthNum, [12 1 2])) = 4;
% 3. 每个季节分别拟合边缘与Copula
K = 10;
sampledScenePerSeason = cell(4,1);
for s = 1:4
idx = find(seasonCode == s);
xW = wind(idx);
xS = solar(idx);
pdW = fitdist(xW, 'wbl');
pdS = fitdist(xS, 'kernel'); % 或者根据数据特性用 beta
uW = min(max(cdf(pdW, xW), 1e-6), 1-1e-6);
uS = min(max(cdf(pdS, xS), 1e-6), 1-1e-6);
% 这里以 Gaussian Copula 为例,实际建议用 AIC 筛选
rho_s = copulafit('Gaussian', [uW, uS]);
% 生成 5000 个场景
Nsample = 5000;
Usim = copularnd('Gaussian', rho_s, Nsample);
windSim = icdf(pdW, Usim(:,1));
solarSim = icdf(pdS, Usim(:,2));
% 拼成一个场景矩阵:每一行是一个场景
sceneMat = [windSim, solarSim];
% Kmeans 削减
[center_s, prob_s] = reduceKmeans(sceneMat, K);
% 保存结果,供后续随机优化调用
sampledScenePerSeason{s}.center = center_s;
sampledScenePerSeason{s}.prob = prob_s;
end
save('reducedScenes.mat', 'sampledScenePerSeason');
这段代码把每个季节都削减为 K 个典型场景,最后保存成一个 mat 文件。你在后续优化模型里直接读取这个文件即可。
5.2 常见报错排查:NaN、负值和拟合失败
我在跑这种流程时,有几种报错几乎必然遇到,这里提前说明排查思路。
如果 copulafit 返回 NaN,最常见的两个原因:一是输入的均匀序列里出现了 0 或 1,需要检查 min(max(u, 1e-6), 1-1e-6) 是否已经生效;二是某些季节的数据时间跨度太短,样本量过少,导致 Copula 参数估计不稳定。此时要优先增加历史数据,而不是改代码参数。
如果 fitdist(xS, 'beta') 报错说数据必须位于 (0,1) 区间,说明辐照度或归一化功率里有接近 0 或 1 的值。解决办法是把原始变量做一次有界化处理,或者改用核密度估计。
如果核密度估计反变换出的风速有负数,可以设置一个下限截断,但更建议对边界变量使用威布尔分布。风速本身的物理范围是零到正无穷,威布尔比核密度更适合作为边缘。
5.3 关于可复现性的两个小提醒
随机场景生成和 Kmeans 聚类都是带随机性的过程。为了论文里结果可复现,必须在主程序开头固定随机种子,也就是 rng(2025) 这样的语句。Kmeans 的开始中心点也是随机的,所以还要在 kmeans 函数里设置好 Replicates,并保证每次运行环境一致。
另一个容易被忽视的点是,如果数据文件、数据清洗规则或边缘分布类型发生了变化,你应该把对应的版本号写进结果文件名或者注释里。科研项目里最怕的不是算法错,而是半年后回头看,已经不记得某个结果是用哪版数据跑出来的。
6. 论文里怎么写,以及实际项目中的验收建议
6.1 方法部分建议按这套逻辑陈述
如果你需要用这套流程写论文,方法部分我建议按四步讲,逻辑链会比较清晰:
- 第一,说明为什么要分季节,因为你研究的是长时间尺度下的风光出力不确定性,四季的资源特性差异显著;
- 第二,说明边缘分布怎么选、Copula 参数怎么估计,并用 AIC/BIC 表展示不同 Copula 族的比较结果;
- 第三,说明场景是怎么从 Copula 中采样生成的,采样规模是多少;
- 第四,说明 Kmeans 的具体削减流程,并给出削减前后场景概率分布和统计特征的对比。
这套顺序正好对应代码的执行顺序,审稿人不会觉得逻辑跳跃。需要注意,不要在方法部分笼统写“使用 Copula 方法”,要具体写清楚用了哪种 Copula、参数估计方法是什么、为什么这样选,否则会显得随便套了一个工具。
6.2 最后分享一个我亲测好用的验收方法
除了均值、方差对比之外,我每次跑完削减,还会做一个更贴近下游应用的验证:把削减后的 K 个场景放进一个简单的经济调度模型里,计算目标函数值;然后在同样的模型里,直接使用原始 5000 个样本的期望值来做一次“确定性对照”。如果随机优化的结果和确定性结果的差异明显不合理,说明场景集没有充分覆盖极端情况,应该调整采样数量或 K 值。
这样做的好处是,你不仅验证了“场景削减算法本身没跑错”,还验证了“这套场景集对下游问题真的够用”。很多论文只画漂亮散点图,却不关心场景代入优化模型后的合理性,这是审稿人最容易追问的点。
如果你自己跑的过程里也遇到相关问题,尤其是某个季节拟合出的 Copula 参数看起来很奇怪,可以优先怀疑边缘分布没有选对,而不是急着换 Copula。边缘分布是地基,地基歪了,上面建 Copula 和 Kmeans 都白搭。
