不用看公式,风光场景生成这个东西并不神秘。你手头一份风电场和光伏电站的历史出力数据,想把它变成随机优化、容量配置或者生产模拟能用的一堆典型场景,最朴素的做法就是按季节切片,然后聚类。但这中间往往会漏掉一件重要的事:风光之间不是独立的,而且它们的相关性在不同季节差别很大。冬天可能是风大光弱,夏天可能光强风弱或风场来风,单纯把风速序列和光照序列分别建模,得到的结果在联合分布上完全失真。这也是很多代码里“Copula方法+Kmeans聚类削减”同时出现的原因。本篇文章我把这套流程拆开来讲,涉及四季数据切分、Copula依赖建模、场景采样、Kmeans削减,还有我在Matlab里调试这套流程时踩过的坑。适合正在做风光互补、随机生产模拟或者研究生论文里需要生成典型日场景的读者。
1. 为什么不能把全年数据“一把抓”:四季切分背后的概率意义
1.1 风光变量之间的相关性并不固定,季节切分是第一步
先看一个容易犯的错。有人把一整年的风速和光照数据直接用来拟合相关系数,然后生成场景,一画结果图发现春季和秋季看着还行,夏季却出了很多“光照很高、风机也满发”的不合理组合,冬季又出了“光照很低、风机也低”的冗余场景。问题不是算法错,是相关性结构被全年平均掉了。
风力和光伏出力在统计上往往存在负相关倾向,但这种相关强度受天气系统影响很大。以很多中纬度地区为例,冬季受大风天气过程控制,风速高但云量多,光伏容易被压制;夏季午后对流天气带来多云和阵风,风速和辐射之间的时间错配又不一样。用一个全年的Copula函数去统一描述,等于让春天和秋天这种过渡季节去拟合冬夏两端的极端依赖关系,最后每个季节都不准。
C在使用Copula前,应该先按当地的实际气候规律把样本分成春、夏、秋、冬四个子集。切分不一定要严格按3到5月、6到8月这种日历月份来,有些项目会参考气象数据本身的特征,把辐射和风速的变化趋势都明显改变的那段时间作为季节边界。我更建议在代码里把季节设置做成配置项,而不是写死在索引里,方便后面换地区数据时直接调整月份映射。
1.2 生成“年度场景”还是“典型日场景”,决定了场景数组的维度
标题里的“风光场景生成”在不同论文里含义差得很多。有的是要连续8760小时的生产模拟场景,有的是要调度用的典型日场景,后者在硕士论文和规划项目中更常见。两种目标对应的数据组织方式完全不同。
假设要做的是典型日场景,那么基本单元就是“一个包含24个时刻的风光出力向量”。数据文件里如果存的是两年逐小时风速和辐射,就要先把每一日单独切出来,形成类似 N × 24 的矩阵,N表示有多少天。风速已经转成出力的话,还要判断是否有缺测和限电记录,否则某个“低出力日”可能不是天气原因,而是被调度限了,这会让场景的低出力特征带偏。
连续生产模拟的目标则复杂一些,要考虑相邻日之间的自相关,如果只用Copula独立采样每一天,再简单拼成全年,日与日的连续性会非常假。这种情况通常要叠加一个时间序列模型,比如对风速序列先做ARMA拟合,再用Copula把光伏的不确定性与风速的同日状态关联起来。下面我讲的主流程以典型日场景为主,但Matlab代码里的骨架对连续场景也能扩展,只需要在采样环节改成逐日循环加状态传递。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. Copula到底在解决什么问题:风光联合分布的真实形状
2.1 高斯假设解决不了“尾部关联”,Copula把边际和依赖拆开建模
风功率分布强烈右偏,零出力附近概率很大;光伏功率分布则是一个以零为界的分布,多云时的低值区概率密度也很大。如果把两者强行假设为二维正态分布,生成的联合场景大概率是中间概率高、两头概率低,而真实天气系统恰恰更容易让风光同时出现“极端不利”或“极端有利”的时段,这就是统计上说的尾部相关。
Copula方法的核心思路很简单:把单变量的边际分布和变量之间的依赖结构拆开,边际分布可以完全是偏态、有界、混合的,依赖结构则用Copula函数单独刻画。这样既能描述风速分布的厚尾,又能描述“风很小、光伏也几乎没有”这种联合概率,不再被高斯分布的小尾巴限制住。
在实际建模时,先对风速序列和辐射序列分别做边缘分布拟合。可以用Weibull分布和Beta分布这类参数模型,也可以用核分布拟合经验概率分布。从实用角度出发,我通常更倾向核分布或者广义极值分布这类更灵活的形式,因为风光出力常有大量零值和限电导致的平台值,标准两参数分布往往过不了K-S检验。需要谨慎的是,如果只是用Fitdist函数做拟合而完全不加约束,数据里的离群点会让边缘分布尾端过高,后面采样时容易生成现实中几乎不会出现的超低概率场景。
2.2 常用Copula类型如何选,四季是否要统一
Matlab的Statistics and Machine Learning Toolbox里直接提供了Gaussian、t、Clayton、Frank和Gumbel这些常用Copula。Gaussian和t属于椭圆类Copula,能方便地表达对称依赖;Clayton更适合描述下尾相关强的情况,即联合场景常同时出现在低出力区;Gumbel则是上尾相关强,便于模拟极端高风光同时出现的场景。Frank族的依赖关系相对均匀,用于过渡季节比较温和。
这四个季节的风光依赖特征大概率不一样。冬季和秋季更容易出现低辐射伴随高风速的情况,整体依赖偏负向,上尾和下尾哪个更明显要看当地天气;夏季对流天气更多,偶尔风、光双高时段会出现,尾部特征又要单独判断。我在代码里习惯对每个季节分别计算AIC/BIC指标,而不是直接默认用同一个Copula类型。
贴一段可供参考的Matlab拟合骨架,这里u_wind和u_solar是经过边缘分布变换后落在[0,1]区间内的概率值:
matlab复制u = [u_wind, u_solar];
% 分别拟合几种常用Copula
[rho_gau] = copulafit('Gaussian', u);
[rho_t, nu_t] = copulafit('t', u);
[alpha_clayton] = copulafit('Clayton', u);
[alpha_frank] = copulafit('Frank', u);
[alpha_gumbel] = copulafit('Gumbel', u);
% 用负对数似然做简单比较(数值越小通常拟合越好)
nll_gau = copulaloglik(u, 'Gaussian', rho_gau);
nll_t = copulaloglik(u, 't', {rho_t, nu_t});
nll_clayton = copulaloglik(u, 'Clayton', alpha_clayton);
nll_frank = copulaloglik(u, 'Frank', alpha_frank);
nll_gumbel = copulaloglik(u, 'Gumbel', alpha_gumbel);
copulafit对数据的输入顺序没有特殊要求,但我强烈建议固定顺序,把风速放在第一列、光照放在第二列,或者反过来都行,关键是一致。否则后面做误差分析时我会把自己绕晕,分不清维度上到底谁对应谁。
2.3 用Copula生成场景不是直接把原始分布乘在一起,而是两步走
生成环节有一个非常容易误解的点。用Copula并不是先随机生成风速,再随机生成光照,然后把它们按某个公式组合,而是要经过“从依赖结构采样”和“反变换”两步。
先从拟合好的Copula中生成一组在[0,1]区间的联合概率样本,这组样本在变换前已经带有依赖结构,比如copularnd直接可以输出这个矩阵。然后再对每一列各自做边缘分布的反函数变换,把风速那一列转换成功率值,把光照那一列转换成功率值。两步操作缺一不可。
如果在这两步之间插入其他随机扰动,等于把依赖结构破坏了。有些初学者为了提高生成多样性,会在反变换后对每个数值单独加一个噪声,结果生成的风光联合分散点图反而比原始数据更均匀,这就是典型的画蛇添足。要增加多样性,正确的做法是增加样本数量或在边缘分布层面引入参数不确定性,而不是在变换后乱加噪声。
3. Matlab主流程拆解:从原始气象表到高维场景矩阵
3.1 按季节组织样本前,先做好公式化处理和损失日的处理
我在拿到一份原始Excel或CSV数据时,不会急着跑拟合。第一步是检查时间戳是否连续;如果某一天缺了几个小时,直接删除会让每天24个点不再对齐。能插值就插值,不能插值就宁可丢掉这个不完整的日,也别让缺测点变成后面的奇异值。
再一个细节是辐射数据单位。气象站给的是辐照度W/m²,光伏出力则可能受到装机容量和逆变器限制的影响。如果场景生成直接采用辐照度而不是出力,最后要额外加一个固定效率转换系数,这个步骤很容易被遗忘。比较稳妥的做法是,在数据准备阶段就统一成归一化出力,即以各时刻理论峰值作为基准,把功率除以装机容量。归一化后,Copula采样出来的数值也保持在合理区间,Matlab边缘分布拟合会更稳定。
季节切分的实际操作可以维护一张月份表,例如春包含3、4、5月,夏包含6、7、8月,秋包含9、10、11月,冬包含12、1、2月。代码里要注意跨年月份,12月要追加上一年末尾的冬天样本,2月要衔接下一年初的冬天样本。直接按自然年份切片会把12月下旬和1月上旬拆到两个数据集里,冬季样本被生生劈成两半,拟合出来的冬季特征自然偏窄。
3.2 生成场景数组的两种常见封装方式
一种方式是把每个季节的采样集中在一个二维数组里。假设一共要生成5000个冬季场景,每个场景是一个24小时的风功率序列加一个24小时的辐照度序列,那么构建一个大矩阵[场景序号, 时间或维度],行维是场景样本,列维是风速和辐射所有时间点的拼接。这样每一行代表一个完整“日场景”,后续做Kmeans时直接对这一行的48个特征操作即可,概念清晰,代码也容易调试。
另一种方式是保持风和光的两个矩阵分离,例如windScenes(:, 1:24)和solarScenes(:, 1:24),Kmeans之前再用中间拼接或按行堆叠。这种处理在画图阶段更直观,但聚类函数只接受一个特征矩阵,所以在聚类前仍要把两个矩阵横向拼接起来。
需要注意一个常见的事故:风速曲线的幅值尺度通常比光照大,如果不做缩放就一起聚类,Kmeans的距离几乎由风速主导,光照场景之间的差异被淹没。我在削减前一般会先按每个变量的标准差做标准化,或者对各个时间点做Min-Max缩放。当然,如果项目要求保留实际出力水平以便直接用于经济性计算,标准化后要把聚类中心还原到原尺度再保存。
3.3 不适合直接对所有48维跑Copula时的降维选择
严格来说,用Copula直接处理一个48维的日场景向量不是不行,而是样本量要求非常高。风功率24个时刻之间自相关很强,光照24个时刻更是高度平滑,如果直接用48维高斯Copula,相关矩阵会非常稠密且接近奇异,参数估计方差很大,后面生成结果容易崩溃。
实际项目里我更倾向先压缩维数。一种简洁有效的方法是主成分分析PCA:把每一天的风曲线和光曲线分别降到3到5个主成分,得到低维特征后,再对这些特征做Copula拟合。生成时先在主成分空间采样,再投影回原始24维空间,得到完整日曲线。这样既能抓住一天内的波形特征,又避免了高维Copula在大样本下产生的数值问题。
这里有一个取舍:PCA是线性变换,对斜率突变或傍晚“锯齿状”的光伏出力刻画能力有限。如果数据中多云天气很多,光伏曲线形状复杂,可以改用局部时间对齐后的表示,或者直接对每个时段分别建立分位数回归,再通过排序组合重现日曲线形状。后者更复杂,但对数据细节保留更好。我一般先跑一遍PCA看重建误差,如果重建误差小于5%,就优先采用PCA加Copula的路线,简单稳健。
4. Kmeans聚类削减在干什么:从上千个场景到十几个典型场景
4.1 聚类削减的本质是概率化压缩,不是简单找“平均日”
生成5000个场景后,如果直接扔进机组组合或生产模拟,计算量会大到不现实。因此要把场景集合压缩成数量很少的典型场景,比如10到20个,并为每个典型场景赋予一个权重,代表该典型场景在全样本中出现的概率。这一步里Kmeans是最常见的选择。
Kmeans并不直接考虑时间顺序或概率分布,它只负责把距离相近的样本分到同一组,然后以组内所有样本的均值作为该组中心。计算概率时用该组样本数量除以总样本数即可。严格说这背后有一个假设:原始样本是从某个概率分布中抽出的,且每个样本等概率代表一个可能出现的情况。只要上面的Copula采样使用均匀等概率采样,这个假设就基本成立。
削减质量不能只看“簇中心曲线是否平滑”,而应重点考察削减后的概率场景集能否复现原始场景集的统计特征,特别是平均值、标准差、分位数,以及风光联合出力落在低值区的可能性。我常用一个误差指标:削减后的场景集按权重计算的风光联合分布函数,与原始生成样本的经验CDF之间的最大偏差。这个偏差如果小于3%到5%,就可以认为聚类数设置合理。
4.2 簇数量如何定:肘部法则与工程经验的平衡
Kmeans需要提前指定K值,这是很多代码里最不好调的一个参数。纯统计上可以用轮廓系数或肘部图。我把原始场景按K从2扫到30,对每个K计算组内平方和,画出曲线后寻找拐点。风光场景的曲线往往没有特别尖锐的拐点,这时候要结合最终用途。如果只是看典型场景并分析曲线形态,K取8到15就够;如果要把场景放进随机优化模型,K太少会丢掉极端场景,一般要增到20甚至30。
还有一点,Kmeans聚类对初始中心非常敏感。Matlab的kmeans默认使用K-means++初始化,一般比随机初始化更稳。即便如此,单次Kmeans也可能因为随机性收敛到局部最优。我的习惯是用一个循环做20次重复聚类,每次设置不同随机种子,最终选择总距离最小的那次结果。下面是一个参考写法:
matlab复制rng(2025);
[idx, C, sumD] = kmeans(featureMatrix, K, ...
'Distance', 'sqeuclidean', ...
'MaxIter', 500, ...
'Replicates', 20);
特征矩阵的标准化会影响总距离数值,所以这里用标准化后的矩阵聚类还是原始矩阵聚类,一定要先想清楚。如果标准化矩阵聚类,得到的是标准化空间里的簇中心,要反映到原始曲线,不能直接用C画图,必须对C按列还原。我在早期版本里吃过这个亏,画出来中心全是接近0的平线,排查半天才发现是忘记还原。
4.3 每个典型场景的权重不是平均分配的
Kmeans只给出每个样本的类别标签,典型场景的权重必须自分组后单独计算。如果1000个样本分到某类有300个,另一类只有20个,权重就应该是0.3和0.02,而不是每个典型场景都取0.2或1/K。有的同学直接把K个簇中心当成K条等权场景拿去跑优化,等于人为放大了少数稀有天气情形的发生概率,结果计算出的期望发电成本会偏得很厉害。
写成Matlab,大致逻辑是:
matlab复制counts = accumarray(idx, 1);
prob = counts / sum(counts);
prob = prob(:);
得到簇中心矩阵C和权重数组prob后,还要再把这些中心映射到风速、辐照度的原尺度,再进一步转换成对应的出力水平,才算完成“场景削减”。很多后续优化模型实际上只需要两个文件:一个典型场景矩阵,一个每个场景的概率数组,文件命名清晰点能省掉大量时间。
5. 联调阶段最容易出的三个问题与完整定位思路
5.1 生成场景与历史数据的散点图对不上,怎么排查
先检查U的分布形状。Copula是对[0,1]区间概率样本建模的,如果历史数据经边缘分布变换后,在0和1附近出现大量陡峭堆积,要么是边缘分布对零值建模不够,要么是数据里存在大量完全相同的小数值。风功率数据集经常出现连续零出力,辐照度数据集夜间全是0,这部分严格来说不应进入白天的Copula拟合,否则相关结构会被一组巨大的零值点控制。
解决办法有二。一是根据光伏运行特点,只挑选日出后到日落前的小时数据构建边缘分布,夜间全0点不参与Copula相关性计算。二是给边缘分布左侧添加一个“零膨胀”概率,即先估算出力为0的概率p0,再用一个分段函数表示条件分布。这类处理会让实测数据与生成数据的低出力极端区匹配度显著提升,但代价是编码量增加。我建议先画一下数据的累计概率图,如果零值占的比例很低,就不用做零膨胀,避免过度复杂。
5.2 聚类结果里“极端场景”经常丢失,要检查标准化和数据形状
边界场景和极端场景一般出现在样本空间的外围,样本数量少,Kmeans距离最小化原则会把它们分到附近的最大簇里,导致削减后的集合过于温和。要规避这个问题,不能只把希望寄托在反复增大K上。
一个有效做法是分类样本权重:对历史极端天气样本进行过采样,或在对场景削减之前单独把上尾和下尾的少数场景抽出来,不参与聚类,等聚类完成后再作为一个特殊类型并直接并入典型场景集合。这种做法对应对电网调峰或容量评估问题特别有用,因为极端高风速、极低光照场景虽然概率小,但产生的净负荷波动恰恰可能主导系统投资决策。
在代码层面还需要检查特征矩阵的形状。有的代码习惯把日场景按行排列,每行是一个日曲线;聚类函数默认按行聚类。一旦不小心把矩阵转置成列场景,聚类结果会受完全错误的方向影响,但程序不会报错,看起来就是结果没有规律。定位方法是打印size(featureMatrix),并确认所有场景在行方向。这类问题最容易被忽略,因为程序明明跑通了,画图却总是不对。
5.3 削减前后的统计量出现偏差,用分位数而不是均值来判断
判断Kmeans结果好坏,有人只看均值,发现削减前后平均出力差不多,就认为结果合格。实际上平均出力只代表整体能量水平,系统调度更关心的是峰谷差、光伏高发时段的极端低风速概率,这些信息属于分位数和尾部联合概率。
我在验证阶段通常做这样一组对比:削减前原始5000个样本按时间的分位数区间,以及削减后按权重计算的分位数区间,画在同一张图上。如果5%和95%分位数偏差小于可接受范围,说明聚类保留了波动幅度。再把“风光联合输出小于某阈值”的概率对比一下,比如用 mean( (wind+solar) < threshold ) 作为统计量,看削减后是否接近原始场景集。只有联合尾部概率接近,才能说明场景削减既压缩了数量又不牺牲风险信息。
6. 一些可以继续扩展的方向
这套Copula加Kmeans的框架并不是只有标题里的Matlab一种实现方式,但Matlab的优势在于统计工具箱提供了完整的Copula函数和Kmeans函数,开发效率高,做论文复现足够。项目做完后再回头看,我最大的体会是不要把Copula当作万能生成器。它擅长描述同一时间尺度下风光之间的依赖关系,但很难自动处理连续多日的时间序列自相关。如果你后续要做全年8760小时随机生产模拟,建议在Copula外面再加一层时间序列驱动,或者在每个时段内构建动态条件Copula,效果会好很多。
代码层面建议封装成三个模块:数据预处理模块、季节Copula采样模块、Kmeans削减与验证模块。每个模块输入输出用结构体或表格传递,字段名明确,调试时能快速定位问题。加注释也尽量把单位和物理含义写清楚,风光数据建模最怕的就是数值上跑通但物理上意思不明。只要能保证这一点,后续换地区数据、换场景数量、换聚类K值,整个框架都可以继续复用。
