总有人问我,做空气质量研究这些年,最让我头疼的数据是什么。我的答案一直很稳定:SO2。PM2.5有国控站点、有卫星反演、有再分析产品,想要哪个尺度都能找到;但SO2不一样,它在大气里寿命短、浓度空间差异大,早期的卫星产品像元动辄十几公里,放中国东部那种城市连片的区域,一个像元能把三四个城市糊在一起。所以当我第一次拿到这套“中国高分辨率月/日度SO2数据集(2013-2023)”的时候,第一反应不是“又一个数据集”,而是“这个分辨率,终于能干点正经事了”。
这篇内容我想认真聊聊这个数据集:它背后的生成逻辑是什么,拿到手怎么验证、怎么用、怎么避坑。不管你是做大气环境研究的硕士博士,还是搞健康暴露评估、排放清单校验的从业者,这篇文章应该都能帮你省下不少试错的时间。我会尽量把那些产品文档里不会写的细节也一并讲清楚。
1. 从OMI的13公里到1公里精度:这个数据集解决的真正痛点
先来说说“高分辨率”这三个字到底有多值钱。
在2013年之前,想做中国SO2的空间分布研究,可选的卫星数据其实就那么几个。OMI传感器2004年上天,设计寿命五年,硬撑到2013年左右已经开始出现条带异常;它的星下点空间分辨率是13km乘24km,边缘像元更差。这个分辨率意味着什么?举个我实际遇到过的例子:以北京为中心,OMI的单个像元很可能同时覆盖北京城区、通州副中心和河北廊坊的一部分。你想回答“北京和廊坊的SO2差异有多大”,原始卫星产品根本给不出答案,因为两者的信号在同一个像元里被混匀了。
后来OMPS接棒,情况也没有本质改善。NPP上的OMPS SO2产品,标称分辨率约50km,比OMI还粗糙,用来做全球火山监测和背景趋势还行,想画中国城市群的细节分布,基本是痴人说梦。真正把分辨率拉到7km乘3.5km的TROPOMI,2018年才发射,覆盖不了2013到2017年这段中国减排力度最大的窗口期。
这就出现了一个时间断层:你找不到一个传感器,能同时满足“2013年起”“中国区域”“公里级分辨率”这三个条件。所以“中国高分辨率月/日度SO2数据集(2013-2023)”这类产品的核心价值,恰恰在于它绕开了“单靠一颗卫星”的思路——用算法把原始粗分辨率数据降尺度到1km左右,填上这个历史空白。
1km分辨率是什么概念?差不多是一个区县级格网。北京朝阳区大约470平方公里,1km格网能把朝阳切成四五百个单元,管理层面上能区分出城区核心、工业集中区、生态涵养区之间的SO2差异。当然,我要泼一盆冷水:1km不等于100%真实,它是在粗分辨率观测约束下的一种最优估计,本质上仍然带有模型假设。但它确实把研究尺度从“城市群”推到了“城市内部”,这是质的改变。
市面多数此类数据集的时间起点选在2013年,也有现实原因:2013年是中国空气质量监测网密集建设的关键节点,国控站点数量明显扩充,地面观测样本多了,机器学习型的降尺度融合模型就有了足够的训练标签。再加上2013年之后中国SO2浓度经历了非常明显的下降过程,这十一年正好是研究排放变化、健康效应和政策响应的黄金窗口。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 数据不是从天上直接掉下来的:高分辨率SO2产品的生成链路
很多刚接触这类数据集的同学,会把“高分辨率SO2数据”理解成“卫星直接拍出来的高分辨率图”。这种理解也不算错,但跟实际情况差了很远。我必须把这套产品的生成链路掰开揉碎了讲,因为你只有知道数据怎么来的,才知道哪些地方可信、哪些地方要小心。
2.1 卫星反演这一环:紫外波段的吸收信号是怎么变成浓度的
SO2在紫外波段有一段特征吸收结构,主要集中在300到320纳米附近。太阳光穿过大气到达地面再被散射回卫星,途中只要经过含SO2的空气团,光谱上就会留下吸收痕迹。卫星传感器接收到的光谱,跟辐射传输模型模拟出的“无污染”光谱一比,差值就能反演出SO2的柱浓度。
这个过程的专业术语叫差分吸收光谱法,业内一般简称DOAS。核心要点是:卫星反演出来的是“垂直柱浓度”,意思是大气一整根柱子里有多少SO2分子,单位通常是DU(Dobson Unit)。这里要特别注意,柱浓度不等于地面浓度。同样的柱浓度,如果SO2集中在地面附近几百米的边界层里,地面浓度会非常高;如果混合层有1500米厚,SO2被摊薄,地面浓度就低得多。后面我讲单位换算的时候还会细说,这里先记住一个结论:卫星反演解决的是“大气里总共多少SO2”,而不是“地面你吸入了多少SO2”。
OMI和OMPS的紫外通道在晴天条件下反演SO2比较稳定,但碰到云层时,低层SO2信号会被云挡住。所以原始L2产品里很多像元在阴雨天是缺测的。这也是为什么后续的降尺度产品要引入大量辅助数据来填补这些空洞,而不是简单地把缺测格网标成NaN。
2.2 模式模拟与机器学习融合:分辨率是怎么变细的
把13km变成1km,不是靠插值放大图像。真正的做法一般是两段式。
第一段,用化学传输模式(比如GEOS-Chem、CMAQ、WRF-Chem)在较粗网格上模拟SO2浓度的空间分布。模式本身有完整的排放清单和气象驱动,能给出SO2在水平方向和垂直方向上的迁移扩散结果,它的优势是“物理上自洽”,缺点是排放清单不准的时候,模拟偏差会很大。
第二段,用机器学习模型做降尺度和偏差校正。这里的关键思路是把模式模拟的SO2浓度场作为一个基础特征,再叠加一批与SO2时空分布相关的高分辨率协变量——包括卫星原始柱浓度、气象再分析资料(温度、风速、边界层高度、相对湿度)、高程、土地利用类型、人口密度、路网密度、工业分布等。模型的任务就是学习一套从这些变量到“地面站点观测SO2浓度”的映射关系。训练数据就是全国上千个国控站点的观测值,样本量足够支撑这类模型。
常见的模型选型是随机森林、XGBoost、LightGBM,近两年的产品也会用深度神经网络。它们的共同特点是能捕捉变量间的非线性关系。比如冬季北方边界层压低、逆温频繁,同样的排放量在地面造成的浓度会高很多,线性模型很难把这种交互效应学扎实,而树模型能自动切分这些场景。训练完之后,把模型应用到整个中国区域每个1km格网上,就能得到一张空间连续、而且地面浓度含义明确的SO2分布图。
月度数据和日度数据的生成策略还有区别。月度的往往先对训练标签做月平均,让模型学“月均浓度与月均气象场的关系”,空间稳定性更好;日度的则必须面对每天的站点样本可能不均、部分日期大量站点缺测的问题,所以日度产品通常会有更严格的样本筛选和时空交叉验证,避免模型把某个单日的噪声也学进去。
2.3 误差来源的结构化拆分:哪里能信,哪里不能信
这类数据集的误差,至少有三个来源叠加:
第一个是卫星反演误差。SO2柱浓度在有气溶胶污染时会受到干扰,中国东部冬季霾天气下,气溶胶光学厚度高,紫外波段的散射过程变复杂,SO2反演可能被低估或高估。这个误差在卫星原始产品阶段就存在,后续降尺度模型很难完全消除。
第二个是模式模拟偏差。化学传输模式对排放清单非常敏感,中国能源结构转型期,燃煤排放的快速变化会让静态清单经常滞后于现实。再加上模式对边界层高度、垂直混合过程的参数化方案不同,模拟出的SO2垂直分布会有系统性差异。
第三个是机器学习外推陷阱。训练站点主要分布在城市建成区,东部密集、西部稀疏。模型在站点密集地区学到的映射关系,搬到站点几乎为零的青藏高原或西北荒漠,本质上就是外推,不确定性会显著加大。很多产品会在文档里强调“个别区域精度未得到充分验证”,说的就是这个。
理解了这三个误差来源,你就该明白一件事:这个数据集在城市群、平原地区、监测站点覆盖好的地方精度高,在偏远无人区精度存疑。拿到数据先看区域,再谈精度。
3. 拿到手先别急着算均值:验证、单位与时间语义
我见过太多人下载完数据直接套AOI裁剪,算出个平均值就开始下结论。这个流程跳过了最重要的一步——拿已知站点数据去验证产品在你研究区域内的可靠性。这里我展开说几个关键点。
3.1 验证指标与交叉验证策略:到底怎么判断数据靠不靠谱
好的高分辨率SO2数据集在发布前一定会做验证,但你拿到手之后,还是应该自己做一遍。最常规的做法是把产品值跟国控站点观测值做对比。
评估指标主要是四个:相关系数R(或R²)看趋势一致性,均方根误差RMSE看整体偏差大小,平均绝对偏差MAB看绝对误差水平,再配合一个平均偏差MB检查是否存在系统性高估或低估。从同类产品的公开验证结果看,月度产品的表现通常会明显好于日度产品——月平均会抵消掉大量随机噪声和气象扰动,相关系数普遍能做到0.8以上,RMSE大致在10到20微克每立方米这个区间;日度产品因为要捕捉每日的天气尺度波动,误差天然更大,相关系数在0.7到0.85之间更常见,重污染个例里出现几十微克的偏差也不算意外。
这里要提醒一句:站点值与1km格网值做对比,不是简单的“格网值=该点真值”。站点周边微环境(小范围排放源、局地气象、地面粗糙度)的影响可能非常强。常规做法是取目标站点所在格网及周围3乘3共9个格网的均值去做对比,这比单点取值更稳健,能在一定程度上平滑格网与站点之间的尺度错配。
模型验证的严谨性也要看交叉验证方式。要特别警惕那种随机划分训练集和测试集的操作——因为同一个月、相邻站点的样本高度相关,随机划分会让模型“见过”相似样本,导致验证指标虚高。更可靠的做法是留出整年做验证,比如用2013到2021年训练、2022到2023年验证,这样你评估的是模型对未来趋势的预测能力,而不是对“熟面孔”的记忆能力。拿到数据先看文档里用的是哪种验证,如果只写了随机KFold,那精度指标就要打个折扣。
3.2 单位换算的经典陷阱:柱浓度怎么变成地面浓度
这是使用SO2卫星数据时最容易出错、而且代价极高的一步。我单独拿出来讲。
先说清楚一个换算关系。柱浓度1 DU等于2.69乘10的16次方个SO2分子每平方厘米,也就是2.69乘10的20次方个分子每平方米。如果这整根柱子的SO2都均匀分布在1000米厚的边界层内,那么换算成体积比是多大呢?我们来算一下:
2.69×10²⁰分子/m²除以1000m,得到2.69×10¹⁷分子/m³。每摩尔气体有6.02×10²³个分子,所以相当于4.47×10⁻⁷ mol/m³。SO2的摩尔质量按64g/mol算,质量浓度就是4.47×10⁻⁷×64g/m³,约等于28.6微克/m³。
结论就是:边界层高度1000米时,1 DU的柱浓度约等于28.6微克每立方米的地面浓度。如果边界层高度只有500米,同样的柱浓度对应约57微克每立方米。这组数字很直观地说明了为什么不能拿柱浓度直接当地面浓度用——你没有边界层高度信息,就做不了换算。
所以使用数据集时必须先确认单位。如果产品给的是“近地面SO2浓度”,通常单位是微克每立方米,那它应该已经在生成过程中引入了边界层高度信息和垂直廓线假设,可以直接用;如果产品给的是柱浓度,单位是DU或者molecules/cm²,那就必须结合ERA5的边界层高度数据自行换算,而且换算时还要考虑SO2的垂直分布形状——不要假设均匀混合,城区冬季的SO2往往集中在近地面几百米。
3.3 “日”到底是什么意思:时间语义不能想当然
很多日度产品标注的“daily”,含义各不相同。有的代表卫星过境时刻(中国区域大约是当地时间13点到14点)的瞬时地面浓度估计;有的经过模型校正后,代表当日24小时平均浓度;还有的是把白天云覆盖时间内有效反演的极大值或中位数作为代表值。
平时我们跟国控站点数据对比时,站点日均值是24小时平均的,如果产品值是过境瞬时浓度,两者必然存在系统性偏差。SO2有明显的日变化规律,早晚高峰和午后光化学消耗会让浓度形成显著的日内波动,所以对比前一定要查清产品文档中关于日值定义的部分。没有说清楚的,宁可先写信问作者,也别自己瞎猜。
月度数据也有类似问题。有的产品月值是“该月所有日度有效值求平均”,有的产品则是在模式模拟基础上先做月平均再融合站点数据,两条路径的结果会有细微差异,尤其在数据缺失多的月份。拿到月数据时,顺手看看该月的有效样本数量,如果某月有效天数太少,这个月均值参考价值就很有限。
4. 月度和日度数据的分工:两种时间尺度该怎么用
数据产品给两种时间尺度,不是让你只挑一个,而是它们各自解决不同的问题。我做了几年污染数据分析,对这两种尺度的使用场景做过比较系统的总结,这里直接分享出来。
4.1 月度数据更适合做趋势、格局和总量分析
月度数据噪声小,空间完整性好,几乎所有的“长期趋势”类研究都应该先用月度数据。比如你想回答“京津冀区域的SO2浓度在这十一年里下降了多少”,正确做法是把研究区域内的月均SO2浓度按格网聚合,得到逐月区域均值序列,再做季节分解或趋势检验。
实际操作中,Theil-Sen斜率估计和Mann-Kendall显著性检验这套组合拳,比普通线性回归稳健得多。SO2浓度的季节波动非常大——冬季采暖期浓度可能是夏季的几倍——普通最小二乘回归很容易被冬季峰值带偏,而Theil-Sen基于中位数斜率,对异常值和季节性的抵抗能力强得多。早年我做这类趋势分析时,还会先对月度序列做STL分解,把季节项、趋势项和剩余项拆开,这样能更清楚地看出趋势转折点在哪里。这套方法不需要多高深的数学背景,Python里pymannkendall和statsmodels都能直接实现。
月度数据在空间格局分析上也有独特优势。因为月平均消掉了很多随机波动,不同城市之间的浓度排序更稳定。你可以很方便地做“省级行政区划统计”:对每一个省份求区域面积加权平均,看看2013年和2023年各省的SO2浓度发生了什么样的空间重组。这类结果做出来以后,配合排放源分布图,能讲出很多有意思的故事——比如浓度高值区是不是从传统工业基地向城市群边缘转移了。
4.2 日度数据是健康效应和污染过程研究的刚需
日度数据的主战场是流行病学和健康风险评估。SO2属于短时间暴露就可能引起呼吸系统症状的污染物,健康研究关心的是“今天吸入的SO2对明天急诊量有什么影响”,这就必须要有逐日的暴露浓度。
典型的研究设计是时间序列分析或病例交叉设计。前者把逐日区域平均SO2浓度跟当日的死亡数、急诊量做回归,控制温度、湿度、气压等气象混杂因素,再考虑污染物浓度的滞后效应;后者则把每个病例的发病日与同一周或同一月的对照日做配对,本质上消除了时间长趋势和季节性的影响。这两种设计都需要每天一个暴露值,而且这个暴露值最好能覆盖到个体所在的具体位置——1km格网数据的价值就在这里,住在工业区附近的人跟住在公园旁边的人,在同一个城市里拥有完全不同的SO2暴露水平,日度1km数据能捕捉到这种精细差异,几公里或几十公里的网格做不到。
日度数据还可以用来解析污染过程。比如每年秋冬季,中国北方很多城市会经历静稳天气下的SO2累积过程。用日度数据拉一个城市群十天左右的时间序列,能看到SO2浓度怎么一步步攀升、在高位维持、再随风速增大而快速清除。如果再叠加风场数据和后向轨迹分析,就能判断某个城市出现的SO2高值到底是本地排放还是区域传输贡献的。这类过程分析对制定应急管控措施很有参考价值,而月度数据是完全看不出这些细节的。
4.3 时间窗口的独特价值:2013到2023恰好是变化最剧烈的十一年
我特别想强调这个时间窗口的稀缺性。2013年之前,中国的卫星反演和地面监测网络都不够完善,高分辨率SO2产品做不出来;而这个时间段内,全国范围内的SO2浓度经历了非常显著的整体性下降。也就是说,这套数据的前几年和后几年,几乎是一个天然的“污染高峰vs相对清洁”对照实验。
这对趋势研究非常有利。如果你的研究需要区分“气象条件变化带来的浓度波动”和“排放控制带来的趋势性下降”,这段跨越十一年、包含多个暖冬冷冬、包含了多种气象模态的观测窗口,能帮你把气象贡献和排放贡献分离得更加干净。常用的方法是用气象归一化:把实际气象数据随机置换多次,输入训练好的机器学习模型,得到一组“如果气象条件不变,浓度会怎样变化”的反事实情景,再对比真实浓度序列,就能估算出排放控制对浓度下降的贡献。这套做法在PM2.5研究里已经很成熟,SO2数据集分辨率上来以后,同样可以复制。
5. 下载与预处理实操:从NetCDF到省市级时间序列
理论说完了,进入实操环节。一份数据拿在手里,前后处理大概要经过这么几个步骤,我挨个过一遍,每步都可能踩坑。
5.1 数据格式与工具链选择
这类高分辨率产品最常见的格式是NetCDF或GeoTIFF,也有一部分产品保留HDF5格式。NetCDF的好处是自带维度信息和元数据,比较适合批量编程处理;GeoTIFF则适合在ArcGIS或QGIS里直接做可视化检查。
我个人的建议是,不管最终在什么平台出图,处理环节统一走Python:xarray负责读取NetCDF和维度操作,rioxarray或rasterio负责重投影和裁剪,geopandas处理行政区划矢量,regionmask把行政区掩膜叠加到格网上。Anaconda一条命令就能把这套环境装好。不要再走“先转成文本再导入Excel”的老路了,1km分辨率中国全境的数据动辄上千万个格网,Excel根本扛不住。
5.2 基础处理流程示例
假设你已经下载好了月度NetCDF文件,结构大概是(time, lat, lon)三维数组。第一步是用xarray打开看一眼维度信息和单位标注:
python复制import xarray as xr
ds = xr.open_dataset("SO2_1km_monthly_2013_2023.nc")
print(ds)
# 确认变量名、单位、坐标范围和缺失值标记
so2 = ds["so2"]
然后是裁剪中国范围或目标省份。如果你的文件本身就是全国数据,需要叠加行政边界掩膜:
python复制import geopandas as gpd
import regionmask
china = gpd.read_file("china_boundary.shp")
mask = regionmask.mask_3D_geopandas(china, lon=so2.lon, lat=so2.lat)
# 只保留中国范围内的格网
so2_china = so2.where(mask)
按省级行政区聚合时,regionmask生成的mask带有一个regions维度,每个索引对应一个省级行政区。对掩膜后的数据进行纬度经度平均,就能得到逐月省级序列:
python复制province_monthly = so2_china.mean(dim=("lat", "lon"))
这里有两个细节值得单独说。regionmask默认基于经纬度直线边界做掩膜,跟投影后的精确面积有细微差异,但做省级统计完全够用。另外,做区域平均时,如果只用mean(),相当于给每个格网等权重,这在低纬度格网面积大、高纬度格网面积小的情况下会引入轻微偏差;严谨的做法是用cos(latitude)做权重,或者用面积权重。省市级尺度的差异很小,但如果你要核算全国或大区域总量,面积权重就不能省:
python复制weights = np.cos(np.deg2rad(so2.lat))
province_monthly_weighted = so2_china.weighted(weights).mean(dim=("lat", "lon"))
日度数据文件会大得多,处理思路一样,只是多了一个时间维度的循环。我建议日度数据不要一次性全读入内存,用xarray的open_dataset配合chunks参数按时间块处理,或者干脆写成循环分年读取。
5.3 重投影和缺失值处理的注意事项
如果你需要把数据跟其他来源的格网数据做叠加分析,必然涉及重投影。这里有一个重要的经验:SO2浓度场的空间连续性比较强,用双线性插值重投影,视觉效果平滑,但会人为抹掉高值点的峰值,区域总量也会被轻微稀释。对空气质量数据,如果你的下游分析是区域总量或极端值,考虑用保守重投影方案,这样每个目标像元的值是源像元的面积加权平均,物理含义更严谨。
缺失值处理是我见过翻车最多的地方。卫星反演带来的缺测,在日度数据里非常普遍。处理前必须搞清楚:文件里的NaN是真的没有观测,还是已经被插补算法填充过了?如果产品本身已经做了时空插补,那NaN格网可能很少;如果没做,那日度数据的空间覆盖率可能只有百分之六七十。这时候直接对每个格网算时间均值,会把有云天的浓度系统性剔除掉,导致平均浓度偏高或偏低。稳妥的做法是先统计每个格网的有效率,在有效率低于某阈值的区域标记为不可靠,并在论文里如实报告。
6. 使用中大概率会遇到的问题清单
最后一部分,我把几个反复遇到的坑集中列出来。这些问题有些是我自己在处理SO2数据时踩过的,有些是我在帮别人看数据处理流程时发现的,每一条都对应真实的教训。
| 现象 | 可能的根因 | 处理建议 |
|---|---|---|
| 日度数据大面积NaN | 云覆盖导致卫星反演缺测 | 优先选已完成插补的产品;自行插补时用时空克里金或先填补后平滑,不要简单填0 |
| 区域平均与站点平均差异大 | 站点集中在城区,格网平均包含乡村背景 | 分城市建成区和背景区对比,不要混在一起说 |
| 某年冬季浓度异常偏低 | 边界层方案调整或反演输入变化 | 检查产品版本说明,跨版本数据拼接要谨慎 |
| 产品出现负浓度值 | 弱信号下反演噪声允许出现负值 | 数据本身可能无偏;直接截断为0会系统性高估浓度 |
| 省界处出现浓度突变 | 掩膜边缘像元混合了邻省格网 | 统计省级序列时做一次缓冲区腐蚀,去掉边界一圈 |
| 跟站点对比R很高但MB很大 | 验证站点与格网空间尺度不匹配 | 改用9格网邻域均值对比;检查站点是否代表局地高值 |
| 重投影后区域总量变化 | 插值方法导致浓度平滑或稀释 | 做总量研究时使用面积权重的保守重投影 |
负浓度这一点我多说几句。很多第一次用卫星反演产品的人,看到SO2浓度是负值会吓一跳,以为数据出了问题,直接把这些格网改成0。这种做法在平均时会人为抬高浓度,因为负值和正值都是噪声的组成部分,它们相互抵消才是无偏的。合理做法是保留负值用于趋势和平均分析,只有做健康暴露计算时,才考虑做截尾处理(比如将负值替换为该格网时间序列的第2.5百分位数),同时说明这种处理对暴露估计的影响。
另一个很隐蔽的问题是政策或日期字段的错位。有些产品的时间戳用的是UTC时间,中国在东八区,UTC时间某天的数据实际对应北京时间当天和昨天的混合时段。你如果直接把UTC日期当本地日期去跟健康数据匹配,会造成一天的暴露错位。SO2的健康效应滞后通常在0到2天,错位一天对效应估计的影响可能非常大。拿到数据第一时间检查时间坐标是UTC还是本地时间,并且在代码里统一转换。
还有一个关于OMI数据的年代问题。OMI传感器的信号在2013年之后逐渐退化,特别是行异常现象导致部分扫描行数据缺失或偏差。如果这套高分辨率产品的前期年份主要依赖OMI反演,那2013到2015年之间的数据会比后期有更大的不确定性。使用前几个年份的数据时,我会习惯性对比同期的OMPS或地面观测,确认没有出现趋势性的突变。如果是跨传感器拼接的产品,还要关注拼接时间点是否与统计模型的训练结构一致。
最后分享一个我自己的使用习惯:每次拿到新数据集,先用最快的速度拉一条目标区域的年度均值时间序列,跟国控站点平均做一次对比,看看趋势是否吻合。如果趋势都对不上,后面再精细的统计都没有意义。如果趋势一致,再按需求逐步深入。这个习惯帮我过滤掉了很多表面精度高但实际趋势有问题的数据产品。
做SO2浓度的精细时空分析,这几年确实比以前顺手多了。从OMI时代“一个大点的方块”到今天的1km格网,这种分辨率上的进步,本质上是把卫星遥感、化学传输模式、地面观测和机器学习这几条原本平行的技术路线拧成了一股绳。数据产品再漂亮,终究是辅助工具,真正决定研究质量的,还是你对误差结构的理解和每一次预处理时对细节的较真。希望这篇文章里的经验,能让你的SO2研究少走几步弯路。
