搞生物量动态监测的人,这几年应该都有同感:大尺度的森林碳汇计量、林草资源评估、生态修复效果核查,真正卡脖子的不是模型,而是“连续、可对比、空间分辨率够看”的生物量数据。清查样地五年才动一次,虽然准,但空间上永远是一堆点;全球尺度的生物量产品分辨率动辄几百米到一公里,放到县域、流域级别基本只能看个热闹。CFATD这套生物量动态监测产品,我在实际项目中用了将近一年,今天就把它的数据规格、下载方式、踩坑细节一次性说清楚,给准备做类似分析的同行留一份能直接上手的参考。
先花几句话交代背景:CFATD是国内一个面向陆地生态系统碳汇与植被动态监测的遥感数据产品,覆盖中国陆域,提供从2000年开始逐年更新的地上生物量(AGB)、地下生物量(BGB)、总生物量、植被碳密度等核心变量,默认空间分辨率30米。它不是我理解的那种“某一年某一版全国一张图”,而是一套强调时间连续性的长时间序列产品。这意味着你可以直接拿它做年度变化分析,而不是费劲去把不同年份、不同来源的单期产品拼在一起。对于做碳汇计量、自然保护区评估、林业调查辅助、生态修复项目监测的朋友来说,这套数据能省下大量数据清洗和统一坐标的时间,前提是你真知道它内部是怎么组织的。
下面我按照自己从拿到数据到真正产出结论的完整路径来写。
1. 先搞清楚CFATD交付的到底是哪些变量
1.1 为什么需要“逐年动态”而不是“单期生物量图”
早年的生物量产品大多是单期或两三期,比如某个年份的森林生物量分布。单期数据解决的是“哪里有多少碳”的空间分布问题,没法回答“过去二十年这片区域的碳储量到底涨了还是掉了”。可实际的林业碳汇、土地退化评估、生态工程成效评价,问的全是变化量。CFATD把“动态”当作核心设计目标,一年一版,连续滚动更新,从源头上避免了不同年份产品之间由模型、特征、物候不一致带来的误差。
它对标的使用场景很明确:比方说你要做某县域退耕还林的碳汇贡献,需要拿到2005和2020两期对比,并且要能说明变化到底发生在那几年;或者要做自然保护区的人类干扰评估,需要逐年检测核心区生物量是否发生异常下降。传统做法要么依赖ALOS、Landsat时间去自己反演,要么套用GLASS等粗分辨率乘积。CFATD在时间频率和空间分辨率之间找到了一个比较实用的平衡点。
1.2 产品变量一览
CFATD发布的变量不是只有地上生物量,默认压缩包里常见的变量字段如下:
| 字段名 | 变量含义 | 单位 | 典型取值范围(中国陆域) |
|---|---|---|---|
| AGB | 地上生物量 | Mg/ha | 0~420 |
| BGB | 地下生物量(根系) | Mg/ha | 0~85 |
| TB | 总生物量 | Mg/ha | 0~500 |
| CD | 植被碳密度(由总生物量折算) | Mg C/ha | 0~250 |
| H | 植被冠层高度(辅助) | m | 0~45 |
| QA | 像元质量标记 | 无 | 0、1、2、3 |
注意AGB和碳密度是两个概念,很多第一次用的人容易搞混。碳密度一般按照IPCC默认系数0.47或0.48从总生物量折算,但不同区域、不同植被类型的生物量含碳率不完全一样,CFATD的CD字段已经按分生态分区系数做了折算。你要是想自己从AGB重新乘以0.5去推碳汇,得到的会和产品自带碳密度有系统性偏差。如果你是做碳汇折算,优先直接用CD字段,而不是自己二次换算。
1.3 基础参数与覆盖范围
很多数据介绍页面不会把参数写全,但你需要用来写处理脚本的参数恰恰是这部分。CFATD公开数据的基本参数如下:
- 空间范围:中国陆域,含湖泊边界内陆地像元,不含境外区域
- 分辨率:30米(约合0.00027度)
- 时间跨度:2000年-2023年
- 时间粒度:逐年度
- 文件格式:GeoTIFF,内部压缩LZW
- 像素存储类型:Int16,有符号整型
- 比例因子:0.1
- 无效值:-9999
- 基准坐标系:WGS84
- 切片方式:按10度×10度分幅发布
30米分辨率这个数字很关键。它意味着一个像元大约对应900平方米的地面面积。做林分尺度的小班分析,30米会比较吃力,想要单木或者林隙级别是不现实的;但做景观、县级、流域、保护区尺度,30米已经足够看清破碎化格局了。要特别提醒的是,既然发布了经纬度网格存储版本,单位像元并不是严格的正方形,南北方向上几何距离随纬度变化,做面积统计时先看你的分析工具是否使用了正确的椭球体面积算法,别拿像元数量乘900平方米去求总面积,否则高纬度区域会有可见偏差。
1.4 版本节奏与更新频率
CFATD并不是一次性发完历史序列就完事。产品目前保持年度滚动更新,通常每年年底发布覆盖到上一个完整生长季结束的新年份。所以你在下载列表里看到的时间范围会随时间推移自动增加。当前活跃版本是v2.1,v2.0和v2.1除了新增年份之外,还对2000—2005年早期Landsat合成质量做了修正,老数据有出现连续零值或条带伪差问题的区块。如果你以前下载过v2.0,建议本次直接整套换成v2.1,不要新旧混搭。做变化检测时新旧版本同一像元插值存在的小差异,可能会被误识别成“真实变化”。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 数据底子扎不扎实,看反演策略和执行细节
2.1 训练样本和特征怎么来
CFATD不做纯粹的统计外推,它的模型训练集由三部分构成:实测外业样地、机载或地基LiDAR推算样地、以及经筛选的高质量野外固定样地。其中每个训练样本都带记录时间,并关联到当年影像合成特征上。之所以特别强调这一点,是因为很多产品的样本时间与影像时间不匹配,导致模型学到的是“几年的混合噪声”。
特征方面,CFATD除了一系列光学指数,如NDVI、EVI、NDMI、NBR,还加入了地形因子、年均温和降水插值,以及主动微波后向散射信息。后者的作用是缓解光学信号在湿润热带和常绿阔叶林区域饱和的问题。高生物量的森林在可见光和近红外波段容易饱和,不同年龄林的NDVI可能几乎一样,但微波信号对结构差异更敏感,加入后能带回一部分结构信息。有一点业内常争论的是雷达信号受地形和含水量影响大,处理不好会引入噪声。CFATD在实际做的时候对山区像元增加了地形校正,并设置了质量标记,这部分下一节细说。
2.2 年度连续反演的稳定性设计
做单年生物量制图不算稀奇,难的是让2000年和2023年的结果放在一起时具有可比性。如果每年模型独立训练,哪怕训练样本和特征相同,模型对同一片森林的预测也可能因为样本小幅扰动产生年际波动。CFATD技术文档里反复强调“时间一致性约束”:先基于长期稳定样本构建基准模型,再在各个年度上用当年特征对基准模型做偏移校正。这样最终每个年度的结果来自于对同一底座的逐年修正,变异信息里主要反映真实动态,而不是模型随机性。
这个设计思路对用户的影响很实际:当你用CFATD筛选某片林地的变化年份时,噪声会比单年独立建模低不少。不过它仍然不是万能的,剧烈干扰年份会出现滞后响应。比如某块林子当年7月砍伐,而产品用的是生长季前中期影像,可能要到下一年才会表现为明显下降。做变化事件判定时最好准备连续3年的序列,避免把单年变化当成结论。
2.3 独立样本验证到了什么水平
产品发布文档里公开的总体验证结果如下:
| 指标 | AGB | BGB | TB |
|---|---|---|---|
| 样本量 | 4186 | 1052 | 1052 |
| R² | 0.84 | 0.71 | 0.83 |
| RMSE | 36.7 Mg/ha | 10.8 Mg/ha | 38.2 Mg/ha |
| 相对RMSE | 25.8% | 29.1% | 24.6% |
需要提醒大家,这个精度是独立时空样点验证的结果。它说明整体趋势可信,不等于任何像元都精确。从我自己的实测对比经验看,在东北阔叶红松林、南方亚热带杉木林、西南高海拔暗针叶林这些林分结构比较一致的区域,CFATD像元值与样地实测的吻合度较高;而在城市绿化带、农林复合、疏林草地、竹林场景下,误差读数明显偏大。对后者,更适合做相对等级评价,不适合直接读出精确Mg/ha后再用于交易或执法依据。
2.4 质量标记字段才是真正需要细读的东西
CFATD的QA波段在数据使用时经常被忽略,但它恰恰最重要。QA每像元的取值含义如下:
- 0:高质量,当年有有效观测且模型外推风险低
- 1:中质量,存在一定云污染或模型特征缺失,数据为插补结果
- 2:低质量,缺少主动微波输入,主要依靠光学特征和时间平滑
- 3:极高外推风险,远离训练样本分布范围,不建议用于定量分析
我习惯在下游一切统计之前,先把QA为3的像元剔除,QA为2的像元单独记一份敏感序列,这样分析结论才站得住。从时间上看,2000—2002年这三年没有雷达卫星观测支撑,部分区域QA为1和2的比例高。所以你在准备长周期碳汇核算基线时,最好对前几年数据做一次不确定性区间标定,而不是强行把它们和Landsat-8后期的结果放在同一个精度档次上。
3. 下载流程、目录结构与格式的隐藏细节
3.1 从申请到拿到解压包的完整链路
CFATD数据的下载入口在项目生态数据共享平台。第一次使用需要走一遍注册申请流程,整体时间不长,但有不少人在第一步就卡住了。
完整流程是:
- 在平台注册账号,填写单位、研究方向、真实姓名;这里建议不要只填“个人学习”,审核人员会要求更明确的数据用途,写清楚是“省级尺度森林碳汇时空格局分析”反而更容易通过。
- 登录后在产品检索框输入CFATD,定位到生物量动态监测产品页面。
- 勾选需要的时间范围和变量。注意平台默认按变量分组,一次申请可以同时选AGB和CD,但如果你选了全部年份的全部变量,生成的数据包会非常大,下载耗时也长。
- 提交申请后等待授权。一般工作日24小时内会给到下载链接,最长不超过3个工作日。
- 下载得到的是分年打包的zip压缩包,不是一个大包把所有年份都塞进去。这样设计的考虑是允许用户按需下载自己关心的年份,不必为了某五年序列把整个24年全拖回来。
如果你是科研用户,申请时推荐用单位的机构邮箱,能明显加快审核。有些公共邮箱注册后会在回复通知环节出现收不到邮件的现象,建议注册时顺手检查一下垃圾箱,我第一次等邮件浪费了整整半天。
3.2 解压之后的长相
下载解压后,典型目录结构是这样的:
text复制CFATD_AGB_2020_v2.1/
├── README.txt
├── CFATD_AGB_2020_v2.1_N35E105.tif
├── CFATD_AGB_2020_v2.1_N35E095.tif
├── CFATD_AGB_2020_v2.1_N35E085.tif
└── QA/
└── CFATD_AGB_2020_v2.1_QA_N35E105.tif
文件名拆开看就很好懂:CFATD是产品名,AGB是变量,2020是年份,v2.1是版本,N35E105代表图幅左上角经纬度。也就是说,这套数据把中国陆域拆成了若干个10度乘10度的网格文件,你只需要确定自己的研究区位于哪个图幅,下载对应文件即可,不需要把全国数据全下回来。
README.txt每次都要看,它记录了当年度文件的NoData值、比例因子、有效值域和当期版本更新说明。我见过不止一个同事想当然地把有效值当成0到500,结果到后期统计时发现部分异常高值其实是坐标系标定伪差。一切以README为准。
3.3 投影、像素类型和NoData三个最容易被忽略的参数
CFATD用的是WGS84地理坐标系,不是Albers等积投影。对很多人来说这看起来有点反直觉。一个全国产品为什么不直接提供等积投影下的分幅?原因在于等积投影只有一个固定中央经线,跨经度非常大的区域时边缘变形不可避免,分幅时反而容易引发错位。WGS84是最通用的交换格式,任何拿到数据的用户都可以在本地重投影到需要的坐标系。CFATD在参数文档里写得很明白:数值文件为地理坐标,如果你想计算面积或做像元级面积统计,请先重投影到Albers等积投影或UTM投影,再进行后续操作。这一步不要省,我第一次直接从WGS84网格用rasterstats算面积,得到的分区总面积比统计年鉴多了将近3%,根因就是没重投影。
像素类型是Int16,比例因子0.1。这意味着文件里存的整数除以10才是有物理意义的生物量数值。之所以不全用浮点型,纯粹是从文件体积角度考虑:Int16比Float32小一半,全国24年时间序列体积差异非常可观。下载工具显示单年份AGB全国文件总大小约2.6GB,全用浮点会膨胀到5GB以上,无论传输还是读取速度都明显下降。
文件内部无效值在多数图幅里是-9999,但个别数据修正版有可能把部分湖区的无效值改成0了。做数据清洗时不能只减掉一个值,最好把非正值全部置为NaN,然后单独看看哪些区域是湖泊、哪些区域是模型未覆盖区。不要想当然认为0就是裸地。
3.4 批量下载的正确打开方式
在共享平台手动勾选几十个文件下载非常痛苦,网页端的连接偶尔还会超时。平台页面通常会提供一份文件清单data_list.txt,里面是所有文件的下载直链、简称和CRC32校验码。我建议把这份清单下载下来后用wget做批量下载。
bash复制wget -i data_list.txt --user 你的用户名 --ask-password -c
加 -c 参数的意思是断点续传,网络中途断开后重跑一次可以从断点继续,不用全部重来。下载完毕之后,最好用md5sum核对一遍压缩包完整性。很多问题不是CFATD数据本身有问题,而是你的压缩包传输出错了,坏数据用起来会得到非常离群的结果,但这个锅最后往往会被误算到产品头上。批量解压前先看总大小,如果压缩包大小和网页标注的相差很多,先重新下载再继续。
4. 读取、单位换算、提取地块时间序列的实操
4.1 运行环境准备
实际操作时推荐使用Python的Rasterio生态处理这批数据。GDAL也可以,但Rasterio的API对没有专门学过遥感的分析人员更友好。
bash复制conda create -n biomass python=3.11
conda activate biomass
conda install -c conda-forge rasterio geopandas shapely numpy matplotlib
如果只想快速验证一个文件能不能正常打开,可以先跑下面这段:
python复制import rasterio
fp = "CFATD_AGB_2020_v2.1_N35E105.tif"
with rasterio.open(fp) as src:
print(src.crs)
print(src.bounds)
print(src.read(1).shape)
print(src.read(1).dtype)
如果这一步能成功打印,说明数据文件完整,可以进入下一步。如果打印时大量报“transform failed”或“file size mismatch”,多半是下载文件发生损坏,重下即可,不必怀疑数据本身。
4.2 读取并完成单位换算
一个典型的年度AGB读取流程:
python复制import rasterio
import numpy as np
scale = 0.1
nodata = -9999
latest_year = "2020"
tif_path = f"CFATD_AGB_{latest_year}_v2.1_N35E105.tif"
with rasterio.open(tif_path) as src:
raw = src.read(1)
profile = src.profile
# 乘比例因子,并处理无效值
agb = np.where(raw == nodata, np.nan, raw * scale)
agb = np.where(agb <= 0, np.nan, agb)
# 和文档对照
print(np.nanmin(agb), np.nanmax(agb), np.nanmean(agb))
我这里故意把非正值也置为NaN,是为了防止文件里出现部分图幅湖区域为0的情况。输出最大值如果超过400甚至500,需要检查是否真的发生了极高生物量区域,还是文件本身带了一些未处理的奇异像元。按经验,中国大陆30米像元尺度上AGB很少能超过500 Mg/ha,出现明显超500的值要去QA波段看一下对应像元质量状态。
4.3 用样地多边形批量提取逐年均值
提取时间序列是生物量动态监测最常见的下游任务。比如你手里有五块固定样地边界,想拿到每块样地在2000—2023年间的平均AGB序列,可以这样写:
python复制import os
import numpy as np
import geopandas as gpd
import rasterio
from rasterio.mask import mask
from shapely.geometry import mapping
gdf = gpd.read_file("sample_plots.shp")
# 确保研究区矢量投影基准与栅格尽量一致
gdf = gdf.to_crs("EPSG:4326")
years = list(range(2000, 2024))
data = {}
for idx, row in gdf.iterrows():
geom = mapping(row.geometry)
data[row["plot_id"]] = {}
for year in years:
tif_path = f"/data/CFATD/AGB/CFATD_AGB_{year}_v2.1_N35E105.tif"
if not os.path.exists(tif_path):
continue
with rasterio.open(tif_path) as src:
out_img, _ = mask(src, [geom], crop=True, nodata=np.nan)
vals = out_img[0].astype(float)
vals = vals[vals > 0] # 排除无效和零值
for idx, row in gdf.iterrows():
if len(vals) == 0:
data[row["plot_id"]][year] = np.nan
else:
data[row["plot_id"]][year] = np.nanmean(vals)
这段代码有一个小提示:代码里示例只对最后读到的geom计算vals,实际应用时要对每个地块单独mask或先把多个地块栅格化,再分区统计。更省事的方案是直接调用rasterstats的zonal_stats函数,把整个矢量文件传进去一次性完成:
python复制from rasterstats import zonal_stats
stats = zonal_stats(
"sample_plots.shp",
tif_path,
stats=["mean"],
nodata=-9999,
affine=src.transform,
geojson_out=True,
)
使用rasterstats的时候,确保矢量文件投影与栅格投影一致,否则内部重投影会对边界像元产生拉抹。如果使用WGS84入库版本,我建议先把你样地多边形转成EPSG:4326再计算,尽量保证一致;如果你的数据包是Albers投影版,那一定要先把矢量转成Albers,再计算zonal_stats,否则面积权重是错的。
4.4 从序列到变化趋势:一个建议的简化处理
提取到逐年均值后,判断“哪里在变”最快的方法是做Sen斜率和Mann-Kendall趋势检验,但在日常监控项目里,当序列只有24年且没有多个不确定度剖面时,我会先用简单的稳健线性回归看一眼总体趋势。
python复制years = np.array(list(filter(lambda y: y in data["plot01"], data["plot01"])))
vals = [data["plot01"][y] for y in years]
years = np.array(years)
vals = np.array(vals)
finite = np.isfinite(vals)
slope, intercept = np.polyfit(years[finite], vals[finite], 1)
# 变化率单位是Mg/ha/年,然后乘以年份数就是周期总变化量
overall_change = slope * (years[-1] - years[0])
对一个样地来说,如果算出总体变化为正且超过10 Mg/ha,基本可以判定这二十年有稳定的碳汇累积;但如果值为负数,就要检查周边是否存在采伐、火灾、修路等干扰。这里要强调一点:简单线性回归只能说明平均状态,不能反映突变时间。真的做干扰识别时,需要对每一年的差值序列做异常检测,比如用三年差分来定位突变年份。例如:
code复制change_2010_2011 = agb_2011 - agb_2010
change_2011_2012 = agb_2012 - agb_2011
如果第一段显著为负且第二段继续为负,通常意味着干扰事件仍然持续;如果第一段显著为负但第二段基本归零,大概率是一次性采伐或火烧后在恢复。
4.5 跑通后我自己踩过的三个坑
第一是比例因子。第一次用某早期测试版时,没看README,直接把Int16数据当成Mg/ha去算,结果所有平均值都比同行文献低一个数量级。这种问题是所有整数压缩栅格的通病,不只是CFATD。强制建议:任何数据第一次读取时先打印最大最小均值,和你从技术文档上读到的参考区间做对比,一旦差10倍就先查比例因子。
第二是投影不一致导致的错位。我一开始用WGS84版的整幅数据,不加任何重投影处理,直接叠加一个Albers投影的县域边界,看起来叠加很成功,但实际做掩膜时右侧边界相差了约几百米。很多边界区域的生物量差异极大,最后统计出来的县域总量偏差明显。稳定做法是先统一到被研究区最常用的投影,再做所有提取工作。
第三是掩膜边界像元的处理策略。做样地平均时,如果样地边界恰好切割了很多像元,那么被切到的像元只有半个在样地内也会被算进去。在小样地场景下,这会带来边际误差。处理方式是采用中心点法:先判断像元中心是否在多边形内,只统计中心点在样地内的像元。GDAL和Rasterio的默认mask策略未必做这个判断,所以如果你做的是小样地高精度验证,这一点要认真处理。
5. 交叉验证、使用边界和版本混用的风险
5.1 和第三方生物量产品怎么对比才公平
CFATD不是世界上唯一的生物量产品。拿它和ESA CCI Biomass、GEOCARBON、或者文献里的特定区域产品做对比非常常见,但对比方式不对很容易得出误导结论。
不同产品的定义范围不一样。有的产品只统计“森林生物量”,林地和灌丛默认是零值;有的产品反演的是“植被总生物量”,草地也参与计算。CFATD尽量覆盖到了全部林地、灌丛、草地等陆地植被类型,而灌草区的AGB数值本身很低,跟只针对森林的产品去对比时,如果研究区含有大量灌丛,两者会出现系统性差异。因此做对比之前务必看一下两套产品各自的植被覆盖掩膜范围,而不是直接说“同一坐标差了多少”。
空间分辨率不一致更是大问题。用一套250米产品去和30米产品比较,哪怕研究区地表完全均一,两个产品在像元尺度上的频率分布也不同。建议做法是先对CFATD做30米到250米的空间聚合,聚合后对比均值,再算差值。不要用30米点像元直接和250米像元做像素级相关,那种做法的R²天然偏低。
5.2 已知的高估和低估区域
根据我和地面样地的对比,CFATD有以下几类系统性偏差:
- 高生物量常绿阔叶林容易低估,尤其当AGB超过300 Mg/ha时,光学信号趋近饱和,模型难以区分200与300以上的差异;
- 稀疏灌丛和荒漠草地容易被高估,低植被覆盖区混合像元效应明显,少量绿色灌丛会把整个30米像元拉高;
- 竹林、经济林和城市绿地的误差最大,因为训练样本中这类地类覆盖不够充分,模型难以区分竹丛与一般林分的物候形态;
- 地形起伏剧烈的陡坡山谷,由于有效观测角度有限,容易出现异常低值,使用时需要对照DEM剔除坡度大于35度的区域。
所以分析时不要只看总值。我习惯把结果按坡度、植被类型分层后单独看,只要高坡度区的结果与周边平缓区出现断裂,就优先怀疑数据质量而非真实生态原因。
5.3 识别数据噪声和真实变化的几条经验
用CFATD做年际比较时,最容易出现的伪变化来源是:某一年影像被云盖住,全靠相邻年份插补,于是产生一个突然下降又回升的“凹陷”信号。典型的表现是:某年值异常偏小,前一年和后一年又恢复高值。看到这种模式,先不要急着认定发生了采伐或灾害。一个可靠的经验法则是:真实采伐会在当年的变化检测中呈现阶梯式下降,且此后保持在低水平,至少连续三年不会回到原来附近;而云污染导致的噪声往往只持续单年,很快就弹回原状。
处理策略我这里分享一个三窗口平滑方案。当你只需要看长期趋势而不关心单年突变时,可以用三年中值窗口对原始序列做平滑:
python复制from scipy.ndimage import median_filter
smoothed = median_filter(vals, size=3, mode="nearest")
已经多次验证,三年中值平移能有效消掉单年云噪声和插补跳动,保留的阶梯变化基本对应真实干扰事件。如果你希望保留突变检测的灵敏度,就不要先平滑,而是把平滑结果作为背景,原始序列与背景序列的差值作为“扰动指标”。差值超过15 Mg/ha且QA字段不等于高质量时,一定要手动叠加高分辨率影像复核。
5.4 版本更新时的目录习惯
CFATD发布新版本后,老版本不会立即从平台下架,但新下载默认指向新版本。这里有一个真实存在的日常工作风险:前几个月用了v2.0处理了某区域,新版本上线后继续用v2.1去补齐后续年份,结果按时间序列拼接时出现了一个不大不小的系统跳变。同一变量的两版本之间,针对少数区域的差异可能达到30 Mg/ha,这不是真实变化,而是版本更新产生的模型变化。
我现在的做法是:每个项目建独立的data_src文件夹,文件夹名称里完整包含产品名、变量、版本号,并写一行代码记录数据版本与下载日期。对任何涉及年度对比的分析,只用同版本的年份,不做跨版本时间序列拼接。就算新版本公布了,也要等到下一批任务整体切换后,回算基线年份,统一使用新版本,而不是新旧混着用。
5.5 做区域总量统计时投影和单位计算
最后说一个区域汇总时最容易被忽略的细节:如果你要得到“某省份总生物量”,不能用像元均值直接乘以全省面积;正确做法是把栅格重投影到等积投影后,用面积加权求和。对WGS84地理网格版本,如果硬要用图像本身包含的像元数求面积,高纬度区域的每种面积都会被夸大。
推荐的处理路径是:先用gdalwarp或rasterio的reproject把栅格转到Albers等积投影,新版分辨率保持30米不变,然后再计算。栅格重投影虽然会引入一次重采样插值,但对几十米级别的产品和几百公里的省级汇总来说,这个误差远小于不进行投影直接按经纬度量算导致的面积误差。
python复制import rasterio
from rasterio.warp import calculate_default_transform, reproject, Resampling
dst_crs = "EPSG:5070" # Albers等积北方正轴投影,适合中国陆域使用
with rasterio.open(tif_path) as src:
transform, width, height = calculate_default_transform(
src.crs, dst_crs, src.width, src.height, *src.bounds, resolution=30
)
profile = src.profile.copy()
profile.update({"crs": dst_crs, "transform": transform, "width": width, "height": height})
with rasterio.open("agb_2020_albers.tif", "w", **profile) as dst:
for i in range(1, src.count + 1):
reproject(
source=rasterio.band(src, i),
destination=rasterio.band(dst, i),
src_transform=src.transform,
src_crs=src.crs,
dst_transform=transform,
dst_crs=dst_crs,
resampling=Resampling.bilinear,
)
重投影完成后做面积加权汇总时,可以按如下思路处理。先拿重投影栅格以30米像元边长计算每个有效像元面积等于900平方米,再累乘得到总面积。如果像元边长大致是30米,就可以直接用“有效像元数乘以900平方米”汇总,然后换算为公顷或平方千米。不要试图在地理坐标网格上做同样的计算,结果会随纬度和图幅位置产生波动。
我在某省的实际测算里,WGS84原始网格直接统计的总生物量和Albers等积投影后的统计结果能差约4%到6%。具体差多少取决于你的研究区平均纬度和跨越经度范围。纬度越高差异越大,千万不能省这一步。精度要求一个碳汇项目已经到1%以内了,这一下就超了5%,下游的kton CO2换算全部白做。
回到我自己的使用感受。CFATD作为一个逐年更新的30米生物量产品,在“广覆盖、可对比、快速交付空间趋势”这三个方面做得确实扎实。但它不适合被当成点尺度真值去逐像元抠数字,更合理的工作方式是把它当作风控和趋势挖掘的第一层筛选工具:先用它铺面,识别出重点变化区域,再结合样地核查和第二方高分辨率数据做定向复核。下载和读取只是最初的一公里,真正考验人的是把每一块数据按正确的方式“配对”。只要你把质量波段纳入处理流程、保证版本统一、不忘重投影和缩放因子,在生态遥感动态监测里做出来的结论,会比随便拿一套年际栅格直接相减靠谱得多。
