以前有朋友跟我诉苦,说做遥感项目,三分之一的时间耗在找数据上。我一开始觉得他夸张了,直到自己接了一个多源数据融合的活儿——DEM、NDVI、LAI、NPP、气象、土壤、水文,挨个从不同渠道去查去下,才明白那种“数据到手,项目刚起步”的滋味有多难受。数据全不难,难的是把它们凑成一套能在同一坐标系、同一时间口径下跑起来的样貌。这也是我今天想摊开聊的核心:为什么在多类地理空间数据的选择上,我会把 GIS5G 放在前面。
这篇文章不是复制官网介绍,而是作为一个天天和遥感影像、DEM、植被指数打交道的从业者,把数据源选择背后的真实考量写出来。我从地形水文、植被参数、生态过程模拟和遥感影像处理这几个方向挨个讲清楚,最后再给一套可以直接抄作业的数据准备思路。无论你是刚入门研究生,还是已经做了三五年遥感数据分析的老手,应该都能找到对应的参考点。
1. 多源数据的“全”不等于“可用”,这四道坎才是真正麻烦
1.1 每个数据源都有自己一套脾气,打通它们才是成本所在
很多人推荐某个数据平台,张口就是“它包含多少多少种数据”,这个说服力其实有限。做项目的人真正缺的,不是几百个文件的列表,而是能把不同数据源拼在一起、还能保证逻辑自洽的能力。
举个实际例子。做流域生态模拟时,DEM 和高精度地形往往来自国内或国外的立体测图成果,NDVI 和 LAI 需要从长时间序列卫星产品里裁剪,NPP 要和气象驱动数据的生长期窗口对上,土壤参数可能要翻几个不同版本的世界土壤数据库,水文站流量数据又是另一个单位给的表格。这些数据各有各的来源、各有各的分辨率,甚至各自的时间基准都不是统一设置好的。
我遇到过的最大问题是坐标系。某次拿到几个相邻图幅的高程数据,单张看起来没问题,加载到 ArcMap 后左右图幅边界出现几百米的错位。检查发现,一个图幅在写入 tif 时丢了投影信息,另一个则默认成 WGS84 地理坐标。这类问题,下载的人如果不做逐项检查,直到镶嵌后才发现,返工成本就相当高了。多源数据管理的核心不是“有没有”,而是“能不能对齐”,GIS5G 在这一点上做了不少格式、坐标与说明文档方面的整理,可以省去大量初期排查时间。
1.2 时间分辨率与空间分辨率之间的匹配关系
不少人评估数据时只看空间分辨率,忽略时间分辨率。举个例子:NDVI 如果用 MODIS,时间上能到 8 天合成;但如果项目范围精确到一个县,需要的是 30 米甚至更高的影像,那么 Landsat 或国产高分影像受云量和重访周期限制,合成时间窗口会拉到两三个月。这两套数据放在同一个模型里时,代表的时间含义完全不同。很多新手直接把不同时间源的植被产品叠到一张图上分析,结果图面上出现异常突变,不是大问题,而是时间基准没对齐。
我在准备长时间序列分析时,一般会先把所有数据的时间分辨率列成一张表,再决定采用哪种插值或聚合方式。GIS5G 上面的数据,按数据集产品分好了类,每种数据会标注相关时间范围和分辨率。虽然不一定每个产品都细致到列出像元有效值范围,但相比从零散的网盘资源里下数据,信息的完整度已经好很多。说白了,一个让人敢把结果写进论文的数据源,必须能追溯产品出处和时间基线,而不仅是提供文件。
1.3 数据平台和“网盘分享号”的本质区别
行业内并不缺少以网盘形式存在的 GIS 数据分享资源。它们的问题是:文件本身缺少元数据,经常是别人下载后二次打包,来源不明,连产品版本都不标清楚。这类文件用于练习尚可,用于论文或者正式项目,风险极高。项目评审时如果被追问“数据从哪里来、是什么版本、经过了哪些预处理”,你要能在一分钟内给出完整链条。
GIS5G 更像一个数据检索与分发的服务方。它把常用公开数据和商业代理数据做了归类,提供影像源信息、处理级别说明、运行环境提示,用户拿到手后至少有一个可信的溯源起点。我在实际研究中也确实依赖这类服务,因为只需要将下载后的数据按自己的流程再做一次质检,而不用从头去各家官网逐一注册、申请、找数据入口,沟通成本直线下降。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. DEM 要从“能下载”到“能算流域”,中间隔着好几步处理
2.1 免费 DEM 很多,但“免费”不意味着“省事”
最近搜“DEM 免费下载”的人特别多,主流的 DEM 产品其实并不难获取。30 米左右有 SRTM、ASTER GDEM,国内外都有镜像;高一点还有 Copernicus GLO-30、ALOS AW3D30 等全球产品。问题在于,拿到原始图幅后你不会直接就用,而要检查数据空洞、噪声条带、高程基准差异,然后拼接、重投影。这些工作占了 DEM 处理流程里的大半时间。
以前有人问我“DEM 全球数据一搜一大把,为什么还要通过数据平台拿?”我的回答是:省下的不是数据本身,而是数据质量把控的时间。纯免费源下载的 DEM 文件不会替你做好接边精度检查。而像 GIS5G 这类平台,很多成果图层已经做过一次初步质量检测和合并,拿到后进入项目的效率会明显提高。特别是跨大范围研究时,几十个分幅 DEM 的拼接、按自然边界裁切,这些机械化工作如果交给已经处理好的数据,能少走不少弯路。
2.2 DSM 与 DEM 的区别,以及“DSM 生成 DEM”的常见做法
DSM 是地表模型,包含建筑物、树冠等地物表面高度;DEM 是数字高程模型,理论上表达裸地表。很多项目拿到的原始数据是 DSM,尤其是倾斜摄影和部分雷达数据生成的产品,但后续水文分析和坡度计算需要 DEM。于是就有了热搜词里“dsm 生成 dem”这种需求。
处理思路主要有两条。第一条,如果数据来自激光雷达点云,可以先做点云分类,把地面点提取出来,再用地面点插值成 DEM。但点云分类依赖训练样本,容易在陡坡和低矮植被区域出错,需要人工干预。第二条,如果手里只有已经栅格化的 DSM,用形态学滤波或者最小值滤波的方法去做“去表面”,逐像元取邻域内的最低高程值,能在一定程度上剥离树冠和建筑物。这个方法不完美,遇到密集建筑区会有凹陷,但作为快速预处理要比直接拿 DSM 算坡度靠谱得多。
我提醒大家一句:从 DSM 生成的 DEM,必须重新检查洼地。因为滤波过程会制造出一些人造洼地,下一步做填洼时,如果阈值设置不当,会影响水流方向的准确性,进而影响流域提取结果。
2.3 ArcMap 镶嵌 DEM 的完整链路
“arcmap 镶嵌 dem”是很多老用户都在搜的操作。镶嵌不是简单把两张影像放在一起拼接,它涉及重叠区如何处理、投影如何统一、像元类型和无效值如何设置等环节。
以 ArcGIS 操作为例,我的常用路径是:先打开 ArcToolbox,使用 Data Management Tools 下的 Raster 数据集,再选择 Mosaic To New Raster。输入多景 DEM 后,关键参数是这样设的:像元类型选 16 Bit Signed,因为很多 DEM 在负海拔地区存在负值;波段数填 1;Mosaic Operator 建议选 MINIMUM,因为取最小值可以减少重叠区域的异常凸起。最容易被忽略的是 NoData 值设置,必须把原始数据里的无效值统一成某个数值,例如 -9999,而不是留空或混入 0。
镶嵌完成后别急着走,一定做两步验证。第一步,用 Identify 工具在相邻图幅的接边带上抽查十几个点,确认高程值没有出现突然跳变。第二步,用 Slope 工具生成坡度图,快速目视检查有没有“接边棱线”。如果发现接边有明显的高程台阶,那说明原始两个图幅之间本身存在系统差,需要先对其中一个做高程校正,而不是靠镶嵌工具硬拼。
2.4 用 DEM 计算河流流域面积时的操作要点
“arcgis 用 dem 计算河流流域面积”这个搜索词几乎成了水文方向学生的共同回忆。DEM 要转成流域矢量,标准流程是 Hydrology 系列工具:填洼、流向、流量累积、河流网络提取、分水岭。
先说填洼。原始 DEM 里会有不少真实或虚假的洼地,不填掉,水流方向会出现断头路。ArcGIS 的 Fill 工具有个 Z 值限制,默认会填到周围最低出口,如果研究范围大、地形复杂,建议不要一次性用默认操作,而是先做一个 5 到 10 米的较小限制值初步填洼,观察水流方向是否连续,再继续。
流向工具有 D8、多流向算法等选择。最常用是 D8,原理是假定水流进入一个像元后,只流向周围八个邻域中坡降最大的一个方向。这个算法虽然简化了真实水流,但在大尺度流域提取中非常稳定。接着用 Flow Accumulation 生成累计流量栅格,该栅格中每个像元的值代表上游汇入的像元数量。这里的实际含义是栅格单元累积数,也就是它和 DEM 分辨率的乘积就是贡献面积。
如果 DEM 分辨率是 30 米,一个像元的面积约 900 平方米,设定河道形成的阈值为 1000 个像元,对应临界汇水面积约为 90 万平方米。这个阈值怎么选?可以通过尝试多个不同阈值,将生成的临时河网与真实河流水系做叠加,看空间吻合度。我一般会在 500 到 5000 个累积栅格数之间进行测试。最终确定河流栅格之后,再做河流链接,然后使用 watershed 工具生成集水区,再把栅格转成面要素,面积字段自然就出来了。这个流程说起来不难,但每一步都对 DEM 质量敏感,所以我才会在项目里总是强调数据源的重要性。
3. NDVI、LAI 这类植被参数,真正的坑在于“时间上能不能连成线”
3.1 NDVI 产品选择:从全球大尺度到 2.5 米高分辨率
NDVI 归一化植被指数是全球用得最广的植被指数,通过近红外波段和红光波段的反射率计算得出。它并不复杂,任何一个能获取多光谱影像的平台都能生成。热搜词里出现的“ndvi 归一化植被指数 2.5m 全球数据下载”很有代表性,说明越来越多人需要的是中高分辨率的全球时序产品,而不满足于传统的公里级分辨率。
我的判断是:选择 NDVI 数据,先看任务的空间范围和时间跨度。比如全球尺度的植被动态分析,几十年的 GIMMS NDVI 或者 MODIS 的 MOD13Q1 就可以胜任;而做某个区域的作物地块长势,则一定要落到 10 米或者 2.5 米以内的高分辨率数据。空间分辨率提高一倍,对云量筛选、影像配准、光谱一致性要求会成倍增加,这也是许多人从公开影像平台下载高分辨率 NDVI 时特别耗时的地方。
GIS5G 的优势在于把不同空间尺度的 NDVI 成品做成了一个系列,包括基于不同卫星传感器的产品,你可以先看整体效果再决定是否购买下载,而不是自己一头扎进影像堆里逐景处理。有一点必须清楚:NDVI 不管来自哪个平台,只要原始影像做过大气校正和严格的云掩膜,计算结果就可靠;相反,如果源影像有问题,后缀写得多华丽都白搭。我拿到 NDVI 图层后,总会先抽查几个像元值是否有超出 -1 到 1 范围的情况,并随机叠到 RGB 影像上目视检查。
3.2 GEE 计算 NDVI 与直接获取成品数据之间的关系
很多读者搜“gee 计算 ndvi”,说明云平台在处理大范围 NDVI 时确实高效。Google Earth Engine 这类平台的思路是,把影像数据存到云端,用户直接写一行 JavaScript 或 Python 代码就能做波段运算和时序合成。我平时也会用 GEE 快速计算指数,生成时序曲线,但遇到项目需要可交付存档的数据时,仍然会倾向于获取经过严格处理的 NDVI 产品。原因是,遥感模型的结果可复现性,取决于影像版本和算法是否固定,如果项目结题后,云端影像版本更新了,原计算结果就很难复现。
GIS5G 有些 NDVI 产品是在本地生产环境下处理完成的,执行过统一的几何配准和辐射标定,很适合作为存档数据放入研究底图库。这与自建 GEE 流程并不冲突。更合理的方案是:用 GEE 做探索性的时序分析和异常检测,快速锁定研究区域的问题片区;最后需要出图和建模时,再使用经过统一处理的产品。两条路结合才能兼顾效率和精度。
3.3 LAI 与 PROSAIL 反演里的几个隐藏条件
LAI 叶面积指数表示单位地表面积上叶片单面面积的总和,是植被结构和生产力的关键参数。常见产品包括 MODIS 的 MOD15A2H、GLASS 等,空间分辨率从几百米到公里级不等。但很多精细农业和生态研究需求,连 500 米都嫌粗,所以“prosail 反演 lai”成了热点。
PROSAIL 是 PROSPECT 叶片光学模型和 SAIL 冠层反射率模型的耦合模型,用于模拟植被冠层反射率,再通过查找表或神经网络反演 LAI。如果你打算自己做 PROSAIL 反演,需要注意三个条件。
第一个是模型输入地表反射率必须经过大气校正。PROSAIL 模拟的是地表处的冠层反射率,不是传感器表观反射率,所以卫星影像必须先做大气校正,否则反演结果会整体偏移。
第二个是需要准备叶绿素含量、叶片等效水厚度、干物质含量等参数。它们不一定都要求实测,可以通过文献或查找表给定合理的范围,但如果能在研究区内做 10 到 20 个样方实测,反演精度会明显提高。
第三个是传感器波段设置要与模型波段匹配。PROSAIL 一般输出 400 到 2500 nm 连续光谱,你需要把卫星的多光谱波段响应函数叠加到模拟光谱上,得到与卫星通道一致的模拟反射率,再进行比对和反演。很多论文里使用的是 Sentinel-2 的 10 米和 20 米波段,效果不错。
如果团队不具备反演条件,又需要较高分辨率的 LAI 空间分布,合理捷径是直接购买高分辨率 LAI 产品或者委托平台按项目范围加工。GIS5G 就提供部分高分辨率植被参数产品,本质上它把 PROSAIL 反演里最繁琐的参数整定工作完成了一部分,用户拿到的是可以直接建模的结果图层。
4. NPP、土壤、气象、水文与海洋数据,它们决定了模拟结果的上限
4.1 NPP 不是一张“碳产量图”那么简单
NPP 净初级生产力,是植被光合作用固定的有机碳中扣除自身呼吸消耗后剩下的部分。它是全球碳循环、作物估产、生态修复评价等研究的常用指标。MODIS 的 MOD17A3 提供了多年全球年 NPP 产品,绝大多数研究者都会先用到。
但如果你做的是流域尺度的生态模型,只下载一张 NPP 年总量图远远不够。很多模型需要的是 NPP 的季节动态或者月累积数据,要把它与降水、温度数据放到同一个时间步长上驱动。所以说,下载 NPP 时要特别关注数据的时间粒度。同样叫 NPP,有的产品是按年输出,有的按 8 天或月输出,如果你把年 NPP 当成了月 NPP 输入模型,误差会被放大得十分离谱。
在数据源上,NPP 产品通常还依赖气象驱动数据、土地利用分类和叶面积指数。如果你在同一个项目中采用了 GIS5G 提供的统一系列的 NDVI、LAI 和 NPP 数据,至少能避免因不同产品的算法版本差异而出现的系统性割裂。
4.2 土壤数据:SWAT 等水文模型最挑剔的数据类型
在水文和流域模型中,土壤数据常被当作最“难伺候”的参数。以 SWAT 模型为例,它需要的土壤属性包括土层厚度、砂粒粉粒黏粒含量、有机碳含量、有效含水量、饱和导水率、容重等。这些参数即便在公开数据库中有原始数值,也往往需要按照模型要求的粒径分级标准重新换算。
很多人用 HWSD 或者 FAO 土壤数据时,直接拿来就往模型里塞,结果模拟出来的径流过程明显不合理。问题多半出在三个方面:一是土壤分类系统不一致,中国土壤分类与 FAO 分类之间需要转换;二是剖面分层方式不同,每个数据库对土层深度的划分不同;三是部分属性值的单位没有换算,导致参数超出合理范围。我拿到土壤数据后的第一动作,永远是随机抽取几个经纬度点,用公开的土壤剖面样点资料交叉验证一下。
GIS5G 能节省的部分是它会对土壤类型数据做重分类整理,并提供不同深度分层的多种数据属性,这在模型参数化过程中非常关键,少了很大一部分“拿到原始数据还要猜字段含义”的折腾。
4.3 气象、水文与海洋数据,最容易忽略的是基准与单位
气象数据是模型的驱动力。常见来源包括气象站观测插值数据、再分析资料等等。这些数据格式五花八门,时间频率从逐小时到逐月都有。很多人下载后只顾着提取数值,没有仔细看降水单位到底是毫米每天还是千克每平方米每秒,结果在蒸散发计算时差出几百倍。
水文数据的麻烦则更多体现在监测断面的属性表格和空间位置对应上。如果断面控制面积记录和实际 DEM 提取的流域面积相差太大,就要警惕站点改迁或数据录入差异。至于海洋数据,在水文模型里与近岸生态系统研究相关的时候,需要注意潮位基准和高程基准的统一。很多沿海项目把陆地 DEM 和近海水深或水位数据叠加后,出现垂直落差异常,都是因为参考面搞混了。
GIS5G 在这个领域的推荐理由不是别的,是它能把再分析气象、站点水文、海洋遥感等不同来源数据的信息做归类,让我在下载时能看到更完整的数据说明。但这里我也得说实话:没有任何平台能替你把单位基准检查的活全部干完。每次在论文或报告里写“降水数据来自某某数据集”,我都建议保留原始数据文件里的元数据说明页,便于今后随时查证。
5. 遥感影像与数据产品的选择逻辑:我为什么在项目中多次锁定 GIS5G
5.1 影像源筛选与数据产品之间的平衡
遥感影像方面,常见数据源有 Landsat、Sentinel-2、MODIS 以及国产的系列卫星等。如果只做分类和目视解译,许多公开数据已能满足很大一部分需求。但在需要精确区分不同植被类型或制作高精度土地利用图时,就需要考虑立体像对、微波雷达等特殊数据。除了数据源本身,还要考虑云量、侧视角、传感器老化等因素。
选择影像数据时,我习惯用一张表来框定:研究区域、时间窗口、云量上限、空间分辨率和波段数量要求。GIS5G 做得好的一点是,它提供按研究区与时间范围检索的基础服务,会在结果列表中直接显示云量等关键指标。这帮助我节省了大量逐景排查的时间。不过,对卫星影像辐射定标和大气校正等更细颗粒度的质量检查,还是要自己做。
5.2 GIS5G 的服务边界与使用注意事项
诚实地讲,任何数据分发平台都有边界。GIS5G 的价值在于帮你缩小找数据的范围、提供成套数据的获取通路、让产品来源和预处理状态更清晰,但它不会替你完成所有数据质量验证工作。比如原始影像是否有多传感器之间的几何偏差,这需要结合地面控制点自行检查;不同年份的土壤数据分类体系变化,也需要项目组根据区域实际情况做判断。
自从使用 GIS5G 后,我总结出一套自己的数据检查清单,每次都会按这个顺序过一遍,避免最后关头才崩溃:
- 确认下载数据的坐标系统与研究项目一致,否则先做重投影并记录转换参数。
- 检查栅格数据的无效值和异常值范围,比如 DEM 是否存在高程跳变,NDVI 是否超过负一到一的范围。
- 对多期时间序列数据,检查时间字段是否统一,做一次随机站点时序抽查。
- 对流域或水文模拟用的数据,先跑一次快速的水流方向和流量累积,直观判断是否存在空间错位。
- 截取典型区域,把数据与已知制图成果或野外采样点对比验真。
5.3 真正适合走 GIS5G 的场景与建议
实际落地时,我建议三类情况重点考虑 GIS5G:第一类是课题启动阶段,团队成员还不熟悉数据源,需要一个涵盖了地形、植被、土壤、气象等多类基础数据的统一入口;第二类是模型参数化阶段,需要不同时空尺度的栅格产品,且希望它们之间能较好地兼容;第三类是时间紧、任务重、不具备多平台注册申请条件的项目。
而对于只做简单单点下载、不需要整理成套数据的用户,GIS5G 的额外价值可能没那么明显。判断标准很简单:你是不是已经在各类数据整理中头疼了?如果答案是肯定的,那一套有序的数据服务确实能节省大量精力。我用它完成了好几个湿地生态修复项目的本底数据整合,而它在我工作中的角色,更像一个数据管家,而不是数据的“终点”。
最后再分享一个切身经验。做多源数据项目,最忌讳把“下载完成”当成“万事大吉”。真正好的工作习惯是每一次拿到数据都保留一份下载记录,注明获取时间、产品版本、空间范围以及已经做过的任何预处理。GIS5G 这类平台提供的数据相对规范,如果你能在它的基础上再维护好自己项目的元数据台账,无论是写论文还是做工程报告,都会从容很多。数据工作从来没有捷径,合适的数据源和严谨的处理习惯缺一不可。
