1. 项目概述与需求分析
1.1 全球露天矿分布数据到底是什么
做矿业遥感或者地质研究的朋友应该都有体会,找一份覆盖全球范围的露天矿分布数据有多难。早些年我们做区域环境影响评估,想要一份完整的矿点分布矢量数据,翻遍国内外的公开数据平台,找到的多半是某个国家、某个矿种或者特定年份的零散数据,要么精度不够,要么字段信息残缺,很难直接拿来用。
这份全球露天矿分布数据,简单说就是一套记录了全球主要露天矿采矿权范围的矢量空间数据集。它不是一个简单的点坐标清单,每个矿点都带有明确的土地覆盖类型属性,能区分出这个区域是开采中的矿坑、废弃矿区还是待开发的矿权地。这种数据做宏观分析特别有用,比如研究矿业活动对周边生态系统的影响、分析全球矿产资源开发的空间格局、或者做矿业用地的变化检测,都需要这种带空间边界和属性的基础数据。
我第一次拿到这份数据的时候,印象最深的是它的覆盖面——全球79个国家、大约4437个露天矿采矿权区,而且时间跨度从2000年前后一直到2020年左右。这意味着你可以在全球尺度上对比不同国家的矿业开发强度,也可以追踪某一片区域十几年来的扩张过程。对做全球变化研究、矿业政策分析或者可持续发展评估的人来说,这基本属于必备的基础底图。
1.2 这个项目适合谁来看
这篇文章主要写给三类人:
第一类是GIS和遥感方向的研究生、工程师,你们可能是想把这份数据叠加到自己的分析流程里,做生态破碎化评估、土地利用变化检测或者碳汇估算。这类朋友最关心的是数据的坐标系统、字段格式和精度是否满足研究需求。
第二类是矿产资源管理和规划部门的技术人员,你们可能要拿这份数据做区域矿业开发现状梳理,或者辅助划定生态红线。这类朋友需要知道这份数据能不能替代或补充本地的高精度矿权数据。
第三类是刚入门的数据分析师,你们可能只是偶然发现这份数据,想试试看能不能做一些可视化分析。这类朋友需要的是把数据跑起来的具体操作步骤,包括怎么下载、怎么导入、字段都是什么意思。
我写这篇文章的时候会尽量把每个环节都拆开讲清楚,涉及代码的部分也会给出可以直接用的脚本,大家根据自己的基础取所需即可。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 数据格式与字段结构解析
2.1 数据包里的核心内容
这份数据下载解压之后,核心文件是一个GeoJSON格式的矢量文件,文件名通常长这样:Global_OPEN_MINED_AREAS.geojson。GeoJSON这种格式的好处是纯文本存储、跨平台兼容性好,几乎所有的GIS软件和空间分析库都能直接读取,不需要额外转换。
字段设计沿用的是Google Earth Engine上WHU(武汉大学)发布那版全球露天矿区数据集的属性体系。原始数据是基于高分卫星影像人工解译的,每条记录的属性信息包含了矿区的名称(如果有)、所在国家代码、影像获取日期、土地覆盖类型、面积估算值,以及一条对应的影像超链接。这些字段的设计思路很清晰——既保证了你能够做基本的空间查询和筛选,又保留了追溯到原始影像的能力,方便验证数据精度。
有一个字段经常被忽略,就是那条影像链接。它指向的是Google Earth高清影像上的具体坐标位置。我建议拿到数据之后先随机挑几个点,点开影像链接核验一下边界轮廓和实际情况是否吻合。这套数据虽然整体精度不错,但毕竟是通过卫星影像人工解译出来的,局部区域很可能存在边界偏移,尤其是那些矿坑边缘堆了废石、植被恢复区和不透水面混杂的区域。做精度要求高的分析之前,这一步抽检不能省。
2.2 字段定义与含义说明
| 字段名 | 字段类型 | 示例值 | 含义说明 |
|---|---|---|---|
| NAME | String | DUNDAS | 矿区名称,部分记录为空 |
| COUNTRY | String | AUS | 国家代码(ISO三位字母码) |
| ISO | String | AUS | ISO国家代码,一般与COUNTRY一致 |
| START_DATE | String | 2004-06-09 | 卫星影像获取日期 |
| LAND_COVER | String | MINERAL EXTRACTION | 土地覆盖类型 |
| AREA_KM2 | Double | 7.512 | 矿区面积(平方公里) |
| IMAGE_URL | String | https://... | 对应的高分影像链接 |
这里要特别说明的是AREA_KM2字段。这个面积是解译多边形在WGS84坐标系下直接计算的球面面积,并不是投影平面面积,所以对于高纬度地区的矿区,这个值可能和当地测绘部门提供的矿权登记面积有出入。如果你要做精确的面积统计,建议先做一次投影转换,再重新计算每个多边形的面积。
另外提醒一下,这份数据里NAME字段大约只有一半左右的记录有名称,其余都是空值。这不能算是缺陷,因为很多小型露天矿在原始影像上很难获取官方名称,解译人员通常以矿区所在的小地名或编号代替。做图的时候如果发现大量无名称要素,不要慌,用COUNTRY和AREA_KM2字段做标注即可。
3. 数据下载与获取方式
3.1 从Google Earth Engine检索数据
这份数据集在Google Earth Engine上对应的名称是projects/sat-io/open-datasets/WHU/global_OPEN_MINED_AREAS,你可以直接在GEE的代码编辑器里搜索OPEN MINED关键词找到它。
需要提醒的是,如果你的网络环境无法正常访问Google的相关服务,那从GEE上获取这份数据会非常困难。这种情况下可以考虑两个替代方案:
一是从其他提供镜像下载的学术数据平台检索,有些高校的公开数据仓库会定期同步这套数据;二是如果你已经能正常访问GEE,直接使用下面的导出脚本,把数据下载到本地或者自己的Google Drive里。
如果你确定能正常访问GEE环境,直接在代码编辑器里运行下面的脚本,就可以把整个数据集导出到你的Google Drive:
javascript复制var minedAreas = ee.FeatureCollection("projects/sat-io/open-datasets/WHU/global_OPEN_MINED_AREAS");
Export.table.toDrive({
collection: minedAreas,
description: 'Global_OPEN_MINED_AREAS',
fileFormat: 'GeoJSON',
folder: 'EE_exports',
fileNamePrefix: 'Global_OPEN_MINED_AREAS'
});
等待导出任务完成,从Google Drive下载到本地即可。这里有两个小坑要提前说明:
第一,GEE导出的GeoJSON文件名默认是数字串,但fileNamePrefix参数加了之后就会用你指定的前缀命名,建议每个导出任务都把前缀写清楚,不然下载后满屏数字文件,根本分不清哪个是哪个。
第二,如果数据集比较大,导出GeoJSON时可能会提示达到最大记录数限制。这时候不用慌,你可以按国家或按年份分块导出,后面再合并。操作上就是在加载minedAreas之后,用filterBounds加一个逐国处理的循环。
3.2 按国家筛选导出的Python实现
如果你打算在GEE的Python客户端里按国家逐个导出,可以参考下面这段代码。核心逻辑就是遍历国家代码列表,用filter筛选后再逐国导出,避免单次导出数据量过大导致任务失败。
python复制import ee
# 初始化GEE
ee.Initialize()
mined_areas = ee.FeatureCollection("projects/sat-io/open-datasets/WHU/global_OPEN_MINED_AREAS")
# 获取所有国家代码
country_list = mined_areas.aggregate_array('COUNTRY').distinct().getInfo()
print(f"共 {len(country_list)} 个国家")
# 按国家循环导出
for country in country_list:
subset = mined_areas.filter(ee.Filter.eq('COUNTRY', country))
task = ee.batch.Export.table.toDrive(
collection=subset,
description=f'export_{country}',
folder='EE_exports',
fileNamePrefix=f'OPEN_MINED_{country}',
fileFormat='GeoJSON'
)
task.start()
print(f"已启动 {country} 导出任务")
这段脚本跑起来之后,GEE后台会生成一长串等待中的导出任务,你可以在Task标签页里统一管理。每个国家导出的数据量不一样,多数国家单个任务几十秒到几分钟就能完成。个别矿区特别多的国家,比如澳大利亚、美国、中国,导出时间会长一些,耐心等就行。
4. 实操过程与核心环节实现
4.1 用Python读取和清洗数据
下载好GeoJSON文件之后,第一步是用Python把它读进来,看看整体数据质量。我习惯用GeoPandas做这一步,下面的脚本可以直接用:
python复制import geopandas as gpd
# 读取GeoJSON
gdf = gpd.read_file('Global_OPEN_MINED_AREAS.geojson')
print(gdf.shape) # 查看行列数
print(gdf.columns) # 查看字段名称
print(gdf.head()) # 查看前5行数据
print(gdf.crs) # 查看坐标系
正常的情况下,你会看到类似这样的输出:
code复制(4437, 8)
Index(['NAME', 'COUNTRY', 'ISO', 'START_DATE', 'LAND_COVER', 'AREA_KM2', 'IMAGE_URL', 'geometry'], dtype='object')
EPSG:4326
3939个要素、8个字段、WGS84经纬度坐标系(EPSG:4326),这就是我刚才说的那几个关键词:全球、露天矿、矢量数据。如果你读出来的要素数是3939而不是4437,不用担心,不同渠道的版本字段略有差异,影响不大。
接下来做数据清洗。这里有一个我踩过好多次的坑:GeoJSON里的START_DATE字段在读取后经常被解析成datetime类型,但有时候又是字符串,类型不稳定。建议统一处理成字符串或者datetime,避免后续时间筛选时报错:
python复制# 统一日期字段格式
gdf['START_DATE'] = pd.to_datetime(gdf['START_DATE'], errors='coerce')
print(gdf['START_DATE'].min(), gdf['START_DATE'].max())
errors='coerce'的意思是遇到解析不了的日期就置为NaT,不会让整个程序崩溃。处理完之后可以快速看一下数据的时间分布:
python复制print(gdf['START_DATE'].dt.year.value_counts().sort_index())
你会发现这份数据绝大多数影像集中在2015年至2020年,个别要素甚至可以追溯到2000年左右。如果你要做时间序列分析,需要注意早期年份样本量不足的问题,容易得出偏差较大的结论。
4.2 数据去重与空间自相交修复
很大概率你会碰到一个问题:这份数据里存在重复要素。来源是数据集在拼接和更新时,把不同时间解译的同名矿区多边形同时保留了下来。处理思路很简单,按NAME和COUNTRY去重就行:
python复制# 按国家+名称去重,保留面积较大的记录
gdf_sorted = gdf.sort_values('AREA_KM2', ascending=False)
gdf_unique = gdf_sorted.drop_duplicates(subset=['NAME', 'COUNTRY'], keep='first')
print(f"去重前: {len(gdf)} 条,去重后: {len(gdf_unique)} 条")
如果你做的是全球尺度的分析,直接用gdf_unique就够用了。但如果你关注的是某一个具体区域,我建议再做一步投影变换,把坐标系从WGS84地理坐标系转成适合你研究区的投影坐标系,再进行面积重算和缓冲区分析。比如研究澳洲矿区,可以转成澳大利亚Albers等积投影;研究中国区域,用Albers等积投影或者高斯-克吕格投影都可以。
需要特别提醒的是,GeoPandas在做缓冲区或相交分析时,如果原始数据存在自相交的多边形,会报TopologyException错误。遇到这种问题,先跑一遍gdf['geometry'] = gdf.buffer(0)强制修复几何拓扑,再继续后续操作。
4.3 数据可视化出图
可视化是理解数据最直接的方式。我贴一段简单的代码,用matplotlib叠加全球背景后绘制矿点分布:
python复制import matplotlib.pyplot as plt
import geopandas as gpd
# 读取一个简单世界底图,也可以用自然地球数据
world = gpd.read_file(gpd.datasets.get_path('naturalearth_lowres'))
fig, ax = plt.subplots(figsize=(16, 9))
world.plot(ax=ax, color='lightgray', edgecolor='white')
gdf.plot(ax=ax, color='red', markersize=0.5, alpha=0.6)
plt.title('Global Open Mined Areas Distribution')
plt.show()
出的图基本能看出一个明显规律——露天矿在全球的分布非常集中,澳大利亚、南美洲、非洲南部、中亚、北美和中国华北都是高密度区。这种可视化做出来之后,无论是写报告还是做汇报,信息量都非常足。
如果你习惯用QGIS,直接把GeoJSON拖进图层就行,没有任何兼容问题。QGIS里用Symbology调整矿点颜色,用Rule-based按LAND_COVER字段分类渲染,效果比matplotlib更专业一些。
5. 核心应用场景扩展
5.1 叠加环保合规审查
这套数据最有价值的应用场景之一,就是把它和自然保护区边界、生态保护红线叠加,快速筛查出可能存在冲突的矿区。做法也不复杂,就是把保护区边界数据读进来,用GeoPandas做空间连接,找出那些和保护区多边形相交的露天矿要素。
python复制reserve = gpd.read_file('protected_areas.shp')
overlap = gpd.overlay(gdf_unique, reserve, how='intersection')
print(overlap[['NAME', 'COUNTRY', 'AREA_KM2']].drop_duplicates())
这样做出来的结果可以辅助合规审查报告——哪些矿区侵入了保护区核心区、哪些在缓冲区、面积多大,全部量化输出。做项目汇报的时候,一张叠加分析图配上统计表,说服力比单纯文字强得多。
不过我要提醒一句:这套数据的边界来源于卫星影像解译,并不是官方矿权边界,所以叠加分析的结果只能作为初筛参考,不能直接作为执法依据。如果某个矿区的分析结果引起关注,务必调取当地的官方矿权登记数据进行复核。
5.2 区域矿业风险评估
很多金融机构在做矿业投资风险评估时,会关注项目所在区域的矿业开发密度和环境敏感性。这套数据也可以用在类似场景中,计算方法可以很简单:把研究区划分成规则网格,然后统计每个网格单元内的露天矿面积占比。
python复制import numpy as np
# 以0.5度网格为例
lon_bins = np.arange(-180, 180, 0.5)
lat_bins = np.arange(-90, 90, 0.5)
gdf['lon'] = gdf.geometry.centroid.x
gdf['lat'] = gdf.geometry.centroid.y
grid_count = gdf.groupby(
[pd.cut(gdf['lon'], lon_bins), pd.cut(gdf['lat'], lat_bins)]
).size().reset_index(name='count')
这种网格统计结果画成热力图之后,可以非常直观地看出哪些区域矿业活动密集,辅助判断投资标的所在区域的风险等级。当然,现实中的风险评估还需要叠加更多数据,比如政治稳定性、基础设施通达性、水资源压力等,这套数据只提供空间维度上的参考。
5.3 生态修复目标识别
我发现一个很实用的用法,是用这套数据辅助识别生态修复的优先区域。思路是这样:把LAND_COVER字段过滤出废弃矿区那一类(例如BARE GROUND或MINERAL EXTRACTION但已无新影像更新的记录),再结合植被覆盖数据判断这些区域是否处于退化和裸露状态,就能圈定一批需要优先关注的历史遗留矿区。
具体操作上,可以把废弃矿区图层和NDVI(归一化植被指数)数据叠加,计算每个矿区范围内的平均NDVI值。NDVI长期低于阈值的区域,植被恢复情况差,可能就是修复需求最迫切的区域。这个思路虽然不是特别复杂,但在做国土空间生态修复规划时很有参考价值。
6. 常见问题与排查技巧实录
6.1 属性字段乱码问题
GeoJSON读取后字段名或属性值偶尔出现乱码,最常见的原因是你的Python环境默认编码和文件编码不一致。解决办法是在读取时强制指定编码:
python复制gdf = gpd.read_file('Global_OPEN_MINED_AREAS.geojson', encoding='utf-8')
如果这种方式仍然提示错误,可以用文本编辑器把GeoJSON文件打开另存为UTF-8 with BOM格式,再重新读取。实操中发现,BOM格式反而更能被GeoPandas稳定识别。
6.2 投影与面积偏差问题
AREA_KM2字段是在WGS84经纬度坐标系下计算的球面面积,高纬度地区的多边形面积会被高估。更稳妥的做法是先把数据转换为适合研究区的等积投影,再用投影后的几何计算真实面积:
python复制# 示例:全球分析用World Mollweide等积投影
gdf_proj = gdf.to_crs('+proj=moll')
gdf_proj['AREA_CALC_KM2'] = gdf_proj.geometry.area / 1e6
转投影之后你会发现,AREA_KM2和重新计算的面积确实存在偏差,纬度越高的地区偏差越大。做全球尺度的面积统计建议一律用重新计算的字段,别直接拿原始字段往报告里放。
6.3 GEE导出任务失败排查
如果你在GEE里导出数据时,任务长时间停留在Ready或Running状态,甚至提示Error,按这个顺序排查:
一是检查网络连接是否稳定。GEE导出任务对网络环境要求较高,网络波动会导致任务失败。最简单的办法是换个时间段重试,或者把导出区域拆小一点。
二是检查Google Drive空间是否充足。导出到Drive后如果你把文件移动到其他目录,也会导致GeoJSON文件无法下载,因为导出的文件默认放在Drive的根目录。
三是如果数据集太大导致单次导出失败,就用前面Python脚本里那种按国家分批导出的方式逐步处理。拆分之后每个子任务对应一个国家的数据,失败重试的成本也低。
6.4 数据更新版本差异
这套数据目前仍在持续更新中,不同时间下载的版本在要素数量和字段上会有差异。比如我最早拿到的版本大约3900多个要素,后来源里又新增了几百个采矿权区,重新下载时别用旧的去重逻辑,直接对新数据跑一遍完整的清洗流程最稳妥。如果你手头有旧版本,建议直接下载最新版本重新分析,不要混用。
7. 数据扩展与自动化提取思路
7.1 结合高分辨率影像进行局部更新
这套数据毕竟是一段时间内的快照,时效性有限。如果你想用更新颖的数据做局部的变化检测,比如某个矿区三年内面积是否扩张,可以用Playwright或Selenium这样自动化工具,按矿区名称或坐标从在线地图服务上抓取最新高分辨率影像,再做人工或算法判读。我试过用Playwright定位页面中的元素来批量触发影像加载,原理不算复杂,就是在定位到矿区坐标对应的地图切片后截图保存。
python复制from playwright.sync_api import sync_playwright
with sync_playwright() as p:
browser = p.chromium.launch(headless=True)
page = browser.new_page()
page.goto('https://example-map-service.com/')
# 定位搜索框并输入矿区坐标
page.fill('input#search-box', '-25.123, 134.567')
page.click('button#search-btn')
page.wait_for_timeout(5000)
page.screenshot(path='mine_area_2024.png')
browser.close()
这个方法我自己用过,省去了很多手动截图的重复劳动。需要注意的是一次别跑太多坐标,频率过高容易被目标网站的访问策略限制。地图网站一般都会有比较严格的反爬机制,合理控制请求频率、加随机延迟都是必要的。另外,很多在线地图服务的影像有版权限制,拿来做内部技术验证问题不大,公开发布就需要先确认使用许可。
7.2 用自然语言处理提取矿区名称
之前处理这份数据时,我遇到过一个问题:NAME字段很多是当地语言的写法,不熟悉矿业地理的人根本没法判断它在哪个语系。后来我试着用Python调了大语言模型的接口做地名归一化,把NAME字段统一转成英文或中文常用译名。方法不复杂:把名称列提取出来,分批发给模型,让它返回国际通用名称和中文译名,再写回原始数据。
这个方法在处理几十条名称时很好用。但如果你要处理全量数据,调用量会很大,而且模型对生僻地名的翻译偶尔会出现错误,需要人工抽检或设置置信度阈值。对大部分分析场景来说,直接用原始名称或国家代码作为分组变量就够了,不需要做全量翻译。
7.3 配合时间序列数据追踪矿区扩张
这套数据里每条要素都带一个影像获取日期,这个信息可以做矿区扩张的时间序列分析。方法是把同名的矿区按年份分组,看它们在不同年份的面积变化。需要注意的是,不是每个矿区每年都有影像记录,所以时间序列是不均匀的,分析时要处理缺失值。
用pandas的groupby配合interpolate简单插值,就可以做出比较平滑的面积变化曲线:
python复制gdf['year'] = gdf['START_DATE'].dt.year
area_series = gdf.groupby(['NAME', 'year'])['AREA_KM2'].sum().unstack(fill_value=0)
area_series = area_series.interpolate(axis=1)
这个操作能帮你快速识别出那些面积在短时间内急剧扩张的矿区,这些区域往往是环境压力和治理需求最突出的地方。
8. 实操心得与建议
说几点我在实际操作中总结出来的体会吧。
这套数据下载下来之后,第一件事不是急着做分析,而是先花时间把数据的基本情况摸熟。打开属性表看看字段分布、把数据叠加到底图上随机浏览几个矿区、点击影像链接对比一下目视效果——这套流程走下来基本就能掌握数据的质量和适用范围。
做跨国、跨区域对比分析时,不要直接用AREA_KM2字段做统计,务必做投影转换后重新计算面积。之前有过一次南美和北欧的矿区对比分析,原始数据里高纬度矿区面积普遍偏大,直接对比做出来的结论偏差非常明显。当时花了半天排查才发现是投影方式的问题,现在每次做面积统计前我都会提醒自己先转投影。
另外,如果你打算把这份数据用在论文或正式报告里,建议在方法部分把数据源出处、解译方式说明清楚。公开数据虽然免费,但引用规范还是要遵守,这也是对数据生产方工作的尊重。
最后分享一个小技巧:这套数据配合全球人口密度数据、夜间灯光数据一起做叠加分析,能做出很多有意思的交叉结论。比如识别偏远地区但夜间灯光异常活跃的区域,这些地方往往有非法的或未记录的矿业活动。拿这套数据做底图,再叠加上去,能发现一些常规渠道找不到的异常点。这类分析方法目前还有很大的挖掘空间,有条件的读者可以试一试。
