做气象和环境数据分析的人,应该都绕不开“reanalysis-era5-pressure-levels”这个名字。它是欧洲中期天气预报中心(ECMWF)发布的ERA5再分析数据集中,专门提供气压层大气变量的一套数据。简单说,你要研究高空环流、温度平流、风场垂直结构,或者想画一张500 hPa位势高度场,拿这套数据基本就够了。
我第一次接触ERA5时,最直观的感受是:数据质量好、时间序列长、网格规整,而且下载流程高度自动化。只要你学会了通过Python调用CDS API(Climate Data Store API),就可以批量拉取几十年的小时级大气数据,不必再去翻各种格式混乱的观测站数据。这篇文章从数据原理讲到下载脚本,再到实际出图和常见坑位,把reanalysis-era5-pressure-levels整套玩法拆开给你看,适合刚入门的气象爱好者,也适合需要把数据接入业务流的工程开发。
1. 为什么先选reanalysis-era5-pressure-levels
1.1 再分析数据到底是什么,为什么比观测数据好用
先讲一个容易混淆的概念:文件名里的reanalysis,翻译成“再分析”而不是“分析”,这是个有历史渊源的词。传统的天气分析,是把台站、探空、雷达、卫星这些零零散散的观测资料,靠预报员手工或自动绘制成一张场。问题是观测站点分布极不均匀,海洋和极地几乎没什么数据,填出来的场自然有很多空洞。
ERA5的做法完全不一样。它用一套数值天气预报模式作为“动力骨架”,把所有历史观测数据同化进去,让模式预报不断用观测去修正,最终输出一套在规则网格上的完整大气状态估计。你可以把它理解为:模式负责补全空白区域,观测负责校准模式,两者反复迭代,最后得到一套比任何单一观测都更完整、更自洽的三维大气“最佳猜测”。由于这套数据是逐小时输出的,从1940年到现在,时间上几乎没有断档,所以非常适合作气候统计和事件回溯。
从实际体验来看,ERA5的优势还体现在数据一致性上。你用同一种方法处理2000年和2020年的数据,不会觉得变量定义变了、坐标系变了,这让批量分析省了很多心。对于常做业务的人来说,这种“几十年口径统一”本身就是巨大的效率。
1.2 气压层数据和单层数据怎么选
ERA5在CDS里被拆成好几个数据集,你看到 reanalysis-era5-pressure-levels 大概率会疑惑:它和 reanalysis-era5-single-levels 有什么区别?这里必须说清楚。
pressure-levels 提供的是三维大气在固定气压面上的物理量,比如1000 hPa、925 hPa、850 hPa、700 hPa、500 hPa、300 hPa、200 hPa、100 hPa这些高度上的温度、风、位势高度、比湿等。它描述的是“大气在垂直方向上的状态”,适合研究高空槽脊、急流、温度平流、水汽输送。
single-levels 则是地表或某一特定高度的量,比如2米气温、10米风、地表气压、总降水、地表短波辐射。它适合研究近地面要素,风资源分析、农业气象、降水统计通常用它。
日常使用中的选择逻辑很简单:只要你的物理量本身带有高度概念,或者你要分析大气的三维结构,就用pressure-levels。如果你只关心地表或近地面,用single-levels。有些工作两者都要,比如要算边界层高度、地转风、垂直风切变,你甚至需要把两个数据集的变量拼在一起。
另外要注意,pressure-levels里的“level”是标准气压面,不是海拔高度。1000 hPa大约对应近地面,500 hPa大约在5500米高度附近,那是中层大气的重要参考面。你要画天气图常说的“500百帕形势场”,就是从这个数据集里取位势高度。
1.3 这套数据核心的技术参数
再讲几个选数据时一定会遇到的参数,搞清楚它们,后面脚本怎么写就清楚了。
- 时间范围:ERA5从1940年1月至今。标题里的
reanalysis-era5-pressure-levels是1940年以后的版本,之前还有一个ERA5早期版本数据集,现在统一用1940之后即可。 - 空间分辨率:0.25°×0.25°经纬度网格。赤道上每个格点大约对应27公里左右,对区域气候和天气尺度分析足够用。
- 时间分辨率:1小时。气压层数据有逐小时输出,做日变化分析很方便。
- 气压层:从1000 hPa到1 hPa,共37层。业务上常用的主要是1000、925、850、700、500、300、200、100,研究臭氧或平流层时会用到更高的层。
- 变量:温度、水平风U/V、位势高度、比湿、相对湿度、垂直速度、气压、臭氧、云量等,具体变量名要去CDS的变量字典里查。
我建议在第一次下载之前,先想清楚“我需要哪些变量、哪些层、哪个区域、哪个时段”,然后在请求里显式裁剪。ERA5的全球逐小时数据非常大,如果你不裁剪就去下载,一个文件跑几百GB都有可能,浪费时间和硬盘。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 用Python下载ERA5气压层数据的准备工作
2.1 CDS账号注册与API Key配置
ERA5数据不能直接通过浏览器点击下载大文件,官方推荐方式是通过CDS API。第一步是注册CDS账号,地址是CDS官网,注册后在个人主页能看到两样东西:UID(一串数字)和API Key(一串长字符)。
这两样信息要写进一个名为 .cdsapirc 的配置文件。操作上,在用户根目录下新建一个隐藏文件:
bash复制cd ~
touch .cdsapirc
然后用文本编辑器写入以下内容:
code复制url: https://cds.climate.copernicus.eu/api
key: 你的UID:你的APIKey
注意这里key的格式是“UID:APIKey”,中间是英文冒号,不要反了。写完保存后,Python的 cdsapi 库读取请求时会自动找到这个文件。如果你换了机器或者多用户共用环境,这个文件忘配置是新手最常见的翻车点。
我自己踩过的坑是,以前老版本CDS用的域名是 cds.climate.copernicus.eu,现在依然兼容,但新用户注册后的API访问入口可能有调整。所以如果你发现认证报401,先去检查 .cdsapirc 里的url是否和你账号后台显示的一致。
2.2 安装cdsapi并完成环境验证
打开终端,执行:
bash复制pip install cdsapi
我建议把 cdsapi 装进一个干净的conda虚拟环境,尤其你后面还会用到xarray、netCDF4、cartopy这些库,虚拟环境能避免各种版本冲突。装完后在Python里跑一句验证:
python复制import cdsapi
print(cdsapi.__version__)
能正常打印版本号,说明安装成功。接着做一个最小请求:
python复制import cdsapi
c = cdsapi.Client()
c.retrieve(
"reanalysis-era5-pressure-levels",
{
"product_type": "reanalysis",
"variable": "geopotential",
"pressure_level": "500",
"year": "2023",
"month": "01",
"day": "01",
"time": "00:00",
"area": [60, 70, 20, 140],
"format": "netcdf",
},
"test_500hpa.nc",
)
如果这段代码能跑完并生成一个netcdf文件,说明账号、配置、网络链路都是通的。这里的 area 参数后面会细讲,它把区域限制在东亚一带,下载量很小,非常适合验证。
2.3 变量命名和坐标体系这些细节
很多人在这一步卡住,不是因为下载不会写,而是因为变量名写错。CDS的变量名和你在文献里看到的不一定一样。你要用 temperature,它不是 temp;要用 geopotential,不是 hgt;要用 u_component_of_wind,不是 u。建议在CDS的Dataset Documentation页面里找到完整的变量字典,Ctrl+F搜关键词,对照着抄。
坐标体系有两个容易出错的地方。一是经纬度顺序,CDS的download参数里,latitude范围是90到-90,longitude范围是0到360或-180到180都可以,但请求里通常习惯写90到-90、0到360。二是 area 参数的顺序是[北, 西, 南, 东],不是[左上, 右上, 右下, 左下]这种直觉顺序。比如你要取中国的区域,写成 [60, 70, 20, 140],分别代表北纬60°、东经70°、北纬20°、东经140°。
气压层参数名叫 pressure_level,在请求里是单数形式,可以传一个字符串,也可以传一个列表。如果你要多层,就写 "pressure_level": ["1000", "850", "500", "200"]。这个参数名很容易和输出数据的维度名 level 搞混,但请求阶段必须用 pressure_level。
3. 数据检索语句的完整实现,从单次下载到批量生产
3.1 一个可直接用的最小下载脚本
下面这个脚本覆盖了大多数单次下载需求,我把注释写详细一点。它下载2023年1月1日00时、500 hPa层、东亚区域的地转位势高度和风场:
python复制import cdsapi
c = cdsapi.Client()
c.retrieve(
"reanalysis-era5-pressure-levels",
{
"product_type": "reanalysis",
"variable": [
"geopotential",
"u_component_of_wind",
"v_component_of_wind",
],
"pressure_level": "500",
"year": "2023",
"month": "01",
"day": "01",
"time": "00:00",
"area": [60, 70, 20, 140],
"format": "netcdf",
},
"era5_500hpa_20230101_00.nc",
)
下载完成后,用xarray打开:
python复制import xarray as xr
ds = xr.open_dataset("era5_500hpa_20230101_00.nc")
print(ds)
你会看到 geopotential、u100、v100 这些变量。注意CDS返回的u和v在500 hPa层会写成 u100、v100 之类的变量名吗?实际上是 u、v,如果只有一个气压层,变量名通常保留为 u、v,维度里包含 level,读取时可以通过 ds["u"].sel(level=500) 切出来。具体命名以打印为准,不必死记。
3.2 时间、区域、层次裁剪的取舍逻辑
为什么请求里要写这么细?核心原因是控制数据量。
ERA5全球逐小时、37层、多个变量的一份数据,几十GB稀松平常。但如果你只是做某一天某个区域的天气过程分析,很多数据完全用不上。裁剪的意义就是只取需要的部分,让下载时间从几小时降到几十秒。
时间参数 year、month、day、time 在CDS接口里是分开的,可以传字符串或列表。比如要下载2023年1月整月的逐小时数据,你可以写:
python复制"year": "2023",
"month": "01",
"day": [
"01", "02", "03",
# ... 一直到 "31"
],
"time": [
"00:00", "01:00", "02:00",
# ... 一直到 "23:00"
],
手写太累,可以用Python生成。不过要提醒,逐小时整月数据仍然不小,即使裁剪到区域,下载也会排队较久。一般建议按天或按变量拆分请求,减少单个请求的数据量。比如只下00时和12时两个时刻,对研究日变化也够用了。
其中 area 参数我再次强调,顺序是北、西、南、东。你如果按西、东、南、北去填,拿到数据的经纬度范围会完全对不上,而且报错信息不一定明显,很容易白跑一趟。
3.3 批量下载多个变量和多年数据的循环写法
实际工作中很少只下一次,通常要批量拉取多年逐月数据。这里分享一个我自己常用的分段策略:按“变量组”拆分,而不是一次性把所有变量全塞进一个请求。
原因是ERA5的请求队列有大小限制,变量越多、时间段越长,请求被排队的概率越高。把变量拆成三到五组,每组对应一个NetCDF文件,后续再用xarray合并,反而更稳。示例:
python复制import cdsapi
c = cdsapi.Client()
variables_by_group = {
"wind": ["u_component_of_wind", "v_component_of_wind"],
"temp_humi": ["temperature", "relative_humidity"],
"geo": ["geopotential"],
}
years = ["2020", "2021", "2022"]
months = [f"{m:02d}" for m in range(1, 13)]
for group_name, vars_list in variables_by_group.items():
for year in years:
for month in months:
filename = f"era5_{group_name}_{year}_{month}.nc"
c.retrieve(
"reanalysis-era5-pressure-levels",
{
"product_type": "reanalysis",
"variable": vars_list,
"pressure_level": [
"1000", "925", "850", "700",
"500", "300", "200",
],
"year": year,
"month": month,
"day": [
"01", "02", "03", "04", "05", "06",
"07", "08", "09", "10", "11", "12",
"13", "14", "15", "16", "17", "18",
"19", "20", "21", "22", "23", "24",
"25", "26", "27", "28", "29", "30", "31",
],
"time": ["00:00", "06:00", "12:00", "18:00"],
"area": [60, 70, 20, 140],
"format": "netcdf",
},
filename,
)
print(f"{filename} done")
这段代码会请求3个变量组 × 3年 × 12个月 = 108个文件,每个文件都带7层、每天4个时次、东亚区域,整体数据量还在可控范围。
脚本跑起来后,日志里会显示请求状态,从 request queued 到 request completed,再到下载进度条。如果中途断网,cdsapi 通常会报错退出,但文件不会重下。我的习惯是写一个 downloaded_ok.txt 记录已完成文件,或者先检查文件大小是否大于某个阈值,避免重复请求同一个文件。
4. 数据集使用中的常见问题与排查技巧实录
4.1 请求一直排队,下载速度慢怎么办
用CDS API下载ERA5,最常见的问题就是“排队”。日志里会出现一行 Request queued,意思是你的请求已经进入队列,但还没开始处理。这个队列的处理时间取决于服务端负载和请求体量。有时候几十秒,有时候要等十几分钟。
遇到这种情况,先不要反复重跑脚本,那样只会让队列更堵。正确的做法是判断一下请求体量:如果数据量特别大,比如全球37层逐小时10年的数据,排队几小时都正常。你能做的是拆分请求,缩小区域,减少变量和层次。
另外,CDS对同一用户同时提交的请求数量有限制,一般同时跑过多请求会报错。我在批量脚本里会加一个 time.sleep(2) 的简单限速,或者依赖 cdsapi 自身的重试机制。注意日志里如果出现 HTTPError 或 Request failed,要先停下来看错误码,而不是盲目重试。
我更推荐的一个经验是:白天网高峰容易积压,夜里或早晨提交批量请求,处理速度快不少。这并不是什么特殊渠道,只是纯工程调度上的经验。
4.2 下载完成但数据乱七八糟,维度和单位不对
这里要处理几个坑。
第一,维度顺序。你用xarray打开NetCDF时,通常维度是 time、level、latitude、longitude,这是最理想的情况。如果你使用GRIB格式,需要注意GRIB本身不含坐标轴变量名,读取时对经纬度单位、扫描方向会更敏感。我建议下载时直接选 format: "netcdf",省掉很多麻烦。
第二,单位。ERA5在气压层数据里,温度单位是开尔文(K),不是摄氏度;位势高度单位是 m²/s²,不是位势米。画图前需要换算。位势高度从 geopotential 换算成位势米(gpm),要除以重力加速度9.80665。很多初学者直接拿原始值画500 hPa高度图,出来的数字全是几十万,完全不对。
第三,相对湿度。某些版本的ERA5相对湿度可能以百分比存储,也可能以0到1的小数存储,取决于你下载的变量。CDS文档里写的是百分比,但保险起见,读取后先打印最大值和最小值确认一下。
4.3 内存爆炸,文件打不开
这是用ERA5做长时间序列分析时特别头疼的问题。一个全球逐小时、37层、若干变量的文件可能超过10GB,直接 xr.open_dataset 会内存溢出。
解决思路是流式读取和分块计算。xarray 配合 dask 可以只用元数据打开文件,需要计算时再按块加载。示例:
python复制import xarray as xr
ds = xr.open_dataset(
"era5_big.nc",
chunks={"time": 24, "level": 1},
)
subset = ds.sel(
time=slice("2023-01-01", "2023-01-31"),
level=500,
latitude=slice(60, 20),
longitude=slice(70, 140),
)
mean_field = subset["geopotential"].mean(dim="time").compute()
print(mean_field)
这里有两个地方值得注意。一是 latitude=slice(60, 20) 看起来是“从大往小切”,因为ERA5的纬度是从北到南排列的,如果你写 slice(20, 60) 会返回空数据。二是 compute() 才真正触发计算和内存加载,在这之前只是构造了计算图。
如果你要处理的数据量实在太大,我更建议在下载阶段就把区域裁剪好,而不是全量下载回来再切片。宁可在请求列表里多写几个区域任务,也别让本地内存爆炸。
4.4 下载环境中的常见报错速查表
| 现象 | 常见原因 | 处理方式 |
|---|---|---|
| 401 Unauthorized | .cdsapirc 没配置或key格式错误 |
检查url和key,确认 UID:APIKey 格式 |
| 400 Bad Request | 变量名错误、pressure_level写成复数 | 对照CDS文档变量字典,复制标准变量名 |
| 请求一直queued | 请求体量太大或服务端繁忙 | 拆分时间、区域、变量,错峰提交 |
| 下载中断,文件大小为0 | 网络中断或请求超时 | 检查文件大小,删掉无效文件重新请求 |
| NetCDF打不开 | 文件未下载完整 | 用 os.path.getsize 检查大小,配合循环重试 |
| 经度范围异常 | area顺序写错 | 按北、西、南、东顺序检查 |
| 温度数值上万 | 单位还是K | 减273.15转摄氏度 |
| 位势高度数值过大 | 还没有换算 | 除以9.80665转位势米 |
这张表基本覆盖了我用ERA5压数据三年的高频坑位。遇到报错先对表做检查,往往能省半小时排查时间。
5. 实操案例:从数据下载到出图,完整跑一遍
5.1 画500 hPa位势高度场和风场
拿到数据后,第一个最直观的应用就是画天气图。这里展示一个精简但完整的流程,以下代码是在已下载好 era5_500hpa_20230101_00.nc 文件的基础上进行的。
python复制import xarray as xr
import matplotlib.pyplot as plt
import cartopy.crs as ccrs
import cartopy.feature as cfeature
import numpy as np
ds = xr.open_dataset("era5_500hpa_20230101_00.nc")
hgt = ds["z"] / 9.80665 # 转位势米
u = ds["u"]
v = ds["v"]
lon = ds["longitude"]
lat = ds["latitude"]
fig = plt.figure(figsize=(10, 8))
ax = plt.axes(projection=ccrs.PlateCarree())
ax.set_extent([70, 140, 20, 60], crs=ccrs.PlateCarree())
levels = np.arange(5200, 6000, 40)
cf = ax.contourf(lon, lat, hgt, levels=levels, cmap="RdYlBu_r", transform=ccrs.PlateCarree())
contour = ax.contour(lon, lat, hgt, levels=levels, colors="black", linewidths=0.8, transform=ccrs.PlateCarree())
ax.clabel(contour, inline=True, fontsize=8)
ax.barbs(
lon[::4], lat[::4],
u[::4, ::4], v[::4, ::4],
length=5, transform=ccrs.PlateCarree(),
)
ax.add_feature(cfeature.COASTLINE, linewidth=0.5)
ax.add_feature(cfeature.BORDERS, linewidth=0.5)
plt.colorbar(cf, orientation="horizontal", pad=0.05, label="gpm")
plt.title("ERA5 500 hPa Geopotential Height and Wind 2023-01-01 00UTC")
plt.show()
这里 barbs 叫风羽图,在气象里很常用。通过等值线的疏密和风羽的方向,你可以很直观看出高空槽脊位置以及西风带的走向。我第一次画出这种图时,很清楚感受到ERA5数据的价值:一张图就能复现当时的天气形势,这对于天气过程复盘、教学演示都特别有说服力。
5.2 计算温度平流作为应用示范
下载下来的变量可以进一步做物理量诊断。举个经典公式:温度平流
[
-\vec{V} \cdot \nabla T
]
它表示暖空气或冷空气的水平输送对局地温度变化的影响。用ERA5的u、v和温度,在850 hPa层算一个简化版。注意这里不做严格的球坐标订正,只演示工作流。
python复制import xarray as xr
import numpy as np
ds = xr.open_dataset("era5_temp_wind_850.nc")
u = ds["u"].sel(level=850)
v = ds["v"].sel(level=850)
t = ds["t"].sel(level=850)
# 简单用有限差分求温度梯度,单位K/m
# 先对经度、纬度方向差分
dT_dlon = t.differentiate("longitude")
dT_dlat = t.differentiate("latitude")
# 实际单位还需要乘经纬度方向单位距离,这里只做框架示例
adv = -(u * dT_dlon + v * dT_dlat)
在正式科研里,计算温度平流会把经纬度差换算成米,还会做球坐标订正,但思路就是这样:先微分、再和风场点乘、最后取负号。ERA5的气压层数据空间分辨率高,算出来的温度平流场平滑度很好,基本不会出现噪点爆炸的问题。
5.3 从气象到能源、航空,这套数据还能怎么用
数据本身是中性的,价值体现在应用。
风资源评估领域,ERA5气压层数据常用来获取不同高度的风场,尤其是850 hPa和边界层附近的水平风。配合测风塔实测数据做相关性修正,可以做区域风能潜力的快速筛选。这个过程比单纯用单层数据更精细,因为你可以从垂直剖面判断风切变强度。
航空气象领域,高空急流的位置和强度对航路飞行影响很大。ERA5的250 hPa和200 hPa风场数据,可以辅助判断颠簸风险区。有些业务系统会把急流轴和晴空颠簸指数结合起来做风险提示,ERA5逐小时更新虽然不如实时观测那么及时,但回溯分析非常有用。
环境科学领域,气压层的三维风场和混合层高度,是污染扩散模拟的重要输入。你可以用ERA5风场驱动拉格朗日粒子扩散模型,回算重污染过程中污染气团从哪里来。加上ERA5有几十年连续数据,做长期趋势分析没有观测空缺问题。
6. 我用ERA5气压层数据这几年,最想提醒你的几件事
第一件事:变量名永远以CDS官方文档为准,不要凭记忆写简称。我见过太多人把 u_component_of_wind 缩写成 u 或者 U_wind,然后请求返错,一气之下以为数据接口坏了。其实接口很死板,它只认标准名。
第二件事:下载数据前先问自己,是否可以把时间分辨率降低。很多时候做气候统计根本不需要逐小时数据,用 00:00 和 12:00 两个时次,或者取日平均,能把数据量缩小一个数量级。数据量小了,后面处理、存储、画图都会轻松非常多。
第三件事:一定要多做单位换算和数值合理性检查。下载完数据后,先用 print(ds[var].min(), ds[var].max()) 看一眼取值范围。温度如果是200多K,没问题;位势高度如果是几十万,先想到换算;风速如果显示几百米每秒,那多半是数据读取错误。一个简单的极值检查,能帮你提前发现串维度、选错层、单位没换算等一堆问题。
ERA5气压层数据是个非常趁手的工具,但工具越强,越需要你谨慎使用。我身边一直有同事觉得下载麻烦、数据大、格式难处理,宁可去用拼凑的再分析产品,也不愿意花半小时把这套流程跑通。实际上你只要完整走一遍“注册—配置—下载—读取—出图”的流程,后面的工作基本就是批量复制逻辑了。先从小区域、短时段、少变量开始,跑通后再逐步扩大,这是我认为最稳的上手路径。
