很多人上手 Python 爬虫,第一反应就是去抓电商商品、抓社交评论,结果没跑几步就被登录校验、参数加密、封 IP 轮番教育,代码还没调通就先放弃了。我这些年带过不少人入门,也越来越觉得:练爬虫不要一上来就挑硬骨头,先找一个“低摩擦”的数据源把整条链路跑通,才是性价比最高的方式。天气数据就是这类目标的典型代表:公开、稳定、字段干净,而且天然带时间维度,抓下来之后可以直接做可视化分析。
这篇内容我会完整记录从零爬取全年天气数据并做可视化分析的过程,不绕弯子,直接把我在实际项目中用到的操作顺序讲清楚:先确定数据源和 URL 规律、再写抓取脚本、清洗数据、最后用几张图把这一年的天气变化说明白。不管你是刚学完 requests 的 Python 新手,还是想给自己补一个“爬虫 + 数据分析”小项目的同学,这篇文章都值得跟着做一遍。整个项目跑完后,你手里的不只是一堆数字,而是能回答“这座城市最热的时段是什么时候”“什么时候昼夜温差最大”“雨季集中在哪几个月”这几件事的完整分析工具。
1. 为什么我把“全年天气数据”列为第一个爬虫练习项目
很多人以为爬虫练的就是 requests 和 BeautifulSoup 这两个库怎么用,其实不是。真正决定一个爬虫项目能不能做成、做完了有没有价值的,是数据源选择、请求节奏控制、数据清洗和分析链路规划这些在代码之外的功夫。天气项目恰好能把这些点全部练到。
1.1 练的是爬虫通用链路,不是某种奇技淫巧
一个完整的爬虫项目,拆开来看永远是这几步:找到数据源、分析目标内容的规律、构造请求、处理响应、把需要的数据落地。天气数据在这个链路里几乎没有“脏活”——不需要模拟登录,不需要逆向加密参数,返回的数据结构也很规矩。正因如此,你才能把注意力放在真正通用的能力上,而不是被某一家网站的特殊反爬手段带偏。
我第一次完整跑天气项目的时候,最大的体会是:原来最花时间的不是写请求代码,而是搞清楚“怎么把一整年的日期翻译成服务器能理解的参数”。这个能力在爬任何网站时都一样,你在页面上看到的数据,背后一定对应某个 URL、某个参数、某次请求,找到这个对应关系以后,代码量反而很小。
1.2 天气数据天然适合做可视化分析
练爬虫还有一个容易忽略的点:抓完数据之后,如果只是打印出来或存成 Excel,项目大概率做完就丢。可一旦进入可视化阶段,你就被迫去思考数据质量、数据之间的关系,以及怎么把一个时间序列讲清楚。天气数据做可视化非常友好:它有明确的时间轴,有温度、降水、风速这类连续变量,图表做出来不需要额外解释,看的人一眼就能明白。
而且天气数据适合做多城市、多年份的横向扩展。同一个脚本今天抓杭州,明天改成南京,后面想对比三年的气温变化,只需要改几个参数,不用重写逻辑。这种“可复用”带来的成就感,比照着教程敲一个玩具项目强太多。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 开始写代码前,先把数据源和 URL 规律摸清楚
这个项目里最容易翻车的环节,不是代码语法,而是你根本不知道数据从哪来。有些人一上来就搜索“XX天气历史数据”,然后拿着一个网页硬解析,结果页面改版、编码混乱、字段对不上,折腾一下午也拿不到完整一年的数据。更好的做法是先找一个稳定的公开数据源,把请求结构摸清楚,再根据它的返回格式设计抓取脚本。
2.1 为什么我不建议直接去找“天气预报网站”硬抓
这里要先说清楚一个概念:广义的爬虫不只包括把 HTML 网页抓下来解析,也包括用程序批量请求一个 JSON 接口并处理返回数据。很多网站页面上的天气数据,其实也是通过内部接口加载的。用一个稳定的公开天气查询服务,虽然看起来像是在“调 API”,但它锻炼的核心能力和网页爬虫完全一致:构造请求参数、处理状态码、解析结构化数据、控制请求频率。等到你理解了整套逻辑,再去爬网页,不过就是把“解析 JSON”换成“解析 HTML”而已。
所以我这个项目选择了 Open-Meteo 这样一个不用注册、不用密钥、完全公开的历史天气查询服务。它最方便的地方是,请求 URL 就是普通 HTTP 链接,复制到浏览器里能直接看到 JSON,很适合用来学习“URL 参数到数据响应”的过程。
2.2 解读一个真实的天气数据请求
以杭州为例,经纬度大约在北纬 30.2741、东经 120.1551。要获取 2023 年全年每一天的最高气温、最低气温和降水量,一个完整的请求 URL 长这样:
text复制https://archive-api.open-meteo.com/v1/archive?latitude=30.2741&longitude=120.1551&start_date=2023-01-01&end_date=2023-12-31&daily=temperature_2m_max,temperature_2m_min,precipitation_sum&timezone=Asia%2FShanghai
这段 URL 里的参数并不复杂,我来逐个拆解:
| 参数 | 值 | 含义 |
|---|---|---|
| latitude | 30.2741 | 目标位置纬度,北纬为正 |
| longitude | 120.1551 | 目标位置经度,东经为正 |
| start_date | 2023-01-01 | 开始日期,ISO 格式 |
| end_date | 2023-12-31 | 结束日期 |
| daily | temperature_2m_max,temperature_2m_min,precipitation_sum | 每天需要哪些字段,分别是最高气温、最低气温、降水量 |
| timezone | Asia/Shanghai | 时区,保证日期对应本地时间 |
注意里面那个 %2F 是 URL 编码后的斜杠 /,有些服务端不处理裸斜杠会报错,所以文档里经常会看到这种写法。在 Python 里使用 requests 库的 params 参数时,requests 会自动帮你做好编码,不需要手动替换。
2.3 跑通探测请求,再谈批量抓取
写循环抓全年之前,一定要先跑通单个请求。我当时是先写一个最简版本,直接请求一年的数据并打印前几条:
python复制import requests
BASE_URL = "https://archive-api.open-meteo.com/v1/archive"
params = {
"latitude": 30.2741,
"longitude": 120.1551,
"start_date": "2023-01-01",
"end_date": "2023-01-31",
"daily": "temperature_2m_max,temperature_2m_min,precipitation_sum",
"timezone": "Asia/Shanghai",
}
resp = requests.get(BASE_URL, params=params, timeout=15)
print(resp.status_code)
print(resp.json())
先请求一个月而不是一整年,这种“探测请求”是很有必要的。它能让你快速确认三个问题:URL 参数有没有拼错、服务器是否正常返回数据、返回的 JSON 结构是否符合预期。看到控制台能打印出日期列表和对应温度数组,再往下写循环就不会两眼一抹黑。
如果你发现打印出来的 JSON 里 daily 下面是以时间数组形式组织的,就说明后续要用 DataFrame 或者 zip 把日期和温度一一对应起来。这一步要是没搞清楚,后面很容易出现取错字段的问题。
3. 抓取全年数据:用循环请求代替一次全量拉取
在确认数据接口没问题之后,就要考虑怎么把“一天一天”或“一月一月”的数据变成一整年的结构化文件。这里我不建议一次性请求全年 365 天,虽然这个接口支持这么干,但按月循环请求是更值得养成的习惯——真实爬虫项目里,数据量一大就必须分页、分片处理,单次请求能拿到的数据永远有限,学会切片请求比盲目追求“一次拉完”重要得多。
3.1 安装依赖和整体脚本思路
这个项目用到的主要库有三个:requests 负责发请求,pandas 负责整理数据,matplotlib 负责后续绘图。先用命令装好:
bash复制pip install requests pandas matplotlib
整体脚本思路其实很短:循环遍历 1 到 12 月,每个月生成对应的起止日期,请求数据后把返回的日期、最高气温、最低气温、降水量拼成一个临时 DataFrame,全部收集完成后再合并成一个全年 DataFrame,最后存成 CSV。为了让脚本可复现,我把目标城市的经纬度和年份都做成变量,后续想换城市、换年份只需要改最上面的几行。
3.2 按月循环请求的实现
直接贴一个我实际用过的抓取脚本,注释写在对应位置:
python复制import calendar
import time
import pandas as pd
import requests
# 目标城市经纬度,示例为杭州
LAT, LON = 30.2741, 120.1551
YEAR = 2023
BASE_URL = "https://archive-api.open-meteo.com/v1/archive"
HEADERS = {
"User-Agent": "weather-learning-script/1.0 (personal project)"
}
def fetch_month(year: int, month: int):
"""抓取某年某月的逐日天气"""
last_day = calendar.monthrange(year, month)[1]
params = {
"latitude": LAT,
"longitude": LON,
"start_date": f"{year}-{month:02d}-01",
"end_date": f"{year}-{month:02d}-{last_day:02d}",
"daily": "temperature_2m_max,temperature_2m_min,precipitation_sum",
"timezone": "Asia/Shanghai",
}
for attempt in range(3):
try:
resp = requests.get(
BASE_URL,
params=params,
headers=HEADERS,
timeout=15,
)
if resp.status_code == 200:
return resp.json()
print(f"HTTP {resp.status_code},第 {attempt + 1} 次请求失败")
except requests.RequestException as exc:
print(f"请求异常:{exc},第 {attempt + 1} 次请求失败")
time.sleep(3 * (attempt + 1)) # 指数退避,等一会儿再试
return None
frames = []
for month in range(1, 13):
print(f"正在抓取 {YEAR} 年 {month:02d} 月")
data = fetch_month(YEAR, month)
if data is None or "daily" not in data:
print(f"{month} 月数据抓取失败,跳过")
continue
daily = data["daily"]
month_df = pd.DataFrame({
"date": daily["time"],
"temp_max": daily["temperature_2m_max"],
"temp_min": daily["temperature_2m_min"],
"precipitation": daily["precipitation_sum"],
})
frames.append(month_df)
time.sleep(0.5) # 适度限速,避免请求太频繁
raw_df = pd.concat(frames, ignore_index=True)
raw_df.to_csv(f"weather_{YEAR}.csv", index=False, encoding="utf-8-sig")
print(f"共抓取 {len(raw_df)} 天数据,已保存到 weather_{YEAR}.csv")
这个脚本里有几个值得注意的细节。第一,calendar.monthrange(year, month)[1] 用来获取当月最后一天,处理 2 月 28 天和 29 天时不用自己判断。第二,time.sleep(0.5) 控制在两次请求之间留出间隔,这是对数据源最基本的尊重。第三,请求失败时做了最多 3 次重试,并且每次等待时间递增,避免在服务器繁忙时暴力重试。
3.3 结果合并与落盘:CSV 是后面所有分析的地基
脚本运行结束后,你应该会看到一个 weather_2023.csv 文件,里面有 365 行左右的数据。我特意用 utf-8-sig 而不是普通的 utf-8 保存,是因为 Excel 打开带 BOM 头的 UTF-8 文件时能正确识别中文,后续你想直接用 Excel 看也方便。
CSV 是后面所有分析的地基,这个阶段千万不要为了省事直接跳到绘图。先把文件保存好,再用 pd.read_csv 读回来确认列名、行数、字段类型都没问题,后面清洗和处理才会顺利。我自己的习惯是每爬完一步就落盘一次,宁可中间文件多几个,也不希望在分析阶段发现数据缺了一整天,回头还得重新跑请求。
4. 清洗与预处理:拿到 365 行数据只是开始
接口返回的数据干净是相对而言的,真正把它读进 pandas 之后,你会发现至少有四件事必须处理:日期列还不是时间对象、可能有缺失值、极端值需要检查、还缺少适合分析的新字段。跳过这一步直接画图,通常会得到一张坐标轴混乱、曲线带缺口、甚至结论错误的图。
4.1 先看数据落到本地后长什么样
抓取脚本完成以后,第一步永远是用 df.info() 和 df.head() 检查数据,而不是急着画图。我自己见过太多初学者,数据都没看过就直接 plt.plot,最后当然不知道为什么报错。
python复制import pandas as pd
df = pd.read_csv("weather_2023.csv", encoding="utf-8-sig")
print(df.shape)
print(df.dtypes)
print(df.head())
print(df.isna().sum())
正常情况下,date 列应该是字符串或 object 类型,temp_max、temp_min、precipitation 应该是 float 或 int 类型。如果 isna().sum() 显示某个字段有很多空值,就必须回头检查是不是有月份没有抓成功。
4.2 处理缺失值、异常值和值得新增的字段
先把日期转换成 datetime 类型,这一步不做,后面所有按时间聚合和画图的逻辑都会出问题。然后我习惯增加两个辅助列:一个是从日期中提取月份,另一个是计算当天的昼夜温差,即最高气温减去最低气温。
python复制df["date"] = pd.to_datetime(df["date"])
df["month"] = df["date"].dt.month
df["temp_range"] = (df["temp_max"] - df["temp_min"]).round(1)
# 检查日期是否齐全
full_index = pd.date_range("2023-01-01", "2023-12-31", freq="D")
missing_days = full_index.difference(df["date"])
print("缺失日期数量:", len(missing_days))
if len(missing_days) > 0:
print(missing_days)
# 检查基础异常:最低温不应该高于最高温
abnormal = df[df["temp_range"] < 0]
print("异常记录数量:", len(abnormal))
日期齐全性检查很重要。我们按月份抓取,如果某个月因为网络问题在重试 3 次之后还是失败,
