1. 为什么拿新冠疫情预测作为深度学习入门题
1.1 这个项目练的不是模型,是完整流程
很多初学者找我咨询深度学习入门,第一句话往往是“我想学LSTM”或者“我想做图像识别”。但真正的问题不是学哪个模型,而是能不能独立跑通一个完整的项目链路:数据获取、清洗、特征构造、模型搭建、训练验证、结果评估。
新冠感染人数预测恰好是这么一道“全链路”的入门题。它不像图像分类那样需要你折腾复杂的卷积网络,也不像自然语言处理那样要处理词向量和注意力机制。数据本身就是一张CSV表格,里面是日期和每日新增确诊数,目标明确:用过去一段时间的数据,预测未来一段时间的结果。整个项目对机器配置要求极低,CPU都能跑,数据和代码都好找,非常适合用来建立对深度学习项目的整体手感。
用PyTorch也好,TensorFlow也好,核心不是框架选择,而是你能否理解“时间序列数据”和“普通表格数据”在训练时的本质区别。这个区别如果没搞懂,后面调什么模型都是白费。
1.2 大多数人第一次跑这个项目容易在哪翻车
先说我观察到的几个高频翻车点,也是这个项目最有学习价值的地方。
第一个翻车点是数据泄漏。很多人把数据集随机切分成训练集和验证集,然后用后一段数据里的“未来信息”去预测前一段,最后验证集上表现惊人,换到真实场景立刻崩盘。
第二个翻车点是用原始确诊数字直接训练。2020年到2021年,很多国家的每日新增数据跨度极大——从几十例到几十万例,这种量纲差异会让均方误差完全被峰值数据主导,模型为了照顾那几个峰值点,把其他所有时间段全部拟合成了“基本为零”。最后预测曲线就是一条几乎贴地的线。
第三个翻车点是单步预测自嗨。模型用前14天预测第15天,在验证集上画出来的曲线和真实曲线高度重合,于是以为成功了。实际上每次预测都依赖前一步预测的结果作为输入,误差会一级级累积,预测到第7天以后曲线就开始放飞自我。
这篇文章我会按我实际做这个项目时的顺序,把数据准备、特征构造、模型选型、训练验证和结果评估整个过程过一遍,重点写那些“教程里不会告诉你、但你自己踩一次要浪费好几天”的细节。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 数据准备:下载CSV只是开始
2.1 数据源与最初的数据清洗
做这个项目,数据源我建议用约翰霍普金斯大学维护的公开疫情数据集(GitHub上直接可以下载)。它提供全球各国每日累计确诊数,原始文件是CSV格式,每行是一个国家或地区,每列是一个日期,单元格里的数值是当天累计确诊人数。
下载完第一件事不是建模,是看数据。先用 Pandas 把它读进来,打印前几行和数据类型,看看有没有缺失值、负数和乱码列名。
python复制import pandas as pd
df = pd.read_csv("time_series_covid19_confirmed_global.csv")
print(df.head())
print(df.info())
这段代码跑完,你会发现问题:原始宽表里,每个日期占一列,国家在行上。这种“宽表”适合人眼看,但不适合建模。你需要用 pd.melt() 把它从宽表转成长表,变成三列:国家、日期、累计确诊数。
python复制df_long = df.melt(
id_vars=["Country/Region"],
value_vars=df.columns[4:],
var_name="date",
value_name="confirmed"
)
df_long["date"] = pd.to_datetime(df_long["date"])
df_long = df_long.sort_values(["Country/Region", "date"]).reset_index(drop=True)
然后把累计确诊数转成每日新增数。很多人这一步偷懒,直接对累计值建模,结果发现模型总是预测一个单调递增的曲线——这本来就是累计曲线的特性,根本不需要深度学习,随便一个线性模型都能做到。我们要预测的是“新增感染人数”,这才是真正有波动、有难度的目标序列。
python复制df_long["daily_new"] = df_long.groupby("Country/Region")["confirmed"].diff().fillna(0)
接下来处理异常值。疫情数据里经常出现“某天新增为负”的情况,这是因为上报口径调整、历史数据修订,导致当天累计值比前一天还小。对这类数据,最简单的处理是把它替换成前后几天的移动平均值,或者直接删掉。别小看这一步,如果你把一个巨大的负脉冲喂给神经网络,模型会被这种“根本不是规律”的噪声带偏。
2.2 疫情期间数据口径变化带来的“伪异常”
刚开始做这个项目,我把全部历史数据丢进模型,训练出来的结果非常离谱:模型预测的曲线在某个时间点突然断层式下跌,然后又缓慢回升。起初我以为是模型结构问题,换了LSTM、换了GRU,问题依旧。
排查了很久才发现,问题出在数据口径上。疫情期间,很多国家的确诊标准发生过变化:一开始只统计核酸检测阳性,后来增加了抗原检测阳性,再后来又调整了统计口径。每一次口径变化,都会在时间序列上制造一个明显的“跳变”或“断点”。这些点不是真实的感染人数波动,而是统计规则的变化。模型没有能力区分这两者,它只会努力去拟合这个突变。
处理方式有两种。第一种是做幅度修正:找到断点位置,把断点前后的数据按比例对齐,消除台阶效应;第二种是直接截取时间范围,只使用疫情结束后、口径相对稳定的那段时间。作为一个入门项目,我强烈建议选择第二种——简单、可靠,不引入额外的主观修正偏差。
我当时选了一个疫情已经趋于平稳、每日新增数据相对平稳的年度区间,用截取后的数据重新训练,效果立竿见影。这也给了所有入门者一个教训:建模前你花多久清洗数据都不为过,花多久调参都嫌多。
2.3 目标序列的对数变换:指数增长数据的必修课
清洗完异常值和断点之后,还有一道关键工序:对数变换。
为什么需要它?你先看一下你的每日新增序列的分布。疫情期间,部分时段的每日新增数据可能是一万到十万这个量级,但在爆发早期可能是几十。如果直接用原始数值算均方误差,那么模型会把几乎所有“注意力”都放在数值大的爆发时段,数值小的时段即使预测偏差一倍,损失函数里也体现不出来。
对数变换能把乘法关系变成加法关系:原始值从1000变成10000,对数空间里只是从6.9变成9.2。这样一来,不同量级的数据在损失函数中的贡献就均衡了。
python复制import numpy as np
df_long["log_new"] = np.log1p(df_long["daily_new"])
预测完成之后,再通过 np.expm1() 把预测值还原成原始量纲。这里有个小细节:评估指标最后要在原始量纲上算一次,因为对数空间的误差对读者没有直观意义;但训练时的损失函数用对数空间误差,模型学起来才稳定。
3. 数据泄漏:时间序列项目最容易踩的雷
3.1 数据泄漏的三个常见来源
数据泄漏在时间序列项目里的杀伤力,比任何模型选型错误都大。我见过不止一个新手,用着最复杂的双向LSTM,效果看似完美,结果只是把未来数据泄漏进了训练集。
泄漏的第一个来源是随机切分。时间序列数据不允许随机打乱,必须严格按时间顺序划分训练集和验证集。为什么?因为模型要学习的是“从过去预测未来”的规律,如果验证集里出现时间上早于训练集的数据,模型相当于提前“见过了”未来的一部分信息。
泄漏的第二个来源是特征构造时用了未来信息。比如你想加一个“7日均线”作为特征,如果某一天的7日均线计算包含了后面3天的数据,那么预测的那一天实际上“偷看”了未来。正确的做法是只用截止到当天的历史窗口计算所有特征。
泄漏的第三个来源是数据归一化。很多人在整个时间序列上计算均值和标准差,然后做标准化。这同样有问题:验证集的统计量无意中进入了训练过程。应该只基于训练集计算归一化参数,再把这个参数套到验证集上。
3.2 正确的切分方式:滚动验证与 walk-forward
针对疫情预测这个场景,我用的切分方式是 walk-forward,也叫滚动验证。核心思想是:不断把验证窗口向后平移,每平移一次,就把之前“验证过”的数据并入训练集,再预测下一段时间。
具体做法是这样的。假设我有500天的数据,预测窗口是14天:
- 第一次:用第1~200天训练,预测第201~214天
- 第二次:用第1~214天训练,预测第215~228天
- 第三次:用第1~228天训练,预测第229~242天
以此类推。这样做最贴近真实使用场景:每当你有了新数据,就重新训练一次模型,预测未来两周。因为训练集只包含过去的信息,所以完全不存在泄漏问题。
如果嫌反复训练费时,也可以用一种简化模式:一次性把前80%作为训练集,后20%按连续时间块作为验证集。这个方案虽然不如walk-forward严谨,但作为入门跑通流程已经够用。我在实验里用的是后者,因为训练速度快,迭代调参方便;等模型结构确认没问题了,再改用walk-forward做最终效果评估。
3.3 预测任务定义:单步还是多步
预测任务的定义方式,比很多人想象中更影响结果。最常见的定义是:给定过去N天的数据,预测接下来M天。但M=1和M=14的训练难度完全不同。
我的建议是:如果不是为了展示效果,第一步先把M设为1,把单步预测跑通。因为单步预测的误差累积最小,训练也最简单。等到单步效果稳定了,再做多步预测。
多步预测有两种实现方式。第一种是迭代预测,就是模型每次只预测未来一天,然后把预测值当作已知输入,再预测下一天,循环M次。第二种是直接预测,就是让模型一次输出M个值,对应未来M天。
我试下来,入门阶段用迭代预测更合理。因为直接预测M个值会大大增加输出层的复杂度,而且M个输出之间缺乏约束,容易产生不合理的波动。迭代预测虽然每次预测有误差累积,但误差结构更透明,出了问题更好定位。
4. 从线性基准到PyTorch实现:模型选型的思路
4.1 先跑通AR基准模型,建立下限
很多初学者一上来就搭三层LSTM,训了半天发现结果不如一个简单的线性回归,心态直接崩掉。我在这个项目里踩过同样的坑之后,学乖了:任何时间序列预测项目,先用一个最简单的自回归(AR)模型建立基线。
自回归模型的含义很直白:用过去p天的数据,线性加权预测未来一天。它没有隐藏层,没有激活函数,本质上就是一个线性回归,输入是过去14天的新增感染数,输出是未来1天。甚至连深度学习框架都不需要,用sklearn的LinearRegression就能跑通。
python复制from sklearn.linear_model import LinearRegression
def make_features(data, window=14):
X, y = [], []
for i in range(len(data) - window):
X.append(data[i:i + window])
y.append(data[i + window])
return np.array(X), np.array(y)
X, y = make_features(log_new_values)
train_size = int(len(X) * 0.8)
X_train, X_test = X[:train_size], X[train_size:]
y_train, y_test = y[:train_size], y[train_size:]
model = LinearRegression()
model.fit(X_train, y_train)
baseline_rmse = np.sqrt(np.mean((model.predict(X_test) - y_test) ** 2))
print(f"AR baseline RMSE (log space): {baseline_rmse:.4f}")
这个基线模型跑出来,记录一下RMSE。后面无论你上什么深度学习模型,如果预测误差没有明显低于这个值,说明你的深度学习模型没有学到比“线性组合历史窗口”更多的东西。这时候你要做的不是换更大模型,而是检查数据处理和特征构造。
4.2 MLP滑动窗口:深度学习的第一个真正模型
基线稳了之后,再把同样的输入结构搬到PyTorch里,搭一个最简单的多层感知机(MLP)。输入还是过去14天的对数新增数,网络结构就三层:输入层14维、隐藏层64维、输出层1维。隐藏层激活函数用ReLU,输出层不加激活。
一个常见的疑问是:输入维度只有14,这么少的信息量,用MLP够吗?我的体验是,完全够。因为在“过去14天预测未来1天”这个任务里,真正有用的信息就是近期趋势、周期性、波动幅度这些局部特征,MLP有能力捕捉它们。LSTM的优势在于处理更长、更复杂的时序依赖,在窗口为14的设定下优势并不明显。
PyTorch实现的关键代码大致长这样:
python复制import torch
import torch.nn as nn
class MLPForecast(nn.Module):
def __init__(self, input_size=14, hidden_size=64):
super().__init__()
self.fc1 = nn.Linear(input_size, hidden_size)
self.relu = nn.ReLU()
self.fc2 = nn.Linear(hidden_size, 1)
def forward(self, x):
return self.fc2(self.relu(self.fc1(x)))
训练时记得用Adam优化器,学习率从1e-3开始,损失函数用MSE。我把训练集按比例再切出一小块作为验证,用来观察过拟合情况;但注意验证集的数据顺序仍然不能乱,只能从训练集的末尾切。
MLP跑通之后,你会看到验证集的RMSE比AR基线要低。这说明非线性激活函数确实捕捉到了数据中的非线性模式。不过别高兴太早,这个提升幅度通常在10%~20%左右,属于合理范围。如果MLP和AR的RMSE几乎一样,很可能是因为数据噪声太大,或者窗口不够长。
4.3 要不要上LSTM:什么时候LSTM才有意义
做完MLP之后,很多人会问:那LSTM还有必要上吗?我的看法是:有必要,但你要知道它到底在什么场景下才有优势。
LSTM的核心能力在于维护一个“内部状态”,这个状态可以在时间维度上记忆长期信息。它适合的是“当前输出依赖很早之前的输入”的任务。比如预测某个国家未来一周的感染趋势,如果两三个月前出现过一轮大规模感染,人群免疫水平有了变化,这种长距离信息可能会影响当前预测——LSTM理论上能捕捉到这种依赖。
具体到代码,PyTorch里实现一个单层LSTM预测器非常简洁:
python复制class LSTMForecast(nn.Module):
def __init__(self, input_size=1, hidden_size=32, num_layers=1):
super().__init__()
self.lstm = nn.LSTM(input_size, hidden_size, num_layers, batch_first=True)
self.fc = nn.Linear(hidden_size, 1)
def forward(self, x):
out, _ = self.lstm(x)
return self.fc(out[:, -1, :])
注意这里输入形状和MLP不同:MLP输入是 (batch, window),而LSTM输入是 (batch, window, input_size),因为LSTM要求显式地给出时间步维度。
我实际对比过,在窗口长度14、预测步长1的设定下,LSTM的RMSE和MLP差不多,甚至偶尔还略差一点。因为14天窗口内的短期依赖,MLP完全够用,LSTM的循环结构反而增加了训练难度。但一旦把预测窗口拉长到7天以上,做迭代预测时,LSTM的优势才会逐步显现出来。因为它每次用“自己的预测”作为下一次输入,对偏差演化的建模能力比MLP更稳健。
所以我的建议很直接:入门项目里,先用AR建立下限,再用MLP验证非线性能力,最后再上LSTM做对照。每一层都有明确的学习目标,而不是一上来就堆模型。
5. 训练与调参过程中真正有用的技巧
5.1 损失函数、评估指标与激活函数的选择
训练时间序列模型,损失函数的选择容易被忽视。很多教程默认用MSE,但MSE对离群点极敏感,疫情数据里偶尔的一两天异常反弹,会给梯度带来巨大扰动。
在我这个项目里,我对比过MSE、MAE和Huber Loss。Huber Loss是一个折中方案:误差小于某个阈值时它像MSE,误差大于阈值时它像MAE。这样既保持了可微性,又降低了大误差样本的主导作用。PyTorch里直接有 nn.HuberLoss(delta=1.0) 可用。
激活函数方面,我踩过一个具体坑:输出层直接用纯线性激活时,预测值偶尔会变成负数。对数空间里负数意味着原始值小于1,物理上就是“感染人数不可能为负”。解决办法是在输出层后面加一个Softplus激活,它既能保证输出大于0,又不会像ReLU那样在0处产生梯度断裂。
评估指标我这里用了两个维度:对数空间的RMSE用于训练决策,原始空间的MAPE用于向人解释效果。注意RMSE是“训练时用的目标”,MAPE是“汇报时用的指标”,两者可以不一样。
5.2 过拟合信号怎么识别:训练损失震荡时别急着调模型
新手最容易犯的错是:发现训练损失下不去,立刻去改模型结构、调学习率,折腾一大圈,最后发现只是数据切分或标准化出了问题。
判断过拟合,不要只看训练损失。我的做法是:把训练过程的train loss和val loss都打印出来,每5个epoch记录一次。如果你看到train loss持续下降,val loss下降若干轮后开始回升,这就是标准的过拟合信号。这时候优先做的不是换模型,而是增加正则化、降低模型容量或加早停。
torch.optim.lr_scheduler 的学习率调整策略也很有用。我会在val loss连续5轮不下降时,把学习率乘以0.5。这个技巧比手动重启训练要平滑得多。
5.3 预测结果如何展示:逆变换与置信区间
模型输出的是对数空间的值,展示给读者前,必须用 np.expm1() 还原成原始感染人数。这个环节我见过不少人在博客里跳过了,导致读者根本没法判断预测效果好坏。
除了还原量纲,一个很有价值的做法是画出“预测均值±1个标准差”的区间。实现方式不复杂:在测试时开启dropout,多次前向传播,每跑一次得到一组预测值,最后用这组预测值的均值和标准差画出置信区间。这就是一种简化的Monte Carlo Dropout,实现代码量不大,但对判断模型不确定性非常有帮助。
python复制model.train() # 开启dropout
preds = []
for _ in range(50):
pred = model(x_test_tensor).detach().numpy()
preds.append(pred)
preds = np.array(preds)
pred_mean = preds.mean(axis=0)
pred_std = preds.std(axis=0)
画图时,真实值用实线,预测均值用虚线,置信区间用浅色填充。这张图放在项目报告里,比任何指标都直观。
6. 实战全流程:从数据到最终预测结果
6.1 完整代码流程与时间开销
最后分享一套我跑通的完整流程,从数据到最终结果,大致是这样一个顺序:
- 下载JHU数据,读取CSV
- 宽表转长表,计算每日新增
- 去除断点和负值,截取稳定时间段
- 对数变换
- 构造“过去14天预测未来1天”的样本
- 按时间顺序切分训练/验证集
- 训练AR基线记录RMSE
- 训练MLP,记录RMSE对比
- 训练LSTM,记录RMSE对比
- 用最优模型做7天迭代预测
- 逆变换回原始量纲,画对比图
这套流程在普通笔记本CPU上,MLP和LSTM的训练时间都在几分钟以内。真正耗时的部分是数据清洗和频繁迭代调参,而不是模型训练本身。所以完全不用担心硬件门槛。
6.2 一个参考实验结果
我用某国稳定期的数据跑了一版,窗口14天、预测未来1天,三组模型的对数空间RMSE如下:
| 模型 | RMSE(对数空间) | 原始空间MAPE |
|---|---|---|
| AR线性回归 | 0.432 | 18.7% |
| MLP(64隐藏层) | 0.371 | 15.2% |
| LSTM(32隐藏层) | 0.368 | 15.0% |
可以看到,MLP比AR明显好,而LSTM与MLP之间的差距很小。这再一次验证了前面的判断:在短窗口、单步预测场景下,结构复杂度带来的收益有限。但换成7天多步迭代预测后,LSTM的MAPE优势会扩大到2~3个百分点。
6.3 这个项目还能怎么扩展
如果你做完基础版本,想更进一步,有下面几个自然的扩展方向:
- 把“每日新增”换成“每百万人新增”,归一化人口差异,可以做多国对比
- 加入外部特征,比如政策干预指数、疫苗接种率、季节气象数据,观察它们能否进一步降低预测误差
- 把单个国家的时间序列扩展成多个国家一起训练,做成“多任务学习”版本,让模型学习跨国的共性传播规律
- 尝试直接多步预测的模型结构,比如seq2seq或者基于Transformer的时间序列模型,对比迭代预测和直接预测的优劣
每一步扩展,都在原来的基础上增加一个新知识点。这就是我推荐这个项目的原因:它像积木一样,可以配合你当前的学习进度灵活组装。
做这个项目时,我最意外的收获其实是:大部分精力并没有花在“深度学习”本身上,而是花在了理解数据、避免泄漏、设计评估方式这些事情上。这些能力在日后做任何机器学习项目都用得上。如果你正想找一个既能练手、又能真正打磨工程能力的入门项目,这个新冠预测题,是个相当靠谱的选择。
