接手一个数据分析任务时,我最怕遇到的不是数据量大、内存爆掉,而是数据里有一列日期。日期这种字段,看着人畜无害,处理起来却能把人逼疯:一会儿是字符串,一会儿是时间戳,排序不对、格式不统一、频率对不齐,任何一步出错都会让后面的分析全部白做。后来我用Pandas处理时间序列数据越来越多,才慢慢摸清这套东西的门道。
这篇文章就是围绕用Pandas处理时间序列数据来写的,从最基础的日期字符串转换、时间索引的切片和重采样,到rolling滚动窗口、shift滞后特征,再到把处理好的时序数据交给LSTM、GRU这类预测模型前需要准备成什么样子,都会用真实可跑的代码串一遍。如果你正在用Python做销量预测、流量分析、日志统计,或者刚开始学时间序列分析,这篇文章应该能让你少踩不少坑。
1. 日期字符串和真正的时间索引之间,隔着一个to_datetime
1.1 为什么一定要把日期列变成时间类型
很多人拿到带日期的Excel表格,第一步就是pd.read_excel读进来,然后发现date列显示的是"2024/5/6"或者"2024-05-06",看起来挺正常,就直接当字符串用了。字符串不是不能用,但你会很快撞上一堵墙:想按月份汇总,得先把字符串切开再groupby;想取某个时间段的数据,正则匹配写到怀疑人生;想算距今天数,更是无从下手。
Pandas处理时间序列的核心,是把日期字符串变成真正的datetime类型,然后把它放到索引(index)或者某列中。datetime类型不是字符串的“好看版本”,它背后是年、月、日、时、分、秒、时区这些结构化属性,只有转成这种类型,你才能用df.loc['2024-05']直接取出五月的数据,才能用resample做重采样,才能用rolling做滑窗。
打个比方:字符串日期像写在纸上的地址,人能看懂,但没法直接导航;datetime类型像地图App里的经纬度坐标,只有变成坐标,你才能算距离、规划路线、按区域筛选。Pandas里,datetime就是那个坐标。
1.2 to_datetime的三种典型解析场景
把各种乱七八糟的日期统一转成datetime,靠的是pd.to_datetime这个函数。实际项目里我会把它分成三种场景来处理。
场景一:整列日期格式统一,想快速转换。这种情况直接用默认参数就行:
python复制import pandas as pd
df = pd.DataFrame({
'date': ['2024-05-06', '2024-05-07', '2024-05-08'],
'sales': [3200, 4100, 3900]
})
df['date'] = pd.to_datetime(df['date'])
print(df.dtypes)
输出里date列的类型会从object变成datetime64[ns],proceed到下一步。这里有个细节:to_datetime默认解析速度其实不算最快,如果你的数据有几十万行以上,最好在调用时加上format参数,告诉它日期字符串的确切格式。
python复制df['date'] = pd.to_datetime(df['date'], format='%Y-%m-%d')
format参数有两个好处:一是解析速度快很多,二是能避免歧义。比如“2024-05-06”不写format还能靠默认猜测,但遇到“06/05/2024”这种,Pandas默认会先按月份在前还是日期在前纠结一下,你直接给format='%d/%m/%Y',它就不会猜错了。
场景二:数据里混了好几种日期格式,像“20240506”“2024-05-06”“2024/5/6”都有。我的经验是不要企图用一个正则解决所有问题,直接用errors='coerce'把解析不了的转成NaT,再单独处理那一小撮脏数据,比追求一次搞定要省心得多:
python复制df['date'] = pd.to_datetime(df['date'], errors='coerce')
# 看看哪些日期解析失败了
bad_rows = df[df['date'].isna()]
print(bad_rows)
结合热搜词里有人搜“pandas数据类型转换”,指的其实就是这类object转datetime、字符串转数值的操作。遇到解析失败的行,先打印出来看看具体长啥样,是“2024年5月”这种中文格式,还是Excel导出的序列号,再针对性清洗。你要记住,pandas.drop可以删坏行,但删之前至少得知道坏在哪。
场景三:拿到的是Unix时间戳,也就是一串数字,比如1720000000。这种数据在日志系统和接口返回里很常见。这时要指定unit参数:
python复制# 单位是秒
df['ts'] = pd.to_datetime(df['ts'], unit='s')
# 单位是毫秒,常见于Java/JavaScript系统
df['ts'] = pd.to_datetime(df['ts'], unit='ms')
1.3 频率缺失时用date_range补一张完整时间表
做时序分析时还有一个经常被忽略的需求:拿到手的数据可能缺了某些日期。比如门店销售表,周日不营业,周一的数据从周二才开始;或者因为系统故障,某个小时的数据直接整段丢了。直接用原表去分析,得到的“按天汇总”其实缺了好几天,很多新手会在这一步得出错误结论。
我习惯先看数据的日期范围,然后用pd.date_range生成一张完整的日历表,再拿它去和原数据对齐:
python复制full_dates = pd.date_range(start='2024-01-01', end='2024-12-31', freq='D')
print(full_dates)
date_range里freq参数非常常用,'D'表示按天,'H'表示按小时,'MS'表示每月第一天,'W-MON'表示每周一。为什么需要它?因为原始数据里缺失的日期,Pandas不会主动帮你补上——如果你不做这一步,滚动窗口、重采样计算出来的结果全是偏的,而且越往后偏差积累越严重。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 时间索引切片与重采样:把杂乱的数据拉回固定频率
2.1 sort_index之后,loc切片才真正好用
把date列转换成datetime64之后,最顺手的一步就是把它设成索引:
python复制df = df.set_index('date').sort_index()
这里有个很容易踩的坑:只set_index不sort_index。时间索引的切片、resample、rolling都默认索引是有序的,如果你的数据时间顺序乱了,操作结果会非常诡异。所以我的习惯是设置完索引立刻sort_index,你可以把这当成时间序列操作前的固定动作。
索引排好序之后,取数据就很直观了:
python复制# 取出2024年5月整月
may_data = df.loc['2024-05']
# 取出2024年5月6日到5月10日
week_data = df.loc['2024-05-06':'2024-05-10']
# 取出5月1日早上9点那一小时的数据(数据是小时粒度时)
hour_data = df.loc['2024-05-01 09']
loc里的字符串日期会被自动识别并转成时间范围,这个能力是我用Pandas处理时间序列数据时最顺手的特性之一。但注意,切片前索引一定要是datetime类型且排过序,否则这里就会报错或取错。
2.2 用resample把日数据变月数据,让趋势浮出水面
原始数据粒度太细时,直接画图会有一堆锯齿,看不出趋势。这时需要重采样,也就是把数据从高频率聚合到低频率。日销售数据转成月度汇总,核心API是resample:
python复制monthly = df.resample('M')['sales'].sum()
resample('M')表示按月汇总,后面的['sales'].sum()表示对销量列求和。除了M,常用的还有:
| 频率代码 | 含义 |
|---|---|
| 'D' | 按天 |
| 'W-MON' | 按周,从周一开始 |
| 'M' | 按自然月(月末日期) |
| 'MS' | 按自然月(月初日期) |
| 'Q' | 按季度 |
| 'H' | 按小时 |
这里特别提醒一下'M'和'MS'的区别:'M'是月结束日,'MS'是月起始日。如果你把resample('M')结果拿出来发现索引是2024-05-31这种,这不是bug,是Pandas的规则——'M'就是给你一个月末时间戳。我觉得日常分析里用'MS'反而更好理解,索引落在月初,一眼能看出是哪个月的汇总。
如果要对多列做不同的聚合统计,可以传一个字典给agg:
python复制monthly_stats = df.resample('MS').agg({
'sales': 'sum',
'temperature': 'mean',
'customer_cnt': 'max'
})
这段代码表达的是:销量按月求和,气温按月取平均,客流量按月取最大值。agg参数让一次resample完成了多列多个聚合,不用写好几个groupby再去merge。
2.3 升采样后先reindex补齐时间轴,再决定怎么填缺失值
和降采样相对的是升采样,就是把日数据变成小时数据,或者把周数据变成日数据。升采样不会自动帮你创造数据,原表里没有的小时,变成NaN躺着等你处理。这时候我用asfreq来搭骨架:
python复制# 把日数据转成8小时粒度,缺失变成NaN
df_8h = df.resample('8H').asfreq()
然后用reindex把缺的时间点全部显式列出来:
python复制full_index = pd.date_range(start=df.index.min(), end=df.index.max(), freq='H')
df_full = df.reindex(full_index)
为什么要先reindex?因为原数据里缺失的时间点,索引里根本没有对应的行,直接ffill是没法处理的。只有先把完整时间轴铺开,每一个小时都有了一行(缺失值为NaN),后面的填充才有意义。这一步也是很多“时间序列数据预处理”教程里最爱一带而过、但实际上最影响结果的地方。
缺失值填哪种方式,取决于业务含义。销量类的数据我一般不用线性插值,因为销量受星期、促销影响很大,周末和周一之间的线性插值会造出根本不存在的数据;ffill(用前一个值填充)在“系统停机,但这段时间数值应该沿用上一个状态”的监控类数据里比较合适。时间序列里还可以用interpolate(method='time'),它会按时间间隔的比例插值,比如9点和10点的数据缺了9:30,它会取二者的中点。要根据业务场景选,不能一律bfill或一律fillna(0)。
3. 用rolling和shift搭建特征工程流水线:移动平均与滞后特征别搞混
3.1 rolling移动窗口的本质是“只看最近一段”
做销量预测、流量分析时,最常用的特征之一就是移动平均。移动平均不是“一段时间内的平均”这么简单,它是用滚动窗口对序列做的局部平滑,Pandas里由rolling实现。
下面用7天移动平均来示例:
python复制# 7天移动平均
df['sales_ma7'] = df['sales'].rolling(window=7).mean()
这段代码理解起来简单,但有几个细节容易被忽视。一是window=7在这里是按行数算的7个点,不是按自然周算的7天。如果你的数据不是严格的每天一条,而是偶尔缺两天,那么“最近7行”对应的实际时间跨度就不是7天了。要按真实时间窗口来算,可以把window改成偏移量字符串:
python复制# 最近7个自然日(按时间戳计算窗口)
df['sales_ma7d'] = df['sales'].rolling(window='7D').mean()
第二种写法更符合“最近一周”的业务直觉。数据不是每天一条、中间有缺口时,这两种写法的结果会有肉眼可见的差异。
第二个细节是min_periods参数。滚动窗口刚启动时,前面6天凑不满7个点,默认结果是NaN。如果你不希望开头出现一大片空值,可以设置min_periods=1,表示至少1个有效数据就算:
python复制df['sales_ma7'] = df['sales'].rolling(window=7, min_periods=1).mean()
第三个细节是center参数。默认情况下,rolling窗口是“过去”的窗口,也就是算第10天的移动平均时,用的是第4天到第10天;如果你设置center=True,它会以第10天为中心,算第7天到第13天的均值。在特征工程里,我们做预测特征时一定不能用未来数据,所以center=True要慎用,它只适合做平滑展示,不适合做预测特征。
3.2 shift做滞后特征时最容易踩的坑
滞后特征也是时间序列预测里离不开的操作。要预测明天的销量,前一天的销量往往是最重要的特征。Pandas里用shift来取“上一天”的值:
python复制df['sales_lag1'] = df['sales'].shift(1)
df['sales_lag7'] = df['sales'].shift(7)
shift(1)的意思是整列往下挪一行,第2天的lag1值等于第1天的当天值,第1天因为没有前一天,lag1为NaN。shift(7)则是往下挪7行,对应“7天前”的销量。
这里我踩过的坑是:当索引是时间索引时,shift是按“行数”挪,而不是按“日历天数”挪。如果数据有缺口,shift(1)得到的不一定是“昨天”,而是“表格里的上一行”。想要严格按日历天数的滞后,可以对时间索引执行如下操作:
python复制df['sales_lag_1day'] = df['sales'].shift(1, freq='D')
shift的freq参数和rolling的window偏移量一样,都是按时间长度来移动的。不过我坦白说,实际业务里很多分析师并没有注意到shift默认按行数走的特性,数据一旦有缺口,lag特征就会悄悄错位。我自己的习惯是先确保时间轴连续、没有缺失日期(用前面说的date_range + reindex流程),再使用默认shift,这样能省去很多隐蔽的错误。
另一个很常见的坑是在构造特征时把“当天”数据混进去。比如要预测明天的销量,现在的训练数据里有一列是“最近7天平均销量”,如果用rolling(7)算完之后不shift,那第10天行上的这个特征其实包括了第10天当天的销量,而你的标签也是第10天当天的销量,特征和标签就重叠了,模型会在训练时偷看未来,测试时表现一塌糊涂。正确做法是:算完rolling后,再shift(1),把所有特征整体往后挪一天,确保特征只使用历史数据。
python复制df['feat_ma7'] = df['sales'].rolling(window=7).mean().shift(1)
这一行代码是特征工程里的小细节,但价值极大,与数据泄露相关的预测翻车事故,有一大半都是这种特征和标签时间窗重叠引起的。
3.3 diff和pct_change:从绝对值到变化的视角
很多时序模型对平稳性有要求,销量、股价这类数据直接建模效果不好,但它的变化量或者变化率往往更平稳。Pandas里的diff和pct_change就是为这种需求准备的:
python复制# 一阶差分:今天的销量和昨天相比差多少
df['sales_diff'] = df['sales'].diff(1)
# 环比变化率:和昨天相比涨跌百分比
df['sales_pct'] = df['sales'].pct_change(1)
# 同比变化率:和去年同期比(数据是月度时)
df['sales_yoy'] = df['sales'].pct_change(12)
diff(1)本质上等价于df['sales'] - df['sales'].shift(1),它把非平稳的销量序列转换成相对平稳的增量序列。我在处理销售额、访问量这类序列时,经常会把diff后的序列作为机器学习模型的特征输入,而不是直接用原始值,模型拟合效果好不少。
不过要注意,diff和pct_change后的第一行必然是NaN,因为前面没有可减的对象。这个NaN必须洗掉,否则后续模型训练会报错。另外,如果数据本身带很强的周期性——比如销售数据是按周波动的,周一到周五高、周末低——只看一阶差分还不够,可以试试用shift(7)做“周同比差分”:df['sales'] - df['sales'].shift(7),这种周期差分能滤掉星期效应带来的假波动。
4. 多序列对齐、可视化外部数据读写:时间序列分析里最容易乱的部分
4.1 不同来源的数据时间戳不一致时,怎么对齐
实际项目很少只分析一列数据。比如你想分析销量和天气的关系,销量表是每天一条记录,天气表是每小时一条记录,时间戳粒度都不一样。直接把两张表塞进一个DataFrame是不行的,必须先把它们对齐到同一时间频率。
我通常的做法是:把两边的索引都转成datetime并排序,然后统一降采样到日粒度,再通过join或concat合并。
假设sales_df的索引是日期(天级),weather_df的索引是小时级:
python复制# 天气数据按天求平均
weather_daily = weather_df.resample('D')['temperature'].mean()
# 合并到销售数据上
aligned = sales_df.join(weather_daily, how='left')
这里join默认按索引对齐,索引都是datetime类型,Pandas会自动把sales_df的日期和weather_daily的日期逐一匹配。how='left'表示以销售数据为基准,天气缺哪天就补NaN;如果两边数据来源都比较全,也可以用how='outer'看看哪些日期两边对不上。
多序列对齐还有一个细节:不同时区的数据要统一。如果你合并的数据一个带时区、一个不带,Pandas会直接给你报错。解决办法是用tz_convert和tz_localize统一:
python复制df['date'] = pd.to_datetime(df['date']).dt.tz_localize('UTC')
df['date'] = df['date'].dt.tz_convert('Asia/Shanghai')
tz_localize是给一个没有时区意识的时间序列“贴标签”,tz_convert是把它从一个时区换算到另一个时区。实际运用中,我建议先把所有时间统一成UTC存库,展示时再转本地时区,能避免很多夏令时、跨时区导致的错乱。
4.2 画图前先确认索引有序,否则折线图会画出一团乱麻
时间序列可视化是最直观的检查手段。很多人把数据画出来之后发现折线图像一团乱麻,从左上到右下全是斜线,第一反应是数据太乱,其实十有八九是索引没排序,或者存在重复时间戳。
用matplotlib或者pandas内置的plot画时间序列时,必须保证x轴(也就是索引)是单调递增的。我的固定检查流程是:
python复制# 检查是否有序
print(df.index.is_monotonic_increasing)
# 检查是否有重复时间戳
print(df.index.has_duplicates)
如果has_duplicates是True,先处理重复:是保留最后一次记录还是取平均,取决于业务。比如系统每5分钟采一次样,但因为重试机制偶尔同一分钟写了两条记录,这时可以按时间分组取最后一条:
python复制df = df[~df.index.duplicated(keep='last')].sort_index()
时序画图还有个小坑:如果一条线包含几年的日数据,直接画会非常密集,线条变成一团黑色。我一般会用它做月度重采样来展示趋势,同时用原始日数据做细节分析。还有一个实用技巧是画多条序列时,先用min-max归一化再画到同一张图上,不然销量上万、温度几十,温度线会被压成一条直线,什么信息都看不出。
4.3 从Excel读入日期字段时的几种“隐藏刺客”
回到热搜词里很多人问“pandas读取Excel文件”“pandas读写Excel文件”的问题。读Excel本身不难:pd.read_excel('文件.xlsx')就完事了,难的是Excel里的日期字段会以各种形态出现,而且经常在读取时被悄悄变成datetime或者字符串。
我遇到过三种常见情况:
一是日期列读进来变成datetime64但带了00:00:00的时间部分,看着碍眼,输出到Excel时格式混乱。处理办法是统一格式成字符串:
python复制df['date_str'] = df['date'].dt.strftime('%Y-%m-%d')
二是在某些Excel文件里,日期被存成了文本,还混着“2024/5/6”和“2024年5月6日”这样的格式。我的处理是:
python复制df['date'] = pd.to_datetime(df['date'], errors='coerce')
# 然后drop掉没转出来的坏行或单独处理
三是Excel的序列号日期,比如显示为45000这种数字,代表从1900年1月0日算起的天数。处理这种数据的代码是:
python复制df['date'] = pd.to_datetime('1899-12-30') + pd.to_timedelta(df['excel_date'], unit='D')
读进来之后如果确定日期列没问题,不要忘了在pd.read_excel时直接指定parse_dates,这样连后面的转换都能省掉:
python复制df = pd.read_excel('sales.xlsx', parse_dates=['date'])
这个参数会让Pandas在读取阶段自动把指定列解析成datetime。写入Excel时,如果想把时间字段的时分秒去掉,最简单的方式是先把列转成字符串再写:
python复制df['date'] = df['date'].dt.strftime('%Y-%m-%d')
df.to_excel('output.xlsx', index=False)
如果你保留了datetime类型直接写,Excel默认会显示成“2024-05-06 00:00:00”,每次都要手动改单元格格式,不推荐。排序索引后如果把date列留在index里,to_excel记得加index=True或者把index.reset_index()再写,否则日期列会悄悄丢在文件外面,看起来就像“丢失了一列”。
5. 把处理好的时间序列交给LSTM/GRU之前,Pandas这最后一公里怎么走
5.1 时序预测不能用默认的train_test_split随机切分
热搜词里“LSTM时间序列预测python”“GRU实现时间序列预测”这类问题特别多。很多人用Pandas处理好数据后,下一个动作就是写:
python复制# 不要这样用,时间序列不能用随机切分
from sklearn.model_selection import train_test_split
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2, random_state=42)
时间序列数据一旦随机切分,就相当于让模型用未来数据去预测过去,测试集里混着训练集后面时间的信息,测试指标会虚高到让你误以为模型很厉害。正确做法是按时间顺序切分:
python复制train_size = int(len(df) * 0.8)
train, test = df.iloc[:train_size], df.iloc[train_size:]
先取前80%的时间段当训练集,后20%当测试集。这里还隐藏着一个重要原则:归一化Scaler只能用训练集的数据fit,不能用全量数据fit,否则测试集的信息在预处理阶段就泄漏给了模型。
5.2 用Pandas构造滑窗样本,再从二维表变成三维张量
LSTM、GRU这类循环神经网络要求的输入形状是(batch_size, time_steps, features),也就是说,模型看到的不是一个样本一个值,而是一段连续的历史窗口。比如给定过去7天的销量和气温,预测第8天的销量。用Pandas做这件事非常顺手。
假设现在有一个DataFrame,索引是日期,列是sales和temperature。构造训练样本的代码:
python复制import numpy as np
df = df.reset_index(drop=True) # 先把索引变成从0开始的行号,方便滑窗
def make_sequences(data, window_size):
X, y = [], []
for i in range(len(data) - window_size):
X.append(data.iloc[i:i+window_size][['sales', 'temperature']].values)
y.append(data.iloc[i+window_size]['sales'])
return np.array(X), np.array(y)
window_size = 7
X, y = make_sequences(df, window_size)
print(X.shape, y.shape)
理想情况下X的形状是(样本数, 7, 2),7代表历史天数,2代表销量和温度两个特征。这个例子用一个滑动窗口循环遍历整张表,把窗口内的二维数组作为一个样本。数据量不大时这样写没问题,数据量很大的话可以借助numpy的stride_tricks提高效率,但对多数入门项目来说,先跑通循环版本更重要。
转折点在于,窗口的每一步都有一个“特征不能包含预测目标当天”的原则。上面的代码里,第i个样本的特征窗口是i到i+6,标签是i+7的值,正好错开了窗口,不会偷看未来。如果你先算了rolling特征再直接切,就回到第三节说过的重叠泄漏问题。
5.3 归一化时机和预测结果还原,这两处坑得提前规避
LSTM这类模型对输入特征的尺度很敏感,销量几千、温度十几、客流量几百,直接喂进去会让loss被销量特征主导。因此要对特征做归一化,常见做法是标准化或MinMax缩放。我用MinMax较多:
python复制from sklearn.preprocessing import MinMaxScaler
scaler_X = MinMaxScaler() # 对特征归一化
scaler_y = MinMaxScaler() # 对标签单独归一化
train_size = int(len(df) * 0.8)
train_df = df.iloc[:train_size]
test_df = df.iloc[train_size:]
# 只用训练数据fit
X_train_scaled = scaler_X.fit_transform(train_df[['sales', 'temperature']])
y_train_scaled = scaler_y.fit_transform(train_df[['sales']])
注意,scaler必须分开fit特征和标签。为什么标签也要单独scaler?因为预测完成后需要把输出还原成真实销量单位,如果特征和标签混在一起用一个scaler,还原时还得从混合矩阵里拆出对应列,容易出错。
预测完还原销量的代码:
python复制y_pred_inv = scaler_y.inverse_transform(y_pred)
到了这个阶段,你会意识到前面Pandas做的时间索引对齐、缺失值填充、滞后特征构造有多重要——LSTM模型本身不会替你处理这些问题,它只会默默把带NaN的数据学成一个更差的模型,或者因为数据泄露学出一个测试集上很炫、上线后崩盘的花架子。
我对这一类工作的最大体会是:Pandas的活干得越细致,后面的模型训练就越省心。很多预测项目最终效果差,不是模型选得不好,而是数据喂进去之前就已经错了。时间序列跟普通表格数据最大的区别就在“先后顺序”这四个字上,处理每个步骤前都问问自己:这一步会不会把未来的信息带到过去?如果会,先shift;如果时间轴不齐,先reindex。把这两个意识刻进肌肉记忆,你的Pandas时间序列处理水平就已经超过大多数人了。
