1. 数据操作不是苦力活,而是建模前的第一道关卡
很多人一提到机器学习,脑子里蹦出来的全是神经网络、梯度下降、支持向量机这些听起来很唬人的算法名词。我当年入门的时候也是这样,花了大把时间啃理论,结果到了真正要拿一份数据练手的时候,整个人直接懵在原地——数据长什么样?怎么读进来?为什么里面有那么多空值?这些英文列名到底代表什么意思?当时我才意识到,算法模型只是冰山一角,真正拦住新手的第一道坎,其实是数据操作和数据预处理。
先给还没入门的读者一个整体认知:一个完整的机器学习项目,大致分成数据采集、数据清洗、特征工程、模型训练、模型评估这几个环节。数据操作和数据预处理覆盖的就是从"拿到原始数据"到"把数据整理成模型能吃的格式"这一大段路程。很多教程喜欢一笔带过这部分,直接拿sklearn自带的那种已经处理得干干净净的玩具数据集开跑,这其实是在给新手埋雷。等你自己去爬一份数据、导出一份Excel、接一个接口的时候就会发现,现实世界的数据乱得让人头皮发麻。
我自己的体会是,数据预处理在整个项目里占的时间比例,少说也有50%到70%。Kaggle上那些拿高分的方案,往往不是模型有多花哨,而是特征处理和预处理做得足够细致。这也是为什么我强烈建议每个想学机器学习的人,先别急着碰那些高深的算法,老老实实把数据操作的基本功打牢。这篇文章就把我自己在"动手学机器学习"这条路上最常用的数据操作技巧和数据预处理流程完整梳理一遍,所有代码都基于Python生态,工具以NumPy、Pandas、Scikit-learn为主。内容不是按教科书目录硬搬的,而是按照我拿到一份陌生数据之后实际会走的流程来写的,你只要跟着走一遍,以后再遇到乱七八糟的数据,心里就有底了。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 动手之前,先搞清楚机器学习里的"数据"长什么样
既然要说数据操作,那就得先建立一个直观印象:机器学习里处理的数据到底是什么形态?这个基本概念如果不先厘清,后面不管用什么工具都容易出问题。
2.1 从"表格"这个最熟悉的形态说起
绝大多数机器学习任务面对的数据,都可以理解成一张二维表格。行是样本,列是特征。打个比方,你想根据一个人的身高、体重、年龄来预测他是否经常运动,那每一行就是一个具体的人,身高、体重、年龄就是三列特征,最后那一列"是否经常运动"就是标签。模型的训练过程,本质就是通过大量这样的样本,去找出特征和标签之间的规律。
这个"行是样本、列是特征"的约定,是整个数据操作的基石。你后面做的所有筛选、清洗、变换,都不应该破坏这个结构。我见过不少新手在预处理的时候把行列搞反,或者把一个样本的信息拆到多行里,结果模型训练的时候报错,还死活找不到原因。所以拿到任何数据的第一步,永远是先看它的shape,把行列关系搞清楚。
2.2 结构化数据与非结构化数据的典型差异
还有一个概念值得在动手前理清:结构化数据和非结构化数据。
结构化数据就是上面说的这种规规矩矩的表格数据,每一列有明确含义,类型也相对统一。比如电商平台的订单表、医院的病历记录表、银行的用户信息表。这类数据是数据预处理最主流的应用场景,也是这篇文章的重点。
非结构化数据则是指文本、图片、音频、视频这类没有固定格式的数据。处理它们需要另一套专门工具,比如处理文本要用分词和词向量,处理图片要用卷积神经网络等。虽然现在大模型和计算机视觉很火,但绝大多数业务的落脚点依然是结构化数据。尤其是对新手来说,先把结构化数据的预处理练扎实,性价比最高。
2.3 机器学习数据与普通数据分析数据的区别
这里还得说一个很多人忽略的点:机器学习要用的数据,和普通数据分析用的数据,要求不完全一样。做数据分析,你关心的是趋势、占比、分布,数据稍微有点瑕疵,比如个别缺失值,可能并不影响大方向。但机器学习直接把数据喂给算法,算法不会像人一样"脑补"。缺失值它不知道怎么处理,文本它读不懂,量纲差异大的特征还会让某些算法产生偏差。所以机器学习对数据的要求更严格:格式要统一、缺失要处理、数值要缩放、类别要编码。
这也是为什么数据预处理会成为一个独立的、值得专门学习的环节。它不是在"收拾屋子",而是在为模型准备"标准化的食材"。
3. NumPy和Pandas,数据操作的两根台柱子
理解了数据的形态,接下来就是工具。Python做数据操作,核心逃不开两个库:NumPy和Pandas。打个比方,NumPy是"发动机",负责高性能的数值计算;Pandas是"整车",提供了便捷的数据结构和操作接口。实际做数据处理的时候,Pandas用得最多,但NumPy的数组是很多底层操作的基础,两者缺一不可。
3.1 NumPy数组:向量化计算和广播机制
先简单说NumPy。它的核心是ndarray,也就是多维数组。比如np.array([1, 2, 3])就是最简单的一维数组。NumPy最强大的地方在于向量化计算,也就是说,你可以直接对整个数组做运算,不用像Python原生列表那样写循环。
python复制import numpy as np
arr = np.array([1, 2, 3, 4])
print(arr * 2) # 输出 [2 4 6 8]
print(arr + 10) # 输出 [11 12 13 14]
print(arr.mean()) # 输出 2.5
这种写法不仅代码简洁,底层是C语言实现的循环,性能远高于Python的for循环。还有一个很重要的概念叫广播机制,就是不同形状的数组之间也能做运算。比如一个二维数组的每一行都想减去这一行的均值,就可以利用广播来实现,不用手动写循环。数据预处理里的标准化操作,底层大量依赖这种机制。
3.2 Pandas的两大核心结构:Series和DataFrame
Pandas的核心是Series和DataFrame。Series可以理解成一列带索引的数据,DataFrame则是多列Series拼成的表格。DataFrame提供了极其丰富的操作方法,包括按条件筛选行、按列聚合、合并连接、处理缺失值等等。
python复制import pandas as pd
df = pd.DataFrame({
"name": ["Alice", "Bob", "Charlie"],
"age": [25, 30, 35],
"score": [85, 90, 95]
})
print(df)
text复制 name age score
0 Alice 25 85
1 Bob 30 90
2 Charlie 35 95
每一列的数据类型可以不同,比如name是字符串,age是整数,score也是整数。这个特点让DataFrame非常适合承载现实世界中的混合类型表格数据。
3.3 从导入到初诊:加载数据后的习惯性动作
实际项目中,我们一般不会手动创建DataFrame,而是从文件里读。最常用的就是pd.read_csv(),读取CSV文件。我这几年处理过的数据,至少八成都是CSV格式。
读进来之后,我建议你养成一套固定的"初诊"习惯动作:
python复制df = pd.read_csv("your_data.csv")
# 1. 看行列数
print(df.shape)
# 2. 看前几行,确认数据长什么样
print(df.head())
# 3. 看每列的类型、非空个数
print(df.info())
# 4. 看数值列的统计描述
print(df.describe())
这几行代码能让你在几分钟内建立起对一份陌生数据的基本认知。df.shape告诉你数据规模,df.head()让你直观看到每一列的内容,df.info()帮你发现哪些列有缺失值、类型对不对,df.describe()则给出均值、标准差、最小值、最大值、四分位数等统计量,帮助你初步判断是否有异常值。
我见过一些新手拿到数据就直接开跑模型,结果运行报错,回头一查,日期列读进来是字符串、缺失值一大堆、还有一列全是同一个值。如果养成先初诊的习惯,这些问题都能在第一时间暴露。数据操作的核心不是某个单独的函数,而是这套"先看后动"的思维方法。
4. 数据预处理的五大标准动作,每一步都要知其所以然
拿到数据、做完初步认知之后,真正的预处理就开始了。我按照实际处理顺序,把最常见的操作分成五类:处理缺失值、去除重复值、识别异常值、编码类别特征、缩放数值特征。每一类我都会结合具体场景解释原理和做法。
4.1 缺失值处理:删除还是填充,取决于缺失机制
缺失值几乎是最常见的问题。Pandas里判断缺失值用isnull(),统计每列缺失数量可以用df.isnull().sum()。
处理缺失值无非两条路:删除或者填充。但怎么选,有讲究。
如果某一列缺失比例极高,比如超过50%,甚至80%,这一列的信息量本身就非常有限,硬填反而可能引入噪声。这时候直接删除这一列往往是更稳妥的选择。同理,如果某一行只有很少几个特征,却缺失了绝大部分字段,这一行对模型训练也基本没有贡献,可以直接删除。
但如果缺失比例不高,删除就会浪费掉其他列的有效信息,这时候优先考虑填充。填充的方式要看数据类型:
- 数值型特征,最常用的是用均值或中位数填充。为什么不是随便填个0?因为均值能尽量保持数据的整体分布不产生偏移。为什么更推荐中位数?因为中位数对异常值不敏感。比如某个特征的正常范围是1到10,但有一个异常值100,那均值会被拉高,用均值填充就会影响到所有样本。
- 类别型特征,用众数填充,也就是出现次数最多的那个类别。
- 时间序列数据,可以用前向填充或后向填充,用上一个时刻的值填下一个时刻的空缺,因为时间上相邻的值往往更相似。
在scikit-learn里,SimpleImputer可以很方便地实现这些策略。
python复制from sklearn.impute import SimpleImputer
imputer = SimpleImputer(strategy="median")
df["age"] = imputer.fit_transform(df[["age"]])
这里要特别注意一个非常关键的细节:处理缺失值的时候,一定要先划分训练集和测试集,再在训练集上fit填充器,然后用同一个填充器去transform测试集。绝对不能在整个数据集上fit,否则会造成数据泄漏。数据泄漏是个很隐蔽但又很严重的问题,它会让模型在训练时表现很好,但一到真实场景就崩盘。
4.2 重复值处理:去重前先想清楚"重复"的定义
重复值也是数据清洗中常见的坑。Pandas里去重用drop_duplicates(),默认是每一列都完全相同才视为重复。但实际使用时,"重复"的定义往往比表面上复杂。
比如一份用户行为数据,一个用户今天访问了网站10次,这10条记录的其他字段都相同,只有访问时间不同。对于"预测用户是否会购买"这个任务来说,这10条记录是同一个用户的信息,不能当成10个独立的样本。但如果任务是预测"用户每一次访问是否会购买",那这10条就都是有效样本。所以我总是强调,去重之前,先想清楚这个数据集里"样本"的定义到底是什么。
还有些场景下,判断重复不能看全部列,而是看关键列。比如同一笔订单可能在日志里出现了两次,判断标准可以是订单号这一列是否重复。这时候可以传入subset参数:
python复制df = df.drop_duplicates(subset=["order_id"])
4.3 异常值处理:不是所有"异常"都要删除
异常值指的是明显偏离正常范围的数据点。比如一个人身高记录为300厘米,或者年龄记录为-5岁。这类数据如果不处理,会影响模型的训练,尤其对于线性回归这类对数值敏感的算法。
判断异常值通常有两种方法:
- 基于统计分布:用Z-score,也就是看某个值偏离均值多少个标准差。通常认为Z-score绝对值大于3的点是异常值。
- 基于四分位数:IQR方法,也就是计算四分位距(Q3-Q1),凡是小于Q1-1.5×IQR或大于Q3+1.5×IQR的值都视为异常值。箱线图就是基于这个原理绘制的。
但我要泼一盆冷水:异常值检测是手段不是目的,并不是所有异常值都要删。有些异常值代表着重要的业务信息。比如在银行风控场景里,一笔金额远超正常范围的交易,很可能就是欺诈交易,恰恰是需要模型重点关注和识别的样本。如果你在预处理阶段把它删掉了,模型就永远学不到这个模式。
所以处理异常值之前,先问自己几个问题:这个值是不是录入错误?这个值是不是真实存在的极端情况?这个极端情况是否包含我们要预测的信息?想清楚之后再决定是删除、用上下限截断,还是单独作为一个特征标记出来。对于新手来说,最稳妥的起步做法是:先用df.describe()观察各列的最大最小值,再用箱线图可视化,对异常情况有个整体认知,然后针对具体业务场景决定怎么处理。
4.4 类别特征编码:标签编码和独热编码怎么选
数据里除了数值型特征,经常还有一堆文本型类别特征。比如性别(男/女)、城市(北京/上海/广州)、学历(本科/硕士/博士)。机器学习算法本质上只能处理数值,所以必须把这些文本转换成数值。这个转换过程就是类别特征编码。
最常见的两种方式是标签编码和独热编码。
标签编码就是把每个类别映射成一个整数。比如性别:男=0,女=1。这种方式的优点是简单、节省空间,但它给类别强加了一个顺序关系。如果类别本身没有顺序(比如城市),那么"北京=0,上海=1,广州=2"就可能让模型误以为广州和上海更接近、北京和广州差距更大。这对树模型影响相对小,但对线性模型和神经网络来说可能是个问题。
独热编码则是为每一个类别单独创建一列,用0/1表示是否是这一类别。比如城市如果是"北京、上海、广州"三个值,就拆成三列:is_北京、is_上海、is_广州。样本属于哪个城市,对应列为1,其他为0。这种方式的优点是不会引入虚假的顺序关系,缺点是当某个特征的类别很多时,会急剧增加特征数量和内存占用。比如一个特征有100个类别,独热编码后就是100列。
python复制# 对城市列做独热编码
df = pd.get_dummies(df, columns=["city"])
还有一种介于两者之间的方案叫序数编码,用在类别本身有明确顺序的场景。比如学历:小学<初中<高中<本科<硕士<博士,就可以依次编码成0到5。这种编码保留了顺序信息,又不会像独热编码那样膨胀维度。
选哪种,我的建议是:树模型可以用标签编码或序数编码,不仅快而且往往效果不错;线性模型和神经网络尽量用独热编码;类别特别多的特征可以考虑先用目标编码等更进阶的方案,但那属于特征工程范畴了,新手期可以暂时不碰。
4.5 特征缩放:标准化和归一化的适用场景
最后一个标准动作是特征缩放。假设一份数据里,年龄的范围是0到100,而收入的范围是0到1000000。如果不做缩放,收入这个特征在距离计算中会完全碾压年龄,导致模型几乎只看收入,忽略其他特征。很多算法(比如K近邻、SVM、神经网络)对特征的量纲非常敏感,必须做缩放。
最常用的两种方式是标准化和归一化。
标准化(Standardization)也叫Z-score归一化,公式是(x - mean) / std。处理后数据均值变成0,标准差变成1,分布形态不变。它适合特征本身就近似正态分布的场景,也是很多模型默认推荐的缩放方式。在sklearn里对应StandardScaler。
归一化(MinMaxScaler)是把数据线性映射到[0, 1]区间,公式是(x - min) / (max - min)。它适合数据范围是有限区间的场景,比如像素值0到255。缺点是对异常值敏感,如果有一个极大值,其他值会被压缩到很小的范围。sklearn里对应MinMaxScaler。
python复制from sklearn.preprocessing import StandardScaler, MinMaxScaler
scaler = StandardScaler()
df["age_scaled"] = scaler.fit_transform(df[["age"]])
这里再次强调:scaler同样只能在训练集上fit,用训练集的均值和标准差去transform测试集。这跟前面填充缺失值的逻辑是一样的,都是为了避免数据泄漏。很多新手在这里栽跟头,把整个数据集丢进去统一缩放,虽然模型分数看起来不错,但一上真实数据就原形毕露。
我把这五类操作整理成了下面这张表,方便查询:
| 操作类型 | 常用方法 | 适用场景 | 关键注意点 |
|---|---|---|---|
| 缺失值处理 | SimpleImputer/mean/median/mode | 存在空值 | 先划分数据集再fit填充器 |
| 重复值处理 | drop_duplicates | 存在重复记录 | 想清楚"重复"的业务定义 |
| 异常值处理 | Z-score/IQR/箱线图 | 存在极端值 | 不是所有异常都要删除 |
| 类别编码 | OneHotEncoder/LabelEncoder | 存在文本类别特征 | 注意类别是否有顺序关系 |
| 特征缩放 | StandardScaler/MinMaxScaler | 特征量纲差异大 | 训练集fit测试集transform |
5. 完整案例:拿一份真实数据走一遍全流程
前面讲了很多原理和方法,但光看永远学不会,得动手。这一节我用一个非常经典的入门数据集——泰坦尼克号乘客数据,把前面讲到的所有操作串起来走一遍完整流程。这份数据在Kaggle上非常有名,也能直接在网上找到。假设我们的任务是:根据乘客的各种信息,预测该乘客是否幸存。
5.1 第一阶段:加载并观察数据全貌
python复制import pandas as pd
import numpy as np
df = pd.read_csv("titanic_train.csv")
print(df.shape) # (891, 12)
print(df.info())
print(df.head())
数据大概是这样的:PassengerId、Survived(标签)、Pclass(舱位等级)、Name、Sex、Age、SibSp、Parch(亲属数量)、Ticket(票号)、Fare(票价)、Cabin(船舱号)、Embarked(登船港口)。
df.info()跑完之后,我注意到几个问题:
- Age列有缺失值。
- Cabin列缺失值非常多,一多半都是空。
- Embarked列有两个缺失值。
- 其他列看起来比较完整。
这就是典型的"脏数据"生态,完全可以代表现实中遇到的情况。
5.2 第二阶段:按策略逐一处理各类问题
先处理缺失值。Cabin缺失太多了,从它里面提取"有没有船舱号"其实比"具体的船舱号"更有价值。所以我暂时不删它,而是创建一个新特征Has_Cabin,有值标记1,缺失标记0。至于Age,缺失比例不算太高,我用中位数填充。Embarked只有2个缺失,直接用众数填充。
python复制df["Has_Cabin"] = df["Cabin"].notnull().astype(int)
age_median = df["Age"].median()
df["Age"] = df["Age"].fillna(age_median)
embarked_mode = df["Embarked"].mode()[0]
df["Embarked"] = df["Embarked"].fillna(embarked_mode)
接下来处理类别特征。Sex只有"male/female"两个值,用标签编码或者直接映射成0/1即可。Embarked有三个值"S/C/Q",类别之间没有顺序关系,用独热编码。Name和Ticket、PassengerId这三列对预测幸存与否没有直接帮助,这里直接丢弃。
python复制df["Sex"] = df["Sex"].map({"male": 0, "female": 1})
df = pd.get_dummies(df, columns=["Embarked"])
df = df.drop(columns=["Name", "Ticket", "PassengerId", "Cabin"])
数值特征方面,Fare和Age的量纲差异很大,所以做标准化。Age本身已经没有缺失值了,Fare也没有,直接缩放。
python复制from sklearn.preprocessing import StandardScaler
scaler = StandardScaler()
df[["Age", "Fare"]] = scaler.fit_transform(df[["Age", "Fare"]])
5.3 第三阶段:划分数据集并建立基线模型
预处理做到这一步,数据基本上就可以拿来训练了。先划分特征和标签,然后从sklearn里拿一个最简单的逻辑回归模型跑一下,看基线效果:
python复制from sklearn.model_selection import train_test_split
from sklearn.linear_model import LogisticRegression
from sklearn.metrics import accuracy_score
X = df.drop(columns=["Survived"])
y = df["Survived"]
X_train, X_test, y_train, y_test = train_test_split(
X, y, test_size=0.2, random_state=42, stratify=y
)
model = LogisticRegression(max_iter=1000)
model.fit(X_train, y_train)
y_pred = model.predict(X_test)
print(accuracy_score(y_test, y_pred))
注意这里train_test_split里有一个stratify=y参数,它的作用是分层抽样,确保训练集和测试集中幸存与遇难的比例跟原始数据保持一致。尤其在标签分布不平衡的情况下,这个参数至关重要。如果不分层,可能测试集里恰好全是幸存者,模型评估结果就完全失真了。
以上就是一条完整的从原始数据到可训练数据集的流程。你可以用任何一份自己的数据,按照这个流程走一遍。走完之后你会发现,数据预处理的思路其实是相通的:先观察、再判断、再处理、最后验证。换一个数据集,步骤可能略有变化,但底层逻辑不变。
6. 数据泄漏、手工编码和可视化,新手最常踩的三个坑
最后这部分,我想专门聊聊新手阶段最容易踩的坑。这些坑我基本都踩过,写出来就是为了让你少走弯路。
6.1 数据泄漏:训练集和测试集的信息红线
第一个坑是数据泄漏,这个概念我在前面反复提到,因为它真的太重要又太隐蔽了。简单说,如果你在划分训练集和测试集之前,就用整个数据集的信息去做了填充、缩放、编码等操作,那么测试集的信息就已经渗透进了训练过程和模型参数里。这样得到的模型评估分数会虚高,但一到真实场景就自动打回原形。
举个具体的例子。假设你用均值填充了缺失值,这个均值是整个数据集的均值,其中就包含了测试集的信息。模型在测试集上的表现就"作弊"了。正确做法是:
python复制from sklearn.model_selection import train_test_split
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2, random_state=42)
# 先划分
# 再在训练集上fit imputer/scaler,然后transform训练集和测试集
imputer = SimpleImputer(strategy="median")
imputer.fit(X_train)
X_train = imputer.transform(X_train)
X_test = imputer.transform(X_test)
画一道红线:处理缺失值、特征缩放、类别编码的fit过程,永远只在训练集上执行。测试集只能被transform,不能被fit。这条红线守住,就能躲开大多数数据泄漏问题。
6.2 手工编码的隐藏风险:一不留神就引入了错误信息
第二个坑是关于手工编码。很多新手喜欢自己写函数映射,比如把学历列手动映射成"本科=1,硕士=2,博士=3"。这种做法本身没错,但很容易出两类问题。
第一类是映射顺序和实际含义不匹配。比如某个类别特征根本没有大小关系,你却随手映射成0、1、2、3,让模型误以为类别之间有数值距离。第二类是映射规则在训练集和测试集上不一致。比如某天测试集里出现了一个训练集没见过的类别,手工映射函数直接报错或处理错误。
所以我的建议是:能交给sklearn或Pandas内置工具处理的,就不要手工写映射逻辑。LabelEncoder、OneHotEncoder、pd.get_dummies这些都是成熟封装,能自动处理类别枚举和一致性对齐的问题。实在要手工写,也一定要把映射规则封装成函数,同时用try-except兜底,防止遇到未知类别时程序崩溃。
6.3 图表是预处理阶段最好的"体检报告"
第三个坑,其实不算坑,更像是被大多数人忽略的习惯:不做可视化。很多人拿到数据,只看df.describe()的统计数字就直接开干。我不是说统计数字没用,但数字有时候会欺骗你。
举个我亲身经历的例子。有一次我处理一份销售额数据,统计结果显示均值正常、中位数正常、缺失值也不多。但当我画出分布直方图的时候才发现,数据呈现明显的双峰分布——原来这份数据混合了两个不同来源的记录,它们的数据分布完全不同。如果不看图表,直接拿这份混合数据去训练模型,结果一定很糟糕。
对于数据预处理来说,常用的可视化手段包括:
- 直方图,看单特征的分布形态;
- 箱线图,直观发现异常值;
- 相关性热力图,看特征之间、特征与标签之间的相关性;
- 缺失值矩阵图(可以用missingno库),一眼看出缺失值分布是否有规律。
python复制import matplotlib.pyplot as plt
df["Age"].hist(bins=30)
plt.title("Age Distribution")
plt.show()
可视化不需要多复杂,几张基础图表就能帮你在预处理阶段发现大量隐患。把它当成数据质量的"体检报告",每次拿到新数据都做一遍,久而久之你会形成非常敏锐的数据直觉。我自己现在拿到新数据,第一步永远是shape、head、info、describe四连击,然后用图表配合观察,最后才动手清洗。这套流程看起来很朴素,但真的能救你无数次。
数据操作和数据预处理这项基本功,说难不难,说简单又处处是细节。它不像算法那样有那么多炫酷的技巧,更像是个需要耐心和细心打磨的工艺活。但恰恰是这些看似琐碎的细节,决定了你的模型最终是60分还是90分。希望这篇从实际经验里总结出来的流程,能帮你把这条路走得顺一些。
