做深度学习项目这几年,我见过太多人把精力全砸在网络结构、调参技巧、训练轮数上,结果模型效果总是差那么一口气。最后排查来排查去,问题基本都出在数据准备这一环。说句不那么好听的话:数据准备才是深度学习模型实践里真正拉开差距的地方,尤其是在工业缺陷检测、目标检测这类落地场景里,数据做得好不好,直接决定你的模型是能上线还是只能躺在实验报告里。
这篇东西不聊玄乎的理论,就聊聊我在实际项目里怎么准备数据,从数据集获取、清洗、标注、增强到组织格式,一条龙捋下来。无论你是刚入门想跑通一个分类模型,还是已经在用 Halcon 或者 mmdetection 做检测项目,这篇文章里的思路和坑都适用。读完之后你会发现,数据准备不是简单的“收集图片加标注”,而是一套有方法、有顺序、有检查点的工程流程。
1. 数据准备的整体思路:先想清楚再动手
1.1 数据准备不只是“收集图片”,而是完整的工程环节
很多人一提到数据准备,第一反应就是“多找点图,标注一下”。这个理解太浅了。我习惯把数据准备拆成五个环节:需求分析、数据获取、数据清洗、数据标注、数据组织。每个环节都有明确的产出物和检查点。需求分析要回答“这个任务到底需要什么样的数据”,数据获取要解决“数据从哪来、要多少”,数据清洗要保证“进模型的每一张图都是有效的”,数据标注要确保“标签和真实情况一致”,数据组织则是“让训练脚本能高效读取”。
这五个环节不是线性走一遍就完事的。实际项目里经常要来回迭代,比如清洗完发现正负样本比例失衡,就得回去重新采集;标注完抽检发现错误率超标,就得返工。所以数据准备这件事,你得把它当成一个独立的子项目来管理,给它排期,给它定验收标准。我见过不少团队给模型训练留了两周,给数据准备只留了两三天,结果训练阶段反复被数据问题打断,总工期反而翻倍。
1.2 从任务类型反推数据需求:分类、检测、分割各有各的规矩
数据准备的第一步不是打开爬虫或者相机,而是先搞清楚你的任务类型。同样是深度学习模型,图像分类、目标检测、语义分割对数据的要求完全不一样。
图像分类最简单,每张图一个标签就行,你要关心的是类别的覆盖度和类间均衡。目标检测就不一样了,除了图片本身,每个目标的位置框也得标注,你要关心的是目标尺寸分布、遮挡情况、密集程度。语义分割最费劲,每个像素都要有类别,标注成本是检测的好几倍。
这里有个很实际的经验:如果你发现标注成本实在扛不住,可以考虑从检测任务退一步做分类,或者用弱监督的方式先跑通流程,但这会影响模型上限。拿工业缺陷检测来说,有些缺陷区域特别小,比如几像素的划痕,做检测框标注很容易漏,这时候你需要的是像素级标注还是检测框,取决于你的最终需求。如果只是为了判断“有没有缺陷”,分类就够用;如果要定位“缺陷在哪里”,就得检测;如果还要计算缺陷面积、形状,那必须分割。任务类型没定清楚之前,别急着去标注,否则返工成本极高。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 数据集从哪里来:公开数据集、自采数据、合成数据三选一
2.1 公开数据集的选择与判断标准
如果你是做通用场景的模型验证,或者刚入门跑通流程,优先用公开数据集。像 ImageNet、COCO、VOC 这些经典数据集,社区资料多,踩坑记录也多,适合用来验证你的网络结构和训练流程是否正确。
但公开数据集有个问题:它和你的实际场景大概率有分布差异。用 COCO 预训练的模型去做工业零部件检测,效果一般不会好到哪去,因为工业场景的光照、背景、目标形态跟自然图像差距太大。所以我把公开数据集定位成“用来跑通流程”的工具,而不是“最终模型”的训练来源。
选公开数据集时,不只要看类别和数量,还要看几点:图片分辨率分布、标注质量、拍摄条件。有些数据集标注很糙,框偏了、类别标错的不少,用来训练模型会被带偏。我的建议是,拿到一个数据集先抽 10% 的样本自己做一次人工抽检,如果标注错误率超过 5%,这个数据集就得谨慎使用,要么做一轮清洗,要么换一个。
2.2 自采数据的采集规范:光照、角度、设备一个都不能马虎
工业场景下,公开数据集几乎帮不上忙,你必须自己采集。自采数据的关键不是“拍多少张”,而是“怎么拍才有效”。我踩过的坑是:用手机拍了 2000 张产品图,高高兴兴开始标注,结果训练出来的模型换到产线摄像头下完全不能用。原因很简单,手机拍摄的视角、光照、分辨率跟产线工业相机差异太大。
自采数据要严格按照目标场景的成像条件来。如果你最终要用海康或者 Basler 的工业相机部署,那采集数据时最好就用同一型号的相机,至少在分辨率、镜头焦距、光照条件上保持一致。采集时覆盖这几类变量:不同光照强度(这直接影响缺陷的可见度)、不同拍摄角度(尤其是目标形态变化大的情况)、不同表面状态(比如金属件反光和哑光表面的差异)。这些变量不是随便拍的借口,而是要有意识地记录成元数据,方便后面分析模型在哪个子集上表现差。
另外采集数量上有个底线参考:单类别分类任务,每类至少 500 到 1000 张;目标检测单类别,至少 1000 到 3000 个实例;分割任务单类别,至少 200 到 500 张像素级标注图。这只是底线,实际项目中通常要翻倍才稳。参考热词里总有人问“深度学习样本数量少的缺点”,答案很明确:样本少模型容易过拟合,训练集上表现得很好,验证集上掉点严重,更别说泛化到新数据。
2.3 合成数据与半自动标注:当你真的凑不齐样本量
有些场景你就是凑不齐足够的真实样本。比如缺陷检测中某一类缺陷非常罕见,生产线上一个月都出不了几个。这时候合成数据和半自动标注就是值得考虑的方向。
合成数据就是用渲染、生成对抗网络或程序化生成的方式来制造训练样本。比如用三维渲染软件把产品模型和缺陷模型组合,渲染出不同光照、角度下的图像。好处是标注完全免费且精确,坏处是合成图像与真实图像之间有“域差距”,模型可能学到渲染痕迹而不是真实特征。缓解办法是采用“域随机化”的思路:在渲染时随机化纹理、光照、相机参数,让模型学到对域不敏感的特征。另外可以配合少量真实数据做微调,效果会好很多。
半自动标注则是用已有模型预标注,人工只做修正。这个方案需要你有一定的模型基础——哪怕是用公开数据集预训练的检测模型,先在你的数据上跑一遍,生成候选框,然后人工在标注工具里修改。这能把标注时间缩短 50% 以上,但前提是预标注的质量不能太差,否则人工改框的时间和重新标注差不多。
3. 数据清洗与质量检查:模型效果差,八成是数据没洗干净
3.1 图片质量筛选的几个硬指标
很多教程直接跳过了数据清洗这一步,但实操里这是性价比极高的一步。脏数据混进训练集,轻则拉低精度,重则让模型学到错误特征。我在实际项目里总结了一套硬指标,大家在清洗时可以直接套用。
第一项是清晰度检查。用 OpenCV 的拉普拉斯算子计算图片的方差,低于阈值的视为模糊图像。工业场景下阈值一般设 50 到 100,具体看你图像的纹理复杂度,纹理少的图像本身方差就低,阈值要相应下调。模糊图的典型来源是运动模糊、对焦不准,这类图不删掉的话模型会学到“模糊也能识别”的错误模式。
第二项是曝光检查。过曝和欠曝的图像会丢失大量细节,计算灰度直方图,如果高光区域或暗部区域占比超过 30%,可以判定为异常样本。但注意,某些场景下过曝或欠曝本身就是要检测的缺陷,这时候要结合任务来定,不能一刀切。
第三项是重复和近似重复检查。用感知哈希(pHash)计算图像指纹,汉明距离小于 5 的两张图认为是重复样本。重复样本会被训练脚本重复采样,导致模型对这部分数据过拟合,尤其是少数类里的重复图,危害更大。
第四项是文件名和格式检查。这是最不起眼但最坑的,批量处理图像时很容易出现文件名乱码、扩展名不符、图片损坏无法解码的情况。我之前有一次训练到一半报错,排查了半天发现是数据集里混进了一张损坏的 JPEG。清洗阶段用脚本把所有图片读一遍,能解码的全部重编码为统一格式,这步花不了多少时间,但能省后面三天。
3.2 标签一致性检查:标注错误比标签缺失更致命
图片清洗完必须做标签检查,而且这是整个数据准备里最容易翻车的一环。标注错误主要有三种类型:错标(把 A 类标成 B 类)、漏标(有目标但没框)、错位(框的位置和大小偏了)。其中错标和漏标对模型训练的损害是持续的,因为模型会努力去拟合这些错误标签。
标签检查怎么做?如果标签已经有文件了,可以写脚本做基础统计分析。比如:
- 统计每类的样本数量,看看有没有明显过少或过多的类别
- 统计检测框的宽高比、面积分布,检查有没有异常框(比如框的面积占整图比例极小或极大)
- 对图片进行“标签覆盖可视化”,把标注框画在图上,人工抽查一批
最有效但最费时间的方式,是按类别筛选出全部样本,人工快速浏览一遍缩略图。这个过程叫“标签预览”,每张图停留一秒钟,只看标注框和目标的匹配情况。2000 张图大概需要半小时到一小时,但能发现很多脚本查不出来的问题。我的习惯是清洗阶段做一次全量预览,标注完成后抽检另一个批次再做一次,两轮下来基本能把标签问题压缩到可接受范围。
3.3 类不均衡怎么处理:重采样比盲目增广更有效
类不均衡是工业场景里最常见的问题。正常产品图片可能有上万张,缺陷图片只有几十张。这时候如果你直接拿原始分布去训练,模型会倾向于把所有样本都预测为正常类,因为这样准确率也很高。
处理类不均衡有几个手段,按优先级排序。
第一优先是重采样,对少数类做上采样(重复采样少数类样本),对多数类做下采样(随机丢弃部分多数类样本)。上采样时要注意,简单重复会加剧过拟合,更好的做法是配合数据增强来生成样本变体。
第二优先是损失函数层面的处理,比如在交叉熵损失里给少数类加权重,或者在 Focal Loss 中调节聚焦参数。但损失函数调整属于模型侧方案,数据侧该做的平衡还是要做。
第三优先才是数据增强,也就是对少数类样本做旋转、翻转、裁剪等变换来增加样本量。但增强只能缓解样本量不足的问题,如果原始样本的“域覆盖”本身就窄,增强出来的样本也只是在同一个局部区域打转,无法覆盖真实世界中的新变化。所以做增强之前,先问问自己:少数类样本的多样性够不够?不够的话,优先去采数据,而不是靠增强硬造。
4. 数据标注工具选型与实操要点
4.1 常用开源标注工具对比:LabelImg、Labelme、CVAT、X-AnyLabeling
标注工具的选择直接影响效率和标注质量。我这些年用下来,比较主流的几个工具各有各的适用场景,整理成表格方便大家选型。
| 工具 | 适用任务 | 优点 | 缺点 | 部署方式 |
|---|---|---|---|---|
| LabelImg | 检测框标注 | 轻量、上手快、支持 PascalVOC/YOLO 格式 | 功能单一、不方便多人协作 | 本机安装 |
| Labelme | 多边形分割、检测框 | 支持多边形标注,适合分割任务 | 界面偏老、批量操作弱 | 本机安装 |
| CVAT | 检测、分割、分类、视频标注 | 功能全、支持多人协作、有自动标注插件 | 需要部署服务端,有学习成本 | 服务器或 Docker |
| X-AnyLabeling | 检测、分割、关键点 | 有 AI 辅助标注能力,体验接近商业软件 | 依赖模型效果,配置稍复杂 | 本机安装 |
我的建议是:单人做小项目,检测用 LabelImg,分割用 Labelme;团队协作或者数据量大,直接上 CVAT,它能扛住几十万张图的标注任务,而且带审计功能,可以追踪每个标注员的进度和质量。经常有人问 Halcon 自带的标注工具 DL Tool 怎么样,如果你用的是 Halcon 生态,它跟后续训练部署的集成度更高,可以直接导出 Halcon 需要的格式,但这个工具相对封闭,换到其他框架时格式转换比较麻烦。
4.2 标注规范怎么定:一条框线规则引发的血案
标注规范是数据准备里最容易“省事”但其实最不能省事的一步。我见过最典型的反面案例:一个缺陷检测项目里,三个标注员对“框要贴合目标还是留边距”的理解不一致,一个紧贴边缘,一个留了两三像素的边,还有一个把范围更大的区域也框进去了。这样训练出来的检测模型,边框预测忽大忽小,后处理阶段怎么调都调不好。
标注规范至少要覆盖这几条:框线贴合法则(贴合目标边缘还是留固定边距)、遮挡目标处理(不完全可见的目标要不要框)、极小目标处理(面积小于多少个像素的目标是否忽略)、类别定义(一条裂纹延伸到什么程度算另一类缺陷)。这些规则不能口头交代,要写成文档,并且在标注工具里尽量用预设标签来实现。
还有一个实操细节:标注时建议把图像放大到 100% 以上再画框,尤其对小目标,缩放下画框很容易出现几个像素的偏移。标注完成后导出的坐标要检查坐标系约定,有些工具用左上角+宽高,有些用中心点+宽高,转换时候算错一个公式,全部标注就废了。
4.3 标注质量抽检:不能省的最后一道防线
标注完成不代表数据准备完成,质量抽检是最后的把关环节。我常用的抽检方案是:从每个标注员完成的结果里随机抽取 10% 到 20%,进行以下检查:
- 框与目标的交并比(IoU):目测或计算预测框和实际目标的 IoU,低于 0.7 的视为不合格。注意这是人工判断,不是模型计算。
- 类别正确率:框的内容和标签类别是否一致。
- 漏标率:图片里明显可见的目标有没有没被框出来的。
抽检的通过标准我通常定在 95% 以上,低于这个值就退回给标注员修改。不要觉得 5% 的错误率无所谓,在深度学习训练里,5% 的错误标签足以让模型在对应类别上产生可见的性能下降,尤其是样本量少的类别,错误样本的破坏力更大。
5. 数据增强与预处理:让有限样本发挥最大价值
5.1 离线增强 vs 在线增强:什么场景选什么方案
数据增强是解决样本量不足、提升模型泛化能力的常用手段。但你先要搞明白两种增强方式的区别。
离线增强是在训练之前把增强后的图片直接写到磁盘上,生成一个新的数据集。好处是直观,你可以直接看到增强后的效果,排查问题时方便。缺点是磁盘占用大,而且由于增强组合固定,每个 epoch 看到的都是同一批增广图,多样性受限。
在线增强是在训练过程中实时对每个 batch 做随机变换,同样的原始图每次进模型前都可能被变换成不同的样子。这样模型每个 epoch 看到的样本都有变化,相当于变相扩充了数据集。现在的训练框架基本都内置了在线增强能力,PyTorch 里用 torchvision.transforms,mmdetection 里用 config 配置即可。
我的选择标准很简单:数据量小、增强策略需要反复调试时用离线增强;数据量已经比较大或者想追求最佳泛化效果时用在线增强。实际项目中,我一般两种方案结合使用。离线增强专门用来给少数类“补量”,在线增强用来给整体数据增加随机多样性。比如用 Albumentations 库做离线增强,生成 8 到 10 组变体补进训练集,然后训练时再配合在线增强进一步引入随机性。
5.2 工业场景里最实用的增强组合
工业视觉场景有它特有的增强偏好,和自然图像场景不太一样。以缺陷检测为例,下面这组增强策略是我实测下来比较有效的组合,基本都是 Albumentations 里的现成类:
- 水平翻转和垂直翻转,概率 0.5。注意不是所有场景都能翻转,如果有方向性要求(比如文字、方向标记),垂直翻转会制造错误样本。
- 随机旋转 90 度,或者小角度旋转正负 10 度,看你的目标是否对角度敏感。
- 亮度对比度调整,参数范围正负 0.2。这个对光照变化场景特别有用。
- 高斯噪声,标准差 0.01 到 0.02,模拟传感器噪声。
- 随机雨雾、模糊等模拟恶劣成像条件,按场景需要加。
- 随机裁剪加缩放(RandomResizedCrop),模拟目标尺度变化。
这组的核心思路是“模拟真实成像条件的波动”,而不是单纯为了增加样本数。每种增强操作都要问你一句:这个变换在真实部署时会出现吗?如果不会,加了反而让模型学到不存在的特征。比如工业固定工位检测,相机角度几乎不变,你非要加随机透视变换,模型就会浪费能力去适配一个根本不存在的视角变化。
5.3 增强的禁忌:什么时候不能随便增强
数据增强不是越多越好,有几个场景要格外谨慎。
一是热词里提到的“深度学习样本数量少的缺点”,增强能缓解但不能根除。当某类缺陷只有 20 个原始样本时,增强再怎么造,模型也很难学到真正通用特征。这种情况下,优先去搞到更多真实样本,或者用合成数据做补充,而不是靠增强硬撑。
二是增强操作会改变目标的几何属性时要注意。比如工业场景中要求检测框精确贴合目标,你做了裁剪和缩放,需要同步更新标注框坐标。Albumentations 这类库会自动处理好标注框的变换,但如果你用 torchvision 里的 transforms 处理图像后还手动改标签,就比较容易出错。
三是不要对验证集和测试集做增强,只做尺寸调整和归一化。验证集和测试集应该尽量保持原始分布,这样才能真实评价模型在真实数据上的表现。有些新手上手直接把全部数据做了增强,结果训练集和验证集有重叠的增广样本,验证集的分数的虚高,上线后被打回原形。
6. 数据集组织与框架对接:格式不对,脚本白费
6.1 COCO、VOC、YOLO 等数据集格式的区别与转换
训练框架不同,能接受的数据集格式也不同。mmdetection 默认用 COCO 格式或 VOC 格式,YOLO 系列模型用 YOLO 格式,Halcon 深度学习工具则有自己的数据集组织方式。格式不统一是数据准备阶段最烦人的问题之一,尤其多个项目来回切换时,格式转换脚本几乎成了标配。
COCO 格式的核心是一个 JSON 文件,包含 images、annotations、categories 三个数组,标注框用 [x, y, width, height] 表示,坐标是绝对像素值。VOC 格式则是每个图片对应一个 XML 文件,标注框用 [xmin, ymin, xmax, ymax] 表示。YOLO 格式更简化,每个图片对应一个 TXT 文件,每行一个目标,格式是“类别 中心点x 中心点y 宽 高”,其中坐标经过归一化处理,取值在 0 到 1 之间。
这三个格式之间转换时最需要注意的是坐标系的差异。COCO 的框左上角坐标加宽高,VOC 是左上角和右下角坐标,YOLO 是归一化后的中心点坐标和宽高。转换公式本身很简单,但容易犯的错是忘了归一化这一步,或者把宽高比传错了。我建议写一个统一的转换脚本,输入输出都定义清楚,每次转换后做一次可视化抽查,确认框的位置没有偏差。
以下是一个 COCO 转 YOLO 格式的核心转换逻辑示例(Python),你可以根据实际标注结构调整:
python复制import json
import os
def coco_to_yolo(coco_json_path, output_dir):
with open(coco_json_path, 'r') as f:
coco_data = json.load(f)
# 建立 category_id 到 yolo_class_id 的映射
categories = coco_data['categories']
cat_id_map = {}
for i, cat in enumerate(categories):
cat_id_map[cat['id']] = i
# 建立 image_id 到图片信息的映射
image_id_map = {}
for img in coco_data['images']:
image_id_map[img['id']] = img
# 按图片组织标注
anns_by_image = {}
for ann in coco_data['annotations']:
img_id = ann['image_id']
if img_id not in anns_by_image:
anns_by_image[img_id] = []
anns_by_image[img_id].append(ann)
for img_id, anns in anns_by_image.items():
img_info = image_id_map[img_id]
img_w = img_info['width']
img_h = img_info['height']
txt_name = os.path.splitext(img_info['file_name'])[0] + '.txt'
lines = []
for ann in anns:
cat_id = ann['category_id']
class_id = cat_id_map[cat_id]
bbox = ann['bbox'] # [x, y, width, height]
x_center = (bbox[0] + bbox[2] / 2) / img_w
y_center = (bbox[1] + bbox[3] / 2) / img_h
box_w = bbox[2] / img_w
box_h = bbox[3] / img_h
lines.append(f"{class_id} {x_center:.6f} {y_center:.6f} {box_w:.6f} {box_h:.6f}")
with open(os.path.join(output_dir, txt_name), 'w') as f:
f.write('\n'.join(lines))
6.2 训练集/验证集/测试集划分的正确姿势
数据集划分看起来简单,但很多人在这儿犯迷糊。最常见的问题是:直接从整批数据里随机抽 80% 做训练、10% 做验证、10% 做测试,这在大多数情况下都能用,但有几个坑要注意。
第一个坑是“同源样本泄漏”。如果你的数据里有同一个物体在不同角度的多张连续拍摄,按图片随机划分时,同一个目标的图片可能同时出现在训练集和测试集里,测试结果虚高。正确做法是按“目标实例”或者“拍摄批次”划分,确保同一目标的所有图片全部落在同一个集合里。具体到工业场景,如果一个产品拍了多张不同角度的图,那这些图应该绑定在一起,要么全进训练集,要么全进测试集。
第二个坑是类别分布要保持一致。划分完成后检查每个集合的类别比例,如果训练集里某类占了 90%,验证集里却只有 50%。这会导致验证集的评价结果失真。用分层采样的方式进行划分,保持各类别在各集合中的比例基本一致。
第三个坑是验证集和测试集的定位要分清。验证集是用来调参和选模型的,测试集是你所有调优结束后最后跑一次的数据,相当于“期末考试”。如果你反复用测试集调参,测试集就不再是“未知数据”了。所以划分时候测试集最好单独锁起来,平时只在验证集上做决策。
6.3 环境与路径规划:数据准备阶段就把坑填平
数据准备阶段虽然不直接训练模型,但环境问题经常会在这里先暴露出来。热词里有人问“在 Windows 系统装深度学习环境”或者“Linux 环境配置”不顺利,其实很多问题不是环境本身的问题,而是数据集路径、编码方式、权限设置等细节造成的。
首先,所有数据文件的命名强烈建议只用英文字母、数字和下划线,不要用中文名、空格和特殊符号。这不是歧视中文,而是很多深度学习框架对路径的编码处理不一致,Windows 下中文路径在读取时容易出现编码错误,Linux 倒是问题不大,但团队协作时不同平台之间的兼容性会让人很头疼。
其次,规划目录结构的时候,把原始数据、标注结果、增强后数据、划分后的训练集/验证集/测试集分开存放。不要在一个目录里堆所有文件。我的习惯是:
code复制dataset/
raw/ # 原始图像,只读,绝不在上面做任何修改
annotations/ # 标注原始导出文件
processed/ # 清洗、增强后生成的训练数据
train/
val/
test/
configs/ # 类别名称映射、路径配置等
这样区分的核心逻辑是“原始数据永远不变、处理过程可追溯”。如果增强后的数据处理错了,直接从原始数据重新跑一遍流程就行,不用重新采集。另外,硬链接或者符号链接在数据集组织上也很好用,可以避免复制大量图片浪费磁盘空间。
7. 数据准备阶段的常见问题与排查
7.1 训练 loss 不降,先查数据还是先查模型
这是被问得最多的问题。我的一贯做法是:第一件事不是去调网络结构,而是先用一个极小的数据子集做“过拟合测试”。取 10 到 20 张训练图片,训练几十个 batch,看 loss 能不能降到很低,训练准确率能不能到 100%。如果小样本都拟合不了,问题多半出在数据管道:标签和图片没对齐、数据加载逻辑有 bug、预处理设置不合理。如果小样本能过拟合,再逐步扩大数据量,排查泛化问题。
这里特别提醒一个典型坑:如果你的标签文件里图片文件名和实际文件名不匹配,训练脚本会读取到错误的数据。这种 bug 导致的 loss 异常现象经常被误判为“模型结构有问题”或者“学习率设错了”。所以出问题先查数据管道,这是性价比最高的排查顺序。
7.2 标注文件与图片对不上
标注文件常规问题包括:文件名不匹配、标注格式类型错误、坐标越界、类别 ID 超出范围。这类问题写一个校验脚本一次性查完:
- 遍历所有标注文件,读取引用的图片文件名,检查文件是否存在
- 检查标注框坐标是否在 [0, 图片宽/高] 范围内
- 检查类别 ID 是否在预设的类别列表内
- 检查是否存在空标注文件(图片存在但没有任何目标)
这类脚本应该在划分训练集之前跑一遍,宁可多花十分钟写校验逻辑,也不想等到训练才报错。
7.3 数据加载慢导致 GPU 空转
数据准备阶段如果没考虑加载效率,训练时会暴露出来。最常见的现象是 GPU 利用率忽高忽低,训练一个 epoch 的时间远超预期。原因多为图片解码太慢、实时增强太耗时、磁盘 I/O 成为瓶颈。
解决办法有几层。图片尺寸在存储前统一缩放到合适大小,不要直接扔原始大图进去训练,这会极大降低解码时间。使用 TFRecord(TensorFlow)或 WebDataset(PyTorch)这类打包格式减少小文件随机读取的开销。Windows 系统下尽量把数据放在 SSD 上,机械硬盘随机读小图会把你等哭。参考热词里有人问“批量处理图像”的优化技巧,核心就是减少重复 I/O,能一次读入的不要读多次,能内存缓存的不落磁盘。
7.4 数据准备阶段的时间规划:别把数据压缩到最后几天
最后聊一个项目管理层面的经验。数据准备经常是项目排期里被低估的部分。根据我的统计,一个中型规模的工业检测项目,数据采集加标注往往要占到总工期的 40% 到 50%,而模型训练和调参只占 20% 左右。但很多团队把数据准备当作“启动阶段的杂活”,排期的时候只给两周。结果就是训练阶段反复回头补数据,折腾了一个月还没到真正调模型的阶段。
我现在的习惯是:项目开始前先花几天做数据预研,拍一批代表性样本,快速标注,跑一个简单的基准模型,验证这个方向的可行性。预研通过后再排完整的数据采集和标注计划。这个“先花小钱试错”的策略,能帮你规避掉很多项目后期才发现的数据方向性错误。
写在最后的一些体会
数据准备这件事,入门很简单,无非是收集图片、做标注、跑训练脚本。但做得深了你会发现,它本质上是一个系统工程,每个环节都有对应的质量标准和检查方法,每个环节的错误都会在训练阶段被放大。我从一开始“随手拿数据就训练”到现在“花一半时间在数据上”,踩过的坑不算少。现在每接到一个新项目,我最先做的永远是数据预研,先搞清楚数据长什么样、边界在哪里,再谈模型怎么选、参数怎么调。这个顺序反了,后面全是坑。
最后再分享一个小技巧:做数据准备时不管多忙,每次处理完一批数据都顺手写一段简短的记录,包括来源、处理方式、发现的问题。这不是为了写文档而写文档,而是当你训练结果不理想回头排查时,这些记录能帮你快速定位问题出在哪一步。数据准备的质量,最终都会在模型效果上体现出来。这个环节做扎实了,后面训练调参才真正有意义。
