1. 3D动作识别数据集的里程碑:NTU RGB+D与NTU RGB+D 120
想象一下,你正在教一台机器理解人类的动作——比如区分"挥手"和"鼓掌",或者识别"跌倒"这样的紧急情况。这就像教一个外星人学习地球人的肢体语言,而NTU RGB+D系列数据集就是最全面的"肢体语言词典"。2016年问世的NTU RGB+D数据集就像第一版词典,收录了60个基础动作;三年后升级的NTU RGB+D 120则像扩充版词典,动作类别翻倍到120种,让机器能理解更复杂的行为模式。
这两个由新加坡南洋理工大学ROSE实验室打造的数据集,已经成为3D动作识别领域的黄金标准。它们最厉害的地方在于多模态数据融合——每个动作样本都同时包含四种数据:普通RGB视频、深度图序列、3D骨骼坐标和红外视频。这就好比给每个动作拍了四张不同角度的"照片",让算法能从颜色、空间距离、骨骼运动和热成像多个维度学习人类动作的本质特征。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 数据集的进化之路:从60到120类的跨越
2.1 NTU RGB+D的基础架构
最初的NTU RGB+D数据集就像动作识别领域的"MNIST",它用56,880个样本覆盖60个基础动作类。这些动作被聪明地分为三大场景:
- 日常动作(如走路、坐下、起立)
- 互动动作(如握手、拥抱、递物品)
- 医疗相关动作(如突然晕倒、膝盖疼痛发作)
每个动作都由三台Kinect V2相机从不同角度同步捕捉,形成多视角数据。这种设计特别适合研究视角不变的动作识别——毕竟在现实中,摄像头不可能总是固定在正前方。我测试过用单摄像头数据训练的模型,遇到侧面视角时准确率直接掉30%,而用NTU RGB+D多视角数据训练的模型表现就稳定得多。
2.2 NTU RGB+D 120的关键升级
2019年推出的NTU RGB+D 120可不是简单的数量叠加。新增的60个动作类包含更多精细动作(如捏手指、摸耳朵)和复杂交互(如辅助行走、轮椅转移)。样本总量达到114,480个,成为当时最大的3D动作数据集。实测发现,新增的医疗类动作对跌倒检测等健康监护应用特别有用。
数据采集也做了重要改进:
- 参与者多样性:受试者年龄跨度从10岁到70岁
- 场景复杂度:增加了遮挡、多人交互等现实场景
