家里老人独自在客厅活动,你不在现场,但路由器就在墙角。如果你能实时知道老人是坐在沙发上、起身走向厨房,还是不小心摔倒在地——不需要任何摄像头,也不需要老人佩戴设备——这就是WiFi DensePose在做的事。
这个方向听起来像科幻,其实这几年在无线感知领域已经落地了不少真实系统。WiFi信号本身不携带图像,但它穿过空间时会被人体的运动、姿态、甚至呼吸扰动,形成一种可以被解析的“无线电阴影”。DensePose则是计算机视觉里的一种密集人体姿态估计表示,比骨架关键点更精细,可以给人体表面每个可见像素一个部位标签和UV坐标。把这两件事接起来,就是用户标题里说的“用无线电波看透世界”——不用摄像头、不依赖光线、能穿墙,却能输出接近视觉密度的人体姿态信息。这篇文章我会从原理、数据、模型到实测边界,完整拆一遍我在这条路上踩过的坑和验证过的做法,适合正在做WiFi感知、边缘智能或隐私保护型人体检测的工程师参考。
1. 为什么WiFi“看得见”人却不需要摄像头
1.1 WiFi信号里确实存着人体信息
先放下DensePose不谈,回到一个根本问题:WiFi信号是怎么知道人在哪、在做什么的?答案是CSI,即信道状态信息。
我们平时看WiFi信号,习惯看格数或者RSSI,也就是信号强度指示。但那个东西的信息量太粗了,它只能告诉你“信号强还是弱”,完全说不出细节。而CSI不一样,它在WiFi数据包的物理层里,记录了信号从发射天线到接收天线之间,每个子载波上的幅度和相位变化。这意味着一条WiFi链路不只是“通不通”的问题,它有几十甚至上百个频点上的状态数据,环境里任何物体移动,都会改变信号传播的路径和相位。
可以把CSI理解成一台声呐:你站在房间里喊一声,声波撞到墙壁、家具、人体,会反射回来形成不同的回声叠加。WiFi信号也是这样,从路由器的天线发射出去后,在室内经历无数条反射路径——直接路径、墙壁反射、地面反射、人体反射——这些路径叠加在一起到达接收端。人体任何微小的动作都会改变其中几条路径的长度,进而改变叠加后的相位和幅度。接收端网卡把这些变化如实记录下来,就是CSI。
所以严格说,WiFi感知并不是“看见”人,而是通过身体的移动和形态,对无线电波的传播产生了可测量的扰动。人在房间里的姿态不同,身体表面反射无线电波的方式就不同,接收天线上的CSI就会呈现不一样的模式。这就是无摄像头人体感知的物理基础。很多人第一次听到这个方向会怀疑“这也能行”,但CSI的灵敏度确实可以做到分辨呼吸引起的胸腔起伏,比想象中细得多。
1.2 DensePose到底是什么,为什么选它做表示
DensePose最早是Facebook人工智能研究团队提出的密集人体姿态估计方法。传统的人体姿态估计通常输出骨架关键点,比如头部、肩膀、手肘、手腕这些关节点的坐标。DensePose则更进一步:它把人体表面划分成24个部位,然后对图像中每个属于人体的像素,预测出具体的部位编号以及该像素在人体表面参数化坐标里的位置。
这个表示通常叫IUV映射。我用一个通俗的方法理解:把人体的3D表面想象成一个可以展开的球,球面上每个点都有经纬度坐标。DensePose要做的,就是给每个像素一个“经纬度”(UV坐标)和“它属于哪个半球”(I部位)。这样输出出来的东西,比骨架点稠密得多,能表达胳膊是粗是细、身体是向前倾还是侧着、整个人是蜷缩还是舒展。
选择DensePose而不是普通骨架点作为WiFi感知的输出目标,有三个实际原因。第一,WiFi信号的空间分辨率有限,骨架关键点需要非常精确的坐标回归,但这恰恰是无线信号最难的部分——墙和家具带来的多径效应会严重干扰关键点定位。而DensePose输出的是一块区域级的概率分布,容错性更强。第二,DensePose保留了人体表面的空间连续性,即便某个部位估计不准,旁边的部位还能形成相互约束。第三,从应用角度说,摔倒检测、行为识别、健康监测这类场景,关心的本质是“身体姿态和表面状态”,而不是精确的关节坐标,DensePose的表示和目标需求是匹配的。
1.3 “WiFi + DensePose”解决的是传统方案的什么痛点
传统人体感知方案其实已经很多了:摄像头、毫米波雷达、红外传感器、穿戴式IMU。它们各有各的麻烦。
摄像头最直观,但不能放在卫生间、卧室这类私密空间,晚上光线不足也是个问题,更别说用户对摄像头被入侵的担忧。毫米波雷达这几年很火,但它需要专门部署硬件,一套覆盖全屋的设备成本并不低,而且对静态人体的识别能力其实有限。红外传感器只能感知“有没有人”,完全没有姿态信息。穿戴设备则需要用户始终佩戴,老人很容易忘记戴或者不想戴,一摘下来就断了监控。
WiFi感知的差异化价值在于:它是零部署、零穿戴、能穿墙、无感工作的。家里的路由器如果支持CSI采集,基本就是现成的感知基础设施,不需要额外安装任何东西。用户完全不知道房间里存在感知系统,这是隐私场景里最大的优势。把WiFi感知的输出设计成DensePose这种高密度表示,意味着它能做到的事情不再局限于“检测有人在”,而是可以真正判断“这个人在做什么姿态”——这是从存在感知到行为感知的关键跨越。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 核心映射链路:从多普勒特征图到DensePose UV坐标
2.1 将CSI转成可学习的图像特征
现在的问题非常具体:CSI是一堆随时间变化的复数序列,而DensePose是一个空间上的密集映射,两者之间怎么建立关系?我见过不少初次接触这个方向的人,直接拿原始CSI矩阵丢进神经网络,期望网络“自己学出”空间信息。理论上可以,但效果很差。
原因是原始CSI里混着大量与人体无关的信息:发射机本身的相位偏移、环境温度的漂移、天线间的差异。直接回归等于让网络从一堆噪声里大海捞针。我的做法是把CSI先变成一个时间-频率表征,也就是多普勒特征图。
具体流程是这样的。第一步,用Hampel滤波器对CSI的相位做校准,把突变离群点剔除。第二步,将原始相位展开并做差分,得到相邻时刻的相位变化率,这个变化率本质上就是多普勒频移,它直接反映物体移动的速度和方向。第三步,对时间序列做短时傅里叶变换,得到频谱图。这一步处理之后,原始的一维CSI序列就变成了二维的时频图,横轴是时间,纵轴是频率,颜色深浅代表能量大小。
为什么要转成二维图?因为深度学习在图像上的特征提取已经非常成熟,把无线信号转成图像格式,就能直接借用预训练的视觉模型。而且多普勒图天然有物理意义:人体不同部位的运动速度不一样,在频谱图上会呈现不同的频率分布,这跟图像里的纹理特征有某种同构性。转成图之后,网络要学习的就变成“什么样的频谱纹理对应什么样的人体姿态”,而不是从零开始理解复数信号。
这里还有一个实用的细节:天线对的选择。如果网卡支持多天线,每一对收发天线都可以生成一张多普勒图。用3根发射天线加3根接收天线,一个接收设备能提供9个天线对的数据,也就是9张多普勒图。你可以把它们当成9个不同的“视角”,堆叠成一个多通道的输入张量。我实测下来,多天线带来的性能提升非常明显,相当于是给网络提供了多个角度的观测,推理时鲁棒性会好很多。
2.2 视觉特征到DensePose表示的回归
特征图生成之后,网络结构的设计就很顺理成章了。我选用的是ResNet-18作为骨干网络,输入是多通道的时频图堆叠,输出是DensePose的表示。
这里有个关键的改动:不要从零训练整个网络。先用ImageNet预训练的ResNet权重初始化,然后冻结前几层,只微调后面的层。这样做的原因很朴素:网络前几层学的是边缘、纹理、颜色渐变这类通用特征,在时频图上同样有意义;而后面几层学的是更高层的语义,需要针对无线信号场景重新适配。
网络输出设计成三个分支:一个分支做部位分类,输出每个位置属于哪个身体部位的置信度;另外两个分支分别回归U坐标和V坐标的连续值。这跟视觉DensePose的输出设计保持一致。我用50×50的分辨率作为输出网格,相当于把人体表面离散成2500个点,这个密度在WiFi感知场景够用了,再高分辨率对无线信号而言没有意义,因为CSI的物理分辨率极限摆在那里。
训练时的损失函数我用了三项组合:部位分类用标准的交叉熵损失,U、V坐标回归用平滑L1损失,再加一个时序一致性损失,用来约束相邻帧之间的输出不要突变。第三项特别重要。WiFi感知的帧率一般只有15到20赫兹,人体动作是连续的,如果网络在相邻两帧输出完全不同的DensePose结果,说明预测不稳定。时序平滑损失能有效压低这种抖动。
2.3 最关键的训练策略:跨模态对齐与知识蒸馏
训练数据怎么来?这个问题曾经劝退过很多人,也是我认为整个链路里最重要的工程决策。
WiFi CSI本身没有语义标签,你拿一段CSI数据,很难直接标注“这是一个人在弯腰”。给CSI数据人工标注姿态,成本高到不现实。我的做法是走跨模态的知识蒸馏路线:同时采集WiFi CSI和同步的RGB视频,用视觉DensePose模型给视频帧生成高质量的IUV标签,然后用这些标签去训练WiFi模型。
具体采集时,我会把WiFi采集设备和摄像头放在同一场景,通过一个简单的时间同步方案让两类数据对齐。然后视觉模型对每一帧视频生成DensePose坐标,作为监督信号。WiFi模型只接收CSI输入,却要预测出和视觉模型一致的DensePose结果。训练完成后,推理阶段完全不需要摄像头,WiFi模型自己就能输出DensePose。
这个方法有一个特别有价值的效果,叫表示对齐:WiFi模型学到的中间特征,会被迫和视觉模型的特征空间对齐。因为最终预测的是同一个DensePose标签,WiFi模型必须从信号里提取出和视觉信息“语义一致”的特征。这就是为什么训练好的WiFi模型对姿态判断比较准,而不仅仅是对着历史数据过拟合。
我还会额外加一个对比学习辅助分支:同一时刻的WiFi特征和视觉特征拉近,不同时刻的特征推远。它本质上是给特征空间加结构约束,让WiFi特征在空间上的排列方式和视觉特征一致。这个辅助分支对提升跨场景泛化能力很有帮助,后面会说为什么。
3. 最小复现系统:硬件、数据与损失函数怎么拼
3.1 硬件方案:比想象中便宜
先解决“我手里没有实验室级别的设备,能不能试”的问题。答案是能,而且成本可能低于预期。市面上做WiFi CSI采集,常见的有三套方案。
第一套是Intel 5300网卡加Linux CSI Tool,这是学术圈用得最早的方案。它能输出30个子载波的CSI,代码开源,文档多,缺点是只有2.4GHz和5GHz的低带宽模式,子载波数偏少,而且网卡型号现在不太容易买到全新的了。第二套是Atheros CSI Toolkit,用高通Atheros网卡配合修改过的固件,能拿到完整的CSI矩阵,数据量比Intel方案大得多,但固件配置比较复杂。第三套是ESP32配合定制固件,它灵活、便宜,能接入嵌入式系统,但ESP32大多数型号只能输出802.11n的WiFi信息,精度有限。
| 方案 | 子载波数 | 成本 | 上手难度 | 适合场景 |
|---|---|---|---|---|
| Intel 5300 + CSI Tool | 30 | 中等 | 较低 | 算法验证、入门 |
| Atheros + CSI Toolkit | 数百 | 中等 | 较高 | 高精度研究 |
| ESP32 定制固件 | 数十 | 很低 | 中等 | 嵌入式、产品原型 |
如果你只是想把算法跑通、验证想法,首选Intel 5300方案。我的建议是不要在一开始就纠结硬件的高精度,先用最成熟、资料最多的方案把整个流程跑通,再考虑升级。
3.2 数据采集:标注不用纯手工
数据采集是整个系统里最容易被低估的环节。我踩过的坑是:采集的人体动作种类太少,导致模型在真实场景里一遇到没见过的姿态就崩。
我的做法是设计一个动作清单,覆盖站、坐、蹲、走、弯腰、举手、踢腿、摔倒模拟等十几类基础姿态,每一类采集三到五分钟。在采集过程中,人不要刻意放慢动作,就按生活的自然速度来,这样多普勒图上的频率分布更真实。同时,摄像头和WiFi尽量同步记录,摄像头放在能看到全身的位置,WiFi采集设备放在人侧方。同步精度不需要做到逐帧级,后期可以用视觉模型和CSI的相对时间戳做对齐。
另外一个容易忽略的点:房间里不要只有人。把桌子、椅子、窗帘都放在里面,甚至开一台风扇制造一点环境扰动。因为真实场景里本来就有各种反射物,如果在纯空房间里采集,模型学到的东西到真实场景会立刻失效。我做过对比测试,加了一些常见家具后,模型在一个新房间里的性能能提升好几倍。
采集完的视频用视觉DensePose模型批量生成标签,这一步不需要人工参与。生成后做质量检查,把明显预测失败的帧丢掉。最后把CSI处理成多普勒特征图和标签对齐,就得到了训练集。
3.3 训练与部署的配置细节
模型训练整个流程已经比较成熟,我把关键配置写在这里,方便你直接抄作业。
骨干网络用ResNet-18,输入是9个天线对生成的多维多普勒图,输出部分分类头加两个回归头。训练时用AdamW优化器,初始学习率1e-4,batch size我实测32比较稳。损失函数组合如下:部位分类用交叉熵,U/V坐标用平滑L1,再加一个0.1权重的时序平滑损失。总损失就是这三项加权求和。
框架层面,PyTorch就够用。训练完做剪枝和量化,模型可以压到几十MB以内,放到边缘设备上跑没有问题。推理阶段,网络输入是过去0.5秒的CSI窗口,输出当前时刻的DensePose结果。因为多普勒特征图的生成只需要滑动窗口加短时傅里叶变换,整个链路在树莓派这一档的设备上也能跑到实时。
4. 实测中不得不说的边界条件与典型误判
4.1 墙上也能感知,但分辨率下降明显
穿墙感知是这个方向最吸引人的点,但一定要先搞清楚“穿墙之后能做到什么”和“不能做到什么”。
我的实测经验是:隔着一堵砖墙,人在墙后的动作能被检测到,大动作比如走路、弯腰、下蹲,特征非常明显;但细微动作比如手指动作、轻微转头,基本完全丢失。这是因为墙体对WiFi信号有显著的衰减,人体的反射信号传回接收端时,能量已经非常弱,信噪比大幅下降。
另一个问题是穿墙时多径效应变得更严重。墙本身就是一个很大的反射体,墙后反射路径会被墙面的反射淹没。所以穿墙场景下我建议把任务目标降低到行为分类级别,比如“走动、静止、跌倒、坐下”,而不要去追求精确的DensePose坐标。我见过一些团队在穿墙场景强行上高细粒度姿态估计,结果模型输出完全漂移,用户体验很糟糕。这个问题不是模型不行,是对物理极限的预期错了。
4.2 多人、快速动作、静态站立的坑
多人同时出现在WiFi感知范围内,是目前最棘手的情况之一。两三个人的反射信号会混叠在一起,CSI上看到的是所有人体运动的叠加,很难将它们分离。有一种思路是用多个接收设备做类似波束成形的处理,在空间上把不同的人分开,但这需要更复杂的硬件阵列和校准,已经超出WiFi DensePose本身的范围。
快速动作也会带来麻烦。一个人突然快速挥手或跑步时,多普勒频移会瞬间覆盖很宽的频率范围,如果短时傅里叶变换的时间窗设得太大,频谱会被抹平,特征反而消失。遇到这种情况,可以把窗口调短,增加帧率,但对算力要求更高。我习惯用一个自适应窗长:检测到宽频能量激增时,自动切换到短窗口。
还有一个反直觉的坑:人在完全静止时,WiFi信号几乎感知不到姿态。因为DensePose依赖的是运动带来的信号变化,人站着不动时,无线电波特性是稳定的,网络无法区分“站着的姿势”和“坐在椅子上完全不动”。这个问题需要靠呼吸信号来辅助,或者定期让用户做一些自然微动来刷新状态。设计系统时一定要想清楚:你是要感知“动态姿态变化”,还是要感知“静态存在状态”,这两者的信号处理逻辑完全不同。
4.3 环境迁移:换房间就不准了
模型在采集数据的房间表现好,搬到隔壁房间性能就掉,这是无线感知方向的经典问题。原因是不同房间的布局、墙壁材料、家具摆放都会改变信号传播路径,模型在训练环境里学到的多普勒模式,在新环境里产生了偏差。
我试过最有效的方案是数据增强:在训练时随机改变CSI数据的信道响应,模拟不同环境的反射情况。这种模拟增强可以让模型学到更鲁棒的特征,而不是死记某个房间的信号分布。另一个有效的方法就是前面提到的对比学习辅助分支,它让WiFi特征和视觉特征在语义空间对齐,语义是不会随房间变化而改变的,所以特征鲁棒性会明显提升。
即便如此,一个大面积的新环境部署仍然需要做少量微调。最好的实践是:在新环境布置好设备后,采集十分钟无特定动作的CSI数据,用来做归一化校准,再用少量数据微调模型。这个过程一般不需要人工标注,因为标签可以用视觉模型自动生成,做一次几十秒的快速采集就可以了。
4.4 常见问题排查表
| 问题 | 可能原因 | 排查方法 |
|---|---|---|
| 输出DensePose完全漂移 | 相位校准失败 | 检查Hampel滤波后的相位是否平滑 |
| 静态人体检测不到 | 窗口内无运动信息 | 增加呼吸信号分析或者降低姿态判定灵敏度 |
| 多人场景输出混乱 | 多径混叠严重 | 尝试多接收设备组合或改到单人受限场景 |
| 新房间掉点严重 | 环境过拟合 | 用对比学习重训,加入信道随机化增强 |
5. 隐私与伦理:这块技术的双刃剑效应
WiFi感知和摄像头相比,最吸引人的就是隐私保护。摄像头拍到的是一张完整的人脸和场景图,一旦数据泄露,后果很严重。而WiFi感知输出的DensePose表示,不包含人脸、不包含清晰的图像纹理,只是模糊的人体表面信息。从数据形态上看,它天然比图像更“安全”。
但我必须说得直白一点:这不意味着可以随意使用。DensePose坐标如果配合足够多的时序数据,仍然能推断出很多个人隐私,包括大概的身高、体态、行为习惯、作息规律。一个用户每天几点坐在沙发上、几点起身走动、有没有摔倒迹象,这些都是高度敏感的个人信息。任何感知系统,本质都是对个人行为的数字化描述,WiFi感知只是换了一种采集方式,并没有改变“采集个人数据”这个事实。
所以在做产品落地时,我会坚持几个原则。第一是本地处理:CSI数据不出设备,感知结果只在边缘端计算,云端只接收已经抽象化的行为事件,比如“跌倒”“长时间未移动”,不接收原始信号。第二是知情同意:哪怕系统是无感的,也应该明确告知用户环境中存在感知装置,并给出选择权。第三是数据最小化:只保存行为级的结果,不保存可回溯的原始数据。这不是技术问题,而是决定这技术能否长期发展的底线问题。
我这里再分享一个我自己的实践习惯:在采集数据时,只要摄像头在拍摄,房间门口的提示牌一定亮着。虽然WiFi感知的目标是数据安全,但实验过程中摄像头参与标注就意味着图像数据存在,必须把所有图像标注数据加密存储,用完立即删除。这个行业要想健康发展,技术能力和自律意识缺一不可。
我之前做完一个摔倒检测原型,放在家里一个独居老人房间测试了一个星期。结果完全没有误报,老人也很满意不用带任何设备。但真正让我印象深刻的,反而是老人说的一句话:“我在里头坐着你们都知道,那路由器会不会把我的私事都记下来?”我花了很长时间解释数据的处理过程,把加密存储和本地化处理的逻辑都讲给他听。这个经历让我意识到,感知技术的价值从来不只是技术本身,用户信任才是能不能真正落地的那道门槛。从那以后,我每做一个相关项目,都会先把隐私保护方案写在技术方案的第一页。
