1. 为什么倾向得分加权比匹配更值得推荐
在观察性研究中,我们常常需要处理非随机化实验带来的选择偏差问题。传统上,倾向得分匹配(PSM)是最常用的方法,但越来越多的研究者开始转向倾向得分加权(PSW)。这两种方法都基于倾向得分——即给定协变量条件下个体接受处理的概率,但实现方式和效果存在显著差异。
我从事因果推断研究多年,处理过数十个真实世界数据集。最初我也习惯性使用PSM,直到在一次药物疗效评估项目中,匹配后的样本量从原始20000例骤减到3000例,导致统计功效严重不足。这次教训让我开始系统研究PSW的优势,并在此分享我的实践经验。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 核心方法对比与选择逻辑
2.1 倾向得分匹配的固有缺陷
PSM通过为处理组寻找协变量平衡的对照组个体,构建一个"伪实验"环境。常见操作包括:
- 最近邻匹配(有/无放回)
- 卡钳匹配(caliper matching)
- 分层匹配
但存在三个根本问题:
- 样本浪费严重:通常只能保留50%-70%的处理组样本,对照组未匹配样本直接丢弃
- 方差估计复杂:匹配后的样本不再独立,需要bootstrap等方法计算标准误
- 平衡性检验主观:对协变量平衡的判断缺乏统一标准
提示:当处理组占比<10%或>90%时,PSM可能完全无法找到足够匹配对象
2.2 倾向得分加权的技术优势
PSW通过为每个样本赋予权重,使加权后的样本分布满足协变量平衡。主流权重包括:
- 逆概率权重(IPTW):处理组权重=1/PS,对照组权重=1/(1-PS)
- 重叠权重(Overlap Weights):权重=PS(1-PS)
- 标准化死亡率权重(SMR)
相比PSM的核心优势:
- 保留全部样本:不丢弃任何数据点
- 显式控制极端权重:可通过截断或模型调整处理
- 方差计算直接:加权后的样本可视为独立观测
r复制# 典型的PSW实现代码(R语言)
ps_model <- glm(treatment ~ age + gender + disease_score,
data = df, family = binomial)
df$ps <- predict(ps_model, type = "respons
