上个月有个在医院做科研的朋友来找我,手里拿着一份三组病人数据,每组才6例。Kruskal-Wallis H检验跑出来p=0.081,她的主任看了一眼说“没差异,写结论吧”。她不甘心,跑来问我:“如果样本量再大一倍,还会是这个结果吗?会不会是因为我人太少才不显著?”
这个问题特别典型,几乎是每个用非参数检验的人都会撞上的墙。Kruskal-Wallis H检验作为多组独立样本比较中最常用的非参数方法,大家默认它“不用正态、很稳健”,但很少有人真正讲清楚:样本量到底在哪个环节影响结果、影响有多大、小到大各会踩什么坑。这篇文章我想从统计量本身出发,结合蒙特卡洛模拟和功效计算,把样本量与KW检验的关系完整拆开。
1. KW检验到底在算什么?样本量又是从哪里“插手”的
1.1 非参数检验没有抛弃数据,只是先换成“名次”
很多材料一上来就讲KW检验是“多组中位数比较”,这话其实只对了一半。Kruskal-Wallis H检验的原假设是所有组来自同一个分布,或者说各组在位置参数上没有差异。它不要求数据服从正态分布,这是它比单因素方差分析(ANOVA)更常被选用的原因。
但它并不是不用数据,而是先把所有组的观测值混在一起,从小到大排序,用“秩”替换原始数值。你可以把它想象成让所有人按身高排成一队,然后只看每个人排第几,不再看具体身高是多少厘米。第1名、第2名……第N名就是秩。第i组所有成员的秩加起来,得到第i组的秩和R_i。如果某一组的秩和明显偏大或偏小,说明这一组的数值整体偏高或偏低,H检验就会拒绝原假设。
这个过程里样本量已经在“暗处”起作用了:秩的稳定性完全依赖于总人数N和每组人数n_i。一个人单独排出来的名次,受其他组人数影响很大。你想判断的是组与组之间的差异,但每个组能贡献多少信息,首先就取决于这个组里有多少观测值。
1.2 H统计量公式里写满了n,只是很多人没细看
Kruskal-Wallis H统计量的常用形式是:
H = [12 / (N(N+1))] × Σ(R_i² / n_i) − 3(N+1)
其中k是组数,n_i是第i组的样本量,N是所有组样本量之和,R_i是第i组的秩和。理解这个公式,就能直观看到样本量是怎么影响结果的。
第一层影响在分母里:n_i作为除数,把各组秩和“按人头归一化”。如果某一组样本量很大,它的秩和天然容易偏大,除以n_i后才能和其他组公平比较。第二层影响在总样本量N:公式最外面的12/[N(N+1)],本质上是把所有秩的波动标准化到理论方差。N越大,标准化的精度越高。第三层影响最隐蔽,也最关键:H统计量只有在样本量足够大时,才近似服从自由度为k−1的卡方分布。实际检验里的p值,几乎都是拿这个H值去查卡方分布算出来的,而“近似”两个字恰恰就是小样本问题的大本营。
1.3 只看总样本量会骗人,真正决定命运的是“每个组”
做KW检验的人经常会报“我一共100个样本”,好像数字很大就很放心。但KW检验是分组比较,100个样本如果分成90、5、5三组,最关键的比较其实建立在那两组只有5例的数据上,信息量非常稀薄。H统计量对不同组的秩和做的是等权比较,单个组的秩和方差会随该组人数减少而急剧变大,这会直接稀释整个检验对组间差异的敏感度。
所以,“样本量对KW检验的影响”这句话背后,最重要的其实不是总N,而是“组数”“每组最小样本量”“组间样本量是否悬殊”这三个维度的组合。后面讲小样本和大样本的问题时,我会反复用到这个观点。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 样本量太小:p=0.08未必表示“没有差异”
2.1 小样本下“卡方近似”可能变成一张空头支票
KW检验的p值,默认是以H统计量近似卡方分布为前提的。这个近似是否可靠,主要取决于样本量和组数。经验上每组样本量大于等于5时,近似已经能用了,但如果某组样本量只有3、4甚至更少,H统计量的真实抽样分布是离散的、跳跃的,而你拿一个连续的卡方分布去套它,p值自然会有偏差。
更麻烦的是,这种偏差在不同数据分布下方向还不一样。连续数据、没有太多重复值时,小样本KW往往会稍微保守,也就是p值偏大,不容易拒绝原假设。很多人以为“KW检验很灵敏,人少也能出结果”,实际操作中却发现人少时通常更难出显著,这不全是效应不存在,而是小样本下检验本身就没给你足够的“火力”。一旦数据里还掺了重复值或离散评分,近似误差会更复杂,光靠默认的kruskal.test()并不靠谱。
2.2 检验功效太低,才是“不显著”的元凶
假设真实情况是三组里有一组确实不同,比如三种训练方法里,方法B平均能比另外两种多提高5分。如果每组只收5个人,这5分很容易被个体差异淹没,KW检验哪怕重复一百次,能发现差异的次数也很有限。这种“真实有差异但检验没检出来”的概率,就是统计功效(Power)问题。
功效取决于三个东西:效应量、样本量、显著性水平。效应量就是“真实差异有多大”,样本量是“你有多少证据”,显著性水平是你设置的阈值。KW检验本身不提供一个像t检验那样简单计算功效的标配函数,很多人就忽略了这一步。但现实是,样本量不足时做出“无差异”的结论,和样本量充足时做出“无差异”的结论,可信度完全不是一个量级。
我常见到的错误表述是:“KW检验p=0.72,所以两组没有差异。”统计检验只能告诉你“没有足够证据拒绝原假设”,不能告诉你“原假设一定成立”。当样本量很小时,一个不显著的结果可能只是说明这次实验的探测能力太弱,效应真存在也没办法被发现。
2.3 小样本里的“结”和秩偶然性会放大噪声
连续分布理论上不会有完全相同的观测值,但现实中大量数据是整数、评分、等级、计数,比如0~10分的疼痛评分、Likert量表的满意度,一个样本里出现大量相同数值,这些相同值在排序时只能分配平均秩,形成“结”(tie)。
当总样本量只有15~30时,数据一旦离散,结的比例会非常高。秩和里充斥着并列名次,意味着原始数据提供的区分信息远少于名义样本量。此时如果用不做结校正的H统计量,方差会被低估,p值倾向于偏小,也就是容易假阳性。好在R的kruskal.test()默认做了结修正,但如果结的数量过多,修正公式也只是补救,不能替代真正足够的样本量。
小样本时还有一个隐蔽风险:秩的分配对个别极端值特别敏感。一个观测值从第10名跳到第11名,可能只是因为另一个组多了一个人,这种“偶然性”在小样本中会被放大成伪差异或伪相似。
3. 样本量变大后,KW检验真的就越来越强吗
3.1 渐近性慢慢兑现,但“显著”不等于“重要”
当每组样本量增大,KW的H统计量会越来越接近卡方分布,p值计算越来越可靠,检验功效也会随之上升。这是好事。但样本量一旦过大,又会撞上另一个所有显著性检验都躲不开的问题:只要样本够多,任何微小差异都能变成“显著”。
举例来说,三种网页改版方案之间真实差异只有转化率0.1个百分点,从业务角度看根本不值得改版,但如果你每组放5万用户,KW检验照样能给出一个p<0.001。这时候你得到的不是“存在有意义差异”,而是“样本量大到能捕捉噪声级的差异”。所以大样本报告KW结果时,光写p值是不够的,还必须报告效应量。
KW后续常用的效应量是ε²(epsilon squared),计算公式是ε² = (H − k + 1) / (N − k)。它表示组间秩差异占总秩差异的比例。一般经验是ε²在0.01~0.06算小效应,0.06~0.14算中等,0.14以上算大。只看p值容易产生“越大越强”的错觉,配上效应量才能把统计显著和实际显著区别开。
3.2 样本量大了,分布形态差异也会更容易“冒充”位置差异
KW检验在解释上有一个默认前提——各组分布形状相似。如果所有组都是近似正态且方差接近,那么KW拒绝原假设时可以解释为“中位数/位置不同”。但真实数据往往不是这样:A组方差小、数值集中,B组方差大、拖了长尾,两组中位数可能完全一样,KW检验照样可能拒绝。
样本量小的时候,这种分布形态上的差异可能被噪声掩盖;样本量一大,检验对任何系统性差异都变得敏感,于是方差差异、偏度差异都会转化为“显著”。这不是KW检验坏了,而是它检验的是“随机占优/分布整体差异”,并不只针对中位数。大样本只是把这个特点暴露得更明显而已。
所以大样本场景下,我建议除了KW检验,一定要画分组箱线图或分布密度图,先看形状是否大体一致。如果只是方差不同导致显著,解释成“A组比B组数值更高”就是过度解读。
3.3 组间样本量悬殊,并不会因为总量变大而自动变好
假设总样本量500例,其中对照组450例,两个处理组各25例。KW检验会告诉你三组秩分布不全相同,但你仔细想想:450例的对照组对整体秩排序贡献巨大,两个25例小组只要稍微有几例偏高,秩和就可能出现明显偏移。这个检验对“大组内部的微小波动”和“小组真实效应”之间的区分能力并不平衡。
从功效角度看,最需要被检出的往往正是样本量最小的处理组。但样本量悬殊时,小处理组的秩和方差大,检验功效被严重削弱。KW检验不会因为你总量大就自动弥补这种不平衡。设计实验时,应该优先保证最关心的对比组有足够样本量,而不是只盯着总样本量做大。
4. 跑一遍蒙特卡洛模拟:样本量与检验结果的数量关系
4.1 模拟设计思路
纸上谈兵再多,不如直接写代码看模拟结果。我用R语言做了两类模拟:
第一类:三组数据都从标准正态分布N(0,1)抽取,也就是原假设为真,考察不同样本量下KW检验把p值错误判断为小于0.05的比例。这个比例应该接近0.05,如果偏差太大,说明近似失效。
第二类:让第三组数据带一个位置偏移,即第三组从N(shift,1)抽取,考察每组在不同样本量下能正确拒绝原假设的比例,也就是检验功效。
模拟核心代码如下:
r复制set.seed(123)
# 模拟1:原假设为真时的I类错误率
sim_type1 <- function(n_per_group, nsim = 5000) {
mean(replicate(nsim, {
x <- c(rnorm(n_per_group), rnorm(n_per_group), rnorm(n_per_group))
g <- factor(rep(1:3, each = n_per_group))
kruskal.test(x, g)$p.value < 0.05
}))
}
# 模拟2:备择假设为真时的检验功效
sim_power <- function(n_per_group, shift = 0.5, nsim = 5000) {
mean(replicate(nsim, {
x <- c(rnorm(n_per_group, 0),
rnorm(n_per_group, 0),
rnorm(n_per_group, shift))
g <- factor(rep(1:3, each = n_per_group))
kruskal.test(x, g)$p.value < 0.05
}))
}
ns <- c(5, 10, 20, 30, 50)
# 查看I类错误率
round(sapply(ns, sim_type1), 3)
# 查看两种偏移量下的功效
round(sapply(ns, sim_power, shift = 0.5), 3)
round(sapply(ns, sim_power, shift = 1.0), 3)
模拟次数设5000次,主要是为了让比例稳定。如果电脑配置一般,可以降到1000~2000次,趋势不会变,只是数值会有一些随机波动。下面是我跑出来的典型结果,不同随机种子会有±0.02左右的波动,但只要趋势一致就说明问题。
4.2 I类错误率:小样本并非完全失控,但确实有偏差
我运行模拟后得到的I类错误率大致如下:
| 每组样本量n | 名义水平0.05下的实际拒绝率 |
|---|---|
| 5 | 0.044 |
| 10 | 0.048 |
| 20 | 0.052 |
| 30 | 0.049 |
| 50 | 0.051 |
可以明显看到,当三组都是连续数据、每组5例时,KW检验的实际拒绝率约0.044,低于名义的0.05,表现出一定保守性。这意味着,如果真实效应存在,小样本下KW不仅功效低,连犯错方向的“性子”都偏谨慎。每组10例以上时,I类错误率已经很接近0.05了。
这里要注意,模拟假设的是无结的连续数据。如果换成离散评分数据,小样本下结会变多,结果会不同于这张表,有可能变得过于宽松。这也解释了为什么“离散数据+小样本”的组合最需要警惕。
4.3 功效随样本量的变化:不是线性增长,而是S形爬坡
再看功效模拟结果。我分别设置偏移量为0.5和1.0,代表中等和较大效应,计算结果大致如下:
| 每组样本量n | 第三组偏移0.5时功效 | 第三组偏移1.0时功效 |
|---|---|---|
| 5 | 0.10 | 0.23 |
| 10 | 0.15 | 0.52 |
| 20 | 0.27 | 0.84 |
| 30 | 0.42 | 0.95 |
| 50 | 0.68 | 0.99 |
这张表很能说明问题。偏移0.5时,每组5例只有约10%的把握检测出差,几乎等于瞎猜;每组50例能达到约68%。偏移1.0时,每组10例就已经有一半以上把握,每组20例就冲到了80%以上。检验功效随着样本量增长不是直线上升,而是典型的S形曲线:在低样本区增长缓慢,到中间区间快速拉升,最后趋于饱和。
所以,回答开头那个“样本量再大一倍会怎样”的问题,最靠谱的答案不是凭感觉,而是用这种功效曲线去看。如果实际效应量是中等,每组6例跑到p=0.08完全正常,因为你的检验根本没有足够“力气”把差异拉出来。与其继续纠结这个p值,不如思考能不能补样本、能不能合并效应接近的组,或者至少把结果如实报告为“探索性发现,需更大样本验证”。
5. 实验设计阶段怎么给KW检验科学地定样本量
5.1 先用ANOVA功效计算做基准,再给KW留一点余量
KW检验没有像t检验那样人人皆知的功效计算函数,但有一个很实用的近似路径:先按单因素ANOVA估计所需样本量,再用KW检验相对ANOVA的渐近效率做修正。
在数据正态且位置偏移的假设下,KW检验相对F检验的渐近相对效率约为0.955。也就是说,KW大约损失4.5%的功效。反过来用,想让KW达到与ANOVA相同的功效,样本量约需增加1/0.955≈1.047,也就是约5%。
R里先用pwr包算ANOVA基准:
r复制# 安装过就不用重复执行
# install.packages("pwr")
library(pwr)
# 三组、中等效应f=0.25、显著性水平0.05、目标功效0.8
res <- pwr.anova.test(k = 3, f = 0.25, sig.level = 0.05, power = 0.8)
res$n # 每组需要的样本量,约为52.4
# 换算成KW检验的保守估计
ceiling(res$n / 0.955) # 每组约55例
很多分析人员做到这里就停了,直接按ANOVA的结果收样本,这其实小瞧了KW检验在重尾数据上的能力。如果数据分布明显偏离正态,KW往往比ANOVA更稳健,所需样本量甚至可能比ANOVA还小。上面的“加5%”只是保险做法,适用于你也不确定数据形态、先按最不利情况打算的场景。更严谨的做法是先做个小规模预实验,估计出效应量和数据分布,再做针对性的功效模拟。
5.2 不会写模拟代码时,也可以手动估算关键参数
如果不熟悉功效模拟,可以按下面这套流程手动估算:
第一步:确定你要检测的最小实际差异。差异太小不值得做,差异太大不用多少样本就能检出来,所以要定一个业务上有意义的下限。
第二步:估计组内标准差。KW检验用的是秩,但估算样本量时仍需原始数据的标准差。可以用预实验数据或文献里的同类数据估一个大概值。
第三步:计算Cohen's f。公式可以写成f = sqrt(Σ(各组均值−总均值)² / k) / σ。这个值如果算不出来,可以按经验取:f=0.1小效应、0.25中等、0.4大效应。
第四步:用G*Power或pwr包算出三组ANOVA需要的样本量,再乘以1.05作为KW的参考值。这样不需要专门学R,也能得到一个可用的样本量起点。
这个流程的价值不在于算出精确数字,而在于逼你先想清楚“差异多大才算有意义”,这比任何检验本身都重要。
5.3 如果样本已经收完、也补不上了,还能做什么补救
实际项目里最常遇到的情况是:数据已经收完了,样本量就那么大,没法回头。这时候还有几条路可以走:
第一条路是改用精确检验。KW默认的卡方近似在小样本下不可靠时,可以用置换检验得到“精确p值”。R里coin包的oneway_test可以指定分布为“exact”或“asymptotic”。对于小样本,精确p值比默认卡方近似更可信。
第二条路是报告秩效应量和置信区间,把“是否显著”和“差异多大”分开说。一个p=0.08但ε²=0.12的KW结果,在探索性研究里仍然有报告价值,它告诉你方向值得追踪,只是证据力度不足。
第三条路是在解释时特别注意措辞。小样本下的“不显著”只能说“本次数据不足以支持差异结论”,绝对不能倒过来当作“证明没有差异”。如果写论文或报告,建议补充一句样本量效能分析,说明当前样本量能检出的最小效应量是多少,读者自然能判断结论的可靠性。
6. 几个让人误判KW结果的经典场景
6.1 ANOVA显著、KW不显著,是不是KW不够灵敏
我见过太多次这种对比:同一份数据,ANOVA给出p=0.03,KW给出p=0.11,然后有人得出结论说“KW太不灵敏”。这其实不一定是KW的错。ANOVA基于原始均值,容易被个别极端值拉动;KW基于秩,对极端值不敏感。如果这三组数据里混杂明显的离群值,ANOVA的显著很可能只是被少数极端点驱动的。
反过来想:如果你关心的是“整体上哪一组倾向于更大”,而不是“均值有没有被极端值拉高”,KW的结论更贴近你的实际研究问题。KW和ANOVA检验的重点略有不同,把它们的结果当成互相矛盾的裁判,不如当成两种不同视角的互补验证。
6.2 每组样本量都很大,KW还是“不显著”,怎么回事
大样本下还不显著,通常有两种原因。第一种是效应量真的太小。样本量大了,检验灵敏度确实会提高,但如果三组之间的分布几乎重合,任何检验都无能为力。第二种是组数太多。KW的自由度随组数增加而变大,组数一多,卡方分布的临界值也变大,对显著性提出了更高要求。比如比较五六个处理组时,就算有两组差异明显,整体KW也可能因为“平均效应被稀释”而得不到显著。
这时候不要急着否定KW,可以先做针对性的对比。如果事先计划好了要比较的特定组对,直接做带多重比较校正的秩和检验;如果事先没有计划,KW显著之后再用Dunn检验或Conover-Iman检验探索具体哪两组不同。
6.3 同组里有明显方差差异,KW显著还能不能解释为中位数差异
不能。我前面已经强调过,KW检验对“分布整体差异”敏感。如果两组的方差差异非常大,即便中位数完全相同,KW也很可能给出显著结果。真实研究里经常是处理组既改变了平均水平,又改变了波动幅度,这时候KW拒绝原假设其实同时包含了位置和形状两方面的信息。
正确做法是先画图确认各组分布形态。如果形状相近,KW可以作为位置检验来解读;如果形状差异很大,建议报告时明确说明“三组秩分布存在差异”,不要强行写成“中位数有显著差异”。如果研究目标就是中位数本身,可以考虑换用更专门的检验,或者通过Bootstrap构造中位数差置信区间,把重点放到差值大小上。
写在最后
我在实际处理这类问题时,最常提醒自己的一句话是:KW检验给的是“秩的差异信号”,不是“疗效大小”。样本量决定了这个信号能不能被稳定捕获,而效应量决定了信号被捕获后有没有实际价值。做统计推断时,我一般会先问清楚三个问题:你想找的差异到底有多大?你现在的样本量能检测到这个差异的概率是多少?如果检测不到,你的结论打算怎么表达?把这三个问题想透了,再回头看待那些不显著的p值,心态会稳很多,结论也会扎实很多。
