RNA-seq标准化方法全解析:如何为你的数据选择RPKM、FPKM还是TPM?
第一次处理RNA-seq数据时,看到RPKM、FPKM和TPM这三个缩写词,我的反应和大多数新手一样——瞬间头大。实验室前辈随手扔来一句"用TPM准没错",但没人告诉我为什么。直到自己分析数据时发现,同样的样本用不同方法标准化后,差异基因列表竟有30%的不一致,这才意识到问题的严重性。本文将带你彻底理清这三种方法的本质区别,以及在不同研究场景下的最佳选择策略。
1. 标准化方法的核心逻辑与数学本质
所有RNA-seq标准化方法都在解决两个关键问题:基因长度偏差和测序深度差异。想象一下,一个5kb的长基因和一个1kb的短基因,在相同表达水平下,长基因会捕获更多reads——这就像用不同大小的渔网捕鱼,直接比较捕获量显然不公平。
1.1 RPKM/FPKM的计算逻辑
RPKM(Reads Per Kilobase per Million)的计算分为两个步骤:
- 测序深度标准化:
r复制RPM = (基因reads数 × 10^6) / 样本总reads数 - 基因长度标准化:
r复制RPKM = RPM / (基因长度/1000)
FPKM(Fragments Per Kilobase per Million)在双端测序中的计算稍有不同:
| 测序类型 | 计数单位 | 公式特点 |
|---|---|---|
| 单端测序 | reads | FPKM=RPKM |
| 双端测序 | fragments | 配对的reads计为1个fragment |
关键区别:RPKM适用于单端数据,FPKM适用于双端数据,但两者标准化逻辑完全相同。
1.2 TPM的革命性改进
TPM(Transcripts Per Million)看似只是字母顺序调整,实则改变了标准化流程:
- 先进行长度标准化:
r复制length_normalized = (基因reads数) / (基因长度/1000) - 再进行深度标准化:
r复制TPM = (length_normali
