1. WGCNA分析概述
WGCNA(Weighted Gene Co-expression Network Analysis)是一种广泛应用于生物信息学研究的分析方法,它通过构建基因共表达网络来识别功能相关的基因模块。这种方法特别适合处理高通量基因表达数据,如RNA-seq或微阵列数据。
WGCNA的核心思想可以概括为:将大量基因按照表达模式的相似性进行聚类,形成不同的模块(module),然后分析这些模块与特定表型或实验条件之间的关联,最终筛选出与研究目标最相关的核心基因(hub genes)。
提示:WGCNA分析的优势在于它能够捕捉基因之间的协同变化关系,而不仅仅是单个基因的表达变化。这种方法特别适合发现那些表达变化不大但协同性强的基因群。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 数据准备与预处理
2.1 数据格式要求
进行WGCNA分析前,需要准备两个基本文件:
-
表达矩阵(expression matrix):
- 行为基因(gene),列为样本(sample)
- 建议使用FPKM、TPM或log2转换后的表达值
- 文件格式推荐CSV或TXT
-
分组信息(group information):
- 包含样本名和对应的分组信息
- 通常用0表示对照组(control),1表示处理组(treat)
- 文件格式推荐TXT或CSV
2.2 数据加载与初步处理
在R环境中,我们可以使用以下代码加载数据:
r复制library(WGCNA)
library(tidyverse)
library(limma)
# 加载表达矩阵
exp <- read.csv("exp.csv", row.names = 1)
# 加载分组信息
group <- read.table("group.txt", header = TRUE, row.names = 1)
# 数据转置并筛选高变异基因
dat <- t(exp[tail(order(apply(exp, 1, mad)), 5000), ])
这里使用了MAD(Median Absolute Deviation)指标来筛选表达变异度最高的5000个基因。这种筛选基于一个重要的生物学假设:表达变化较大的基因更可能参与重要的生物学过程,而
