1. 项目背景与需求解析
在哺乳动物转录组数据分析中,我们经常需要从参考基因组中提取基因编码区域(coding regions)的信息。这个需求主要出现在以下几种场景:
- 过滤SNP时排除非编码区域变异
- 研究基因表达与序列特征的关联
- 比较不同物种间的保守编码区域
以我最近处理的猪(Sus scrofa)转录组数据为例,上游分析使用的是UCSC RefSeq注释体系,因此需要获取与之匹配的基因坐标信息。NCBI Genome数据库作为最权威的基因组数据来源,提供了完整的注释信息下载渠道。
关键提示:选择基因组版本时,务必确认该版本带有完整注释(标有✅️),否则无法获取基因结构信息。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. NCBI基因组数据获取全流程
2.1 访问NCBI Genome数据库
首先打开NCBI Genome主页:
bash复制https://www.ncbi.nlm.nih.gov/datasets/genome/
这个界面提供了多种检索方式:
- 按物种名称搜索(推荐使用拉丁学名)
- 按分类层级浏览
- 按基因组组装质量筛选
对于猪基因组,我搜索"Sus scrofa"后会出现多个版本。这里需要注意两个关键指标:
- 是否有✅️标记(表示包含完整注释)
- 是否为最新参考基因组(通常版本号最高)
2.2 选择特定基因组版本
以Sscrofa11.1为例,点击进入详情页后会看到多个数据下载选项:
- 基因组序列(FASTA格式)
- 注释文件(GFF/GTF格式)
- 基因表格数据(TSV格式)
我们需要的是"View annotated genes"功能,这能获取最完整的基因结构注释。
2.3 批量下载基因注释
在基因列表页面:
- 点击"Genomic location"旁的复选框全选基因
- 选择"Download"→"Table"格式
- 保存为ncbi_dataset.tsv文件
这个TSV文件包含以下关键字段:
| 字段名 | 描述 | 后续处理需求 |
|---|---|---|
| GeneID | 基因 |
