SeekGene 平台参考基因组说明
为了保证单细胞与多组学数据分析的高质量与可靠性,SeekGene 云平台不仅内置了国际权威数据库发布的标准化参考基因组,还针对单细胞及空间测序技术的特点,对底层注释数据进行了深度定制与优化过滤,旨在最大程度降低背景噪声、提升有效信号的捕获率。
本说明文档为您详细梳理了平台上人(Human)、小鼠(Mouse)及大鼠(Rat)参考基因组的来源版本、染色体构成以及基因类型统计,并附上了常见参考基因组下载及命名的通用规则,方便您在下游个性化分析中快速核对或通过前缀过滤相关基因。
1. 平台内置参考基因组信息
1.1 人类 (Human)
- 基因组版本: GRCh38
- 注释版本: GENCODE v44
- 原始下载链接: GENCODE v44 GTF
染色体与基因统计
- 染色体 (25条):
chr1~chr22,chrX,chrY,chrM(线粒体) - 线粒体基因前缀: 基因名通常以
MT-开头 - 核糖体基因前缀: 核糖体蛋白基因通常以
RPL,RPS,MRPL,MRPS开头 - 免疫相关基因前缀: B细胞受体主要以
IGH,IGK,IGL开头;T细胞受体主要以TRA,TRB,TRG,TRD开头 - 其他常见质控前缀: 血红蛋白基因(提示红细胞污染)主要以
HBA,HBB开头;热休克蛋白(提示细胞应激)主要以HSP开头
当前的参考基因组文件已经过 SeekGene 平台的定制化预处理,主动移除了绝大多数非活性的基础假基因,从而极大降低了背景噪声。处理后共计保留 44,528 个基因:
| 大类 | Gene Type | 基因数量 |
|---|---|---|
| 编码蛋白 | protein_coding | 20,046 |
| 非编码 RNA | lncRNA | 18,866 |
misc_RNA, snRNA, miRNA, snoRNA 等小 RNA | 7,112 | |
| 免疫球蛋白 (B细胞受体) | IG_V_gene, IG_D_gene, IG_J_gene, IG_C_gene 及其相应假基因 | 409 |
| T细胞受体 | TR_V_gene, TR_J_gene, TR_C_gene, TR_D_gene 及其相应假基因 | 239 |
1.2 小鼠 (Mouse)
- 基因组版本: GRCm39
- 注释版本: GENCODE vM38
- 原始下载链接: GENCODE vM38 GTF
染色体与基因统计
- 染色体 (22条):
chr1~chr19,chrX,chrY,chrM(线粒体) - 线粒体基因前缀: 基因名通常以
mt-开头 - 核糖体基因前缀: 核糖体蛋白基因通常以
Rpl,Rps,Mrpl,Mrps开头 - 免疫相关基因前缀: B细胞受体主要以
Igh,Igk,Igl开头;T细胞受体主要以Tra,Trb,Trg,Trd开头 - 其他常见质控前缀: 血红蛋白基因主要以
Hba,Hbb开头;热休克蛋白主要以Hsp开头;此外包含大量Gm开头的预测基因(Gene Model)及Rik结尾的 RIKEN cDNA 克隆
与人类基因组处理逻辑一致,过滤掉基础假基因后,小鼠参考基因组中实际保留了 61,449 个基因:
| 大类 | Gene Type | 基因数量 |
|---|---|---|
| 编码蛋白 | protein_coding | 21,760 |
| 非编码 RNA | lncRNA | 32,889 |
miRNA, snoRNA, snRNA, misc_RNA 等小 RNA | 5,728 | |
| 免疫球蛋白 (B细胞受体) | IG_V_gene, IG_D_gene, IG_J_gene, IG_C_gene (含 LV 及假基因) | 426 |
| T细胞受体 | TR_V_gene, TR_J_gene, TR_C_gene, TR_D_gene 及其相应假基因 | 270 |
1.3 大鼠 (Rat)
- 基因组版本: GRCr8
- 注释版本: Ensembl release 116
- 原始下载链接: Ensembl 116 GTF
染色体与基因统计
- 染色体 (26条):
chr1~chr20,chrX,chrY,chrMT(线粒体) - 未定位 Scaffold:
chrJAXUCZ010000023.1,chrJAXUCZ010000028.1,chrJAXUCZ010000075.1 - 线粒体基因前缀: 基因名通常以
MT-开头 - 核糖体基因前缀: 核糖体蛋白基因通常以
Rpl,Rps,Mrpl,Mrps开头 - 其他常见质控前缀: 血红蛋白基因主要以
Hba,Hbb开头;热休克蛋白主要以Hsp开头;此外包含大量LOC开头的未表征基因
由于该大鼠注释文件已经过特定的过滤处理,目前默认且全部保留的基因类型仅包含 1 种核心基因类型:
| 大类 | Gene Type | 基因数量 |
|---|---|---|
| 编码蛋白 | protein_coding | 43,360 |
2. 国际通用数据库参考基因组下载说明
为了方便您获取其他物种的参考基因组,或者在分析前确认数据库文件的版本规则,我们为您整理了两大核心数据库(NCBI RefSeq 和 Ensembl)的标准下载格式。
2.1 NCBI RefSeq 数据库
NCBI 使用三层数字分段目录(如 002/007/445/)以提升 FTP 服务器的检索性能。该分段是从完整 Accession 号(如 GCF_002007445)中提取的。
下载数据格式:
- FASTA 文件 (
.fna.gz)https://ftp.ncbi.nlm.nih.gov/genomes/all/GCF/{Accession分段}/{完整Accession}/{完整Accession}_genomic.fna.gz - GTF 文件 (
.gtf.gz)https://ftp.ncbi.nlm.nih.gov/genomes/all/GCF/{Accession分段}/{完整Accession}/{完整Accession}_genomic.gtf.gz
URL 结构解析(以大熊猫 Ailuropoda melanoleuca 为例):
| 组成部分 | 示例值 | 说明 |
|---|---|---|
| 基础路径 | https://ftp.ncbi.nlm.nih.gov/genomes/all/ | NCBI 基因组下载服务器 |
| 目录分段 | GCF/002/007/445/ | Accession 号每 3 位数字分段 |
| 完整Accession | GCF_002007445.1_ASM200744v2 | GCF 号 + 版本号 (.1) + Assembly 组装名称 |
| 文件后缀 | _genomic.fna.gz / _genomic.gtf.gz | FASTA 序列文件或 GTF 注释文件 |
2.2 Ensembl 数据库
Ensembl 按发布版本(Release)组织数据,物种名统一使用全小写的拉丁学名(空格替换为下划线)。
下载数据格式:
- FASTA 文件 (
.fa.gz)https://ftp.ensembl.org/pub/release-{版本号}/fasta/{物种名小写}/dna/{物种名.Assembly名.dna.toplevel.fa.gz} - GTF 文件 (
.gtf.gz)https://ftp.ensembl.org/pub/release-{版本号}/gtf/{物种名小写}/{物种名.Assembly名.{版本号}.gtf.gz}
URL 结构解析(以袋熊 Vombatus ursinus 为例):
| 组成部分 | 示例值 | 说明 |
|---|---|---|
| 基础路径 | https://ftp.ensembl.org/pub/release-115/ | Ensembl FTP 服务器及版本号 |
| 数据类型 | fasta/ 或 gtf/ | 数据类型目录 |
| 物种目录 | vombatus_ursinus/ | 物种学名(全小写,空格替换为下划线) |
| 子目录 | dna/ (仅 FASTA 需要) | FASTA 序列存储的固定子目录 |
| 文件名 | Vombatus_ursinus.bare-nosed_wombat_genome_assembly.dna.toplevel.fa.gz | 首字母大写的物种名 + Assembly 组装名称 |
温馨提示: 不同物种的 Assembly 名称可能包含多种命名风格(如
bare-nosed_wombat_genome_assembly或VulVul2.2),下载时需根据该物种在 Ensembl 的实际命名拼接文件名。
3. SeekGene 参考基因组云端资源
为便于使用,以上提及及更多常用的标准化参考基因组文件,我们已经统一上传至 SeekGene 的官方 OSS 存储库。您可以直接在云平台调用,或在定制化分析流程中引用以下路径:
为方便其他用户直接下载使用,当前已构建完成并开放下载的参考基因组压缩包如下:
| 类型 | 物种 | 文件名 | 下载链接 |
|---|---|---|---|
| ARC | 人 | refdata-arc-GRCh38-2024-A-v44.zip | 点击下载 |
| ARC | 小鼠 | refdata-arc-GRCm39-2025-A-vM38.zip | 点击下载 |
| ARC | 大鼠 | refdata-arc-GRCr8_Ensembl_116.zip | 点击下载 |
| GEX | 人 | refdata-gex-GRCh38-2024-A-v44.zip | 点击下载 |
| GEX | 小鼠 | refdata-gex-GRCm39-2025-A-vM38.zip | 点击下载 |
| GEX | 大鼠 | refdata-gex-GRCr8_Ensembl_116.zip | 点击下载 |
| MET | 人 | refdata-met-GRCh38-2024-A-v44.zip | 点击下载 |
| MET | 小鼠 | refdata-met-GRCm39-2025-A-vM38.zip | 点击下载 |
| MET | 大鼠 | refdata-met-GRCr8_Ensembl_116.zip | 点击下载 |
| GEX + VDJ | 人 | refdata-gex-vdj-GRCh38-2024-A-v44_multi.zip | 点击下载 |
| GEX + VDJ | 小鼠 | refdata-gex-vdj-GRCm39-2025-A-vM38_multi.zip | 点击下载 |
总结
平台在处理标准的转录组参考注释时,为了最大化单细胞和空间测序数据的信噪比,SeekGene 平台执行了严格的定制化过滤逻辑(去除了如 processed_pseudogene, unprocessed_pseudogene 等纯背景假基因),最终精选并保留了具有潜在生物学意义的基因类型。
主要包括蛋白编码基因 (protein_coding)、各类长短非编码 RNA (lncRNA, miRNA 等),以及所有参与 T/B 细胞受体 V(D)JC 重排的基因片段(包括其相应的 pseudogene,如 IG_V_pseudogene,因为它们在免疫组库组装中仍具有重要参考价值)。
