单细胞 scATAC-seq & scRNA-seq 双组学高级分析:SCENIC+ 调控网络分析
前言
TIP
SCENIC+(Single-Cell Regulatory Network Inference and Clustering Plus)是一种整合 scRNA-seq 与 scATAC-seq 数据的转录调控网络推断框架。其核心优势在于利用染色质可及性信息约束 TF–靶基因关系的推断,相比传统 SCENIC 方法显著降低假阳性连接,构建"转录因子 → 顺式调控元件 → 靶基因"的完整调控网络。
在单细胞多组学研究中,仅依赖基因共表达推断 TF–靶基因关系往往存在大量假阳性。SCENIC+ 通过整合 scATAC-seq 的染色质可及性信息,从两个独立的组学层面(RNA 表达 + ATAC 可及性)共同验证 TF 的调控关系,大幅提升调控网络的可靠性。平台会自动完成从 pycisTopic 主题建模、cisTarget 数据库构建、调控网络推断到 eRegulon 质量评估与可视化的全部流程。
SCENIC+ 的核心功能
调控网络推断 结合基因共表达(RNA)与染色质可及性(ATAC)双重证据,推断转录因子与靶基因之间的调控关系,构建高置信度的 eRegulon(extended Regulon)。
eRegulon 质量评估与过滤 通过 TF 表达–AUC 相关性、Gene-based 与 Region-based AUC 一致性等多维度指标,自动筛选高质量调控关系,剔除假阳性连接。
Regulon 特异性评分(RSS) 计算每个 eRegulon 在各细胞类型中的特异性富集程度,识别细胞类型特异性调控因子,帮助解析细胞命运决定的调控逻辑。
多模态联合可视化 基于 eRegulon AUC 矩阵进行 UMAP/t-SNE 降维,将 TF 表达、Gene AUC、Region AUC 映射到同一底图,并提供热图–点图联合展示,全面呈现调控网络的结构与动态。
本篇文档旨在为单细胞多组学研究者提供一份详尽的 SCENIC+ 技术指南,内容涵盖其基本原理、在 SeekSoul Online 云平台上的操作方法、结果解读及常见问题,帮助您快速掌握并应用该工具。
SCENIC+ 理论基础
核心原理
SCENIC+ 分析的核心思想是:利用 scATAC-seq 的染色质可及性信息作为独立证据约束 TF–靶基因关系的推断,仅保留在 RNA 和 ATAC 两个组学层面均获支持的调控连接,从而显著提升调控网络的精度和可解释性。
从 SCENIC 到 SCENIC+
传统 SCENIC 方法仅基于 scRNA-seq 数据推断调控网络,存在以下局限:
- 基因共表达可能反映间接调控或技术噪音
- 缺乏表观遗传层面的独立验证
- 推断的 regulon 假阳性率较高
SCENIC+ 通过引入 scATAC-seq 数据解决了这些问题:
- 顺式调控元件(cis-regulatory element):从 ATAC 数据中识别 TF 结合位点附近的开放区域
- eRegulon:将 TF、调控元件(Region)、靶基因(Gene)三者关联为一个完整的调控单元
- 双重验证:只有当 TF 的靶基因在 RNA 层面呈现共表达、且其结合区域在 ATAC 层面呈现可及性时,调控关系才被保留
SCENIC+ 的完整分析流程
SCENIC+ 分析包含 5 个主要步骤:
- 数据转换(step0):将 Seurat 对象中的 RNA 和 ATAC counts 矩阵转换为 AnnData (h5ad) 格式
- pycisTopic 主题建模(step1):对 scATAC 数据进行 LDA 主题建模,识别共开放区域模块
- cisTarget 数据库构建(step2):基于 consensus regions 构建 motif 打分数据库
- 调控网络推断(step3):整合 RNA + ATAC 证据,推断 TF–调控元件–靶基因关系
- 后处理与可视化(step4):eRegulon 质量评估、过滤、RSS 计算与多模态可视化
关键算法与流程
对于每个推断出的 eRegulon,SCENIC+ 会进行以下关键验证:
- TF 表达–AUC 相关性:计算 TF 的 RNA 表达水平与其 eRegulon AUC 活性评分之间的 Pearson 相关性,筛选出具有显著正相关或负相关的调控关系
- Gene-based 与 Region-based AUC 一致性:要求同一 eRegulon 在基因表达层面和染色质可及性层面的 AUC 评分具有较高相关性,确保调控关系在两个组学层面均获支持
- 靶基因数量过滤:剔除靶基因数量过少的 eRegulon,保留具有足够信息量的高质量调控单元
云平台操作指南
在云平台上,SCENIC+ 分析流程被设计得直观易用。平台会自动完成从 pycisTopic 主题建模、cisTarget 数据库构建到调控网络推断的全部计算步骤,用户仅需配置基本参数即可查看结果。


分析前的准备
TIP
SCENIC+ 分析对输入数据有较高要求。在开始分析前,请务必确认:
- 数据已完成预处理:您的单细胞 ATAC 和 RNA 数据已经过标准的质控、降维、聚类和细胞类型注释。
- 双组学数据完整:确保输入 Seurat 对象同时包含 RNA 和 ATAC 两个 Assay,否则无法进行多组学联合推断。
- 物种信息正确:SCENIC+ 需要匹配正确的 motif 数据库(human/mouse),请确认物种参数与数据一致。
- 细胞数量充足:SCENIC+ 对细胞数量有一定要求,细胞过少可能导致调控网络推断不稳定。
参数详解
下表详细列出了云平台 SCENIC+ 分析模块的主要参数及其说明。
| 参数名称 | 说明 |
|---|---|
| 任务名称 | 本次分析的任务名称,需以英文字母开头,可包含英文字母、数字、下划线和中文。 |
| 分组因子 | 细胞分群列名。 |
| 细胞类型 | 要分析的细胞类型。 |
| 筛选因子 | 样品信息的列名。 |
| 筛选对象 | 要分析的样品名称。 |
| 物种 | 物种信息,用于选择对应的 cisTarget motif 数据库(human 或 mouse)。 |
| n_topics | pycisTopic LDA 主题建模的主题数量,默认 40。主题数越多,识别的共开放区域模块越精细,但计算量也相应增大。 |
| TF_eRegulon_cor | TF 表达与 eRegulon AUC 相关性的绝对值阈值,默认 0.5。仅保留相关性高于该阈值的 eRegulon。 |
| AUC_Gene_Region_cor | Gene-based 与 Region-based AUC 相关性的最低阈值,默认 0.5。用于筛选在两个组学层面均一致的 eRegulon。 |
| min_target_genes | eRegulon 最少靶基因数,默认 10。过滤靶基因数量过少的低信息量调控单元。 |
| Downsample | 是否在分析前对细胞进行降采样以节省计算资源,默认为 TRUE。 |
| Downsample_num | 降采样数量,每个细胞亚群最多保留的细胞数,仅在降采样开启时生效,默认为 1000。 |
重要注意事项
TIP
- 数据质量要求:SCENIC+ 对输入数据质量要求较高。低质量的 ATAC 数据(如 TSS 富集不足、片段长度分布异常)会直接影响 pycisTopic 主题建模的质量,进而降低调控网络推断的准确性。
- 双组学数据必要性:SCENIC+ 的核心优势在于整合 RNA 和 ATAC 两个组学层面的证据。若输入对象缺少 RNA 或 ATAC Assay,分析将无法进行或结果质量显著下降。
- 计算资源需求:SCENIC+ 的完整流程(尤其是 step1 pycisTopic 和 step3 网络推断)对内存和 CPU 要求较高。降采样参数可有效控制资源消耗,但可能损失部分稀细细胞亚群的调控信息。
- 物种匹配:物种参数直接决定 motif 数据库的选择,错误的物种设置会导致 motif 富集分析失败或结果不可靠。
- eRegulon 过滤:平台会自动进行多维度质量过滤。过严格的阈值可能保留的 eRegulon 过少;过宽松的阈值可能引入假阳性。建议先使用默认阈值,再根据结果调整。
- RSS 解读:Regulon 特异性评分(RSS)反映 eRegulon 在各细胞类型中的相对特异性,而非绝对活性。高 RSS 值表示该 eRegulon 在特定细胞类型中活性最强,但不代表其他细胞类型中完全没有活性。
操作流程
- 进入分析模块:在云平台导航至"高级分析"模块,选择"SCENIC+"。
- 创建新任务:为您的分析任务命名,并选择要分析的样本或项目。
- 配置参数:根据上述指南,选择细胞类型、物种、过滤阈值等参数。
- 提交任务:确认参数无误后,点击"提交"按钮,等待分析完成。SCENIC+ 完整流程通常需要较长时间,请耐心等待。
- 查看结果:分析结束后,在任务列表中查看生成的分析报告和结果文件,包括 eRegulon 质量评估图、RSS 热图、降维可视化等。
结果解读
SCENIC+ 的分析报告包含丰富的图表和数据文件,以下是对核心结果的详细解读。
TF 表达–eRegulon AUC 相关性散点图
该图展示了 TF 的 RNA 表达水平与其 eRegulon AUC 活性评分之间的相关性分布,用于评估调控关系的可靠性。分别展示 direct 和 extended 两类 eRegulon 的结果。

图表解读
- 横轴:TF 表达量(pseudobulk 均值或标准化值)
- 纵轴:eRegulon AUC 活性评分
- 颜色:标识通过/未通过相关性阈值(默认 |cor| > 0.5)的 eRegulon
- 散点分布:每个点代表一个 eRegulon,高相关性的点分布在左上和右下角(正/负相关),低相关性的点聚集在中部
分析要点
- 相关性阈值:只有 TF 表达与 AUC 相关性绝对值超过阈值的 eRegulon 被保留,确保调控关系具有表达层面的支持。
- 正相关 vs 负相关:正相关表示 TF 表达升高时靶基因活性增强(激活型调控),负相关可能暗示抑制型调控。
eRegulon 相似性双面板热图
该双面板热图从连续值(AUC 相关性)和集合(靶基因交集)两个维度评估 eRegulon 之间的功能相似性。

图表解读
- 左侧 AUC 相关性热图:基于各 eRegulon 在细胞间的 AUC 活性模式计算 Pearson 相关性,反映功能相似性。高相关性的 eRegulon 可能调控同一通路或处于同一调控层级。
- 右侧 Jaccard 交集热图:基于各 eRegulon 的靶基因集合计算 Jaccard 系数,反映调控靶标的重叠程度。高交集的 eRegulon 可能具有功能冗余性或互为备份。
- 聚类排序:两个热图共享相同的层次聚类排序,功能相似的 eRegulon 在热图中相邻展示。
分析要点
- 联合解读:如果两个 eRegulon 在两种热图中都高度相似,说明它们可能代表同一调控轴的不同方面。
- 间接调控识别:如果仅在 AUC 热图中相似而靶基因不重叠,可能暗示间接调控关系。
Regulon 特异性评分(RSS)
RSS 衡量每个 eRegulon 在不同细胞类型中的特异性富集程度,是识别细胞类型特异性调控因子的关键指标。

图表解读
- 热图颜色:表示 RSS 得分,颜色越深代表该 eRegulon 在对应细胞类型中的特异性越强。
- 行(eRegulon):按特异性最高的细胞类型聚类排序,便于识别细胞类型特异的调控模块。
- 列(细胞类型):展示每个 eRegulon 在各细胞类型中的特异性分布。
分析要点
- 细胞类型特异性调控因子:在某一种细胞类型中 RSS 显著高于其他类型的 eRegulon,可能是驱动该细胞类型特性的核心调控因子。
- 跨细胞类型共享调控:在多种细胞类型中均有较高 RSS 的 eRegulon,可能参与基础调控过程。
eRegulon AUC 联合降维图
基于 eRegulon AUC 矩阵进行 UMAP/t-SNE 降维,将 TF 表达、Gene AUC、Region AUC 三种模态的信息映射到同一底图,全面展示调控异质性。

图表解读
- 底图:基于 Combined(Gene-based + Region-based)AUC 矩阵的 UMAP 降维
- 颜色映射:每个子图展示一种特征(TF 表达、Gene AUC 或 Region AUC)在细胞上的分布
- 模态对比:通过对比同一 TF 在三种模态下的分布模式,可判断调控主要发生在转录水平还是表观遗传水平
分析要点
- 模态一致性:若某 TF 在三种模态下的分布模式高度一致,说明调控关系在转录和表观遗传两个层面均获支持。
- 调控异质性:降维图中相邻的细胞群具有相似的调控活性模式,可能属于同一发育谱系或功能模块。
eRegulon UMAP 单细胞映射
将每个 eRegulon 的 AUC 活性评分映射到 UMAP 空间,按细胞类型分面展示,直观呈现调控活性的空间分布。

图表解读
- 每个面板:展示一个 eRegulon 在 UMAP 上的活性分布,按细胞类型着色
- 颜色梯度:从蓝色(低活性)到红色(高活性),标识该 eRegulon 在不同细胞中的活性水平
- 细胞类型特异性:通过观察活性在不同细胞类型间的分布差异,可直观验证 RSS 结果
热图–点图联合展示(heatmap_dotplot)
SCENIC+ 内置的热图–点图联合展示,以颜色表示 Gene-based AUC、以点大小表示 Region-based AUC,在同一张图中同时展示两种模态的调控活性。

图表解读
- 颜色通道(Gene-based AUC):反映靶基因表达层面的调控活性
- 点大小通道(Region-based AUC):反映染色质可及性层面的调控活性
- 行(eRegulon):按调控活性排序
- 列(细胞类型):展示每个 eRegulon 的细胞类型特异性模式
分析要点
- 双模态验证:颜色和点大小同时显著的 eRegulon–细胞类型对,代表在 RNA 和 ATAC 两个层面均获支持的高置信度调控关系。
- 细胞类型特异性识别:在某列中颜色和点大小均显著但在其他列不显著的 eRegulon,是该细胞类型的特异性调控因子。
RSS–表达量联合点图
自定义的 RSS–表达量联合点图,整合 RSS 打分与 TF 表达 Z-score,构建综合调控特征图谱。

图表解读
- RSS 打分:反映 eRegulon 在各细胞类型中的特异性
- TF 表达 Z-score:反映 TF 本身的表达水平
- 联合解读:高 RSS + 高表达的 TF 是该细胞类型的核心驱动因子;高 RSS + 低表达的 TF 可能是潜在调控因子(表达量虽低但特异性强)
结果文件列表
| 文件名 | 内容说明 |
|---|---|
scplusmdata.h5mu | SCENIC+ pipeline 输出的最终 MuData 对象(含 direct/extended eRegulon 的 AUC 矩阵)。 |
ctx_results.hdf5 | cisTarget motif 富集分析结果。 |
dem_results.hdf5 | 差异可及性分析结果。 |
cistromes_direct.h5ad | Direct eRegulon 的 cistrome(TF–peak 关联)。 |
cistromes_extended.h5ad | Extended eRegulon 的 cistrome。 |
AUCell_direct.h5mu | Direct eRegulon 的 AUCell 活性矩阵。 |
AUCell_extended.h5mu | Extended eRegulon 的 AUCell 活性矩阵。 |
direct_e_regulon_metadata_raw.csv | Direct eRegulon 元数据原始表格。 |
extended_e_regulon_metadata_raw.csv | Extended eRegulon 元数据原始表格。 |
TF_eRegulon_cor_Direct_vs_Extended.pdf | TF 表达–AUC 相关性散点图(Direct vs Extended)。 |
correlation_and_intersection_heatmaps.pdf | eRegulon 相似性双面板热图(AUC 相关性 + Jaccard 交集)。 |
RSS_matrix_transposed.csv | RSS 评分矩阵(eRegulon × 细胞类型)。 |
eRegulon_combined_AUC_reduction.pdf | Combined AUC 联合降维图(UMAP)。 |
TF_AUC_Combined_UMAP/ | 各 eRegulon 的 UMAP 单细胞映射目录(按细胞类型分面)。 |
Regulon_Specificity_Score/direct_eRegulon_heatmap_dotplot.pdf | Direct eRegulon 热图–点图联合展示。 |
Regulon_Specificity_Score/direct_eRegulon_RSS_expression_dotplot.pdf | Direct eRegulon RSS–表达量联合点图。 |
注意事项
1. 数据质量的重要性:SCENIC+ 对输入数据质量要求很高。低质量的 ATAC 数据会直接影响 pycisTopic 主题建模的质量,进而降低调控网络推断的准确性。建议在分析前进行充分的质控,包括 TSS 富集、核小体信号、片段长度分布等指标。
2. 双组学数据的必要性:SCENIC+ 的核心优势在于整合 RNA 和 ATAC 两个组学层面的证据。输入对象必须同时包含 RNA 和 ATAC Assay,否则分析无法进行。
3. 计算资源需求:SCENIC+ 完整流程(pycisTopic + cisTarget + 网络推断)对内存和 CPU 要求较高。对于大规模数据集(> 50K 细胞),建议开启降采样以控制计算资源消耗。
4. 物种匹配:物种参数决定 cisTarget motif 数据库的选择。错误的物种设置会导致 motif 富集分析失败。请确认物种参数与实验样本一致。
5. eRegulon 过滤阈值:TF_eRegulon_cor、AUC_Gene_Region_cor 和 min_target_genes 三个阈值共同决定最终保留的 eRegulon 数量。建议先使用默认阈值,再根据结果质量调整。
6. RSS 解读需谨慎:RSS 反映的是相对特异性而非绝对活性。高 RSS 值表示该 eRegulon 在特定细胞类型中活性最强,但不代表其他细胞类型中完全没有活性。应结合 TF 表达水平和其他调控证据综合判断。
7. 结果解读需结合生物学知识:SCENIC+ 推断的是统计学上的调控关系,需要结合已知的生物学知识和文献验证。推断出的调控关系可能是直接或间接的,也可能存在细胞状态依赖的调控模式。
常见问题解答(FAQ)
Q1:SCENIC+ 与传统 SCENIC 有什么区别?
A:主要区别在于数据整合层面:
- 传统 SCENIC:仅基于 scRNA-seq 数据,通过基因共表达推断 TF–靶基因关系,假阳性率较高
- SCENIC+:同时利用 scRNA-seq 和 scATAC-seq 数据,在 RNA 表达和染色质可及性两个层面共同验证调控关系,显著降低假阳性
- eRegulon 概念:SCENIC+ 引入 extended Regulon(eRegulon)概念,将 TF、调控元件(Region)和靶基因(Gene)关联为完整调控单元
Q2:为什么我的分析结果中 eRegulon 数量很少?
A:可能的原因包括:
- 细胞数量过少:导致统计功效不足,建议增加细胞数量或降低过滤阈值
- 过滤阈值过严格:尝试降低 TF_eRegulon_cor 或 AUC_Gene_Region_cor 阈值
- min_target_genes 设置过高:降低该阈值可保留更多靶基因数量较少的 eRegulon
- ATAC 数据质量不佳:低质量 ATAC 数据导致 pycisTopic 主题建模失败,建议检查 TSS 富集等质控指标
Q3:如何选择合适的 n_topics 参数?
A:n_topics 控制 pycisTopic 主题建模的主题数量:
- 默认值 40:适用于大多数数据集
- 较小值(20–30):适合细胞类型较少、调控结构简单的数据
- 较大值(60–100):适合细胞类型丰富、调控结构复杂的数据
- 主题数过多会增加计算量且可能引入噪声,过少则可能遗漏重要的调控模块
Q4:RSS 评分为负值是什么意思?
A:RSS 评分可以为负值,表示该 eRegulon 在该细胞类型中的活性低于背景水平。只有正值 RSS 才有生物学意义(表示特异性富集),负值通常被忽略。
Q5:SCENIC+ 分析结果可以与哪些下游分析整合?
A:SCENIC+ 结果可以与多种分析整合:
- Peak2Gene 分析:将 SCENIC+ 推断的调控网络与 Peak2Gene 分析的 peak–gene 关联进行交叉验证
- Motif 分析:将 eRegulon 的 TF 与 Motif 富集分析结果进行匹配,验证 TF 结合位点的活性
- 拟时序分析:将 eRegulon AUC 活性映射到 Monocle3 轨迹上,揭示调控网络的时序动态
- 差异分析:将细胞类型特异性 eRegulon 与差异表达/差异可及性分析结果整合,锁定核心调控因子
Q6:direct 和 extended eRegulon 有什么区别?
A:
- Direct eRegulon:仅包含 TF 直接调控的靶基因(TF 结合位点位于靶基因附近)
- Extended eRegulon:包含直接调控和间接调控的靶基因(TF 结合位点可能位于较远区域)
- 推荐使用:通常建议使用 direct eRegulon 进行主要分析,因为其假阳性率更低;extended eRegulon 可用于补充探索间接调控关系
方法
参考资料
[1] FANTL V, BRUSSELMANS J, LU W, et al. SCENIC+: single-cell multiomic inference of enhancers and gene regulatory networks[J]. Nature methods, 2023, 20(8): 1154-1164.
[2] AENTS I, BRUSSELMANS J, HU Y, et al. pyCisTopic: cis-regulatory topic modeling on single-cell ATAC-seq data[J]. Nature methods, 2022, 19(12): 1625-1634.
[3] MARIN I, FERRY M, KUMAR M S, et al. SCENIC: single-cell regulatory network inference and clustering[J]. Nature methods, 2018, 15(11): 1011-1014.
