Skip to content

单细胞 scATAC-seq & scRNA-seq 双组学高级分析:SCENIC+ 调控网络分析

作者: SeekGene
时长: 20 分钟
字数: 5.4k 字
更新: 2026-07-20
阅读: 0 次
SeekSoul Online

前言

TIP

SCENIC+(Single-Cell Regulatory Network Inference and Clustering Plus)是一种整合 scRNA-seq 与 scATAC-seq 数据的转录调控网络推断框架。其核心优势在于利用染色质可及性信息约束 TF–靶基因关系的推断,相比传统 SCENIC 方法显著降低假阳性连接,构建"转录因子 → 顺式调控元件 → 靶基因"的完整调控网络。

在单细胞多组学研究中,仅依赖基因共表达推断 TF–靶基因关系往往存在大量假阳性。SCENIC+ 通过整合 scATAC-seq 的染色质可及性信息,从两个独立的组学层面(RNA 表达 + ATAC 可及性)共同验证 TF 的调控关系,大幅提升调控网络的可靠性。平台会自动完成从 pycisTopic 主题建模、cisTarget 数据库构建、调控网络推断到 eRegulon 质量评估与可视化的全部流程。

SCENIC+ 的核心功能

  1. 调控网络推断 结合基因共表达(RNA)与染色质可及性(ATAC)双重证据,推断转录因子与靶基因之间的调控关系,构建高置信度的 eRegulon(extended Regulon)。

  2. eRegulon 质量评估与过滤 通过 TF 表达–AUC 相关性、Gene-based 与 Region-based AUC 一致性等多维度指标,自动筛选高质量调控关系,剔除假阳性连接。

  3. Regulon 特异性评分(RSS) 计算每个 eRegulon 在各细胞类型中的特异性富集程度,识别细胞类型特异性调控因子,帮助解析细胞命运决定的调控逻辑。

  4. 多模态联合可视化 基于 eRegulon AUC 矩阵进行 UMAP/t-SNE 降维,将 TF 表达、Gene AUC、Region AUC 映射到同一底图,并提供热图–点图联合展示,全面呈现调控网络的结构与动态。

本篇文档旨在为单细胞多组学研究者提供一份详尽的 SCENIC+ 技术指南,内容涵盖其基本原理、在 SeekSoul Online 云平台上的操作方法、结果解读及常见问题,帮助您快速掌握并应用该工具。

SCENIC+ 理论基础

核心原理

SCENIC+ 分析的核心思想是:利用 scATAC-seq 的染色质可及性信息作为独立证据约束 TF–靶基因关系的推断,仅保留在 RNA 和 ATAC 两个组学层面均获支持的调控连接,从而显著提升调控网络的精度和可解释性。

从 SCENIC 到 SCENIC+

传统 SCENIC 方法仅基于 scRNA-seq 数据推断调控网络,存在以下局限:

  • 基因共表达可能反映间接调控或技术噪音
  • 缺乏表观遗传层面的独立验证
  • 推断的 regulon 假阳性率较高

SCENIC+ 通过引入 scATAC-seq 数据解决了这些问题:

  • 顺式调控元件(cis-regulatory element):从 ATAC 数据中识别 TF 结合位点附近的开放区域
  • eRegulon:将 TF、调控元件(Region)、靶基因(Gene)三者关联为一个完整的调控单元
  • 双重验证:只有当 TF 的靶基因在 RNA 层面呈现共表达、且其结合区域在 ATAC 层面呈现可及性时,调控关系才被保留

SCENIC+ 的完整分析流程

SCENIC+ 分析包含 5 个主要步骤:

  1. 数据转换(step0):将 Seurat 对象中的 RNA 和 ATAC counts 矩阵转换为 AnnData (h5ad) 格式
  2. pycisTopic 主题建模(step1):对 scATAC 数据进行 LDA 主题建模,识别共开放区域模块
  3. cisTarget 数据库构建(step2):基于 consensus regions 构建 motif 打分数据库
  4. 调控网络推断(step3):整合 RNA + ATAC 证据,推断 TF–调控元件–靶基因关系
  5. 后处理与可视化(step4):eRegulon 质量评估、过滤、RSS 计算与多模态可视化

关键算法与流程

对于每个推断出的 eRegulon,SCENIC+ 会进行以下关键验证:

  1. TF 表达–AUC 相关性:计算 TF 的 RNA 表达水平与其 eRegulon AUC 活性评分之间的 Pearson 相关性,筛选出具有显著正相关或负相关的调控关系
  2. Gene-based 与 Region-based AUC 一致性:要求同一 eRegulon 在基因表达层面和染色质可及性层面的 AUC 评分具有较高相关性,确保调控关系在两个组学层面均获支持
  3. 靶基因数量过滤:剔除靶基因数量过少的 eRegulon,保留具有足够信息量的高质量调控单元

云平台操作指南

在云平台上,SCENIC+ 分析流程被设计得直观易用。平台会自动完成从 pycisTopic 主题建模、cisTarget 数据库构建到调控网络推断的全部计算步骤,用户仅需配置基本参数即可查看结果。

分析前的准备

TIP

SCENIC+ 分析对输入数据有较高要求。在开始分析前,请务必确认:

  1. 数据已完成预处理:您的单细胞 ATAC 和 RNA 数据已经过标准的质控、降维、聚类和细胞类型注释。
  2. 双组学数据完整:确保输入 Seurat 对象同时包含 RNA 和 ATAC 两个 Assay,否则无法进行多组学联合推断。
  3. 物种信息正确:SCENIC+ 需要匹配正确的 motif 数据库(human/mouse),请确认物种参数与数据一致。
  4. 细胞数量充足:SCENIC+ 对细胞数量有一定要求,细胞过少可能导致调控网络推断不稳定。

参数详解

下表详细列出了云平台 SCENIC+ 分析模块的主要参数及其说明。

参数名称说明
任务名称本次分析的任务名称,需以英文字母开头,可包含英文字母、数字、下划线和中文。
分组因子细胞分群列名。
细胞类型要分析的细胞类型。
筛选因子样品信息的列名。
筛选对象要分析的样品名称。
物种物种信息,用于选择对应的 cisTarget motif 数据库(human 或 mouse)。
n_topicspycisTopic LDA 主题建模的主题数量,默认 40。主题数越多,识别的共开放区域模块越精细,但计算量也相应增大。
TF_eRegulon_corTF 表达与 eRegulon AUC 相关性的绝对值阈值,默认 0.5。仅保留相关性高于该阈值的 eRegulon。
AUC_Gene_Region_corGene-based 与 Region-based AUC 相关性的最低阈值,默认 0.5。用于筛选在两个组学层面均一致的 eRegulon。
min_target_geneseRegulon 最少靶基因数,默认 10。过滤靶基因数量过少的低信息量调控单元。
Downsample是否在分析前对细胞进行降采样以节省计算资源,默认为 TRUE。
Downsample_num降采样数量,每个细胞亚群最多保留的细胞数,仅在降采样开启时生效,默认为 1000。

重要注意事项

TIP

  • 数据质量要求:SCENIC+ 对输入数据质量要求较高。低质量的 ATAC 数据(如 TSS 富集不足、片段长度分布异常)会直接影响 pycisTopic 主题建模的质量,进而降低调控网络推断的准确性。
  • 双组学数据必要性:SCENIC+ 的核心优势在于整合 RNA 和 ATAC 两个组学层面的证据。若输入对象缺少 RNA 或 ATAC Assay,分析将无法进行或结果质量显著下降。
  • 计算资源需求:SCENIC+ 的完整流程(尤其是 step1 pycisTopic 和 step3 网络推断)对内存和 CPU 要求较高。降采样参数可有效控制资源消耗,但可能损失部分稀细细胞亚群的调控信息。
  • 物种匹配:物种参数直接决定 motif 数据库的选择,错误的物种设置会导致 motif 富集分析失败或结果不可靠。
  • eRegulon 过滤:平台会自动进行多维度质量过滤。过严格的阈值可能保留的 eRegulon 过少;过宽松的阈值可能引入假阳性。建议先使用默认阈值,再根据结果调整。
  • RSS 解读:Regulon 特异性评分(RSS)反映 eRegulon 在各细胞类型中的相对特异性,而非绝对活性。高 RSS 值表示该 eRegulon 在特定细胞类型中活性最强,但不代表其他细胞类型中完全没有活性。

操作流程

  1. 进入分析模块:在云平台导航至"高级分析"模块,选择"SCENIC+"。
  2. 创建新任务:为您的分析任务命名,并选择要分析的样本或项目。
  3. 配置参数:根据上述指南,选择细胞类型、物种、过滤阈值等参数。
  4. 提交任务:确认参数无误后,点击"提交"按钮,等待分析完成。SCENIC+ 完整流程通常需要较长时间,请耐心等待。
  5. 查看结果:分析结束后,在任务列表中查看生成的分析报告和结果文件,包括 eRegulon 质量评估图、RSS 热图、降维可视化等。

结果解读

SCENIC+ 的分析报告包含丰富的图表和数据文件,以下是对核心结果的详细解读。

TF 表达–eRegulon AUC 相关性散点图

该图展示了 TF 的 RNA 表达水平与其 eRegulon AUC 活性评分之间的相关性分布,用于评估调控关系的可靠性。分别展示 direct 和 extended 两类 eRegulon 的结果。

图表解读

  • 横轴:TF 表达量(pseudobulk 均值或标准化值)
  • 纵轴:eRegulon AUC 活性评分
  • 颜色:标识通过/未通过相关性阈值(默认 |cor| > 0.5)的 eRegulon
  • 散点分布:每个点代表一个 eRegulon,高相关性的点分布在左上和右下角(正/负相关),低相关性的点聚集在中部

分析要点

  1. 相关性阈值:只有 TF 表达与 AUC 相关性绝对值超过阈值的 eRegulon 被保留,确保调控关系具有表达层面的支持。
  2. 正相关 vs 负相关:正相关表示 TF 表达升高时靶基因活性增强(激活型调控),负相关可能暗示抑制型调控。

eRegulon 相似性双面板热图

该双面板热图从连续值(AUC 相关性)和集合(靶基因交集)两个维度评估 eRegulon 之间的功能相似性。

图表解读

  • 左侧 AUC 相关性热图:基于各 eRegulon 在细胞间的 AUC 活性模式计算 Pearson 相关性,反映功能相似性。高相关性的 eRegulon 可能调控同一通路或处于同一调控层级。
  • 右侧 Jaccard 交集热图:基于各 eRegulon 的靶基因集合计算 Jaccard 系数,反映调控靶标的重叠程度。高交集的 eRegulon 可能具有功能冗余性或互为备份。
  • 聚类排序:两个热图共享相同的层次聚类排序,功能相似的 eRegulon 在热图中相邻展示。

分析要点

  1. 联合解读:如果两个 eRegulon 在两种热图中都高度相似,说明它们可能代表同一调控轴的不同方面。
  2. 间接调控识别:如果仅在 AUC 热图中相似而靶基因不重叠,可能暗示间接调控关系。

Regulon 特异性评分(RSS)

RSS 衡量每个 eRegulon 在不同细胞类型中的特异性富集程度,是识别细胞类型特异性调控因子的关键指标。

图表解读

  • 热图颜色:表示 RSS 得分,颜色越深代表该 eRegulon 在对应细胞类型中的特异性越强。
  • 行(eRegulon):按特异性最高的细胞类型聚类排序,便于识别细胞类型特异的调控模块。
  • 列(细胞类型):展示每个 eRegulon 在各细胞类型中的特异性分布。

分析要点

  1. 细胞类型特异性调控因子:在某一种细胞类型中 RSS 显著高于其他类型的 eRegulon,可能是驱动该细胞类型特性的核心调控因子。
  2. 跨细胞类型共享调控:在多种细胞类型中均有较高 RSS 的 eRegulon,可能参与基础调控过程。

eRegulon AUC 联合降维图

基于 eRegulon AUC 矩阵进行 UMAP/t-SNE 降维,将 TF 表达、Gene AUC、Region AUC 三种模态的信息映射到同一底图,全面展示调控异质性。

图表解读

  • 底图:基于 Combined(Gene-based + Region-based)AUC 矩阵的 UMAP 降维
  • 颜色映射:每个子图展示一种特征(TF 表达、Gene AUC 或 Region AUC)在细胞上的分布
  • 模态对比:通过对比同一 TF 在三种模态下的分布模式,可判断调控主要发生在转录水平还是表观遗传水平

分析要点

  1. 模态一致性:若某 TF 在三种模态下的分布模式高度一致,说明调控关系在转录和表观遗传两个层面均获支持。
  2. 调控异质性:降维图中相邻的细胞群具有相似的调控活性模式,可能属于同一发育谱系或功能模块。

eRegulon UMAP 单细胞映射

将每个 eRegulon 的 AUC 活性评分映射到 UMAP 空间,按细胞类型分面展示,直观呈现调控活性的空间分布。

图表解读

  • 每个面板:展示一个 eRegulon 在 UMAP 上的活性分布,按细胞类型着色
  • 颜色梯度:从蓝色(低活性)到红色(高活性),标识该 eRegulon 在不同细胞中的活性水平
  • 细胞类型特异性:通过观察活性在不同细胞类型间的分布差异,可直观验证 RSS 结果

热图–点图联合展示(heatmap_dotplot)

SCENIC+ 内置的热图–点图联合展示,以颜色表示 Gene-based AUC、以点大小表示 Region-based AUC,在同一张图中同时展示两种模态的调控活性。

图表解读

  • 颜色通道(Gene-based AUC):反映靶基因表达层面的调控活性
  • 点大小通道(Region-based AUC):反映染色质可及性层面的调控活性
  • 行(eRegulon):按调控活性排序
  • 列(细胞类型):展示每个 eRegulon 的细胞类型特异性模式

分析要点

  1. 双模态验证:颜色和点大小同时显著的 eRegulon–细胞类型对,代表在 RNA 和 ATAC 两个层面均获支持的高置信度调控关系。
  2. 细胞类型特异性识别:在某列中颜色和点大小均显著但在其他列不显著的 eRegulon,是该细胞类型的特异性调控因子。

RSS–表达量联合点图

自定义的 RSS–表达量联合点图,整合 RSS 打分与 TF 表达 Z-score,构建综合调控特征图谱。

图表解读

  • RSS 打分:反映 eRegulon 在各细胞类型中的特异性
  • TF 表达 Z-score:反映 TF 本身的表达水平
  • 联合解读:高 RSS + 高表达的 TF 是该细胞类型的核心驱动因子;高 RSS + 低表达的 TF 可能是潜在调控因子(表达量虽低但特异性强)

结果文件列表

文件名内容说明
scplusmdata.h5muSCENIC+ pipeline 输出的最终 MuData 对象(含 direct/extended eRegulon 的 AUC 矩阵)。
ctx_results.hdf5cisTarget motif 富集分析结果。
dem_results.hdf5差异可及性分析结果。
cistromes_direct.h5adDirect eRegulon 的 cistrome(TF–peak 关联)。
cistromes_extended.h5adExtended eRegulon 的 cistrome。
AUCell_direct.h5muDirect eRegulon 的 AUCell 活性矩阵。
AUCell_extended.h5muExtended eRegulon 的 AUCell 活性矩阵。
direct_e_regulon_metadata_raw.csvDirect eRegulon 元数据原始表格。
extended_e_regulon_metadata_raw.csvExtended eRegulon 元数据原始表格。
TF_eRegulon_cor_Direct_vs_Extended.pdfTF 表达–AUC 相关性散点图(Direct vs Extended)。
correlation_and_intersection_heatmaps.pdfeRegulon 相似性双面板热图(AUC 相关性 + Jaccard 交集)。
RSS_matrix_transposed.csvRSS 评分矩阵(eRegulon × 细胞类型)。
eRegulon_combined_AUC_reduction.pdfCombined AUC 联合降维图(UMAP)。
TF_AUC_Combined_UMAP/各 eRegulon 的 UMAP 单细胞映射目录(按细胞类型分面)。
Regulon_Specificity_Score/direct_eRegulon_heatmap_dotplot.pdfDirect eRegulon 热图–点图联合展示。
Regulon_Specificity_Score/direct_eRegulon_RSS_expression_dotplot.pdfDirect eRegulon RSS–表达量联合点图。

注意事项

1. 数据质量的重要性:SCENIC+ 对输入数据质量要求很高。低质量的 ATAC 数据会直接影响 pycisTopic 主题建模的质量,进而降低调控网络推断的准确性。建议在分析前进行充分的质控,包括 TSS 富集、核小体信号、片段长度分布等指标。

2. 双组学数据的必要性:SCENIC+ 的核心优势在于整合 RNA 和 ATAC 两个组学层面的证据。输入对象必须同时包含 RNA 和 ATAC Assay,否则分析无法进行。

3. 计算资源需求:SCENIC+ 完整流程(pycisTopic + cisTarget + 网络推断)对内存和 CPU 要求较高。对于大规模数据集(> 50K 细胞),建议开启降采样以控制计算资源消耗。

4. 物种匹配:物种参数决定 cisTarget motif 数据库的选择。错误的物种设置会导致 motif 富集分析失败。请确认物种参数与实验样本一致。

5. eRegulon 过滤阈值:TF_eRegulon_cor、AUC_Gene_Region_cor 和 min_target_genes 三个阈值共同决定最终保留的 eRegulon 数量。建议先使用默认阈值,再根据结果质量调整。

6. RSS 解读需谨慎:RSS 反映的是相对特异性而非绝对活性。高 RSS 值表示该 eRegulon 在特定细胞类型中活性最强,但不代表其他细胞类型中完全没有活性。应结合 TF 表达水平和其他调控证据综合判断。

7. 结果解读需结合生物学知识:SCENIC+ 推断的是统计学上的调控关系,需要结合已知的生物学知识和文献验证。推断出的调控关系可能是直接或间接的,也可能存在细胞状态依赖的调控模式。

常见问题解答(FAQ)

Q1:SCENIC+ 与传统 SCENIC 有什么区别?

A:主要区别在于数据整合层面:

  • 传统 SCENIC:仅基于 scRNA-seq 数据,通过基因共表达推断 TF–靶基因关系,假阳性率较高
  • SCENIC+:同时利用 scRNA-seq 和 scATAC-seq 数据,在 RNA 表达和染色质可及性两个层面共同验证调控关系,显著降低假阳性
  • eRegulon 概念:SCENIC+ 引入 extended Regulon(eRegulon)概念,将 TF、调控元件(Region)和靶基因(Gene)关联为完整调控单元

Q2:为什么我的分析结果中 eRegulon 数量很少?

A:可能的原因包括:

  • 细胞数量过少:导致统计功效不足,建议增加细胞数量或降低过滤阈值
  • 过滤阈值过严格:尝试降低 TF_eRegulon_cor 或 AUC_Gene_Region_cor 阈值
  • min_target_genes 设置过高:降低该阈值可保留更多靶基因数量较少的 eRegulon
  • ATAC 数据质量不佳:低质量 ATAC 数据导致 pycisTopic 主题建模失败,建议检查 TSS 富集等质控指标

Q3:如何选择合适的 n_topics 参数?

A:n_topics 控制 pycisTopic 主题建模的主题数量:

  • 默认值 40:适用于大多数数据集
  • 较小值(20–30):适合细胞类型较少、调控结构简单的数据
  • 较大值(60–100):适合细胞类型丰富、调控结构复杂的数据
  • 主题数过多会增加计算量且可能引入噪声,过少则可能遗漏重要的调控模块

Q4:RSS 评分为负值是什么意思?

A:RSS 评分可以为负值,表示该 eRegulon 在该细胞类型中的活性低于背景水平。只有正值 RSS 才有生物学意义(表示特异性富集),负值通常被忽略。

Q5:SCENIC+ 分析结果可以与哪些下游分析整合?

A:SCENIC+ 结果可以与多种分析整合:

  • Peak2Gene 分析:将 SCENIC+ 推断的调控网络与 Peak2Gene 分析的 peak–gene 关联进行交叉验证
  • Motif 分析:将 eRegulon 的 TF 与 Motif 富集分析结果进行匹配,验证 TF 结合位点的活性
  • 拟时序分析:将 eRegulon AUC 活性映射到 Monocle3 轨迹上,揭示调控网络的时序动态
  • 差异分析:将细胞类型特异性 eRegulon 与差异表达/差异可及性分析结果整合,锁定核心调控因子

Q6:direct 和 extended eRegulon 有什么区别?

A:

  • Direct eRegulon:仅包含 TF 直接调控的靶基因(TF 结合位点位于靶基因附近)
  • Extended eRegulon:包含直接调控和间接调控的靶基因(TF 结合位点可能位于较远区域)
  • 推荐使用:通常建议使用 direct eRegulon 进行主要分析,因为其假阳性率更低;extended eRegulon 可用于补充探索间接调控关系

方法

SCENICplus 方法下载

参考资料

[1] FANTL V, BRUSSELMANS J, LU W, et al. SCENIC+: single-cell multiomic inference of enhancers and gene regulatory networks[J]. Nature methods, 2023, 20(8): 1154-1164.

[2] AENTS I, BRUSSELMANS J, HU Y, et al. pyCisTopic: cis-regulatory topic modeling on single-cell ATAC-seq data[J]. Nature methods, 2022, 19(12): 1625-1634.

[3] MARIN I, FERRY M, KUMAR M S, et al. SCENIC: single-cell regulatory network inference and clustering[J]. Nature methods, 2018, 15(11): 1011-1014.

0 条评论·0 条回复