Skip to content

单细胞 scATAC-seq & scRNA-seq 双组学高级分析:TF–Peak–Gene 三元组分析

作者: SeekGene
时长: 17 分钟
字数: 4.7k 字
更新: 2026-07-10
阅读: 0 次
SeekSoul Online

前言

TIP

TF–Peak–Gene 三元组(Trios)分析是单细胞多组学调控网络研究的核心功能单元。其目标是:在特定细胞状态下,系统识别"哪些 TF"通过结合"哪些调控 Peak",最终调控了"哪些 Gene",从而重建具有生物学解释力的 TF → Peak → Gene 调控逻辑链条。

TF–Peak–Gene 三元组将三个层面的分子证据整合为一个完整的调控单元:

  • TF(调控发起者):转录因子通过识别并结合靶 DNA 上的特征性 Motif 基序,发起特异性调控。
  • Peak(调控媒介):代表染色质开放区域,常富集于增强子、启动子等顺式调控元件;其可及性是 TF 发挥功能的物理前提。
  • Gene(功能输出):基因表达变化是上游调控事件在转录层面的最终体现。

本篇文档旨在为单细胞多组学研究者提供一份详尽的 TF–Peak–Gene 三元组技术指南,内容涵盖其基本原理、在 SeekSoul Online 云平台上的操作方法、结果解读及常见问题,帮助您快速掌握并应用该工具。

TF–Peak–Gene 三元组理论基础

核心原理

TF–Peak–Gene 三元组分析的核心思想是:整合 Peak2Gene 共变性链接、Motif–Peak 物理结合证据、TF 表达水平、TF 染色质活性(chromVAR)四个层面的多维证据,通过严苛的多维度阈值过滤,构建高置信度的 TF → Peak → Gene 调控逻辑链条。

与仅基于共表达或仅基于 Peak2Gene 相关性的方法相比,Trios 分析的优势在于引入了多重独立验证:

  1. 物理结合证据(Motif–Peak 空间重叠):通过基因组空间比对,确认 TF 的结合 Motif 是否物理上落在目标 Peak 内部。
  2. 表达共变性(TF–Gene 相关性):确认 TF 的 mRNA 表达与靶基因表达是否在细胞间具有显著相关性。
  3. 活性–表达一致性(TF 活性–表达相关性):确认 TF 的染色质结合活性(chromVAR 推断)与其 mRNA 表达水平是否一致,排除非功能性结合。
  4. 活性驱动靶基因(TF 活性–靶基因相关性):确认 TF 的染色质结合活性是否真正驱动了靶基因的转录变化。

关键算法与流程

Trios 分析包括以下关键步骤:

  1. 初始三元组组装:基于 Peak2Gene 链接结果,通过基因组空间重叠比对(findOverlaps),将 Motif–Peak 结合关系与 Peak–Gene 调控链接关联,构建初始 TF–Peak–Gene 三元组
  2. 多维统计检验:分别计算 TF–Gene 表达相关性、TF 活性–表达一致性、TF 活性–靶基因相关性,并计算综合调控强度评分(Linkage Score)
  3. Linkage Score 计算:对同一 TF–Gene 对的所有关联 Peak,计算 (R2×Motif Score),量化多点联合调控的总强度
  4. 多维阈值过滤:通过 Motif 亲和力、三重相关性及显著性、Linkage Score 等多个维度的联合过滤,保留高置信度 Trios

云平台操作指南

在云平台上,TF–Peak–Gene 三元组分析流程被设计得直观易用。本分析依赖前期 Peak2Gene 分析的产出作为输入。

分析前的准备

TIP

TF–Peak–Gene 三元组分析对输入数据有特定要求。在开始分析前,请务必确认:

  1. Peak2Gene 分析已完成:本分析依赖 Peak2Gene 模块输出的 Gene2PeakLinks.xls 文件作为输入。
  2. Motif 注释已添加:输入的 Seurat 对象必须已完成 AddMotifs 操作,包含完整的 Motif 序列注释和基因组位置信息。
  3. chromVAR 活性已计算:输入对象需包含 chromVAR 推断的 TF 活性矩阵(用于计算 TF 活性–表达一致性)。
  4. 数据质量:确保 ATAC 和 RNA 数据经过充分质控,低质量数据会导致三元组推断不准确。

参数详解

下表详细列出了云平台 TF–Peak–Gene 三元组分析模块的主要参数及其说明。

参数名称说明
任务名称本次分析的任务名称,需以英文字母开头,可包含英文字母、数字、下划线和中文。
物种物种信息,用于 TF 命名大小写转换及下游 Motif 数据库匹配(human 或 mouse)。
分组因子细胞分群列名,用于热图按细胞群分组展示。
细胞类型要分析的细胞类型。
筛选因子样品信息的列名。
筛选对象要分析的样品名称。
Motif Score 阈值最小 Motif Score 阈值,用于过滤低亲和力的 TF–Peak 结合,默认为 10.0。设为 0 则不过滤。
TF-Gene 相关性阈值最小 TF–Gene 表达相关性绝对值阈值,用于筛选表达水平上具有共变性的 TF–靶基因对,默认为 0.2。
TF 活性-表达一致性阈值最小 TF 活性与表达相关性绝对值阈值,用于确保 TF 的染色质结合活性与其 mRNA 表达水平一致,默认为 0.2。
TF 活性-靶基因相关性阈值最小 TF 活性与靶基因表达相关性绝对值阈值,用于确保 TF 的染色质结合活性驱动了靶基因的转录变化,默认为 0.2。
P 值阈值最大相关性 P-value 阈值,用于三重相关性的显著性过滤,默认为 0.05。
Downsample是否在分析前对细胞进行降采样以节省计算资源,默认为 TRUE。
Downsample_num降采样数量,每个细胞亚群最多保留的细胞数,仅在降采样开启时生效,默认为 1000。

重要注意事项

TIP

  • 依赖 Peak2Gene 输出:本分析必须以 Peak2Gene 模块的输出(Gene2PeakLinks.xlsoutput.rds)作为输入,不能独立运行。请确保 Peak2Gene 分析已正确完成。
  • Motif 注释必要性:输入的 Seurat 对象必须已完成 AddMotifs 操作。如果 Motif 注释缺失,将无法建立 TF–Peak 物理结合关系,三元组组装会失败。
  • chromVAR 活性必要性:TF 活性–表达一致性和 TF 活性–靶基因相关性两个维度的计算依赖 chromVAR 推断的 TF 活性矩阵。若输入对象中缺少 chromVAR 结果,这两个维度会被跳过,仅基于剩余维度进行过滤。
  • 多维过滤阈值平衡:过严格的阈值可能保留的 Trios 过少;过宽松的阈值可能引入假阳性。建议先使用默认阈值,再根据结果调整。
  • Linkage Score 动态阈值:平台会自动计算所有 TF–Gene 对的 Linkage Score 分布,并选取前 10%(90% 分位数)作为过滤阈值,仅保留调控效应最显著的核心网络。
  • 负相关的生物学解读:TF–Gene 或 TF 活性–靶基因的"负相关"不能直接等同于"直接物理抑制",可能是由于发育轨迹上的时间错位或 TF 激活了某个中间抑制因子(间接效应)造成的。确凿的调控方向仍需实验验证。
  • 计算资源需求:Trios 分析涉及多维统计检验和全基因组 Motif 空间比对,计算量较大。对于大规模数据集,建议开启降采样。

操作流程

  1. 进入分析模块:在云平台导航至"高级分析"模块,选择"TF–Peak–Gene 三元组"。
  2. 创建新任务:为您的分析任务命名,并选择要分析的样本或项目。
  3. 配置参数:根据上述指南,选择细胞类型、物种、各相关性阈值等参数。
  4. 提交任务:确认参数无误后,点击"提交"按钮,等待分析完成。
  5. 查看结果:分析结束后,在任务列表中查看生成的分析报告和结果文件,包括 Trios 三元组表格、调控散点图、共变性热图、调控网络图等。

结果解读

TF–Peak–Gene 三元组分析的分析报告包含丰富的图表和数据文件,以下是对核心结果的详细解读。

核心 TF 筛选与靶基因调控散点图

平台自动计算每个 TF 的总调控强度(Total Linkage Score),挑选排名最靠前的核心 TF(Hub TFs),并绘制 TF–靶基因调控散点图。

图表解读

  • 横轴(TF 活性–靶基因相关性):反映 TF 的染色质结合活性与靶基因表达的相关性,体现调控的方向与效应。
  • 纵轴(Linkage Score):反映综合物理调控强度,数值越高表示调控证据越确凿。
  • 高亮标记:位于右上角(正相关 + 高 Linkage Score)和左上角(负相关 + 高 Linkage Score)的点为通过双阈值筛选的核心靶基因,分别代表推断的激活型和抑制型调控关系。

分析要点

  1. 核心靶基因识别:同时具有高相关性绝对值和高 Linkage Score 的靶基因是该 TF 最可信的调控靶标。
  2. 调控方向推断:正相关提示激活型调控,负相关可能暗示抑制型调控,但需结合生物学知识谨慎解读。

Trios 调控共变性热图

针对核心 TF,绘制其所有靶基因在单细胞层面的表达共变性热图,按细胞类型分组展示。

图表解读

  • 行(基因):该 TF 的所有高置信度靶基因
  • 列(细胞):按细胞类型分组排列,顶部颜色条标识细胞类型
  • 颜色梯度:表示基因表达量的 Z-score 标准化值,红色表示高表达,蓝色表示低表达
  • 聚类:行和列均进行层次聚类,揭示靶基因的共表达模块和细胞类型间的表达差异

分析要点

  1. 共表达模块识别:在热图中呈现相似表达模式的靶基因群,可能参与同一生物学通路或受共同调控。
  2. 细胞类型特异性:通过观察不同细胞类型间的表达差异,可识别 TF 的细胞类型特异性调控模式。

核心 TF 靶基因群的亚群特异性表达热图

针对单个核心 TF,绘制其靶基因群在各细胞亚群中的特异性表达热图,直观展示调控活性的细胞类型分布。

图表解读

  • 行(基因):该 TF 的靶基因
  • 列(细胞类型):各细胞亚群
  • 颜色梯度:表示靶基因在各细胞类型中的平均表达水平(Z-score 标准化)
  • 特异性模式:在某些细胞类型中高表达的靶基因群,代表该 TF 在该细胞类型中的特异性调控程序

TF–Target 调控网络图

将核心 TF 与其高置信度靶基因的调控关系以网络图形式可视化,展示 TF 的调控靶标拓扑结构。

图表解读

  • 中心节点(大圆):核心 TF
  • 外围节点(小圆):靶基因,颜色标识调控方向(红色=激活,蓝色=抑制)
  • 连线:TF–靶基因调控关系,连线粗细与 Linkage Score 成正比

分析要点

  1. Hub TF 识别:调控靶基因数量多且 Linkage Score 高的 TF 是调控网络的关键枢纽。
  2. 调控方向分布:通过观察激活型与抑制型靶基因的比例,可推断该 TF 的整体调控模式。

全局多转录因子协同调控网络图

将所有核心 TF 及其靶基因的调控关系整合为一张全局网络图,揭示多 TF 之间的协同调控关系。

图表解读

  • 节点:大节点表示 TF,小节点表示靶基因;不同 TF 用不同颜色区分
  • 连线:TF–靶基因调控关系
  • 共享靶基因:被多个 TF 共同调控的靶基因位于网络中心,可能处于多条调控通路的交汇处

分析要点

  1. 协同调控识别:共同调控同一靶基因群的多个 TF 可能形成协同调控模块。
  2. 调控枢纽:处于网络中心、被多个 TF 共同靶向的基因,可能是关键的细胞命运决定基因。
  3. 功能冗余性:多个 TF 靶向相同靶基因群,可能暗示功能冗余或备份调控机制。

结果文件列表

文件名内容说明
TF_Peak_Gene_Trios_all.txt完整三元组表格,包含所有初始组装的 TF–Peak–Gene 组合及其多维统计指标。
TF_Peak_Gene_Trios_all_filter.txt高置信度三元组表格,经过多维阈值过滤后的核心调控关系。
TF_Targets_Scatters/核心 TF 靶基因调控散点图目录(每个 TF 一个 PDF/PNG)。
TF_Targetcds_Heatmaps/核心 TF 靶基因共变性热图目录(每个 TF 一个 PDF/PNG)。
TF_Targets_Networks/核心 TF 调控网络图目录(每个 TF 一个 PDF/PNG)。
All_TFs_network.pdf/png全局多转录因子协同调控网络图。

注意事项

1. 依赖上游分析:TF–Peak–Gene 三元组分析必须依赖 Peak2Gene 模块的输出结果。请确保先完成 Peak2Gene 分析,并将 Gene2PeakLinks.xlsoutput.rds 作为输入传入。

2. Motif 注释和 chromVAR 活性的必要性:输入的 Seurat 对象必须包含 Motif 注释(AddMotifs)和 chromVAR TF 活性矩阵。缺少这两者会导致部分维度无法计算,影响过滤效果。

3. 多维阈值平衡:Motif Score、三重相关性及 Linkage Score 等多个阈值共同决定最终保留的 Trios 数量。建议先使用默认阈值,再根据结果质量调整。过严格的阈值可能丢失真实调控关系,过宽松则可能引入假阳性。

4. Linkage Score 的动态阈值:平台采用自适应动态阈值(90% 分位数)进行 Linkage Score 过滤,确保保留的 Trios 始终是调控效应最显著的头部核心网络。

5. 负相关解读需谨慎:TF–Gene 或 TF 活性–靶基因的"负相关"不能直接等同于"直接物理抑制"。它可能是由于发育轨迹上的时间错位、TF 激活了某个中间抑制因子(间接效应)等造成的。确凿的调控方向仍需实验验证。

6. 细胞数量要求:TF–Gene 相关性和 TF 活性–靶基因相关性的计算需要足够的细胞数量以保证统计功效。细胞过少会导致相关性估计不稳定。

7. 结果解读需结合生物学知识:Trios 分析推断的是统计学上的调控关系,需要结合已知的生物学知识和文献验证。推断出的调控关系可能是直接或间接的,也可能存在细胞状态依赖的调控模式。

常见问题解答(FAQ)

Q1:Trios 分析与 Peak2Gene 分析有什么区别?

A:两者关注的调控层面不同,但结果互补:

  • Peak2Gene:仅关注 Peak 与 Gene 之间的共变性关系,回答"哪些 Peak 可能调控哪些 Gene"
  • Trios:在 Peak2Gene 基础上进一步整合 TF–Peak 物理结合、TF 表达、TF 活性等多维证据,回答"哪些 TF 通过哪些 Peak 调控了哪些 Gene"
  • 整合关系:Trios 依赖 Peak2Gene 的输出作为输入,是 Peak2Gene 分析的下游延伸

Q2:为什么我的分析结果中高置信度 Trios 数量很少?

A:可能的原因包括:

  • 细胞数量过少:导致相关性估计不稳定,建议增加细胞数量
  • 过滤阈值过严格:尝试降低相关性阈值(如 0.2 → 0.1)或降低 Motif Score 阈值
  • chromVAR 活性缺失:若输入对象中缺少 chromVAR 结果,活性–表达一致性和活性–靶基因相关性两个维度会被跳过,过滤效果会受影响
  • Motif 注释不完整:确保输入对象已完成 AddMotifs 操作

Q3:Linkage Score 是怎么计算的?

A:Linkage Score 计算公式为:(R2×Motif Score),其中:

  • R2:Peak2Gene 相关性(peak_gene_cor)的平方,即决定系数,代表 Peak 可及性能解释靶基因表达变异的比例
  • Motif Score:TF 在该 Peak 上的序列结合亲和力打分
  • :对同一 TF–Gene 对的所有关联 Peak 求和,量化多点联合调控的总强度

Linkage Score 越高,代表该 TF 调控目标基因的综合物理证据越确凿。

Q4:负相关 Trios 是否代表抑制型调控?

A:不能直接下结论。负相关可能由以下原因导致:

  • TF 确实直接抑制靶基因转录
  • TF 激活了某个中间抑制因子,间接导致靶基因下调(间接效应)
  • 发育轨迹上的时间错位,TF 与靶基因处于分化的不同阶段
  • 统计噪声或批次效应

建议结合已知生物学知识和文献综合判断,必要时进行实验验证。

Q5:Trios 分析结果可以与哪些下游分析整合?

A:Trios 结果可以与多种分析整合:

  • SCENIC+ 分析:将 Trios 的高置信度调控关系与 SCENIC+ 推断的 eRegulon 进行交叉验证
  • Motif 富集分析:将 Trios 涉及的 Peak 集合进行 Motif 富集,验证 TF 结合位点的活性
  • 差异分析:将高置信度 Trios 与差异表达/差异可及性分析结果整合,锁定疾病或状态特异性的核心调控因子
  • 功能富集分析:对 Trios 涉及的靶基因进行 GO/KEGG 富集,揭示调控的生物学功能

方法

Trios 方法下载

参考资料

[1] GRANJA J M, KLEMM S, MCGEOUGH L J, et al. Single-cell multiomic analysis identifies regulatory programs in mixed-phenotype acute leukemia[J]. Nature biotechnology, 2019, 37(12): 1458-1465.

[2] STUART T, SRIVASTAVA A, MADAD S, et al. Single-cell chromatin state analysis with Signac[J]. Nature methods, 2021, 18(11): 1333-1341.

[3] SCHEP A N, WU B, BUENROSTRO J D, et al. chromVAR: inferring transcription-factor-associated accessibility chromatin using single-cell data[J]. Genome biology, 2017, 18: 180.

0 条评论·0 条回复