Skip to content

单细胞 scATAC-seq & scRNA-seq 双组学标准分析:ATAC 差异可及性与调控网络分析(ATAC_DiffEnrich)

作者: SeekGene
时长: 27 分钟
字数: 7.4k 字
更新: 2026-08-12
阅读: 0 次
SeekSoul Online

前言

TIP

ATAC_DiffEnrich 分析是一种专为单细胞多组学(ATAC + RNA)数据设计的差异可及性及调控网络分析方法。其核心目标是识别细胞群间或实验组间的差异开放染色质区域,并通过"多重证据链闭环"策略向上溯源核心转录因子(TF),向下映射靶基因与功能通路。

在单细胞多组学研究中,染色质可及性的变化直接决定 TF 是否能够结合顺式调控元件(增强子、启动子等),进而启动或抑制下游基因转录。相比仅观察 RNA 表达变化,ATAC 层面的信号更接近调控发生的"起点"。

ATAC_DiffEnrich 分析不仅帮助定位差异开放区域,还能通过以下策略系统性解析调控网络:

  • 向上溯源:从差异开放区域出发,通过 Motif 富集 → chromVAR 活性 → 表达关联 → Footprint 物理确证,完成"富集-活性-表达-物理结合"的证据闭环。
  • 向下求证:将差异开放区域映射至最近靶基因,并进行 GO/KEGG 功能富集,将表观遗传变化翻译为具体的生物学过程与信号通路。

ATAC_DiffEnrich 的核心功能

  1. 差异可及性区域鉴定 通过 Wilcoxon 秩和检验,识别各细胞群间或实验组间显著差异的开放染色质区域(DiffPeaks),筛选符合显著性和效应大小的阈值条件。

  2. Motif 富集与活性分析 对差异 Peak 进行 Motif 富集分析,识别潜在上游 TF;利用 chromVAR 算法在单细胞尺度计算 Motif 活性(Deviation Score),并进行差异 TF 活性分析。

  3. 核心 TF 多维确证 通过 TF 活性与 RNA 表达的全局相关性分析、韦恩图交集筛选、Tn5 足迹分析(Footprint),完成从序列富集到物理结合的多维证据闭环。

  4. 靶基因功能映射 将差异 Peak 映射到最近基因,并执行 GO/KEGG 富集分析,将染色质可及性变化翻译为可解释的生物学结论。

本篇文档旨在为单细胞多组学研究者提供一份详尽的 ATAC_DiffEnrich 技术指南,内容涵盖其基本原理、在 SeekSoul Online 云平台上的操作方法、结果解读及常见问题,帮助您快速掌握并应用该工具。

ATAC_DiffEnrich 理论基础

核心原理

ATAC_DiffEnrich 分析的核心思想是:通过差异可及性区域作为锚点,向上溯源核心调控网络(Motif→活性→表达→Footprint),向下映射靶基因与功能通路,完成"表观遗传变化→调控机制→功能效应"的完整闭环。

表观遗传调控与寻找调控源头

在细胞分化、组织重塑及疾病进程中,基因表达改变常常由上游表观遗传事件触发。染色质可及性的变化直接决定 TF 是否能够结合顺式调控元件(增强子、启动子等),进而启动或抑制下游基因转录。相比仅观察 RNA 表达变化,ATAC 层面的信号更接近调控发生的"起点"。

向上溯源:核心调控网络解析

以单细胞 ATAC-seq 数据鉴定的差异可及性区域为锚点,通过"多重证据链闭环"策略,深度解析细胞状态转换背后的核心 TF:

  • Motif 富集与活性定量:对差异区域进行 Motif 扫描以识别潜在结合位点,并利用 chromVAR 算法在单细胞尺度对 Motif 活性(Deviation Score)进行定量评估。
  • 表达关联验证:联合 TF 的 RNA 表达量进行相关性分析,筛选出"活性变化"与"表达水平"高度一致的候选因子。
  • Footprint 物理确证:结合 Tn5 酶切插入痕迹,在染色质物理层面验证候选核心 TF 的真实结合状态。

向下求证:差异靶基因与功能映射

染色质开放区域的改变最终需转化为生物学功能。本模块将差异开放区域精确映射至其最近的基因,然后对这些最近基因进行 GO 与 KEGG 通路富集分析,从而完成对差异 Peak 生物学功能的解析。

TIP

标准分析流程

  1. 差异 Peak 筛选:定位具有生物学意义的差异可及性区域
  2. Motif 富集分析:鉴定及评估 Motif 富集和活性,预测关键 TF
  3. 核心 TF 多维确证:活性差异分析、表达-活性相关性、韦恩图交集、Footprint 物理确证
  4. 靶基因功能映射:邻近基因注释 + GO/KEGG 通路富集

关键算法与流程

ATAC_DiffEnrich 分析包括以下关键步骤:

  1. 差异 Peak 鉴定:使用 Wilcoxon 秩和检验(presto::wilcoxauc)在 ATAC assay 上识别显著差异开放区域
  2. Motif 分析AddMotifs + RunChromVAR 计算单细胞 Motif 活性;FindMotifs 对差异 Peak 做 Motif 富集
  3. TF 活性差异分析:在 chromvar assay 上做差异活性检验,鉴定显著变化的核心 TF
  4. 全局相关性计算:pseudobulk 聚合后计算 TF RNA 表达 vs Motif 活性的 Pearson 相关系数
  5. 韦恩图交集筛选:将"差异活性 TF"与"差异 Peak 富集 Motif"做交集,锁定高置信核心 TF
  6. Footprint 物理确证:对全局相关性 Top 10 的 TF 做 Tn5 足迹分析,验证真实结合状态
  7. Peak靶基因注释与富集ClosestFeature 注释 + GO/KEGG 功能富集

云平台操作指南

在云平台上,ATAC_DiffEnrich 分析流程被设计得直观易用。您无需编写代码,只需通过参数配置界面即可完成分析。

### 分析前的准备

TIP

ATAC_DiffEnrich 分析的成功与否,很大程度上取决于输入数据的质量和多组学数据的匹配度。在开始分析前,请务必确认:

  1. 数据已完成预处理:您的单细胞 ATAC 和 RNA 数据已经过标准的质控、降维、聚类和细胞类型注释。
  2. 数据匹配性:确保 ATAC 和 RNA 数据来自相同的细胞或匹配的细胞群体。
  3. 注释信息完整:确保数据中包含必要的细胞类型、样本分组等注释信息。
  4. RegionStats 步骤:确保已执行 RegionStats 步骤,注释每个 Peak 区域的 GC 含量等特征,用于后续偏置校正。

参数详解

下表详细列出了云平台 ATAC_DiffEnrich 分析模块的主要参数及其说明。

参数名称说明
任务名称本次分析的任务名称,需以英文字母开头,可包含英文字母、数字、下划线和中文。
分组因子细胞注释结果,meta 中对应的列名,用于热图按细胞类型展示。
细胞类型要分析的细胞类型。
分组比较要分析的样本名称或分组名(组间差异模式时使用)。
比较组要分析的样本组比较的样本组或分组名(组间差异模式时使用)。
对照组对照组的样本组或分组名(组间差异模式时使用)。
物种物种信息,用于选择对应的 cisTarget motif 数据库,目前该分析支持bovine、 dog、 fly、 zebrafish、 rhesus、 chimp、 pig、 xenopus、 human、 mouse、 rat、 chicken、 Arabidopsis、others 等多物种。
corTF 活性与 RNA 表达的 Pearson 相关性阈值,用于过滤高相关性 TF,默认为 0.2。
fe_cutMotif 富集倍数(fold enrichment)阈值,用于筛选显著富集的 Motif,默认为 1.5。
Downsample是否在分析前对每个细胞亚群进行随机降采样以节省内存,默认为 TRUE。
Downsample_num每个细胞亚群最多保留的细胞数,仅在降采样开启时生效,默认为 1000。
基于历史结果分析是否在分析前基于历史结果分析,有“否”和“footprint”两种选项,默认值为“否”。
历史任务名称基于历史结果分析时,指定要基于的历史任务名称。
TF对指定 TF 做 Tn5 足迹分析( footprint),验证真实结合状态。

重要注意事项

TIP

  • 数据质量要求:确保 ATAC 和 RNA 数据的质量满足要求,低质量数据会导致差异 Peak 和 Motif 分析结果不准确。
  • 两种分析模式:当不设置"筛选因子"时,执行细胞群间差异分析(Cluster vs All);设置"筛选因子"后,执行同一细胞群内的组间差异分析(Case vs Control)。
  • Pseudobulk 机制:为降低单细胞数据的稀疏性(Dropout 效应)并提升信噪比,平台会按照细胞亚群将多个细胞合并为一个"伪细胞"后再进行相关性计算与热图绘制。降采样参数会影响伪批量的构建。
  • 物种支持:当前支持 human、mouse、rat、chicken、bovine、dog、fly、zebrafish、rhesus、chimp、pig、xenopus、Arabidopsis、sheep 等共 14 种物种的 Motif 和注释数据库。
  • Motif 数据库选择:对于常见模式动物(人、小鼠等),直接使用 JASPAR2020 提取指定物种的 Motif 矩阵;对于其他脊椎动物,使用 tax_group = "vertebrates" 获取整个脊椎动物大类的 Motif 集合以保证覆盖度。
  • Footprint 计算耗时:Footprint 分析涉及大量底层序列遍历,计算较为耗时。平台已自动开启并行计算框架以加速。
  • KEGG 富集网络依赖:KEGG 通路富集需访问在线数据库,若网络不可用则该部分结果可能被跳过,不影响其他分析流程。

操作流程

  1. 进入分析模块:在云平台导航至"高级分析"模块,选择 "ATAC_DiffEnrich"。
  2. 创建新任务:为您的分析任务命名,并选择要分析的样本或项目。
  3. 配置参数:根据上述指南,选择要分析的细胞类型、分组信息、阈值参数等。
  4. 提交任务:确认参数无误后,点击"提交"按钮,等待分析完成。
  5. 查看结果:分析结束后,在任务列表中查看生成的分析报告和结果文件。

结果解读

ATAC_DiffEnrich 的分析报告包含丰富的图表和数据文件,以下是对核心结果的详细解读。

1. 差异 Peak 分析

1.1 差异 Peak 结果交互表

在 ATAC assay 中进行差异可及性统计,识别各 cluster 或组间显著差异开放区域。筛选符合 padj < 0.05 + logFC > 0.25 的差异 Peaks,以保证结果具备统计可信度与生物学意义。

根据分析目的不同,支持两种差异分析模式:

  1. 单聚类 Marker 鉴定模式(Cluster vs All):当不设置筛选因子时,程序将每一个细胞类型与剩余所有细胞进行对比,寻找定义某种特定细胞类型的专属开放区域(Cluster-specific Marker Peaks)。

  2. 细胞类型内组间差异模式(Case vs Control):当设置筛选因子后,程序遍历每一种细胞类型,在同一种细胞内部比较实验组与对照组的差异,将所有细胞类型内部的组间差异结果合并为一个总表。

1.2 CoveragePlot 展示 Top 差异 Peak

基于各 cluster 或组间比较结果,选取 logFC 靠前的差异 Peak 进行覆盖图可视化(CoveragePlot),从信号形态与峰强差异两个维度直观展示可及性变化趋势。

图表解读

该图用于展示 Top 差异 Peak 在不同组或 cluster 中的 ATAC 覆盖信号差异:

  • 上/下轨道:分别是两组或多个细胞簇在同一区域的标准化 ATAC 覆盖信号;峰越高代表该区域可及性越强。
  • Normalized signal:纵轴为标准化覆盖强度,可在同一面板内比较两组高低。
  • chr position (bp):横轴为基因组坐标,显示该 Peak 及其上下游邻域。
  • Genes 轨道:显示邻近基因结构与方向,便于判断差异 Peak 可能影响的功能基因。
  • Peak 标记:灰色短条为调用到的开放区间,重点看 Top 差异 Peak 所在位置是否与组间信号变化一致。
  • 多面板并列:每个面板一个 Top Peak 位点,便于快速筛出"统计显著且图像上也分离明显"的高可信候选区域。

1.3 差异 Peak 可及性热图

以差异 Peak 分析结果为输入,在每个 cluster(或 cluster 内 case/control 分组)中筛选满足阈值条件的差异 Peak,按效应量降序选取 Top 500 的位点构建热图。为降低单细胞噪声,信号按组进行 pseudobulk 聚合;随后对每个 Peak 做 Z-score 行标准化处理,从而更清晰地比较不同组别的可及性模式。热图右侧的 Motif 行注释来自差异 Peak 的 Motif 富集结果。

图表解读
  • 顶部颜色条:标识不同细胞类型或比较组别。
  • 颜色梯度(Z-score):反映了特定 Peak 在不同组中的相对可及性水平。红色表示显著高于平均水平(更开放),蓝色表示显著低于平均水平(更封闭),白色表示接近平均值。

2. Motif 富集分析

2.1 差异 Peak 的 Motif 富集结果表

对每个 cluster/组别的差异 Peaks 执行 Motif 富集分析,识别潜在上游 TF 相关结合模式。统计显著性和富集强度(p.adjustfold.enrichment),并仅保留在目标细胞集合中表达比例达到 10% 的 TF 相关 Motif,降低仅序列富集但缺乏表达支持的假阳性风险。

2.2 Top Motif Logo 展示

图表解读

Motif 代表了 TF 在 DNA 序列上的潜在结合偏好性,是连接表观遗传开放状态与转录调控网络的关键桥梁:

  • 横轴:序列的位置。
  • 纵轴:信息含量(bit),在特定位置上,某个碱基字母越高,代表该位置对该核苷酸的选择性越强,即该位置非常保守。
  • 优先关注那些统计显著性高且核心序列特征极其保守的 Motif,它们往往是驱动当前细胞状态特征的主力调控因子的结合靶点。

2.3 Top Motif 活性在 UMAP 空间中的分布

图表解读

基于前述筛选得到的 Top 富集 Motif,使用 FeaturePlot 在单细胞降维空间中展示其活性分布:

  • 空间特异性检验:将抽象的活性分数映射回单细胞的物理坐标,直观检验该 Motif 特异性分布情况。
  • 排除假阳性信号:如果一个 Motif 在统计上显著富集,但在 UMAP 图上表现为随机散布的"背景噪音",这提示该富集信号可能缺乏生物学特异性。
分析要点

优先关注那些在目标细胞群或比较组别中,呈现出**高度集中且颜色深(高活性)**分布模式的 Motif。

3. 核心 TF 分析

3.1 差异 TF 活性分析

在 chromvar assay 上利用 Wilcoxon 秩和检验鉴定差异活性 TF。细胞群间模式输出 TF 活性 Z-score 热图;组间模式输出 TF 活性火山图。

细胞群间 TF 活性热图

组间 TF 活性火山图

每个细胞群生成一张火山图,标注 logFC 变化最剧烈的前 15 个上调与下调 TF。

3.2 TF 活性与 DiffPeak 富集 Motif 重叠分析(韦恩图)

要确定一个 TF 是否真正在当前细胞状态中发挥了关键调控作用,仅靠单一维度的分析往往是不够的。本步骤通过韦恩图,将前面分析的两个独立维度的证据进行交叉验证:

  • 维度一:序列富集证据——回答了"该 TF 的结合序列在差异开放的染色质区域中是否异常密集?"
  • 维度二:全基因组活性变化证据——回答了"在全基因组范围内,该 TF 潜在结合位点的整体开放程度是否发生了显著改变?"

韦恩图中间的交集部分,代表了那些既在局部差异区域被招募,又在全基因组层面表现出活跃状态的 TF,具有最高级别的置信度,是核心主导 TF

3.3 核心 TF 的确定(全局相关性散点图)

一个真实发挥作用的"核心 TF",不仅需要其结合靶点的染色质处于异常开放状态,其本身的基因也必须被积极转录翻译成蛋白。本步骤执行了两项严格的筛选与评估:

  • 条件一 真实转录支撑:提取所有 Motif 对应的潜在 TF,并过滤掉在单细胞 RNA 数据中表达率低于 1% 的假阳性因子。
  • 条件二 强烈的协同联动:在全细胞层面上,进行拟 bulk 处理,计算每个 TF 的 RNA 表达量与其对应 Motif 结合位点活性的 Pearson 相关系数。
图表解读

该散点图展示了在全局范围内,TF 的 RNA 表达量与其结合位点活性之间的 Pearson 相关性分布:

  • X 轴(TF Rank):按照相关性系数从大到小对所有评估的 TF 进行的排序。越靠左的 TF 正相关性越强,越靠右的 TF 负相关性越强。
  • Y 轴(Pearson Correlation):TF 的 RNA 表达水平与 ATAC 活性水平之间的皮尔逊相关系数,介于 -1 到 1 之间。
  • 左侧高亮标注最正相关 TF:位于图表左上角的 TF。它们表现出强烈的正相关,表达量越高,靶点越开放,通常是典型的转录激活因子
  • 右侧高亮标注最负相关 TF:位于图表右下角的 TF。它们表现出强烈的负相关,可能代表转录抑制因子
分析要点

散点图左上角和右下角的核心 TF,是结合了表观开放与基因表达双重特性的主导调控枢纽。特别是左上角的强正相关 TF,具备极强的证据表明其基因表达的上升切实主导了下游靶点染色质图谱的开放,建议将其作为后续深入分析的首选靶标。

3.4 核心 TF 的 Footprint 分析

Footprint 分析用于在染色质切割轨迹层面,客观评估 TF 潜在的物理结合行为。其基本原理是统计 Motif 位点及其邻域的 Tn5 酶插入信号分布:当 TF 结合在 DNA 上时,会阻挡 Tn5 酶对该区域的切割,从而在富集峰的中心形成一个信号相对较低的保护区(足迹),而两侧则出现信号高峰。

程序会对全局相关性 Top 10 的 TF 进行 Footprint 分析,验证其真实结合状态。

图表解读
  • X 轴:距离 Motif 中心的距离(bp)。
  • Y 轴:归一化后的 Tn5 切割频率。
  • 如果看到中心区域(0 bp 处)有一个明显的"凹陷"(即切割频率降低),而两侧有"高峰",这说明该转录因子在这些细胞中发生了真实的结合。
  • 如果某一组(如 Case 组)的凹陷比另一组(如 Control 组)更深,说明该转录因子在 Case 组中的结合活性更强。
分析要点

优先关注中心区域出现明显凹陷、且在目标比较组别间中心凹陷深度存在显著差异的曲线。这种差异通常指示了该 TF 在两种状态下的结合亲和力或占位频率发生了实质性改变。

4. 差异 Peak 靶基因映射与功能富集

4.1 差异 Peak 邻近基因注释

一段染色质区域的异常开放或关闭,最有可能直接影响其附近基因的转录活性。本部分基于基因组的位置信息,将每个显著差异的开放 Peak 精准映射到其物理距离最近的基因位点。

4.2 差异 Peak 靶基因功能富集(GO / KEGG)

在完成了从坐标到基因的映射后,可进一步将这些零散的靶基因放入宏观的生物学网络中进行考察。通过执行 GO 与 KEGG 富集分析,理解这些发生染色质开放状态改变的区域,最终究竟驱动了细胞怎样的表型变化。

TIP

解读指南 — GO/KEGG 柱状图与气泡图

  • 柱状图(Barplot):x 轴为注释到 GO/KEGG 条目的基因数(Count),y 轴为条目描述。颜色表示校正后 p 值(p.adjust);颜色越红,显著性越高。
  • 气泡图(Dotplot)x 轴:GeneRatio,表示该条目中差异基因占输入基因集的比例。
  • 气泡图颜色:表示校正后 p 值;越红显著性越强。
  • 气泡图点大小:表示富集到该通路的差异基因个数(Count),点越大代表参与基因越多。
  • 综合判读:优先关注"颜色更红 + GeneRatio 更高(更靠右)+ 点更大/柱更长"的条目,这类通路通常具有更强的生物学解释意义。

结果文件列表

文件名内容说明
DIFF/all_diffPeak.xls差异 Peaks 总表
DIFF/01_diffPeak/*_diffPeak_significant.xls显著差异 Peaks 表格
DIFF/01_diffPeak/*_DiffPeak_Heatmap.pdf/png差异 Peaks 可及性热图
DIFF/02_topPeak/*_diffPeak_top.pdf/pngTop 差异 Peaks 染色质可及性信号图(CoveragePlot)
DIFF/03_motif/*_diffPeak_motifs.xls显著差异 Peaks 的 Motif 表格
DIFF/03_motif/*_diffPeak_motifs_top.pdf/pngTop 显著差异 Peaks 的 Motif Logo 图
DIFF/03_motif/*_diffPeak_motifs_top_umap.pdf/pngTop 富集 Motif 活性的 UMAP 分布图
DIFF/03_motif/*_TF_Markers.xls显著差异 TF 活性标记表
DIFF/03_motif/*_TF_Activity_Heatmap.pdf/pngTop 差异 TF 活性热图(细胞群间模式)
DIFF/03_motif/*_TF_Activity_Volcano.pdf/png组间 TF 活性火山图(组间模式)
DIFF/03_motif/Global_TF_ActExpr_Correlation.xls全局 TF 活性与 RNA 表达量相关性分析表
DIFF/03_motif/All_TF_Global_Correlation.xls全局 TF 相关性排序全表
DIFF/03_motif/All_TF_Global_Correlation_Scatter.pdf/png全局 TF 活性与表达相关性散点图
DIFF/03_motif/*_TF_ActExpr_Correlation.xls各组 TF 活性与表达量相关性表
DIFF/03_motif/motif_overlap_venn/*_venn.pdf/pngTF 活性与富集 Motif 交集韦恩图
DIFF/03_motif/motif_overlap_venn/*_summary.xls韦恩图交集统计
DIFF/03_motif/motif_overlap_venn/*_overlap_motifs.xls交集 Motif 列表
DIFF/03_motif/footptint/*_footprint.pdf/png核心 TF Tn5 足迹图(Footprint)
DIFF/03_motif/footptint/footprint_global_summary.xlsFootprint 分析汇总表
DIFF/04_closestFeature/*_diffPeak_sig_genes.xls显著差异 Peaks 附近的基因注释表
clusterProfiler/GO/all_GOenrich.xlsGO 富集结果总表
clusterProfiler/GO/*_GOenrich.xls各细胞群 GO 富集结果
clusterProfiler/GO/*_GO_bar/dot.pdf/png各细胞群 GO 富集可视化图表
clusterProfiler/KEGG/all_KEGGenrich.xlsKEGG 富集结果总表
clusterProfiler/KEGG/*_KEGGenrich.xls各细胞群 KEGG 富集结果
clusterProfiler/KEGG/*_KEGG_bar/dot.pdf/png各细胞群 KEGG 富集可视化图表

注意事项

1. 数据质量的重要性:ATAC_DiffEnrich 分析的结果质量很大程度上取决于输入数据的质量。确保 ATAC 和 RNA 数据都经过充分的质控和标准化处理。

2. 两种分析模式的选择

  • 细胞群间模式(Cluster vs All):不设置筛选因子时自动触发,用于寻找各细胞类型的特异性开放区域和 TF。
  • 组间模式(Case vs Control):设置筛选因子后触发,用于探索同一细胞群在不同处理条件下的表观遗传改变。

3. Pseudobulk 聚合策略:为降低单细胞数据的稀疏性,热图和相关性分析均使用 pseudobulk 聚合后的数据。降采样参数会影响伪批量的构建质量。

4. 相关性阈值的选择:默认 cor = 0.3,过严格的阈值可能会过滤掉部分具有生物学意义的中等强度相关 TF,过宽松的阈值可能引入假阳性。

5. Motif 富集 vs Motif 活性:两者关注角度不同但互补:

  • Motif 富集:回答"某一组差异 Peak 中富集了哪些 TF 结合位点"
  • Motif 活性:回答"在全基因组范围内,该 TF 的结合位点整体开放程度是否发生了改变"
  • 建议关注两者交集的 TF,作为核心候选

6. Footprint 分析的限制:Footprint 分析依赖于片段文件的完整性和参考基因组的一致性。确保片段文件路径正确且参考基因组与上游比对使用的一致。

7. 靶基因注释的局限ClosestFeature 基于最近邻法则注释靶基因,这仅提供空间关联最紧密的候选对象,不代表确切的调控关系。

常见问题解答(FAQ)

Q1:ATAC_DiffEnrich 与单独的 Motif 分析有什么区别?

A:ATAC_DiffEnrich 是一个完整的闭环分析模块,包含差异 Peak → Motif 富集 → TF 活性 → 相关性 → Footprint → 靶基因功能映射的完整流程。单独的 Motif 分析只覆盖 Motif 富集和活性部分,缺少差异 Peak 筛选、核心 TF 多维确证和靶基因功能映射。

Q2:为什么差异 Peak 结果较少?

A:可从以下方面排查:

  • 样本或细胞数量较少:导致统计功效不足,建议增加样本量
  • 阈值设置过严格logFCpval_adj 过高,建议适当放宽
  • 数据质量问题:ATAC 数据的信噪比不足,建议检查 TSS enrichment 和 fragments 数量
  • 细胞类型选择不当:选择的细胞类型间可及性差异较小

Q3:如何判断核心 TF 的可靠性?

A:核心 TF 的可靠性可通过以下多重证据层级评估:

  • 第一层(序列证据):Motif 在差异 Peak 中显著富集(p.adjust < 0.05, fold.enrichment > 1
  • 第二层(活性证据):TF Motif 活性在目标组中显著上调(差异 TF 活性分析)
  • 第三层(表达证据):TF 的 RNA 表达与 Motif 活性呈强正相关(Pearson cor > 0.3
  • 第四层(物理证据):Footprint 分析显示 TF 在 Motif 位点有真实的结合保护信号
  • 建议优先关注同时满足以上四层证据的 TF

Q4:Footprint 分析没有出现凹陷怎么办?

A:可能的原因包括:

  • 细胞数量不足:Footprint 信号需要足够多的细胞才能积累出清晰的切割轨迹
  • TF 结合率低:某些 TF 在目标状态下结合比例较低,凹陷不明显
  • Tn5 偏好性校正不足:可尝试调整 normalization 方法
  • 建议:结合其他维度的证据(活性、表达相关性)综合判断

Q5:GO/KEGG 富集结果如何解读?

A:

  • 优先关注"颜色更红(显著)+ GeneRatio 更高(更靠右)+ 点更大(Count 多)"的条目
  • 交叉对比不同细胞群或组别的富集谱,观察关键生物学事件的表观层面响应轨迹
  • 注意富集条目的基因组成,确认核心驱动基因是否来自差异 Peak 的直接注释

Q6:组间差异模式与细胞群间差异模式有什么区别?

A:

  • 细胞群间模式:比较不同细胞类型(如 B cells vs T cells)的可及性差异,用于定义细胞身份
  • 组间差异模式:在同一种细胞类型内部比较不同实验组(如疾病组 vs 对照组),用于揭示环境或病理状态下的染色质重塑
  • 两种模式的分析逻辑和可视化方式不同:细胞群间模式输出合并大热图,组间模式输出每个细胞群独立的小热图和火山图

方法

ATAC_DiffEnrich 方法下载

参考资料

[1] STUART T, SRIVASTAVA A, MADAD S, et al. Single-cell chromatin state analysis with Signac[J]. Nature methods, 2021, 18(11): 1333-1341.

[2] GRANJA J M, KLEMM S, MCGEOUGH L J, et al. Single-cell multiomic analysis identifies regulatory programs in mixed-phenotype acute leukemia[J]. Nature biotechnology, 2019, 37(12): 1458-1465.

[3] KORSUNSKY I, NATHAN A, MILLARD N, et al. Presto: Fast functions for differential expression using Wilcox and AUC[R]. R package, 2019.

[4] SCHIMMEL M S, RICE E S, RAGAVENDRAN A, et al. chromVAR: Inferring transcription factor variation from single-cell chromatin accessibility data[J]. Nature methods, 2019.

0 条评论·0 条回复