ATAC_Monocle3 分析文档
前言
TIP
ATAC_Monocle3 是单细胞 ATAC-seq 数据的拟时序(pseudotime)分析工具,用于重建细胞发育或分化轨迹。
ATAC_Monocle3 分析通过将高维空间中的细胞沿着隐含的生物学进程轨迹进行排序,揭示染色质开放状态、转录因子结合活性和基因表达在动态过程中的变化规律。与传统的 RNA-seq 拟时序分析不同,ATAC_Monocle3 基于染色质可及性数据,从表观遗传调控层面解析细胞命运决定的分子机制。
核心功能
- 染色质可及性动态分析:检测沿拟时序显著变化的差异开放区域(Differentially Accessible Peaks)
- 转录因子活性动态分析:追踪 chromVAR 推断的 Motif 活性沿轨迹的变化模式
- 基因表达动态分析:识别沿拟时序差异表达的基因
- 多组学整合可视化:将 Peak、Motif、RNA 三个层面的动态变化整合到统一的热图框架中
- 转录因子特异性分析:聚焦转录因子亚群的表达动态,识别关键调控因子
理论基础
核心原理
ATAC_Monocle3 基于 Monocle3 算法框架,通过以下步骤重建细胞发育轨迹:
- 降维嵌入:将高维染色质可及性数据投影到低维空间(UMAP)
- 图学习:在降维空间中学习细胞状态之间的主图结构(Principal Graph)
- 拟时序排序:以指定的根细胞群为起点,为每个细胞计算拟时序值
- 多模态动态检测:利用广义线性模型(GLM)和空间自相关检验,识别沿拟时序显著变化的分子特征
关键算法
- 图学习算法:Monocle3 使用 DDRTree 或 UMAP-based 图学习算法,在降维空间中构建细胞状态转换图
- 差异分析:
- Peak 差异分析:基于分箱聚合的广义线性模型(
fit_models) - RNA 差异分析:基于主图拓扑的空间自相关检验(
graph_test) - Motif 差异分析:基于线性回归的 chromVAR 活性变化检测
- Peak 差异分析:基于分箱聚合的广义线性模型(
- 平滑矩阵构建:通过局部加权平均生成沿拟时序的连续信号曲线
云平台操作指南
在云平台上,ATAC_Monocle3 的分析流程被设计得直观易用。您无需编写代码,只需通过参数配置界面即可完成分析。


分析前的准备
TIP
ATAC_Monocle3 分析的成功与否,很大程度上取决于输入数据的质量和根细胞的选择。在开始分析前,请务必确认:
- 数据已完成预处理:您的单细胞 ATAC 数据已经过标准的质控、降维(PCA、UMAP)、聚类和细胞类型注释。
- 选择了合适的细胞亚群:拟时序分析应在具有潜在分化或转变关系的细胞亚群中进行。将生物学上毫无关联的细胞放在一起进行分析是没有意义的。
- 明确生物学起点:这是 ATAC_Monocle3 分析最关键的一步。您必须根据已知的生物学知识,明确哪个细胞群是您所研究过程的起始状态(如干细胞、祖细胞等)。
参数详解
下表详细列出了云平台 ATAC_Monocle3 分析模块的主要参数及其说明。
| 界面参数 | 说明 |
|---|---|
| 任务名称 | 本次分析的任务名称,需以英文字母开头,可包含英文字母、数字、下划线和中文。 |
| root 类型 | 选择要分析的细胞类型或聚类对应的标签,例如细胞注释分组 celltype。此参数与 "root 节点" 和 "细胞类型" 配合使用。 |
| root 节点 | 核心参数。选择细胞发育过程中的祖细胞或发育前期的细胞类型,例如 CMP 细胞。 |
| 细胞类型 | 多选,选择要纳入拟时序分析的所有细胞类型。 |
| 降维方法 | 选择用于轨迹推断的降维嵌入方式,可选 "UMAP"、"ATACUMAP"、"WNNUMAP"(不区分大小写)。 |
| 物种 | 选择数据对应的物种,用于 Motif 分析和基因功能富集分析。目前平台支持 人 和 小鼠。 |
| Downsample | 逻辑值,选择是否对细胞进行降采样(随机抽取部分细胞)后再进行分析。适用于超大规模数据集,可显著提升计算速度。 |
| Downsample_num | 整数,如果启用 Downsample,此参数用于指定每个细胞类型保留的最大细胞数量。 |
| 分区模式 | 逻辑值,决定是否允许学习在不同分区(Partitions)中的不相连轨迹。默认允许,适用于存在多个独立发育过程的复杂数据集。 |
| 基于历史结果分析 | 选择是否基于历史结果进行分析。默认不基于历史结果,即从头开始学习轨迹。 |
| 历史任务名称 | 如果基于历史结果分析,此参数用于指定历史分析任务的名称。 |
| Peaks | 多选,选择要基于历史分析结果进行可视化的差异开放区域(Peaks)列表。包括差异表达的区域。 |
| Gene | 多选,选择要基于历史分析结果进行可视化的差异表达的基因列表。包括差异表达的基因。 |
| TFs | 多选,选择要基于历史分析结果进行可视化的差异活性的转录因子列表。包括差异活性的转录因子。 |
重要注意事项
TIP
- 根细胞选择:
root参数指定的细胞类型必须在celltypes列表中存在,否则轨迹排序将失败。选择错误的根细胞会导致整个拟时序方向反转。 - 降维方法匹配:
降维方法参数的名称(如 "WNNUMAP")必须与 Seurat 对象中obj@reductions的键名完全匹配(本工具支持大小写不敏感匹配)。 - 分区模式:当细胞存在多个不连通的发育分支时,
分区模式 = TRUE会自动将数据分为独立分区分别学习。如果强制分区模式 = FALSE,Monocle3 会尝试将所有细胞连入同一张图,可能导致不合理的跨谱系连接。
操作流程
- 进入分析模块:在云平台导航至"高级分析"模块,选择 "ATAC_Monocle3"。
- 创建新任务:为您的分析任务命名,并选择要分析的样本或项目。
- 配置参数:根据上述指南,选择要分析的细胞类型,并务必准确指定轨迹的起点。
- 提交任务:确认参数无误后,点击"提交"按钮,等待分析完成。
- 查看结果:分析结束后,在任务列表中查看生成的分析报告和结果文件。
结果解读
1. 轨迹可视化
ATAC_Monocle3 生成两类轨迹可视化图,帮助验证轨迹推断的合理性:
1.1 拟时序图

图表解读
- 左图:显示拟时序渐变 + 轨迹骨架,彩色线条表示学习到的细胞状态转换路径
- 右图:仅显示拟时序渐变,颜色从紫色(起点)到黄色(终点)表示发育进程
分析要点
- 检查轨迹方向是否与预期的发育顺序一致
- 观察轨迹分支点是否对应已知的命运决定节点
- 验证根细胞是否位于轨迹起始端
1.2 细胞类型图

图表解读
- 左图:显示细胞类型分布 + 轨迹骨架
- 右图:仅显示细胞类型分布
分析要点
- 对比拟时序图和细胞类型图,验证不同细胞类型在轨迹上的分布是否符合发育逻辑
- 检查中间态细胞是否位于轨迹的过渡区域
2. 差异开放峰分析
2.1 Top 变化 Peak 散点图

图表解读
该图展示了 5 个随拟时序最显著上升的可及性位点,用于观察"染色质逐步开放"的动态模式:
- 横轴(pseudotime):表示细胞沿轨迹从起始到终末的相对进程
- 纵轴(accessibility):表示对应 peak 的可及性强度
- 趋势判断:曲线整体随 pseudotime 上升,说明该位点在发育推进过程中逐步激活
分析要点
- 上升更陡、末端水平更高的位点,往往提示更强的阶段特异开放信号
- 这些 Peak 对应的基因组区域可能包含关键的顺式调控元件(如发育特异的增强子)
3. 多组学动态热图
ATAC_Monocle3 生成三类热图,分别展示 RNA、Motif、Peak 沿拟时序的动态变化:
3.1 RNA 表达热图

图表解读
- 颜色映射:红色表示高表达,蓝色表示低表达,白色表示中等水平
- 顶部注释条:展示拟时序从起始(紫色)到终末(黄色)的渐变过程
- 行聚类:热图自动将基因分为两个簇——上方簇通常随拟时序上升(晚期激活),下方簇随拟时序下降(早期激活后退出)
- 右侧标签:标注了变化幅度最大的 Top 50 基因名称
3.2 Motif 活性热图

图表解读
- 展示转录因子结合活性沿拟时序的动态变化
- Motif ID 已映射为易读的转录因子名称(如 STAT1、GATA1 等)
- 右侧标签标注了变化幅度最大的 Top 50 Motif
分析要点
- 对比 RNA 热图和 Motif 热图,可以判断转录因子的表达变化是否与其结合活性的变化一致
- 如果表达和活性变化不一致,可能提示调控发生在转录后水平
3.3 Peak 可及性热图

图表解读
- 展示染色质开放状态沿拟时序的动态变化
- 右侧标签标注了变化幅度最大的 Top 50 Peak
4. Top 10 特征散点图
为了更细致地观察单个特征的动态变化模式,ATAC_Monocle3 提取每类特征中变化最显著的 Top 10,绘制沿拟时序的散点图。
4.1 Top 10 RNA 特征

图表解读
- 每个面板对应一个基因
- 散点颜色:按细胞类型着色
- 黑色平滑曲线:LOESS 拟合的趋势线,展示整体变化方向
分析要点
- 通过观察曲线的形状和陡峭程度,可以判断该基因是早期激活、晚期激活还是瞬时表达
4.2 Top 10 Motif 特征

图表解读
- 每个面板对应一个转录因子的 Motif
- 展示转录因子结合活性的动态变化
4.3 Top 10 Peak 特征

图表解读
- 每个面板对应一个染色质开放区域
- 展示 Peak 可及性的动态变化
5. 转录因子特异性分析

图表解读
- 聚焦于转录因子这一特殊类别
- 只有同时满足两个条件的基因才会出现在此热图中:(1)在 RNA 水平上沿拟时序显著差异表达;(2)基因名存在于已知的转录因子数据库中
生物学意义
- 如果一个 TF 的表达沿拟时序显著变化,提示它可能在分化过程中发挥阶段性调控作用
- 早期高表达的 TF 可能启动分化程序,晚期高表达的 TF 可能维持终末状态
注意事项
1. 根细胞选择的重要性:根细胞的选择直接影响拟时序的方向和生物学解释。请确保选择的根细胞在生物学上是合理的发育起点(如干细胞、祖细胞)。
2. 细胞亚群选择:拟时序分析应在具有潜在分化或转变关系的细胞亚群中进行。将生物学上毫无关联的细胞放在一起进行分析会导致无意义的轨迹。
3. 降维方法匹配:如果平台提供的降维方法(UMAP、ATACUMAP、WNNUMAP)与您的数据不匹配,请先在预处理步骤中生成相应的降维结果。
4. 分区模式的使用:当数据包含多个独立的发育过程时,建议启用分区模式。强制将所有细胞连入同一张图可能导致不合理的跨谱系连接。
5. 结果解读的谨慎性:拟时序分析提供的是细胞状态转换的相对顺序,而非绝对时间。生物学结论需要结合其他实验证据进行验证。
常见问题解答(FAQ)
Q1:为什么轨迹方向与预期不符?
A:最常见的原因是根细胞选择不当。请检查:
- 根细胞是否确实是发育起点
- 根细胞是否在 "细胞类型" 列表中
- 是否需要尝试不同的降维方法
Q2:轨迹出现多个不相连的分支怎么办?
A:这是正常现象,说明数据中存在多个独立的发育过程。建议:
- 启用分区模式(
分区模式 = TRUE) - 或者分别对不同的发育过程进行独立分析
Q3:Motif 热图和 RNA 热图的结果不一致?
A:这提示转录调控可能发生在转录后水平。可能的原因包括:
- 转录因子的蛋白质活性受翻译后修饰调控
- 转录因子的核定位受调控
- 转录因子需要与其他因子形成复合物才能发挥作用
Q4:如何选择降维方法?
A:
- UMAP:适用于大多数情况,平衡了计算速度和轨迹质量
- ATACUMAP:专门针对 ATAC 数据优化的降维方法
- WNNUMAP:加权最近邻降维,整合了多组学信息,适用于多组学数据
Q5:分析结果中的 q_value 和 p_value 有什么区别?
A:
- p_value:原始统计显著性,未考虑多重检验校正
- q_value:经过 Benjamini-Hochberg 校正后的 p 值,控制了假发现率(FDR)
- 通常使用 q_value < 0.05 作为显著性阈值
方法
参考资料
[1] Cao J, Spielmann M, Qiu X, et al. The single-cell transcriptional landscape of mammalian organogenesis. Nature, 2019, 566(7745): 496-502.
[2] Pliner HA, Packer JS, McFaline-Figueroa JL, et al. Cicero predicts cis-regulatory DNA interactions from single-cell chromatin accessibility data. Molecular Cell, 2018, 71(5): 858-871.
[3] Schep AN, Wu B, Buenrostro JD, et al. chromVAR: inferring transcription-factor-associated accessibility chromatin using single-cell data. Genome Biology, 2017, 18: 180.
