Skip to content

甲基化 + RNA 双组学云平台 Jupyter 分析使用说明

作者: SeekGene
时长: 14 分钟
字数: 3.7k 字
更新: 2026-07-31
阅读: 0 次
甲基化 + RNA 双组学 分析指南

本说明适用于已完成甲基化标准流程分析,并希望在寻因生物云平台 Jupyter 环境中开展下游个性化分析的用户。

文档以示例项目 {project_name}(项目编号 {project_id},样本 {sample_name})为例展示操作路径。

实际使用时,请替换为您的真实项目信息。


1. 启动 Jupyter 个性化分析

1.1 进入项目详情页

登录寻因生物云平台后,进入:

资源总览 → 我的项目

在项目列表中找到目标项目,例如:

  • 项目编号:{project_id}
  • 项目名称:{project_name}

点击项目右侧【查看】,进入项目详情页。

图片0


1.2 启动 JupyterLab

在项目详情页右上角点击【个性化分析】。

点击【快速运行】,会弹出资源配置弹窗,选择合适计算资源,启动完成后再次点击【快速运行】,平台会自动跳转 JupyterLab。

图片1

常用资源说明:

资源配置适用场景
4 核 32G查看结果、小规模绘图、轻量级表格处理
8 核 64G常规单细胞对象处理、基础整合分析
16 核 128G样本量较大、多模态整合、差异分析
32 核 256G大对象分析、复杂 CNV 分析或大规模多组学分析

如需更换资源,可在 JupyterLab 右下角【操作】中选择【重置资源】。

注意:【重置资源】会注销当前 Jupyter 实例,并重新启动一个新的 Jupyter 实例。操作前请先保存 Notebook、脚本和已生成结果,未保存内容会丢失。


1.3 JupyterLab 常用区域

进入 JupyterLab 后,常用区域包括:

区域作用
左侧文件浏览器查看目录、打开 Notebook、上传或下载文件
Launcher新建 Notebook、Terminal 或其他交互界面
右下角【操作】挂载流程数据、汇总数据、模板库、上传模板、延长时间、重置资源、关闭页面

图片2


1.4 右下角【操作】功能说明

JupyterLab 右下角【操作】菜单包含平台提供的常用功能。

功能说明
挂载流程数据默认不挂载流程数据。需要使用流程结果时,通过【挂载流程数据】勾选相关流程进行挂载;如需卸载,取消勾选对应流程即可
汇总数据可将 /home/{username}/workspace/project/{username}/ 及其子文件夹下的数据汇总到对应流程的【结果总览】页面
模板库用于下载平台提供的 Notebook 模板。通过模板库下载的模板会保存到 /home/{username}/workspace/project/{username}/
上传模板可上传 /home/{username}/workspace/project/{username}/ 及其子文件夹下的 .ipynb 文件
重置资源注销当前 Jupyter 实例,并重新启动一个新的 Jupyter 实例。操作前必须保存 Notebook、脚本和分析结果,未保存内容会丢失
关闭页面注销当前 Jupyter 实例。关闭前必须保存 Notebook、脚本和分析结果,未保存内容会丢失
延长时间延长 Jupyter 使用时间。该操作可多次执行,延长时长会在当前剩余时间基础上叠加

2. 工作目录与流程数据挂载

2.1 工作目录说明

Jupyter 中主要使用两个目录:project 盘和 data 盘。

目录类型路径说明推荐用途
project 盘/home/{username}/workspace/project/{username}/用户个人可写目录保存 Notebook、脚本、图片、表格、h5ad、rds 等个性化分析结果
data 盘/home/{username}/workspace/data/{挂载编号}/挂载后的流程结果目录读取标准流程输出数据

建议所有用户自行生成的结果均保存到:

bash
/home/{username}/workspace/project/{username}/

不建议将个性化分析结果直接写入 data 盘。data 盘主要作为标准流程结果的读取目录使用。


2.2 存储与协作说明

  1. 所有项目个人工作目录 /home/{username}/workspace/project/{username}/ 的存储总和上限为 500GB。
  2. 同一个项目下的成员可以查看其他成员的分析结果,例如:
bash
/home/{username}/workspace/project/{OtherUsers}/

因此,不建议在 project 目录中保存敏感信息或与项目无关的大体积临时文件。


2.3 挂载流程数据

SeekMethyl 标准流程结果不会默认出现在 Jupyter 文件系统中,需要通过【挂载流程数据】映射到当前 Jupyter 环境。

操作步骤:

  1. 点击右下角【操作】;
  2. 选择【挂载流程数据】;
  3. 勾选需要使用的流程任务;
  4. 确认挂载。

图片3

如需卸载已挂载的数据,可再次进入【挂载流程数据】,取消勾选对应流程任务。

挂载完成后,可在 Terminal 中查看:

bash
ls -lh /home/{username}/workspace/data/

挂载后的 SeekMethyl 结果通常位于:

bash
/home/{username}/workspace/data/{挂载编号}/methylation/{任务目录}/

单个样本的结果目录通常为:

bash
/home/{username}/workspace/data/{挂载编号}/methylation/{任务目录}/{sample_name}/

示例:

bash
cd /home/{username}/workspace/data/{挂载编号}/methylation/{任务目录}/{sample_name}/
ls -lh

3. 挂载数据内容说明

3.1 样本级挂载目录结构

挂载后,SeekMethyl 当前提供给 Jupyter 下游分析使用的样本级标准数据按以下五类目录组织:

text
allcools_generate_datasets
cnvPreflight
filtered_feature_bc_matrix
methscan
split_bams

示例结构:

text
{sample_name}/
├── allcools_generate_datasets
│   └── {sample_name}.mcds
│       ├── chrom10k
│       ├── chrom20k
│       ├── chrom50k
│       ├── chrom100k
│       ├── chrom500k
│       ├── chrom1M
│       ├── chrom_sizes.txt
│       └── geneslop2k
├── cnvPreflight
│   ├── copykit_{sample_name}_1Mb.rds
│   ├── copykit_{sample_name}_1Mb.rds.md5
│   ├── copykit_{sample_name}_500kb.rds
│   ├── copykit_{sample_name}_500kb.rds.md5
│   ├── copykit_{sample_name}_220kb.rds
│   └── copykit_{sample_name}_220kb.rds.md5
├── filtered_feature_bc_matrix
│   ├── barcodes.tsv.gz
│   ├── features.tsv.gz
│   └── matrix.mtx.gz
├── methscan
│   └── compact_data
│       ├── *.npz
│       ├── cell_stats.csv
│       ├── column_header.txt
│       └── run_info.txt
└── split_bams
    ├── {sample_name}_cells.csv
    └── filtered_barcode_reads_counts.csv

上述五类目录是平台当前提供给 Jupyter 的标准挂载结果,可作为后续 SeekMethyl 模板教程的数据基础。不同教程会根据分析目的选择其中一类或多类数据;部分教程也会使用前序教程基于这些数据生成的中间结果,例如 adata_rna.h5adadata_met.h5ad 或 DMR 结果文件。


3.2 五类标准挂载数据说明

目录数据含义主要用途
filtered_feature_bc_matrix/RNA 表达矩阵RNA 质控、降维、聚类、注释、差异表达分析
allcools_generate_datasets/{sample_name}.mcds/ALLCools 生成的单细胞甲基化 MCDS 数据集甲基化基础分析、区域甲基化聚合、DMG/DMB 分析、多模态整合
methscan/compact_data/MethSCAn 所需的压缩甲基化矩阵VMR 检测、DMR 分析
cnvPreflight/CNV 预分析对象CNV 可视化、肿瘤细胞判定、克隆分群
split_bams/单细胞 barcode 与 reads 统计细胞级质控、reads 分布检查、双细胞辅助判断

4. 甲基化下游分析模板使用说明

平台已提供常用甲基化下游分析的 Notebook 模板,并统一收录在模板库中。用户可根据分析目的选择并下载相应模板,即可在 Jupyter 环境中完成对应分析。


4.1 下载模板

在 JupyterLab 右下角点击【操作】→【模板库】。

进入模板库后,将类型选择为 Public,产品选择为 SeekMethyl。找到需要使用的教程后,点击右下角的下载箭头。

模板下载后默认保存到 /home/{username}/workspace/project/{username}/。用户可在左侧文件浏览器中进入该目录,打开对应 .ipynb 文件。

模板分为 PublicPrivate 两种类型:

模板类型说明
Public公有模板,具有使用权限的用户可查看和下载
Private私有模板,仅创建者可查看和使用

图片4


4.2 选择 Kernel

不同教程依赖不同运行环境。打开 Notebook 后,请先根据 4.3 教程总览表选择推荐 Kernel。

操作方式:

Kernel → Change Kernel → 选择推荐 Kernel


4.3 教程总览表

分析类别教程文件推荐 Kernel标准输入来源主要输出
双细胞识别甲基化+RNA双组学-双细胞判断.ipynbSeekMethy_pyfiltered_feature_bc_matrix/allcools_generate_datasets/{sample}.mcds/split_bams/sample_doublet.txt、UMI 分布图、甲基化 reads 分布图、双细胞判定图
基础整合分析甲基化+RNA双组学-基础分析.ipynbSeekMethy_pyfiltered_feature_bc_matrix/allcools_generate_datasets/{sample}.mcds/adata_rna.h5adadata_met.h5ad、QC 图、UMAP 图
MOFA+ 多模态整合甲基化+RNA双组学-MOFA+多模态整合分析.ipynbmuon_env(py)基础分析输出的 adata_rna.h5adadata_met.h5adMOFA+ latent factors、组学贡献度结果
WNN 多模态整合甲基化+RNA双组学-WNN多模态整合分析.ipynbmuon_env(py)基础分析输出的 adata_rna.h5adadata_met.h5adWNN UMAP、整合聚类结果
差异分析与功能富集甲基化+RNA双组学-差异分析和功能富集分析.ipynbSeekMethy_pyadata_rna.h5adadata_met.h5adallcools_generate_datasets/{sample}.mcds/DEG、DMG、DMB、Venn 图、Circos 图、GO/KEGG 富集图
组间细胞类型差异富集甲基化+RNA双组学-组间细胞类型差异富集分析.ipynbSeekMethy_pyadata_rna.h5adadata_met.h5adallcools_generate_datasets/{sample}.mcds/、分组信息组间 DEG、组间 DMG、火山图、Venn 图、Circos 图、GO/KEGG 富集图
MethSCAn 差异甲基化分析甲基化+RNA双组学-MethSCAn差异甲基化分析.ipynbcommon_rmethscan/compact_data/、细胞分组信息VMR、DMR、差异甲基化区域表
DMR 功能富集甲基化+RNA双组学-差异甲基化区域功能富集分析.ipynbcommon_r上游分析得到的 DMR BED 文件rGREAT 注释结果、GO/KEGG 富集结果
DMR Motif 富集甲基化+RNA双组学-差异甲基化区域Motif富集分析.ipynbcommon_r上游分析得到的 DMR/VMR BED 文件HOMER motif 富集结果、候选 TF
CNV 拷贝数变异分析甲基化+RNA双组学-CNV拷贝数变异分析.ipynbSingleCell RcnvPreflight/copykit_{sample}_1Mb.rds500kb.rds220kb.rdsCNV 热图、肿瘤细胞判定结果、克隆分群结果

5. 自定义环境创建与管理

平台已提供 SeekMethyl 模板所需的常用 Kernel:

Kernel主要用途
SeekMethy_py甲基化 + RNA 双组学基础分析、差异分析、组间分析
common_rMethSCAn、DMR 功能富集、DMR motif 分析
singlecell_rCopyKit CNV 分析
muon_env(py)MOFA+、WNN 多模态整合

一般情况下,使用模板教程时不需要自行创建环境。只有在需要安装额外软件包、固定特殊版本或运行自定义脚本时,才建议创建自定义环境。


5.1 创建自定义 R 环境

示例:创建名为 DemoR 的 R 环境。

bash
# 1. 创建 R 环境
micromamba create --prefix /jp_envs/envs_user/{UserId}/DemoR -y

# 2. 激活环境
micromamba activate /jp_envs/envs_user/{UserId}/DemoR

# 3. 安装 R 内核和常用 R 包
micromamba install -c conda-forge -c bioconda -c defaults r-base r-irkernel r-seurat -y

# 4. 启动 R
R

在 R 交互界面中执行:

r
Sys.setenv(PATH = paste("/home/mambauser/bin:/home/mambauser/env/jupyter/bin", Sys.getenv("PATH"), sep = ":"))

IRkernel::installspec(
  name = "DemoR",
  displayname = "DemoR",
  prefix = "/jp_envs/kernels_user/{UserId}/"
)

q()

返回 Terminal 后执行:

bash
jupyter kernelspec install /jp_envs/kernels_user/{UserId}/share/jupyter/kernels/demor --user

micromamba deactivate

刷新 Jupyter 页面后,可在 Kernel 列表中看到 DemoR


5.2 删除自定义 R 环境

bash
jupyter-kernelspec remove demor

micromamba env remove --prefix /jp_envs/envs_user/{UserId}/DemoR

5.3 创建自定义 Python 环境

示例:创建名为 DemoPython 的 Python 环境。

bash
# 1. 创建 Python 环境
micromamba create --prefix /jp_envs/envs_user/{UserId}/DemoPython python=3.10 -y

# 2. 激活环境
micromamba activate /jp_envs/envs_user/{UserId}/DemoPython

# 3. 安装 Jupyter 内核和常用 Python 包
micromamba install -c conda-forge -c bioconda -c defaults ipykernel scanpy pandas numpy matplotlib -y

# 4. 安装 Python Kernel
python -m ipykernel install \
  --name DemoPython \
  --display-name "DemoPython" \
  --prefix /jp_envs/kernels_user/{UserId}/

# 5. 注册到当前用户 Jupyter
jupyter kernelspec install /jp_envs/kernels_user/{UserId}/share/jupyter/kernels/demopython --user

# 6. 退出环境
micromamba deactivate

刷新 Jupyter 页面后,可在 Kernel 列表中看到 DemoPython


5.4 删除自定义 Python 环境

bash
jupyter-kernelspec remove demopython

micromamba env remove --prefix /jp_envs/envs_user/{UserId}/DemoPython

5.5 自定义环境注意事项

  1. 优先使用平台预置 Kernel。
  2. 不建议修改公共环境中的包版本。
  3. 自建环境建议使用独立名称,避免覆盖已有环境。
  4. 安装额外软件包时建议记录安装命令,便于复现。
  5. 如果依赖冲突严重,建议新建环境,不建议在原环境中反复覆盖安装。

6. 常见问题

Q1:找不到 /home/{username}/workspace/data/ 目录怎么办?

先确认是否已挂载流程数据:

右下角【操作】→【挂载流程数据】

然后在 Terminal 中检查:

bash
ls -lh /home/{username}/workspace/data/

如果仍未看到对应挂载编号,请重新挂载流程数据,或确认当前项目是否已有可挂载的 SeekMethyl 流程结果。


Q2:模板下载后在哪里?

模板下载后默认保存到:

bash
/home/{username}/workspace/project/{username}/

可在左侧文件浏览器中进入该目录打开 Notebook。


Q3:Notebook 无法保存怎么办?

请确认 Notebook 是否位于个人 project 目录:

bash
/home/{username}/workspace/project/{username}/

如果在只读目录或挂载数据目录中创建 Notebook,可能出现 Permission denied


Q4:资源不够怎么办?

如果出现内存不足、运行过慢或任务中断,可点击右下角【操作】→【重置资源】,选择更高配置后重新启动 Jupyter。

注意:重置资源会注销当前 Jupyter 实例,并重新启动新的实例。操作前请保存 Notebook、脚本和重要结果,未保存内容会丢失。


Q5:会话即将结束怎么办?

可点击右下角【操作】→【延长时间】延长 Jupyter 使用时间。该操作可多次执行,延长时长会在当前剩余时间基础上叠加。

同时建议及时保存 Notebook 和输出结果到 project 目录,避免浏览器关闭、会话中断或实例重启导致未保存内容丢失。


7. 技术支持与问题反馈

如遇问题,请提供以下信息,便于快速定位:

  1. 项目编号:{project_id}
  2. 项目名称:{project_name}
  3. 样本名称:{sample_name}
  4. 使用的 Notebook 名称
  5. 使用的 Kernel
  6. 当前输入路径
  7. 报错截图或完整报错文本
  8. 是否已完成流程数据挂载
  9. 使用的资源配置:CPU / 内存

分析结束后,建议通过右下角【操作】→【关闭页面】释放计算资源。

0 条评论·0 条回复