表面蛋白 - CRISPR - 混样(Multiplex)参考表格(Feature Reference)填写指南
本文档帮助您填写 Feature Barcode 信息(抗体、CRISPR、Hashing 等),用于 Cell Ranger 分析。请根据产品类型及建库方式(3' / 5')选择对应内容,提供正确且完整的信息表格。
参考表格填写注意事项
产品简介
| 产品 | 简单来说 | 检测对象 |
|---|---|---|
| 表面蛋白检测(Cell Surface Protein / CITE-seq, Antibody Capture) | 用抗体-寡核苷酸标签,在单细胞转录组测序中同步定量表面蛋白 | 表面蛋白(如 CD3、CD4 等) |
| CRISPR Guide Capture(CRISPR 筛选 / Perturb-seq) | 捕获单个细胞中的 sgRNA,关联基因扰动与转录组表型(详见「CRISPR Guide Capture」) | sgRNA 序列 |
| 样本混样(Multiplex: Hashing / CellPlex CMO) | 多样本混合测序,利用标签在分析时拆分为单样本 | 细胞来源样本的标签信息 |
基础概念(所有产品通用)
无论是表面蛋白、CRISPR 还是混样样本,Cell Ranger 分析这类数据都需要一份 Feature Reference CSV,用于告诉软件:
- 每一个 Feature(抗体 / sgRNA / Hashtag)的名称和编号;
- 该 Feature 的标签序列(Barcode 序列);
- 这个标签序列在测序读长(Read)中的具体位置和提取模式(pattern);
- 该 Feature 属于哪一类分析(抗体、CRISPR 还是混样)。
所有产品类型共享 6 个通用必填列,列名和顺序固定;CRISPR 产品还需额外填写 2 个专属列(详见「CRISPR Guide Capture」):
| 列名 | 含义 | 是否必填 |
|---|---|---|
id | Feature 唯一编号(如 CD3、sgTP53-1、Hashtag1),不能有空格、斜杠、引号或逗号等特殊符号;不能与转录组中基因名相同 | ✅ 必填 |
name | Feature 展示名称;可与 id 相同,不要求唯一;会在 matrix/features.tsv.gz 里展示;同样不能有空格、斜杠、引号或逗号等特殊符号 | ✅ 必填 |
read | 该 Feature 标签序列所在的测序读长,通常为 R2(个别情况为 R1) | ✅ 必填 |
pattern | 一段固定序列,表明标签序列在 read 中的位置(详见下方说明) | ✅ 必填 |
sequence | 标签序列,例如表面蛋白抗体序列或 sgRNA protospacer 序列 | ✅ 必填 |
feature_type | Feature 类型:Antibody Capture / CRISPR Guide Capture / Multiplexing Capture | ✅ 必填 |
Pattern 语法说明
| 符号 | 含义 |
|---|---|
5P 或 ^ | 表示 pattern 从 read 起始位置开始匹配(只能出现在 pattern 最前面,二者选一,不可同时使用) |
3P 或 $ | 表示 pattern 在 read 末端(只能出现在 pattern 最后面,同上) |
N | 任意碱基(占位,不校验) |
A / C / G / T | 固定碱基,必须与 sequence 完全一致 |
(BC) | 表示 Feature Barcode 实际序列所在位置,每条 pattern 中必须且只能出现一次,对应 sequence 列的内容 |
Pattern 示例:
5PNNNNNNNNNN(BC):pattern 位于 read 的开头,紧跟其后的序列即为sequence序列。^(BC):表示从序列的起始位置直接读取sequence序列。(BC)GTTTAAGAGCTAAGCTGGAA:pattern 序列为GTTTAAGAGCTAAGCTGGAA,其前面的序列为sequence序列。TTCCAGCTTAGCTCTTAAAC(BC):pattern 序列为TTCCAGCTTAGCTCTTAAAC,其后面的序列为sequence序列。pattern 序列长度应适中:太长容易受测序错误影响,太短则不利于唯一识别
sequence序列。对于非 N 的固定序列部分,建议长度为 12–20 bp。Cell Ranger 会根据 pattern 识别并提取
sequence序列,再与参考表格中的sequence进行匹配。匹配时最多允许一个碱基错配,并使用 barcode 校正算法完成比对。
通用填写注意事项(务必检查)
- 文件必须为纯 ASCII 编码 CSV 格式,不要使用 Excel 另存后带有中文全角符号、BOM 头或特殊符号的版本。
- 每一行对应一个唯一的 Feature Barcode,
id列在整份文件(包括同时存在的抗体 + 混样标签)中不可重复,也不能与后续基因名 / 探针 ID 冲突。 id列建议只使用字母、数字、下划线_、短横线-,不要使用竖线|、逗号、空格(竖线在multi config CSV中另有含义)。- 如果同一实验中既有「抗体检测」又有「样本混样(Hashing)」,两部分 Feature 信息需要写在同一份 Feature Reference CSV 中(各自
feature_type不同即可),不要拆成两个文件。 sequence列务必确认是正确的。采购自供应商的,请向抗体 / sgRNA / Hashtag 供应商提供的最新序列表核对。对于 CRISPR 产品,需确认提供的是 sgRNA 本身(即最终会被转录、被测序读到)的那条链序列,序列错误会导致该 Feature 无法被识别(计数为 0)。
表面蛋白
表面蛋白检测通常使用 BioLegend TotalSeq™ 系列,标签序列在 R2 read 中的位置因抗体类型不同而不同。下机数据名称常以 _Pro 作为样本名后缀。feature_type 固定填 Antibody Capture。
TotalSeq-A(兼容 3' v2 / 3' v3 kits)
- 适配数据类型:3' 基因表达(Single Cell 3' v2 / v3)。
- 标签序列位于 R2 read 最起始位置(无前置间隔序列)。
read=R2,pattern=5P(BC)。
示例(仅需要修改 id / name / sequence,以您的实际情况来填写):
id,name,read,pattern,sequence,feature_type
CD3,CD3_TotalSeqA,R2,5P(BC),ATTGGCACTCAGATG,Antibody Capture
CD4,CD4_TotalSeqA,R2,5P(BC),TACCCGTAATAGCGT,Antibody CaptureTotalSeq-B(兼容 3')
- 适配数据类型:3' 基因表达。
- 标签序列位于 R2 read 固定第 10 个碱基起始(前面有 10 bp 随机序列)。
read=R2,pattern=5PNNNNNNNNNN(BC)。
示例(仅需要修改 id / name / sequence,以您的实际情况来填写):
id,name,read,pattern,sequence,feature_type
CD3,CD3_TotalSeqB,R2,5PNNNNNNNNNN(BC),AACAAGACCCTTGAG,Antibody Capture
CD4,CD4_TotalSeqB,R2,5PNNNNNNNNNN(BC),TACCCGTAATAGCGT,Antibody CaptureTotalSeq-C(兼容 5' / V(D)J)
- 适配数据类型:5' 基因表达 / V(D)J 免疫文库。
- 标签序列同样位于 R2 固定第 10 个碱基起始。
read=R2,pattern=5PNNNNNNNNNN(BC)。
示例(仅需要修改 id / name / sequence,以您的实际情况来填写):
id,name,read,pattern,sequence,feature_type
CD3,CD3_TotalSeqC,R2,5PNNNNNNNNNN(BC),CTCATTGTAACTCCT,Antibody Capture
CD19,CD19_TotalSeqC,R2,5PNNNNNNNNNN(BC),CTGGGCAATTACTCG,Antibody Capture样本混样
样本混样用于将多个样本混合上机,事后通过标签(Hashtag / CMO barcode)在计算层面拆分回各个样本。10x 目前支持以下混样方式,填写要求各不相同,请先确认您使用的是哪一种:
| 混样方式 | 适用平台 | 标签来源 | Feature Reference 是否需要 |
|---|---|---|---|
| 3' CellPlex(CMO) | 3' 基因表达 | 10x 官方 CMO 标签(内置于软件,通常无需自建) | 使用官方 CMO 无需提供;使用第三方 / 自定义标签(如 TotalSeq 系列做 Hashing)时需要提供 |
| Antibody Capture Hashing(TotalSeq Hashtag) | 3' 或 5' 基因表达 | 抗体厂商提供的 Hashtag 序列 | ✅ 需要提供 |
目前,下机数据中 3' 混样数据名称常以 _HTO 或 _ADT 作为样本名后缀。5' 混样仍以 _Pro 为样本后缀。
Antibody Capture Hashing(最常见,基于表面蛋白进行混样)
若使用 TotalSeq-A / B / C Hashtag 抗体进行样本混样:
- 需自行提供 Feature Reference,写法与对应类型的表面蛋白抗体完全一致(即 TotalSeq-B 用
5PNNNNNNNNNN(BC),TotalSeq-C 用5PNNNNNNNNNN(BC))。 - 提前告知是基于表面蛋白的混样分析,便于后续生信分析(重要)。
feature_type填写Antibody Capture。- 务必确认您使用的是 CellPlex CMO 官方标签还是 TotalSeq Hashtag 抗体混样,两种写法的
feature_type不同(分别为Multiplexing Capture与Antibody Capture),混淆会导致分析失败。 - 混样分析必须同时提供转录组(Gene Expression)数据,仅混样数据无法分析。
只用表面蛋白做混样
以 TotalSeq-A Hashtag(用于 3' 数据)为例(仅需要修改 id / name / sequence,以您的实际情况来填写):
id,name,read,pattern,sequence,feature_type
TotalSeqA_Hashtag_1,TotalSeqA_Hashtag_1,R2,5P(BC),ATCACATCGTTGCCA,Antibody Capture
TotalSeqA_Hashtag_2,TotalSeqA_Hashtag_2,R2,5P(BC),CTCTAGGTTCCCACC,Antibody Capture
TotalSeqA_Hashtag_3,TotalSeqA_Hashtag_3,R2,5P(BC),AGCTCACTTGTCCTG,Antibody Capture
TotalSeqA_Hashtag_4,TotalSeqA_Hashtag_4,R2,5P(BC),GTATGTTCTGCAATT,Antibody Capture以 TotalSeq-B Hashtag(用于 3' 数据)为例(仅需要修改 id / name / sequence,以您的实际情况来填写):
id,name,read,pattern,sequence,feature_type
TotalSeqB_Hashtag_1,TotalSeqB_Hashtag_1,R2,5PNNNNNNNNNN(BC),GTCAACTCTTTAGCG,Antibody Capture
TotalSeqB_Hashtag_2,TotalSeqB_Hashtag_2,R2,5PNNNNNNNNNN(BC),TGATGGCCTATTGGG,Antibody Capture以 TotalSeq-C Hashtag(用于 5' 数据)为例(仅需要修改 id / name / sequence,以您的实际情况来填写):
id,name,read,pattern,sequence,feature_type
TotalSeqC_Hashtag_1,TotalSeqC_Hashtag_1,R2,5PNNNNNNNNNN(BC),GTCAACTCTTTAGCG,Antibody Capture
TotalSeqC_Hashtag_2,TotalSeqC_Hashtag_2,R2,5PNNNNNNNNNN(BC),TGATGGCCTATTGGG,Antibody Capture
TotalSeqC_Hashtag_3,TotalSeqC_Hashtag_3,R2,5PNNNNNNNNNN(BC),TTCCGCCTCTCTTTG,Antibody Capture
TotalSeqC_Hashtag_4,TotalSeqC_Hashtag_4,R2,5PNNNNNNNNNN(BC),AGTAAGTTCAGCGTA,Antibody Capture同时有表面蛋白文库和 Hashtag 混样
例如以 TotalSeq-B 来作为标签,参考表格可以参考(需要修改 id / name / sequence,以您的实际情况来填写):
id,name,read,pattern,sequence,feature_type
TotalSeqB_Hashtag_1,TotalSeqB_Hashtag_1,R2,5PNNNNNNNNNN(BC),GTCAACTCTTTAGCG,Antibody Capture
TotalSeqB_Hashtag_2,TotalSeqB_Hashtag_2,R2,5PNNNNNNNNNN(BC),TGATGGCCTATTGGG,Antibody Capture
CD3_TotalSeqB,CD3,R2,5PNNNNNNNNNN(BC),AACAAGACCCTTGAG,Antibody Capture
CD4_TotalSeqB,CD4,R2,5PNNNNNNNNNN(BC),TACCCGTAATAGCGT,Antibody Capture
CD8a_TotalSeqB,CD8a,R2,5PNNNNNNNNNN(BC),ATTGGCACTCAGATG,Antibody Capture生信分析注意事项
生信在分析时,会在配置文件 [samples] 部分添加 sample_id 和 hashtag_ids,用于后续数据的拆分 (生信负责配置,无需额外提供信息)。
拆分后样本名称、sample_id 和 hashtag_ids 均与 id 保持一致。
[samples]
sample_id,hashtag_ids
TotalSeqB_Hashtag_1,TotalSeqB_Hashtag_1
TotalSeqB_Hashtag_2,TotalSeqB_Hashtag_2若同一样本使用了多个抗体 Hashtag(技术重复),可用竖线分隔多个编号,例如 ABHT-1|ABHT-2。示例 (生信负责配置,无需额外提供信息):
WARNING
此类情况,请提前告知!
[samples]
sample_id,hashtag_ids
Sample1,TotalSeqB_Hashtag_1|TotalSeqB_Hashtag_2
Sample2,TotalSeqB_Hashtag_33' CellPlex with CMO
CMO(Cell Multiplexing Oligo)基于脂质锚定 oligo 来进行混样。
- 混样分析必须同时提供转录组(Gene Expression)数据,仅混样数据无法分析。
feature_type填写Multiplexing Capture。- 请确认 CMO 标签是 Cell Ranger 默认的还是自定义的。
使用 10x 官方 CMO 标签
10x 官方提供了 12 种默认 CMO 标签(CMO301–CMO312)并内置到了 Cell Ranger 分析软件里。如果使用的是 10x 的官方标签,在 Feature Reference CSV 里可以不列出来 sequence 序列,只提供用到的 CMO 标签 id 即可。
id,name,read,pattern,sequence,feature_type
CMO301,CMO301,R2,5P(BC),ATGAGGAATTCCTGC,Multiplexing Capture
CMO302,CMO302,R2,5P(BC),CATGCCAATAGAGCG,Multiplexing Capture
CMO303,CMO303,R2,5P(BC),CCGTCGTCCAAGCAT,Multiplexing Capture
CMO304,CMO304,R2,5P(BC),AACGTTAATCACTCA,Multiplexing Capture
CMO305,CMO305,R2,5P(BC),CGCGATATGGTCGGA,Multiplexing Capture
CMO306,CMO306,R2,5P(BC),AAGATGAGGTCTGTG,Multiplexing Capture
CMO307,CMO307,R2,5P(BC),AAGCTCGTTGGAAGA,Multiplexing Capture
CMO308,CMO308,R2,5P(BC),CGGATTCCACATCAT,Multiplexing Capture
CMO309,CMO309,R2,5P(BC),GTTGATCTATAACAG,Multiplexing Capture
CMO310,CMO310,R2,5P(BC),GCAGGAGGTATCAAT,Multiplexing Capture
CMO311,CMO311,R2,5P(BC),GAATCGTGATTCTTC,Multiplexing Capture
CMO312,CMO312,R2,5P(BC),ACATGGTCAACGCTG,Multiplexing Capture运行时,会在配置文件的 [samples] 部分列出使用的 cmo_ids 以便于数据拆分 (生信负责配置,无需额外提供信息):
[samples]
sample_id,cmo_ids
sample1,CMO301
sample2,CMO303使用自定义 CMO 混样标签
使用自定义混样标签时,需要提供完整的参考表格,包括 id / name / read / pattern 序列和实际的 sequence 序列。feature_type 固定填 Multiplexing Capture。
示例(需要修改 id / name / pattern / sequence,以您的实际情况来填写):
id,name,read,pattern,sequence,feature_type
HTO1,HTO1,R2,5PNNNNNNNNNN(BC),CTCATTGTAACTCCT,Multiplexing Capture
HTO2,HTO2,R2,5PNNNNNNNNNN(BC),CTGGGCAATTACTCG,Multiplexing Capture运行时,会在配置文件中额外指定 cmo-set 参考序列表格位置,并指定 cmo_ids (生信负责配置,无需额外提供信息):
[gene-expression]
reference,/path/to/transcriptome
cmo-set,/path/to/custom_cmo_ref.csv
create-bam,true
[samples]
sample_id,cmo_ids
sample1,HTO1
sample2,HTO2若同一样本使用了多个 CMO 标签(技术重复),可用竖线分隔多个编号,例如 CMO301|CMO302。示例:
WARNING
此类情况,请提前告知!
[samples]
sample_id,cmo_ids
sample1,CMO301|CMO302
sample2,CMO303|CMO304混样信息提交清单(客户必须提供)
| 信息项 | 是否必须 |
|---|---|
| 使用的混样方式(CellPlex CMO / Hashing 抗体) | ✅ 必须 |
| 每个样本对应的标签编号(CMO ID / Hashtag 抗体 clone)与样本名称对照表 | ✅ 必须 |
| 若为自定义抗体 Hashing:抗体类型(TotalSeq-A / B / C)及对应厂商序列表 | ✅ 必须(自定义时) |
| 是否存在同一样本使用多个标签(技术重复,需要合并输出) | 建议提供,便于确定运行时是否需要合并 |
CRISPR Guide Capture
CRISPR Guide Capture 用于检测单细胞内导入的 sgRNA(protospacer),其 Feature Barcode 即为 sgRNA 的 protospacer 序列本身。
CRISPR 产品共有 8 个信息列(在通用 6 列基础上新增 2 列):
| 列名 | 含义 | 是否必填 |
|---|---|---|
id | Feature 唯一编号,不能有空格、斜杠、引号或逗号等特殊符号;不能与转录组中基因名相同 | ✅ 必填 |
name | Feature 展示名称;可与 id 相同,不要求唯一;会在 matrix/features.tsv.gz 里展示;同样不能有空格、斜杠、引号或逗号等特殊符号 | ✅ 必填 |
read | R2 | ✅ 必填 |
pattern | 一段固定序列,表明标签序列在 read 中的位置,一般为 12–20 bp | ✅ 必填 |
sequence | 标签序列,也是 sgRNA protospacer 序列,不能有重复 | ✅ 必填 |
feature_type | CRISPR Guide Capture | ✅ 必填 |
target_gene_id | 目标基因 ID,如 ENSG00000113812 | 非必填 |
target_gene_name | 目标基因名称,如 ACTR8 | ✅ 必填 |
填写注意事项
sequence列填写每条 sgRNA 的 protospacer 序列,不含 scaffold / 骨架序列,长度需与实际设计一致。- 当
target_gene_id整列为空时,可以正常运行,但不会执行 perturbation effect 分析。 target_gene_id和target_gene_name列需要与基因组(GTF)中的gene_id和gene_name一致,分析过程中会做校验,不在基因组中的将无法分析。- 5' CRISPR 需要额外注意 sgRNA 序列方向:测序读段方向为 5'→3',但在 5' CRISPR Guide Capture 文库中,建库时 sgRNA 以反向捕获,因此 Feature Reference CSV 中的
sequence必须填写原始设计序列的反向互补,而非正向序列。若为 5' CRISPR Guide Capture 实验,请务必确认提交的是「原始序列」还是「已转换序列」,如有疑问请提前沟通,避免因方向错误导致返工。 - sgRNA 序列不能有重复,若不同基因的 sgRNA 序列意外重复,需提前排查并沟通,避免运行失败或歧义计数。
- 确认是否包含非靶向对照(Non-Targeting):如有,请单独列出,并在
id/name中明确标注为Non-Targeting,便于后续下游分析时区分阴性对照。
3' CRISPR 参考表格填写示例(以您的实际情况来填写):
id,name,read,pattern,sequence,feature_type,target_gene_id,target_gene_name
ACTR8-1,ACTR8-1,R2,(BC)GTTTAAGAGCTAAGCTGGAA,GAAGGGCGGCGAGAAGGAGA,CRISPR Guide Capture,ENSG00000113812,ACTR8
ACTR8-2,ACTR8-2,R2,(BC)GTTTAAGAGCTAAGCTGGAA,GAGAACGGAAAGGAGAAGGG,CRISPR Guide Capture,ENSG00000113812,ACTR8
NEG_CTRL-1,NEG_CTRL-1,R2,(BC)GTTTAAGAGCTAAGCTGGAA,GACCGGGGGGGTGCGATGTA,CRISPR Guide Capture,Non-Targeting,Non-Targeting
NEG_CTRL-2,NEG_CTRL-2,R2,(BC)GTTTAAGAGCTAAGCTGGAA,GTGTACTAGTGACGACTATA,CRISPR Guide Capture,Non-Targeting,Non-Targeting5' CRISPR 参考表格填写示例(以您的实际情况来填写):
id,name,read,pattern,sequence,feature_type,target_gene_id,target_gene_name
ACTR8-1,ACTR8-1,R2,TTCCAGCTTAGCTCTTAAAC(BC),TCTCCTTCTCGCCGCCCTTC,CRISPR Guide Capture,ENSG00000113812,ACTR8
ACTR8-2,ACTR8-2,R2,TTCCAGCTTAGCTCTTAAAC(BC),CCCTTCTCCTTTCCGTTCTC,CRISPR Guide Capture,ENSG00000113812,ACTR8
NEG_CTRL-1,NEG_CTRL-1,R2,TTCCAGCTTAGCTCTTAAAC(BC),TACATCGCACCCCCCCGGTC,CRISPR Guide Capture,Non-Targeting,Non-Targeting
NEG_CTRL-2,NEG_CTRL-2,R2,TTCCAGCTTAGCTCTTAAAC(BC),TATAGTCGTCACTAGTACAC,CRISPR Guide Capture,Non-Targeting,Non-TargetingPattern 序列确认示例
示例产品为 5' + CRISPR,使用 Addgene: lentiCRISPR v2 产品,可直接在官网上确认 pattern 序列。
进入网页后,找到 sequence 序列中的 sgRNA scaffold 序列:




gRNA 转录本从 5' 到 3' 端的基本结构为:
5' — guide sequence(spacer) + sgRNA scaffold — 3'
- guide sequence:设计用于靶向特定基因的一段碱基序列,是实验中唯一变化的部分。
- sgRNA scaffold:同一载体系统中骨架序列固定不变,负责与 Cas9 蛋白结合。
因此,pattern 序列位于 scaffold 序列的 5' 端。考虑到序列长度需要适中(过长容易受测序错误影响,过短则不易准确识别),选择 scaffold 紧邻上游的 20 bp GTTTTAGAGCTAGAAATAGC 作为 pattern。又因 5' + CRISPR 实验为反向捕获,需取其反向互补序列,因此最终 pattern 序列为 GCTATTTCTAGCTCTAAAAC(BC)。
总体填写检查清单(提交前自查)
- [ ] 文件为 UTF-8 / ASCII 纯文本 CSV,无中文全角逗号、无 BOM 头。
- [ ] 表头列名严格为
id,name,read,pattern,sequence,feature_type,顺序不能打乱。 - [ ]
id全文件唯一,且不含空格、逗号、竖线。 - [ ]
read与pattern是否与所选建库化学(3' TotalSeq-A / B、5' TotalSeq-C、CRISPR、PTG)匹配。 - [ ]
sequence已核对为正确序列,长度与 pattern 中(BC)的预期长度一致。 - [ ]
feature_type填写正确:表面蛋白 →Antibody Capture;CRISPR →CRISPR Guide Capture;混样(Hashtag 方式)→Antibody Capture;混样(CMO 方式)→Multiplexing Capture。 - [ ] 若同时包含抗体检测与样本混样,两者信息合并在同一份 Feature Reference CSV 中。
- [ ] 确认具体产品组合(3' / 5'、是否 V(D)J、是否 CRISPR、是否混样)及各样本与标签的对应关系表。
如对以上任何一项不确定,请在提交前与我们联系确认,避免因文件格式或字段错误导致分析返工。
