10x 单细胞建库 & 胶珠分选 核⼼原理详解 · ⾯向零基础读者 | 2026年7⽉ 阅读前提:本⽂不需要任何分⼦⽣物学背景。你需要⼀个直觉类⽐——快递分拣中⼼。10x 做的事情,本质 上就是给全城每个⼈⼀封信,贴上独⼀⽆⼆的房间号,然后混在⼀起也能分清谁是谁。 ⼀、核⼼类⽐:快递分拣中⼼ 你要给全城 10000 个⼈ 发问卷,但有三个变态要求: ① 每个⼈的问卷必须有独⼀⽆⼆的编号 ② 你不知道谁是谁——问卷回收后要能分清"这⼀份来⾃ A 先⽣还是 B ⼥⼠" ③ 所有⼈填完的问卷混在⼀个⼤箱⼦⾥,你仍然能知道每个答案来⾃哪个⼈ 10x 的解决⽅案:把每个⼈关进独⽴⼩房间 → 在每个房间⾥放⼀张带房间号的贴纸 → 让他在房间 ⾥填完问卷(贴纸贴在问卷上)→ 把所有问卷混在⼀起 → 靠房间号分清谁是谁。 ⼆、三步⾛完整个流程 第⼀步:把每个细胞关进独⽴"⼩房间"(GEM 液滴) 细胞悬液 + 胶珠悬液 + 油相 → 微流控芯⽚ → 上万个 GEM 液滴 GEM = Gel Bead-in-Emulsion:液滴⾥包着⼀颗胶珠 + ⼀个细胞 + 反应液。理想情况每个 液滴最多⼀个细胞、最多⼀颗胶珠。 怎么保证"刚好⼀个细胞"?纯靠概率。细胞浓度稀释到极稀,⼤部分液滴是空的或单细胞,双胞率 ⼈⼭⼈海 带编号贴纸 包裹液 分流闸机 独⽴⼩房间 控制在 <5%。空液滴在数据分析时⾃动排除。 第⼆步:每颗胶珠上都写了什么? 胶珠(Gel Bead)上密密麻麻挂着⼏⼗万条 DNA 短链,每条链有三个功能区: Cell Barcode + UMI + Poly(dT) 组成部分 快递分拣⽐喻 实际作⽤ Cell Barcode 房间号 同⼀颗胶珠上所有链共享同⼀个 Barcode(共 ~75 万 种),液滴内所有 mRNA 都被贴上同⼀个"房间号"—— 测序后就知道这个基因是从哪个细胞来的 UMI 快递单号 同⼀颗珠⼦上每条链的 UMI 不同(⼏百万种组合)。每 条 mRNA 分⼦都获得独⼀⽆⼆的"单号"——能区分"真的 ⾼表达"和"PCR 扩增出来的假重复" Poly(dT) 磁铁 mRNA 尾巴是 Poly(A)(⼀串 A),Poly(dT)(⼀串 T) 能像磁铁⼀样精准抓住它,把 mRNA 从裂解液⾥"钓"出 来 第三步:液滴内发⽣的⼀切("包裹⾥完成") 单个 GEM 液滴内部流程 16 个碱基 · 细胞身份证 同⼀颗珠⼦上所有链的 Barcode 完全相同 10-12 个碱基 · 分⼦防伪码 同⼀颗珠⼦上每条链的 UMI 各不相同 T 碱基重复序列 · 抓⼿ 抓住 mRNA 的 Poly(A) 尾巴 细胞裂解 细胞膜破裂 mRNA 释放到液滴中 → mRNA 被抓住 Poly(dT) 抓住 mRNA 的 Poly(A) 尾巴 → 逆转录 以 mRNA 为模板 逆转录成 cDNA → 标记完成 每条 cDNA ⾃带 Barcode + UMI 破乳 → 所有⼈ cDNA 混在⼀管 → 建库 + 测序 → Barcode → 哪个细胞 UMI → 真实表达量 三、胶珠分选:Barcode 是怎么做到每颗珠⼦不⼀样的? 核⼼技术:分割-混合法(Split-Pool Synthesis) 想象你要给 43 亿 个⼈每⼈发⼀个不重号的 16 位数字身份证。你可以这么做: 4 种碱基 (A/T/C/G) → 分成 4 个池 → 第 1 轮:各加 1 种 → 全部混合 → 再分 4 池 → 第 2 轮:各加 1 种 → 混合… …重复 16 轮 … 数学结果:4^16 = 4,294,967,296 种可能组合。实际 10x 基因组学使⽤ ~75 万种 Barcode——取 43 亿种可能性的⼀⼩部分,⾜够覆盖每个样本中的细胞数(通常⼏千到⼏万个)。 实际操作 为什么不会撞号? 打碎所有液滴 实际操作 胶珠悬浮在反应液中,每轮经过⼀个含特定 碱基的溶液池,珠⼦表⾯会加⻓⼀个碱基。 全部珠⼦混匀后再随机分⼊下⼀轮——就像 洗扑克牌⼀样,每轮洗⼀次,16 轮后顺序 完全不同。 为什么不会撞号? 两颗粒⼦ 16 轮⾛完全⼀样的路径的概率 = (1/4)^16 ≈ 2.3 × 10⁻¹⁰——也就是 43 亿分 之⼀。在实际细胞数(⼏千到⼏万)中,撞 号概率可以忽略不计。 四、为什么需要 UMI?(分⼦防伪码的核⼼价值) 没有 UMI 时 有 UMI 时 ⼀条 mRNA 被 PCR 扩增了 1000 倍 → 测 序读出 1000 条相同的序列 → 你以为这个基因表达了 1000 次 → 其实它只表达了 1 次 每条 mRNA 在反转录时被贴上不同的 UMI → PCR 扩增 1000 倍后,所有拷⻉共享同⼀ 个 UMI → 同⼀个 UMI 的所有 reads 只算作 1 个 分⼦ → 真实表达量被还原 简单记:Cell Barcode 回答"这个基因来⾃哪个细胞";UMI 回答"这个基因在这个细胞⾥真的表达了 ⼏个分⼦"。 五、常⻅新⼿问题 10x 和传统 RNA-seq 有什么区别? 传统 RNA-seq 把⼀堆细胞的 mRNA 混在⼀起测,只能得到"平均表达量"——你只知道这群细胞平均表达 了某个基因,但你不知道是"每个细胞都中等表达"还是"少数细胞极⾼表达、其余不表达"。10x 单细胞测 序告诉你:这⼀个细胞表达了基因 A 100 次,旁边那个细胞表达了 0 次。这就是"单细胞分辨率"。 胶珠分选和流式分选(FACS)有什么不同? FACS 是⽤激光识别细胞表⾯标志物,然后⼀个⼀个挑出来——你需要事先知道要找什么标志物。10x 不 挑细胞——它会⽆差别地把所有细胞包进液滴,然后通过 RNA 表达谱"反向发现"细胞类型。FACS 是"我 知道我要谁的 CD4+ T 细胞";10x 是"我不知道这群细胞⾥有什么,让我把所有细胞都测⼀遍,再分类"。 空液滴和双胞怎么办? 空液滴:⾥⾯没有细胞,⾃然没有 mRNA。测序后这些液滴的 UMI 计数极低或为零,数据分析时⾃动过 滤。 双胞:两个细胞进了同⼀个液滴,会共⽤同⼀个 Barcode。如果两个细胞类型不同,它们的混合表达谱像 ⼀个"四不像"——分析软件能识别为双胞并剔除。如果两个同类型细胞形成双胞,确实难以检测,但概率 很低。 10x 能做多少个细胞? 最新 Chromium X 系列可以⼀次处理 500-20,000 个细胞,⾼通量版本可以到 100,000+ 个细胞。对 于单样本来说,1000-10000 个细胞是最常⻅的范围。⼀次实验的成本⼤约 ¥5000-20000 / 样本(不包 括测序)。 六、⼀张图总结全流程 ┌─────────────────┐ 细胞悬液 ──────────→ │ │ 胶珠悬液 ──────────→ │ 微流控芯⽚ │──→ 上万个 GEM 液滴 油相 ──────────→ │ (每秒产上万个液滴) │ │ │ └─────────────────┘ 单个 GEM 液滴内部: 测序后分析: ┌──────────────────┐ ┌──────────────────┐ │ 1 个细胞 │ │ Barcode → 来⾃哪个细胞 │ │ ↓ 裂解 │ │ UMI → 真实表达量 │ │ mRNA 释放 │ │ 基因 → 表达了什么 │ │ ↓ │ └──────────────────┘ │ 胶珠(Barcode+UMI) │ │ ↓ Poly(dT) 抓 mRNA│ │ 逆转录 → cDNA │ │ ↓ │ │ 每条 cDNA = │ │ Barcode + UMI + 基因 │ └──────────────────┘ 核⼼思想⼀句话:把每个细胞关进独⽴⼩房间(GEM 液滴)→ 在每个房间⾥贴⼀张带房间号的 标签(胶珠 Barcode)+ 每份问卷贴⼀张快递单号(UMI)→ 拆掉所有墙把问卷混在⼀起(破乳)→ 靠房间号分清每个⼈(⽣信分析)。 10x 单细胞建库核⼼原理解析 | ⾯向零基础读者 关键参考⽂献:10x Genomics Chromium Single Cell Gene Expression官⽅技术⽂档 | Zheng et al., Nature Communications 2017