为什么 80% 的 Gibson 失败其实在设计阶段就注定了
Gibson Assembly(Gibson 等温一步法)看起来很神奇:把若干带末端重叠的 DNA 片段和三种酶(T5 外切酶、Phusion 聚合酶、Taq 连接酶)混在一起,50°C 孵育几十分钟,就能无缝拼接成完整质粒。但真正上手时,许多同学遇到的却是无菌落、阳性率低、拼接错位或序列缺失。
已有文章 gibson-assembly-failure 从故障排查角度分析了”已经失败了怎么办”,但绝大多数失败的根因其实在引物下单那一刻就埋下了:重叠区太短无法退火、GC 过高形成二级结构、载体末端设计错误产生自连背景、片段摩尔比不对……这些问题,一旦进入组装反应阶段几乎无法补救。
本文聚焦设计阶段的正向操作 SOP:从重叠区参数、片段拆分策略、载体线性化方式、引物序列设计、摩尔数与质量换算,到最终的设计自查清单,一步步帮你把 Gibson 成功率从”碰运气”变成”可重复”。
Gibson 三酶系统与末端重叠的基本原理
在谈设计之前,先快速理解反应原理,因为设计原则都是从原理推导出来的:
| 酶成分 | 作用 | 设计启示 |
|---|---|---|
| T5 外切酶(5’→3’ 外切) | 从双链 DNA 的 5’ 端切出 3’ 单链突出末端,使相邻片段的重叠区暴露并互补退火 | 重叠区必须在 5’ 端,长度要足够让 T5 切完后仍有 15–25 nt 的互补单链 |
| Phusion 聚合酶 | 补平退火后产生的缺口(5’→3’ 合成,3’→5’ 校对) | 退火后 3’ 端必须是正确配对的起始点;重叠区 3’ 端若有错配则无法延伸 |
| Taq 连接酶 | 将相邻链的 3’—OH 和 5’—P 缺口封合,形成完整环状质粒 | 连接处 5’ 必须是磷酸化的(PCR 产物引物如果是普通合成的就没问题,限制性酶切载体 5’ 自带磷酸) |
核心结论:相邻两个片段的末端 15–40 bp 必须 100% 反向互补,且这段序列决定了退火的稳定性和特异性。
一、重叠区(Overlap)设计参数表
这是整篇文章最重要的一张表。请在设计引物时严格对照:
| 参数 | 推荐值 | 允许范围 | 超限后果 | 特殊说明 |
|---|---|---|---|---|
| 重叠长度 | 20–30 bp | 15–40 bp | <15 bp 退火不稳阳性率骤降;>40 bp 易形成发夹或串联重复 | 片段越多(4+)越要偏向 25–30 bp |
| 重叠区 GC 含量 | 40%–60% | 35%–65% | <35% Tm 低难以稳定退火;>65% 易形成二级结构和非特异性 | 若序列本身高 GC,可适当拉长重叠长度到 30 bp 补偿 Tm |
| 重叠区 Tm(近邻法) | 48–56°C | 45–60°C | 低于反应温度太多会无法稳定退火 | 用 NEB Tm Calculator 或 SnapGene 计算,不要用 4×GC+2×AT 粗算 |
| 连续相同碱基 | ≤ 4 bp | — | A/T 连续 >4 bp 产生”呼吸”效应解链;G/C 连续 >4 bp 产生强发夹 | 设计时有意把重叠区”换位置”避开 poly-A/T 区 |
| 回文 / 发夹结构 | ΔG ≥ −3 kcal/mol | ≥ −5 kcal/mol | 自身发夹会和互补退火竞争,严重时完全不组装 | 用 OligoCalc 或 SnapGene Hairpin 检查 |
| 二聚体 ΔG | ≥ −5 kcal/mol | ≥ −7 kcal/mol | 重叠区与自身或其他片段 3’ 端形成强二聚体,会被聚合酶延伸出杂带 | 用 primer-analysis 工具排查 |
| 编码区拼接 | 不引入移码 / 不改变氨基酸 | — | 重叠区跨越 CDS 时,错 1 bp 就移码,错 3 bp 就改变一级序列 | 最容易犯的错:酶切位点后加 2 bp 做重叠,结果移码 |
| 重叠位置 | 避开末端 3 bp 内含限制酶识别位点 | — | 后续验证酶切时可能把连接点切断 | 连接位点尽量设计在无常见酶切位点的区域 |
为什么不推荐所有实验都用 15 bp 最短重叠?
15 bp 重叠在”理想条件”(40%–60% GC、无二聚体、2 片段)下可行,但容错率极低:只要引物合成有 1 个 n-1 缺失,或者 PCR 引入 1 个错配落在重叠区内,15 bp 的退火稳定性就会直接垮掉。默认用 25 bp 会让你省下大量重复实验的时间。
二、片段拆分策略:在哪切、切几段
把目标序列拆成多少片段、每个片段多长,直接决定了组装难度和成功概率。
片段数 × 总长度推荐表
| 组装场景 | 片段数 | 单片段长度范围 | 预期阳性率 | 难度等级 |
|---|---|---|---|---|
| 单片段插入(最常见) | 2 片段(载体 + 插入) | 插入 100 bp–10 kb | >85% | ⭐ 入门 |
| 中等复杂构建 | 3–4 片段 | 每段 300 bp–5 kb | 50%–80% | ⭐⭐ 常规 |
| 复杂通路 / 多基因 | 5–6 片段 | 每段 200 bp–3 kb | 20%–50% | ⭐⭐⭐ 进阶 |
| 超大组装 | >6 片段 或单段 >15 kb | 视情况 | <20%,强烈不推荐一次硬拼 | ⭐⭐⭐⭐ 换方法 |
经验法则:如果你是第一次做 Gibson,从 2 片段(载体 + 1 插入)开始。很多同学一上来就想 5 片段拼 15 kb,结果失败了完全不知道问题出在哪。
拆分位点怎么选:3 个优先级
- 优先选天然存在的”无功能区”:如载体上多克隆位点两端、CDS 之间的 linker、UTR 中间等,避免把功能域或蛋白编码区硬从中间打断。
- 次选 GC 均匀、无重复序列的区域:重叠区就是两个片段的接头,接头序列本身要”干净”。
- 最后才考虑长度均分:如果 2 和 3 片段差不多,才考虑让各片段大致相等(便于定量)。
拆分反例:这些位点千万别做连接点
| 反例 | 后果 |
|---|---|
| 刚好在 ATG 起始密码子前面 10 bp 以内 | 破坏 5’ UTR 结构和核糖体结合效率,表达量骤降 |
| 刚好截断信号肽 / 核定位信号等短功能元件 | 信号肽被一劈两半后即使拼上也常常折叠错误,功能失效 |
| 刚好在 poly-A 尾或 GC-rich 结构域中央 | 重叠区序列差,退火不稳定 |
| 刚好在常见限制酶识别位点上 | 后续用该酶做验证时把质粒切碎,无法正确判断连接产物 |
三、载体线性化方式选择:双酶切 vs 反向 PCR + DpnI
载体制备占 Gibson 背景高低的 70%,两种方法各有适用场景:
方法对比决策表
| 维度 | 双酶切法 | 反向 PCR 法(线性扩增 + DpnI) |
|---|---|---|
| 适用场景 | 多克隆位点两端有合适的酶;需要极低自连背景 | 多克隆位点没合适酶;想完全无缝(不残留酶切位点末端) |
| 操作步骤 | 双酶切 2–4 h → 切胶回收 / 柱纯化 | 高保真 PCR 线性扩增 → DpnI 37°C 1–2 h 消模板 → 柱纯化 |
| 自连背景 | 极低(双酶切两端不匹配) | 稍高(DpnI 消化不彻底时会残留超螺旋模板) |
| 末端平整度 | 取决于所选酶(可能有 5’ 突出、3’ 突出或平端) | 绝对平端(Phusion 产物),对 Gibson 最友好 |
| 载体大小限制 | 几乎无限制(>15 kb 也能切) | >10 kb 时 PCR 扩增易出错,保真性下降 |
| 引入突变风险 | 无 | PCR 错配可能引入突变(>10 kb 建议送部分测序) |
| 酶切后残留碱基 | 有 2–6 bp 的”酶切脚”,如果位点在 CDS 里可能移码 | 完全无缝,连接点 0 额外碱基 |
反向 PCR 扩增载体的关键要点(容易忽略)
- 引物方向必须是”背靠背”(Back-to-Back):正向引物 5’→3’ 沿质粒顺时针,反向引物则逆时针,两个引物之间的区域是被扩增的”载体骨架”,而不是被删除的部分。设计前把序列文件调出来确认一遍,否则扩增出来是反过来的,整个构建全废。
- 5’ 端必须带重叠区:反向 PCR 产物两端就是载体和插入片段的接头,因此每条载体引物的 5’ 端要加 20–30 bp 的重叠序列,分别和两个相邻插入片段互补。
- DpnI 必须足量且彻底:模板质粒(通常是小提的)是 dam+ 甲基化的,DpnI 只切甲基化 GATC 位点;但如果消化时间不够或酶量不够,残留超螺旋质粒会转化后长出密密麻麻的假阳性,让你误以为 Gibson 成功了。推荐:100 µL PCR 产物加 1 µL DpnI(20 U),37°C 孵育 2 h,不要偷懒只放 30 分钟。
四、引物序列完整设计实例(2 片段插入)
下面用一个最常见的场景:把 1.8 kb 的 ORF 插入 pET-28a(+) 的 NcoI / XhoI 之间,完全无缝(不保留酶切位点多余碱基),演示完整设计步骤。
方案选择:反向 PCR 线性化载体(因为要完全无缝不残留酶切位点)
步骤 1:确定载体上的”插入位置”
- pET-28a(+) 上 NcoI(CCATGG)含 ATG 起始,XhoI(CTCGAG)在 His-tag 上游
- 我们要把 ORF 直接插到 ATG 后、His-tag 之前,所以连接点就在:
- 载体左端点:NcoI 切开后的 ATG 开头位置(保留 ATG,后面直接接 ORF 的第 2 个密码子)
- 载体右端点:XhoI 之后 His-tag 前的氨基酸编码区
步骤 2:画出四个引物的组成结构
每个引物 = 5’ 端重叠区(20–30 bp)+ 3’ 端特异性结合区(18–25 bp,Tm ~60°C)
| 引物名称 | 5’ 端(20–30 bp 重叠) | 3’ 端(特异性结合区 ~20 bp) |
|---|---|---|
| F-载体(反向 PCR 左引物) | 和插入片段 3’ 端末尾 25 bp 相同(正向链) | 结合 pET-28a 上 XhoI 下游质粒骨架区 |
| R-载体(反向 PCR 右引物) | 和插入片段 5’ 端开头 25 bp 的反向互补相同 | 结合 pET-28a 上 NcoI 上游(ATG 处)质粒骨架 |
| F-插入(扩增 ORF 正向) | 和 R-载体 5’ 端的 25 bp 相同(即载体右端 25 bp) | 结合 ORF 5’ 端特异性序列(不含 ATG,因为载体已有 ATG) |
| R-插入(扩增 ORF 反向) | 和 F-载体 5’ 端的 25 bp 反向互补相同(即载体左端 25 bp 的 RC) | 结合 ORF 3’ 端特异性序列(去掉终止密码子,因为后面要接 His-tag) |
读起来有点绕,实际上最简单的方法是:把”期望得到的最终质粒序列”在两个连接点之间分别取 25 bp,左边那段就是 F-载体 5’ 端和 R-插入 5’ 端的序列;右边那段就是 R-载体 5’ 端和 F-插入 5’ 端的序列。 然后每条引物的 3’ 端接特异性扩增区。建议用 SnapGene / Geneious 等软件直接在序列上标注,比手动写不容易错。
步骤 3:用工具验证每一条引物
把设计好的 4 条引物分别复制到 primer-analysis 里检查:
- Tm 是否在 58–62°C 之间(PCR 扩增区的 Tm)
- 有无发夹(Hairpin ΔG < −5 kcal/mol 的要改)
- 有无二聚体(尤其是 F-载体和 R-载体之间、F-插入和 R-插入之间)
- GC clamp:3’ 端最好有 1–2 个 G/C,但不要连续 3 个以上
五、片段定量与摩尔比换算
Gibson 反应的”黄金比例”是载体 : 每段插入片段 = 1 : 2(摩尔比),而不是质量比。很多同学直接照 50 ng 载体 + 50 ng 插入片段来加,结果如果插入片段比载体小很多,分子数就严重过量(产生多拷贝串联)或不足(阳性率低)。
摩尔数与纳克质量换算公式
pmol = ng × 1000 ÷ (bp × 650)
ng = pmol × bp × 650 ÷ 1000
650 是 1 bp 双链 DNA 的近似平均分子量(g/mol·bp)。单链 DNA / RNA 用 330。
也可以直接用 molecular-weight-calculator 和 copy-number-calculator 快速换算。
不同片段数的推荐加样总表(10 µL 体系)
| 片段数 | 载体 pmol 用量 | 每段插入 pmol 用量 | 载体典型质量(按 5 kb 算) | 插入典型质量(按 2 kb / 段算) |
|---|---|---|---|---|
| 2 片段(1 插入) | 0.03 pmol | 0.06 pmol(1:2) | ~100 ng | ~40 ng |
| 3 片段(2 插入) | 0.04 pmol | 每段 0.08 pmol | ~130 ng | 每段 ~52 ng |
| 4–5 片段 | 0.06 pmol | 每段 0.12 pmol | ~195 ng | 每段 ~78 ng |
| 6 片段 | 0.1 pmol | 每段 0.2 pmol | ~325 ng | 每段 ~130 ng |
实际操作建议:先用 NanoDrop 或 Qubit 测每段 DNA 浓度(ng/µL),再按上表或计算器算出每样需要加多少 µL。总体积不要超过 Gibson 酶体系的 50%(即 10 µL 体系中 DNA 加起来不要超过 4–5 µL,因为酶和缓冲液要占 5 µL)。
六、最终设计自查清单(每条引物设计完都勾一遍)
重叠区检查
- 相邻片段重叠区长度 ≥20 bp(4 片段以上 ≥25 bp)
- 重叠区 GC 在 40%–60% 之间,Tm 在 48–56°C 之间
- 重叠区内无连续 >4 个相同碱基
- 重叠区 Hairpin ΔG ≥ −3 kcal/mol
- 如果重叠区跨 CDS,确认 不移码、氨基酸不改变(或符合预期突变)
- 每对相邻片段的重叠区 100% 互补(没有 1 bp 错配)
引物扩增区检查
- 每个引物 3’ 端特异性结合区长度 18–25 bp,Tm 58–62°C
- 反向 PCR 载体引物是背靠背方向(不要扩增反了)
- 所有引物之间(尤其是同管 PCR 的 F/R)无强二聚体
- 3’ 端不是连续 3 个以上 A/T(防止滑配)
最终产物逻辑检查
- 连接后质粒的期望序列拼出来是正确的(把所有片段在文本编辑器里连接一遍,或用 SnapGene 模拟组装)
- 抗生素抗性、复制起点、启动子、终止子都完整
- 验证用的酶切位点在预期长度会出现预期条带
常见设计错误与避坑
坑 1:重叠区和扩增区之间多了一个酶切位点”脚”
双酶切载体 + 插入片段做 Gibson 时,同学经常在设计插入引物时把载体末端那 4 个突出的碱基也算进重叠区——结果最终连接点多了 4 bp,CDS 里直接移码。解决方法:先写出最终期望的完美质粒序列,再从里面截取重叠区,不要从”酶切后的载体序列”里直接取。
坑 2:三片段以上组装时中间片段两端的 Tm 不匹配
中间片段的左侧重叠和右侧重叠 Tm 相差 >10°C,会导致一端已经退火连接了,另一端还没稳定结合。要求:同一引物上的两侧重叠和扩增区 Tm 差距 <5°C。
坑 3:反向 PCR 载体方向设计反了
最隐蔽的错误。扩增产物测序看骨架序列,结果是反的——此时所有重叠区也都是反的,组装完全不工作。预防:在 F-载体的 3’ 端特异性结合区上选 20 bp,去质粒序列里 BLAST 一下,看方向对不对,或者引物下单前把整段 PCR 产物的模拟序列在 SnapGene 里比对到参考质粒。
坑 4:PCR 产物直接加,不过柱也不切胶
引物二聚体(即使只有几十 bp)末端和载体的短重叠序列如果意外互补,也会被 T5 外切酶处理后连接,最终产生大量”载体+二聚体”的假阳性克隆。所有 PCR 产物(无论 Marker 看起来多干净)都必须过柱或切胶回收。
设计工具速查表
| 工具 / 网页 | 用途 | 适用场景 |
|---|---|---|
| NEBuilder Assembly Tool(NEBuilder 官网) | 自动设计 Gibson / HiFi 组装引物,支持多片段、自动检查 Tm | 新手首选,准确率高 |
| SnapGene Gibson Assembly(软件) | 可视化拖拽,模拟组装后质粒,自动生成引物清单 | 实验室有 License 时用最顺手 |
| primer-analysis(本站工具) | 批量检查 Tm、GC、二聚体、发夹、特异性 | 手动设计完必走一步验证 |
| sequence-manipulation(本站工具) | 反向互补、翻译、酶切位点查找、序列拼接 | 手动拼序列、检查移码 |
| molarity-converter(本站工具) | 输入片段 bp 和目标浓度,直接给出称量/加样质量 | 摩尔比换算时用 |
按本文 SOP 先设计、再验证、后组装,2–3 片段的 Gibson 组装几乎可以做到每次都有阳性克隆,测序正确率 >80%。如果仍然失败,可以回过头看 gibson-assembly-failure 的故障排查篇,那里覆盖了酶活性、转化条件、DNA 质量等下游环节的问题。