问题现象
当 PCR 产物中含有较长的单核苷酸重复序列(如 polyA、polyT、polyG、polyC,又称同聚核苷酸或 homopolymer stretch)时,Sanger 测序往往在重复区附近开始出现问题:
- 信号骤降:重复区之后峰图突然变平,几乎无信号
- 套峰/双峰:重复区开始出现重叠峰,后续序列全部错位
- 读长变短:原本能测 800 bp 的模板,过了重复区只剩背景噪音
- 碱基丢失:峰图显示的重复碱基数目与实际不符(通常偏少)
这种现象在 3’ UTR 区、polyA 尾、微卫星位点(如 A 重复、CA 重复)、低复杂度序列中非常常见。
根本原因:测序酶在重复区滑帧
Sanger 测序使用 DNA 聚合酶在模板上延伸新链。当模板上出现连续相同碱基时,聚合酶容易发生滑帧(slippage):
模板: 5' ...AAA AAA AAA... 3'
正常延伸:TTT TTT TTT
滑帧1: TTT TTT TT (少合一个 T)
滑帧2: TTT TTT TTT T (多合一个 T)
滑帧导致延伸产物长度不一,同一位置出现多个信号峰,形成套峰。重复越长,滑帧概率越高,信号衰减越严重。
不同重复类型的难度对比
| 重复类型 | 典型长度 | 测序难度 | 原因 |
|---|---|---|---|
| polyA / polyT | >8 bp | 高 | A-T 只有 2 个氢键,链易滑移 |
| polyG / polyC | >6 bp | 极高 | G-C 三氢键,易形成二级结构(G-四链体) |
| 混合重复(如 ATAT、CACACA) | >10 bp | 中 | 滑移概率低于纯同聚,但仍有风险 |
| 分散重复(间隔相同碱基) | 不限 | 低 | 每次只有 1-2 个相同碱基,不易滑帧 |
经验阈值:连续相同碱基超过 8 个(A/T)或 6 个(G/C)时,Sanger 测序质量会明显下降。
解决方案
方案一:从重复区两侧反向测序
最直接的策略是避开重复区,从重复序列的另一侧设计引物反向测序。
正向引物 → [polyA 重复区] ← 反向引物
↓
两侧分别测,拼接结果
操作要点:
- 在重复区下游设计反向测序引物(距离重复区 50-100 bp 最佳)
- 正向测序获取重复区上游序列,反向测序获取下游序列
- 两段序列在重复区附近重叠,拼接得到完整序列
引物设计建议:
| 参数 | 推荐值 |
|---|---|
| 引物长度 | 18-22 nt |
| Tm | 55-60°C |
| GC 含量 | 40%-60% |
| 距重复区距离 | 50-100 bp(避免引物结合在重复区) |
| 3’ 端 | 不要落在重复碱基上 |
注意:反向测序只能解决重复区下游的读长问题,重复区本身的精确长度仍可能不准确。如果需要精确计数重复碱基数目,需结合其他方法(见方案四)。
方案二:使用高保真测序酶或专用试剂
部分测序试剂针对高 GC 或长重复序列做了优化:
| 试剂/酶 | 适用场景 | 优势 |
|---|---|---|
| BigDye Terminator v3.1 | 通用 | 对短重复效果好 |
| BigDye Direct | 含高 GC 模板 | 改善 GC 富集区测序 |
| 测序专用高保真酶(如 Phusion 测序版) | 长同聚重复 | 减少滑帧 |
| dGTP 类似物(如 dITP、7-deaza-dGTP) | polyG/polyC | 破坏二级结构,减少滑移 |
如果是送商业测序,可以向测序公司说明模板含长单核苷酸重复,要求使用高 GC 缓冲液或专用测序 mix。
方案三:优化测序反应条件
调整测序反应参数也能改善长重复区的测序质量:
| 参数 | 常规条件 | 长重复优化条件 |
|---|---|---|
| 退火温度 | 50-55°C | 提高到 58-60°C,减少非特异结合 |
| 延伸时间 | 1 min/kb | 延长至 2-3 min/kb,让酶充分延伸 |
| 循环数 | 25-30 | 增加到 35-40 循环,提高信号强度 |
| 模板量 | 10-50 ng | 适当增加到 50-100 ng,但避免过载 |
| DMSO 添加剂 | 0% | 加 5%-10% DMSO,破坏二级结构 |
对于 polyG/polyC 序列,DMSO 或甘油(5%-10%)能有效破坏 G-四链体等二级结构,是性价比最高的优化手段。
方案四:克隆后单克隆测序
如果上述方案都无法解决,可以将 PCR 产物克隆到载体后,挑取单克隆测序。
原理:直接测序时,PCR 产物本身就是异质的(不同分子的重复长度可能不同),导致套峰。克隆后每个菌落只含一种长度的模板,测序结果干净。
操作步骤:
- PCR 产物胶回收纯化
- 连接到 T 载体(如 pMD18-T、pGEM-T)
- 转化感受态细胞,涂板
- 挑取 5-10 个单菌落,PCR 验证后送测序
- 统计多个克隆的重复长度,取众数或报告分布
适用场景:
- 需要精确知道重复碱基数目
- 重复区长度 >15 bp
- 直接测序完全无法读通
方案五:改用二代测序
对于极长重复(>30 bp)或复杂低复杂度序列,Sanger 测序本身能力有限,可以考虑:
| 方法 | 读长 | 适用场景 |
|---|---|---|
| Illumina 测序 | 150-300 bp | 重复区较短,但模板量大 |
| PacBio SMRT | 10-50 kb | 长重复,单分子实时测序,酶滑帧少 |
| Nanopore | 可达 Mb | 超长读长,能跨越大段重复 |
二代测序成本较高,仅在 Sanger 实在无法解决时考虑。
决策树:按重复长度选择方案
重复区长度 ≤ 8 bp(A/T)或 ≤ 6 bp(G/C)?
├─ 是 → 常规测序即可,必要时加 5% DMSO
└─ 否 → 重复区 ≤ 15 bp?
├─ 是 → 方案一(双侧引物测序)+ 方案三(优化条件)
└─ 否 → 方案二(专用试剂)或 方案四(克隆测序)
└─ 仍不行 → 方案五(二代测序)
常见坑点
坑 1:把重复区套峰当成模板不纯
现象:重复区后全是套峰,以为是 PCR 有非特异扩增。
鉴别方法:检查套峰是否正好从重复区开始。如果是,大概率是滑帧而非非特异扩增。可以用 引物分析工具 检查产物序列中是否有长重复。
坑 2:引物设计在重复区上
现象:测序信号极弱或完全没有信号。
原因:引物结合在 polyA 区,无法特异退火。
解决:引物 3’ 端至少 3 个碱基不在重复区,整条引物中重复碱基不超过 50%。
坑 3:忽略 polyA 尾带来的信号衰减
现象:3’ UTR 区测序后半段信号很差。
原因:mRNA 的 polyA 尾在 cDNA 中形成长 polyT/polyA,测序酶滑帧。
解决:用 Oligo(dT) 反转录后,在 polyA 上游设计测序引物,跳过 polyA 区;或用随机引物反转录。
坑 4:DMSO 浓度过高抑制测序酶
现象:加了 15% DMSO 后完全无信号。
解决:DMSO 终浓度不要超过 10%,常用 5%。过高浓度会抑制测序酶活性。
结果解读:重复长度不准怎么办
即使测序成功,长重复区的精确碱基数目也可能有 ±1-2 bp 的误差。如果研究关注重复长度的精确值(如微卫星不稳定性检测),建议:
- 同时做正反向测序,取两者平均值
- 克隆测序 5-10 个单克隆,统计长度分布
- 用 Fragment Analysis(片段分析)或毛细管电泳精确测定片段大小
相关阅读
- PCR 产物直接测序套峰:实验层面原因与解决方案
- Sanger 测序峰图判读实战:套峰、杂合子与突变识别
- PCR 产物测序验证 SOP
- PCR 非特异性条带排查与优化
- 引物二聚体的识别与消除
- 模板质量检查与要求
- PCR 反应体系优化完整指南
- 长片段 PCR 优化策略