问题排查

Sanger 测序长单核苷酸重复区失败原因与优化方案

PCR 产物里含 polyA、polyT 或长同聚核苷酸序列时,Sanger 测序常出现套峰、信号骤降、读长变短。本文从测序酶滑帧、模板二级结构、引物设计到测序试剂选择,系统给出可落地的优化方案。

更新于 2026-09-06 6 分钟
链接已复制到剪贴板

问题现象

当 PCR 产物中含有较长的单核苷酸重复序列(如 polyA、polyT、polyG、polyC,又称同聚核苷酸或 homopolymer stretch)时,Sanger 测序往往在重复区附近开始出现问题:

  • 信号骤降:重复区之后峰图突然变平,几乎无信号
  • 套峰/双峰:重复区开始出现重叠峰,后续序列全部错位
  • 读长变短:原本能测 800 bp 的模板,过了重复区只剩背景噪音
  • 碱基丢失:峰图显示的重复碱基数目与实际不符(通常偏少)

这种现象在 3’ UTR 区、polyA 尾、微卫星位点(如 A 重复、CA 重复)、低复杂度序列中非常常见。

根本原因:测序酶在重复区滑帧

Sanger 测序使用 DNA 聚合酶在模板上延伸新链。当模板上出现连续相同碱基时,聚合酶容易发生滑帧(slippage):

模板:  5' ...AAA AAA AAA... 3'
正常延伸:TTT TTT TTT
滑帧1:  TTT TTT TT       (少合一个 T)
滑帧2:  TTT TTT TTT T    (多合一个 T)

滑帧导致延伸产物长度不一,同一位置出现多个信号峰,形成套峰。重复越长,滑帧概率越高,信号衰减越严重。

不同重复类型的难度对比

重复类型典型长度测序难度原因
polyA / polyT>8 bp高A-T 只有 2 个氢键,链易滑移
polyG / polyC>6 bp极高G-C 三氢键,易形成二级结构(G-四链体)
混合重复(如 ATAT、CACACA)>10 bp中滑移概率低于纯同聚,但仍有风险
分散重复(间隔相同碱基)不限低每次只有 1-2 个相同碱基,不易滑帧

经验阈值:连续相同碱基超过 8 个(A/T)或 6 个(G/C)时,Sanger 测序质量会明显下降。

解决方案

方案一:从重复区两侧反向测序

最直接的策略是避开重复区,从重复序列的另一侧设计引物反向测序。

正向引物 → [polyA 重复区] ← 反向引物
              ↓
       两侧分别测,拼接结果

操作要点:

  1. 在重复区下游设计反向测序引物(距离重复区 50-100 bp 最佳)
  2. 正向测序获取重复区上游序列,反向测序获取下游序列
  3. 两段序列在重复区附近重叠,拼接得到完整序列

引物设计建议:

参数推荐值
引物长度18-22 nt
Tm55-60°C
GC 含量40%-60%
距重复区距离50-100 bp(避免引物结合在重复区)
3’ 端不要落在重复碱基上

注意:反向测序只能解决重复区下游的读长问题,重复区本身的精确长度仍可能不准确。如果需要精确计数重复碱基数目,需结合其他方法(见方案四)。

方案二:使用高保真测序酶或专用试剂

部分测序试剂针对高 GC 或长重复序列做了优化:

试剂/酶适用场景优势
BigDye Terminator v3.1通用对短重复效果好
BigDye Direct含高 GC 模板改善 GC 富集区测序
测序专用高保真酶(如 Phusion 测序版)长同聚重复减少滑帧
dGTP 类似物(如 dITP、7-deaza-dGTP)polyG/polyC破坏二级结构,减少滑移

如果是送商业测序,可以向测序公司说明模板含长单核苷酸重复,要求使用高 GC 缓冲液或专用测序 mix。

方案三:优化测序反应条件

调整测序反应参数也能改善长重复区的测序质量:

参数常规条件长重复优化条件
退火温度50-55°C提高到 58-60°C,减少非特异结合
延伸时间1 min/kb延长至 2-3 min/kb,让酶充分延伸
循环数25-30增加到 35-40 循环,提高信号强度
模板量10-50 ng适当增加到 50-100 ng,但避免过载
DMSO 添加剂0%加 5%-10% DMSO,破坏二级结构

对于 polyG/polyC 序列,DMSO 或甘油(5%-10%)能有效破坏 G-四链体等二级结构,是性价比最高的优化手段。

方案四:克隆后单克隆测序

如果上述方案都无法解决,可以将 PCR 产物克隆到载体后,挑取单克隆测序。

原理:直接测序时,PCR 产物本身就是异质的(不同分子的重复长度可能不同),导致套峰。克隆后每个菌落只含一种长度的模板,测序结果干净。

操作步骤:

  1. PCR 产物胶回收纯化
  2. 连接到 T 载体(如 pMD18-T、pGEM-T)
  3. 转化感受态细胞,涂板
  4. 挑取 5-10 个单菌落,PCR 验证后送测序
  5. 统计多个克隆的重复长度,取众数或报告分布

适用场景:

  • 需要精确知道重复碱基数目
  • 重复区长度 >15 bp
  • 直接测序完全无法读通

方案五:改用二代测序

对于极长重复(>30 bp)或复杂低复杂度序列,Sanger 测序本身能力有限,可以考虑:

方法读长适用场景
Illumina 测序150-300 bp重复区较短,但模板量大
PacBio SMRT10-50 kb长重复,单分子实时测序,酶滑帧少
Nanopore可达 Mb超长读长,能跨越大段重复

二代测序成本较高,仅在 Sanger 实在无法解决时考虑。

决策树:按重复长度选择方案

重复区长度 ≤ 8 bp(A/T)或 ≤ 6 bp(G/C)?
├─ 是 → 常规测序即可,必要时加 5% DMSO
└─ 否 → 重复区 ≤ 15 bp?
         ├─ 是 → 方案一(双侧引物测序)+ 方案三(优化条件)
         └─ 否 → 方案二(专用试剂)或 方案四(克隆测序)
                  └─ 仍不行 → 方案五(二代测序)

常见坑点

坑 1:把重复区套峰当成模板不纯

现象:重复区后全是套峰,以为是 PCR 有非特异扩增。

鉴别方法:检查套峰是否正好从重复区开始。如果是,大概率是滑帧而非非特异扩增。可以用 引物分析工具 检查产物序列中是否有长重复。

坑 2:引物设计在重复区上

现象:测序信号极弱或完全没有信号。

原因:引物结合在 polyA 区,无法特异退火。

解决:引物 3’ 端至少 3 个碱基不在重复区,整条引物中重复碱基不超过 50%。

坑 3:忽略 polyA 尾带来的信号衰减

现象:3’ UTR 区测序后半段信号很差。

原因:mRNA 的 polyA 尾在 cDNA 中形成长 polyT/polyA,测序酶滑帧。

解决:用 Oligo(dT) 反转录后,在 polyA 上游设计测序引物,跳过 polyA 区;或用随机引物反转录。

坑 4:DMSO 浓度过高抑制测序酶

现象:加了 15% DMSO 后完全无信号。

解决:DMSO 终浓度不要超过 10%,常用 5%。过高浓度会抑制测序酶活性。

结果解读:重复长度不准怎么办

即使测序成功,长重复区的精确碱基数目也可能有 ±1-2 bp 的误差。如果研究关注重复长度的精确值(如微卫星不稳定性检测),建议:

  1. 同时做正反向测序,取两者平均值
  2. 克隆测序 5-10 个单克隆,统计长度分布
  3. 用 Fragment Analysis(片段分析)或毛细管电泳精确测定片段大小

相关阅读

相关工具

继续用工具完成条件判断和计算

PCR 添加剂使用参考表

DMSO、BSA、Betaine、TMAC、Mg²⁺ 等 PCR 添加剂的推荐浓度、适用场景、作用机制与注意事项速查表。

立即使用
引物二聚体检测

辅助检查引物互补、长度和 GC 分布,定位潜在的二聚体风险。

立即使用
序列反向互补翻译

输入 DNA 序列,一键生成反向互补链、反向序列、互补链和六框翻译氨基酸序列。

立即使用
下一步排查

看完这页后,可以继续确认这些相邻问题

没有解决?

把你的实验现象发给 BioHelper

写下实验类型、异常表现、已经尝试过的操作和关键参数。后续会优先把真实问题整理成排查卡片或工具说明。

提交实验现象
本文用于科研实验排查与条件优化,不替代实验室 SOP、试剂说明书或医学判断。