概述
Sanger 测序是分子生物学中最常用的序列验证手段。与 NGS 不同,Sanger 测序每次反应只读取一条 DNA 链,结果以峰图(chromatogram)形式呈现。正确判读峰图不仅能确认目标序列是否正确,还能发现杂合突变、SNP、插入缺失和测序质量问题。
本文面向日常克隆、基因分型和突变验证场景,帮助你在拿到 ab1 文件后快速做出判断,避免被测序公司的原始报告误导。
峰图基础
峰图文件格式
| 格式 | 说明 | 常用打开工具 |
|---|---|---|
| .ab1 | ABI 原始峰图文件 | Chromas, SnapGene, SnapGene Viewer, BioEdit |
| .scf | 标准色谱图格式 | FinchTV, 4peaks |
| .fasta/.seq | 仅序列文本 | 任何文本编辑器 |
建议 always 保留原始 .ab1 文件,不要只保存 .seq 文本。峰图中的质量信息无法从纯文本中恢复。
四色荧光含义
| 颜色 | 碱基 | 激光通道 |
|---|---|---|
| 绿色 | A | dRhodamine 或 BigDye |
| 蓝色 | C | |
| 黑色/灰色 | G | |
| 红色 | T |
不同测序公司或试剂版本颜色可能略有差异,打开软件时先确认图例。
高质量峰图特征
- 峰形尖锐、对称,峰顶清晰
- 相邻峰间距均匀
- 背景噪音低,基线平稳
- 信噪比(Q value 或 Phred score)≥ 20
- 无明显重叠峰或套峰
峰图质量评估
Phred 质量值与判读
| Q value | 碱基准确率 | 判读 |
|---|---|---|
| ≥ 30 | 99.9% | 优秀 |
| 20-29 | 99% | 良好,可接受 |
| 10-19 | 90% | 较差,需谨慎 |
| < 10 | < 90% | 不可靠,通常舍弃 |
前 50-100 bp 和后 100-200 bp 的序列通常质量较低,这是因为毛细管电泳起始和末端分辨率下降导致的正常现象。
可读区间判断
拿到峰图后,建议先定位高质量区间:
- 找到第一个清晰、无重叠的峰作为起始
- 向后拖动,观察峰形何时开始模糊、套峰或噪音升高
- 通常有效读长在 500-900 bp 之间,超过 1000 bp 后质量快速下降
- 只截取 Q ≥ 20 的区间用于后续分析
常见峰图异常与判读
1. 套峰(Overlapping peaks / Mixed peaks)
特征: 同一位置出现两个或多个颜色叠加的峰,峰高明显降低或峰形变宽。
常见原因与处理:
| 套峰类型 | 典型表现 | 原因 | 处理 |
|---|---|---|---|
| 局部套峰 | 仅某一位置出现双峰 | 杂合突变 / SNP | 记录为杂合位点 |
| 连续套峰 | 从某一位点开始后面全是套峰 | 模板不纯 / 多克隆混合 | 重新制备模板 |
| 周期套峰 | 规律性的双峰 | 引物二聚体或重复序列 | 重新设计引物 |
| 末端套峰 | 仅序列末端有重叠 | 测序读长极限 | 忽略末端区域 |
2. 杂合子识别
杂合子(Heterozygote)在 Sanger 测序中表现为同一位置两个等位碱基同时出现,峰高约为野生型的一半。
判读要点:
- 两个峰基线对齐,几乎同时起始和终止
- 两个峰高度接近 1:1
- 周围序列质量好,无连续套峰
- 不会从该位点开始向后的序列全部套峰
示例:
| 位点 | 野生型 | 杂合突变 | 判读 |
|---|---|---|---|
| 第 156 位 | 单个 A 峰 | A 和 G 双峰等高 | A/G 杂合 |
| 第 289 位 | 单个 C 峰 | C 和 T 双峰,T 峰较弱 | 可能为低丰度嵌合或污染 |
如果怀疑是杂合子,建议反向测序确认,或改用位点特异性 PCR、RFLP、NGS 验证。
3. 纯合突变识别
纯合突变表现为单个碱基与参考序列不同,但峰图本身清晰单一。
注意事项:
- 单个碱基替换容易被识别
- 小的插入/缺失(1-3 bp)可能导致该位点后移码套峰
- 大片段缺失/插入通常无法通过 Sanger 直接判读,需要设计跨区引物
4. 引物二聚体峰
特征: 测序起始端(前 30-50 bp)出现大量密集、低而尖锐的小峰。
原因: 测序引物与自身或引物二聚体被延伸。
处理:
- 重新纯化 PCR 产物,去除残留引物
- 提高测序引物 Tm,优化反应条件
- 必要时重新设计引物
5. 重复序列区域的压缩峰
特征: poly-A/T/C/G 区域峰形压缩、变窄,甚至相邻峰合并。
原因: DNA 聚合酶在均聚物区域容易发生滑脱。
处理:
- 单端测序时该区域结果仅供参考
- 改用反向测序覆盖该区域
- 对于关键位点,设计避开均聚物的测序策略
6. 染料峰(Dye blob)
特征: 序列起始区域出现一个或多个宽而低的彩色峰,不对应真实碱基。
原因: 未完全去除的荧光染料分子被检测。
处理: dye blob 通常在起始端,不影响后续序列判读,只需在分析时跳过该区域。
突变分析实战流程
步骤一:导入参考序列
- 在 SnapGene 或 Chromas 中打开 .ab1 文件
- 导入预期参考序列(如载体序列、野生型序列)
- 开启序列比对功能,软件会自动标记差异位点
步骤二:逐峰检查差异位点
不要只看软件自动生成的 .seq 文本。对每个差异位点:
- 放大该区域,观察峰形
- 判断是单峰还是套峰
- 确认周围序列是否清晰
- 排除测序错误和噪音
步骤三:区分真实突变与假象
| 情况 | 峰图表现 | 结论 |
|---|---|---|
| 单个碱基替换,峰形清晰 | 单峰,质量 Q > 20 | 真实突变或 SNP |
| 单个碱基替换,质量差 | 峰形模糊,Q < 15 | 可能为测序错误,需重测 |
| 双峰,高度相近 | 两个峰基线对齐 | 杂合突变 |
| 双峰后全部套峰 | 从某点开始连续重叠 | 模板混合或多克隆 |
| 重复序列区差异 | 峰形压缩 | 可能是聚合酶滑脱,需反向验证 |
步骤四:交叉验证
对于关键突变:
- 设计反向测序引物,从另一侧覆盖突变位点
- 或改用限制性酶切、等位基因特异性 PCR 验证
- 对于杂合子,建议 NGS 或克隆后单克隆测序确认
克隆测序中的特殊问题
多克隆混合
挑取菌落时如果挑到多个克隆,测序结果会出现连续套峰。表现:
- 从某个位点开始,后续所有峰都是套峰
- 套峰比例不一定相等
- 反向测序结果同样套峰
解决: 重新挑取单克隆,或从原始平板划单菌落。
载体引物测序的方向
使用 M13F/M13R 等通用引物测序时,注意:
- 峰图序列方向与插入片段方向可能相反
- 需根据载体图谱确定 reads 方向
- 多克隆位点附近的载体序列应提前裁剪
突变位点靠近引物
如果目标突变距离测序引物太近(< 50 bp),可能处于低质量起始区,难以判读。
解决: 设计靠近突变位点但距离适中的内部测序引物。
常见样本问题导致的峰图异常
| 峰图问题 | 最可能原因 | 首选解决方案 |
|---|---|---|
| 整体信号弱 | 模板浓度低 | 增加模板量至 20-100 ng |
| 全部套峰 | 模板不纯 / 多克隆 | 重新纯化或挑单克隆 |
| 前端大量 dye blob | 纯化不彻底 | 重新纯化 PCR 产物 |
| 中途信号衰减 | 模板二级结构 | 提高变性温度或加 DMSO |
| 峰形过宽 | 模板量过高或盐分过多 | 稀释模板或重新纯化 |
| 周期性弱峰 | 引物二聚体干扰 | 优化 PCR 条件 |
结果记录与报告
完成判读后,建议记录:
| 项目 | 内容 |
|---|---|
| 测序引物 | 名称、序列、位置 |
| 可读区间 | 起始位点 - 终止位点 |
| 平均 Q value | 如 32.5 |
| 突变位点 | 坐标、突变类型、杂合/纯合 |
| 与参考序列一致性 | 如 99.2% |
| 备注 | 套峰、均聚物区、低质量区等 |
工具推荐
| 工具 | 平台 | 特点 |
|---|---|---|
| SnapGene | Win/Mac | 功能全面,适合日常克隆 |
| Chromas | Win | 轻量级,打开 ab1 快速 |
| FinchTV | Win/Mac | 免费,基础判读够用 |
| 4peaks | Mac | 界面简洁,适合 Mac 用户 |
| NCBI BLAST | 在线 | 序列比对和验证 |
| Ensembl Variant Effect Predictor | 在线 | 突变功能注释 |
速查决策树
打开 ab1 峰图
│
├─ 整体质量差(Q < 20 区域过多)
│ └─ 重新制备模板测序
│
├─ 局部单个位点双峰
│ ├─ 峰高等高、基线对齐 → 杂合突变
│ └─ 峰高不等 → 可能是污染或嵌合,需验证
│
├─ 从某位点开始连续套峰
│ └─ 模板不纯 / 多克隆,重新制备
│
├─ 均聚物区压缩
│ └─ 聚合酶滑脱,反向测序确认
│
└─ 单个碱基与参考不同,峰形清晰
└─ 真实突变,建议反向验证后确认
总结
Sanger 测序峰图判读是一项需要经验积累的技能。核心原则是:不要只看软件生成的文本序列,必须回到原始峰图逐峰确认。套峰不等于杂合子,突变需要峰形和方向双重验证。规范的判读流程能显著提高克隆成功率和突变分析准确性,避免被低质量数据误导。