为什么需要操作 DNA 序列
做分子生物学实验,几乎每天都在跟序列打交道:
- 设计 qPCR / PCR 引物时,反向引物要跟模板的哪条链互补?
- TA 克隆后送测序,反向测通了,怎么拼起来找到插入的方向?
- 构建过表达质粒,想确认 CDS 序列有没有移码突变,怎么把 DNA 翻译成氨基酸?
- ChIP-qPCR 验证某个启动子区域,想在基因组上设计跨外显子 / 内含子边界的引物……
不熟悉序列链的方向、互补规则、读码框判断,实验设计阶段就容易踩坑,结果就是:PCR 永远扩不出、克隆永远是反的、测序永远找不到 ORF。
先理清概念:正链 / 负链、方向、互补
正链与负链
DNA 是双链反平行螺旋,两条链方向相反。在基因组数据库、序列文件(FASTA/GenBank)里,我们看到的通常是 5′→3′ 方向的正义链(+ 链,也叫编码链、正链),它的序列与转录出的 mRNA 一致(T 换成 U)。与之互补的另一条链是 − 链(反义链、模板链)。
关键点:RNA 聚合酶以 − 链为模板合成 mRNA,所以 mRNA 的序列与 + 链一致,与 − 链互补。
四种基本变换
假设我们有一段 DNA 序列(5′→3′ 正链):
5′-ATG GCT TAA GCA-3′
变换方式如下:
| 变换 | 结果(5′→3′) | 用在哪里 |
|---|---|---|
| 反向 (Reverse) | ACG AAT TCG GTA | 把序列从右往左倒过来,本身无独立生物学意义 |
| 互补 (Complement) | TAC CGA ATT CGT | 另一条链的 3′→5′ 序列(注意:互补后要再反向才是另一条链的 5′→3′ 方向) |
| 反向互补 (Reverse Complement, RC) | TGC TTA AGC CAT | 另一条链的 5′→3′ 序列(最常用!) |
| 原始 + 链 | ATG GCT TAA GCA | 数据库中给出的正义链 |
⚠️ 90% 的序列误操作都在这里:很多同学以为 “互补” 就等于另一条链 5′→3′ 序列,其实不对——必须是反向 + 互补组合使用才对。只做互补,得到的是 3′→5′ 的反义链,顺序反了。
碱基互补配对规则
记住标准配对:
- A ↔ T(DNA)
- A ↔ U(RNA)
- G ↔ C
简并碱基(常用于简并引物设计):
- R = A/G(嘌呤 puRine)
- Y = C/T(嘧啶 pYrimidine)
- S = G/C(Strong,3 个氢键)
- W = A/T(Weak,2 个氢键)
- K = G/T(Ketone,酮基)
- M = A/C(aMino,氨基)
- B = C/G/T(A 之外)
- D = A/G/T(C 之外)
- H = A/C/T(G 之外)
- V = A/C/G(T 之外)
- N = A/T/C/G(aNy)
什么时候用哪种变换
场景 1:PCR 引物设计
设计一对 PCR 引物扩增一段序列时:
- 正向引物(Forward):直接取 5′ 端 18–25 bp,5′→3′ 方向,就是 + 链本身
- 反向引物(Reverse):取 3′ 端 18–25 bp,对这段序列做 反向互补,得到 5′→3′ 的反义链序列
例如扩增 ATGGCTTAAGCA……(省略中间序列)……TGCCGAATTAGC:
正向引物:5′-ATG GCT TAA GCA-3′(直接取左端,+链的左端)
反向引物:5′-GCT AAT TCG GCA-3′(右端原始 TGCCGAATTAGC → 反向互补后得到)
反向引物为什么要做反向互补?因为引物在溶液中是以 5′→3′ 单链形式存在的,它需要与模板的 − 链 3′ 端按反平行方式配对,所以序列方向必须反过来再互补。手动设计反向引物非常容易搞反,建议直接用 序列操作工具 一键生成 RC 序列。
场景 2:测序结果拼接
PCR 产物或克隆质粒送样测序,通常会测正反向各一次(双向测序)。反向测序得到的结果是从 − 链读出来的,必须对反向测序结果做反向互补,才能与正向测序结果对齐拼接。
典型拼接步骤:
- 对正向测序结果:保留原样
- 对反向测序结果:整段序列做 反向互补(RC)
- 找到两条序列的重叠区域(overlap,通常 30–100 bp),拼接得到全长序列
- 跟参考序列比对,验证是否有突变
场景 3:TA 克隆 / TOPO 克隆方向判断
TA 克隆是非定向克隆(插入方向是随机的,正向和反向都可能)。菌落 PCR 后送样测序,拿到结果如果发现:
- 序列反着才对得上插入片段 → 说明插入方向是反向的
- 需要对测序结果做 RC,然后与预期序列比对
场景 4:siRNA / shRNA 序列设计
siRNA 正义链序列与靶 mRNA 一致(T 换 U),反义链与 mRNA 互补。实际操作时,把靶 DNA 序列的某 19–21 bp 区域:
- 正义链 = 该区域序列 + UU 悬挂(T→U)
- 反义链 = 该区域的反向互补序列 + UU 悬挂(T→U)
六框翻译(Six-Frame Translation)
DNA 双链有 6 种可能的读码框,每种读码框翻译出一条完全不同的氨基酸序列。做克隆验证、ORF 查找、测序比对时,几乎都需要先做六框翻译。
为什么是 6 个框
每条链从第 1、2、3 个碱基开始读,每 3 个碱基为一个密码子:
- + 链读码框:+1(从第 1 位开始)、+2(从第 2 位开始)、+3(从第 3 位开始)
- − 链读码框:先做 RC 后,再从 3 个起始位置开始,对应 −1、−2、−3
6 种翻译中,通常只有 1 种是正确的(能找到连续的长 ORF,从 ATG 起始到终止密码子结束)。其他 5 种读码框会频繁出现终止密码子(*),这是移码的表现。
密码子表(简表)
| 密码子首位 | U | C | A | G |
|---|---|---|---|---|
| U | Phe / Phe / Leu / Leu | Ser / Ser / Ser / Ser | Tyr / Tyr / * / * | Cys / Cys / * / Trp |
| C | Leu × 4 | Pro × 4 | His / His / Gln / Gln | Arg × 4 |
| A | Ile / Ile / Ile / Met | Thr × 4 | Asn / Asn / Lys / Lys | Ser / Ser / Arg / Arg |
| G | Val × 4 | Ala × 4 | Asp / Asp / Glu / Glu | Gly × 4 |
终止密码子:TAA、TAG、TGA(在 DNA 序列层面)→ 翻译输出
*起始密码子:标准情况下 ATG(真核 / 原核通用),少数情况下 GTG / TTG 也能起始,但蛋白表达效率会低很多
怎么判断哪个读码框是对的
以一段 CDS 序列为例(比如你克隆的某基因 CDS):
- 六框全部翻译出来,找哪一框里没有频繁的终止密码子 *
- 正确的 ORF 通常特征:
- 以
M(ATG)开头(或部分 CDS 没有完整 N 端) - 中间连续 100+ 个氨基酸无
*中断 - 以
*(终止密码子)结尾 - 氨基酸长度跟参考蛋白匹配
- 以
- 如果一框里每隔几个氨基酸就出一个
*,那肯定是移码了,换框继续找
常见坑:测序结果找不到 ORF
送测序后做翻译,发现 6 个框全是断断续续的短肽,没有完整 ORF。典型原因排查:
- 方向搞反了:RC 一次再翻译试试(90% 的坑)
- 插入方向反了:非定向克隆(TA/TOPO)时,质粒骨架上启动子在一侧,插入片段反向的话,实际编码的是反向互补 RNA,翻译出来全错
- 移码突变:测序峰图查一下是不是某个位置出现 indel(插入缺失),导致后续全部错位
- 把内含子也翻译了:从基因组 DNA 上扩增到的序列含内含子,直接翻译当然会错位。应该用 mRNA/cDNA 的 CDS 序列
GC 含量与序列长度
对一段序列做操作时,两个附加参数也很重要:
- 序列长度 (bp):引物通常 18–25 bp,qPCR 产物 80–200 bp,常规 PCR 产物 100–2000 bp,CDS 通常 300–3000 bp
- GC 含量 (%):GC = (G + C) / 总数 × 100%。理想范围 40–60%:
- GC 过低(<30%):Tm 太低,引物结合不稳,PCR 容易不出带
- GC 过高(>70%):容易形成二级结构和二级互补,扩增效率低,甚至出现拖尾、非特异
完整案例:qPCR 引物设计与验证
假设我们要在人源 GAPDH 基因上设计一对 qPCR 引物(跨两个外显子,避免基因组 DNA 污染)。
步骤:
- 从 NCBI/Ensembl 找到 GAPDH 的 CDS 序列,选中两个外显子边界附近的区域
- 在 + 链上选一段 18–22 bp 作为正向引物:如
5′-GAA GGT GAA GGT CGG AGT C-3′ - 在下游另一个外显子(距离 ≥ 80 bp)选 18–22 bp 序列,对这段序列做反向互补,得到反向引物:
5′-GAC AAG CTT CCC GTT CTC AG-3′ - 检查两条引物的长度、GC 含量、Tm:用 退火温度工具 算 Tm,两条引物 Tm 相差 ≤ 3°C
- 检查引物的二聚体风险:用 引物二聚体检测工具 看 3′ 端 GC 是否过高
- 做 Blast 比对,确认引物不会非特异结合到其他基因上
如果任何一步手工计算出错(比如反向引物忘了做 RC),那么最终 PCR 要么完全无带,要么扩出来是反方向的其他片段。
其他实用技巧
1. 序列输入大小写、空格都不影响
分析工具一般会自动:
- 全部转大写
- U(RNA)转成 T(DNA)
- 去除空格、换行、特殊字符、数字编号 所以从 GenBank 直接复制带行号的序列也能用
2. RNA 序列 vs DNA 序列
做 RNA 操作时(mRNA/siRNA/miRNA),序列中 U 替换了 T。在做互补、翻译时自动把 U 当 T 处理即可,原理完全一样。
3. 突变引入后的 ORF 验证
做定点突变(单点替换 / 插入 / 缺失)后,务必重新做六框翻译确认读码框没乱:
- 同义突变:氨基酸不变 → OK
- 错义突变:氨基酸被替换 → 核对是否是你想要的替换
- 移码突变:插入/缺失不是 3 的倍数 → 下游氨基酸全变了,立即重做
4. 测序结果峰图配合序列判断
如果翻译出来发现某个氨基酸突变异常,应该回去看测序峰图:
- 峰形清晰但确实不同碱基 → 真实突变
- 峰形混乱双峰 → 可能是测序质量问题,不能轻信
一键完成所有操作
手工做反向互补、六框翻译很容易出错,可以直接用 序列反向互补翻译工具:
- 粘贴 DNA 序列,一键输出:反向、互补、反向互补
- 自动做 6 个读码框的翻译(+1 / +2 / +3 / −1 / −2 / −3)
- 给出序列长度和 GC 含量百分比
- 所有操作本地浏览器计算,不上传数据