基因组与比较基因组学

基因组与比较基因组学·

由GPT-5.6-Sol-Ultra生成


人类基因组计划·

计划目标·

  • 基因组(genome):特定物种细胞内全部DNA分子的总和,即生物体遗传信息的集合。
  • 基因组学:系统研究并解析生物体整个基因组的全部遗传信息。
  • 人类基因组计划(HGP)以单倍体约$3\times10^9\ \mathrm{bp}$的序列为对象,主要目标可归纳为:
层面 主要任务
基因 确定约2万~2.5万个编码基因的序列、物理位置、产物与功能
表达调控 定位转录及剪接调控元件,从全基因组和三维染色体结构理解表达调节
染色体结构 解析重复序列、非转录调控序列的大小与组织及其对复制、转录和表达的影响
遗传稳定与变异 寻找复制、重组相关序列,研究突变、重排和染色体断裂及其疾病机制
可移动序列 确定转座子、反转座子及病毒残余序列并分析其周围序列
群体多态性 研究个体间遗传元件差异,服务于诊断、个体识别、组织配型及进化等研究

四类人类基因组图·

图谱 核心含义 基本尺度/材料
遗传图 基因或DNA标志的相对位置与遗传距离 重组频率、厘摩(cM)
物理图 已知序列标签在基因组上的实际位置及相连片段群 STS,bp/kb/Mb
转录图 可转录区域、转录本位置及表达信息 mRNA、cDNA、EST
全序列图 基因组全部核苷酸的排列 约30亿bp的参考序列

遗传图与遗传标记·

  • **遗传图(连锁图)**利用遗传连锁分析确定标志的相对距离和方向。减数分裂时两位点间的重组频率通常与距离正相关,以cM表示;cM越大,距离越远。
  • 重组率为$50%$(50 cM)时,两位点完全不连锁,相当于随机交换;遗传标志越多、越密集,连锁图分辨率越高。
遗传标记 原理与特点
第一代:RFLP、RAPD 单个或少数核苷酸变化造成限制性位点或引物结合改变,表现为酶切片段或扩增条带的有无;多态信息量较小
第二代:小卫星、微卫星 小卫星重复单位约15~65 nt;微卫星约2~6 nt,又称STR/STRP/SSLP;重复数易变,具有高多态性和高频率
第三代:SNP 分散于基因组的单碱基替换、缺失或插入,以直接序列差异而非片段长度为标记,可用DNA芯片检测

RFLP由限制性位点变化产生片段长度多态性

  • 以STRP为主体的连锁图含5 264个标记,平均分辨率约$600\ \mathrm{kb}$;短重复序列错配可进一步增加群体中的等位基因数。

显性与共显性DNA多态性标记类型之一 显性与共显性DNA多态性标记类型之二 显性与共显性DNA多态性标记类型之三 显性与共显性DNA多态性标记类型之四 显性与共显性DNA多态性标记类型之五 显性与共显性DNA多态性标记类型之六 显性与共显性DNA多态性标记类型之七 显性与共显性DNA多态性标记类型之八

  • 人类基因组已发现超过1 000万个SNP,平均约每$300\ \mathrm{bp}$一个;绝大多数位于非编码区。教材认为SNP在密度上可接近基因组多态位点的极限。

SNP的产生及其对DNA杂交强度的影响

  • 遗传图可辅助定位疾病基因:与标记重组率为$50%$表示不连锁;$0<r<50%$提示可能位于附近;不发生重组则提示二者可能非常接近。

物理图·

  • **物理图(physical map)以已知位置的序列标签位点(STS)为路标,以bp、kb、Mb表示实际图距;核心是建立相互重叠的相连DNA片段群(contig)**并用PCR证实。
  • 遗传图与物理图采用的实验依据不同,遗传标记间的距离不一定等于实际物理距离。

酵母第三号染色体遗传图与物理图比较

  • STS为基因组中的单拷贝短DNA序列,长约100~500 bp。用多套基因组大片段为模板、以各STS序列为引物进行PCR:
    • 两个STS越近,越常共同出现在同一大片段上;相距越远,共现概率越低。
    • 据此排列大片段、建立contig,并把经典遗传位点转换为可直接克隆和分析的物理片段。
  • 教材所述人类物理图已含上百万个STS,分辨率达每3~4 kb一个标签。

以STS共现关系建立基因组物理图

转录图·

  • **转录图(cDNA图)/表达序列标签图(EST图)**记录基因组可转录部分;可用一段cDNA或EST筛选全长转录本,并按特异序列把相应基因定位到基因组。
  • 人类基因组约$2%$的序列编码蛋白质,含约2万~2.5万个蛋白质编码基因。
人类蛋白质编码基因的平均参数 数值
基因长度 约27 kb
外显子 8.8个,每个约145 bp
内含子 约3 365 bp
$5’$/$3’$非翻译区 约300/770 bp
开放读码框 约1 340 bp,编码447 aa
  • 教材称成年个体每一特定组织通常仅有$10%\sim20%$的基因表达。分离特定组织、阶段或生理状态的mRNA并制备cDNA,可同时获得转录本种类和相对数量;比较不同表达谱可识别组织特异、组成性、发育调控及环境响应基因,并形成区分200余种人体组织或细胞的body-map。

全序列图·

  • 全序列图是分子水平最高、最详尽的物理图。HGP测定的约30亿核苷酸参考序列成为个体重测序、基因分析和诊断的参照。
  • 人与其他动物基因组在染色体水平可呈共线性;教材以人21号染色体与小鼠相关染色体片段为例。

人21号染色体与小鼠染色体片段的共线性


高通量DNA序列分析技术·

Sanger双脱氧链终止法·

  • Sanger法又称引物合成法/酶催引物合成法:以单链DNA为模板和特异引物,在DNA聚合酶催化下合成互补链。常用去除$5’\rightarrow3’$外切核酸酶活性的DNA聚合酶I Klenow大片段。
  • 链终止原理:$2’,3’$-双脱氧核苷三磷酸(ddNTP)缺少$3’$-OH;一旦替代dNTP掺入新链$3’$端,后续磷酸二酯键不能形成,延伸在该碱基处终止。

脱氧核苷三磷酸dNTP的分子结构 双脱氧核苷三磷酸ddNTP缺少3'-OH

  1. 四个反应管均加入模板、引物、DNA聚合酶、4种dNTP及适量的一种ddNTP,并以${}^{32}\mathrm P$标记dNTP。
  2. 随机掺入ddNTP产生一组$5’$端相同、长度不同,并以相应ddNTP为$3’$末端的片段。
  3. 四组产物经变性凝胶电泳和放射自显影,按片段长度依次读取待测序列。
  • Sanger法后续改进:荧光标签取代放射性标记,毛细管电泳取代平板电泳,配对末端测序突破单次读长限制;自动流体操作进一步提高自动化和平行化程度。

基因组大片段文库·

载体 组成与容量 优势/局限
YAC 含着丝粒、端粒、复制起点;平均插入200~1 000 kb,最大约2 Mb 容量最大;但嵌合体多、部分克隆不稳定,且难与酵母染色体区分,易机械断裂
BAC 源于细菌F质粒,含oriSrepEparAparB;容量125~150 kb 嵌合率低、转化效率高,环状载体易分辨和纯化

YAC载体结构及大片段克隆策略

鸟枪法及其改良·

  • Sanger单次测序不超过约1 000 bp,不能直接测定BAC等大片段。全基因组鸟枪法将基因组随机打断、构建质粒文库,对随机克隆进行测序,再由计算机按重叠关系拼接。
  • 教材称随机测序量达基因组大小5倍时,未测碱基约占$0.67%$,但仍会留下多个缺口。

BAC载体的构建及其克隆策略 基因组DNA全基因组鸟枪法测序流程 重复序列造成鸟枪法片段错误拼接

  • 提高完整性和质量的策略:
    1. 建立高度随机、插入1~2 kb的文库,使已测末端总碱基数达到基因组的5倍以上。
    2. 对每个克隆进行双端、高效的大规模末端测序。
    3. 用拼装软件减少错误连锁,并另建$\lambda$文库填补缺口。
  • 局限:基因组越大,片段形成完整contig的概率越低;高等真核基因组的大量重复序列尤其容易造成拼装困难。
  • 大片段克隆法/靶标鸟枪法:先用稀有限制性内切核酸酶把大基因组切成几十万bp片段,或用已知基因、遗传标签确定片段顺序,再分别测序和逐步定位。

大片段克隆或靶标鸟枪法改进流程

新一代测序的共同框架·

  • 第二代测序不再以细菌克隆扩增待测模板:基因组随机片段化$\rightarrow$体外连接共同接头$\rightarrow$乳胶PCR或桥连PCR形成扩增子簇$\rightarrow$固定于固相基底$\rightarrow$酶促反应与图像采集循环。
  • 体外建库、扩增和高密度阵列显著提高自动化、平行化和通量并降低成本,但总体读长较短,精确度仍有改进空间。

传统Sanger与第二代阵列化测序流程比较

Illumina:桥连PCR与边合成边测序·

  1. DNA片段连接接头,与固相基底上的正、反向引物杂交;反复变性和桥连PCR,使单模板在原位形成约1 000个拷贝的扩增子簇。
  2. 测序引物结合共同接头,DNA聚合酶加入4种带不同荧光且$3’$端可逆封闭的核苷酸。
  3. 每轮只能整合一个碱基;采集四色荧光后切除荧光和终止基团,再进入下一轮,因而各模板同步延伸。

Illumina固相桥连PCR形成扩增子簇 Illumina合成测序与SOLiD连接测序的循环信号检测

  • 荧光或封闭基团切除不完全会导致信号衰减、去同步化和后段质量下降;正文称双末端有效读长为100或150 nt,主要错误为碱基替换。
  • 可逆终止使同多聚串检测较准确;每个通道含数百万个独立扩增子簇,因此通量高、成本低。

SOLiD:连接测序与双碱基编码·

  1. 片段接头连接并扩增后,将携带同一模板大量拷贝的磁珠固定为阵列;链延伸由DNA连接酶而非聚合酶催化。
  2. 荧光标记的简并八聚核苷酸探针与模板杂交,探针第1、2位碱基共同决定荧光颜色;连接、成像后切除探针后3位核苷酸及荧光标签,再重复循环。
  3. 每10次循环获得每隔5个碱基的双碱基信息;模板变性后依次换用5个左移一位的引物重新测定,再把颜色序列比对至参考基因组解码。
  • 双碱基编码使一个SNP引起相邻两次荧光变化,可提高SNP判定精度;主要错误仍为碱基替换,读长约50~100 bp,教材称通量为各平台中最大。
  • 第二代平台仍依赖PCR信号放大,可能引入突变及模板扩增偏倚;拷贝间去同步化还会增加噪声、缩短有效读长,影响RNA-seq等丰度测定。

SOLiD五轮连接、双碱基编码与颜色解码

单分子测序·

  • Pacific Biosciences实时测序
    1. DNA聚合酶固定在Zero Mode Waveguide底部,与引物-单分子模板及4种荧光核苷酸共同反应。
    2. 纳米结构把激光激发限制在$10^{-21}\ \mathrm L$,只检测正被聚合酶整合的核苷酸;携带荧光的焦磷酸副产物离开检测区后信号恢复至背景。
    3. 实时连续读取,无需模板扩增。正文称读长可达1 000 nt或更长,单次准确度仅$80%$多;同一模板测定15次以上可使准确度超过$99%$。
  • 纳米孔测序:驱动单分子核酸通过纳米孔,依据单碱基与孔的相互作用或通过时电导变化推断序列,不依赖DNA聚合反应。
    • 教材所述MinION以膜孔蛋白形成约1 nm直径、10 nm长的通道;反应快、仪器小、成本低、读长长,但通过速度快和相邻信号重叠使错误率较高。
    • 可用于基因组测序及染色体大片段缺失检测,并可结合二代短读长数据提高结果质量。

PacBio零模波导实时测序与纳米孔电信号测序原理 MinION纳米孔测序仪外观 Illumina短读长与Nanopore检测大片段缺失的结果比较

10X Genomics:条形码关联的长片段建库·

  • 10X Genomics以微流体微滴为分区,使不同的10~100 kb DNA大片段获得不同barcode;随后打断大片段并用Illumina测序。
  • 根据barcode把来自同一原始大片段的短reads归组并拼成相连序列(linked-reads),从短读长恢复长片段关联信息。
  • GemCode流程中,带14 bp分子条形码的凝胶珠、试剂和DNA先混合,再由油滴包裹;凝胶珠裂解释放教材所称oligo并启动常规建库。
  • linked-reads可显示缺失、重复、重排等结构变异;染色体定相可视化单体型并辅助定位致病突变。教材称GemCode当时仅兼容Illumina系统。

10X Genomics微滴条形码与linked-reads建库流程

平台机制比较·

平台 模板/测序反应 教材所列读长 主要特点与限制
Illumina 桥连PCR;聚合酶合成、可逆末端终止 正文100或150 nt;表11-3列75或100 nt 应用广、通量高、成本低;主要为替换错误,读长较短
SOLiD 乳胶PCR磁珠;连接酶与双碱基编码 正文50~100 bp;表11-3列50 bp 双碱基编码提供内部核验、SNP检测较准;测序时间长
Pacific Biosciences 单分子;固定聚合酶实时荧光检测 正文1 000 nt以上;表11-3列20 kb 可重复测定提高准确度;正文称单次准确度仅80%多
Nanopore 单分子直接过孔;检测特征电流 表11-3列1 Mb 读长优势明显、速度快;错误率高

正文与表11-3所列部分读长并不一致,表中按教材两处口径分别保留。


新测序平台的应用·

  • 高通量测序的主要应用包括:全基因组或靶区重测序以发现单核苷酸变体(SNV)和结构变体(SV)、组装细菌及低等真核生物基因组、测定转录组与表达谱、元基因组物种鉴定、新基因发现,以及研究染色体构象和全基因组范围内反式因子-顺式元件互作。

SNP、疾病关联与深度测序·

  • SNP是重要遗传标记,可用于遗传图谱绘制和疾病遗传基础研究。HapMap将常见SNP模式归为单体型,再选出代表性的标签SNP,以提高个体单体型的判定效率。
  • GWAS用于发现SNP与疾病的关联;少数相关SNP位于已知蛋白编码区,可直接帮助解释机制,但多数位于认识有限的基因间区,可能只是与真正致病多态性邻近的标记,仍需精细定位。
    • 标签SNP分析无法发现与周围SNP不连锁的位点。
    • 常见SNP、SV只能解释少数常见病机制;稀有SNP/SV及癌症体细胞突变须通过大量个体的直接深度测序研究。
  • 与芯片相比,新一代测序能更准确界定拷贝数多态性区域(CNVR)中插入或缺失的边界;癌症基因组工程还可系统分析基因组、表观遗传组、转录组及体细胞插入、缺失、易位等变化。个人基因组和个性化医疗同样依赖高通量、低成本测序。

染色体构象俘获测序·

  • 染色体构象俘获研究同一或不同染色体位点在三维空间中的相互作用;这些互作可促进增强子-启动子接触并形成染色质环,从而调控表达。测序所得互作频率还可用于重构染色体三维结构。
  • 建库主线:化学交联固定蛋白质与基因组DNA的三维构象 $\rightarrow$ 酶切 $\rightarrow$ 保留受结合蛋白保护的互作DNA $\rightarrow$ 平末端连接、解除交联 $\rightarrow$ 接头连接和高通量测序。
方法 检测尺度
3C 一个位点-一个位点
4C 一个位点-多个位点
5C 多个位点-多个位点
Hi-C 全部位点之间
  • 人CTCF相关构象俘获结果显示:构象调节因子可使不同染色体基因形成高级结构,并同时被RNA聚合酶Ⅱ高效转录,体现染色体高级结构对组织特异性表达的调控。

染色体构象俘获测序结果及染色体三维构象模拟


核糖体与多核糖体图谱测序·

项目 多核糖体图谱测序 核糖体图谱测序
样品制备 细胞裂解液经蔗糖梯度沉降,按结合核糖体数分离mRNA;结合3个以上核糖体者通常视为高度富集 RNA酶消化mRNA,保留核糖体保护片段并建库
检测对象 富集多核糖体的mRNA序列 某时刻核糖体-mRNA结合序列的“快照”
主要优势 与蛋白质表达水平的相关性较好 可定位翻译起始位点和核糖体在mRNA上的分布
  • 两者实验方法、读长和分析流程不同,但都可检测翻译速率与效率变化,是全基因组翻译组研究的重要方法。

多核糖体图谱测序与核糖体图谱测序原理比较

  • MeDIP-seq、MethylC-seq、ChIP-seq、DNase-seq及构象俘获-配对末端测序等,可研究表观遗传修饰、转录因子结合和染色质结构。相较qPCR和芯片,高通量测序覆盖更完整、边界分辨率更高,能区分高度相似序列并发现新转录物、变异体及转录起始位点;短读长还适于小RNA测序、miRNA鉴定和靶mRNA分析。

其他代表性基因组·

  • 测序成本下降使基因组数据快速增长。遗传元件尤其管家基因的保守性,使一种生物的基因研究可帮助理解、解释或克隆另一种生物的相应基因;基因组差异则为物种特异性状、演化和环境适应研究提供依据。

已完成和正在进行的基因组测序项目数量变化

大肠杆菌K12基因组·

  • K12 MG1655基因组是含$4,639,221\ \mathrm{bp}$的双链环状DNA;蛋白编码基因占$87.8%$,RNA基因占$0.8%$,非编码重复序列占$0.7%$,其余约$11%$为调控或其他功能区。
  • 约有4 400个可能的编码基因,其中约3 700个得到合理注释;约700个未注释基因中,650个与其他细菌基因高度同源,只有50个未显示明显同源性。
  • 重复序列排布可能与复制有关:多拷贝rRNA基因rrn与相关序列TPIP对称分布在oriC两侧的先导链上,rrn操纵子通常朝远离oriC的方向转录。

酿酒酵母基因组·

  • 酿酒酵母是第一个完成基因组测序的真核生物。教材称其$13,040,000\ \mathrm{bp}$基因组为最小真核基因组,基因密度约为每$2\ \mathrm{kb}$一个基因;含5 885个蛋白编码基因,另有约140个rRNA、40个snRNA和275个tRNA基因。
  • 不同酵母遗传物质差异较大:教材所列菌株有7~16条染色体,基因组约$9.72\sim18.355\ \mathrm{Mb}$。
  • 染色体常由高、低GC区段交替组成,GC分布与基因密度和重组频率相关;以3号染色体为例,GC富集的染色体臂中部重组率高,而低重组率的端粒、着丝粒区GC含量较低。

拟南芥基因组·

  • 拟南芥是第一个完成测序的植物基因组,也是继线虫、果蝇后第三个完成测序的多细胞生物基因组;全长约$115.4\ \mathrm{Mb}$,5条染色体编码约30 000个基因。
  • 其进化过程中至少发生两次全基因组复制,并伴随广泛基因缺失、重复复制及来自蓝藻的DNA片段横向转移。
  • 拟南芥编码转录调控因子的基因数量明显多于酵母、线虫和果蝇,教材据此从一个侧面说明高等植物的复杂性。

教材称酵母“约4%的编码基因有内含子”,随后又括注这些基因“大多为rRNA基因”,术语范围含混。


比较基因组学研究·

基本逻辑与比较维度·

  • 比较基因组学(comparative genomics)

    比较不同生物基因组的保守性与差异性,用于认识基因结构和功能、普遍生命机制、物种特异性状、演化与环境适应。

  • 近缘基因组的相似性有助于细化基因结构与功能;远缘基因组的相似性可揭示普遍机制并帮助选择复杂生理、病理过程的实验模型。
基因组特征 教材所述比较
基因密度 酵母、线虫、拟南芥基因组较小且密度高,每Mb含200个或更多基因;人类约12~15个/Mb
常/异染色质 前三者常染色质超过$90%$;果蝇和人类异染色质约占$20%\sim40%$
果蝇染色体 Y染色体几乎完全异染色质化,4号染色体大部分异染色质化;X染色体在不同家系中异染色质化程度为$30%\sim50%$

人、酵母、玉米和大肠杆菌基因组成分比较

代表性$50\ \mathrm{kb}$区段 基因与重复序列特征
人$\beta$-T细胞受体位点 仅1个基因、1个假基因和2个基因片段,功能基因序列不足$3%$,有52个全基因组重复序列
酵母4号染色体 26个蛋白编码基因、2个tRNA基因,功能编码序列占$66.4%$;该区无内含子
玉米 仅1个乙醇脱氢酶I-F基因,其余近乎都是重复序列;全基因组重复序列可能超过$50%$
大肠杆菌 可含43个基因,约占$85.9%$,基因间隔极短;教材称原核基因无内含子,但少数古菌可有极少内含子

果蝇各染色体常染色质与异染色质含量比较

教材正文称果蝇与人类异染色质占$20%\sim40%$,表11-9却列果蝇常染色质占$97%$,两种口径存在冲突。

教材在大肠杆菌专节统计了$0.7%$非编码重复序列并讨论rrn等重复序列,比较段却称“原核基因组中没有重复序列,但有插入序列”,两种口径并列保留。


单拷贝基因、最小基因组与功能推断·

  • 原核、低等真核和高等真核生物的蛋白编码种类差异明显;教材所列单拷贝基因比例为流感嗜血杆菌$88.8%$、酵母$71.4%$、果蝇$72.5%$、线虫$55.2%$、拟南芥$35.0%$,总体显示高等植物中单拷贝基因比例较低。
  • 最小基因组推断:教材称尿殖道支原体具有当时已知最小的基因组,约$0.58\ \mathrm{Mb}$,流感嗜血杆菌约$1.83\ \mathrm{Mb}$;二者基因大小和密度相近,尺度差异主要来自基因数。比较二者得到240个共有基因,再加其他基因,教材据此提出由256个基因组成的最小基因组。
  • 由序列推断代谢能力:流感嗜血杆菌缺少柠檬酸合成酶、异柠檬酸脱氢酶和顺乌头酸酶基因,因而被推断缺失TCA循环,不能经其中间物$\alpha$-酮戊二酸合成谷氨酸。
  • 由同源性推断亲缘关系:产甲烷球菌在环状染色体、操纵子、能量产生和固氮等方面与原核生物相似,而转录、翻译和分泌系统与真核生物同源;教材据此认为古菌与真核生物的亲缘关系比与原核生物更近,细菌分化较早。

本章名词·

基因组|genome

一个细胞或病毒所携带的全部遗传信息或整套基因, 包括每一条染色体和所有亚细胞器的 DNA 序列信息。

Sanger|Sanger

Sanger测序法,又称双脱氧链终止法或引物合成法,是由F. Sanger于1977年发明的DNA序列测定技术。其原理是以单链DNA为模板,在DNA引物和DNA聚合酶催化下进行互补链合成,通过掺入双脱氧核苷酸终止链延伸,产生不同长度的片段,从而读取DNA序列。该方法因适于自动化而成为早期基因组测序的主流技术。

靶标鸟枪法|Directed Shotgun

用稀有限制性核酸内切酶先将待测基因组降解为几十万个碱基对的片段, 再分别进行测序, 或者根据染色体上已知基因或遗传标签的位置来确定部分 DNA 片段的排列顺序, 逐步确定各片段在染色体上的相对位置。

基因组的大小|Genome Size

是指一种生物单倍染色体中的 DNA 的长度。

厘摩|centiMorgan, cM

表示遗传连锁分析中重组频率的单位, cM 值越大, 表明两者之间距离越远。

全基因组鸟枪法测序|Whole genome shotgun sequencing

随机打断基因组序列克隆扩增后各自测序, 最后进行序列拼接的策略。

物理图|Physical Map

是指以已知核苷酸序列的 DNA 片段(序列标签位点, sequence-tagged site, STS)为“路标”, 以碱基对(bp, kb, Mb)作为基本测量单位(图距)的基因组图。

遗传图|Genetic Map

遗传图又称为连锁图(Linkage Map), 是指基因或 DNA 标志在染色体上的相对位置与遗传距离。

遗传距离|Genetic Distance

遗传距离是通过遗传连锁分析确定的, 在同源染色体的同一遗传位点上存在的不同等位基因在产生配子的减数分裂过程中可能发生片段互换,从而导致子代出现两个遗传位点等位基因的“重组”,该重组频率与这两个位点之间的距离呈正相关。于是,科学上用两个位点之间的交换或重组频率来表示其遗传学距离。

BAC|bacterial artificial chromosome

细菌人工染色体(BAC)是基于细菌F质粒及其调控基因构建的克隆载体,可容纳125~150 kb的外源DNA片段,主要用于基因组大片段文库的构建,克服了酵母人工染色体(YAC)嵌合体比例高、不稳定等缺点。

Baltimore|Baltimore

巴尔的摩(Baltimore)通常指美国分子生物学家戴维·巴尔的摩(David Baltimore),他因发现逆转录酶而获得1975年诺贝尔生理学或医学奖,并提出了基于基因组核酸类型的病毒分类系统(巴尔的摩分类法),将病毒分为七类。

contig|contig

contig(重叠群)是指在基因组物理图中,通过相互重叠连接的相连DNA片段群。它们是基于共享序列的重叠关系组装而成的连续DNA序列,用于构建更长的基因组区域,并可通过STS标签和PCR方法予以验证。

Roderick|Roderick

托马斯·H·罗德里克(T. H. Roderick),美国科学家,于1986年首次提出“基因组学”(genomics)这一术语,标志着该学科的诞生,并与国际期刊《Genomics》一同问世。

STS|sequence-tagged site

序列标签位点(STS)是基因组中已知核苷酸序列的单拷贝短DNA片段,长度通常为100~500 bp,可用作物理图的界标。任何已知基因组位置的DNA序列均可作为STS,通过PCR技术可对其进行特异性扩增和定位。STS是构建基因组物理图的核心路标,用于建立和验证重叠DNA片段群(contig),并以碱基对为图距表示基因组的物理距离。

YAC|yeast artificial chromosome

酵母人工染色体(yeast artificial chromosome,YAC)是一种含有酵母染色体的着丝粒、端粒和自主复制起点的克隆载体,能在酵母细胞中稳定复制和分离。它是目前容量最大的克隆载体,插入片段平均长度为200~1000 kb,最大可达2 Mb。YAC存在嵌合体比例高、部分克隆不稳定易发生缺失或重排、难以与酵母染色体区分等缺点。

表达序列标签图|expressed sequence tag map

表达序列标签图(expressed sequence tag map)即人类基因组转录图或cDNA片段图,由表达序列标签(EST)构成,是人类基因组图的重要组成部分。通过测得的cDNA或EST序列,可筛选全长转录本并根据序列特异性将相应基因精确定位于基因组上,从而揭示基因的可转录部分。

高通量测序技术|high-throughput sequencing

高通量测序技术是指一次可并行测定大量DNA序列的测序方法,包括以Illumina Solexa、Roche 454、ABI SOLiD为代表的第二代测序和以单分子测序、纳米孔测序为代表的第三代测序。该技术通量高、成本低、速度快,已广泛应用于全基因组重测序、转录组分析、染色体构象俘获、元基因组研究等众多生物学领域。

酵母人工染色体技术|yeast artificial chromosome technology

酵母人工染色体技术是一种构建基因组大片段文库的克隆载体技术,其载体含有酵母染色体的三种必需成分:着丝粒、端粒和复制起点,是迄今容量最大的克隆载体,插入片段平均长200~1000 kb,最大可达2 Mb。该技术为基因组物理图绘制和序列测定提供了重要平台,但存在嵌合体比例高、部分克隆不稳定易缺失重排、以及难以与酵母染色体区分等缺点。

连锁图|linkage map

连锁图即遗传图,指基因或DNA标志在染色体上的线性排列图,标明它们的相对位置和遗传距离。其距离根据减数分裂过程中同源染色体交换导致的重组频率来确定,以厘摩(cM)为单位,1%重组率相当于1 cM。通过连锁图可了解基因或标记间的相对顺序、距离以及靠近着丝粒或端粒的方向。

连锁遗传|genetic linkage

连锁遗传是指位于同一条染色体上的多个基因在减数分裂过程中倾向于共同遗传而非独立分配的现象。其分子基础在于减数分裂时同源染色体可能发生片段互换,导致子代出现等位基因重组,重组频率与基因间的遗传距离呈正相关。通过连锁分析可测定重组率并转换为厘摩(cM)单位,1 cM相当于1%重组率,从而构建遗传图(连锁图),揭示基因在染色体上的相对位置与顺序。

扫描模型|scanning model

扫描模型是真核生物翻译起始过程中,由Kozak提出的机制,用以解释40S核糖体小亚基如何定位起始密码子AUG。该模型认为,40S小亚基与起始因子首先识别mRNA的5’端帽子结构并与之结合,随后沿mRNA向3’方向滑行扫描,直至遇到第一个合适的AUG起始密码子时停止,与60S大亚基组装形成80S起始复合物。此模型阐明了大多数真核mRNA的单顺反子性质,并解释了为何mRNA水解后内部起始密码子可被活化,因为水解产生的新5’端可重新为40S亚基提供扫描进入位点。

DNA 条形码|DNA barcoding

是利用一个或少数几个短的标准的 DNA 片段对地球上现有物种进行识别和鉴定的一项新技术。Barcode 序列通常标记于接头序列之前。在动物研究中采用的标准片段是线粒体 COI 基因中约 650 bp 长的一段。然而任何一个单片段都不足以区分所有植物物种,目前主要在叶绿体基因组上进行选择。Illumina 公司有多种商业化 barcode 包,TruSeq 系统通常使用 6 碱基组成的 12 种 barcode 序列。GU-AG 法则 (GU-AG rule): 以 GU 起始和以 AG 为末端的内含子碱基序列, GU 表示供体衔接点的 5’ 端, AG 代表接纳体衔接点的 3’ 端序列。

HapMap 工程|International Haplotype Map Project, 国际人类基因组单体型图计划

将已检测到的人类常见 SNP 的共有模式进行分类, 形成单体型, 通过找出这些单体型的代表性标签 SNP, 可以有效地增加了实际操作中能够确定出个体单体型的区域。

MeDIP-seq|Methylated DNA Immunoprecipitation followed by Sequencing, 甲基化 DNA 免疫共沉淀测序

将带有甲基化 DNA 的序列与特异结合甲基化胞嘧啶的抗体免疫共沉淀后进行测序, 用于对基因组 DNA 甲基化状态的分析。

单核苷酸变体|Single Nucleotide Variant, SNV

包括单核苷酸插入、缺失、替换的序列变体。

多核糖体图谱测序|Polysome profiling sequencing

将细胞裂解液沉降在蔗糖梯度中, 从而分离结合有不同数量核糖体的 mRNA 分子, 找到处于高效翻译状态的 mRNA, 其中含有 3 个以上核糖体的 mRNA 通常被称为多核糖体高度富集的 RNA。分离得到的多核糖体 RNA 添加接头后测序并进行后续的翻译组研究。

染色体构象捕获|Chromosome Conformation Capture

用于鉴定 DNA 分子内或分子间长程相互作用的技术。

细菌人工染色体|Bacteria Artificial Chromosome, BAC

主要包括 oriS, repE(控制 F 质粒复制)和 parA、parB(控制拷贝数)等成分, 其克隆能力在 125~150 千碱基对左右。

元基因组学|Metagenomics

以取自环境的样本里所有的遗传物质或特定的微生物群落为研究对象的学科。