基因组学及蛋白质组学

基因组学及蛋白质组学·

由GPT-5.6-Sol-Ultra生成

  • 基因组学(genomics)

    对一个物种全部基因的结构和功能进行系统研究的领域。

  • 主要内容

    • 测定全部基因组DNA序列并注释其编码信息
    • 分析全基因组范围的转录、翻译及其调控
    • 在全基因组水平进行人工设计、改造和进化分析
    • 开展个性化医疗等医学应用
  • 技术基础:DNA重组、大规模高通量测序及海量数据储存和分析

  • 蛋白质组学(proteomics)

    对一个生物样品中全部蛋白质的结构、功能、翻译后修饰和相互作用等进行系统研究的领域。

  • 技术基础:全基因组测序、二维电泳或液相色谱等高效分离、质谱高通量鉴定及计算机技术

  • 生物信息学(bioinformatics)

    应用于基因组学和蛋白质组学,对海量数据进行储存、处理和分析的计算机技术。

  • 系统生物学(systems biology)

    运用数学和计算机科学,从全局及整体水平认识生命现象的研究体系。

  • 强调揭示蛋白质相互作用、信号转导和代谢等复杂网络,分析其特性及其与更高级生理过程的关系

  • 系统生物学在一定程度上推动生命研究方法由还原论向整体论提升


全基因组DNA序列的测定和注释·

  • 大规模DNA测序主要以1977年报道的Sanger双脱氧链终止法为基础
  • 总体策略:将基因组DNA分成大量片段 → 分别测序 → 根据重叠序列拼接完整基因组
  • 基因组越大、重复序列越多,数据储存、拼接和注释越依赖计算机
  • 全基因组测序使不同生物的遗传信息全貌得以呈现,也为蛋白质组研究提供基础

代表性模式基因组·

基因组来源 教材表列大小/kb 预测蛋白质/种 完成年份
$\Phi$X174噬菌体 5.4 8 1977
人线粒体 16.6 13 1981
生殖道支原体 580 470 1995
流感嗜血杆菌 1830 1740 1995
大肠杆菌 4639 约4300 1997
酿酒酵母 12068 约6000 1996
线虫 97000 19000 1998
拟南芥 125000 27000 2000
果蝇 120000 13600 2000
1850000 25000 2004
  • 最初测定的全基因组较小,主要来自细菌或动物病毒
  • 随技术发展,测序对象依次扩展到真核细胞器、单细胞原核生物、单细胞真核生物、多细胞真核生物及人类
  • 教材表列人基因组为1850000 kb;后文2004年人常染色体结果写约30亿bp,二者数值不一致,原文未作解释

全基因组测序的三个阶段·

测序 → 拼接 → 注释

阶段 基本含义 主要难点
测序(sequencing) 将全长基因组DNA断成小片段,分别测定其序列 大基因组需处理海量片段;高等生物通常还需先分开染色体
拼接(assembly) 按片段在染色体或基因组中的顺序,拼成完整连续序列 重复序列使片段原始位置难以确定,必须依赖计算机
注释(annotation) 解释全长基因组DNA所含的生物学信息 依赖已有生命科学知识,复杂基因组准确度较低
  • 基因组长度和复杂性增加时,三个阶段的挑战均随之增加
  • 注释会随人类对生命现象认识的深入而不断修订,是一个长期、动态过程

全基因组测序的一般流程

测序·

  • Sanger法一次通常只能测定不超过1000个碱基,因此必须先将基因组片段化
  • 常用策略:直接鸟枪测序法与分层鸟枪测序法
比较 直接鸟枪测序法 分层鸟枪测序法
英文及别名 direct shotgun sequencing hierarchical shotgun;又称top-down或map-based法
第一次片段化 全基因组直接随机切成大量、相互重叠且可测序的小片段 先切成约150 kb的相互重叠大片段
载体与文库 小片段连接于可扩增DNA载体 大片段插入BAC,构建BAC文库
前置工作 不先构建物理图谱 先建立BAC物理图谱或叠连群
后续测序 直接测定全部小片段 每个BAC再随机切成约1 kb片段,插入质粒后作鸟枪测序
覆盖率 需多倍覆盖,本段未给统一数值 每个BAC中的小片段约作5倍覆盖测序
适用对象 较小、缺少或没有重复序列的病毒和细菌基因组 大型、复杂、重复序列较多的基因组
主要限制 大基因组的海量短片段难以准确拼接,甚至无法拼接 步骤较多,需先构建BAC文库和物理图谱
直接鸟枪测序法·
  1. 以机械法或酶切法将基因组DNA随机切成大量相互重叠的小片段
  2. 将片段连接到可扩增的DNA载体
  3. 用Sanger法分别测定各片段序列
  4. 计算机根据重叠序列拼接完整基因组
  • 多倍覆盖的目的
    • 确保基因组各片段均被测定
    • 获得足够的重叠序列,供后续拼接
  • 基因组越大、重复序列越多,仅依靠短片段重叠确定其原始位置越困难
分层鸟枪测序法·
  1. 将基因组随机切成约150 kb、彼此重叠的大片段
  2. 把大片段插入细菌人工染色体(BAC),构建BAC文库并在细菌中复制、储存
  3. 利用PCR、限制性内切酶谱等判断BAC片段是否共享序列
  4. 根据大片段间的叠连关系构建物理图谱/叠连群(contig)
  5. 将每个BAC插入片段再随机切成约1 kb小片段,插入质粒构建子文库
  6. 对每个小片段进行约5倍覆盖的鸟枪测序
  • 两个BAC片段共有的相同小片段越多,二者叠连的可能性越高

拼接·

  • 由计算机软件寻找重叠序列并完成
  • 直接鸟枪法
    • 直接把大量通常小于1 kb的片段拼成连续序列
    • 一般只适合较小基因组;对大而富含重复序列的基因组几乎不可能成功
  • 分层鸟枪法
    1. 先拼接每个BAC所携带的基因组片段
    2. 再按物理图谱拼接完整染色体或基因组
  • 高同源性、已经测定的基因组可作为比较参照,使拼接较容易
  • 首轮拼接常只能得到粗略轮廓,随后还需多轮质量控制、优化和缺口填补
  • 教材指出,当时完整、准确、连续的人全基因组DNA序列仍未获得
  • 基因组序列数据储存在GenBank、EMBL和DNA Data Bank of Japan等数据库,供科研人员免费使用

注释·

  • 主要鉴定内容
    • 蛋白质编码基因
    • tRNA、rRNA等功能RNA基因
    • 控制DNA复制和基因表达的调控序列
    • 重复序列和转座子的分布
  • 病毒、细菌的蛋白质编码区多为连续序列,注释准确度较高
  • 高等生物的编码序列不连续,外显子和内含子的存在使蛋白质编码序列难以识别
  • 人类等复杂基因组的注释可能因分析者而异,需跨国家、跨学科合作
  • 基因组记录物种长期演化过程,可用于分析特定基因、基因群及调控机制的演化

大肠杆菌全基因组测序与注释·

  • 大肠杆菌是生物化学、分子生物学和生物技术中的经典模式生物
  • 基因组由一个封闭环状DNA分子组成,较多染色体组成的高等生物基因组简单
  • 全基因组系统测序前,已有1000多个基因被不同实验室零散测定
  • K-12全基因组测序分阶段完成,每一阶段测定一个大片段,并逐步优化策略

$\lambda$ 噬菌体文库与物理图谱路线·

  1. 纯化大肠杆菌基因组DNA
  2. 以特定限制酶随机切成大片段
  3. 连接到由 $\lambda$ 噬菌体改造的载体,构建噬菌体文库
  4. 筛选插入15~20 kb基因组片段的载体
  5. 大规模分析限制性内切酶图谱,确定各片段在原基因组中的相对位置
  6. 据此建立大肠杆菌基因组物理图谱

I-Sce I大片段路线·

  • 将酵母来源、长18 bp的I-Sce I非回文识别序列插入大肠杆菌基因组两个特定位点
  • I-Sce I特异切割后,可直接获得约250 kb DNA片段用于直接鸟枪测序
  • 优点:省去 $\lambda$ 载体克隆步骤,避免克隆可能引入的错误

大片段的鸟枪测序·

  1. 将每个载体所带大片段再次随机切割,常用物理处理或部分酶切
  2. 收集500~1000 bp片段,连接到质粒或M13载体
  3. 克隆扩增后,以通用引物进行Sanger测序
  4. 一般达到4~5倍覆盖,不清晰区域再用其他方法确认
  • 大肠杆菌基因组约5 Mb,4~5倍覆盖时随机测定序列总长约25 Mb

测序与重新注释结果·

阶段 主要结果
1997年完成K-12测序 全长4641652 bp,初步预测4288个基因
8年后重新注释 共4464个基因;156个编码功能RNA,4308个编码蛋白质
全基因组测序前的估计 仅约1700个基因
  • 大肠杆菌基因组碱基序列基本可靠,但结构和功能注释仍是长期、动态的认识过程
  • 表36-1的“约4300种蛋白质”、最初预测4288个基因及重注释的4308个蛋白编码基因属于不同时间和统计口径

人类基因组DNA测序与注释·

  • 人类全基因组由23对染色体组成,其测序的社会意义、科学价值、工作量及注释复杂度均远高于大肠杆菌
  • 1990年人类基因组计划正式启动前,基因克隆、遗传图谱、物理图谱和cDNA克隆等工作已陆续开展

组织与进程·

  • 两组平行开展
    • 来自美国、英国、日本、法国、德国和中国的单位组成国际合作组织,共20个测序中心;当时中国直接参与的是一家民营公司,后来成为中国科学院基因组研究所
    • 美国一家私立公司
  • 2001年公布完整性约94%的初步框架,政府支持项目第一阶段约用10年
  • 真正集中进行人类基因组测序约用2~3年
  • 正式测序前先构建人和鼠的物理图谱,并对较小基因组测序,以建立方法和演练注释

公立国际合作:分层鸟枪法·

  1. 从志愿者白细胞或男性志愿者精子获得基因组DNA
  2. 限制酶部分降解,获得100~200 kb片段
  3. 插入BAC,构建随机文库
  4. BAC文库平均覆盖率约20倍
  5. 构建覆盖全基因组的BAC物理图谱,确定大片段的叠连关系
  6. 各中心分别对选定BAC进行直接鸟枪测序,要求4倍覆盖
  7. 先拼接每个100~200 kb片段,再按物理图谱拼接染色体
  • 人基因组含大量重复序列,计算机拼接极其困难
  • 教材明确指出,当时人体全部染色体的完整连续序列仍未获得

私立公司:全基因组随机鸟枪法·

  1. 将志愿者基因组DNA部分酶切,收集2 kb、10 kb或50 kb片段
  2. 插入质粒,构建随机基因组文库
  3. 以自动毛细管测序仪进行大规模并行测序
  4. 采用配对末端测序(paired-end sequencing),从每个插入片段两端各测500~700 bp
  5. 计算机根据重叠序列和已知的两端间距进行拼接
  • 配对末端之间已知的距离为最终拼接提供重要定位信息
  • 该法建库和测序程序相对简单,但测序工作量和拼接难度巨大
  • 私立公司参考了国际合作组织公开的序列,教材认为不能视为独立以直接鸟枪法完成人类复杂基因组测序

人类蛋白质编码基因注释的困难·

  • 蛋白质编码外显子只占基因组极少部分
  • 外显子平均约150 bp,可编码约50个氨基酸残基
  • 单个内含子可长达10 kb
  • 一个蛋白质编码基因可跨越100 kb以上
  • 很多基因可发生可变RNA剪接
  • 因此,仅用计算机从基因组DNA预测蛋白质编码序列十分困难,准确性较低

预测及2004年结果·

  • 2001年两组科学家均预测人基因组直接编码约25000种蛋白质,低于此前最高140000种的估计
  • 2004年国际合作小组报道的人类常染色体基因组
项目 教材所列结果
拼接序列 约30亿bp
覆盖率 99%
预测蛋白质编码序列 约占常染色体基因组DNA的1.9%
预测蛋白质种类 20000~25000种
small RNA、lncRNA、假基因 各自接近或超过10000个
DNA结合蛋白结合位点 约640000个
  • 片段副本(segmental duplication)
    • 长度大于1 kb,相互间超过90%的碱基序列相同
    • Y染色体超过25%的序列属于片段副本;教材列总长度1450 kb,片段间99.97%的碱基相同
  • 上述99%覆盖率针对教材所述人类常染色体序列,不代表人体全部染色体都已获得完整连续序列

功能基因组学·

  • 基因组DNA相对稳定;除发生突变外,可在细胞分裂和世代间高保真传递
  • 个体发育中,不同细胞使用相同基因组却有不同的转录、翻译状态;表达差异促使细胞分化为不同组织
  • 功能基因组学(functional genomics)

    对特定物种基因组DNA所含全部功能元件(functional element)进行生物学鉴定和功能分析,从基因、转录物和蛋白质层面认识基因组功能。

  • 功能元件包括编码蛋白质与不编码蛋白质的元件
  • 广义范围可包括RNA转录谱、蛋白质翻译谱和代谢产物谱;教材将翻译谱置于蛋白质组学讨论
  • 研究目标
    • 建立细胞基因组与表型之间的联系
    • 解释细胞分化、细胞响应环境等过程的分子机制
  • 方法特点:主要使用DNA芯片等高通量手段,而非一次只研究一个或少数基因
  • 基因敲除有时也被归入功能基因组学

转录谱分析·

  • 转录物(transcript)高通量分析:对特定生物样品所含转录物进行大规模检测
  • 转录谱可在一定程度上反映蛋白质表达谱,但二者不能简单等同
    • 部分存在于细胞中的mRNA并不指导蛋白质翻译
    • 转录物含量与对应蛋白质含量不一定存在对应关系
    • 仅由mRNA的有无或丰度推断蛋白质的有无或丰度,可能不准确,甚至错误
  • 全基因组DNA序列的测定是转录物高通量分析的前提

DNA微阵列·

  • DNA微阵列(DNA microarray)/DNA芯片/生物芯片

    将大量DNA探针同时共价连接在固体表面的不同特定位点而形成的检测器件。

  • 若探针覆盖一个物种全基因组中的所有基因,一块芯片可同时检测样品的全部转录物
    • 教材例:根据酵母基因组6000多个基因设计全基因组芯片
两种样品的比较流程·
  1. 分别从两种生物样品取得cDNA,如正常细胞和肿瘤细胞
  2. 两组cDNA分别标以红色和绿色荧光
  3. 将两组标记cDNA共同与芯片上的DNA探针杂交
  4. 根据各探针位点的荧光种类和强度,判断相应基因是否表达及其丰度
芯片位点信号 教材判读
仅红色或仅绿色 相应基因只在其中一种样品中表达
黄色 两种样品的cDNA均可与该探针杂交,即两种样品均表达该基因
荧光强度 反映相应转录物的表达丰度
  • 教材未指定正常样品和肿瘤样品各对应哪种颜色
  • 黄色仅表示红、绿荧光同时存在,不等于教材断定两组表达量完全相等
  • DNA微阵列用于对两类细胞mRNA水平进行定性和半定量比较,不能直接等同于蛋白质水平

DNA微阵列比较两种样品的基因表达谱


基因敲除·

  • 研究基因功能的一种方法:使特定基因失活,再观察细胞或个体的表型变化
  • 基因敲除(knockout)

    通过基于同源重组的基因打靶技术,将基因组中的正常基因彻底删除,使其失活。

  • 基本逻辑
    1. 选择目标基因
    2. 通过同源重组进行基因打靶
    3. 删除正常基因并使其失活
    4. 观察细胞或个体表型变化,据此推测基因功能
  • 限制
    • 基因组中的每个基因只能逐一敲除,教材指出尚缺乏高通量技术
    • 不同物种中同源重组敲除的难度和技术手段不同
  • Mario Capecchi、Martin Evans和Oliver Smithies因建立基因打靶技术获2007年诺贝尔生理学或医学奖

基因敲低与RNA干扰·

  • RNA干扰(RNA interference,RNAi)

    向细胞引入与目标基因对应的双链RNA,经细胞加工后,使相应的已转录mRNA降解。

  • 基因敲低(knockdown)

    RNAi降低目标mRNA和蛋白质的产生,但不像基因敲除那样彻底消除目标蛋白质。

RNAi机制·

  1. 向细胞或生物个体提供与拟干扰基因对应的双链RNA
  2. 双链RNA在细胞内被加工成约20 nt的寡核苷酸
  3. 其中一条单链寡核苷酸与蛋白质复合物结合
  4. 复合物促使与该寡核苷酸序列对应的mRNA降解
  5. 目标蛋白质产生量降低,但通常不完全消失
  • 生物学背景
    • 最初在线虫细胞中发现,后来发现适用于其他真核生物的培养细胞和完整个体
    • 本是生物体抑制部分外来病毒或自身转座子并沉默其功能的一种复杂机制
  • 对基因组序列已测定的生物,可逐一敲低全部基因并观察表型
  • 结果解释的限制
    • 基因具有冗余性
    • 观察条件有限,敲低或敲除不一定产生可观察表型
    • 因而这类研究只能对部分基因的功能提供暗示
  • Andrew Fire和Craig Mello因在线虫中发现RNA干扰获2006年诺贝尔生理学或医学奖

蛋白质组学·

  • 基因组注释可预测蛋白质编码基因及其氨基酸序列,但不能充分回答
    • 预测蛋白质是否在生物体内真正产生
    • 蛋白质发生了哪些翻译后修饰
    • 蛋白质与哪些其他蛋白质相互作用
  • 因此需在蛋白质水平进行实验性高通量分离、鉴定和功能研究

二维电泳及质谱高通量分离鉴定蛋白质

二维电泳高通量分离蛋白质·

  • 高分辨二维电泳(two-dimensional gel electrophoresis,2-DE)出现于20世纪70年代中期
维度 方法 蛋白质状态 分离依据
第一维 非变性等电聚焦电泳 保持天然构象 等电点差异
第二维 变性SDS-PAGE 蛋白质变性 多肽链长度差异
  • 第二维可将第一维中等电点相同、未能分开的蛋白质进一步分离
  • 一块二维胶可分辨几千种蛋白质斑点
  • 同一种蛋白质的不同翻译后修饰产物,如不同磷酸化形式,也可能被分开
  • 局限:二维电泳难以有效分离膜蛋白。

质谱高通量鉴定蛋白质·

  • 早期方法
    • 抗体与特异抗原蛋白结合
    • Edman法测定蛋白质的部分氨基酸序列
  • 局限:不能进行大规模、高通量鉴定
  • 20世纪80年代发展的蛋白质质谱,以高准确度测定相对分子质量为主要特征
  • 在软解离技术建立前,蛋白质因相对分子质量高、挥发性低而难以进行质谱分析
  • 技术突破:建立两种不破坏蛋白质共价结构的软解离技术

MALDI与ESI·

比较 MALDI ESI
全称 基质辅助激光解吸质谱 电喷雾解离质谱
样品状态 固态,混入吸光基质 溶液
离子化方式 快速激光脉冲引起温和解吸,并经质子化或去质子化形成离子 高压针管喷雾形成带电微粒,溶剂迅速蒸发
带电产物 保持结构完整的带电蛋白质 留在气相中的多电荷蛋白质
检测 电场加速后,以飞行时间反映相对分子质量 进入真空检测腔并加速,以固定距离的飞行时间反映相对分子质量
  • MALDI(matrix-assisted laser desorption/ionization)
    • 教材所举基质:直径30 nm的钴颗粒溶于甘油
    • 教材所举激光:337 nm氮激光
    • 带电颗粒到达检测器的飞行时间(TOF)与相对分子质量相关
  • ESI(electrospray ionization)
    • 蛋白质溶液经高压针管喷成带电微粒
    • 溶剂逐渐蒸发,微粒变小,留下气相中的多电荷蛋白质
    • 带电蛋白进入真空检测腔并飞向检测板

肽段质量指纹谱·

  • 肽段质量指纹谱(peptide mass fingerprint)

    蛋白质经特定蛋白水解酶切割后,其全部特定肽段相对分子质量所构成的特征谱。

  • 鉴定流程
    1. 以二维电泳分离蛋白质斑点
    2. 用胰蛋白酶等特定蛋白水解酶逐一水解成肽段
    3. 以层析技术分离肽段
    4. 用质谱精确测定每个肽段的相对分子质量
    5. 得到待鉴定蛋白质的肽段质量指纹谱
    6. 与数据库中的已知指纹谱比较;相同者即完成鉴定
  • 数据库中的蛋白质序列通常由基因组DNA或cDNA序列预测
  • 已知蛋白质的理论指纹谱可由氨基酸序列及特定酶切方式预测

串联质谱测定肽段序列·

  1. 将一个特定肽段随机在各肽键处打断
  2. 精确测定所得各片段的相对分子质量
  3. 比较两个质量相近片段之间的精确质量差
  4. 由质量差推断相邻位置氨基酸的种类
  5. 根据所得肽段序列搜索蛋白质序列数据库,鉴定未知蛋白质
  • 局限:Leu和Ile相对分子质量完全相同,不能用该方法区分。
  • 教材称当时的人类蛋白质组分析采用直接测定每种蛋白质某一肽段序列的方法进行高通量鉴定
  • John Fenn和Koichi Tanaka因蛋白质质谱技术贡献获2002年诺贝尔化学奖

蛋白质-蛋白质相互作用网络·

  • 体内蛋白质几乎均通过与其他蛋白质相互作用发挥功能,可形成稳定或动态复合体
  • 高通量网络分析的两项核心工作
    1. 大规模分离细胞或组织中的蛋白质复合体
    2. 以质谱鉴定每个复合体中的全部蛋白质
  • 高通量获得细胞或组织中全部蛋白质相互作用复合体,是重要且极具挑战性的工作

亲和层析分离流程·

  1. 将His-tag、Avi-tag等亲和肽标签逐一与每种蛋白质融合
  2. 用标签特异的亲和层析逐一分离融合蛋白及其相互作用复合体
  3. 用质谱鉴定复合体内的全部蛋白质
  4. 汇总各复合体组成,构建复杂的蛋白质相互作用网络

蛋白质翻译后修饰的高通量鉴定·

  • 常见修饰:糖基化、磷酸化、乙酰化等
  • 不同修饰发生在不同氨基酸侧链上,可影响蛋白质的
    • 结构
    • 功能
    • 调控
    • 细胞定位
  • 质谱鉴定原理
    1. 分别精确测定未修饰肽段和修饰肽段的相对分子质量
    2. 计算二者的质量差
    3. 判断该质量差对应何种修饰基团,从而推断修饰类型
  • 主要困难
    • 很多翻译后修饰是可逆、动态的
    • 难以纯化得到修饰状态均一的特定蛋白质样品
  • 教材指出,翻译后修饰的高通量鉴定技术仍需完善

人类蛋白质组工程·

  • 人类基因组DNA序列预测其编码20000~25000种蛋白质
  • 需要回答两个问题
    1. 预测的蛋白质是否都真实存在于人体内
    2. 人体内真实存在的蛋白质是否都已被基因组预测
  • 研究方法
    • 从人体不同组织、细胞系和体液中分离蛋白质
    • 进行质谱鉴定和深度生物信息学分析
  • 教材所述结果
    • 已直接鉴定约17000种人体蛋白质
    • 大部分与基因组预测结果一致
    • 少部分不在预测的蛋白质清单中
    • 仍有许多预测蛋白质未被直接鉴定
  • 未被鉴定的可能原因
    • 体内含量极低
    • 存在时间极短
    • 高度不稳定
  • 人体蛋白质翻译后修饰和相互作用网络仍是未来人类蛋白质组学的重要内容,但技术难度很高

系统生物学·

  • 系统生物学是在能够对生物组分及其相互作用进行高通量、全局研究后形成的新研究模式
研究模式 主要特点
还原论 将复杂体系拆分成简单组分进行研究
系统生物学 对生命体系作全局性描述,强调全局性、网络性、数学和定量分析
  • 当前系统生物学主要由基因组学、蛋白质组学和代谢组学等组学发展而来,仍多处于分子水平
  • 教材判断:系统生物学必须提升到组织和个体水平,才可称为真正的系统生物学
  • 未来任务
    • 揭示和提炼生命体系中的定量理论
    • 根据系统数据预测生物表型
    • 把分子相互作用网络、基因组和蛋白质组数据与个体生理功能和表型联系起来
    • 从高通量信息和大数据中揭示种群演化规律
    • 认识个体发育及疾病发生规律
  • 若不能回答上述问题,系统生物学可能仍未脱离还原论,只是扩大了研究规模

本章名词·

重叠基因|overlapping gene, nested gene

具有部分共用核苷酸序列的基因, 即同一段 DNA 携带了两种或两种以上不同蛋白质的编码信息。重叠的序列可以是调控基因, 也可以是结构基因。常见于病毒和噬菌体基因组中。

共有序列|consensus sequence

共有序列是一组相似DNA或RNA序列经比对后各位置出现频率最高的碱基所组成的保守序列,反映功能相关区域(如启动子、重组位点)的共有模式。例如真核启动子中-25至-30区的TATA框即为典型的共有序列,其碱基组成高度保守。它常用于描述蛋白质或酶识别与结合的关键序列特征。

分层鸟检测序法|hierarchical shotgun sequencing

分层鸟枪测序法是一种用于测定庞大复杂基因组全序列的策略,又称自上而下测序法或基于图谱的测序法。该方法先将基因组DNA构建成物理图谱,分割为多个大片段(如BAC克隆)并确定其位置关系,再对每个克隆单独进行鸟枪法随机打断测序,利用重叠序列拼接出各克隆的序列,最后依据物理图谱将克隆序列装配成完整连续的基因组序列。

基因群|gene cluster

基因群是指基因组中功能上相关或位置上相邻的一组基因,它们可能协同参与同一生物学过程或受到共同的调控机制协调表达。

基因与蛋白质共线性|colinearity of gene and protein

基因与蛋白质共线性指基因中的核苷酸序列与其编码的蛋白质的氨基酸序列之间存在的线性对应关系,即基因编码区的核苷酸顺序直接决定了蛋白质的氨基酸顺序。在无内含子的基因中,这种共线性是连续的;但真核生物基因因含有内含子,其编码序列被非编码序列间隔,导致共线性被打断。

模式生物|model organism

模式生物是一类在生物化学和分子生物学研究中广泛使用的经典生物,例如大肠杆菌。它们作为研究模型,有助于揭示基因表达、蛋白质功能等基本生命过程的普遍规律。

配对末端测序法|paired-end sequencing

配对末端测序法是从待测DNA片段的两端分别进行序列测定,获得一对方向相对、间隔已知的读段的方法。该技术能够提供更长的有效读长和成对的距离信息,有助于提高基因组拼接的准确性和完整性,尤其适用于重复序列区域和结构变异的检测。

片层|lamella

片层指蛋白质二级结构中的β-折叠片层,是由多条β-股通过主链间的氢键横向排列形成的片状结构,常见于锌指等基序中,为其提供稳定支架。

拼接|splicing

拼接是指在基因组测序中,利用计算机软件通过识别DNA片段间的重叠序列,将大量随机测序的小片段组装成完整连续DNA序列的过程。该过程是鸟枪法测序策略的关键步骤,对于分层鸟枪法,需先拼接BAC克隆内的序列,再结合物理图谱获得全基因组序列。拼接通常需多轮优化、质量控制与缺口填补,以确保序列的连续性和准确性。

全基因组|whole genome

全基因组是指一个物种完整的全部DNA序列的总和,包括核基因组以及细胞器基因组等,涵盖编码蛋白质和功能RNA的基因以及非编码调控序列和重复序列等。全基因组序列的测定与注释是基因组学研究的核心内容,旨在揭示全部基因的结构和功能。基于全基因组序列,可进行全基因组范围的基因表达调控分析、进化研究以及医学应用等。

随机片段化|random fragmentation

随机片段化(random fragmentation)是指通过机械剪切(如超声波处理)或酶切等方法,将基因组DNA随机断裂成大小不等、彼此间具有重叠序列的片段的过程。该技术常用于鸟枪法测序策略中构建DNA文库,以获得覆盖整个基因组的随机片段集合,为后续测序和基于重叠序列的计算机拼接提供基础。

生物信息学|bioinformatics

生物信息学是应用于基因组学和蛋白质组学领域的计算机技术,旨在对高通量实验产生的海量生物数据进行有效储存、分析和注释,从而支持基因组和蛋白质组的结构、功能及相互作用的系统研究。

注释|annotation

注释是指在基因组DNA序列测定完成后,利用已有知识和生物信息学方法,对序列所蕴含的功能信息进行系统鉴定和标注的过程。主要工作包括识别全部蛋白质编码基因和功能RNA基因,以及鉴定调控序列、重复序列和转座子等元件。注释是基因组学研究的核心环节,为后续的基因功能、表达调控及进化分析提供基础。

足迹法|footprinting

足迹法是一种用于确定蛋白质在DNA上结合位点的分子生物学技术。其原理是将DNA片段末端标记后与蛋白质结合,再用DNase I或化学试剂进行部分切割。由于蛋白质结合区域受到保护而不会被切割,电泳后放射自显影图上出现缺失条带的“足迹”,从而精确定位蛋白质结合序列。