基因组学-第二讲 基因组研究的方法_第1页
基因组学-第二讲 基因组研究的方法_第2页
基因组学-第二讲 基因组研究的方法_第3页
基因组学-第二讲 基因组研究的方法_第4页
基因组学-第二讲 基因组研究的方法_第5页
已阅读5页,还剩325页未读, 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

1、第二讲 基因组研究的方法,一、遗传图谱 二、物理图谱 三、序列图谱 四、基因图谱,一、遗传图谱,1、遗传图谱(genetic map) 又称连锁图谱(linkage map)或 遗传连锁图谱 (genetic linkage map) 是指人类基因组内基因以及专一的多态性DNA标记(marker)相对位置的图谱。,2、发展过程: (1)经典的遗传图谱: 主要是研究多样性基因的相互关系、这些基因所构成的连锁群(linkage group)以及连锁群中各多样性基因的线性关系。,(2)现代的DNA标记连锁图谱: 利用DNA标记去构建多态性基因与这些标记的连锁关系,进而确定多态性基因的位置。,3、 D

2、NA标记技术: 三大里程碑 限制性片段长度多态性 数量可变的串联重复 单核苷酸多态性,(1)限制性片段长度多态性 (restriction fragment length polymorphism,RFLP) 是指基因组DNA经特定限制性内切酶酶切后所产生相当多的大小不等的DNA片段,用同位素或生物素标记的DNA片段作为探针,用杂交的方法,把与被标记的DNA相关的片段检测出来,从而构建出多态性图谱。,缺点: (1)检测成本昂贵; (2)耗时耗力; (3)不易发展成自动化。,(2)数量可变的串联重复 (variable number tandem repeat,VNTR) 包括:微、小卫星(mi

3、crosatellite/minisaellite)或短串联重复(short tandem repeat,STR或short sequence length polymorphism,SSLP)标记的开发和使用。,优点: (1)微卫星位点的含量丰富; (2)多态信息含量极为理想; (3)利用PCR手段检测,成本大大降低; (4)一定程度上提高了检测过程的自动化 。,缺点: 对位点的分型需要凝胶电泳使之较难达到完全的自动化程度。 但各种荧光标记测序仪的使用使得这种状况得到了改善。,(3)单核苷酸多态性 (single nucleotide polymorphism,SNP) 遗传多样性 在大多数

4、基因位点上都会有若干个等位型(alleles) 每个核苷酸的突变率为10-9左右 单碱基的变异就形成许多双等位型标记 (biallelic marker) 人类基因组中300万个,平均约每1000个碱基对一个,优点: (1)标记数目多; (2)覆盖密度大; (3)多种非凝胶基础的检测手段, 如:DNA芯片技术。,4、基础: 真核生物遗传过程中会发生减数分裂,此过程中染色体要进行重组和交换,这种重组和交换的概率会随着染色体上任意两点间相对距离的远近而发生相应的变化。,5、遗传距离和物理距离: (1)重组分数: 假定沿染色体长度上交换的发生具有同等的机率,那么两个基因位点间的距离可以决定减数分裂过

5、程中产生重组染色体的发生率。 (2)单位:厘摩尔根(centimorgan,cM),6、应用: (1)为染色体行为的研究提供了依据; (2)基因定位与克隆的手段; (3)在肿瘤生物学和细胞遗传学研究中的应用; (4)个体鉴定与法医学; (5)VNTR标记用于群体遗传学中人类进化和遗传 多样性的研究。,二、物理图谱,1、克隆载体: (1)粘粒载体(cosmid vector) 20世纪80年代早期之前 本身也是一种质粒,包含噬菌体cos位点,平均插入片段2040kb,最大约45kb。 “自下而上”,(2)酵母人工染色体(yeast artificial chromosomes, YAC ) 20

6、世纪80年代后期 平均插入片段8001000kb,最大可达2Mb “自上而下”,缺点: 克隆效率低; 易形成克隆嵌合体; 插入片段不稳定; 难以制备纯的YAC-DNA.,(3)细菌人工染色体(bacterial artificial chromosome,BAC) 以大肠杆菌为宿主的替代文库,还包括: P1噬菌体库和P1衍生人工染色体库(PAC) 环状DNA分子 最大容量300kb,平均插入片段125150kb,(4)其它载体: MAC:一种类似于YAC,但以哺乳细胞作为宿 主细胞的新型载体 Fosmid:一种类似于BAC,来源于大肠杆菌的 F基因的载体,2、物理图谱: 是以特异的DNA序列为

7、标志所展示的染色体图。 标志之间的距离或图距以物理距离如碱基对(base pair;bp,kb,Mb)表示。,(1)完整的物理图谱包括: 不同载体DNA克隆片段重叠群图 大片段限制性内切酶切点图 DNA片段(探针)或一段特异DNA 序列(STS) 的路标图 基因组中广泛存在的特征序列(如CpG序列、 Alu序列、isochore)等的标记图,(2)人类基因组物理图 最精细的图是:核苷酸序列图 最粗略的图是:染色体组型(染色体的细胞 遗传学区带)图,(3)相关知识: 重叠群(contig) 由相互重叠的序列片段组装形成的连续的DNA序列。 STS(序列标签位点,sequence tagged s

8、ites) 是从单拷贝的DNA序列发展而来的一对PCR引物,每个STS在基因组内有特定而单一的同源序列。, Alu重复序列(Alu repeat sequences) Alu重复序列是哺乳动物基因组中SINE家族的一员,约有50万份拷贝。也就是说平均46 kb中就有一个Alu序列。由于这种DNA序列中有限制性内切核酸酶Alu工的识别序列AGCT,所以称为Alu重复序列。Alu序列两端各有一个正向重复序列,末端有一个poly(A)尾。, CpG岛(CpG island) 是基因末端的一类长度在几百bp的特殊DNA序列,其中CG核苷酸对出现的频率非常高。 CpG岛在基因组中有重要的生物学意义,而识

9、别CpG岛有助于在基因组序列中确定我们感兴趣的区域。 人类基因组中存在3万个,3、物理图谱的分类: (1)低分辨率物理图谱 (low-resolution physical map) (2)高分辨率物理图谱 (high-resolution physical map),(1)低分辨率物理图谱 只能粗略的分辨路标位置但不能准确排序的物理图谱。 染色体图谱 遗传连锁图谱,(2)高分辨率物理图谱 通常的物理图谱就是指高分辨率的物理图谱。 基因组长片段限制性酶切图谱 重叠克隆图谱,4、基于路标位点构建物理图谱的方法: (1)染色体图: 即细胞遗传图谱(cytogenetic map) 通常使用原位杂交

10、(ISH)或荧光原位杂交(FISH)技术确定含有路标DNA片段在染色体上的区带位置和分布。 DNA片段可定在210Mb的范围内。,(2)cDNA图谱: 是在细胞遗传图谱上显示cDNA或ESTs(expressed sequence tags),即表达DNA(外显子)的区带位置。 部分cDNA序列可作为路标。,(3)利用家系分离分析法: (pedigree segregate analysis) 可确定具有多态性的遗传标记位点在遗传连锁图谱上的位置。 最新的人类基因组遗传连锁图谱已把标记间的平均距离缩小到1cM以下,即粗略地对应于物理图谱中的1Mb范围内。,(4)辐射杂种图谱: (radiati

11、on hybridization map,RH map) 是利用体细胞遗传技术(somatic cell genetic approach)构建高分辨率、长范围连续的人类基因组图谱。,基本原理为:人为地用放射线打断染色体,制备出含有特定人类染色体或片段的杂交细胞系,并利用类似于传统的减数分裂构图原理确定路标间的距离和位置。 最高分辨率可达到50kb。,(5)脉冲场电泳的长片段限制性位点图谱: 即限制性酶切位点指纹图谱 (restriction enzyme fingerprinting map) 是描述以稀有酶切位点为生物学界标的顺序和距离,以及形成基因组或染色体区域上的酶切图谱。,亦称为:T

12、op-down构图法 区域性DNA大片段有利于较精细制图,如:YAC克隆插入片段分析便于重叠图谱的分析,此方法可把DNA片段定位在100kb 1Mb范围内。,(6)相连组合图谱或重叠克隆群图谱 (overlapping sets of cloning map) 由DNA片段重叠群形成的小组合,它是描述存在于重叠的DNA片段克隆的顺序和距离。 通常通过粘粒重叠克隆群把DNA片段定位在小于2Mb的范围内。 相对于长片段限制性酶切位点图谱,亦称为Bottom-up法。,(7)STS为基础的整合图: 是从基因组上筛选特异序列,其最终密度至少达到平均每100kb左右一个,最终将把各种方法构建的图谱整合起

13、来,完成准确完整的系统物理图谱。,(8)部分及全基因组测序: 分辨率最高的物理图谱。 目前要构建的高分辨率(100kb)物理图谱上路标序列本身也是基因组序列信息的一部分。,(9)其他方法: 基因组序列抽样(genomic sequence sampling,GSS) 结合片段限制性酶切和STS 1 5 kb 可见图谱(optical map) 结合限制性酶切、电泳和FISH技术,碱基序列,(10)小结:,5、按路标分类: 两种相关客观物位点:断点(breakponit)和序列的路标 构图法 实验材料 断点 路标 减数分裂 家系 重组位点 DNA多态性 辐射杂种法 杂交细胞系 辐射引起的染色体断

14、裂 STSs 原位杂交法 染色体 细胞遗传水平的界标 DNA探针 富含STS法 克隆库 克隆末端位点 STSs 基于克隆的指纹法 克隆库 克隆末端位点 基因组限制性酶切位点,6、基于STS的物理图谱: (STS-based physical map) 1989年,Olson M 提出 STS-DNA 特异序列,(1)STS在物理图谱中的重要性: 可用来特异性的定义YAC、粘粒或噬菌体克隆 可鉴定出与特定克隆存在重叠的克隆 在计算机数据库中的各种物理图谱可以用STS 这种通用语言统一起来,(2)基于STS的物理图谱的作用: 不但可对包括染色体图谱、限制性酶切位点为路标的限制性酶切图谱、重叠探针杂

15、交的YAC克隆片段重叠群(contig)图谱及其亚克隆重叠排序,以及其他新方法构建的物理图谱进行整合,也可对遗传图谱、基因图谱等各类图谱进行整合,最终完成系统统一性的人类基因组计划终极图谱。并且,最终完成的人类基因组核苷酸序列将是STS密度最高的基因组物理图谱。,(3)STS路标的建立: 从用噬菌体M13上构建的特定染色体克隆开始,选择随机的M13克隆并测200 400bp长的序列,再与所有的已知的序列比较确定出具有特异序列的区域,并从中选择可扩增出100 300bp的两条复性温度相似的PCR引物核苷酸序列。, 使用合成好的引物从基因组中PCR扩增后,进行琼脂糖凝胶电泳分析。可以作为STS的序

16、列将只能从整个基因组的单个特定区域扩增出来,且长度符合设计。,(4)STS的优缺点: 优点: 密度高,平均10kb出现一次; 作为界标提供衡量两个位点之间的距离 缺点: 工作量大; 都是PCR扩增,不能完全保证其精确度 和重复性,(5)STS的来源: 随机位点序列(随机基因组序列) 即从人类基因组上随机测序得到的不含重复序列的位点,其中包括以往用特异性DNA探针检测到的匿名DNA区域(包括多态性序列)中筛选出的特异序列作为STS, 表达基因序列 包括已知的从基因组数据库收集的互补cDNA序列筛选产生的特异序列及部分表达的EST序列,其中对位于cDNA的3非转录区(3-UTR)的特异序列研究,可

17、避免在基因组上扩增功能性DNA序列时由内含子引起的偏差, 遗传标记序列 即各种多态性遗传标记,如:微卫星标记等,但一般偏爱34个核苷酸重复的标记, 其他序列 如在为构建遗传图谱而筛选的遗传标记中淘汰的对遗传图谱不利的多态性较差的标记(大量CA重复的标记),(6)YAC-STS物理图谱 当有足够多的STS位标并在染色体上的分布达到足够密度,就可以根据每个YAC所含有的STS把各YAC排列在染色体上,得到一个相互重叠排列的染色体的YAC图谱,也就是通常所说的“STS mapping”,7、辐射杂种图谱(RH map) 辐射杂种法 1975年 Goss & Harris 创立的一种利用体细胞杂交的技

18、术。 辐射杂种图谱 1990年 Cox 建立的以辐射杂种细胞为工具进行人类(或其他哺乳动物)基因组高分辨率物理图谱,优点: 可以得到高分辨率的物理图谱,所得到的DNA 之间的距离与其物理距离直接对应 多态性DNA标志和非多态性DNA标志都适用于 此方法 此方法中采用PCR技术,因此简单、快捷, 此外,这种方法解决了利用YAC库构建基于STS的物理图谱时存在的两方面问题。 A. 基因组上一些富含GC区域往往被丢失, 没有可信的方法来评价已排序的路标顺序 B. 由于YAC本身存在嵌合体和重排,使得在 重叠群作图中很难精确把路标进行排序,8、大尺度限制酶图谱 (long range restrict

19、ion map) 是将YAC DNA(YAC不必纯化)用稀切点限制酶(如Sfi,Not,Nru等)酶解后经脉冲场凝胶电泳(pulsed field gel electrophoresis)分离DNA片段,经特异人DNA(如Alu序列)探针杂交后绘出图谱。,(1)限制酶的特点: 识别含有一个或多个稀少 CpG 2核苷酸序列、长度为6 8 bp 的稀有酶切位点的内切酶,就会在 CpG 岛处形成断点,以次构建含有多个 CpG 岛的限制性酶切图谱,制备出与捕获基因有关的 CpG 岛图谱,(2)排序方法: DNA指纹法 根据检测DNA的重复序列设置,序列标签限制位点 (sequence-tagged r

20、estriction site,STAR) 是指在随机位点上选择的特异序列STS及在特定位置上收集的序列。,STAR法 可用于部分及完全切割库的分析上,包括克隆末端序列在内的特定限制性酶切位点,收集组成DNA序列信息,在分析完全切割库时必须结合另一个库来分析(如克隆位点的相连克隆库),以产生准确的重复信息。,9、重叠群图谱: 中心内容是把染色体切割成小段后,克隆并排序,得到由排好序的插入DNA片段克隆组成的重叠群。 人类基因组计划物理图谱的核心部分。,(1)确定重叠群图谱的方法: 限制性片段指纹分析法 1992年 Sulston J et al 通过比较酶切片段指纹的异同,确定重叠区域,从而确

21、定克隆群的排序。 什么是指纹?,指纹: 是指通过完全酶解1010个克隆的拷贝,用凝胶电泳分离酶解片段,从而确定所产生的片段的长度。全部酶解片段长度的电泳图谱即构成了该克隆的限制片段指纹。,(2)拼接: 可能性90%可认为两个克隆是相连的 需要重复处理,确定一个重叠群中最可能的顺序,(3)缺点: 在重叠群增长过程中大多会发生交叠而相连,但有些却无法连接,形成间隙。 原因: 部分克隆的重叠度较低以至难检测 部分区域在制备克隆时容易丢失,(4)间隙的补平: 染色体步行法 (chromosome walking),10、人类基因组综合图 不兼容包括: (1)各图的尺度不等 (2)基因或DNA标志的名称

22、相互不一致 (3)不同的图谱内只含有单一的内容,为了某一特定染色体区段的研究,常常需要分别查阅几个不同的图谱,11、物理图在人类基因组研究中的应用 (1)基因克隆 功能克隆法 定位克隆法 (2)发现基因上的作用,(3)将提供鉴定和分析染色体中功能性DNA片段的实验基础 (4)在研究基因组结构时,染色体上基因排序及其与其他功能基因的关系,三、序列图谱,(一)基因组测序的发展 1、历史的回顾新技术的发展是决定因素 (1)限制性内切酶 1971年 SV40 (2)克隆载体 YAC & BAC (3)物理图谱制作技术的成熟 大肠杆菌、 酵母、 线虫,支原体(Mycoplasma genitalium)

23、 580 000碱基对 最小的独立生活的生物,幽门螺杆菌(Helicobacter pylori) 1 660 000碱基对 与胃病有关的细菌,结核分枝杆菌(Mycobacterium tuberculosis) 4 400 000碱基对 结核病的致病菌,霍乱病毒(Vibrio cholerae) 4 030 000碱基对 能引起霍乱,麻风病毒(Mycobacterium leprae) 32 700 000碱基对 能引起麻风病,(4)测序技术 Sanger末端终止法 取代 Maxam and Gilbert 化学法 (5)大规模测序开始 荧光自动分析仪 (6)检测技术 毛细管电泳技术 300

24、450 bp 平板电泳技术 600900 bp,(7)测序的策略 散弹法测序(shotgun sequencing) 它主要依赖于计算机技术将单一读序自动组装起来,而减少人工操作。 人工不仅昂贵,而且常造成判断错误。,2、基因组物理图谱的初期完成 两个标志: (1)全基因组物理图谱: 法国Daniel Cohen领导的CEPH 美国Eric Lander领导的Whitehead 为遗传图谱打基础,分辨率低,仅在0.51.0 Mb左右,(2)单个染色体物理图谱: 分辨率高,一般要求在100kb左右 最早完成的单个染色体是Y和21号 质量最高的是X和7号染色体 分辨率的参数:有序标志(ordere

25、d markers)的平均距离和总标志的平均距离,3、大规模测序的开始 在低精度遗传图谱与物理图谱宣告完成后,酵母和线虫基因组测序工作显示不容质疑的成功希望时开始的。1995年 两个先驱者: 英 Sanger中心 John Sulston 美 圣路易斯华盛顿大学 Robert Waterston,(二)基因组测序和cDNA测序的区别 基因组测序 cDNA测序 BAC、YAC文库筛选 无 STS或酶切指纹物理图谱 无 散弹法亚克隆文库组建 cDNA文库组建 长距读序、高质量数据 无限制 序列组装软件 无或简单组装 间隙连接(需要软件协助) 无 序列组装结果检验 无 克隆长距离连接(1 Mb) 无

26、 基因寻找软件 无 价格高(每测序道5-15美元) 价格低(每测序道5美元),(三)DNA序列分析的方法 1、Sanger双脱氧链终止法 1977年 英 F. Sanger等人 利用DNA聚合酶和双脱氧链终止物测定DNA核苷酸序列的方法 要求使用一种单链的DNA模板和一种适当的DNA合成引物“引物合成法”或“酶催引物合成法”,(1)基本原理 利用了DNA聚合酶所具有的两种酶催反应的特性: DNA聚合酶能够利用单链的DNA作模板,合成出准确的DNA互补链 DNA聚合酶能够利用2,3 -双脱氧核苷三磷酸作底物,使之参入到寡核苷酸链的3 -末端,从而终止DNA链的生长,(2)发现 1969年 M.

27、R. Atkinson等人 32P标记,(3)实际反应中 使用失去了5 3核酸外切酶活性的DNA聚合酶的Klenow大片段,来催化合成单链DNA模板序列的互补链 适当调整ddNTP与dNTP的比例,获得良好的电泳谱带模式 dNTP/ddNTP = 1:100 200 bp 降低ddNTP对dNTP的比例 300 bp,(4)Sanger双脱氧-M13体系DNA序列分析法 限制酶切割 数量大 如:X174 DNA序列 5387 bp 10种限制酶 凝胶检测和纯化 浪费 DNA丢失和损伤, 解决方法 将DNA片段克隆到载体分子上 单链载体分子 M13 通用引物(universal primer),

28、 M13载体的优点 待测定的DNA序列,都是被克隆在M13基因组的同一个特定区段内,所有的待测定的DNA片段,都可以共用一种引物,这样就避免了合成和分离各种不同引物的许多麻烦。 已经成为一种最普遍采用的快速的DNA序列分析法,(5)Sanger双脱氧-pUC体系DNA序列分析法 酶的变化: 反转录酶或 T7 DNA聚合酶 载体的变化: 质粒载体 1985年 E. Y. Chen & P. H. Seeburg,2、Maxam-Gilbert化学修饰法 1977年 美 哈佛大学 A. M. Maxam & W. Gilbert,(1)基本原理 用化学试剂处理具末端放射性标记的DNA片段,造成碱基

29、的特异性切割。由此产生的一组具有各种不同长度的DNA链的反应混合物,经凝胶电泳按大小分离和放射自显影后,便可根据X光片底板上所显现的相应谱带,直接读出待测DNA片段的核苷酸顺序。,(2)特点 DNA片段可以是双链或单链 末端必须带有放射性标记 技术关键在于: 使DNA的4种核苷酸碱基中,有12种发生特异性化学切割反应,(3)化学切割反应的内容 碱基的修饰作用 修饰的碱基从其糖环上转移出去 在失去碱基的糖环部位发生DNA链的断裂,(4)碱基特异的化学切割反应 肼(也叫连氨):NH2NH2 硫酸二甲酯 酸 碱,(5) Maxam-Gilbert化学修饰-CS载体系统DNA序列分析法 1987年 R

30、. Eckert 末端标记载体(endlabeling vector), 载体的特点 在其同待测定序列的DNA克隆片段相邻的部位上,有一个Tth111限制位点 GACN NNGTC 产生出一个突出的5碱基,对于末端标记载体,存在Tth111限制位点的优点 切割后产生单碱基的5突出末端,因此只能加上一个标记的碱基 此位点十分稀少,末端标记反应麻烦小 5突出的碱基可是A、G、C、T,可对末端标记 载体中有两个此位点,因此可对插入片段的任何一端进行标记,(6) Maxam-Gilbert化学修饰法的优点 不需要体外酶催反应 可以两个方向测定 同时测定2条DNA链,可互作参照,3、DNA杂交测序法 传

31、统测序技术在有效性、可靠性、及成本费和自动化的适用性方面已满足不了此类工作的要求。 许多改进: 双链DNA测序法、银染测序法、非放射性标记测序法以及PCR测序法等等,杂交测序法(sequencing by hybridization,SBH) 90年代初期,由英国、前南斯拉夫和俄罗斯,(1)优点 避免了传统测序法必不可少的操作繁琐的 凝胶电泳 不需使用价格昂贵的核酸酶 不需要进行复杂的化学反应,(2)DNA杂交测序的原理 如果一段短的DNA探针能够同较长的靶DNA片段杂交,并形成完全的双链体分子,那么我们便可以据此推断在靶DNA上存在着相应的互补序列。,(3)步骤 将待测定的靶DNA分子同一组

32、已知其核苷酸 顺序的寡核苷酸探针进行杂交 对那些能够同靶DNA分子形成完全双链体分 子的寡核苷酸探针之间的碱基重叠关系作 比较分析,并据此推算出靶DNA的核苷酸序 列结构,例:一段12-mer的靶DNA分子 5 -AGCCTAGCTGAA-3 同一组完全的8-mer的寡核苷酸探针混合杂交,48 = 65 536 5,3-T-C-G-G-A-T-C-G-5 C-G-G-A-T-C-G-A G-G-A-T-C-G-A-C G-A-T-C-G-A-C-T A-T-C-G-A-C-T-T 3-T-C-G-G-A-T-C-G-A-C-T-T-5 5-A-G-C-C-T-A-G-C-T-G-A-A-3,(

33、4)两种不同的具体操作方式 将不同的寡核苷酸与固定在滤膜上的靶DNA样 品作连续按序的杂交 这种方法已被广泛应用于DNA斑点印迹杂交, 应用寡核苷酸矩阵芯片的方法 (oligonucleotide matrix) 简称 SHOM 法 通过连接在寡核苷酸3-末端或5 -末端的活化的接头与玻璃或凝胶之间的共价结合,而把寡核苷酸固定成二维阵列形式,测序芯片(sequencing chip) 或矩阵芯片(matrix) 这种在特殊的固体支持物表面固定着一组完全的或大量的寡核苷酸的结构 实验表明:使用凝胶作支持物,能比玻璃或滤膜固定更多的寡核苷酸分子,光激活化学反应 在一块玻璃板表面直接地平行合成寡核苷

34、酸的技术 核心:用光不稳定的保护基团,取代酸不稳定的二甲氧基三苯甲基(DMT)保护基团,通过一种特殊的装置作光照射,便可使位于寡核苷酸选择区段内的光不稳定保护基团释放出来,(5)杂交的检测 磷光成像仪(phosphor-imager) 图像分析软件 配有光电倍增管的共聚焦激光荧光显微镜,检测中存在的问题 如何正确地辨别具有碱基错配的双链体分子,其中尤以具G-T或G-A末端碱基错配的双链体更难检测,实验结果表明: 对于较短的寡核苷酸来说,由于碱基错配造成的去稳定效应,会使杂交信号强度明显下降,因此他们同靶DNA片段杂交产生的具内部碱基错配的双链体,是很容易同完全的双链体分子辨别开来的。,(6)缺

35、点 无法克服单链DNA样品自身形成的二级及三级结构对杂交作用的干扰效应 不适用于简单重复序列的直接测序 不适用于 poly(A)尾巴的直接测序 不适用于卫星DNA的直接测序,还需要的技术改进: 矩阵芯片的制作 杂交程序 杂交测定 错配碱基双链体的辨别 适用的有关仪器和软件,(7)SBH的应用 可有效地用来检测靶DNA序列中的单碱基的变 化。而且相信在不久的将来,还会制造出能 精确鉴定任何点突变的诊断芯片;, 可用于不同DNA片段之间的序列比较分析, 尤其是新克隆基因与已测序的同源基因的 比较分析,以及对一些特殊的DNA区段(诸 如保守序列、启动子和增强子)之基调序 列进行鉴定和同源性序列检测等

36、等;, 通过一种专门设计的结合着固定的表达序 列标签(ESTs)的矩阵芯片,SBH还可用来 检测在不同类型的细胞中,或是在不同生 长发育状态下的细胞中,特定基因的表达 状况;, SBH可用来检验由传统测序技术所得到的 DNA的核苷酸序列数据。它能够发现出通过 传统测序法的重复测定而未能检测出来的 错误。从而缩短了大分子量DNA分子的冗长 的测序过程,提高了测序的速度,并且还 可以明显地提高输入DNA序列库的有关资料 的准确性。,4、测序技术的自动化 包括两个方面 (1)“分析反应”的自动化 (2)“读片”过程的自动化 关键问题,1988年 J. K. Elbert等人 DNA序列放射自显影图片

37、自动判读法 1986年 L. M. Smith等人 使用荧光染料的无放射性标记的DNA测序法 1986年 W. Ansorge等人 新型的DNA序列自动分析仪 四甲基若丹明作为唯一的荧光剂,(四)DNA序列的测定 1、基因组测序的基础 (1)物理图谱的连续性 (2)制作物理图谱的精髓:纵向整合 即从染色体到碱基的依赖关系 (3)不同水平的分子克隆 RH、YAC、BAC、黏粒、噬菌体等等,2、基本策略分而制之 (1)细菌和小的基因组(10 Mb)可用散弹法 测序新的长度挑战 (2)大规模测序的两个前沿基本是采用散弹法 (3)主要的限制:组装 (4)多染色体基因组逐个克隆各个击破 单分子基因组全基

38、因组散弹法,(5)散弹法测序 也称之为鸟枪法、基于图谱(map-based)或克隆亚克隆(clone-by-clone)法 是一种将基因组预先破碎成各级小片段的分级处理方法。, 基本原理 这些已被测序的破碎小片段被逐步组装成较大的片段,直到整个基因组组装完成。 第一级大片段用于构建物理图谱,它能够反映出每个片段在基因组中的具体位置以及和其他片段的相互关系; 这些大片段再被切割分成互相重叠的小片段进行测序,这个过程被称为“散弹法测序”,一旦这些所有的小片段都被测序完成,利用片段的重复区域重新组装成连续的大片段,并最终获得全部基因组的序列,这整个方法也被称为“分级散弹法测序”, 基本步骤 A. 目

39、的基因组DNA片段的制备 基本原则:DNA片段之间存在部分重叠序列;DNA片段大小均一。 分离和纯化真核生物基因组DNA时,通常采用蛋白酶分解和有机相抽提的方法除掉蛋白质及脂类等其他大分子。基因组DNA片段化则主要采用物理剪切法和限制性内切酶法。,B. 外源DNA片段的全克隆 选择适宜的载体,与外源DNA片段相连。 常用的载体有质粒、噬菌体、粘粒(cosmid)以及YAC。这些载体可以克隆的DNA片段长度上限分别约为10、23、45和1000kb。选择载体的主要参数是基因组大小,即基因组DNA序列的长短。,通过转化或转导的方法将带有不同DNA片段的重组DNA分子导入受体细胞,获得一套包含特定生

40、物体所有DNA序列的克隆。,C. 期望重组子的筛选 很多方法能帮助我们从基因文库的众多克隆中筛选和鉴定带有特定基因的克隆,它们大多是以杂交探测技术(hybridization probing)为基础的。 杂交探测是一种利用能和目的基因序列互补的DNA或RNA片段为探针,通过分子杂交的手段找出带有目的基因的DNA片段的实验方法。,用菌落(菌斑)原位杂交或免疫原位检测法可快速筛选基因文库。一般采用三步甚至两步筛选法,可以在短时间内完成全基因文库的筛选,其程序为: 首先制备高密度平板,使每块平板密集分布5000-10000个菌落或噬菌班,进行原位杂交;,由感光胶片上的斑点位置在原杂交阳性平板的相应区

41、域挖下固体琼脂,用新鲜培养基洗涤稀释; 将稀释液再次涂布平板,使每块平板只含有200-500个可辨认的菌落或菌斑; 用相同的探针进行二轮杂交,直至准确挑出期望的重组克隆。, 优缺点 速度快,简单易行,成本较低。但用它来测序,最终排序结果的拼接组装不太容易。,应用 第一个真核生物酿酒酵母 (Saccharomyces cerevisiae) 第一个动物线虫 (Caenorhabditis elegans),酿酒酵母 (Saccharomyces cerevisiae),线虫 (Caenorhabditis elegans),(6)全基因组散弹法测序 基本原理 将整个基因组进行随机的破碎并直接测定

42、所有的小片段序列,完全避免构建物理图谱,然后通过计算机程序将所有这些小片段组装成连续的大片段,最终得到全基因组序列。,这些程序由排序、编辑和组装小片段等一系列交错的、复杂的数学步骤组成;该方法被设计成先做前期比较简单的工作,后做需要大量计算的困难步骤地操作程序。, 应用 流感嗜血杆菌(Haemophilus influenzae) 果蝇(Drosophila melanogaster) 缺点 小片段重新构建成完整的基因组非常困难,果蝇(Drosophila melanogaster) 180 000 000 碱基对 遗传学上常用的模式生物,(7)大规模基因组测序的流程,YAC/BAC 3540

43、 kb片段的琼脂糖凝胶电泳回收,M13/质粒测序文库的转化,序列的质量评估,序列注册,3、序列测定的质量和准确性 准确性基于DNA多态性的特点而定 1/1000 1/10000 测序的质量是由初级数据库所决定的,Q20每个碱基的错误率在1/100以下,数据质量评估的几个方面: (1)在测序仪读取信息后,进行碱基识别过程的同 时,软件根据荧光曲线波形给出每个碱基的可 信度值 (2)软件确定所测的每个样品的高质量部分 (3)在序列拼接完成之后,软件对拼接成的contig 整体的可信度进行评估,给出可能的错误率 (4)对同一序列进行多次测定,4、DNA序列的组装 Phil Green实验室 Phre

44、d-Phrap-Consed (Ewing, et al,1998;Ewing and Green, 1998;Gordon,et al,1998),(1)Phred(测序器)的基本功能 找道(lane tracking):找到电泳道并识别泳道的空间 信号分离(lane profiling):分离碱基的四种不同信号 信号分析(trace processing):估计信号的强弱和基线,纠正信号的交叉, 碱基识别(base-calling): 按顺序破译碱基 错误率的估计(error probabilities): 根据信号峰的间距,识别与未识别碱基的比率,及信号峰分辨率等来估计错误,(2)Phr

45、ap(组装器)和Consed(校对器)的基本功能 根据Phrap的结果从头组装散弹法产生的不同 段序列 显示组装结果和质量 整合人工校对结果,TIGR(The Institute of Genome Research)在组装他们细菌基因组的序列时,主要是用PE-ABI(Perkin Elmer-Applied Biosystems)的组装软件AUTOASSEMBLER和他们自己的组装软件TIGR ASSEMBLER和TIGR EDITOR,5、测序数据的管理和处理 数量之大,难以形容。 1/3,(五)DNA测序的规模化与工业化 1、规模化的技术前提 (1)测序方法 (2)检测方法 (3)自动化

46、程度,2、DNA测序规模化的现状 (1)人类基因组测序 (2)模式生物测序 (3)微生物测序 (4)商品植物和家养动物基因组测序,拟南芥(Arabidopsis thaliana) 120 000 000 碱基对 第一个测序的植物基因组,3、DNA测序规模化的趋势和技术关键 (1)多种技术并进 测序技术、PCR技术、DNA序列分析技术、DNA制备文库组建、数据分析等 (2)数据分析和处理 (3)测序工作的完整性或彻底性 全基因组测序、全EST测序、全长cDNA测序、全基因组扫描等等,(六)展望基因组物理图谱的制作与DNA测序的未来 1、基因组物理图谱的制作将以“即做即用”为基本特点 测序的成本

47、与压力,2、从基因组的DNA序列中可以学到什么有价值的东西? (1)从DNA序列可以推出基因的结构,包括启动子 (promoter)、外显子(exon)、内含子 (intron)。 (2)从DNA序列中可以找出很多与结构有关的序列 (3)非编码区其实也有很多有价值的信息,3、基因的起源 4、DNA测序无疑将规模化和工业化 势在必行,四、基因图谱,(一)基因图谱的含义 鉴别人类目前认为的全部 3 4万个基因,其中包括决定各类RNA的基因。 有时也称为:基因表达图或转录图,(二)构建基因图谱的方法 基因组扫描(连锁分析和关联分析) 利用染色体畸变进行基因的定位与分离 基因差异表达 cDNA(EST

48、)捕捉法 CpG岛 体细胞杂交体、微细胞杂交体和放射杂交体 击“靶基因” 设“基因陷阱” “动物家庭”印证 分泌蛋白质反证法 计算机杂交,1、连锁分析和关联分析 (1)连锁分析 连锁(linkage) 重组分数(recombination fraction) 作图函数(map function),计算机软件 LINKAGE:适用于大家系,其中每个个体只用少量遗传标记的分析 GENEHUNTER:适用于小家系,其中每个个体须用大量遗传标记进行分析,(2)关联分析 关联(association) 亦称为连锁不平衡(linkage disequilibrium) 一旦形成特定位置基因的关联,由于致病

49、基因与被研究标记间紧密连锁,关联状态可以观察到多代,(3)相关的问题 不完全外显 表现型的模拟 遗传的异质性,2、利用染色体畸变进行基因的定位与分离 都包含染色体的畸变,如神经纤维瘤(NF)、脆性X病(FX)、杜氏肌营养不良(DMD)以及绝大多数的肿瘤和各种癌症,都可以由细胞遗传学的方法检测出来,克隆这类基因的一般策略: 对畸变与致病基因间的确切关系做出鉴定, 这需要进行大量的样本分析或依赖于连锁分 析等手段的检验 对目的区域进行精细分析,尽可能接近该基 因区域 对精细区域进行研究,分离、克隆基因,(1)确定畸变与疾病之间的关系并缩小目的区域 如果发现某个疾病患者中存在染色体变异,能不能进行该

50、位点基因的克隆?,如果该DNA畸变并不直接引起某种疾病 个体发生而非普遍性存在, 连锁分析 一般表现为染色体的断裂与平衡易位 可以以该变异位点作为标记对其家系进行连锁分析,分析染色体畸变与致病基因间的连锁关系,每个成员都进行细胞遗传学分析 遗传图谱 DNA多态性标记 2 cM 1 cM, 利用遗传标记进行染色体缺失研究 Digeoge综合症 5 p 猫叫综合症等 22 q 通过对该区域的高分辨率DNA多态性标记分析,找到公共缺失的最窄片段,杂合缺失(loss of heterozygostiy) 一个位点上两个多态性的等位基因之一的突变或缺失 抑癌基因的杂合缺失常导致肿瘤的发生 一般方法: 多

51、态性标记引物 PCR扩增 SSCP,(2)基因的克隆 功能克隆(functional cloning) 位置克隆(positional cloning) 表型克隆(phenotypic cloning), 功能克隆法 利用此法目前已经使得绝大多数可检测得到明显产物的基因得到克隆,并由此得到了大量的 cDNA 或 EST 序列, 位置克隆法 通过家系分析的方法对疾病基因的染色体位置进行定位后,在进一步克隆 染色体畸变位点本身就成为疾病基因克隆的一个绝好的位置信息,A. 构建目的区域的物理图谱 对精细定位后的区域可以直接对区域性物理图谱进行筛选 对目的DNA克隆重叠群进行测序、突变分析、cDNA筛

52、选等方法进一步克隆该基因,B. 疾病基因的确定 候选基因克隆法:对该区域中的已知基因位点进行测序,比较变化的情况,确定变异位点,b. cDNA直接筛选:如果知道该种疾病发生的 特异组织,还可以将该组织中的cDNA直接 与得到的YAC或BAC克隆杂交,筛选出此区 域内的特异表达基因,再对这些基因作进 一步分析,c. 对YAC或BAC进行测序:在测序允许的长度范 围内,如1 Mb以下的长度对YAC或BAC克隆直 接测序是较为可行的,尤其是得不到该区域 基因分布和表达的情况, 表型克隆 从疾病的表型出发,比较疾病与正常DNA水平上的不同,直接对产生变异的DNA片段进行克隆,而不依赖于基因的染色体位置

53、或基因的产物信息 典型的方法:RDA代表性差式分析,(3)染色体畸变分析中常用的技术 染色体显微切割(chromosome microdisection) 经中期染色体高分辨率制片后直接在显微镜下用激光、玻璃针等手段对目的区域,如某些断裂位点或易位、倒位位点的染色体进行显微切割,将切下的DNA片段克隆,再一一分析。 果蝇和小鼠, 荧光原位杂交(fluorescent in situ hybridization,FISH) 原位杂交(ISH):利用DNA探针在高分辨率中期染色体上杂交从而定位探针位置和检验染色体变异的方法 70年代后期 放射性同位素标记 周期长、信号水平低、信噪比较高 80年代后

54、期,FISH的一般原理: 首先采用生物素(biotin)或地高辛(digoxigenin)标记的dNTP对目的探针进行标记,再以此探针与高分辨率制片的中期染色体变性解链后杂交,经进一步洗脱,加入荧光燃料如FITC、CY5或罗丹明等标记的生物素或地高辛抗体,并洗去多余的抗体,就可以在荧光显微镜下观察信号, 比较基因组杂交 (comparative genome hybridization,CGH) 基于荧光原位杂交技术 很快便应用于肿瘤染色体变异的搜寻,CGH的原理:,基因组DNA打碎,与正高常分辨率中期染色体竞争杂交,CGH较常规细胞遗传学方法的优点: 高分辨率。常规方法不能显示的微小 变化被

55、光信号放大而可见 B. 可以同时对大批量样本进行分析 C. 不需要对肿瘤细胞进行培养,而只需要其DNA, 平底锅PCR(panhandle PCR) 某条相对固定的染色体上某个基因位点与其他染色体片段间发生了融合 染色体易位导致的变异区域的部分信息 为了获得基因的断裂位点,3、cDNA捕捉法(cDNA capture) 亦称为cDNA直选法(direct cDNA selection) 是一种直接用cDNA片段捕捉基因组DNA如YACs中所含人类基因的方法,(1)包括的三方面技术: 用PCR扩增来自不同组织的混合cDNA池(complex cDNA pools) cDNA片段与基因组目标DNA

56、(genomic target)杂 交,选择出与基因组目标DNA杂交的cDNA片段并进行 PCR扩增 进行第二轮选择并将选出的cDNA片段克隆到载体上,适用于大的基因组区域内表达序列的分离 可将多种组织来源的cDNA混合,进行一次直选,来找出尽量多的转录单位 可筛选相应组织的cDNA文库,(2)基本步骤 用生物素标记基因组目标DNA 将不同组织来源的cDNA混合,用随机引物和 oligo dT引物 PCR扩增 cDNA池 用Cot1 DNA或 gDNA与扩增后的cDNA池杂交封闭 cDNA重复序列,重复序列的封闭在 Cot1/2=20 条件下进行, 封闭了重复序列的 cDNA与生物素标记的目标

57、 DNA混合,在Cot1/2=100200条件下进行杂交 用表面有 streptavidin的磁珠吸附生物素标 记的目标 DNA,从而将与目标 DNA杂交的 cDNA保留下来, 洗去非特异结合的 cDNA后,再将被目标 DNA捕捉的 cDNA洗脱下来 用 PCR扩增第一轮选择所得的 cDNA,并用同样的方法进行第二轮选择 将第二轮选择得到的 cDNA克隆到载体上并进行分析,(3)影响因素 高质量 cDNA来源,覆盖 cDNA全长各部分, 低 rRNA和质粒 DNA含量等 基因组目标 DNA质量也很重要 cDNAs和目标 DNA的相对量也很重要, 如用 YACs来选择 cDNA,那么必须将 YA

58、Cs从 酵母基因组中分离出来 用报告 cDNA(reporter cDNA)作为阳性对 照来监测第二轮选择时 cDNA的富集情况,4、CpG岛(CpG island) 几乎所有的管家基因及约占40%的组织特异性基因的5末端含有CpG岛,其序列可能包括基因转录的启动子及第一个外显子 一个CpG岛 一个基因,CpG岛作为探针,进行“染色体油画 (chromosome painting)” 得出基因在染色体中的分布及基因在不同染色体间的分布 被着色的染色体或染色体区带应富含基因,DNA甲基化 CpG岛不被甲基化 在进化及传代过程中仍保持了CpG岛富含G和C;而那些甲基化的区域,由于甲基C亦变成T或与之相配对的G突变成A,导致C和G占总碱基的40%左右,影响最大的是CG序列,20%左右,特殊条件下Cp

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论