版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
1、生物信息学,内 容,一、生物信息学定义 二、生物信息学的发展历史 三、生物信息学的主要研究内容,3,一、生物信息学定义,4,背景,人类基因组计划(Human Genome Project, HGP):1990年正式启动,旨在完成人类基因组约30亿对碱基的全序列测定。 海量生物数据的迅速膨胀:DNA、RNA和蛋白质序列,蛋白质二级结构和三维结构数据,蛋白质相互作用数据等。 对大量生物数据的管理、分析和信息化需求促进了生物信息学的迅速发展。,5,生物信息学(Bioinformatics)名词的由来,20世纪80代末期,林华安博士认识到将计算机科学与生物学结合起来的重要意义,开始留意要为这一领域构思
2、一个合适的名称。 起初,他使用的是“CompBio”; 之后,又将其更改为兼具法国风情的“bioinformatique”,看起来似乎有些古怪。 不久,他便进一步把它更改为“bio-informatics”。 但由于当时的电子邮件系统与今日不同,该名称中的-或/符号经常会引起许多系统问题,于是林博士将其去除,今天我们所看到的“bioinformatics”就正式诞生了,林博士也因此赢得了“生物信息学之父”的美誉。,6,生物信息学之父 林华安,Dr. Hwa A. Lim (林华安)1987年提出 “Bio-informatique” “Bioinformatics” 1955年出生于马来西亚。
3、联合国Bioinformatics专家,University of Texas at Dallas分子与细胞生物学Adjunct Professor、中国科学院基因遗传研究所客座教授。1981年英国伦敦大学帝国学院(Imperial College, London University)毕业,1986年获得美国Rochester University生化物理学博士学位,30岁取得佛罗里达州立大学终生教授。1992年受聘担任美国国家癌症中心及美国国家科学基金会审核委员。1995年后,历任多家生物科技公司生化信息执行长、副总裁等高层管理职位。1997年,创立结合软件与数据分析的专业顾问公司D Tr
4、ends,服务生物技术、制药及卫生保健等机构。,什么是生物信息学 ?,生物信息学,说文解字:生物 + 信息 + 学 (bioinformatics) biology + information + theory 广义: 应用信息科学的方法和技术,研究生物体系和生物过程中信息的存贮、信息的内涵和信息的传递,研究和分析生物体细胞、组织、器官的生理、病理、药理过程中的各种生物信息,或者也可以说成是生命科学中的信息科学。 狭义: 应用信息科学的理论、方法和技术,管理、分析和利用生物分子数据。,9,生物信息学 基本思想的产生,生物信息学 的迅速发展,二十世纪 50年代,二十世纪 80-90年代,生物科学
5、和 技术的 发展,人类基因组 计划的 推动,二、生物信息学的发展历史,10,(一)前基因组时代的生物信息学,属于生物物理学范畴的传统生物信息学可以追溯到很久以前,如研究生物发光、生物电、生物磁和激素等信息物质的传递现象及其相应测定技术。以研究序列比对为标志的现代生物信息学则起源于20世纪7080年代。 这一阶段的主要成就包括核酸和蛋白质序列的初步分析、生物学数据库的建立以及检索工具的开发。例如Dayhoff的替换矩阵、Neelleman和Wunsch的序列比对(sequence alignment)及GenBank(由美国国立生物技术信息中心建立和维护的核酸与蛋白质序列数据库)等大型数据库的建
6、立,形成了生物信息学的雏形。,11,20世纪50年代,生物信息学开始孕育 20世纪60年代,生物分子信息在概念上将计算 生物学和计算机科学联系起来 20世纪70年代,生物信息学的真正开端(序列比对算法) 20世纪80年代初期,生物信息分析方法的发展 20世纪80年代以后,生物信息服务机构和数据库 20世纪90年代后 ,HGP促进生物信息学的迅速发展,生物信息学的孕育和初步形成,12,1956: 美国田纳西州首次召开了“生物学中的理论研讨会”; 1962: Zucherkandl和Pauling研究了序列变化与进化的关系,开创了一个新的领域分子进化; 1967: Dayhoff研制出蛋白质序列图
7、集,即后来著名的蛋白质信息源PIR; 1970: Needleman和Wunsch提出了著名的序列比对算法,是生物信息学发展中最重要的贡献; 1970: Gibbs和McIntyre发表著名的矩阵打点做图法; 1978: Gingeras等人研制了核酸序列中酶切位点识别程序; 1981: Smith和Waterman提出了著名的公共子序列识别算法,同年Doolittle提出了关于序列模式的概念;,13,1982: GenBank第3版本正式发行; 1983: Wilbur和Lipman发表了数据库相似序列搜索算法; 1986: 日本核酸序列数据库DDBJ诞生; 1986: 蛋白质数据库SWIS
8、S-PROT诞生; 1988: 美国国家生物技术信息中心NCBI诞生; 1988: 成立欧洲分子生物学网络(EMBNet),EMBL数据库诞生; 1988: Person和Lipman发表了著名的序列比较算法FASTA; 1990: 快速相似性序列搜索算法BLAST问世,1987年BLAST的改进版本PSI-BLAST投入使用,14,(二)基因组时代的生物信息学,以基因组计划的实施为标志的基因组时代(1990年至2001年)是生物信息学成为一个较完整的新兴学科并得到高速发展的时期。这一时期生物信息学确立了自身的研究领域和学科特征,成为生命科学的热点学科和重要前沿领域之一。 这一阶段的主要成就包
9、括大分子序列以及表达序列标签(expressed sequence tag,EST)数据库的高速发展、BLAST(basic local alignment search tool)和FASTA(fast alignment)等工具软件的研制和相应新算法的提出、基因的寻找与识别、电子克隆(in silico cloning)技术等,大大提高了管理和利用海量数据的能力。,人类基因组计划 (HGP,Human Genome Project) 目标:整体上破解人类遗传信息的奥秘,由美国NIH和能源部提出和带头,美、英、德、法、日、中共同参与的国际合作项目。 重大国际研究项目:测定人类基因组全部DNA
10、序列,构建人类基因组遗传图谱和物理图谱。 1990年: 正式启动,30亿美元。 2001年:人类基因组草图公开发表。 2003年:美国宣布该项目完成。,HGP的历史回顾,1984.12 犹他州阿尔塔组织会议,初步研讨测定人类整个基 因组DNA序列的意义 1985 Dulbecco在Science撰文 “肿瘤研究的转折点:人 类基因组的测序” 美国能源部(DOE)提出“人类基因组计划”草案 1987 美国能源部和国家卫生研究院(NIH)联合为“人类 基因组计划”下拨启动经费约550万美元 1989 美国成立“国家人类基因组研究中心”,Watson担任 第一任主任 1990.10 经美国国会批准,
11、人类基因组计划正式启动,第一个自由生物体流感嗜血菌(H. inf)的全基因组测序完成 1996 完成人类基因组计划的遗传作图 启动模式生物基因组计划,H.inf全基因组,Saccharomyces cerevisiae 酿酒酵母,Caenorhabditis elegans 秀丽线虫,1997 大肠杆菌(E.coli)全基因组测序完成 1998 完成人类基因组计划的物理作图 开始人类基因组的大规模测序 Celera公司加入,与公共领域竞争 启动水稻基因组计划 1999.7 第5届国际公共领域人类基因组测序会议,加快测序速度,大肠杆菌及其全基因组,水稻基因组计划,1999.7 第5届国际公共领域
12、人类基因组测序会议,加快测序速度 2000 Celera公司宣布完成果蝇基因组测序 国际公共领域宣布完成第一个植物基因组拟南芥全基 因组的测序工作,Drosophila melanogaster 果蝇,Arabidopsis thaliana 拟南芥,2001年2月15日Nature封面,2001年2月16日Science封面,2000.6.26 公共领域和Celera公司同时宣布完成人类基因组工作草图 2001.2.15 Nature刊文发表国际公共领域结果 2001.2.16 Science刊文发表Celera公司及其合作者结果,21,我国对人类基因组计划的贡献,23,人类基因组计划准备用
13、15年时间投入30亿美元,完成人全部24(22+X+Y)条染色体中3.2109个碱基对的序列测定,主要任务包括做图(遗传图谱物理图谱以及转录图谱的绘制)、测序和基因识别,其根本任务是解读和破译生物体的生老病死以及与疾病相关的遗传信息。,24,人类基因组,人类基因组的组成,线粒体基因组(16.6kb),细胞核基因组(3200Mb),基因外序列,基因和基因有关序列,约10%,约90%,专一或中等重复序列,Non-coding DNA,假基因,内含子,基因片段,10%,90%,专一的或低 拷贝数序列,中度至高度重复序列,2030%,7080%,分散重复序列,串联重复序列/ 成簇重复序列,约60%,约
14、40%,蛋白编码 基因,rRNA 基因,tRNA 基因,Coding DNA,估计10万最初公布3.5万目前研究确定2.45万,25,生物信息学的研究,结构基因组学时期,26,主要的数据库资源,核酸序列数据库主要有GenBank, EMBL, DDBJ等. 蛋白质序列数据库主要有SWISS-PROT, PIR, TrEMBL等, 蛋白结构数据库有PDB, MMDB等, 与基因组有关的数据库还有dbEST, OMIM等,,27,3大核酸数据库,基因组数据库的相关背景 主要的基因组数据库资源 重点介绍GenBank,28,三大基因数据库,GenbankGenbank库包含了所有已知的核酸序列和蛋白
15、质序列,以及与它们相关的文献著作和生物学注释。它是由美国国立生物技术信息中心(The National Center for Biotechnology Information, NCBI)建立和维护的。NCBI的网址是:。 EMBL(The European Molecular Biology Laboratory )核酸序列数据库由欧洲生物信息学研究所(EBI)维护的核酸序列数据构成,查询检索可以通过通过因特网上的序列提取系统(SRS)服务完成。数据库网址是:http:/www.ebi.ac.uk/embl/。 DDBJ(DNA Data
16、 Bank of Japan)数据库日本DNA数据仓库(DDBJ)也是一个全面的核酸序列数据库,与Genbank和EMBL核酸库合作交换数据。使用其主页上提供的SRS工具进行数据检索和序列分析。DDBJ的网址是:http:/www.ddbj.nig.ac.jp/。,29,GenBank,Public free Available via Internet,EMBL Data Library,DDBJ (DNA Data Bank of Japan),三大基因数据库之间的关系,30,/,http:/www.ddbj.nig.ac.jp/sear
17、ches-e.html,http:/www.ebi.ac.uk/embl/,31,美国的核酸数据库GenBankBanson,D.A. et al. (1998) Nucleic Acids Res. 26, 1-7从1979年开始建设,1982年正式运行。,32,33,欧洲分子生物学实验室的EMBL数据库也于1982年开始服务。,34,35,日本于1984年开始建立国家级的核酸数据库DDBJ,并于1987年正式服务。,36,37,蛋白质数据库,38,主要的数据库资源,核酸序列数据库主要有GenBank, EMBL, DDBJ等. 蛋白质序列数据库主要有SWISS-PROT, PIR, TrE
18、MBL等, 蛋白结构数据库有PDB, MMDB等, 与基因组有关的数据库还有dbEST, OMIM等,,39,60年代“蛋白质信息资源”(Protein Information Resource,简称PIR)雏形产生 1984年,“蛋白质信息资源” 计划正式启动,蛋白质序列数据库PIR也因此而诞生。 1988年,美国的NBRF、日本的国际蛋白质信息数据库JIPID和德国的慕尼黑蛋白质序列信息中心MIPS合作成立了国际蛋白质信息中心(PIR-International),共同收集和维护蛋白质序列数据库PIR。,40,PIR(protein information resource) 1. 由美国
19、NCBI翻译自GenBank的DNA序列(1984年); 2. 在EMBL和GenBank数据库上均建立了镜像站点; 3. 数据依据注释的质量分为4类。 网址: /,PIR数据库的分类情况(Release 51.03),41,42,除了PIR外,另一个重要的蛋白质序列数据库则是SwissProt。 该数据库由瑞士日内瓦大学于1986年创建,目前由瑞士生物信息学研究所和欧洲生物信息学研究所 EBI共同维护和管理。,43,SWISSPROT 1. 瑞士日内瓦大学医学生物化学系和欧洲生物信息学研究所(EBI)合作维护(1986年); 2. 在
20、EMBL和GenBank数据库上均建立了镜像站点; 3. 数据库包括了从EMBL翻译而来的蛋白质序列,这些序列经过检验和注释; SWISS-PROT的网址: /sprot,44,45,PIR和SwissProt是创建最早、使用最为广泛的两个蛋白质数据库。 蛋白质序列数据库TrEMBL是从EMBL中的cDNA序列翻译得到的。该数据库采用SwissProt数据库格式,包含EMBL数据库中所有编码序列的翻译。 TrEMBL: /news/2004/03/02/full,46,蛋白质结构数据库,47,主要的数据库资源,核酸
21、序列数据库主要有GenBank, EMBL, DDBJ等. 蛋白质序列数据库主要有SWISS-PROT, PIR, TrEMBL等, 蛋白结构数据库有PDB, MMDB等, 与基因组有关的数据库还有dbEST, OMIM等,,48,PDB(protein data bank) 1. 目前最主要的蛋白质分子结构数据库; 2. 1970年代建立,美国Brookhaven国家实验室维护管理; 3. 1988年,由美国RCSB(research collaboratory for structural biology)管理; 4. 以文本格式存放数据,包括原子坐标、物种来源、测定方法、提交者信息、一级
22、结构、二级结构等; PDB的网址:/pdb(美国),49,50,(三)后基因组时代的生物信息学,随着人类基因组计划的顺利进行,人类全基因组测序工作已经完成。测序工作的完成并不代表基因组计划的结束,相反标志着“后基因组信息学”的开始。基因组学研究也由结构基因组转向了功能基因组的研究,通过对基因组的分析来了解生物体的功能成为后基因组时代的主要目标。,51,后基因组研究对象的多层次性,后基因组研究对象是多层次的,人们从包括转录组 (Transcriptome)、蛋白质组(Proteome)、相互作用组(Interactome)、定位组(Localizome)、折叠
23、子组(foldome)、代谢组(Metabolome)、表型组(Phenome)等方面,从组的角度研究各类生物学过程。如果说基因组问题涉及遗传图谱(Genetic map)、限制性图谱(Restriction map)和物理图谱(Physical map),那么其它的组学涉及功能图谱(Functional maps)。,52,转录组学研究,转录组学(transcriptomics),是一门在整体水平上研究细胞中基因转录的情况及转录调控规律的学科。简而言之,转录组学是从RNA水平研究基因表达的情况。转录组即一个活细胞所能转录出来的所有RNA的总和,是研究细胞表型和功能的一个重要手段。,53,54
24、,基因组对生命体的整体控制必须通过它所表达的全部蛋白质来执行,由于基因芯片技术只能反映从基因组到RNA的转录水平上的表达情况,由于从RNA到蛋白质还有许多中间环节的影响,因此仅凭基因芯片技术我们还不能最终掌握生物功能具体执行者蛋白质的整体表达状况; 近几年在发展基因芯片的同时,人们也发展了一套研究基因组所有蛋白质产物表达情况蛋白质组研究技术,从技术上来讲包括二维凝胶电泳技术和质谱测序技术。通过二维凝胶电泳技术可以获得某一时间截面上蛋白质组的表达情况,通过质谱测序技术就可以得到所有这些蛋白质的序列组成。这些都是技术实现问题,最重要的就是如何运用生物信息学理论方法去分析所得到的巨量数据,从中还原出
25、生命运转和调控的整体系统的分子机制。,蛋白质组研究,55,蛋白质组研究,56,三、生物信息学的主要研究内容,1、生物分子数据的收集与管理 2、数据库搜索及序列比较 3、基因组序列分析 4、基因表达数据的分析与处理 5、蛋白质结构预测,57,GenBank数据文件格式 GBFF,Genbank flat file (Genbank纯文本文件),58,头部:描述区,59,GenBank数据文件格式,子库,Locus名字,定义 (标题),修改日期,序列类型 mRNA (= cDNA) rRNA snRNA DNA,序列长度,检索号,Genbank号,序列形状,60,GenBank的数据类型,61,物
26、种来源,作者,杂志或单位,测序方式,62,中部:注释区,63,GenBank数据文件格式,尾部:核酸序列,64,FASTA格式,65,NCBI文献检索 开放阅读框架查询,66,UTR的含义是( )。 A. 编码区 B. 非编码区 C. 低复杂度区域 D. 开放阅读框,B,Untranslated Regions,67,algorithm的含义是( )。 A. 登录号 B. 算法 C. 比对 D. 类推,B,68,alignment的含义是( )。 A. 登录号 B. 算法 C. 比对 D. 类推,C,69,analogy的含义是( )。 A. 登录号 B. 算法 C. 比对 D. 类推,D,7
27、0,contig的含义是( )。 A. 基序 B. 叠连群 C. 碱基对 D. 结构域,B,71,RGP是( )。 A. 在线人类孟德尔遗传数据 B. 国家核酸数据库 C. 人类基因组计划 D. 水稻基因组计划,D,72,下列FASTA格式正确的是( )。 A. seq1: agcggatccagacgctgcgtttgctggctttgatgaaaactctaactaaacactccctta B. seq1 agcggatccagacgctgcgtttgctggctttgatgaaaactctaactaaacactccctta C. seq1:agcggatccagacgctgcgtttgc
28、tggctttgatgaaaactctaactaaacactccctta D. seq1agcggatccagacgctgcgtttgctggctttgatgaaaactctaactaaacactccctta,B,73,如果我们试图做蛋白质亚细胞定位分析,应使用( )。 A. NDB数据库 B. PDB数据库 C. GenBank数据库 D. SWISS-PROT数据库,D,74,GenBank中分类码PLN表示是( )。 A. 哺乳类序列 B. 细菌序列 C. 噬菌体序列 D. 植物、真菌和藻类序列,D,75,从cDNA文库中获得的短序列是( )。 A. STS (sequence-tagg
29、ed site) B. UTR (untranslated region) C. CDS (coding sequence) D. EST (expressed sequence tag),D,76,TAIR数据库是( )。 A. 线虫基因组 B. 果蝇基因组 C. 拟南芥数据库 D. 大肠杆菌基因组,C,The Arabidopsis Information Resource,77,ORF的含义是( )。 A. 调控区 B. 非编码区 C. 低复杂度区域 D. 开放阅读框,D,(open reading frame),78,mRNA 5端有( )结构。 A. 帽子 B. 尾巴 C. 帽子和尾
30、巴 D. 多聚核苷酸,A,79,mRNA 3端有( )结构。 A. 帽子 B. 尾巴 C. 帽子和尾巴 D. 多聚胞嘧啶,B,80,目前应用于基因芯片表达数据统计分析的主要方法是( )。 A. 卡方检验 B. 相关分析 C. 聚类分析 D. 正态性分布检验,C,81,SAGE的含义是( )。 A. 基因表达连续分析 B. 聚丙烯酰胺凝胶电泳 C. 基因组分析 D. 双向电泳分析,A,(Serial Analysis of Gene Expression,SAGE),(polyacrylamide gelelectrophoresis, PAGE),(two-dimensional electr
31、ophoresis, 2-DE),82,domain的含义是( )。 A. 基序 B. 跨叠克隆群 C. 碱基对 D. 结构域,D,83,NCBI中人类无冗余基因数据库是( )。 A. UniGene B. UniPro C. UniRef D. URF,A,84,Entrez使用几种逻辑运算符对检索关键词做最基本的限制?( ) A. 1种 B. 2种 C. 3种 D. 4种,C,(AND, OR, NOT),85,微卫星标记是( )。 A. RFLP B. SNP C. SSR D. RAPD,C,(Restriction Fragment Length Polymorphism, 限制性内
32、切酶片段长度多态性),(Single Nucleotide Polymorphisms, 单核苷酸多态性),(Simple Sequence Repeats),(Random Amplified Polymorphic DNA, 随机扩增多态性DNA标记),86,提交序列到GenBank中,使用的程序可以是( )。 A. Entrez B. SRS C. Medline D. BankIt,D,(Sequence Retrieval System,)是EMBL研制的一个基于WEB的查询系统,也是目前国际上最有影响的生物分子数据库查询系统之一),87,PDB是蛋白质的( )。 A. 分类数据库
33、B. 结构数据库 C. 模体数据库 D. 结构域数据库,B,88,限制性片段长度多态性标记是( )。 A. RFLP B. SNP C. SSR D. RAPD,A,89,CDS的含义是( )。 A. 编码区 B. 非编码区 C. 低复杂度区域 D. 非调控区,A,(Codingsequence),90,构建进化树工具是( )。 A. BLAST B. ClustalW C. Mega D. GCG,C,91,在真核生物中,一个基因cDNA 的5端起始密码子AUG的前后序列符合( )规则。 A. Kozak B. AUAG C. SD D. Poly(A)n,(Kozak序列是位于真核生物mR
34、NA 5端帽子结构后面的一段核酸序列,通常是ACCACCATGG,它可以与翻译起始因子结合而介导含有5帽子结构的mRNA翻译起始。),A,92,在真核生物的一个基因内含子两端,即外显子/内含子拼接边界处,其符合( )规则。 A. Kozak B. GUAG C. SD D. Poly(A)n,B,93,下列序列中起始密码子,终止密码子,可能的内含子 5gauguucgucccggagaaccaugggcgcguacaucggauucgaagcuccacugaggcu-3,起始密码子:AUG 终止密码子:UAA, UGA, UAG,94,基本局部比对搜素工具是( )。 A. Mega B. Cl
35、ustalW C. BLAST D. GCG,The Basic Local Alignment Search Tool,C,95,将核酸序列按照6条链翻译成蛋白质序列后搜索蛋白质序列数据库使用的程序是( )。 A. blastp B. blastx C. tblastn D. tblastx E. blastn,(使用蛋白质序列与蛋白质数据库中的序列进行比较),(将给定的核酸序列按照六种阅读框架将其翻译成蛋白质与蛋白质数据库中的序列进行比对),(将给定的氨基酸序列与核酸数据库中的序列(双链)按不同的阅读框进行比对),(将库和待查核酸序列都翻译成蛋白序列, 然后对蛋白序列进行比对),(将给定的
36、核酸序列与核酸数据库中的序列进行比较),B,96,97,被誉为“生物信息学之父”的科学家是( )。 A. Dulbecco B. Sanger C. 吴瑞 D. 林华安1955年出生于马来西亚,1987年,林华安博士正式命名生物信息学(bioinformatics),D,98,DDBJ的含义是( )。 A. 美国国家生物信息中心 B. 欧洲分子生物学实验室 C. 日本DNA数据库 D. 中国基因组研究中心,C,99,单核苷酸标记是( )。 A. RFLP B. SNP C. SSR D. RAPD,B,(single nueleotide polymorphism,SNP),100,GenBa
37、nk数据库的基本信息单位是( )。 A. FASTA B. GBFF C. GCG D. ASN.1,B,(GenBank Flat File),101,OMIM是( )。 A. 在线人类孟德尔遗传数据库 B. 国家核酸数据库 C. 人类基因组计划 D. 国际水稻基因组测序计划,A,(Online Mendelian Inheritance in Man),(human genome project, HGP),( International Rice Genome Sequencing Project , IRGSP),102,没有直接参与完成人类基因组计划的国家是( )。 A. 英国 B.
38、 中国 C. 俄罗斯 D. 德国,C,美国、英国、法国、德国、日本和中国,103,EMBL的含义是( )。 A. 美国国家生物信息中心 B. 欧洲分子生物学实验室 C. 日本DNA数据库 D. 中国国家基因组研究中心,B,(National Center for Biotechnology Information, NCBI),(The European Molecular Biology Laboratory, EMBL),(DNA Data Bank of Japan, DDBJ),104,accession number的含义是( )。 A. 登录号 B. 算法 algorithm C.
39、 比对 alignment D. 类推 analogy,A,105,EST的含义是( )。 A. 表达序列标签 B. 序列标签位点 C. 高通量基因组序列 D. 人工合成序列,A,(expressed sequence tag),(sequence-tagged site),106,Blast结果中HSP的含义是( )。 A. 空位 B. 期望值 C. 过滤 D. 高分配对片段,D,(high-scoring segment pairs),107,Proteomics的含义是( )。 A. 生物信息学 B. 基因组学 C. 蛋白质组学 D. 表观遗传学,C,genomics,108,根据大量E
40、ST具有相互重叠的性质,通过计算机算法获得cDNA全长序列,这种克隆基因的方法是( )。 A. 重叠克隆 B. 电子克隆 C. 基因步移 D. 基因重组,B,109,隐马尔科夫模型的代号是( )。 A. HMM B. CDD C. HTGS D. GSS,(Hidden Markov Model, HMM),A,(Conserved Domain Database, CDD, 保守结构域数据库),(high-throughput genome sequence, 高通量基因组序列),(Genome Survey Sequence database, 基因组勘测序列数据库),110,构建系统发生
41、树,应使用( )。 A. BLAST B. FASTA C. UPGMA D. FTP,C,111,一类是基于距离的构建方法,利用所有物种或分类单元间的进化距离,依据一定的原则及算法构建系统发生树。基本思路是列出所有可能的序列对,计算序列之间的遗传距离,选出相似程度比较大或非常相关的序列对,利用遗传距离预测进化关系。这类方法有非加权分组平均法(unweighted pair group method with arithmetic means, UPGMA)、邻近归并法(neighbor joining method, NJ)、Fitch-Margoliash法、最小进化方法(minimum evolution)等。 另一类方法是基于离散特征的构建方法,利用的是具有离散特征状态的数据,如DNA序列中的特定位点的核苷酸。建树时,着重分析分类单位或序列间每个特征(如核苷酸位点)的进化关系等。属于这一类的方法有最大简约法(maximum parsimony method)、最大似然法(maximum l
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 丝束加工操作工管理综合竞赛考核试卷含答案
- 绢纺原料选别工环保竞赛评优考核试卷含答案
- 时钟装配工岗前生产安全效果考核试卷含答案
- 竹藤编艺师成果转化评优考核试卷含答案
- 拖拉机铸造加工生产线操作调整工诚信评优考核试卷含答案
- 2025年铜仁地区松桃苗族自治县数学四年级第二学期期中教学质量检测试题(含解析)
- 2025年邵阳市洞口县数学四下期中检测试题(含答案解析)
- 2026二级造价工程师-管理类(官方)-第三章工程造价构成参考试题库历年考点答案详解
- 2026上海公务员考试(卫生健康)历年参考题库含答案详解
- 2025年连平县四年级数学下学期期中质量检测模拟试题(含答案解析)
- (正式版)XJJ 090-2018 《电供暖系统应用技术规程》
- 2025浙江金华市永康市综合行政执法局编制外人员招聘12人备考练习题库及答案解析
- 财务电子发票管理办法
- 肺功能报告解读课件
- 封顶仪式流程及主持稿范例
- 《深圳市低空经济产业创新发展实施方案》
- 江苏省苏州市2024-2025学年七年级下学期期末考试数学试卷及答案
- 小学生蜡笔画教学课件
- 《新媒体广告设计》教学课件 第1章 走近新媒体广告
- 《犬猫实验室检查》课件
- 首都经济贸易大学《微积分》2021-2022学年第一学期期末试卷
评论
0/150
提交评论