版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
HGP最初目标经过国际合作,用时间(1990~2005)最少投入30亿美元,构建详细人类基因组遗传图和物理图,确定人类DNA全部核苷酸序列,定位约10万基因,并对其它生物进行类似研究。4张图:
HGP终极目标说明人类基因组全部DNA序列;识别基因;建立储存这些信息数据库;开发数据分析工具;研究HGP实施所带来伦理、法律和社会问题。遗传图物理图序列图转录图第1页遗传图谱(geneticmap)又称连锁图谱(linkagemap),它是以含有遗传多态性(在一个遗传位点上含有一个以上等位基因,在群体中出现频率皆高于1%)遗传标识为“路标”,以遗传学距离(在减数分裂事件中两个位点之间进行交换、重组百分率,1%重组率称为1cM)为图距基因组图。遗传图谱建立为基因识别和完成基因定位创造了条件。遗传图谱
第2页遗传连锁图:经过计算连锁遗传标志之间重组频率,确定它们相对距离,普通用厘摩(cM,即每次减数分裂重组 频率为1%) 表示。back第3页物理图谱物理图谱(physicalmap)是指相关组成基因组全部基因排列和间距信息,它是经过对组成基因组DNA分子进行测定而绘制。绘制物理图谱目标是把相关基因遗传信息及其在每条染色体上相对位置线性而系统地排列出来。第4页1998年完成了含有52,000个序列标签位点(STS),并覆盖人类基因组大部分区域连续克隆系物理图谱。敲碎基因组,分析研究内容所处染色体位置细菌人工染色体80~300kb
)酵母人工染色体(数百~
kb中心粒一对紧密一对相邻染色体图()back第5页转录图谱
转录图谱是在识别基因组所包含蛋白质编码序列基础上绘制结合相关基因序列、位置及表示模式等信息图谱。第6页经过定位克隆技术寻找疾病基因过程
back第7页序列图谱伴随遗传图谱和物理图谱完成,测序就成为重中之重工作。DNA序列分析技术是一个包含制备DNA片段化及碱基分析、DNA信息翻译多阶段过程。经过测序得到基因组序列图谱第8页大规模基因组测序第9页大规模测序基本策略逐一克隆法:对连续克隆系中排定BAC克隆逐一进行亚克隆测序并进行组装(公共领域测序计划)全基因组鸟枪法:在一定作图信息基础上,绕过大片段连续克隆系构建而直接将基因组分解成小片段随机测序,利用超级计算机进行组装(美国Celera企业)第10页利用计算机软件进行序列拼接back第11页
第二节生物信息学及其发展历史
第12页1、生物信息学概念第13页……新生物学研究模式出发点应该是理论。科学家将从理论推测出发,然后再返回到试验中去,追踪或验证这些理论假设。……生物学家不但必须成为计算机学者,而且也要改变他们硕士命现象路径。——W.Gilbert,TowardsAParadigmShiftinBiology,Nature,349(1991)99第14页传统生物学:试验科学当代生物学发展:1、高通量数据获取日益实现自动化、半工业化
从数据库中实现数据挖掘、知识发觉2、海量数据
难以完全依赖试验伎俩对新数据进行分析,必须借助计算机实现分析和筛选3、更复杂层次生物学问题
复杂基因调控网络、代谢网络;细胞间信号转导过程;生物个体全部基因表示改变……分析、筛选大量新数据生物中复杂网络、复杂过程、复杂现象理论生物学计算生物学第15页试验永远起着决定作用计算/理论生物学发展离不开试验生物学贡献试验生物学日益依赖计算/理论生物学指导二十一世纪生命科学理论计算试验数学与物理科学第16页生物信息学(Bioinformatics)这一名词来由八十年代末期,林华安博士认识到将计算机科学与生物学结合起来主要意义,开始留心要为这一领域构思一个适当名称。起初,考虑到与将要支持他主办一系列生物信息学会议佛罗里达州立大学超型计算机计算研究所关系,他使用是“CompBio”;之后,又将其更改为兼具法国风情“bioinformatique”,看起来似乎有些古怪。所以很快,他便深入把它更改为“bio-informatics(或bio/informatics)”。但因为当初电子邮件系统与今日不一样,该名称中-或/符号经常会引发许多系统问题,于是林博士将其去除,今天我们所看到“bioinformatics”就正式诞生了,林博士也所以赢得了“生物信息学之父”美誉。第17页生物信息学HGP生物数据激增(每15个月翻一番)生物学家数学家计算机科学家生物信息学(bioinfomatics)诞生第18页三种科学文化融合生物学家(生物学问题)数学物理学家计算机科学家(基础理论问题)工程师(技术应用)第19页生物信息学(bioinformatics)是80年代未伴随人类基因组计划(Humangenomeproject)开启而兴起一门新交叉学科。它包括生物学、数学、计算机科学和工程学,依赖于计算机科学、工程学和应用数学基础,依赖于生物试验和衍生数据大量储存。第20页概念(广义)生物体系和过程中信息存贮、传递和表示细胞、组织、器官生理、病理、药理过程中各种生物信息信息科学生命科学中信息科学
第21页广义说,生物信息不但包含基因组信息,如基因DNA序列、染色体定位,也包含基因产(蛋白质或RNA)结构和功效及各生物种间进化关系等其它信息资源。生物信息学既涉基因组信息获取、处理、贮存、传递、分析和解释,又包括蛋白质组信息学如蛋白质序列、结构、功效及定位分类、蛋白质连锁图、蛋白质数据库建立、相关分析软件开发和应用等方面,还包括基因与蛋白质关系如蛋白质编码基因识别及算法研究、蛋白质结构、功效预测等,另外,新药研制、生物进化也是生物信息学研究热点。第22页概念(狭义)生物分子数据深层次生物学知识分子生物信息学MolecularBioinformatics挖掘获取生物分子信息获取、存贮、分析和利用第23页因为当前生物信息学发展主要推进力来自分子生物学,生物信息学研究主要集中于核苷酸和氨基酸序列存放、分类、检索和分析等方面,所以当前生物信息学能够狭义地定义为:将计算机科学和数学应用于生物大分子信息获取、加工、存放、分类、检索与分析,以到达了解这些生物大分子信息生物学意义交叉学科。第24页1995年,在美国人类基因组计划(HGP)第一个五年总结汇报
中给出了一个较为完整生物信息学定义:生信息学是包含生物信息获取、处理、贮存、分发、分析和解释全部方面一门学科,它综合利用数学、计算机科学和生物学各种工具进行研究,目标在于了解大量生物学意义。
第25页Bioinformatics生物分子数据计算机计算+第26页2、生物分子信息第27页细胞分子存贮、复制、传递和表示遗传信息系统生物信息载体第28页生物信息学主要研究两种信息载体DNA分子蛋白质分子第29页ProteinMachines
第30页FromtheCelltoProteinMachines
第31页生物分子最少携带着三种信息遗传信息与功效相关结构信息进化信息第32页(1)遗传信息载体——DNA遗传信息载体主要是DNA控制生物体性状基因是一系列DNA片段生物体生长发育本质就是遗传信息传递和表示第33页DNA经过自我复制,在生物体繁衍过程中传递遗传信息基因经过转录和翻译,使遗传信息在生物个体中得以表示,并使后代表现出与亲代相同生物性状。
基因控制着蛋白质合成DNARNA蛋白质转录翻译第34页基因DNA序列DNA前体RNAmRNA多肽链蛋白质序列对应关系遗传密码第35页(2)蛋白质结构决定其功效蛋白质功效取决于蛋白质空间结构
蛋白质结构决定于蛋白质序列(这是当前基本共认假设),蛋白质结构信息隐含在蛋白质序列之中。第36页(3)DNA分子和蛋白质分子
都含有进化信息
经过比较相同蛋白质序列,如肌红蛋白和血红蛋白,能够发觉因为基因复制而产生分子进化证据。经过比较来自于不一样种属同源蛋白质,即直系同源蛋白质,能够分析蛋白质甚至种属之间系统发生关系,推测它们共同祖先蛋白质。第37页生物分子信息DNA序列数据蛋白质序列数据生物分子结构数据生物分子功效数据最基本直观复杂生物分子数据类型第38页
DNA核酸序列蛋白质氨基酸序列蛋白质结构蛋白质功效最基本生物信息维持生命活动机器第一部遗传密码第二部遗传密码?生命体系千姿百态改变生物分子数据及其关系第39页第一部遗传密码已被破译,但对密码转录过程还不清楚,对大多数DNA非编码区域功效还知之甚少对于第二部密码,当前则只能用统计学方法进行分析不论是第一部遗传密码,还是第二部遗传密码,都隐藏在大量生物分子数据之中。生物分子数据是宝藏,生物信息数据库是金矿,等候我们去挖掘和利用。第40页生物分子信息特征生物分子信息数据量大生物分子信息复杂生物分子信息之间存在着亲密联络第41页3、生物信息学发展历史生物信息学基本思想产生生物信息学快速发展二十世纪50年代二十世纪80-90年代生物科学和技术发展人类基因组计划推进第42页20世纪50年代,生物信息学开始孕育20世纪60年代,生物分子信息在概念上将计算生物学和计算机科学联络起来20世纪70年代,生物信息学真正开端20世纪70年代到80年代早期,出现了一系列著名序列比较方法和生物信息分析方法20世纪80年代以后,出现一批生物信息服务机构和生物信息数据库20世纪90年代后,HGP促进生物信息学快速发展第43页第三节生物信息学主要研究内容第44页生物信息学主要研究内容1、
生物分子数据搜集与管理2、数据库搜索及序列比较3、基因组序列分析4、基因表示数据分析与处理5、蛋白质结构预测第45页基因组数据库蛋白质序列数据库蛋白质结构数据库DDBJEMBLGenBankSWISS-PROT
PDBPIR1、生物分子数据搜集与管理第46页2、数据库搜索及序列比较搜索同源序列在一定程度上就是经过序列比较寻找相同序列序列比较一个基本操作就是比对(Alignment),即将两个序列各个字符(代表核苷酸或者氨基酸残基)按照对应等同或者置换关系进行对比排列,其结果是两个序列共有排列次序,这是序列相同程度一个定性描述多重序列比对研究是多个序列共性。序列多重比对可用来搜索基因组序列功效区域,也可用于研究一组蛋白质之间进化关系。第47页发觉同源分子第48页3、基因组序列分析
遗传语言分析——天书基因组结构分析基因识别基因功效注释基因调控信息分析基因组比较第49页4、基因表示数据分析与处理基因表示数据分析是当前生物信息学研究热点和重点当前对基因表示数据处理主要是进行聚类分析,将表示模式相同基因聚为一类,在此基础上寻找相关基因,分析基因功效所用方法主要有:相关分析方法模式识别技术中层次式聚类方法人工智能中自组织映射神经网络主元分析方法第50页基因芯片第51页第52页第53页层次式聚类第54页二维电泳图第55页5、蛋白质结构预测
蛋白质生物功效由蛋白质结构所决定,蛋白质结构预测成为了解蛋白质功效主要路径蛋白质结构预测分为:二级结构预测空间结构预测蛋白质折叠第56页二级结构预测在一定程度上二级结构预测能够归结为模式识别问题
在二级结构预测方面主要方法有:立体化学方法图论方法统计方法最邻近决议方法基于规则教授系统方法分子动力学方法人工神经网络方法预测准确率超出70%第一个软件是基于神经网络PHD系统第57页空间结构预测在空间结构预测方面,比较成功理论方法是同源模型法
该方法依据是:相同序列蛋白质倾向于折叠成相同三维空间结构利用同源模型方法能够完成全部蛋白质10-30%空间结构预测工作第58页第四节生物信息学当前主要任务
第59页纵观当今生物信息学界现实状况,能够发觉,大部分人都把注意力集中在基因组、蛋白质组、蛋白质结构以及与之相结合药品设计上第60页1.基因组
1.1新基因发觉
经过计算分析从EST(ExpressedSequenceTags)序列库中拼接出完整新基因编码区,也就是通俗所说“电子克隆”;经过计算分析从基因组DNA序列中确定新基因编码区,经过多年积累,已经形成许多分析方法,如依据编码区含有独特序列特征、依据编码区与非编码区在碱基组成上差异、依据高维分布统计方法、依据神经网络方法、依据分形方法和依据密码学方法等。第61页1.2非蛋白编码区生物学意义分析
第62页非蛋白编码区约占人类基因组95%,其生物学意义当前尚不是很清楚,但从演化观点来看,其中必定蕴含着主要生物学功效,因为它们并不编码蛋白,普通认为,它们生物学功效可能表示在对基因表示时空调控上。对非蛋白编码区进行生物学意义分析策略有两种,一个是基于已经有已经为试验证实全部功效已知DNA元件序列特征,预测非蛋白编码区中可能含有功效已知DNA元件,从而预测其可能生物学功效,并经过试验进行验证;另一个则是经过数理理论直接探索非蛋白编码区新未知序列特征,并从理论上预测其可能信息含义,最终一样经过试验验证。第63页1.3基因组整体功效及其调整网络系统把握
把握生命本质,仅仅掌握基因组中部分基因表示调控是远远不够,因为生命现象是基因组中全部功效单元相互作用共同制造出来。基因芯片技术因为能够监测基因组在各种时间断面上整体转录表示情况,所以成为该领域中一项非常主要和关键试验技术,对该技术所产生大量试验数据进行高效分析,从中取得基因组运转以及调控整体系统机制或者是网络机制,便成了生物信息学在该领域中首先要处理问题。第64页1.4基因组演化与物种演化
第65页尽管已经在分子演化方面取得了许多主要成就,但仅仅依靠一些基因或者分子演化现象,就想说明物种整体演化历史似乎不太可靠。比如,智人与黑猩猩之间有98%-99%结构基因和蛋白质是相同,然而表型上却含有如此巨大差异,这就不能不使我们联想到形形色色千差万别建筑楼群,它们外观如此不一样,但基础部件组成却是几乎一样,差异就在于这些基础部件组织方式不一样,这就提醒我们基因组整体组织方式而不但仅是个别基因在研究物种演化历史中主要作用。因为基因组是物种全部遗传信息储备库,从根本上决定着物种个体发育和生理,所以,从基因组整体结构组织和整体功效调整网络方面,结合对应生理表征现象,进行基因组整体演化研究,将是揭示物种真实演化历史最正确路径。第66页2、蛋白质组
第67页基因组对生命体整体控制必须经过它所表示全部蛋白质来执行,因为基因芯片技术只能反应从基因组到RNA转录水平上表示情况,因为从RNA到蛋白质还有许多中间步骤影响,所以仅凭基因芯片技术我们还不能最终掌握生物功效详细执行者——蛋白质整体表示情况;所以,近几年在发展基因芯片同时,人们也发展了一套研究基因组全部蛋白质产物表示情况——蛋白质组研究技术,从技术上来讲包含二维凝胶电泳技术和质谱测序技术。经过二维凝胶电泳技术能够取得某一时间截面上蛋白质组表示情况,经过质谱测序技术就能够得到全部这些蛋白质序列组成。这些都是技术实现问题,最主要就是怎样利用生物信息学理论方法去分析所得到巨量数据,从中还原出生命运转和调控整体系统分子机制。第68页基因组和蛋白质组研究迅猛发展,使许多新蛋白序列涌现出来,然而要想了解它们功效,只有氨基酸序列是远远不够,因为蛋白质功效是经过其三维高级结构来执行,而且蛋白质三维结构也不一定是静态,在行使功效过程中其结构也会对应有所改变。所以,得到这些新蛋白完整、准确和动态三维结构就成为摆在我们面前紧迫任务。当前除了经过诸如X射线晶体结构分析、多维核磁共振(NMR)波谱分析和电子显微镜二维晶体三维重构(电子晶体学,EC)等物理方法得到蛋白质三维结构之外3、蛋白质结构
第69页另外一个广泛使用方法就是经过计算机辅助预测方法,当前,普通认为蛋白质折叠类型只有数百到数千种,远远小于蛋白质所含有自由度数目,而且蛋白质折叠类型与其氨基酸序列含有相关性,这么就有可能直接从蛋白质氨基酸序列经过计算机辅助方法预测出蛋白质三维结构第70页4、新药设计
第71页近年来伴随结构生物学发展,相当数量蛋白质以及一些核酸、多糖三维结构取得准确测定,基于生物大分子结构知识药品设计成为当前热点。生物信息学研究不但可提供生物大分子空间结构信息,还能提供电子结构信息,如能级、表面电荷分布、分子轨道相互作用等以及动力学行为信息,如生物化学反应中能量改变、电荷转移、构象改变等。理论模拟还可研究包含生物分子及其周围环境复杂体系和生物分子量子效应。第72页但生物信息学任务远不止于此。在以上工作基础上,最主要是怎样利用数理理论结果对生物体进行完整系统数理模型描述,使得人类能够从一个愈加明确角度和一个愈加易于操作路径来认识和控制本身以及全部其它生命体第73页生物信息学不但仅是一门科学学科,它更是一个主要研究开发工具。
从科学角度来讲,它是一门硕士物和生物相关系统中信息内容物和信息流向综合系统科学,只有经过生物信息学计算处理,我们才能从众多分散生物学观察数据中取得对生命运行机制详细和系统了解。从工具角度来讲,它是今后几乎进行全部生物(医药)研究开发所必需舵手和动力机,只有基于生物信息学经过对大量已经有数据资料分析处理所提供理论指导和分析,我们才能选择正确研发方向,一样,只有选择正确生物信息学分析方法和伎俩,我们才能正确处理和评价新观察数据并得到准确结论。第74页生物信息学研究意义生物信息学将是二十一世纪生物学核心认识生物本质了解生物分子信息组织和结构,破译基因组信息,说明生物信息之间关系改变生物学研究方式改变传统研究方式,引进当代信息学方法在医学上主要意义为疾病诊疗和治疗提供依据为设计新药提供依据第75页第五节生物信息学所用方法和技术
1、数学统计方法2、动态规划方法3、机器学习与模式识别技术4、数据库技术及数据挖掘5、人工神经网络技术6、教授系统7、分子模型化技术8、量子力学和分子力学计算9、生物分子计算机模拟10、因特网(Internet)技术第76页1、数学统计方法生物活动经常以大量、重复形式出现,既受到内在原因制约,又受到外界环境随机干扰。所以概率论和数学统计是当代生物学研究中一个惯用分析方法数据统计、原因分析、多元回归分析是生物学研究必备工具隐马尔科夫模型(HiddenMarkovModels)在序列分析方面有着主要应用。与隐马尔科夫模型相关技术是马尔科夫链(MarkovChain)第77页2、动态规划方法动态规划(DynamicProgramming)是一个处理多阶段决议过程最优化方法或复杂空间优化搜索方法动态规划处理问题基本过程是:将一个问题全局解分解为局部解,逆序递推求出局部最优解,伴随执行过程推进,“局部”逐步靠近“全局”,最终取得全局最优解第78页3、机器学习与模式识别技术机器学习机器学习是模拟人类学习过程,以计算机为工具获取知识、积累经验1、遗传算法采取随机搜索方法,含有自适应能力和便于并行计算2、神经网络理论是基于人脑结构,其目标是揭示一个系统是怎样向环境学习,这一个方法被称为联接主义。模式识别模式识别是机器学习一个主要任务。模式是对感兴趣客体定量或者结构描述,而模式识别就是利用计算机对客体进行判别,将相同或者相同客体归入同种类别中模式识别主要有两种方法:依据对象统计特征进行识别,依据对象结构特征进行识别
第79页环境学习知识库执行机器学习系统基本结构
反馈第80页4、数据库技术及数据挖掘数据库技术数据仓库虚拟数据库技术(VirtualDatabase,简称VDB)数据挖掘(datamining)又称作数据库中知识发觉(KnowledgeDiscoveryinDatabase),它是从数据库或数据仓库中发觉并提取隐藏在其中信息一个新技术,它能自动分析数据,对它们进行归纳性推理和联想,寻找数据间内在一些关联,从中发掘出潜在、对信息预测和决议行为起着十分主要作用模式数据挖掘过程普通分为4个基本步骤:数据选择、数据转换、数据挖掘和结果分析第81页5、人工神经网络技术人工神经网络(ArtificialNeuralNetwork,简称ANN)是经过模拟神经元特征以及脑大规模并行结构、信息分布式和并行处理等机制建立一个数学模型在生物信息学中,使用得最多是反向传
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 环保行业技术研发专员技术创新与环保效果评估KPI考核表
- 财务部门财务规划绩效考评表
- 小学主题班会课件:健康生活我主宰呵护身心我负责
- 交通运输规划师交通路线设计与运营优化绩效考评表
- 2025年八年级历史期末世界古代史综合测试卷:华夏民族与周边国家文化交流与融合试题(含答案)
- 医院会计笔试题及答案
- 艺术品行业数字博物馆与线上展览平台方案
- 融资款项到账时间确认事宜联系函5篇
- 电力设备报废制度
- 公共营养师复习题含答案(附解析)
- 人防防护设备验收监理实施细则
- 出口管制内部合规制度
- 地方金融监管培训
- 老年人疫苗接种的健康获益评估
- DB62-T 3296-2025 建筑保温与结构一体化系统技术标准
- 迅速服务及时响应承诺书7篇范文
- DB5101∕T 148-2022 成都市洪涝灾害应急救援物资配备指南
- 穿越机组装教学课件
- 人教版三年级上册第一单元《观察物体》单元检测卷(含答案)
- 云南职称补贴管理办法
- 机加工标识管理制度
评论
0/150
提交评论