生物信息学简介_第1页
生物信息学简介_第2页
生物信息学简介_第3页
生物信息学简介_第4页
生物信息学简介_第5页
已阅读5页,还剩80页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

生物信息基础生物信息学介绍第1页2026/9/162主讲教师:高昇Cell:1314593Email:gaosheng@Office:教三楼803-模式识别试验室助教:莫能斌Cellmail:monengbin@163.comOffice:教三楼803-模式识别试验室第2页参考资料孙啸等编著,《生物信息学基础》,清华大学出版社,年5月.王勇献等编著,《生物信息学导论——面向高性能计算算法与应用》,清华大学出版社,年6月.陈宝林,最优化理论与算法(第二版),清华大学出版社,年10月.课件存放邮箱:bioinfo_bupt@163.com passwd:bioinfo2026/9/163第3页考评方式期末成绩40%大作业or考试平时成绩40%小作业开放项目,勉励自由参加日常考勤20%2026/9/164第4页课程定位IntroductiontoLifeScienceandArtificialLife生物信息基础

生命科学中信息科学利用信息科学方法和技术,硕士物体系和生物过程中信息存放、信息内涵和信息传递,研究和分析生物体细胞、组织、器官生理、病理、药理过程中各种生物信息。Bioinformatics:分析复杂生物学数据学科:应用信息科学理论、方法和技术,管理、分析和利用生物分子数据。分子生物信息学(MolecularBioinformatics)2026/9/165第5页2026/9/166内容提要生物信息学产生背景什么是生物信息学生物信息学研究意义生物信息学发展历史生物信息学主要研究内容生物信息学所用方法和技术第6页2026/9/167生命信息组织、传递、表示物理化学分子生物学遗传学信息技术引言第7页8历史回顾(1)1866年,神父GregorMendel经过对豌豆杂交和遗传学研究,提出了传递遗传特征基本单位---遗传因子(基因)概念1944年,Avery&McCarty第一次发觉了遗传信息载体是染色体上DNA(而不是先前认为蛋白质).第8页9历史回顾(2)1953年,JamesWatson&FrancisCrick发觉了DNA双螺旋空间结构并推断出了DNA复制方式,由此揭开了分子生物学研究序幕。1990年,人类基因组计划开启第9页人类历史上三大科技工程2026/9/1610曼哈顿原子弹研制计划人类基因组计划阿波罗登月计划1941.12.6-1945.7.16罗斯福同意耗资20亿美元原子半径 10-10m原子体积 10-30m31990.10.1-.4.23克林顿、布莱尔同意耗资30亿美元1961.5.25-1969.7.20肯尼迪同意耗资240亿美元人体半径 100m人体体积 100m3太阳系半径 1012m太阳系体积 1034m3第10页人类基因组计划人类基因组计划(HumanGenomeProject,HGP)1986年R.Dulbeccol在Science上撰文,提议对人类基因组进行全测序。1990年美国政府正式启感人类基因组计划耗资30亿美元、为期15年计划,预期到年完成人类基因组大约30亿个碱基全序列测定美、英、日、法、德、中六国科学家共同参加HGP主要任务是:人类基因组以及一些模式生物体(细菌、酵母、线虫、果蝇等)基因组作图、测序和基因识别。第11页人类基因组计划发展历程前期准备1984年 DOE(DepartmentofEnergy)委托Alta,WhiteR.,MendelsonhmM科学家专业会议;1985年提出人类基因组计划动议1986年 McKusickV称从整个基因组层次上研究遗传科学为基因组学1986年 DulbeccoR在Science上发表文章”肿瘤研究转折人类基因组全序列分析”,提出人类基因组计划1986年 GilbertW&BergP主持人类基因组计划教授会议1987年 DOE(能源部)和NIH(国家健康研究院)下拨研究经费1988年 NRC(原子能调整委员会)教授发表mappingandsequencingthehumangenome汇报1988年 成立了国家人类基因组研究中心。Watson第一任主任。第12页人类基因组计划发展历程正式开启1990年 经过5年辩论,美国国会经过“人类基因组计划”

1990年10月1日开启

计划15年,30亿美元

多国参加(英国1989,法国1990,德国1995,中国1999)1990年 6月,欧共体经过“欧洲人类基因组计划”。

另外,丹麦,日本,韩国,俄罗斯和澳大利亚也加入行动行列1999年 9月1日,杨焕明教授在第五次伦敦国际人类基因组战略讨论会上介绍情况。会议正式接收中国加入国际合作,划定了测序区域,正式负担1%测序任务年 6月26日各国科学家公布了人类基因组工作草图年 精度大于99%完成图公布第13页人类基因组计划参加HGP国家美国(54%)英国(33%)日本(7%)法国(2.8%)德国(2.2%)中国(1%)目标:测定人类基因组DNA序列中30亿个碱基次序,获取四张图谱:遗传图谱物理图谱序列图谱基因图谱HGP责任人柯林斯(Collins)第14页已完成测序基因组

(http://www.ebi.ac.uk/genomes)种类数目备注古细菌(Archaea)16真细菌(Bacteria)120其中有测定了2个以上菌株真核生物(Eukaryo)15包含酵母、线虫、果蝇、蚊子、拟南芥、人等病毒(Virus)885包含不一样亚类或不一样株系类病毒(Viroid)40包含不一样亚类或不一样株系噬菌体(Phage)114包含不一样亚类或不一样株系细胞器(Organelle)308包含线粒体和叶绿体质粒(Plasmid)282第15页103Kilo106Mega109Giga1012Tera1015Peta1018Exa1021Zetta1024Yotta

一个普通生物试验室每年产生数据量 100Terra-bytes(1014)

人类迄今为止所说过话(词语量) ~5exa-bytes(5

1018)生物信息量最少是全部些人类说过话200倍!巨量数据第16页GenBankDataYearBasePairsSequences1982680,33860619832,274,0292,42719843,368,7654,17519855,204,4205,70019869,615,3719,978198715,514,77614,584198823,800,00020,579198934,762,58528,791199049,179,28539,533199171,947,42655,6271992101,008,48678,6081993157,152,442143,4921994217,102,462215,2731995384,939,485555,6941996651,972,9841,021,21119971,160,300,6871,765,84719982,008,761,7842,837,89719993,841,163,0114,864,57011,101,066,28810,106,02315,849,921,43814,976,31028,507,990,16622,318,88336,553,368,48530,968,41844,575,745,17640,604,319/Genbank/genbankstats.html第17页蛋白质序列第18页四种数据原始数据(Originaldata)科学文件(Scientificliterature)数据组合(Datasets)综合性数据(Organizeddata)第19页后基因组时代呼唤传统生物学:试验科学当代生物学发展:数据获取日益实现自动化、半工业化从数据库中实现数据挖掘、知识发觉海量数据难以完全依赖试验伎俩对新数据进行分析,必须借助计算机实现分析和筛选更复杂层次生物学问题复杂基因调控网络、代谢网络;细胞间信号转导过程;生物个体全部基因表示改变……第20页面对堆积如山生物学数据……第21页2026/9/1622HGP生物数据激增(每15个月翻一番)生物学家数学家信息科学家生物信息学(bioinfomatics)诞生生物信息学概念第22页“Wearenotlimitedbythenumberofexperimentsthatwecando,wearelimitedbyourabilitytounderstandtheinformationthatisgeneratedasaresultoftheseexperiments.“Biologyisquicklybecominganinformationscience.生物学日益成为一门信息科学第23页Biologyeasilyhas500yearsofexcitingproblemstoworkon.生物学中有着最少500年也处理不完有趣问题。——DonaldE.KnuthLet’sbeginourexplorationofcomputationalandtheoreticalbiology!第24页什么是生物信息学生物信息学是当代生命科学与信息科学、计算机科学、数学、统计学、物理学、化学等学科相互渗透而形成交叉学科,是应用计算机技术和信息论方法研究蛋白质及核酸序列等各种生物信息采集、存放、传递、检索、分析和解读,以帮助了解生物学信息科学。从研究包括学科来看:多学科交叉从研究内容来看:基因组信息学、蛋白质组信息学、结构模拟与分子设计等组成其主要组成部分第25页2026/9/1626生物体系和生物过程中信息存放、传递和表示细胞、组织、器官生理、病理、药理过程中各种生物信息信息科学生命科学中信息科学概念(广义)第26页2026/9/1627生物分子数据深层次生物学知识分子生物信息学MolecularBioinformatics挖掘获取概念(狭义)生物分子信息获取、存放、分析和利用第27页2026/9/1628生物分子数据信息计算

+Bioinformatics第28页2026/9/1629细胞分子存放、复制、传递和表示遗传信息系统生物信息载体生物分子信息第29页2026/9/1630主要研究两种信息载体DNA分子蛋白质分子第30页2026/9/1631生物分子最少携带三种信息遗传信息与功效相关结构信息进化信息第31页2026/9/1632遗传信息载体---DNA遗传信息载体主要是DNA控制生物体性状基因是---系列DNA片段生物体生长发育本质就是遗传信息传递和表示第32页33DNA生物体(人)人体由上亿个细胞组成每个细胞都有着相同染色体组染色体对每条染色体是一个DNA分子,基因是DNA功效区域DNA双螺旋结构7.5-10

101223对2.8-3.5万第33页2026/9/1634蛋白质结构决定其功效蛋白质功效取决于蛋白质空间结构蛋白质结构决定于蛋白质序列(这是当前基本共认假设),蛋白质结构信息隐含在蛋白质序列之中。第34页2026/9/1635DNA分子和蛋白质分子

都含有进化信息经过比较相同蛋白质序列,如肌红蛋白和血红蛋白,能够发觉因为基因复制而产生分子进化证据。经过比较来自于不一样种属同源蛋白质,能够分析蛋白质甚至种属之间系统发生关系,推测它们共同祖先蛋白质。第35页2026/9/1636生物分子信息DNA序列数据蛋白质序列数据生物分子结构数据生物分子功效数据最基本直观复杂第36页2026/9/1637DNA核酸序列蛋白质氨基酸序列蛋白质结构蛋白质功效最基本生物信息维持生命活动机器第一部:遗传密码第二部:遗传密码?生命体系千姿百态改变生物分子数据及其关系第37页2026/9/1638生物分子信息特征生物分子信息数据量大生物分子信息复杂生物分子信息之间存在着亲密联络第38页2026/9/1639生物信息学目标和任务搜集和管理生物分子数据数据分析和挖掘开发分析工具和实用软件生物分子序列比较工具基因识别工具生物分子结构预测工具基因表示数据分析工具第39页2026/9/1640试验

数据

信息知识搜集表示分析建模刻画特征比较推理应用基因工程蛋白质设计疾病诊疗疾病治疗开发新药生物分子信息处理流程第40页数据源数据量生物信息学任务DNA序列11.5百万条序列125.0亿个碱基分离编码与非编码区域识别内含子与外显子基因产物预测基因功效注释基因调控信息分析蛋白质序列40.0万条序列(每条序列平都有300氨基酸)序列比较多重序列比对识别保守序列模式进化分析第41页数据源数据量生物信息学任务大分子结构1.5万个结构(每个结构平均1000个原子坐标)二级结构、空间结构预测三维结构比对蛋白质几何学度量表面和形态计算分子间相互作用分析分子模拟基因组300个基因组标重视复序列基因结构分析系统发生分析基因与疾病连锁分析基因组比较遗传语言分析第42页2026/9/1643数据源数据量生物信息学任务基因表示酵母6000个基因在约20时间点表示值表示模式相关分析基因基因调控网络分析表示调控信息分析第43页2026/9/1644分子生物学三大关键数据库GenBank核酸序列数据库SWISS-PROT蛋白质序列数据库PDB生物大分子结构数据库第44页2026/9/1645生物信息学研究意义认识生物本质了解生物分子信息组织和结构,破译基因组信息,说明生物信息之间关系。改变生物学研究方式改变传统研究方式,引进当代信息学方法在医学上主要意义为疾病诊疗和治疗提供依据为设计新药提供依据第45页2026/9/1646生物信息学基本思想产生生物信息学快速发展二十世纪50年代二十世纪80-90年代生物科学和技术发展人类基因组计划推进生物信息学发展历史第46页2026/9/164720世纪50年代,生物信息学开始孕育20世纪60年代,生物分子信息在概念上将计算生物学和计算机科学联络起来20世纪70年代,生物信息学真正开端20世纪70年代到80年代早期,出现了一系列著名序列比较方法和生物信息分析方法20世纪80年代以后,出现一批生物信息服务机构和生物信息数据库20世纪90年代后,HGP促进生物信息学快速发展第47页2026/9/1648生物信息学主要研究内容序列分析/SequenceanalysisSequencealignmentStructureandfunctionpredictionGenefinding结构分析/StructureanalysisProteinstructurecomparisonProteinstructurepredictionRNAstructuremodeling表示分析/ExpressionanalysisGeneclusteringGenexpressionanalysis蛋白质组学/ProteomicsProtein-ProteinInteraction第48页2026/9/1649基因组数据库蛋白质序列数据库蛋白质结构数据库DDBJEMBLGenBankSWISS-PROTPDBPIR生物分子数据搜集与管理第49页序列分析从DNA序列与蛋白质序列中进行信息及模式发觉寻找进化联络寻找基因组编码区寻找序列中功效信号区全基因组序列拼接与组装识别非编码区,探索其功效单核苷酸多态性SNP(Singlenucleotidepolymorphism)第50页序列比对/alignment序列分析第51页分子进化和比较基因组学第52页结构分析蛋白质结构和功效预测分析

蛋白质家族保守序列寻找从氨基酸组成辨识蛋白质蛋白质二级结构预测

蛋白质三维结构蛋白质物理性质预测其它特殊局部信息:其它特殊局部结构包含膜蛋白跨膜螺旋、信号肽、卷曲螺旋(CoiledCoils)等,含有显著序列特征和结构特征,也能够用计算方法加以预测第53页基因表示数据分析基因表示数据:近年来biochips,microarray技术快速发展起来,使得我们可能得到同一时间成千上万个基因表示水平数据。上述基因表示数据为我们提供了深入研究基因功效,基因相互作用,基因网络等复杂网络问题有力工具。基因表示数据分析面临维数极高,噪声大而且相关,数据重复度低等问题,对数理统计等学科提出了新问题。当前对基因表示数据处理主要是进行聚类分析,将表示模式相同基因聚为一类,在此基础上寻找相关基因,分析基因功效。第54页2026/9/1655第55页基因调控网络与信号转导基因表示受到蛋白调控,一个基因表示是否,表示量,均受到细胞中各种蛋白调控。所以基因调控能够看作是细胞中各基因对应mRNA与各种蛋白一个相互作用网络。信号转导指当细胞受到某种影响,其中某个蛋白含量发生改变,而引发一系列蛋白表示改变过程和路径。它对于研究药理、病理、细胞分化、发育、进化等重大问题都十分主要。信号转导、基因网络与基因表示数据分析是紧密相关。第56页生物信息处理并行算法第57页2026/9/1658生物信息学主要研究内容序列分析/SequenceanalysisSequencealignmentStructureandfunctionpredictionGenefinding结构分析/StructureanalysisProteinstructurecomparisonProteinstructurepredictionRNAstructuremodeling表示分析/ExpressionanalysisGeneclusteringGenexpressionanalysis蛋白质组学/ProteomicsProtein-ProteinInteraction第58页2026/9/1659生物信息学所用方法和技术1、数学统计方法2、动态规划方法3、机器学习与模式识别技术4、数据库技术及数据挖掘5、人工神经网络技术6、教授系统7、分子模型化技术8、生物分子计算机模拟9、因特网(Internet)技术第59页2026/9/1660数学统计方法生物活动经常以大量、重复形式出现,既受到内在原因制约,又受到外界环境随机干扰。所以概率论和数学统计是当代生物学研究中一个惯用分析方法数据统计、原因分析、多元回归分析是生物学研究必备工具隐马尔科夫模型(HiddenMarkovModels)在序列分析方面有着主要应用。与隐马尔科夫模型相关技术是马尔科夫链(MarkovChain)第60页2026/9/1661动态规划方法动态规划(DynamicProgramming)是一个处理多阶段决议过程最优化方法或复杂空间优化搜索方法动态规划处理问题基本过程是:将一个问题全局解分解为局部解,逆序递推求出局部最优解,伴随执行过程推进,“局部”逐步靠近“全局”,最终取得全局最优解第61页2026/9/1662机器学习与模式识别技术机器学习机器学习是模拟人类学习过程,以计算机为工具获取知识、积累经验遗传算法采取随机搜索方法,含有自适应能力和便于并行计算神经网络理论是基于人脑结构,其目标是揭示一个系统是怎样向环境学习,这一个方法被称为联接主义。第62页2026/9/1663机器学习与模式识别技术模式识别模式识别是机器学习一个主要任务。模式是对感兴趣客体定量或者结构描述,而模式识别就是利用计算机对客体进行判别,将相同或相同客体归入同类中模式识别主要有两种方法:依据对象统计特征进行识别,依据对象结构特征进行识别

第63页2026/9/1664环境学习知识库执行反馈机器学习系统基本结构

第64页2026/9/1665数据库技术及数据挖掘数据挖掘(datamining)又称作数据库中知识发觉(KnowledgeDiscoveryinDatabase),它是从数据库或数据仓库中发觉并提取隐藏在其中信息一个新技术,它能自动分析数据,对它们进行归纳性推理和联想,寻找数据间内在一些关联,从中发掘出潜在、对信息预测和决议行为起着十分主要作用模式数据挖掘过程普通分为4个基本步骤:数据选择、数据转换、数据挖掘和结果分析第65页2026/9/1666人工神经网络技术人工神经网络(ArtificialNeuralNetwork,简称ANN)是经过模拟神经元特征以及脑大规模并行结构、信息分布式和并行处理等机制建立一个数学模型第66页2026/9/1667输入层隐藏层输出层第67页2026/9/1668教授系统教授系统(ExpertSystem)是一个基于知识智能系统,它将领域教授经验用一定知识表示方法表示出来,并放入知识库中,供推理机使用.第68页2026/9/1669使用界面解释机构推理机知识获取知识库数据库领域教授用户AI教授教授系统基本结构第69页2026/9/1670分子模型化技术分子模型化(Molecularmodeling)是利用计算机模拟分子结构、研究分子之间相互作用一个技术分子模型化是进行分子设计基础。分子图形学(MolecularGraphics)是进行分子模型化一项主要技术,正是因为分子图形学和其它计算化学方法(如分子力学、分子动力学)相互结合,才使得分子模型化方法取得成功第70页2026/9/1671第71页2026/9/1672生物分子计算机模拟传统生物分子研究主要是试验方法,如利用测序技术确定DNA分子序列,经过分子遗传学方法确定基因多态性,经过X-射线晶体衍射确定蛋白质分子结构,经过生化试验硕士物大分子之间相互作用、药品分子与靶分子结合。所谓生物分子计算机模拟就是从分子或者原子水平上相互作用出发,建立分子体系数学模型,利用计算机进行模拟试验,预测生物分子结构和功效,预测动力学及热力学等方面性质第72页2026/9/1673反馈,改进模型试验试验现象数学模型计算机模拟模拟结果分析新构想产生设计解释第73页2026/9/1674因特网(Internet)技术Internet已经成为生物学研究平台,同时也成为分子生物学研究人员进行信息交流尤其是生物分子数据交流场所经过网络查询或搜索所需要生物信息,使用分析工具将所要处理数据直接送到对应网络服务器上,服务器接收你处理请求,并将处理结果返回第74页复杂网络分析理论

社会网:社交网,演员合作网,姻亲关系网,科研合作网,Email网生物网:食物链网,神经网,新陈代谢网,蛋白质网,基因网络信息网络:WWW,专利使用,论文引用,计算机共享技术网络:电力网,Internet,电话线路网交通运输网:航线网,铁路网,公路网,自然河流网75第75页中药方剂网即使中药方剂数量很大,但当前还没有统计用数据库。不得不用手工进行统计,所以统计数据量受到很大限制。选取了1536付药方,681种药品进行了统计。节点:药品,边:在一付方剂中药品

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论