已阅读5页,还剩47页未读, 继续免费阅读
(生物医学工程专业论文)全β类蛋白质折叠核心数据库构建及识别.pdf.pdf 免费下载
版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
a b s t r a c l a b s t r a c t o b t a i n i n gs t r u c t u r ea n df u n c t i o no fp r o t e i n si so n eo ft h em a i np u r p o s e so f r e s e a r c hi nb i 0 1 0 9 y , b u td e t e r m i n i n gt h r e e - d i m e n s i o n a ls t r u c t u r eo fp r o t e i nb ym e a n s o fx - r a y sc r y s t a l l o g r a p h ya n dn u c l e a rm a g n e t i cr e s o n a n c es p e c t r o s c o p y , a n dr e s e a r c h i np r o t e i ns t r u c t u r eb yt h ew a yo fb i o c h e m i s t r y , a l r e a d yc a n tm e e tt h en e e do ft h e r a p i di n c r e a s eo fp r o t e i ns e q u e n c e i nb i o i n f o r m a f i c s ,t h es t r u c t u r ep r e d i e t i o no fn e w s e q u e n c ec a nb eu s e dt oe s t a b l i s ht h er e l a t i o nb e t w e e ns e q u e n c ea n dc o r r e s p o n d i n g s t r u c t u r ea sw e l la sf u n c t i o nb ym a k i n gu s eo ft h es t r u c t u r e k n o w nm o d e lo ft h e p r o t e i nf a m i l y , s ot h a tw ec a np r e d i c tt h es t r u c t u r ea n df u n c t i o no f p r o t e i ni nl e s sc o s t a n ds h e r t e rt i m e n 伦m a i no b j e c t so ft h i sr e s e a r c hi st op r e d i c tt h et o p l o g yo ft h ec o r eo ft h e p r o t e i nb yu s i n gf o l dr e c o g n i t i o nm e t h o d 1 1 1 em a i nc o n t e n t sa r c ; ( 1 ) t b ea b s t r a c t i o no ff o l dc o r eo fp r o t e i n sa n dc o n s t r u c t i o no ft h ed a t a b a s eo f f o l dc o r et e m p l a t e s c h a r a c t e f i s t i c so ft h ec o r eo f8 2 2a l l bd o m a i n sw i t hs e q u e n c ei d e n t i t yb e l o w 2 5 a g ei d e n t i f i e db yr a s m o lr e v i e w , t h e nan o n - r e d u n d a n tl i b r a r yo ff o l dp , o r eo f a l l pp r o t e i nt h a ti n c l u d e s7 2f o l dc o r e si sc o n s t i t u t e d ( 2 ) md e v e l o p m e n to f m e t h o df o rr e c o g n i t i o no f p r o t e i nf o l dc o r e d e f m es e c o n d a r ys t r u c t u r ea l i g n m e n tt e c h n i q u ea n da l i g n m e n tf u n c t i o ns s ,a n d l o n g - r a n g ei n t e r a c t i o np o t e n t i a lb po nt h e b a s i so fs t a t i s t i c so fh y d r o g e n - b o n d d i s t r i b u t i o n s c o r i n gf u n c t i o np i sd e v e l o p e dt of o l dc o r er e c o g n i t i o n ( 3 ) c o m p i l a t i o no f p r o t e i nf o l dc e r er e c o g n i t i o ns o f t w a r ef r e s h o nt h eg r o u n do ft h em e t h o dw ed e v e l o p e d ,d e s i g nf o l dc o r er e c o g n i t i o n s o f t w a r ef r e s h t 1 1 ee o m p u a t i o nm o d u l ew a sw r i t t e nb yp e r ll a n g u a g e t h em a i n i n t e r f a c ei si m p l e m e n t e db yh 砷m l v i e w e di ni n t e r n e tb r o w s e r , a n df u r l l lt h ef u n c t i o n b yc o ib a c k g r o u n d r e s u l t s :f o rr a n d o m l yp i c k e dt h r e et e s ts e t si n c l u d i n g1 6 3a l l pd o m a i n sf r o m s c o p l 6 9d a t a b a s e ,t h eb e n c h m a r ks h o w st h a tt h ec h a n c eo ff i r s tp r e d i c t e do n ea s c o r r e c tf o l dc o r ei s4 9 ,w h i l e8 1 t h ec o r r e c tf o l dc o r ei si no n eo ft h et o pt e n p r e d i c t i o n t h em e t h o dd e v e l o p e di nt h i sp a p e rm a i n t a i n sg o o dp e r f o r m a n c ew h i l et h e s i m p l i f i c a t i o no ft h ec o m p u t a t i o n ,a n di te a np r e d i c tt h ec o r es t r u c t u r eo ft h ep r o t e i n o fu n k n o w ns t r u c t u r ei ns h o r tt i m e , a n dp r o v i d es u p p o r tf o rf u r t h e rs t u d yo fs t r u c t u r e i l l 北京工业大学工学硕l 学位论文 a n df u n c t i o n w ee x p e c tt h i ss o f t w a r eh a sa g o o dd e v e l o p i n gp o t e n t i a l k e yw o r d sf o l dc o r e ;a l lpp r o t e i n ;d a t a b a s e ;f o l dt y p e w 独创性声明 本人声明所里交的论文是我个人在导师指导下进行的研究工作及取得的研 究成果。尽我所知,除了文中特别加以标注和致谢的地方外,论文中不包含其他 人已经发表或撰写过的研究成果,也不包含为获得北京工业大学或其它教育机构 的学位或证书而使用过的材料。与我一同工作的同志对本研究所做的任何贡献均 己在论文中作了明确的说明并表示了谢意。 签名:殛赴日期:互笙 关于论文使用授权的说明 本人完全了解北京工业大学有关保留、使用学位论文的规定,即:学校有权 保留送交论文的复印件,允许论文被查阅和借阕;学校可以公布论文的全部或部 分内容,可以采用影印、缩印或其他复制手段保存论文。 ( 保密的论文在解密后应遵守此规定) 签名: 第l 章绪论 1 1 课题背景 第1 章绪论 蛋白质的氨基酸序列如何决定空间结构是生命科学研究中的核心问题之一, 被称为第二遗传密码。9 0 年代后,一些以研究蛋白质结构为核心内容的新兴学 科相继诞生:1 9 9 3 年正式提出结构生物学( s t r u c t u r a lb i o l o g y ) 的时代已经到来, 1 9 9 5 年蛋白质组学( p r o t e o m i c s ) 诞生,2 0 0 0 年以研究基因产物一蛋白质结构为目 标的结构基因组学在英国召开了第一届国际会议,蛋白质折叠问题,成了生命科 学领域的前沿课题之一。蛋白质折叠类型的研究和确定将为蛋白质相互作用界面 【l 】、蛋白质的柔性和动态特性 2 1 、远同源检测t 3 , 4 j 、酶和蛋白质的功能分类和预测 【5 】等提供依据,对于相关蛋白质的设计和折叠动力学实验具有指导作用,并为精 确的蛋白质三级结构预测奠定理论基础。蛋白质折叠问题的研究不仅具有重大的 科学意义,而且在医学和生物工程领域有极大的应用价值。 蛋白质结构是发挥其生物学功能的基础,尽管实验方法可以解析出一部分蛋 白质的高分辨率结构,但结构预测的理论方法依然非常重要,它将为大部分蛋白 的结构研究提供非常有价值的信息,尤其是对那些不能从实验上测定结构的蛋 白。由蛋白质的氨基酸序列预测其空间结构国际上的研究方法有以下几类喇:。是 同源序列( 或序列一致性达4 0 以上) 的经验预测,此方法最为可靠,但只能用于 同源蛋白质序列。二是从头预测,着眼点比较基本,但在现阶段要获得成功难度 很大。介于两种方法之间的是折叠识别,其基本思想是:预测的蛋白质折叠类型 与某一己知结构的蛋白质折叠类型相同,这样蛋白质的折叠问题就转化为在已知 空间结构的蛋白质中,选择一种最有可能的折叠类型,从而大大减少了预测蛋白 质结构的难度,这种方法被认为是最有前途的方法。本文拟对已知空间结构信息 的蛋白质进行分析,探索相同折叠类型蛋白的共同特性,建立蛋白质折叠类型的 折叠模式库,采用折叠识别的方法,进行蛋白质折叠类型的预测。 1 2 生物信息学概论 生物信息学从事对生物信息的获取、加工、储存、分配、分析、和释读,并 综合运用数学、计算机科学和生物学工具,以达到理解数据中的生物学含义的目 标 7 1 。与此相应,生物信息学具有三方面的科学基础。首先,它需要发达的、复 北京工业大学1 = 学硕士学位论文 杂的、可相互交流的数据库系统。其次,生物信息学需要强有力的创新算法和软 件。没有算法创新,生物信息学就无法获得持续的发展。最后,但也是十分重要 的一个方面,是自动化的大规模高通量的生物学研究方法与平台技术。这些技术, 既是产生生物信息数据的主要方法,又是在利用生物信息分析结果的基础上,进 一步获取或验证生物学知识的关键手段之一。 具体地说,生物信息学是把基因组d n a 序列分析作为源头,找到基因组序 列中代表蛋白质和r n a 基因的编码区,阐明非编码区的信息实质,破译隐藏在 d n a 序列中的遗传语文规律;同时,归纳、整理与基因组遗传语文信息释放及 其调控相关的转录谱和蛋白质谱的数据,从而认识代谢、发育、分化、进化的规 律。生物信息学综合基因信息和大规模蛋白质空间结构测定及蛋白质相互作用检 测的数据,进行蛋白质空间结构的模拟和蛋白质功能的预测( 包括蛋白质和蛋白 质的相互作用以及蛋白质与配体的相互作用规律) ,进而将此类信息与生物体和 生命过程的生理生化信息结合,阐明其分子机制,最终进行分子设计、药物设计 和个体化的医疗保健设计。因此,在基因组研究时代,生物信息学至少应包含三 个层次上的重要内容:基因组信息学、蛋白质的结构计算与模拟以及分子与药物 设计。这三者紧密地围绕着遗传信息传递的中心法则,因而必然有机地连接在一 起。 1 3 蛋白质组信息学 蛋白质组信息学是随着蛋白质组学的诞生而兴起的一门交叉学科,是生物信 息学的一个分支。由于生物功能的主要体现者是蛋白质,而蛋白质有其自身特有 的活动规律,仅仅从基因组的角度来研究是远远不够的。例如蛋白质的修饰加工、 转运定位、结构变化、蛋白质与蛋白质的相互作用、蛋白质与其他生物分子的相 互作用等活动,均无法从基因水平上获得。正因为如此,1 9 9 4 年澳大利亚 m a c q u a r i e 大学的w i l k i n s 和w i l l i a m s 在意大利s i e n a 的一次2 - d e 电泳会议 上首次提出了蛋白质组的概念( p r o t e o m e ) ,从而诞生了- - i 新兴学科一蛋白质 组学( p r o t e m i c s ) 。蛋白质组学是研究细胞内所有蛋白质及其动态规律的学科。 要顺利开展蛋白质组学研究,必须加强技术方法体系和生物信息学方面的研究, 于是蛋白质组信息学就应运而生了。 蛋白质组比基因组更复杂,因而蛋白质组信息学更具有挑战性。第一,基因 组是内禀的和固定的,蛋白质组则是随发育阶段、驻留组织甚至所处环境的变迁 而变化的;第二。9 8 的人类疾病是多基因的和或后成的,疾病的诊断和治疗的 选择可能完全依赖于后天的调节以及患者所处的环境;第三,组织中r n a 的丰 度与蛋白质丰度的统计相关是不显著的;第四,几乎所有的蛋白质都经过翻译后 2 第l 章绪论 的修饰,从水解切割到特异残基的共价修饰,仅后者就有2 0 0 多种。因此,蛋白 质组信息学的内容更特殊,方法更独特。 1 4 蛋白质结构预测概述 1 - 4 1 蛋白质结构预测的意义 蛋白质结构预测是分子生物学的一个基本问题。蛋白质从氨基酸序列折叠到 其特定的天然结构是一个不可思议的过程。比如,一个1 0 0 个氨基酸的多肽链有 1 0 1 0 0 种可能的构象( 假设每个残基平均有l o 个构象) ,也就是说,即使每次构 象转换仅需l o 。3 秒,搜索完所有的构象也需要1 0 8 5 秒( 1 0 7 7 年) i s l 。然而自然界 中的蛋白质都具有它特定的空间结构,一种蛋白质从去折叠状态到天然构象的折 叠过程仅用几秒的时间。这就是讨论了3 0 年的l e v i n t h a l 悖论b ”j 。蛋白质的折 叠并没有一条特定的路线,一条序列可能通过各种不同的途径折叠,但是最终的 构象是相同的。那么,蛋白质从氨基酸序列到高级结构的折叠受到什么机制的支 配呢? 这一问题在蛋白质领域被称为蛋白质的折叠问题,也称为折叠密码和中心 法则的第二遗传密码【1 1 i 1 3 】。蛋白质结构预测,尤其是基于热力学定律的蛋白质 结构预测能够帮助我们认识蛋白质折叠机理,揭示折叠密码。 尽管实验技术不断改进,但实验测定的蛋白质结构和已知序列之间的差距仍 在不断增大( 表卜1 ) ,所有蛋白质的空间结构都通过实验测定是不现实的,利用 计算技术预测蛋白质结构势在必行。 表1 - 1 蛋白质序列和结构数量 t a b l e1 - 1t h en u m b e ro f p r o t e i ns e q u e n c e sa n ds t r u c t u r e s 蛋白质分子结构预测除了它自身的理论意义外,同时又是设计全新蛋白质的 基础,在制药、食品、农业、环境等诸多领域都有广阔的应用前景,具有重要的 现实意义。例如,酶具有优良的催化功能,但是由于在剧烈的条件下难以保持稳 定,不能在工业中应用,改造蛋白质的稳定性,可以使其在特定条件下保持活性。 美国的c h a r l e s ,e b u g g 等人用分子设计的方法花费三年时间找到了嘌呤核苷磷 酸化酶( p n p ) 的抑制剂,p n p 在体内破坏抗癌剂和抗病毒剂,从而使药物失效, 这种抑制; ! j 和药物一起使用,就能够抑制p n p 的作用,使药物有足够的时间完 北京t 业大学工学硕t 学位论文 成治疗。 人类基因组全序列草图的完成是分子生物学的一个里程碑,与此同时一些其 它生物的基因组序列数据也与日俱增,人们研究的工作重心转向基因组功能的研 究,此时蛋白质结构预测研究尤为重要【1 4 1 。在分子生物学领域,理论预测蛋白质 结构的研究已有三十多年的历史,尽管科学家们的奋斗取得了卓著的成果,但是 由于蛋白质系统的复杂性,以及人们对蛋白质折叠的机理尚不清楚,到现在还没 有找到一种完善的预测方法。然而,由于计算技术的发展,以及生物学家、数学 家、信息科学家、计算机专家以及物理学家等的共同参与,最近在蛋白质分子结 构预测领域取得了可喜的进展,人们相信这一难题终将被攻克,到那时人们将清 楚各种疾病的发生机制、各种生命现象的根源,并能够预测、控制它们,为人类 创造更美好的生活。 1 4 2 蛋白质结构预测方法 1 9 6 1 年a n f m s e n 等根据变性的核糖核酸酶a 在一定条件下可以自发地再折 叠形成天然酶分子的实验【l 引,提出蛋白质分子的一级序列完全决定其三维结构的 著名论断,并因此获得了诺贝尔奖,后来这一论断多次被实验证实,在蛋白质领 域被广泛接受。尽管近些年对蛋白质折叠过程的研究发现有“分子伴侣”参与折 叠过程,但是“分子伴侣”可能只是起到稳定折叠中间体的作用,并不影响蛋白 质的最终折叠构象,蛋白质的一级结构决定高级结构是蛋白质结构预测的基础 【埘。通过分析已知的蛋白质结构和氨基酸序列的关系发现,蛋白质的三维结构比 一级结构更保守,一级结构相似的蛋白质往往具有相似的三维结构。一般地,将 序列相似性大于3 0 的蛋白质分子归属于一个家族,认为是由同一祖先进化而 来,具有相似的结构和功能,称为同源蛋白质。同源模建方法是基于该理论发展 起来的一种较为成功的方法,然而该方法的局限性是仅适用于同源蛋白质。某些 蛋白质在结构数据库中找不到同源蛋白质,但是许多序列同源性很差( 序列相似 性2 5 以下) 的蛋白质却存在相同的骨架结构一折叠子( f o l d s ) ,此时折叠识别 方法往往能得到较好的结果。以结构已知的蛋白质为模板,寻找目标氨基酸序列 可能采取的折叠类型,即折叠识别。可以看出,同源模建方法和折叠识别方法都 需要结构已经测定的蛋白质结构作为模板,而且不能产生全新结构。和这两种方 法相比,从头预测方法具有一定的特点和优势,它建立在热物理理论基础上,即 蛋白质的天然构象是热力学最稳定构象,也是能量最低的构象,如果能找到一个 表征蛋白质结构和能量关系的函数,利用优化方法寻找能量函数的全局极小点, 蛋白质结构预测问题就可以得到解决。所以从头预测方法不需要序列以外其它更 多信息,从一条序列出发,就可以得到蛋白质空间结构,而且可以产生全新蛋白 4 第1 章绪论 质结构,在理论上,这是一种理想的方法。然而,由于蛋白质结构本身的复杂性, 缺少一个理想的预测模型和一种有效的全局优化方法,从而阻碍着从头预测方法 的实现。 ( 1 ) 同源模建方法( h o m o l o g o u sm o d e l i n g ) 也称比较模建( c o m p a r a t i v em o d e l i n g ) ,这是一种基于知识的预测方法,也 是目前应用最成功的一种方法。比较模建的第一个成功的例子是在1 9 6 9 年 1 7 , 1 3 】, b r o w n e 等在鸡蛋白溶菌酶三维结构的基础上,对牛的a 乳蛋白的结构进行模建。 二者具有相同的二硫键模式,序列同源性为3 9 。2 0 年之后,a c h a s y a 得到a 乳蛋白的晶体结构,证实了b r o w n e 的建模结构除c 端稍有偏差外,是正确的, 但此时模型的构建还依赖于实体模型。8 0 年代后期9 0 年代初期b l u n d e l l ( 1 9 8 7 ) 等人提出同源蛋白质结构预测模型后,相继出现了大量关于同源模建方法预测的 成果。目前对于序列相似性大于3 0 的蛋白质序列,已经能够模建相当精确的结 构模型( r m s d 1 5 埃) 【1 9 l 并拥有许多优秀的模建软件,如s w i s s m o d e l 【蛩譬 h o m o l o g y 、b i o s y m 公司的c o m p o s e r 、t r i p o s 公司的c o n s e n s u s ,我国 学者丁达夫领导的研究组花费了四年半时间完成的蛋白质模建系统 p m o d e l i n e b s 。 同源模建基本包括六个部分【2 1 捌: 1 ) 目标序列与模板序列的匹配; 2 ) 根据模板结构模建目标蛋白结构; 3 ) 目标蛋白质的结构保守区( s c r s ) 的主链模建; 4 ) 结构变异区( s v r s ) 的主链模建; 5 ) 侧链的结构预测; 6 ) 对模建结构进行优化和评估。 在同源模建方法中,序列比对的准确性对预测结构起决定性作用,一般来讲, 同源性越差,比对的准确程度也越低。序列相似度大于5 0 的蛋白质可以得到高 精度的模建模型,主链原子误差大约为l 埃,基本上相当于中等分辨率的n m r 结构和低分辨率的x 射线衍射结构;序列相似度在3 0 0 , 5 5 0 的蛋白质可以得到 中等精度的模建模型,9 0 的主链原子误差不超过1 5 埃;序列相似度低于3 0 的蛋白质则难以得到理想的结构模型,而且随着同源性降低,模型误差迅速增加。 另外,非保守区的模建也是一个关键。 传统的同源模建方法包括以上六个组成部分,此外人们也发展了一种利用约 束条件进行同源模建的方法,该方法没有主链模建、可变区模建、侧链模建等步 骤,直接根据序列匹配结果。然后提取约束条件,并对目标序列模建出满足约束 r 北京工业大学工学硕上学位论文 条件的结构。h a v e l l 和s a l i 2 4 等对这种方法的发展作出了很大贡献,其中h a v e l 的方法已经由b i o s y m 公司发展成商品化软件c o n s e n s u s 。 ( 2 ) 折叠识别方法( f o l dr e c o g n i t i o n ) 人们对已知的蛋白质结构研究发现,大量序列同源性较差的蛋白质存在相同 的折叠结构。1 9 8 7 年,f i n k e l s t e i n & p t i t s y n 就指出【2 5 1 ,由于各种立体化学的限制, 蛋白质折叠子的数目是有限的。后来许多学者对自然界中可能存在的折叠子数目 做了估计。1 9 9 2 年c h o t h i a 估计自然界中折叠子不会超1 0 0 0 1 2 6 1 。1 9 9 8 年我国科 学家王志新院士估计自然界中仅有6 5 4 种折叠子存在1 2 7 1 。这远远少于同源家族的 数目,利用结构己知的蛋白质的折叠子为模板,寻找给定氨基酸序列可能采取的 折叠类型,折叠识别方法成为蛋白质结构预测的另一种重要方法。j o n e s 等提出 的t h r e a d i n g 方法在折叠识别方法中占据主要位置1 2 8 1 。t h r e a d i n g 是一个形象的比 喻,中科院院士,上海药物研究所所长陈凯先先生 2 9 1 将t h r e a d i n g 直译为穿针引 线,即将氨基酸序列作为一条线,穿绕在已知的结构模型上,寻找最佳匹配。 由于考虑氨基酸残基或片段的插入和缺失,这条线要不时被打断或续接。 t h r e a d i n g 方法与反折叠问题( i n v e r s ef o l d i n gp r o b l e m ) 同属于折叠识别问题, 严格地说,二者是相反的两个过程。前者来自这样一个问题:给定一条序列,能 否从己知结构中找到序列可能采取的结构? 后者则是这样一个问题:给定一种结 构,是否能在序列数据库中找到相应序列? 二者都是以序列一结构匹配为核心, 但是两个问题的解决方法往往不能通用。解决前一类问题的方法即t h r e a d i n g , 解决后者的方法通常有p r o f i l e 方法。b o w i e 3 0 】等提出的解决反折叠问题的折叠识 别方法为该类方法的发展奠定了基础。 下面对t h r e a d i n g 做一个简单的描述:假设有n 种已知的折叠子,以它们 作为模板,将目标序列与这些模板一一匹配,得分最高的被认为序列最可能采取 的结构。需要指出的是,折叠模板一旦确定,就不再考虑组成它们的氨基酸类型, 只是将序列按模板进行折叠,寻找最佳匹配。在匹配过程中,需要考虑残基或片 段的插入与缺失。t h r e a d i n g 方法的技术细节包括以下几个方面d h : 1 ) 折叠子数据库( f o l m n gl i b r a r y ) 的建立:由于序列序列比对要比序列一结 构比对容易,所以构建折叠子数据库的方法大多从序列一序列比对开始。假定同 源蛋白质具有相同的折叠子,将蛋白质结构数据库( p d b ) 中结构已知的蛋白质进 行序列比对,归类家族,然后从每一个家族中挑选一个代表进行结构一结构比对, 认为相似性高的具有相同的折叠子。 2 1 比对技术( m i g n m e n tt e c h n i q u e ) :1 9 7 0 年n e e d l e m a n 和w u n s e h 将动态规 划用于两序列比对,提出了著名的n e e d l e m a n - w u n s e h 算法,现在已经成为序列 6 第1 章绪论 分析的一种经典算法,它能够精确的找到两条序列的最佳匹配。但是当动态规划 方法用于序列与结构的比对时,遇到了一个难题:打分矩阵的确定。由于序列比 对仅比较氨基酸类型是否匹配,是一种局部性质,然而在结构比对中,需要考虑 原子间相互作用。这一问题同样出现在序列一结构比对中。g o d z i k 的冻结近似 ( f i r o z e na p p r o 蒯o n ) 利用模板中残基近似计算模型中残基的相互作用,取得了 一定的成功,但是在冻结近似条件下得到的解不能保证是全局最优解。j o n e s 提 出的双层动态规划方法也是一种常用的序列结构对比方法。1 9 9 4 年m i t ( 麻省工 学院) 人工智能实验室l a t h r o p ( 1 9 9 4 ) 1 3 2 1 证明了在考虑原子间相互作用和g a p s 的 情况下,t h r e a d i n g 是一个n p c 问题。解决该问题只有两种选择:要么牺牲速度 求精度,要么牺牲精度求速度。受到计算资源的限制,人们多采取了后者,上面 的两种方法用的比较多,此外b r y a n t ( 1 9 9 6 ) 1 3 3 j 用m o n t ec a r l o 方法进行随机搜索。 3 1 打分函数( s c o r i n gf u n c t i o n ) :建立打分函数的目的是根据打分情况判断序 列一结构匹配的优劣。所以对打分函数的基本要求是能够将序列的类天然结构与 非天然结构区别开。通常采用平均势函数或评估函数。平均势函数在t h r e a d i n g 方法中应用最多,它是在对现有蛋白质各种性质进行统计分析的基础上,依据 b o l t s m a n 分布原理反推出的一个能量函数。尽管平均势函数不能真实反映分子的 能量值,但是可以很好地将蛋白质的天然结构从其他结构中区分出来。以b r y a n t 等( 1 9 9 3 ) t 3 4 】的势函数为例,首先从p d b 中挑选一些分辨率高的结构,然后澳4 量 每种氨基酸对之间的距离,并分类记录;然后把库中蛋白质序列随机化,则每一 个记录都有一个期望值,根据这个期望频率,把每一个记录频率转化为相对几率 再根据几率的b o l t s m a n 分布,把相对几率换算成势函数。评估函数是根据蛋白 质的结构特点总结出来的一种简单函数。如b o w i e 等1 3 0 l 的3 d p r o f i l e 方法,把蛋 白质结构环境分成1 8 类,然后统计出2 0 种氨基酸在1 8 种环境出现的几率,最 后总结出不同氨基酸对各种环境的喜好程度的评估矩阵。 折叠识别方法主要用于不存在同源序列的蛋白质的结构预测,准确率介于同 源模建方法和从头预测方法之间,广泛应用的软件系统主要有o e n t h r e a d e r t ”j , 3 1 3p s s m 3 6 1 f f a $ 3 7 1 。3 d - p r o f i l e 和p r o s p e e t 3 8 1 等。 ( 3 ) 从头预测方法( a bi n i t i op r e d i c t i o n ) 无论是同源模建还是折叠识别都需要已知的蛋白质结构作为模板,因此这两 种方法都不能得到全新的结构,而且在找不到模板结构的情况下难以应用。与之 相比,从头预测方法不需要已知结构信息,直接从蛋白质序列预测其空间结构, 因而在理论上是一种理想的方法。根据从头预测得到的结构信息,可分为0 d 方 法,如蛋白质结构类的预测和蛋白质折叠类型预测;1 d 方法,如二级结构预测 和溶剂可及性预测;2 d 和3 d 方法,如蛋白质折叠模拟。 7 北京工业大学工学硕士学位论文 从氨基酸序列预测三级结构是蛋白质结构预测的最终目标。a n f i 吼不仅提 出蛋白质一级结构决定高级结构著名论断,而且提出了蛋白质的天然构象是自由 能最低时的结构这一热力学假设,这是从头预测方法预测蛋白质空问结构的理论 依据。从头预测方法主要包括两方面的工作:建立预测模型和模型的求解。预测 模型的核心是目标函数,它至少应该能够区分蛋白质的天然构象和其它构象,通 常根据目标函数建立的基础分为基于物理理论的经验势能函数和基于统计方法 的平均势能函数。由于蛋白质体系( 蛋白质及环境) 作用能非常复杂,整个系统 的能量是蛋白质构象的多极值函数,据估计对于1 0 0 个氨基酸残基的蛋白质,势 能表面的局部极小点达到1 0 1 0 0 个,计算所有的可能构象是不现实的,所以模型 的求解需要有一种高效的全局优化方法。 从头预测a bi n i t i o 这个词最初用来指仅采用物理势找到蛋白质折叠结构的 方法,即势能函数采用分子力场。分子力场的研究时间比较长,而且在小分子体 系得到了成功,然而这种方法在蛋白质结构从头预测中的应用进展不大,主要用 于结构优化和蛋白质动态性质的研究中。近些年利用统计方法得到的平均势能函 数发展更迅速,为从头预测方法解决蛋白质结构预测问题带来了活力。 平均势能函数是对己知的蛋白质结构进行统计得出各种性质的分布,然后根 据能量按b o l z m a n 分布的原理反推出一个能量函数。平均势函数的问题在于它依 赖于所采用的样本,所以适用范围受到疑问;另外,与经验势能函数不同,它不 能反映实际的物理相互作用,所以对于理解蛋白质折叠机理意义不大。但是从蛋 白质结构预测的观点来看,仅需要一个能区分天然构象和其它构象的函数,而不 需要势能表面的每一个点都反映真实情况;和经验势能函数相比,平均势函数的 一个优点是它对于小的结构变化不是十分敏感,从而对于低分辨率的结构预测更 稳定;另外由于它的统计特征,理论上它能够包括所有可能的物理影响。 3 9 , 4 0 1 4 3 蛋白质结构预测流程 图1 - 1 为蛋白质结构预测的流程图。 8 第1 章绪论 图1 1 蛋白质结构预测流程图 f i g 1 1f l o wc h a r to f p r o t e i n8 f f u g t u r ep r e d i c t i o n 1 5 论文工作及创新 通过以上介绍我们可以看出,从头预测方法的思想是好的,但是在实际研究 中它遇n t 两大困难,一是要建立一个适当的预测模型,二是当模型建立之后, 还需要一种有效的解全局优化的方法,再加上庞大的计算消耗,使得这一方法距 离实际应用还有很长的路要走。 已经预测到蛋白质折叠类型数目是有限的,而且越来越多的实验证明已有的 蛋白质结构数据库中已经包含了绝大多数的折叠类型,这为我们从已有知识出发 研究蛋白质结构提供了理论基础。同源模建的方法相对成熟,但是序列相似度要 求高限制了它的应用。相比之下,折叠识别受到了广泛的重视,对于输入序列没 有太多的要求,只要数据库中有相应模板。 对于折叠识别方法来说,建立一个尽量全面而高效的折叠类型分类库至关 重要。从蛋白质折叠机理角度讲,在蛋白质折叠早期,肽链的局部相互作用,生 成二级结构,然后通过疏水塌缩形成一个疏水核心,最后在这个核心的基础上整 9 北京工业大学t 学硕士学位论文 理出完整蛋白质结构,寻找到这个核心对于折叠类型的分类有很大的帮助,因此 本文按照折叠核心对蛋白质结构进行分类是一个新的尝试。 通过对已知空间结构的蛋白质结构域的观察,发现处于结构域核心的二级结 构片段非常保守,这种保守体现在它们的长短、位置和相互作用关系方面。因此 本文提出了以结构域中疏水核心二级结构片段的拓扑结构作为折叠核心模式,并 以此核心为依据,建立了折叠核心模板数据库,通过相应的比对方法和打分函数, 进行蛋白质折叠核心预测,将这一方法命名为f r e s h ( f o l dr e c o g n i t i o nb a s e do n s e c o n d a r ys t r u c t u r ea n dh y d r o g e nb o n d ) 。 工作具体内容有以下三点: ( 1 ) 蛋白质折叠核心的提取及折叠核心模板数据库的建立 本文提取了序列相似性低于2 5 的8 2 2 个全6 类蛋白结构域,通过看图软件 r a s m o l 提取其核心的特征模式,构建了全6 类蛋白包含7 3 种折叠核心的非冗 余模板数据库,并以此模板数据库作为折叠识别方法的依据。 ( 2 ) 蛋白质折叠核心识别方法的建立 定义了二级结构比对方法及二级结构比对函数s s 以及建立在对已知结构蛋 白质氢键分布统计基础上的长程作用势能函数b p ,通过打分排序函数p 对蛋白 质折叠核心进行识别。 ( 3 ) 蛋白质折叠核心识别软件f r e s h 的编制 基于本文所述方法,设计蛋白质折叠核心识别软件f r e s h 。软件的计算模 块采用p e r l 语言,通过基于h t m l 语言的网络浏览界面,调用p e r l c g i 。 本文的主要成果在于: ( 1 ) 建立了蛋白质折叠核心的数据库,为进一步研究蛋白质序列和结构的 关系奠定了基础。 ( 2 ) 实现了快速高效的折叠核心识别方法,为进一步研究蛋白质的结构和 功能提供的方便。 第2 章相关基础知识 第2 章相关基础知识 2 1 蛋白质结构及层次 2 1 1 蛋白质的基本组成单位 氨基酸是蛋白质的基本组成单位,氨基酸是带有氨基的有机酸,它有一个氨 基、一个羧基、一个氢原子和一个r 基团组成( 如图2 1 ) 。每一个从细菌到人 类的所有物种中,一切蛋白质都是由2 0 种氨基酸构成的。氨基酸侧链r 的大小、 形状、电荷、形成氢键的能力和化学活性方面都存在着差异。蛋白质的功能范围 之所以如此之广,就是由于这2 0 种氨基酸的差异,以及它们的各种组合的变化 结果,表2 - 1 是2 0 种氨基酸的简写和符号。 l h n cc o h i i i i hho 图2 - 1 氨基酸结构示意图 f i g 2 - 1s c h e m a t i cd r a w i n go f s t r u c t u r eo f a m i n oa c i d s 表2 - l2 0 种氨基酸的符号 t a b l e2 - 1s y m b o l so f 2 0a m i n oa c i d s 北京工业丈学工学项j :学位论文 2 i 2 蛋白质的结构层次 由于蛋白质的立体结构的形成是分阶段的,同时在已知立体结构的蛋白质中 也“看到”了不同类型的规则的有序结构,因此在这个基础上提出了蛋白质的结构 是立体的多层次的学说。通常把蛋白质结构层次分为一级结构、二级结构、超二 级结构、三级结构以及四级结构( 图2 2 ) 。 惫白质( 四级结构) 结构域( 三级结栩) 锺二级结柯 = 缓结树 氮基馥序列 图2 - 2 蛋白质的结构层次 f i g 2 - 2s t m c t u r a ll e v e l so f p r o t e i n ( 1 ) 一级结构 蛋白质一级结构是指多肽链的氨基酸残基的排列顺序,也是蛋白质最基本的 结构。它是由基因上遗传密码的排列顺序决定的,各种氨基酸按遗传密码的顺序 通过肽键连接起来。图2 3 是溶菌酶的一级结构。 图2 - 3 溶菌酶的一级结构 f i g 2 - 3p r i m a r ys t r u c t u r eo f l y s o z y m e ( 2 ) 二级结构 蛋白质二级结构是指多肽链借助于氢键沿一维方向排列成具有周期性的结 第2 章相关摹础知识 构的构象,是多肽链局部的空间结构( 构象) ,主要有a 螺旋、p 折叠、d 转角、 无规卷曲等几种形式,它们是构成蛋白质高级结构的基本要素。图2 - 4 是核糖核 酸酶的某些二级结构。 图2 - 4 核糖核酸酶的二级结构 f i g 2 - 4s e c o n d a r ys t r u c t u r e so f r i b o n u c l e a s e ( 3 ) 超二级结构 超二级结构是介于蛋白质二级结构和三级结构之间的空间结构,指相邻的二 级结构单元组合在一起,彼此相互作用,排列成规则的、在空间结构上能够辨认 的二级结构组合体,并充当三级结构的构件,其基本形式有眦、陋p 、p p p 等。 图2 5 是蛋白质中几种超二级结构。 ( 4 ) 三级结构 三级结构主要针对球状蛋白质而言,指的是整条多肽链由二级结构元件构建 成的总三维结构,包括一级结构中相距远的肽段之间的几何相互关系,骨架和侧 链在内的所有原予的空间排列。图2 - 6 是溶菌酶分子的三级结构。 北京工业大学工学硕士学位论文 盱:i4 删 缺nc 一渤 貉 e 图2 - 5 蛋白质超二级结构 f i g 2 5s u p c r s c c o n d a r ys t r u c t u r e so f p r o t e i n 图2 - 6 溶菌酶分子的三级结构 f i g 2 - 6t e r t i a r ys b u c r l r eo f l y s o z y m e 1 4 第2 章相关基础知识 ( 5 ) 四级结构 蛋白质的四级结构是指在亚基和亚基之间通过疏水作用等次级键结合成为 有序排列的特定的空间结构。四级结构的蛋白质中每个球状蛋白质称为亚基,亚 基通常由一条多肽链组成,有时含两条以上的多肽链,单独存在时一般没有生物 活性。图2 - 7 是血红蛋白的四级结构。 图2 - 7 血红蛋白的四级结构 f i g 2 - 7q u a t e r n a r ys l r u c l m eo f h 口n o g l o b i n 2 1 3 蛋白质结构数据库p d b 蛋白质结构数据库( p r o t e i nd a t ab a n k ,简称p d b ) 早在序列数据厍诞生之 前的7 0 年代就已经问世。p d b 数据库原来由美国b r o o k h a v c n 国家实验室负责维 护和管理,1 9 9 8 年由美国国家科学基金委员会、能源部和卫生研究院资助,成 立了结构生物学合作研究协会( r e s e a r c hc o l l a b o m t o r y f o rs t r u c t u r a l b i o i n f o r m a t i c s ,简称r c s b ) ,p d b 数据库改由r c s b 管理。和核酸数据库一样, 用户可以通过网络直接向p d b 数据库递交数据。 p d b 收集了全世界利用核磁共振、x - r a y 射线实验得到的蛋白质和d n a 三 维立体结构和理论模型结构,它是目前主要的蛋白质分子结构数据库。随着晶体 衍射技术的不断改进,结构测定的速度和精度也逐步提高。迄今为止,p d b 数 据库中已经存放了4 3 3 3 9 ( 2 0 0 7 5 8 ) 套原子坐标,其中大部分为蛋白质,包括多肽 和病毒。此外,还有核酸、蛋白和核酸复合物以及少量多糖分子( 表2 - 2 ) 。 北京工业大学t 学硕上学位论文 表2 - 2p d b 数据库中不同种类数据统计( 2 0 0 7 5 ) t a b l e2 - 2s t a t i s t i c so f d i f f e r e n tc a t e g o r i e si np d bd a t a b a s e p d b 数据库以文本文件的方式存放数据,每个分子各用一个独立的文件。 除了原子坐标外,还包括物种来源、化合物名称、结构以及有关文献等基本注释 信息。此外,还给出分辨率、结构因子、温度系数、蛋白质主链数目、配体分子 式、金属离子、二级结构信息、二硫键位置等和结构有关的数据。数据库中的信 息可以通过蛋白质结构浏览器界
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 程序与算法课程设计项目
- 同态加密数据安全原型设计课程设计
- Snort入侵防御课程课程设计
- 2026年初级经济师《金融专业知识和实务》全真模拟试卷答案(共十四套)
- 2026年初级药士考试试题及答案
- 2025年新能源技术(发展)试卷及答案
- 2025年教师公需课试题及答案
- 2027年合同印花计提二篇
- 2026中国母婴用品新锐品牌突围路径与渠道变革研究报告
- 2026农产品产地预冷仓储设施投资回报与运营模式研究报告
- DL-T5153-2014火力发电厂厂用电设计技术规程
- (正式版)JBT 7122-2024 交流真空接触器 基本要求
- 《Baby》Justin-Bieber版歌词完整版打印下载打印
- 基层安全生产监管面临的困惑和对策模板范本
- 城市轨道交通车站设备(高职)PPT完整全套教学课件
- 润滑油基础油的加氢法生产工艺课件
- 实验六-兔子的解剖-课件
- 烘干设备购销合同
- 架桥机安装拆除监理细则
- 防空警报试鸣暨人防演练方案
- GB/T 23426-2009船舶与海上技术钢质小型风雨密舱口盖
评论
0/150
提交评论