(环境科学专业论文)蛋白质分形结构及功能研究.pdf_第1页
(环境科学专业论文)蛋白质分形结构及功能研究.pdf_第2页
(环境科学专业论文)蛋白质分形结构及功能研究.pdf_第3页
(环境科学专业论文)蛋白质分形结构及功能研究.pdf_第4页
(环境科学专业论文)蛋白质分形结构及功能研究.pdf_第5页
已阅读5页,还剩72页未读 继续免费阅读

(环境科学专业论文)蛋白质分形结构及功能研究.pdf.pdf 免费下载

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

a bs t r a c t a se s s e n t i a lm a t e r i a lo fc o n s t i t u t i n gt h eo r g a n i s m , t h e p r o t e i nh a sp l a y e d i m p o r t a n tb i o l o g i c a lf u n c t i o n st h a ta l el a r g e l yd e p e n d e n to ni t ss t r u c t u r e t ok n o w c o m p l e t e l yt h eb i o l o g i c a lf u n c t i o no ft h ep r o t e i n ,f u r t h e rr e s e a r c ho nt h ep r o t e i n s t r u c t u r ei sh i g h l yr e q u i r e d a tp r e s e n _ t ,t h em e c h a n i s mo nh o w t h ep e p t i d ec h a i ni s f o l d e di n t ot h ep r o t e i ns t r u c t u r ei sn o ty e tk n o w nc l e a r l y h o w e v e ra m o n gp r o t e i n s t r u c t u r ep r e d i c t i o n ,t h ep r e d i c t i o no fp r o t e i ns e c o n d a r ys t r u c t u r eh a sb e c o m ev e r y n e c e s s a r y ,f o ri tc o n n e c t sa n g l oa c i ds e q u e n c e sw i t ht e r t i a r ys t r u c t u r eo fp r o t e i n t h e p r e d i c t i o no fs e c o n d a r ys t r u c t u r ei st h eb a s eo fs e t t i n gu pam o d e lo ft e r t i a r ys t r u c t u r e o fp r o t e i n i nt h ep a s tt w e n t yy e a r s ,a l t h o u g hs c i e n t i s t sh a v em a d eg r e a te f f o r t st o s o l v et h i sp r o b l e m ,s a t i s f i c a t o r yr e s u l t sh a v en o ty e tb e e na c h i e v e d n o w a d a y s ,o n l y t h ea c c u r a c yo f7 6 c a l lb eg o tb ya v a i l a b l em e t h o d s ,w h i c hi sf a ra w a yf r o m r e q u i r e m e n t s i nt h i st h e s i s ,t h r e ei n v e s t i g a t i o n sh a v eb e e nd o n e :f i r s t l y , t h er e l a t i o nb e t w e e n f r a c t a ld i m e n s i o na n d p r o t e i ns t r u c t u r ei sc o n s i d e r e db a s i n go nm a x i m a l f l u xp r i n c i p l e f o u n d a t i o n t h em e c h a n i s mo nh o wt h ep e p t i d ec t i 痂i sf o l d e di nt h es p a t i a lp r o t e i n s t r u c t u r ei sr e v e a l e db yt h em a t h e m a t i c a lf o r m a l i s m s ,w h i c hm a yp r o v i d ei m p o r t a n t i m p l i c a t i o n sf o rt h es t u d yt h eb i o l o g i c a lf i m c t i o no ft h ep r o t e i na n dt h ea n a l y s i so fl i f e o r i g i n t h ed i f f e r e n tf r a c t a ld i m e n s i o n sm a n i f e s tt h ed i f f e r e n tt o p o l o g ys t r u c t u r e s ,a n d t h ef r a c t a ld i m e n s i o ni si n f l u e n c e db yt h ee n v i r o n m e n t a lf a e t o ra t h e r e f o r e ,t h e e n v i r o n m e n t a lf a c t o r 口m a yb et a k e na sas t a n d a r do f r e c o g n i z i n gp r o t e i ns t r u c t u r e s e c o n d l y , b e c a u s e t h e s i m i l a r i t y e x i s t s a m o n gt h ep r o t e i ns t r u c t u r e s ,t h e s e l f - o r g a n i z i n gm a p ( s o m ) ,w h o s es i m i l a r i t yi ss t r o n g e s ta m o n gg e n e t i cn e u r a l n e t w o r ka l g o r i t h m ,i sc h o s e nt op r e d i c tp r o t e i ns e c o n d a r ys t r u c t u r e t h r e ep e r c e n t a g e p o i n t sp r e c i s i o ne n h a n c e m e n to fp r e d i c t i v er e s u l t so np r o t e i ns e c o n d a r ys t r u c t u r e p r e d i c t i o ni so b t a i n e d ,w h i c hw i l ls p e e dt h ep r o t e i ns t r u c t u r ep r e d i c t i o n t h i r d l y , t h e p r o t e i ns p a t i a ls t r u c t u r ed e c i d e si t sb i o l o g yf u n c t i o n ,h o w e v e rt h ep r o t e i ns p a t i a l s t r u c t u r ei sr e s t r i c t e db y 也ef r a c t a ld i m i e n s i o na n dt h ee n v i r o n m e n t a lf a c t o r a t h e r e f o r e ,t h ep r e d i c t i o no ft h ep r o t e i nb i o l o g i c a lf u n c t i o ni se l a b o r a t e db yt h e b i o l o g i c a l e v o l u t i o nv i e w p o i n t ,f r o mt w o a s p e c t s 嬲f r a c t a l d i m e n s i o na n d e n v i r o n m e n t a lf a c t o r , w h i c hm a yp r o m o t et h eu n d e r s t a n d i n go nt h em e c h a n i s mo ft h e p r o t e i nm o l e c u l a rd i s e a s ea n dt h em e d i c i n em o l e c u l ed e s i g n 嬲w e l l ,a n dm a yf m a l l y i m p r o v et h er e s e a r c ho nt h ep r o t e i nb i o l o g i c a lf u n c t i o no ft h et o w a r d st h eh u m a n d e m a n d s k e yw o r d s :p r o t e i ns t r u c t u r ep r e d i c t i o n ,s e l f - o r g a n i z i n gm a pn e u r a ln e t w o r k , m a x i m a l f l u xp r i n c i p l e ,f r a c t a ld i m e n s i o n 独创性声明 本人声鼹所呈交的学位论文是本人在导师指导下进行的研究工作和取得的 研究成果,除了文中特别加以标注和致谢之处外,论文中不包含其他入已经发表 或撰写过的研究成果,也不包含为获得鑫鲞基鲎或其他教育机构的学位或证 书蔼使用过的材料。与我一同工作的同志对本研究所做的任何贡献均已在论文中 作了明确的说明并表示了谢意。 学位敝作者襁弗嘶签字嗽拶哆车胄夕匿 学位论文版权使用授权书 本学位论文作者完全了解苤鲞基堂宥关保留、使用学位论文的规定。 特授权苤鲞叁茎可以将学控论文的全都或部分内容编入有关数据库进行检 索,并采用影印、缩印或扫描等复制手段保存、汇编以供查阅和借阅。同意学校 向国家有关部门或机构送交论文的复印件和磁盘。 ( 保密的学位论文在解密后适用本授权说明) 学位论文作者签名: 签字麟:歹夕等, 导筛弛魂卟 签字暑期;z 矽年厂月 ,7 星 彳基 建, 彦男 天津大学硕士学位论文第一章绪论 1 1 问题的历史起源 第一章绪论 过去十年,d n a 测序技术( s e q u e n c i n g ) 的飞速发展使分子生物学经历了信 息革命时代。这一革命得益于计算机技术在过去十多年来突飞猛进的高速发展。 只有使用计算机技术,我们才有可能应付日益快速增长的生物信息。8 0 年代中期 以来,计算机在生物学中的广泛应用孕育了生物信息学这一新兴学科。 生物信息学这一术语在不同的场合下被赋予不同的含义。从广义上说,生物 信息学可指利用信息技术管理和分析生物学数据。这就意味着生物信息学所涉及 的范围相当广泛,从人工智能、机器人一直到基因组( g e n o m e ) 分析;就基因 组分析这一角度来看,生物信息学主要是指核酸和蛋白质序列数据的计算机处理 和分析。随着蛋白质结构数据的快速增长,人们把蛋白质三维结构的处理分析也 归入到了生物信息学的范畴。 分子生物学的兴起首先建立在对组成生物体的基本物质的认识上。从最简单 的单细胞生物到最高等的人类,构成生物体的物质种类很多,但其中最基本最重 要的无疑是蛋白质和核酸。核酸是生物体遗传信息的携带者,所有生物体能世代 相传,就是依靠核酸分子可以精确复制的性质【l 】;而蛋白质是生命活动的主要承 担者和机体的功能分子,一切生命活动无不与蛋白质有关。新陈代谢是生命活动 的主要特征,而构成新陈代谢的所有化学变化都是在酶的催化下进行的。除最近 发现的极少数具有催化功能的核糖核酸以外,所有的酶都是蛋白质。生物体的各 种活动,如生长、运动、呼吸、免疫、消化、光合作用,以及对外界环境变化的 感知并做出必要的反应等,都必须依靠蛋白质来实现。虽然遗传信息的携带者是 核酸,但是遗传信息的传递和表达不仅仍然是在酶的催化之下,并且也是在各种 蛋白质的调节控制之下进行的。在人体内蛋白质的含量很多,约占人体固体成分 的4 5 ,它的分布很广,几乎所有的器官组织都含有蛋白质。因此,为了了解蛋 白组织的功能及其在生命活动的重要性,需要深入了解其结构,特别是空间结构 ( 三级结构) 。生命的功能和它的结构,二者是统一的,有什么样的结构必定有 什么样的功能,反之亦然。 蛋白质是一种由d n a 编码的l 型a 氨基酸,通过a 碳原子上的取代基间形 成的酰胺键连成的,具有特定空间构象和生物功能的生物大分子。组成蛋白质分 子的基本单位是氨基酸,构成天然蛋白质的氨基酸共2 0 种,每一种都可以用三 天津大学硕士学位论文第一章绪论 字母或单字母符号来标记,标准符号和性质见表1 1 、表1 - 2 。 表1 1 氨基酸标准符号表 。 名称3 个字母1 个字母名称3 个字母1 个字母 丙氨酸( a l a m i n e ) a l aa 亮氨酸( 1 c u c i n o ) l e ul 精氨酸( m g i n i a e )a r g r 赖氨酸( 1 y s i n e )l y s k 天冬酰胺( a s p 啪g i n c ) a s nn 甲硫氨酸( m e t h i o n i n e ) m e tm 天冬氨酸( a s p a r t i ca c i d ) a s p d 苯丙氨酸( p h e n y l a l a n i n e p h ef 半胱氨酸( c y s t e i n e )c y s c 脯氨酸( p r a l i n e ) p r op 谷酰胺( g l u t a m i n e ) g l n q丝氨酸( s e r i n e ) s e rs 谷氨酸( g l u m m i ca c i d ) g l ue 苏氨酸( t h r e o n i n e ) t h rt 甘氨酸( g l v c i n e )g l y g 色氨酸( t r y p t o p h a n )t r p w 组氨酸( h i s t i d i n e ) h i sh 酪氨酸( t y r o s i n e )t y r y 异亮氨酸( i s o l e u c i n e ) i s o i 缬氨酸( v a l i n e ) v r a lv 根据侧链的化学性质,这2 0 种氨基酸可分为【2 】: 疏水氨基酸:a l a ,v a l ,l e u ,l i e ,p h e ,p r o 和m e t ; 带电氨基酸:a s p ,g i n ,l y s 和a r g ; 极性氨基酸:s c r ,t h r ,c y s ,a s n ,g i n ,h i s ,t y r 和唧; 甘氨酸:g l y ; 天津大学硕士学位论文第一耄绪论 表1 艺构成蛋白质的2 0 种l 型a 氨基酸的一些性质 名称缩写分子量d 4体积 3a s a 6 a 2 比容。胤g p k 。d 频率。 嚣氨酸a l aa7 l 。0 88 8 。61 1 50 。7 4 89 。潞 耩氨酸 a r gr1 5 6 2 0 1 7 3 4 2 2 5 0 6 6 61 24 7 天冬氨酰 a 舳n1 1 4 1 1 1 1 7 71 6 00 6 1 94 4 天冬氨酸 a s p d1 1 5 辨l l l 。l1 5 00 。5 7 94 55 s 篱 拳胱氨酸铷c1 0 3 1 31 0 8 。51 3 50 。6 3 1 9 1 - 0 52 8 谷酰胺 g 1 n q 1 2 8 1 41 4 3 91 8 00 6 7 43 9 谷氨酸g he1 2 9 。1 21 3 8 4 1 9 0 o 6 4 3碡66 磷 嚣氨酸 g 矽g 5 7 0 66 0 。l7 50 6 3 27 5 筠 组氨酸 h i sh1 3 7 1 5 1 5 3 2 1 9 5 0 6 7 06 22 1 异亮氨酸h ei1 1 3 1 71 6 6 。71 7 5o 8 瓣4 娟 亮氨酸 l e u tl1 1 3 。1 71 6 6 。71 7 0 0 8 8 4 7 5 篱 赖氨酸 l y sk1 2 8 1 8 1 6 8 72 0 00 7 8 91 0 47 0 9 6 瞪硫氨酸 m e tm1 3 1 2 l1 6 2 91 8 5 0 。7 4 51 傩 苯丙氨酸p h c f1 4 7 1 81 8 9 92 1 00 。7 7 43 5 舄 脯氨酸 p r op 9 7 1 2 1 2 2 71 4 5 0 7 5 8 ,4 0 9 6 丝氨酸s e ts8 7 0 88 9 ol 圭50 6 1 37 。1 苏氨酸 零融t1 0 1 。1 1l 王6 。l1 韵0 6 8 96 麟 色氨酸 t r p w1 8 6 2 12 2 7 82 5 5 o 7 3 41 1 酪氨酸 t y ry1 6 3 。1 8 1 9 3 。62 3 00 。7 1 29 73 5 缬氨酸 、隆lv9 9 1 4重4 0 。1 5 5o 。8 碡7 6 。瞩 a :i d = l 。0 7 x 1 0 2 4 9 , b :露接触表面积;e :偏微眈窭;d :可解离侧链豹p :蘸毳基的最 值为6 8 - 7 9 ,a 羧基的p k 为3 5 q 3 ;e :氨基酸在一些蛋白质中出现的频 率,l a = l o 。1 。 每一个蛋白质都有它自己特有的一定的氨基酸组成和排列顺序。在蛋白质中 出现酌氨基酸是一类特殊的氮基酸,是由一个氨基- n i l 2 、一个羧基c o o h 、一 个a 碳原子c a 和一个r 基团组成的。除脯氨酸以外,其他的氨基酸都有图1 1 a 所 示的化学结构式,侧链r 基团决定了氮基酸的种类,r 不同氨基酸就不同。髓氨 酸结构式的不同之处在于它的侧链与主链n 原子共价结合,形成一个亚氨基酸 ( 如图1 i b ) 。 天津大学硕士学位论文 第一章绪论 h l r c c o o h 1 n h 2 h i r c c o o h i n h 2 图1 1 a 一般氨基酸结构式图1 1 b 脯氨酸结构式 一个氨基酸的羧基与另一个氨基酸的氨基缩合脱水形成肽键( 图1 2 ) ,一定 数目的氨基酸以肽键( - c o - - n h ) 的形式连接而成一条多肽链。在一条肽链中, 氨基酸分子由于缩合脱水已经失去了原来完整的结构,因此给它重新命名为“残 基”。 n h 2m ,一! 曼一c 彩 眦f 咚 r i :h :r 2 o h 图1 - 2 肽键的形成 蛋白质生物体为什么选用a 氨基酸作为基本组成单元? 主要是因为a 氨基 酸通过口碳原子上的氨基和羧基形成了酰胺键后,在肽链骨架上的一些原子间的 距离相对更靠近一些,彼此间更易相互作用,使蛋白质的空间构象更稳定。在0 螺旋中,形成相邻的一对氢键的氧和氮原子间由1 3 原子个构成一个环。如果是 伊氨基酸,在氨基的氮原子和羧基氧原子间,存在有两个碳原子,不仅因为多了 一根可旋转的单键,可以增加更多的肽链构象,而且肽链内形成a 螺旋的条件, 因多了3 个碳原子而受到影响,或许仍能形成螺旋,但是螺旋的直径有改变,螺 旋内的氢键密度也有所降低。伊氨基酸形成的肽链中的某些片断如果也有声折叠, 则这些口折叠间相互作用而生成的片层结构中的氢键密度同样较少。再者,由于 a 氨基酸比伊氨基酸少一个碳原子,侧链的集团也更靠拢,也能出现更强的相互 作用,利于蛋白质高级结构的形成。当然,残基侧链的靠近,对不同残基的位阻 效应也就不同。由此可见,静氨基酸成为蛋白质中唯一的组成不是偶然的,应是 自然选择的结果。 一个蛋白质分子一般有一条或几条多肽链,每条多肽链大约含有几十到几百 个氨基酸残基。蛋白质分子的重要结构特征是具有层次性。一级结构是指组成蛋 白质的2 0 种不同氨基酸的排列顺序,是蛋白质分子结构的基础,包含着结构的全 部信息,影响着蛋白质分子构象的所有层次。蛋白质是在水溶液的环境中行使其 生物功能的,为减小其疏水侧链与水介质的相互作用,蛋白质形成空间结构必须 天津大学硕士学位论文第一章绪论 遵循的重要原则是:将疏水侧链埋入分子内部,而将亲水主侧链暴露在表面。由 于蛋白质主链上每一个肽单位都有一个氢键的给体( n h ) 和一个氢键的受体 ( c = o ) ,主链是高度亲水的。在将疏水侧链埋入分子内部的同时,必然将亲水 的主链也埋入内部。为解决这一矛盾,自然界在进化的过程中,选择了非常聪明 的策略,就是在分子内部形成二级结构。研究表明多肽主链的若干肽段可以形成 有规则的构象,而其他的一些肽段有的也可能形成无规则的构象,其中最重要的 有纩螺旋、伊折叠和无规则卷曲。 蛋白质分子除有肽链结构以外,还具有肽链在空间的卷曲、折叠而形成特定 空间排布的三维空间结构,只有处在特定的三维结构中的蛋白质分子才能够发挥 其特定的生物功能。因此,即使肽链完整,肽链的氨基酸序列也不变,只要空间 结构被破坏,或者说肽链在空间的位置发生了变化,就会导致蛋白质功能发生变 化乃至丧失。结构和功能关系的研究,一直是蛋白质研究的核心问题之一。此外, 许多蛋白质能在适合的条件下,从完全伸展的肽链自发的调整成具有生物活性的 天然构象,也就是说蛋白质三维结构的形成信息包含在它的一维序列中。所谓蛋 白质折叠问题就是研究蛋白质天然构象是如何形成的,即具有一定氨基酸序列的 多肽链如何逐步卷曲折叠形成蛋白质特定的空间结构。它首先是一个具有重大突 破性意义的基础科学问题;其次,随着基因工程和蛋白质工程的发展,原则上人 们已经可以按照需要来设计和生产出各种特殊用途的蛋白质。但其中的难题之一 就是:基因工程产物没有以生物活性的聚合物形式存在,即所谓的“包含体 。 如何使蛋白质的包含体重新折叠成具有天然构象的活性蛋白,这是当前基因工程 和蛋白质工程中急待解决的现实问题。如果彻底了解了蛋白质折叠的机理和规 律,我们就可以根据实际的需求设计出新型的蛋白质分子,例如具有较高热稳定 性或较高催化活性的酶分子等。另外,酶和其他蛋白质分子空间结构的知识也是 合理药物设计的基础。 随着分子生物学技术的飞速发展,蛋白质氨基酸序列的测定速度也大大加快 了。1 9 6 7 年,e d m a n 等人发明蛋白质序列自动分析法,蛋白质序列测定的速度也 大大提高了。由于国内外许多实验室都配备有序列自动分析仪,因而造成序列数 据库收集到的数据猛增。但现在用x 光衍射的方法测定一个蛋白质分子的晶体结 构不仅需要首先得到高质量的晶体,这需要花相当长的时间,在技术上也会受到 一定的限制;虽然多维核磁共振技术的出现提供了另一个测定蛋白质三维结构的 强有力的手段,但这一方法目前还只限于较小的蛋白质的结构测定。而且这两种 方法耗资巨大,使得蛋白质分子三维结构测定的速度仍远远落后于其氨基酸序列 测定的速度。为了处理这些极其庞大和复杂的数据,必须借助于其他学科知识, 尤其是数学和计算机科学的帮助,这种需要产生了一个新领域计算分子生物 天津大学硕士学位论文第一章绪论 学。近年来,随着蛋白质工程和计算机技术的发展以及人类基因组计划的实施, 蛋白质折叠的理论研究已经成为分子生物学中最活跃的领域之一。 1 2 国内外研究现状 在当今分子生物学领域中,蛋白质分子空间结构与功能的研究无疑是最具挑 战性的问题。尽管三联体密码的破译使人们了解了遗传信息由d n a 到r n a 再 到多肽链合成的基本规律,然而,研究表明蛋白质只有形成一定的空间结构,才 可以具有特定的生物活性。从氨基酸序列到蛋白质三维结构的编码关系,被称为 第二遗传密码,破译此被列为2 1 世纪生物学的首要任务。 随着“人类基因组计划”的顺利完成,多种模式动植物基因序列的测定以及 蛋白质工程技术的不断发展,一方面是由此产生的核酸与蛋白质一级结构数据库 所包含的海量生物信息,以及由此提出的“后基因组时代 对蛋白结构与功能的 研究;另一方面是由于传统的蛋白质空间结构分析技术如x 射线晶体衍射方法、 核磁共振技术等的费时和费力,从而使研究蛋白质空间结构的速度比较缓慢,这 些都使得从理论上对一个己知序列的蛋白质的空间结构进行预测的问题变得日 益紧迫和重要。 蛋白质结构预测问题就是如何从蛋白质的氨基酸序列出发预测它的功能构 象问题。对蛋白质结构预测进行研究,对基础理论和实际应用都有重大意义。在 理论上,如果弄清楚蛋白质一级结构是如何决定其高级结构这个基本问题,将会 使人们更系统和完整地理解生物信息:从d n a 到具有生物活性蛋白质的传递全 过程,使中心法则得到更完整的阐明,从而对生命过程中的各种现象有进一步的 深刻认识,最终推动生命科学的快速发展;在应用上,将使人们有能力解决诸如 疾病等问题,设计具有新型生物功能的蛋白质,对医药、农牧业等将有极大的促 进作用。 一、蛋白质结构预测的理论基础 2 0 世纪6 0 年代初,c b a n f i n s e n 以一条肽链的蛋白质核糖核酸酶为对象研 究二硫键的氧化还原问题时发现,该酶的1 2 4 个氨基酸残基构成的多肽链中存在 四对二硫键,在大量伊巯基乙醇和适量尿素作用下,四对二硫键全部被还原为h , 酶活力也全部丧失,但是如将尿素和伊巯基乙醇除去,并在有氧条件下使巯基缓 慢氧化成二硫键,此时酶的活力水平可接近于天然的酶【3 】。通过这个实验, a n f i n s e n 认为蛋白质特定的空间结构是由其氨基酸排列顺序决定的。换言之,蛋 白质的一级结构决定其空间结构。这个假说为理论预测蛋白质各级结构( 结构类、 二级结构、三级结构等) 奠定了基础,a n f i i l s e i l 本人也因此获得了1 9 7 2 年的诺贝 天津大学磺受攀位论文第一鬻缝论 尔化学奖。 二、餐鑫震结褥硬测酶骥壁 蛋白质彩肽链之所以能形成二级结构和三级结构是因为多肽链上残基侧链 之阌的耱蓬栋震跛及侧链与溶裁环境懿榴互捧麓戆结暴。侧链攘嚣俸耀一般镪括 疏承作用、静趣褪氨律蔫( 离子键) 、氯键帮范德华力,有时还有= 硫键释瓢位 键起到稳定蛋白质结构的作用【4 j 一。芷魁因为在这些力的作用下蛋囱质的空间结 ;陶会处子整个热力学系统熬最稳定状态,蠢虽这个结构愚瞧鳃。搬摆这一壤论 可以建立如下的优化模型: f m i n u ( x )( 1 1 ) t s t x 拦d “ 其审u ( x ) 嚣标避数,透鬻采雳经验势能垂数谶警均势憨邈鼗,猃为梅象塑润。 经典的经验势能函数至少含四个能景项:键伸缩能、键角变形能、键转动( 二 蟊焦) 然彝菲键耀噩作焉( 包括静邀裰互佟慧秘范德牮杰) ,爝- v 式表汞滋; e ( ) = 争i : 一是幻) 2 十争熄一谚孙) 2 + 每( 1 + ( c o s ( 撑脚一y ) ) 。ff - l ( 1 + 善毫h9 挖一9 6 卜嚣 式牵登一) 表霹麓量是n 个原予链萋f 翡懑数;第一项表零链静缩畿,褥键长蠡编离 平衡值矗口时的能量增量;第二项为键角变形能,即键角热偏离平衡值酿。时的能量 增爨;第三顼麓二面蹩顼;第鼷顼表示嚣键稳蔓律震。 三、蛋囱质结构预测研究现状 蛋鑫震蕊功畿楚蠢蛋皇豢熬结构捩定戆,梵了研究燮秘曩分子结搀的基本援 律,入们瘸不阍的方法,献不蕊酶角度对己知鬣弱质进行分类,有些是基于生物 功能,有些是基予结构自身,有些是将者结食在一起,其中比较有影响的是 l e v i t t 帮c h o t h i a 等人对蛋彝葳结麴进褥麓分类。缝稍认兔二缀结梅酌缝合擒藏 了太多数结构域的核心,并依此把蛋囱质结构豢型分为脯型、声型、a 彬型、邶 燮秘喜型筹s 类,| 良嚣太稍黎霜统计瓣方法对基赫结梅翡蛋基囊遴抒分类,帮跌 蚤囱质二缴结构含爨来分类,但在分类a + b 型和a b 型时需引入希折叠中平行与 爱平餐的比侧,这静分类方法虽篱骧,但有一些润题对一攘蛋白蕨熬分类霄暖显 错误,翔:p d b i m u p ( p d b 麾中蛋叁餍名应为露型,毽依照二缀结构含蠢帮爨 为邢型戏彬型,类似的例子还有不少,所以只简单的用二级结构含量魁不能 缀好遣分类蛋叁震磐耨类型。 目前,从本质上解决蛋白质结构预测将需要对以下两个方面的根本问题加以 天津大学硕士学位论文第一耄绪论 解决: ( 量) 在遗传信息传递全过程中,包括d n a 的自身复制以及从d n a 猁具有 生物活性的蛋白质,第二遗传密码的生物学本质是什么; ( 2 ) 揭示在核糖体上合成出来的新生肽链折叠成e l l 其一级结构决定的特定 翡三维结构,并成熟为具有全部生物活性的功能蛋自的全过程。 对于第一方面的问题,研究表明第二遗传密码确实存在,但目前还没有相关 的合理设想。事实上,蠢前蛋自结构预测主要集中在第三方蟊的问题,到露翦隽 止已经取得了一定进展和积累了一定的资料,并提出了许多不同的理论和方法。 蛋白质结构预测的理论基础:蛋囱质的一级结构决定高级结构【戤。目前结构 预测的方法大致分为两大类: ( 1 ) 假设蛋白质分子天然构象处于热力学最稳定、能量最低状态,考虑蛋 良质分子中所有原予闻的相互作用以及蛋自质分子与溶裁之闯豹稳互作用,采用 分子力学的能量极小化方法,计算出蛋白质分予的天然空间结构。 ( 2 ) 第二类方法是找出数据库巾已有的蛋自质的空间结构与其一级序列之 间的联系,总结出定的规律,逐级从一级序列预测二级结构,两建立可能的三 维模型,根据总结出的空间结构与其一级序列之间的规律,排除不合理的模型, 辫根据能量最低原理得到修正的结构,这也就是所谓“基于知识的预测方法一。 需要指出的是第一类方法遇到在数学上难以解决的多重极小值问题,而逐级 预测又受n - - 级结构预测精度的限制。 蛋白质结构预测的理论方法可分为三大类【9 , 1 0 , 1 1 : ( 1 ) 比较建模法。比较建模法( 同源建模法) 是基于知识的蛋白质结构预 测方法。这一方法豳前主要是指同源结构预测。它是在未知蛋白质中有同源结构 可以参考的情况下应用的一种技术。它可以根据同源结构中保守的部分搭建出未 知蛋自质的结构骨架。它是现在最为成熟的预测方法。蛋自质根据序列圊源性可 以分成不同的家族。一般认为序列同源性大于3 0 的蛋白质可能由同一祖先进化 丽来,称为同源蛋离质。同源蛋白质具有相似的结构和功能。所以利震结构已知 的同源蛋白质可以建立目标蚤白质的结构模型,然后用理论计算方法进行优化。 利用同源建模方法建立的蛋酝质模型是以已知的同源蛋白质结构为基础,所以这 是一种基予现代生物学知识的预测方法。同源建模的基本过程包括六部分:目标 序列与模板序列的匹配;根据同源蛋囱质的多重序列匹配结果,确定同源蛋白质 豹结构保守区以及相应的框架结构;邈标蛋白震结构保守区的主链模建;器标蛋 白质结构变异区的主链模建;侧链的安装和优化;对建模结构进行优化和评估。 序列匹配对建立精确的结构模型起着关键作用。一般地,序列同源性越差,匹配 的准确程度越低,建立的模型精度也越差,序列同源性低于3 0 的蛋白质难以得 天津大学硕士学位论文 第一章绪论 到理想的结构模型。自从2 0 世纪8 0 年代后期9 0 年代初期b l u n d e l l 等人提出同 源蛋白质结构预测模型以后,相继出现了大量关于同源预测的成果。目前对于序 列同源性大于3 0 的蛋白质序列已经能够得到相当精确的结构模型,并拥有许多 优秀的建模软件。我国学者丁达夫领导的研究组花费4 年半的时间完成了蛋白质 建模系统p m o d e l i n e ,该系统具有操作自动化、精度高、运行时间少的优点。 ( 2 ) 反向折叠法。它可以应用到没有同源结构的情况中,且不需要预n - - 级结构,即可直接预测三维结构,从而可以绕过现阶段二级结构预测准确性不超 过6 5 的限度,因此是一种有潜力的预测方法。它的主要原理是把未知蛋白质的 序列和已知的这种结构进行匹配,找出一种或几种匹配最好的结构作为未知蛋白 质的预测结构。它的实现过程是总结出已知的独立的蛋白质结构模式作为未知结 构进行匹配的模板,然后经过对现有的数据库的学习,总结出可以区分正误结构 的平均势函数作为判别标准来选择出最佳的匹配方式。它的局限性是假定的蛋白 质折叠类型是有限的,所以只有未知蛋白质和已知蛋白质结构相像的时候,才有 可能预测出未知的蛋白质结构。1 9 8 7 年f i n k e l s t e i n 和p t i t s y n 就指出,由于各种, 立体化学的限制,蛋白质折叠子的数目是有限的。后来许多学者对自然界中可能 存在的折叠子数目作了估计。1 9 9 2 年c h o t h i a 估计自然界中折叠子不会超过 1 0 0 0 。1 9 9 8 年我国科学家王志新院士作了更精确的估计,认为仅有6 5 4 种折叠 子存在。以结构己知的蛋白质的折叠子为模板,寻找给定氨基酸序列可能采取的 折叠类型,即折叠识别。目前利用折叠识别预测蛋白质结构的主要方法大多是从 1 9 9 1 年b o w i e 等提出的三维剖面( 3 d p r o f i l e ) 方法和1 9 9 2 年j o n e s 等提出的 t h r e a d i n g 方法发展而来的。b o w i e 等根据侧链的埋藏程度、侧链被极性原子或 水分子覆盖的分数以及局部二级结构将蛋白质结构环境分成1 8 类,然后统计出 2 0 种氨基酸在1 8 种环境中的出现概率,得到一个表示不同氨基酸对各种环境喜 好程度的评估矩阵,称为3 d 1 d 打分表。对于结构已知的蛋白质x ,每一个氨 基酸残基都可以分配一类环境,从而将3 d 结构转换为1 d 序列( 称环境链) 。利用 3 d 1 d 打分表生成蛋白质x 的3 d p r o f i l e ,借用序列分析中的p r o f i l e 方法,在 蛋白质序列数据库中搜索与蛋白质x 相匹配的蛋白质序列。j o n e s 等则首先从蛋 白质结构数据库中挑选蛋白质结构建立折叠子数据库,以折叠子数据库中的折叠 结构作为模板,将目标序列与这些模板一一匹配,通过计算打分函数的值判断匹 配程度,根据打分值给模板结构排序,其中打分最高的被认为是目标序列最可能 采取的折叠结构。t h r e a d i n g 方法的难点在于序列与折叠结构的匹配技术和打分 函数的确定。同源建模方法在同源蛋白质的结构预测中取得了成功,但是在找不 到同源蛋白质结构作为模板的情况下,折叠识别方法显示出了它独特的优势,因 此得到了迅速发展,尤其是t h r e a d i n g 方法。人们对于折叠子数据库的建立、折 天津大学硕士学位论文 第一章绪论 叠结构与序列的匹配技术和打分函数的建立等进行了大量的分析讨沦,折叠识别 方法已经成为一种较为成熟的蛋白质结构预测方法,对于这种方法的研究已经从 理论转向了实际应用。 ( 3 ) 从头预测法。它要求方法本身可以指根据蛋白质的氨基酸序列来预测 蛋白质的二级结构和高级结构,从理论上讲是最为理想的方法。但现在所有的方 法还不能完全达到这个要求。从头预测法又可细分为:二级结构预测、超二级结 构预测、蛋白质结构类型预测、蛋白质折叠模式预测、详细的三维结构的直接预 测等。蛋白质序列预测空间结构是蛋白质结构预测的最终目标,1 9 7 3 年a 1 t i l i s e l l 提出蛋白质的天然构象对应自由能最低时的结构这一热力学假设,是从头预测方 法预测蛋白质空间结构的理论依据。然而这种方法一直受到两方面的困扰:首先, 难以找到一个能严格区分蛋白质的天然构象和非天然构象的能量函数,使能量函 数的全局极小点对应蛋白质天然结构。目前已有的能量函数都采用经验势函数; 其次,由于蛋白质系统分子量和柔性都很大,所以在蛋白质的势能面上存在着极 多的局部极小点,缺少一种有效的全局优化算法也制约着这种方法的发展。在利 用分子力场建立能量函数的过程中,模型的准确性和模型的简化是需要权衡的基 本矛盾。最简单的模型如g o 等建立的三维网格模型,用相连的方格序列表示氨 基酸主链,侧链位于相应残基最近的一个方格中;s c h e r a g e 等建立的联合残基模 型将氨基酸侧链用一个椭球体来表示,主链被简化为一系列虚键。从头预测方法 发展了近4 0 年,然而和同源建模方法及t r e a d i n g 方法相比较,目前这种方法的 预测结果并不理想,尤其是在全盲预测中的失败,使越来越多的人对它失去了信 心:然而,近来从头预测方法又取得了一些喜人的进展,比如s c h e r a g e 等建立 的阶梯式模型,对残基数为7 0 二2 4 4 的蛋白质进行了全盲预测,预测结构的c a r m s d ( 椭球体球径) 低于0 6 r i m 。尽管目前全盲预测的结果还不能与前两种方法相比, 但是近来取得的成功再一次激起了人们对这种方法的兴趣。随着数学、计算机、 物理等多学科的共同参与,相信这一难题最终将得到解决。 四、蛋白质结构预测结果的评判 蛋白质结构预测是否正确,试验测定和结构解析得到的空间结构数据是否准 确,都需要做出检验和判断。在正误构象的判断方面,主要是发展预测中用到的 能量函数,这种能量函数共有分子力场、平均势函数和评估函数三类。 ( 1 ) 分子力场即根据经典的物理模型如谐振子模型等,结合一些光谱实验 数据,发展一种适合计算蛋白质构象的参数和相应的势能函数形式。现在的主要 有c h a r m m 力场,d i s c o v e r 力场,a m b e r 力场,s y b y l 力场等。这类方法虽然研 究时间长,但多年来在蛋白质从头预测研究方面的应用一直进展不大,而且很难 应用到判断蛋白质整体结构的正误上。 天津大学硕士学位论文 第一章绪论 ( 2 ) 平均势函数是一种对现有蛋白质的各种性质进行统计得出各种性质的 分布,然后根据能量按b o l t z m a n 分布的原理,反推出一个所谓的能量函数,即 平均势函数,然后再以这个函数算出能量作为正误判断的标准。现在用平均势函 数判断所测的晶体结构是否合理方面结果很好,它可以找出原来p d b 库中结构 数据测得不太准确的蛋白质,特别是加入和溶剂有关的能量项后,这种方法非常 灵敏。 ( 3 ) 评估函数是根据蛋白质结构的特点总结出的评估函数,在判断结构好 坏时只须计算这种函数值的高低。有关简单评估函数做得比较好的小组有 k a d i l1 小组,g e o r g er o s e 小组,s r i ni s r e a l 小组等。 1 3 蛋白质结构预测的困难与挑战 一、预测准确率难以提高 在二十世纪6 0 年代到9 0 年代间,蛋白质二级结构的预测只能达到6 0 左右。 一直到1 9 9 3 年r o s t 和s a n d e r 才有了重大的突破,预测准确率达到7 0 以上。它们 之所以能够在预测准确率上有突破,除了结合大量的数据以及更好的算法之外, 主要是因为他们在预测方法中,加入了生物进化方面的信息。这些信息的引入, 将蛋白质二级结构的预测准确率提高了将近7 。在这之后的研究中,提高几个 百分点的预测准确率往往都是较为困难的,最好的结构预测准确率也只能达到 7 6 左右。因此,在进行生物信息学的研究时,如何从海量的数据中,提取出更 多的信息,往往对发展更准确的算法有极大帮助。影响预测准确率提高的因素有 多种,首先是由于人类对于蛋白质构象形成的复杂机制尚未完全认识清楚,以至 于不能建立最佳的预测模型;其次,与未知的结构数据相比,己知的结构数据量 太少,这也限制了从已知结构数据中挖掘知识的潜力;第三,模型结构选择的适 当与否,也会导致模型性能不能达到最佳。例如,在机器学习类方法中,由于先 验知识的缺乏和学习算法的限制,自由参数很难被精细地调整为最佳水平。 二、难以从预测模型中提取领域相关的知识 在蛋白质二级结构预测中,除了评估方法的准确率外,能否从模型中提取领 域相关的知识也是研究人员关心的重要问题。以往所使用的预测方法,如神经网 络方法,大多都是属于黑箱( b l a c k - b o x ) 方法,这种方法能够给预测者带来的信 息其实是很少的,透过这个黑箱,预测者得到的只是一个预测的结果,而并不知 道该预测方法的内部机制。举例来说,预测者( 即使是生物学家) 通常很难理解 神经网络模型中每个权重所代表( 或蕴含) 的生物学含义,更不用说可以利用这 些权重来做更进一步的分析。 天津大学硕士学位论文第一章绪论 1 4 本文的主要工作 针对人们对蛋白质构象形成的复杂机制尚未完全认识清楚以至于不能建立 起最佳的结构预测模型,而蛋白质二级结构预测的准确性又是由级结构序列预 测蛋白质空闻结构的关键,并且蛋白璜的生物学功能与蛋自质的立体结构密不可 分等问题,本文的主要内容如下: ( 1 ) 蛋自质肽链是如何逐步:折叠成为不囝层次结构两生物功能各异的蛋皂 质空间结构? 本文第二章在最大流原理的基础上,利用分形和斑图的基本原理, 结合自组织、自装配理论,以生物进化的观点阐述了蛋白质结构层次自组装积形 成的机制,为蛋白质结构预测模型的选择提供理论依据。 ( 2 ) 由于肽链在折叠成为不同的蛋白质结构层次过程中,体现出了非常强 麴鲞相似豫。为了提高蛋自蕨二级结构预测的精度,本文第三章应用鲁相似性极 强的自组织映射( s o m ) 网络对蛋白质二级结构做了预测,与其他二级结构预 测方法相比较,皇缀织映射( s o m 嘲络的预测准确度又有了一定的提高。 ( 3 ) 蛋白质的生物学功能是由独特的空间结构决定的,结构

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论