已阅读5页,还剩42页未读, 继续免费阅读
版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
摘要 摘要 蛋白质在生物体内占有特殊地位,是生物体的基本构件。几乎一切生命现象都要通 过蛋白质的结构与功能体现出来,而蛋白质的功能取决于其自身的结构。作为研究蛋白 质结构和功能的重要手段,蛋白质的相似性比较显得尤为重要。 鉴于当前对蛋白质相似性比较的研究仍处于探索阶段,不同的方法各有优劣。本文 从蛋白质结构特性出发,从蛋白质两两比对和多对比对两方面,提出了两种比对方法。 第一种方法,提出利用结构字母表和c g r 游走技术相结合的方法,对蛋白质结构信息 进行再现,得到了蛋白质结构的c g r 图像,通过分析图像,能够找出蛋白质分子的主 体结构,并得到各结构对整体结构的贡献率,对差异较大的蛋白质对象进行筛选,实现 了蛋白质对象的粗分类。然后本文又分别利用线性拟合和h a u s d o r f f 距离两种方法对蛋 白质相似度进行计算。第二种方法,从蛋白质的基本组成单元氨基酸入手,对氨基 酸以及蛋白质多肽链中的组分和典型结构进行综合分析,选取适当对象作为约束条件, 依托模糊数学等价矩阵理论,运用传递闭包的方法,对多个蛋白质对象进行相似性比较 和分类。 第一种方法的优点在于:由于蛋白质结构比蛋白质序列更为保守,因此,基于结构 字母的方法与单纯研究氨基酸序列的方法相比,更有利于找到结构和功能相似的蛋白 质。第二种方法的优点在于:利用模糊等价矩阵理论可以实现同时比较多组蛋白质对象, 对蛋白质相似性比较和分类效率的提高有很大的帮助,同时对蛋白质结构预测也具有一 定的借鉴意义。 关键词:结构字母表,c g r ,主体结构,相似性比较,曲线拟合,h a u s d o r f f 离, 模糊等价矩阵,传递闭包 a b s t r a c t a b s t r a c t p r o t e i np l a y sag r e a tr o l ei nt h eb o d yo fb i o l o g y a sm a c r o m o l e c u l e s ,i ti sf o r m e db y a m i n oa c i da n dc o n n e c t e dt h r o u g ht h ep e p t i d eb o n d b e i n gt h ei m p o r t a n tb a s i cm a t e r i a lo f l i v e ,i ti sv i e w e da sa l le s s e n t i a lc o m p o n e n to fo r g a n i s m s a l m o s ta l lt h el i f ep h e n o m e n aa r e f e a t u r e dt h r o u g ht h es t r u c t u r e sa n df u n c t i o n so fp r o t e i n a n dt h ef u n c t i o no fp r o t e i n si s d e p e n d e do nt h es t r u c t u r eo f i t so w n ,s oa sa ni m p o r t a n tm e t h o df o rs t u d y i n gt h es t r u c t u r ea n d f u n c t i o no fp r o t e i n ,s i m i l a r i t yc o m p a r i s o no fp r o t e i nb e c o m e sm o r ea n dm o r ei m p o r t a n t f i r s t l y ,t h ee x i s t i n gm e t h o d sa r ei n t r o d u c e di nt h i sp a p e r ,a c c o r d i n gt os i m i l a r i t y c o m p a r i s o no fp r o t e i n ,a n dt h e ns t a r t i n gw i t ht h ef e a t u r eo ft h es t r u c t u r e ,t h ep r o t e i ns t r u c t u r e i n f o r m a t i o ni sr e p r e s e n t e db ys t r u c t u r a la l p h a b e ta n dc g r t h r o u g ha n a l y s i so fc g r , t h e m a i ns t r u c t u r ec a nb ef o u n da n dt h ec o n t r i b u t i o nr a t eo fe a c hs t r u c t u r ec a r lb eg o t t e n ,t h e nu s e t h e s ei n f o r m a t i o nt oc o m p l e t et h er o u g hc l a s s i f i c a t i o nf o rp r o t e i n s s e c o n d l y t h em e t h o di n t h i sp a p e ri sv e r i f i e df r o mt w os i d e s o n eh a n d ,c o m p u t i n gt h es i m i l a r i t yb yt h ea n a l y s i so f t h ec g r a n o t h e rh a n d ,s o m ec h a r a c t e r sa r ee x t r a c t e da st h er e f e r e n e ec o n d i t i o n st h r o u g h a n a l y z i n gt h ec o m p o n e n t sa n dt y p i c a ls t r u c t u r e f i n a l l y ,t h es i m i l a r i t yc o m p a r i s o ni s c o m p l e t e db yf u z z ye q u i v a l e n tm a t r i x ,a n dt w oe x p e r i m e n t sa r eg i v e nt oc o m p a r et h e i n f l u e n c eo fd i f f e r e n tr e f e r e n c ec o n d i t i o n s 磷sm e t h o dh a st w oa d v a n t a g e s f i r s t ,b e c a u s et l l es t r u c t u r eo fp r o t e i ni sm o r e c o n s e r v a t i v et h a nt h es e q u e n c eo fa m i n oa c i d s ot h em o r es i m i l a rp r o t e i n si ns t r u c t u r e sa n d f u n c t i o n sc a nb ef o u n dw i t ht h i sm e t h o d f u r t h e r m o r e ,t h em e t h o db a s e do nf u z z ye q u i v a l e n t m a t r i xc a l lg e tt h es i m i l a r i t yo fm a n yp r o t e i n sa tt h es a m et i m e i tc a nb eu s e dt oi m p r o v et h e e 街c i e n c yo fs i m i l a r i t yc o m p a r i s o na n dc l a s s i f i c a t i o n k e y w o r d s :s t r u c t u r a la l p h a b e t ,c g r ,m a i ns t r u c t u r e ,s i m i l a r i t yc o m p a r i s o n ,c u r v e f i t t i n g ,f u z z ye q u i v a l e n tm a t r i x ,t r a n s i t i v ec l o s u r e i l 独创性声明 本人声明所呈交的学位论文是本j , d f - 导师指导下进行的研究工 作及取得的研究成果。尽我所知,除了文中特别加以标注和致谢的地 方外,论文中不包含其他人已经发表或撰写过的研究成果,也不包含 本人为获得江南大学或其它教育机构的学位或证书而使用过的材料。 与我一同工作的同志对本研究所做的任何贡献均已在论文中作了明 确的说明并表示谢意。 签 名:主垒亟一 日 期:塑z :壁:! 竺 关于论文使用授权的说明 本学位论文作者完全了解江南大学有关保留、使用学位论文的规 定:江南大学有权保留并向国家有关部门或机构送交论文的复印件乖 磁盘,允许论文被查阅和借阅,可以将学位论文的全部或部分内容编 入有关数据库进行检索,可以采用影印、缩印或扫描等复制手段保存、 汇编学位论文,并且本人电子文档的内容和纸质论文的内容相一致。 保密的学位论文在解密后也遵守此规定。 签 名: 泠占导师签名: 日 期: 锄 弓 a 一矿8 t 叶 第一章绪论 第一章绪论 1 1 研究的背景、目的及意义 2 0 0 1 年2 月,人类基因组序列图谱公开发表,这意味着后基因时代的到来。人类后 基因组计划由序列基因组学( 或者说结构基因组学) 向功能基因组学转移。生命科学的 研究重心从基因组学( g e n o m i e s ) 转变为蛋白质组学( p r o t e o m i c s ) ,其中心任务是阐明基 因组所表达的真正执行生命活动的全部蛋白质的表达规律和生物功能。 对蛋白质相似性比较和分类的研究属于生物信息学的范畴,生物信息学的一个基本 观点是:分子的结构决定分子的性质和功能。因此,蛋白质的空间结构决定蛋白质的生 物学功能。具有相似结构的两个蛋白质,其氨基酸序列可能相差很大,甚至完全不同。 原因在于,趋同进化作用使得两个不同进化源点出发的蛋白质可以折叠得到相似的空间 结构。因此,需要在结构水平上对蛋白质进行比较以发现具有相似结构的蛋白质。 研究蛋白质的结构意义重大,分析蛋白质结构、功能及其关系是蛋白质组计划中的 一个重要组成部分。研究蛋白质结构,有助于了解蛋白质的作用,这对于生物学、医学 和药学都是非常重要的。对于未知功能或者新发现的蛋白质分子,通过分析蛋白质的结 构,确认功能单位或者结构域,可以为遗传操作提供目标,为设计新的蛋白质或改造已 有的蛋白质提供可靠的依据,同时为新的药物分子设计提供合理的靶分子结构。蛋白质 空间结构的相似性比较作为探明其结构与功能的重要分析手段,对于人类自身而言具有 很大的实用价值和重要的指导意义。 1 2 研究现状及内容 利用计算机技术进行蛋白质三维结构相似性比较已经有二、三十年的历史了,其间 所使用的方法主要包括:( 1 ) r m s d 方法,即将蛋白质作为刚体,对被比较的对象之一进 行空间的旋转和平移,使之与另一被比较的蛋白质获得空间最大的叠置,求其最小的均 方根距离进行比较;( 2 ) 利用蛋白质结构内部氨基酸残基之间的距离的比较方法;( 3 ) 将 蛋白质体分解成各种层次的结构组件如原子、侧链、二级结构和结构域等的比较方法; ( 4 ) 对蛋白质构象属性进行比较的方法;( 5 ) 对蛋白质结构内部各种拓扑连接关系进行比 较的方法等。 1 9 9 9 年,a n k e r s t 等首次利用蛋白质三维结构在空间分布中的形状直方图来获取直 观的相似性度量【1 1 。在其文章中提出了扇形、同心球壳以及网状划分三种空间划分方式, 其中只有同心球壳划分方法满足空间旋转不变性原则,而且作者没有对在同一球壳区域 内统计总量相同而分布的结构不同的情况进行进一步的研究1 2 j 。 为了避免对复杂的三维骨架进行空间的配准操作,早在1 9 8 9 年,t a y l o r 等便将蛋 白质的空间坐标转换成距离矩阵的量化表示【3 】。后来,l i i s a h 等在距离矩阵表示的基础 上提出刚性的和弹性的两种相似度函数,通过设定经验阈值获得相似性判定1 4 j 。 2 0 0 4 年,c h i 等将每一个距离矩阵视为一个纹理图像,借助视觉技术中的图像分割 江南大学硕士学位论文 技术定义一系列纹理图像特征值,用来描述蛋白质局部和全局结构特征【5 】。在同一年, n k r a s n o g o r 和d a p e h a 提出用通用相似矩阵( u s m ) 来测量蛋白质结构的相似性【6 】。 该方法的优点是:u s m 从数学意义上来讲是通用的,也就是说,对任意的矩阵和对象, 只要加一个常量,其所得的结果与用其他矩阵所得的结果是一致的。这就是说,即使没 有足够的构造信息或者对模型的构造还没有达成一致,u s m 都可以作为测量相似性的稳 定的方法。 2 0 0 5 年,z h a n g 等在其文章中指出,一个蛋白质分子的三维结构是由所有原子产生 的力场决定的 7 1 。所以对力场相似性的比较可以反映三维结构的相似性。该文利用模糊 映射将采样到的力场转化为体数据集,然后对体数据集进行重采样,使其具有统一的分 辨率,最后,对数据集进行带通滤波和量化来揭露其物理特性。 2 0 0 6 年,g e l l y 等提出一种新的方法来识别组成蛋白质三维结构的小的紧凑单元或 者说紧凑片段【8 】。其中的片段被称为蛋白质单元( p r o t e i n u n i t ,p u ) 。该方法利用传统的 层次聚类分析,使三维结构产生一系列嵌套的划分。每一步的目的都是为了根据一个标 准将一个蛋白质单元尽可能优化地分为两个或三个子单元,而这一标准就是用来评价新 定义单元的结构独立性的“分区索引 。另外,用一个相关的导出熵r 来综合评价蛋白 质结构的划分。 2 0 0 8 年,l i 等利用完整线性规划方法来推导出序列和结构信息条目的最优结合, 并由此产生了更为准确和简洁的结构字母表,其准确度较先前的方法提高了5 0 。与用 从头计算方法进行蛋白质结构预测的方法相比,利用这些新的结构字母,可以构建更准 确的蛋白质结构例。 1 3 本文研究的主要内容和论文结构 本文主要是在c g r ( c h a o sg a m er e p r e s e n t a t i o n ) 和模糊等价矩阵的理论基础上,对 蛋白质相似性的比较进行多角度地考虑,提出了两种新的研究蛋白质相似性的方法。 本论文一共分为五章: 第一章作为“绪论”,介绍了课题的背景、目的及意义,国内外的研究现状及内容 和本课题研究的主要内容。 第二章介绍多种蛋白质相似性比较的基本思想和理论。 第三章和第四章为本论文的核心部分。 第三章提出了将结构字母表和c g r 游走相结合的方法,实现了蛋白质相似性比较 从空间结构向二维平面的转换,并通过实验验证了该方法的可行性。其中对于相似度的 计算,提出了线性拟合和h a u s d o r f f 距离两种方法,并比较了两种方法的优劣。 第四章针对多个蛋白质的相似性比较,通过分析蛋白质的结构和组成,确定蛋白质 对象比较的约束条件,构建模糊相似矩阵,利用传递闭包方法对蛋白质对象进行比较, 并且通过实验进一步探讨了约束条件的选择对比较结果的影响。 第五章为总结与展望,即对课题的研究工作做了一个概括,并对今后的研究提出一 些想法和思路。 2 第二章蛋白质相似性比较概述 第二章蛋白质相似性比较概述 蛋白质是生物体内占有特殊地位的生物大分子,它是生物体的基本构件,也是生命 活动的重要物质基础,几乎一切生命现象都要通过蛋白质的结构和功能而体现出来。因 此,在分子生物学中,深刻阐明蛋白质的结构和功能,是探索生命奥秘的最基本任务。 作为探讨结构与功能的重要分析手段,蛋白质相似性比较已经成为当前生命科学研究的 重要内容。 蛋白质是由2 0 种不同的氨基酸组成的多肽链所构成的,它可以描述成4 级层次结 构【l o 】。其中,一级结构是指构成多肽链的氨基酸排列顺序,它是一种一维的信息;二级 结构是由相邻连续的若干氨基酸在局部空间折叠形成具有一定规则的片段子结构,如仅 螺旋结构、折叠结构和回折结构;三级结构是指由规则的二级结构进一步折叠形成的 三维空间形状;四级结构是指若干条多肽链相互作用形成稳定的空间结构。一维氨基酸 序列在没有进行空间折叠前是没有功能意义的,二级结构是蛋白质空间结构的基本单 元,它们之间相互作用,形成超二级结构,它是一种从二级向三级结构转化的中间结构, 如a 仅。超二级结构进一步组合形成一定功能的结构域,可看成是最基本的功能实体, 但其尚不具备完整的生物活性,空间自然折叠的三维形状最终决定蛋白质的功能。 对蛋白质的相似性比较可以在序列水平上进行,也可以在结构水平上进行。 2 1 序列水平上的比较 序列比较是生物信息学中最基本、最重要的操作,通过序列比对可以发现生物序列 中的功能、结构和进化的信息。序列比较的根本任务是:通过比较生物分子序列,发现 它们的相似性,找出序列之间共同的区域,同时辨别序列之间的差异。蛋白质的相似性 是多方面的,可能是氨基酸序列的相似,也可能是结构的相似,还可能是功能的相似【1 1 1 。 2 1 1 序列的两两比对 就是对两条序列进行编辑操作,通过对字符进行替换、插入或删除操作,使两条序 列达到相同的长度,并且使序列中相同的字符尽可能一一对应。 在序列的两两比对的过程中,会用到两种操作定义函数:代价函数和得分函数。对 字母表么中的任意字符a 、b ,代价函数的定义为: c ( a ,口) = 0 c ( a ,6 ) = 1( 口6 ) c ( a ,一) = r v ( 一,6 ) = 1 得分函数的定义为: s ( a ,口) = 1 s ( 口,6 ) = 00 6 ) s ( 口,- ) = p ( - ,6 ) = 一1 ( 2 1 ) ( 2 2 ) 进行序列比对时,可根据实际情况选用代价函数或得分函数。另外,在进行序列比 对时,常用到以下三个概念: 3 江南大学硕士学位论文 ( 1 ) 两条序列m 和甩比对的得分( 或代价) 等于将m 转化为n 所用的所有编辑操作的 得分( 或代价) 总和。 ( 2 ) m 和刀的最优比对是所有可能的比对中得分最高( 或代价最小) 的一个比对。 ( 3 ) m 和胛的真实距离应该是在得分函数s 值( 或代价函数c 值) 最优时的距离。 对于蛋白质的得分矩阵主要有: ( 1 ) 等价矩阵 饬= ; 其中,如为得分矩阵元素,天,分别代表字母表中第f 个和第,个字符。 ( 2 ) 遗传密码矩阵g c m g c m 矩阵是通过计算一个氨基酸残基转变到另一个氨基酸残基所需的密码子变化 数目得到的,矩阵元素的值对应于代价。如果变化一个碱基,就可以使一个氨基酸的密 码子改变为另一个氨基酸的密码子,则这两个氨基酸的替换代价为l ;如果需要改变两 个碱基,则替换代价为2 ;以此类推。g c m 矩阵常用于进化距离的计算,其优点是可以 直接利用计算结果来绘制进化树,缺点是在蛋白质序列比对尤其是对于相似性较低的序 列比对中很少被应用。 ( 3 ) 疏水矩阵 疏水矩阵是根据氨基酸残基替换前后疏水性的变化而得到的得分矩阵。若氨基酸替 换进行一次后,疏水特性未发生太大变化,则这种替换得分高,否则替换得分低。 ( 4 ) p a m 矩阵 为了得到得分矩阵,最常用的方法是对自然界中各种氨基酸残基的相互交换率进行 统计。如果两种氨基酸之间频繁地发生替换,那么这一对氨基酸在得分矩阵中的互换得 分就比较高。作为这样一种得分矩阵,p a m 矩阵是第一个广泛使用的最优矩阵。该矩 阵是基于进化原理的,建立在进化的点接受突变模型p a m ( p o i n ta c c e p t e dm u t a t i o n ) 基础 上,通过统计相似序列比对中的各种氨基酸替换发生率而得到的矩阵。 作为一个进化的变异单位,一个p a m 表示1 的氨基酸改变。但这并不意味着经过 1 0 0 次p a m 后,每个氨基酸都发生变化,因为其中一些位置可能会经过多次改变,甚 至可能变回到原先的氨基酸,而有的位置未发生任何变化。一个p a m - n 矩阵元素( i j 3 的值反映两条相距个p a m 单位的序列中第f 种氨基酸替换第,种氨基酸的概率。构 造p a m 1 矩阵的过程如下:首先,构建一个序列间相似度很高的比对。其次,计算每 个氨基酸,的相对突变率朋,。相对突变率就是某种氨基酸被其他任意氨基酸替换的次数。 再次,对每组氨基酸对f 和,计算氨基酸,被氨基酸i 替换的次数。最后,将以上计算 结果取常用对数,便得到了p a m 1 矩阵元素p a m 1 ( i 力。这种矩阵被称作对数几率矩阵, 因为其中的元素是根据每个氨基酸替换率的对数值而得到的。 要得到矩阵p a m - n ,只需将p a m 1 矩阵自乘次即可。可以根据待比较序列的长 度以及序列间的先验相似程度来选用特定的p a m 矩阵,以发现最适合的序列比对。在 比较差异较大的序列时,多数情况下会在较高的p a m 值处得到最佳结果,比如在 4 第二章蛋白质相似性比较概述 p a m 2 0 0 到p a m 2 5 0 之间,而较低值的p a m 矩阵一般用于高度相似的序列。实践中用 的最多的矩阵为p f 蝴2 5 0 。 ( 5 ) b l o s u m 矩阵 b l o s u m 矩阵也是一种氨基酸替换矩阵,同样,它也是通过统计相似蛋白质序列 的替换率而得到的。p a m 矩阵是根据蛋白质序列的全局比对结果推导出来的,而 b l o s u m 矩阵则是根据蛋白质序列块比对而推导出来的。在评估氨基酸替换频率方面, 两者应用的策略不同。b l o s u m 矩阵的优点在于可以通过直接观察而不是通过外推获 得数据。同p a m 矩阵一样,b l o s u m 矩阵也有一系列的矩阵,可以根据亲缘关系的不 同来选择不同的b l o s u m 矩阵进行序列比较。但是,b l o s u m 矩阵阶数的意义与p a m 矩阵正好相反。低阶p a m 矩阵适合用来比较亲缘较近的序列,而低阶b l o s u m 矩阵更 多地是用来比较亲缘较远的序列。 2 1 2 序列的多重比对 与序列的两两比对不同,序列多重比对的目标是发现多条序列的共性。序列的两两 比对主要目的在于建立两条序列的同源关系并且推测它们的结构、功能,而序列的多重 比对则对研究分子结构、功能以及进化关系更为有用。某些在生物学上有重要意义的相 似性只能通过将多个序列对比排列起来才能识别。同样,只有通过多序列比对之后,才 能发现与结构域或功能相关的保守序列片段。在实际研究中,生物学家并不是仅仅分析 单个蛋白质,而是更着重研究蛋白质之间的关系,研究一个家族中的相关蛋白质,研究 相关蛋白质序列中的保守区域,进而分析蛋白质的结构和功能。序列两两比对往往不能 满足上述要求,不能发现多个序列的共性,这时就必须同时比较多条同源序列。 多重序列比对的定义,实际上是两两序列比对的推广。设有颠胗2 ) 个序列:s j ,勋, 观,每个序列由同一个字母表中的字符组成;通过插入操作,使得各序列j j ,观, 的长度一样,从而形成这些序列的多重比对。 利用序列的多重比对,可以得到一个蛋白质序列家族的序列特征。对于一个给定的 新序列,根据所得的序列特征,就可以对该序列是否属于已知的蛋白质家族进行判定。 2 2 结构水平上的比较 蛋白质的结构比序列更加保守,通过比较蛋白质的空间结构,可以发现蛋白质的空 间共性,发现属于同一家族蛋白质的保守结构,发现与蛋白质功能密切相关的结构域, 发现特定的空间结构模式,而这种模式在进行序列分析时无法发现。 比较蛋白质结构实际上是比较两个蛋白质中各个原子的空间位置。基本的方法是首 先针对蛋白质中各个二级结构,检查它们出现的次数、类型及相对位置是否相似,然后 再详细检查c a 碳原子之间的距离,分析这两个结构能以多大的程度重叠在一起。重叠 的部分越多,则两个结构就越相似。如果大部分二级结构能重叠在一起,并且具有相似 的环区排布,那么这两个蛋白质就具有共同折叠模式。在许多结构比较方法中,c a 碳原 子之间的距离是一个重要的参数。更细致地结构比较需要考虑侧链的信息。 江南大学硕士学位论文 2 2 1 利用空间特征分布的比较 蛋白质分子中的组成原子在空间的分布情况决定了蛋白质的三维结构。通过对原子 空间分布的相似性研究,我们可以间接地得到蛋白质三维结构的相似性。这种方法的关 键点在于如何从蛋白质结构中提取出具有空间旋转和平移不变性的特征量。这种特征量 可以是几何的、拓扑的或者是与空间位置无关的其他生物信息量。 目前为止,主要有四种基本的空间划分方法:球体法( 球壳法) ( b a l l ) 、三维网 格法( g r i d ) 、球面映射法( s p h ) 和扇形法( i c o ) 1 1 2 。如图2 1 所示。 o 暑 o 销 g 堙g 50 6 三e ( 1 ) 球体法( 球壳法) ( b a l l ) 该方法是将三维结构按照同心球壳进行分解,这样各部分的体积是按照相同的半径 由小到大递增的,这种分类满足旋转不变性。 ( 2 ) 三维网格法( g r i d ) 该方法是将三维结构的细微部分量化为更小的结构单元实现的。 ( 3 ) 球面映射( s p h ) 该方法是将球面映射到三个方面,即点、线和面。连接从表面到中心的所有点可以 建造对象的三维结构。利用这个方法,可以将三维空问划为不同的区域。靠近中纬线的 部分要大于靠近两极的部分。然而,很明显它是满足标度不变性的。 ( 4 ) 扇形法( i c o ) 该方法是将三维空间按照扇形进行量化,这样每一部分都含有相同的圆面区域。实 验时结合从中心到点的脉络,可以充分利用规则多面体上的点,如十二面体和二十面体。 另外,可以明显地看出该方法满足标度不变性。 基于空间特征分布的比较方法往往计算比较简单,虽然得到的比较结果不是很精 确,但是有助于快速地剔除差异性较大的对象。利用该方法进行相似性比较的同时,若 能结合多组相关性低的特征量,则有助于提高相似度的比较精度。 6 第二章蛋白质相似性比较概述 2 2 2 利用几何特性的比较 几何方法是研究蛋白质结构相似性的又一种方法。p r e i s s n e r 等通过试验表明几乎所 有的长度超过1 0 个原子的等价片段有一个相同的几何构型【1 3 】。因此,几何构型在研究 蛋白质相似性中提供了重要的依据。许多研究者的研究表明,通过几何构型来研究蛋白 质的相似性是非常有希望的。 基于几何特性的比较则从蛋白质空间结构元素的几何位置或者元素之间的距离等 方面对被比较对象的相似性进行研究,在a k b a r 等的文章中,列举了从蛋白质对象中提 取的一些几何特性【1 2 】: ( 1 ) 占有率( f r a c t i o n a lo c c u p a n c y ,f o ) 表示一个分区的原子数n a i 与该划分单元容量场,的比值。 f o t :竽 ( 2 4 ) v p , ( 2 ) 局部伸长求逆( t h ei n v e r s eo fl o c a le l o n g a t i o n ,l e ) 通过对原子点进行主成分分析我们得到了_ j ,a 2 ,a 3 三个由大到小的特征值。局 部伸长的求逆与a ,有关。 三e = 垒( 2 5 ) 五f ( 3 ) 对象的不平整性( o b j e c tb u m p i n e s s ,b p ) 对不平整性的测量用 3 aj 来表示。 础= 孕 ( 2 6 ) , ( 4 ) 脉络( c o r d ,c d ) 将其脉络视为一个从中心到划分区域再现点的向量。设玢为从原点到再现点的向 量,构象的特征由该向量的模来表现。 c o r le i( 2 7 ) 在这里需要考虑的一点就是该选择哪一个再现点。这里有两个选择:最远点和与脉 络相交的一个点。 ( 5 ) 表面曲率( c u ) 设p f 为分区f 内的一个再现点,表面曲率是通过尸f 与分区内的其他相邻点的曲率 计算出的。该曲率可以通过计算p f 与相邻点所构成的角度( 除去最大角度2y r ) 得到。 为了防止丢失信息,可将最大角度2y r 也考虑在内。 c v , = ,q ( 2 8 ) ( 6 ) 重心( c g ) 设为从原点到中值点的一个向量,分区f 的重心特性定义如下: c u r i 吲( 2 9 ) 利用几何特性进行蛋白质相似性比较的方法大体分为三种: ( 1 ) 三维骨架直接配准的方法 利用蛋白质比较对象的三维骨架在空间可配准的程度来度量两者的相似性。具体方 7 江南大学硕士学位论文 法如下:首先,选定一个蛋白质对象作为参照标准,然后将另一个蛋白质对象的骨架坐 标进行刚性的平移和旋转,采用最小平方拟合的方法,以实现其整体结构最大程度地叠 置到另一个蛋白质骨架上的目的,如图2 2 。假设两个蛋白质对象为尸和q ,其骨架坐 标分别由连续的三维坐标点决定,其中,p = - ( p l ,p 2 ,胁) ,妒( q l ,q z ,g 疗) , 对p 进行变换乃使得p 与q 的均方根差最小。这种方法就是r m s d 方法。 图2 - 2 两蛋白质对象的结构配准 f i g 2 - 2s t r u c t u r em a t c h i n go ft w op r o t e i n s ( 2 1 0 ) 根据r m s d 的计算结果来完成对蛋白质对象相似性的判定。如果求得的偏差值为0 , 则被比较的两个蛋白质的结构是完全相同的;如果偏差值较小,则认为两个蛋白质的结 构是相似的。 r m s d 方法虽然是最早提出并且一直沿用至今的方法,但也有它的局限性【1 5 1 ,表现 在: 首先,r m s d 的计算结果受被比较对象分子大小尺寸的影响,对于不同分子之间的 比较,偏差值相同并不一定意味着相似度也相同。 其次,在比较过程中需要对所有的原子进行一对一的比较,计算量极大,而且为了 减少比较的搜索空间,在计算r m s d 时需采取优化手段。 最后,如果两个蛋白质对象结构的某一部分区域相差较大时,所得结果往往受这些 不相似的局部结构所控制,从而掩盖了其他相似的部分,使得比较结果与实际情况产生 较大的偏差。 ( 2 ) 利用距离矩阵的方法 为了避免对复杂的三维空间骨架进行结构配准,t a y l o r 等将蛋白质的空间坐标转换 成距离矩阵的量化表示。假设某一个蛋白质分子兄其三维结构的距离矩阵是由组成该 蛋白质链上所有骨架原子c a 之间的距离所构成的一个方阵,记为矿,其中第f 行、第 歹列的元素l y o 表示第f 个c 仅原子到第个c 仅原子之间的距离。两个蛋白质分子a 和b 的匹配程度可以用一个相似度计分公式来判定。 ,工 s = f ( i ,) ( 2 1 1 ) 8 第二章蛋白质相似性比较概述 其中,f 和,是匹配氨基酸残基的序号;工是要匹配结构的长度;f ( 厶,) 是相似度 度量函数。 同样是基于距离矩阵的表示,l i i s a h 等又提出刚性的和弹性的两种相似度函数,并 通过设定经验阈值来实现对蛋白质对象相似性的判定。 而c h o i 等则将蛋白质结构的距离矩阵划分成许多有重叠元素的子矩阵【1 6 】,每一个 子矩阵代表一个蛋白质空间结构的局部特征,比如仅螺旋结构、折叠结构转角和回折 等二级结构。从大量的蛋白质距离矩阵中提取具有代表性的局部特征的子矩阵集合作为 典型范式,对其进行聚类分析并获得k 类局部特征的集合,这样就可以将任何一个蛋白 质结构抽象成k 维欧氏空间的特征点,同时求得发生k 类局部特征的频率( 1 0 c a lf e a t u r e f r e q u e n c y ,l f f ) 。将所要进行相似性比较的每一个蛋白质的距离矩阵在进行相似性比较 之前先转换成l f f ,然后通过计算l f f 之间的距离来获得蛋白质对象相似性的判定。 利用视觉技术中的图像分割技术,c h i 等将每一个距离矩阵视作一个纹理图像,通 过定义一系列纹理图像特征值,来描述蛋白质局部和全局的结构特征;另外,为了利用 索引技术加快蛋白质结构的相似性查询,他们还将蛋白质的距离矩阵表示转换成多维图 像特征矢量。 作为三维结构的一种二维表示,蛋白质的距离矩阵与空间坐标标架无关,除了蛋白 质结构的手性之外,它蕴涵了可以重构三维结构的足够信息。因此,基于距离矩阵表示 的相似性比较方法有实际的生物学意义。 ( 3 ) 利用空间曲线近似表示的方法。 v l a d i m i r 等将蛋白质的g 骨架近似为空间的连续曲线,从曲线上提取g 骨架原子 所在点处的形状特征u 7 】,如曲率等空间旋转、平移不变量,通过对这些形状特征量的偏 离程度的分析来判定被比较对象是否具有相似性。 2 2 3 基于拓扑的比较 d a v i d 等通过实验分析发现:蛋白质结构的拓扑比较可以较好地解决几何比较方法 中由于蛋白质结构内部频繁的原子动态性而引起的问题【l 引。使用几何方法进行比较时, 一些蛋白质功能方面的相似性可能无法得到,而使用拓扑比较则可能捕捉到该方面的相 似性。基于拓扑的比较方法主要分为以下3 类【l5 】: ( 1 ) 基于g r a p h ( 图形) 的比较 该方法的基本思路是:将所考虑对象抽象为具有一定属性的顶点集合( 功和连接这些 顶点之间关系的边的集合( 目,被分析对象中具有一定生物学语义、粒度大小不同的子结 构都可以作为顶点。用僻( n 目来构建蛋白质三维拓扑结构时,用于比较的g r a p h 顶 点单元可以是组成原子、氨基酸、侧链、二级结构等空间三维结构的子结构,借助于顶 点与顶点之间的关联边反映蛋白质结构内部各种组成单元之间的作用关系。可以通过 g r a p h 的同构分析来确定蛋白质结构之间的相似性,通过分析g r a p h 对应的关联矩阵和 对应的拉普拉斯矩阵,可以获得蛋白质结构图之间所包含的不变量特征以及拓扑一致的 聚类信息,并揭示出蛋白质结构中的多种结构模式,最终得到蛋白质空间结构之间可能 存在的相似性。 9 江南大学硕士学位论文 ( 2 ) 基于t o p s ( 拓扑) 图的比较 作为一种用来描述蛋白质空间拓扑结构的形式化符号图,t o p s 图用三角形符号代 表夕片,圆形符号代表玟螺旋,箭头表示二级结构从n 至c 端在空间伸展的方向。利 用一个三元组将其描述成( e ,日,c ) ,其中e 是一个由二级结构组成的序列,日和c 是这些二级结构所组成序列之间的氢键和手性的属性。g i l b e r t 1 9 等采用模式匹配技术从 t o p s 图获得超二级结构的模式,从而获得结构域信息。通过对结构域信息的进一步分 析,可以得到蛋白质结构的相似性。 ( 3 ) 基于v o r o n o i 图的比较 在分析点集的空间分布时,v o r o n o i 图起着重要的作用,p o u p o n a n n e 2 0 j 利用v o r o n o i 图来分析蛋白质结构问题。其主要思想是将蛋白质的组成成分,如原子或氨基酸在空间 的位置看成是三维空间中的点,其所构成的三维点集可构建成v o r o n o i 图的蛋白质三维 结构模型。即使三维构型非常复杂的蛋白质,v o r o n o i 图也可以表现,但是所构建的 v o r o n o i 图受三维点集的位置的影响非常大。要克服这一问题,就需要设定一个与经验 值有关的偏移量,以限定构成的v o r o n o i 图。 2 3 本章小结 由于蛋白质结构的多样性和复杂性,在对蛋白质空间结构的相似性进行比较的过程 中,有许多因素都会影响到最终的比较结果。如:在比较中可能会对数据进行不同程度 的简化与近似;采用不同的记分函数对相似性进行度量;相似性判定中经常会出现一些 与带有经验值有关的阈值设定。而大量的实验也表明:用不同的方法对相同的数据对象 进行相似性判定时,所得的结果并不一样。各种方法各有自己的优势,也存在自身的缺 陷,在利用的时候,需要对多种方法有一个整体的认识和了解,以便更好的完成对蛋白 质对象相似性的判定。 l o 第三章基于c g r 和结构字母表的蛋白质相似性比较 第三章基于c 6 r , i a 结构字母表的蛋白质相似性比较 现有的绝大多数有关蛋白质相似性比较的算法都是围绕序列比对和结构比对。通过 序列比较,可以发现相似的蛋白质,发现氨基酸序列的保守模式。而蛋白质的结构比序 列更加保守,通过比较蛋白质的空间结构,可以发现蛋白质的结构共性,发现属于同一 家族蛋白质的保守结构,发现与蛋白质功能密切相关的结构域,发现特定的空间结构模 式,而这种模式在进行序列分析时却无法发现。 结构字母表的出现,将蛋白质的三维结构转换为编码空间中的字符串序列,从而使 三维空间中的结构模式转换为编码空间中的序列模式,这就为运用c g r 游走技术来研 究蛋白质三维空间结构的相似性提供了可能。 3 1 结构字母表 二级结构作为最被人们熟知的局部结构构型,有关于二级结构的字母表自然是最为 常见的。在该部分中,列举了几种常用的二级结构字母表。另外,还将介绍到( 伊,奶角 字母表、超二级结构字母表以及骨架片段字母表1 2 。其中,骨架片段字母表不像其他字 母表一样( 为每一个单独的残基设计一个结构字母) ,它是为一个含有多个连续残基的片 段进行字母设计。 3 1 1 二级结构字母表 d s s p 是最有名并且是应用最广泛的结构字母表。k a b s c h 和s a n d e r 根据氢键的类型 将蛋白质的二级结构分为八类【2 2 l 。该方法定义了一个基于n - t u r n s 的层次结构特性,其 中的氢键是第f 个残基的c o 与第计刀个( 萨3 ,4 ,5 ) 残基的n h 形成的。该特性包括 a 螺旋、折叠、无规则的螺旋扭曲和凸起以及无规则卷曲。表3 1 列出了d s s p 对二 级结构所做的分类情况,其中的三种螺旋是根据氢键的类型来区分的t ( 1 ) 坟螺旋其氢键是第f 个残基的c o 和第州个残基的n h 形成的。 ( 2 ) 3 1 0 螺旋其氢键是第f 个残基的c o 和第件3 个残基的n h 形成的。 ( 3 ) 7 【螺旋其氢键是第f 个残基的c o 和第件5 个残基的n h 形成的。 表3 - 1 最初由k a b s c h 和s a n d e r 设计的八字母二级结构字母表 t a b 3 - 1t h eo r i g i n a le i g h t l e t t e ri ) s s ps e c o n d a r ys t r u c t u r ea l p h a b e td e v e l o p e db yk a b s c h a n ds a n d c r l e t t e rn a m e b e t as t r a n d a l p h ah e l i x t u r n b e n d 3 1 0 h e l i x s h o r tb e t ab r i d g e p i h e l i x r a n d o mc o i l 最初的s t r i d e 字母表由7 个字母组成,如表3 2 。由于i ( p ih e l i x ) 结构数量过少 不易被预测而且对预测结果影响很小,r a c h e l 将字母i ( p ih e l i x ) 并入h ( a l p h ah e l i x ) 中,得到了一个6 字母的字母表。 江南大学硕士学位论文 表3 2 最初由f r is h m a n 和a r g o s 设计的s t r i d e 二级结构字母表 t a b 3 2t h eo r i g i n a ls e v e n l e t t e rs t r i d es e c o n d a r ys t r u c t u r ea l p h a b e td e v e l o p e db y f r is h m a na n da r g o s l e t t e rn a m e b e t as t r a n d a l p h ah e l i x t u m 3 1 0h e l i x s h o r tb e t ab r i d g e p i h e l i x r a n d o mc o i l d s s p e h l 和s t r i d e e h l 这两种字母表是在d s s p 和s t r i d e 的基础上导出的, 两个字母表一样都含有3 个字母,即 e ,h ,l 。三个字母分别代表螺旋、折叠和卷曲 三种结构状态。在实际映射中,该字母表将d s s p 中的g ( 3 - 1 0h e l i x ) 划归为螺旋类, 将b ( s h o r tb e t ab r i d g e ) 划归为折叠类,将s ( b e n d ) 和t ( t u r n ) 划归为卷曲类。 k i n g 和j o h n s o n 开发了一个用于模仿生物化学家利用圆二色谱( c i r c u l a rd i c h r o i s m , c d ) 数据库来进行二级结构分配的系统【2 3 l 。他们观测发现:利用羰基( c o ) 的方向和 羰基( c o ) 与氨基( n h ) 间的氢键距离可以识别圆二色谱数据库中的二级结构。3 1 螺旋可以利用羰基方向和键角t a u 进行识别。它们的二级结构分配基于两个角和三个 键长,即二面角z e t a ,键角t a u ,如图3 1 、3 2 ,从o ( f ) 到n ( 什3 ) (
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026重庆某国有企业外包岗位(项目主任)招聘1人笔试题库附完整答案详解(全优)
- 2026年滁州凤阳县教师进修学校公开选调工作人员6名模拟试卷【黄金题型】附答案详解
- 2026江苏无锡江阴港发国际物流有限公司招聘工作人员14人考前冲刺密卷及参考答案详解(满分必刷)
- 2026中国医学科学院阜外医院心外科医师招聘模拟试卷及参考答案详解【能力提升】
- 2026年哈尔滨商业大学公开招聘科研助理、管理助理、教学助理岗位人员7人考前冲刺试卷附参考答案详解【培优B卷】
- 2026浙江舟山市普陀区沈家门街道社区卫生服务中心编外招聘1人(影像技师)模拟试卷含答案详解(A卷)
- (2026年)海产品购销合同
- 2026年节水政策解读 企业节水设备补贴申请
- 2025-2026学年四川省成都市郫都区四下数学期末学业质量监测模拟试题含解析
- 射线防护安全培训心得
- 安全仪表系统(sis)管理制度
- 灌排泵站运行工操作规程竞赛考核试卷含答案
- 勘察单位考核制度
- 脑介入手术风险告知书样本
- SA8000-2026社会责任管理体系全套管理手册及程序文件
- 金属冶炼安全员培训课程课件
- 教师风险管理办法
- 深度学习 课件 第2章 卷积神经网络
- 外墙保温装饰一体板施工方案
- 云南省公路工程试验检测费用指导价
- 签约仪式策划方案大型签约仪式流程方案
评论
0/150
提交评论