(计算机软件与理论专业论文)基于机器学习的蛋白质折叠模式预测研究.pdf_第1页
(计算机软件与理论专业论文)基于机器学习的蛋白质折叠模式预测研究.pdf_第2页
(计算机软件与理论专业论文)基于机器学习的蛋白质折叠模式预测研究.pdf_第3页
(计算机软件与理论专业论文)基于机器学习的蛋白质折叠模式预测研究.pdf_第4页
(计算机软件与理论专业论文)基于机器学习的蛋白质折叠模式预测研究.pdf_第5页
已阅读5页,还剩62页未读, 继续免费阅读

(计算机软件与理论专业论文)基于机器学习的蛋白质折叠模式预测研究.pdf.pdf 免费下载

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

r r 一 苏州大学学位论文使用授权声明 1 1 1 11 1 11 1 1 1i ii iil llu l y 17 3 2 0 9 5 本人完全了解苏州大学关于收集、保存和使用学位论文的规定, 即:学位论文著作权归属苏州大学。本学位论文电子文档的内容和纸 质论文的内容相一致。苏州大学有权向国家图书馆、中国社科院文献 信息情报中心、中国科学技术信息研究所( 含万方数据电子出版社) 、 中国学术期刊( 光盘版) 电子杂志社送交本学位论文的复印件和电子 文档,允许论文被查阅和借阅,可以采用影印、缩印或其他复制手段 保存和汇编学位论文,可以将学位论文的全部或部分内容编入有关数 据库进行检索。 涉密论文口 本学位论文属 在年一月解密后适用本规定。 非涉密论文口 论文作者签名: 导师签名: 基于机器学习的蛋白质折叠模式预测研究摘要 基于机器学习的蛋白质折叠模式预测研究 摘要 蛋白质的三维结构决定其生物功能,折叠模式是蛋白质空间拓扑的一种分类表 达。自然界中的蛋白质结构约十多万种而折叠模式的总数约一千多种。因此,蛋白质 折叠模式预测研究具有重要的科学意义和应用价值。 s c o p 数据库是人工分类的蛋白质结构分类数据库。本文对s c o p 数据库中蛋白 质的折叠模式进行解读,分析研究氨基酸串属性与折叠模式的关系,并构造分类器对 氨基酸串的折叠模式进行预测。 首先,从s c o p 数据库中构造了两种训练集,对训练集的氨基酸串根据生化知识 分析抽取相关属性,如氨基酸串的折叠模式、长度、频率、疏水等。构造相应的s v m 分 类器,对一系列折叠预测的开放测试集进行测试,并对预测结果进行分析。 面向从头预测问题对训练集重新提取属性,完整地保留氨基酸串属性,分别构造 了s v m 分类器和贝叶斯分类器,对测试集进行预测,并分析预测结果的有用性。然 后将折叠预测的结果应用于从头预测中,为从头预测提供良好的片段库,以提高从头 预测的精度。 本文详细的实验结果表明,测试集折叠模式的预测准确率最高可达至1 j 8 4 6 1 5 4 , 基于机器学习的折叠模式预测能够为从头预测提供有价值的支持。 关键词:蛋白质折叠模式预测;s v m ;贝叶斯;从头预测 作者:郭海娟 指导教o i l i - 吕强 a s t u d yo np r e d i c t i o no fp r o t e i nf o l db a s e d o nm a c h i n e l e a r n i n g a b s t r a c t 3 dp r o t e i ns t r u c t u r ed e t e r m i n e si t sb i o l o g i c a lf u n c t i o n p r o t e i nf o l dp a t t e r ni sar e p - r e s e n t a t i o no ft o p o l o g yo fp r o t e i ns t r u c t u r e s t h e r ea r ea b o u tm o r et h a n1 0 0 ,0 0 0p r o t e i n s t r u c t u r e si nn a t u r ew h i l et h en u m b e ro ft y p e so fp r o t e i nf o l d si so n l yo v e r1 0 0 0 t h e r e f o r e , p r e d i c t i o no fp r o t e i nf o l di sas i g n i f i c a n ts c i e n t i f i ct a s ka n d v a l u a b l ef o rp o t e n t i a la p p l i c a - t i o n s s c o pi sa m a n u a l l y - c l a s s i f i e dd a t a b a s ef o rp r o t e i nf o l d s i nt h i st h e s i s ,t h ei n f o r m a t i o n a b o u tt h ep r o t e i nf o l d si ns c o pa l es t u d i e d ,a n dt h er e l a t i o n s h i pb e t w e e na m i n oa c i d sp r o p - e r t i e sa n df 0 l d sa t ea n a l y z e d g i v e na m i n oa c i ds e q u e n c es o m ec l a s s i f i e r sf o rp r e d i c t i o no f p r o t e i nf o l da l ed e v e l o p e d t w ot r a i n i n gs e t sa r ec o l l e c t e df r o ms c o pd a t a b a s e b a s e do nt h eb i o c h e m i c a lk n o w l e d g ea b o u tt h ea m i n oa c i d ,a t t r i b u t e sa l ee x t r a c t e df r o mt h et r a i n i n gs e t s ,s u c ha st h ef o l d i n g p a t t e r n ,l e n g t h ,f r e q u e n c ya n dh y d r o p h o b i cp r o p e r t i e so ft h ea m i n oa c i ds e q u e n c e t h e c o r r e s p o n d i n gs v m c l a s s i f i e r sa l ec o n s t r u c t e d , a n dr i g o r o u so p e nt e s t sa l ec o n d u c t e df o r e v a l u a t i n gt h ep e r f o r m a n c eo ft h ec l a s s i f i e r s t h ep r e d i c t i o nr e s u l t sa l ef u r t h e ri n t e r p r e t e d i nt e r m so ft h et o p o l o g yi n f o r m a t i o no ft h ep r e d i c t e dp r o t e i ns t r u c t u r e s o r i e n t e df o rt h ed en o v op r e d i c t i o np r o b l e m ,t h ec o m p l e t ei n f o r m a t i o no fa m i n oa c i d s e q u e n c ei sr e s e r v e da st h ea t t r i b u t e sf o rt r a i n i n gc l a s s i f i e r s b a y e s i a nc l a s s i f i e r sa l ee m p l o y e dt op r e d i c t p r o t e i nf o l d b o t hs v m a n db nc l a s s i f i e r sa l eu s e dt og e tac o n s i s t e n t p r e d i c t i o nr e s u l t s f o l dp r e d i c t i o nr e s u l t sa l ea p p l i e dt og e n e r a t eaf r a g m e n tl i b r a r yw i t h g o o dq u a l i t yf o rd en o v op r e d i c t i o no fp r o t e i ns t r u c t u r e w i t ht h eh e l po ff o l dp r e d i c t i o n , t h ea c c u r a c yo ft h ed en o v op r e d i c t i o ni si m p r o v e d t h ee x p e r i m e n t a lr e s u l t sp r e s e n t e di nt h i st h e s i ss h o wt h a tt h ep r e d i c t i o na c c u r a c yi n o u ro p e nt e s t i n gs e t sc a nr e a c h8 4 615 4 i nt h eb e s tc a s e ,a n df o l dp r e d i c t i o nb a s e do n m a c h i n el e a r n i n gc a np r o v i d ev a l u a b l ee n h a n c e m e n tt od en o v op r e d i c t i o n k e y w o r d s :p r o t e i nf o l dp r e d i c t i o n ;s v m ;b a y e s i a nc l a s s i f i e r ;d en o v op r e d i c t i o n i i i w r i t t e nb y :h a i j u a ng u o a b s t r a c tas t u d yo np r e d i c t i o n o fp r o t e i nf o l db a s e do nm a c h i n e 堡垒婴! 望曼 i v s u p e r v i s e db y :q i a n gl t i 基于机器学习的蛋白质折叠模式预测研究目录 第一章 1 1 1 2 1 3 1 4 1 5 第二章 2 1 2 2 2 3 2 4 2 5 第三章 3 1 3 2 目录 a i 一 ,l 菌 课题背景 研究现状 课题内容 课题意义 本文的组织结构 蛋白质折叠模式预测概述 引言 蛋白质折叠模式的描述 常用的蛋白质数据库 2 3 1s c o p 数据库 2 3 2c a t h 数据库 2 3 3p d b 数据库 蛋白质折叠模式预测方法概述 2 4 1 序列比较 2 4 2n n 方法 2 4 3p r o f i l e 方法 2 4 4s v m 分类器 2 4 5贝叶斯分类器 本章小结 基于s v m 的折叠模式预测方法 引言 数据集构造 3 2 1 训练集构造 3 2 2 特征提取 1 l 3 4 5 5 7 7 7 8 8 9 o 0 1 2 2 3 4 6 7 7 7 8 8_t_i_l_i_,l_ 目录基于机器学习的蛋白质折叠模式预测研究 3 3 3 4 3 5 第四章 4 1 4 2 4 3 4 4 4 5 4 6 4 7 3 2 3开放测试集构造1 9 s v m 的训练1 9 结果与分析2 0 3 4 1s v m r a n s c o p e r 的预测结果2 0 3 4 2s v m u n i s c o p e r 的预测结果2 3 3 4 3结果分析2 5 本章小结2 8 应用于从头预测的折叠模式预测方法2 9 面向从头预测的特征抽取2 9 s v m u n i s c o p e r s 的预测结果2 9 n b n u n i s c o p e r s 的预测结果3 l 4 3 1数据集来源3 2 4 3 2n a i v eb a y e s 设计3 2 4 3 3实验结果3 2 t a n u n i s c o p e r s 的预测结果3 2 4 4 1t a nb a y e s 设计3 2 4 4 2 实验结果3 3 x u n i s c o p e r s 预测结果分析3 3 折叠模式预测结果用于从头预测3 6 4 6 1从头预测概述3 6 4 6 2r o s e t t a 3 7 4 6 3 并行蚁群骨架预测算法p a c b a c k b o n e 3 7 4 6 4从折叠模式预测结果生成片段库3 8 4 6 5基于折叠模式预测的从头预测实验结果4 0 本章小结4 l 第五章总结与展望- 4 3 5 1 工作总结4 3 5 2 工作展望4 3 参考文献4 5 基于机器学习的蛋白质折叠模式预测研究目录 发表文章目录及参与项目4 9 致访| 5 1 基于机器学习的蛋白质折叠模式预测研究插图 插图 2 1 蛋白质的结构层次7 2 2 蛋白质的二级结构8 2 3s c o p 折叠模式与c a t h 蛋白质拓扑的数量逐年增长图1 1 2 4 神经网络示意图1 2 2 5n a i v eb a y e s m 络结构1 5 2 6t a nb a y e s 网络结构1 6 3 1 k i m 0 9 i i i 中l h z 6 在s c o p 中的折叠模式( 左图) 和s v m r a n s c o p e r 、s v m u n i s c o p e r 预测出的代表性折叠模式( 右图) 2 7 3 2k i m 0 9 i i 中l c c 8 在s c o p 中的折叠模式( 左图) 和s v m r a n s c o p e 预测出 的代表性折叠模式( 中图) 、s v m u n i s c o p e r - 预测出的代表性折叠模 式( 右图) 2 7 3 3 b r a d 0 5 中l d i 2 在s c o p 中的折叠模式( 左图) 和s v m r a n s c o p e r 预测出 的代表性折叠模式( 中图) 、s v m u n i s c o p e r - 预测出的代表性折叠模 式( 右图) 2 7 3 4w u 0 7 i i i 中l o f 9 在s c o p 中的折叠模式( 左图) 和s v m r a n s c o p e r 、s v m u n i s c o p e r 预测出的代表性折叠模式( 右图) 2 8 3 5c a s p 8 f m 中3 d e e 天然结构( 左图) 和s v m r a n s c o p e r - 预测出的代表性 折叠模式( 中图) 、s v m u n i s c o p e r 预测出的代表性折叠模式( 右图) 2 8 4 1 k i m 0 9 i i i 中l h z 6 在s c o p 中的折叠模式( 左图) 和s v m u n i s c o p e r s 预测 出的代表性折叠模式( 右图) 3 4 4 2 k i m 0 9 i i 中l b m 8 在s c o p 中的折叠模式( 左图) 和s v m u n i s c o p e r s 预测 出的代表性折叠模式( 右图) 3 5 4 3 c a s p 8 f m 中3 d o a 在s c o p 中的折叠模式( 左图) 和s v m u n i s c o p e r s 预测 出的代表性折叠模式( 右图) 3 5 4 4 从头预测的算法p a c b a c k b o n e 3 8 4 5 折叠模式预测结果应用于从头预测的算法3 9 目录 基于机器学习的蛋白质折叠模式预测研究 4 6 使用“2 0 0 6 的v a u 预测l a 6 8 的结构与天然结构比对图( 左图) 和使 用“同f o l d 的v a l l 预测l a 6 8 的结构与天然结构的比对图( 右图) 4 l 基于机器学习的蛋白质折叠模式预测研究 表 格 表格 2 1s c o p 数据库中的折叠模式分类9 3 1s v m r a n s c o p e r 对b r a d 0 5 和w u 0 7 i i i 的测试结果- 2 l 3 2s v m r a n s c o p e r 对k i m 0 9 i i 和k i m 0 9 i i i 的测试结果2 2 3 3s v m r a n s c o p e r 对c a s p 8 f m 的测试结果2 3 3 4s v m u n i s c o p e r 对b r a d 0 5 和w u 0 7 i i i 的测试结果2 4 3 5 s v m u n i s c o p e r 对l ( i m 0 9 i i 和l ( i m 0 9 i i i 的测试结果2 5 3 6s v m u n i s c o p e r 对c a s p 8 f m 的测试结果2 5 4 1s v m u n i s c o p e r s 对k i m 0 9 i i 和k i m 0 9 i i i 的测试结果3 0 4 2s v m u n i s c o p e r s 对c a s p 8 f m 的测试结果3 1 4 3n b n u n i s c o p e r s 对k i m 0 9 i i 和k i m 0 9 i i i 的测试结果3 3 4 4t a n u n i s c o p e r s 对k i m 0 9 i i 和k i m 0 9 i i i 的测试结果3 4 4 5 折叠模式预测结果用于从头预测的实验结果4 0 基于机器学习的蛋白质折叠模式预测研究第一章引言 1 1 课题背景 第一章引言 生物信息学是近年来最有活力的生物学研究领域之一,人们从生物信息的研究 中获得了对生命本质更丰富的知识和理解。蛋白质( p r o t e i n ) 是生命的物质基础,没 有蛋白质就没有生命。因此,它是与生命及与各种形式的生命活动紧密联系在一起的 物质。机体中的每一个细胞和所有重要组成部分都有蛋白质参与,蛋白质执行着生物 体内各种重要的功能。蛋白质构成人体的每个组织,如:皮肤、骨骼、肌肉、内脏、神 经、大脑、血液、内分泌等;蛋白质构成人体必需的催化和调节功能的各种酶,保证 体内的生化反应正常进行;蛋白质维持肌体正常的新陈代谢和各类物质在体内的输 送;蛋白质帮助凝血和伤口愈合;蛋白质是制造抗体的唯一来源,增加免疫力抵抗感 染;蛋白质调节体内水份平衡,维持身体各种机能。所有的蛋白质都是由2 0 种氨基酸 排列组合而成,按照组成的比例和排列顺序的不同,人体中的蛋白质可达数1 0 万种。 它们的结构、功能干差万别,形成了生命的多样性和复杂性。虽然蛋白质由氨基酸的 线性序列组成,但是它们只有折叠成特定的空间结构时才具有相应的活性和相应的 生物学功能。了解蛋白质的空间结构不仅有利于认识氨基酸残基序列与空间结构的 关系,还有利于认识蛋白质的结构与其生物学的关系。确定蛋白质的结构对于生物学 研究是非常重要的。 目前,蛋白质序列数据库中的数据累积速度非常快,但是已知结构的蛋白质数量 却相对较少。尽管蛋白质结构预测技术有了较大进展,但通过实验确定蛋白质结构的 方法仍然非常复杂,而且代价较高,因此实验预测的蛋白质结构比已知的蛋白质序列 要少得多。另一方面,随着d n a 测序技术的发展,人类基因组及更多的模式生物基因 组已被或将被完全测序,d n a 序列数量将会急增,而由于d n a 序列分析技术和基因 识别方法的进步,可以从d n a 推导出大量的蛋白质序列。这意味着已知序列的蛋白质 数量和已测定结构的蛋白质数量( 如蛋白质结构数据库p d b 【l 】中的数据) 的差距将 会越来越大。因此迫切需要能够直接由蛋白质的氨基酸序列出发进行高级结构预测 的计算方法。另一方面由于对一定氨基酸序列的多肽链折叠形成特定空间结构的机 制尚不清楚,虽然已经发展了许多计算方法预测蛋白质结构,并取得了一定的成功, 但总体来说仍是一个尚未解决的难题。深入了解蛋白质结构,首先可以帮助我们了解 蛋白质的折叠机理;其次,有助于我们了解蛋白质功能和结构之间的关系;最后它是 设计和改造药物结构的一个重要基础。因此,了解蛋白质三维结构具有重要意义。 第一章引言 基于机器学习的蛋白质折叠模式预测研究 为了缩小已知序列的蛋白质数量和已测定结构的蛋白质数量之间的差距,就需 要改进现有的蛋白质结构预测方法,或者发展新的理论分析方法。2 0 世纪6 0 年代后 期,a n f i n s e n 【2 】首先发现去折叠蛋白质( 变性蛋白质) 在允许重新折叠的实验条件下 可以重新折叠到原来的结构,这种天然结构对于蛋白质行使生物功能具有重要作用, 蛋白质只有在折叠成天然结构时才能具有完全的生物活性。因此a n f i n s e n 提出了蛋白 质折叠的信息隐含在蛋白质的一级结构中的观点。基于这种观点,通过对蛋白质一级 结构的研究,发现蛋白质折叠密码后能够仅通过一级结构信息就可以预测其空间结 构。 目前为止,对蛋白质结构预测进行了大量研究,已尝试了许多蛋白质结构预测的 方法,并取得了一些进展。蛋白质结构预测方法主要有两大类。一类是蛋白质分子特 性的理论分析方法,通过理论计算( 如分子力学、分子动力学计算) 进行结构预测。 这类方法假设折叠后的蛋白质能量最低。从原则上来说,人们可以根据物理、化学原 理,通过计算来进行结构预测。但是这种方法可操作性很差,主要有以下几个原因: 1 蛋白质可能的构象空间庞大,针对蛋白质折叠的计算量非常大; 2 天然蛋白质的结构和未折叠的蛋白质结构之间的能量差非常小; 3 计算模型中蛋白质及溶剂系统的立场参数的不准确性,无法证明蛋白质分子 的构象是全局自由能最小的构象。 另一类预测蛋白质结构的方法是统计学方法。这类方法对已知空间结构的蛋白 质进行统计分析,根据已知空间结构蛋白质的序列信息构建模型,然后根据得到的模 型对未知结构蛋白质的氨基酸序列预测其空间结构。这是进行蛋白质结构预测较为 成功的一类方法。这类方法包括结构规律提取方法、同源建模方法、经验性方法等。 蛋白质结构预测理论已经发展了很多年,通过对已知空间结构蛋白质分子的研 究和分析发现,尽管一条多肽链折叠成空间构象的数目是相当大的,但是在蛋白质分 子中由三级结构组装而形成的一定空间结构的方式却是有限的。蛋白质二级结构是 这种组装的基本单位,蛋白质二级结构预测和由二级结构构成的折叠模式预测就成 了解决由蛋白质的一级结构序列来预测其空间结构这一问题的关键步骤。 蛋白质的折叠模式反映了一个蛋白质核心结构的拓扑结构模式,包括蛋白质分 子空间结构的三个主要方面:二级结构单元、二级结构单元的相对排布位置以及蛋白 质多肽链的整个路由关系( 即肽链走向) 【3 】。一般认为蛋白质的折叠模式只有数百 到数千种【4 】,远小于蛋白质所具有的自由度数。折叠所潜藏的物理的简单性使我们 预期:折叠速率和机制看上去在很大程度由天然态的拓扑所决定【5 】。折叠模式的折 叠核心有确定的结构特征,将蛋白质折叠模式的特征信息收集起来,建成折叠模式数 据集,为蛋白质折叠预测和蛋白质结构预测奠定基础。 2 基于机器学习的蛋白质折叠模式预测研究第一章引言 s c o p 【6 】数据库和c a t h 【7 】数据库是蛋白质最主要的结构分类数据库,它们分 别从进化关系和结构相似性角度对结构域进行层次化的分类,将蛋白质的结构分 为四种不同的层次,为折叠模式预测提供大量优质的数据源。本文将在后续章节 对s c o p 数据库和c a t h 数据库做详细介绍。 1 2 研究现状 蛋白质结构预测理论已经发展了几十年,但预测结果依然不能与蛋白质结构数 据库( p d b ) 中收集的通过生化实验手段获得的结果相比较。目前蛋白质结构的实 验测量方法主要包含两类:x 射线衍射技术和核磁共振方法。而实际上,利用这两种 方法精确的预测蛋白质的三级结构是相当昂贵的。所以另外有方法对蛋白质粗粒化 的空间结构进行分类和预测。相关的工作主要集中在蛋白质结构型( - - k 种左右) 识 别、框架结构( 十几种) 预测、蛋白质折叠模式数目的估计和分布上,这样就可以补 充p d b 数据库。 蛋白质折叠预测计算方法的核心问题是明晰残基序列与蛋白质三维结构之间 有机的、必然的联系和挖掘蕴涵在残基序列中的结构信息。可以想象,由于构成合 理长度蛋白质一级序列的2 0 种氨基酸序列之间的组合是一个极大的数字,而蛋白 质的折叠模式仅为一千多种的话,那么序列构成这些折叠模式的方式一定遵循某 种规律。到目前为止人们已经尝试了几种方法来探索这些规律。这些方法包括氨基 酸组分方法( a c c ) 【8 ,9 ,1 0 ,1 l ,1 2 ,1 3 】,神经网络方法( 舢蝌) 【1 4 ,隐马尔可夫模 型( h m m ) 【1 5 方法以及支持向量机方法( s v m ) 等。 由于机器学习的精度直接依赖每类模式的数量,目前大多分类方法都对螺旋、折 叠、螺旋和折叠、螺旋加折叠四类中的2 7 种折叠模式分析,保证每类折叠模式至少包 含7 个以上的蛋白质。但这类方法只能针对有限的折叠模式分析。 折叠模式预测的研究已有很多进展。例如比较经典的,文献【1 6 的基本思路是: 提取氨基酸的组成成分、极性、疏水性、预测二级结构等信息,作为蛋白质折叠模式 的特征参数,利用神经网络或支持向量机方法预测折叠模式,可以预测的折叠模式种 类局限在四种结构类蛋白的2 7 种折叠模式。文献 1 7 的基本思路是:提取氨基酸组成 成分、极性、极化性、范德瓦尔斯量、疏水性和二级结构等信息,作为蛋白质折叠模 式的特征参数,利用“多对多 的多类分类策略来预测蛋白质折叠模式,预测的折叠 模式局限在2 7 种折叠模式。 在蛋白质的折叠模式分类方面,支持向量机及其相关研究非常多,不同的支持向 量机使用的核函数不同。属性提取也有很多种,可以是组成成分、二级结构等,也可 以是序列比对信息,也可以将多种属性综合考虑,不同的特征向量提取对于预测效果 3 第一章引言基于机器学习的蛋白质折叠模式预测研究 有很大的影响。 1 3 课题内容 本文的研究内容主要从以下几个方面着手。 基于s v m 分类器的蛋白质折叠模式的研究主要包括以下几个方面: 1 样本集构成了学习和分类的工作环境,所以样本集的选择很重要。首先分 析s c o p 数据库,从中获取所有的氨基酸串及对应的折叠模式信息,利用随机方 法与均匀方法来选取训练集,构成本文的两个基本训练集。 2 编码方法及属性提取。氨基酸残基序列转化为输入空间的向量的过程称作编码, 本文使用一肽频数和二肽频数的编码方法,从氨基酸串中提取氨基酸的长度、 亲水疏水性以及一肽频数和二肽频数作为氨基酸串的属性值。 3 利用s v m 分类器对不同的训练集建模,根据得到的模型对本文构建的开放测试 集预测,并对实验结果进行分析和对比。 应用于从头预测的折叠模式预测方法的研究主要包括以下几个方面: 1 根据从头预测的启发,对选定的训练集和测试集重新编码,将序列信息直接作 为氨基酸串的属性值,构成本文第四章基本的训练集和测试集。 2 利用s v m 分类器对训练集建立模型,利用得到的模型来预测测试集。 3 用n a i v eb a y e s 分类器对训练集建立模型,利用得到的模型对测试集预测,并给 出实验结果。 4 用t 锄b a y e s 分类器对训练集建立模型,利用得到的模型对测试集预测,并给出 实验结果。 5 将n a i v eb a y e s s - j 类器得到的结果以及t a nb a y e s 分类器得到的结果分别与s v m 分 类器得到的结果进行分析比较,并根据得到的结果分析结果的正确性以及方法 的有效性。 6 利用折叠模式预测结果用于从头预测,用并行蚁群骨架预测算法p a c b a c k b o n e 对 从头预测的蛋白质重新进行预测,并将得到的结果与未使用前的结果进行比 较。 4 基于机器学习的蛋白质折叠模式预测研究第一章引言 1 4 课题意义 蛋白质作为由氨基酸序列组成的链状生物大分子,是生命中最基本的组成部分 之一,它直接参与生物结构的形成,在生物功能的过程中起着重要的作用。随着人类 基因组计划的完成,人们得到的不同物种的d n a 序列越来越多,但蛋白质结构数据 库( p d b ) 的增长速度却相对缓慢。目前,已知蛋白质序列数与已知结构数严重不平 衡,蛋白质序列数据库总数据量远远超过结构数据库中的数据量。据2 0 1 0 年5 月公布 的信息,u n i p r o t k b 数据库中已知序列的记录为1 1 3 8 4 8 9 8 条,而p d b 数据库中已知结 构的记录仅为6 5 5 2 7 条。目前为止,人们提出了许多蛋白质结构的测定方法,如x 射线 晶体学方法、多维核磁共振( n m r ) 、同源建模法和从头预测法等。虽然使用这些方 法使蛋白质结构预测有了显著的进步,但蛋白质结构预测的数目还远不能与所确定 的序列数目相比。由于蛋白质折叠问题可以表达成标准的预测问题,因此可以用机器 学习的技术进行预测或分类。 由于蛋白质的折叠模式有数千种( s c o p 数据库中有1 3 9 3 种) ,远小于蛋白质所具 有的自由度数。因此,对自然界存在的数百到数千种折叠模式进行系统研究,探索蛋 白质折叠形成的经验规律,这将有助于揭示蛋白质的折叠规律、解决蛋白质折叠问 题。 目前存在的蛋白质结构预测技术如r o s e t t a 【1 8 ,1 9 ,2 0 ,2 1 】,在预测蛋白质结构时, 对待测氨基酸串,首先从已有的片段库中选择与该氨基酸串相似的3 残基和9 残基两 个片段库组装成空间结构,而这些3 残基和9 残基片段从形态上没有很好的生化解释。 如果能够利用本文预测的折叠模式来生成片段库,将会为蛋白质结构预测提供更多 有价值的信息。 对于未知结构的氨基酸串,其搜索空间非常大,预测其结构相当困难。如果能够 预测该氨基酸串包含的折叠模式,将大大缩减搜索空间,指导氨基酸串空间结构预 测,同时对较难解决的从头预测问题有很好的指导作用。 1 5 本文的组织结构 本文的主要章节安排如下: 第一章主要介绍本文的研究背景、研究现状、研究内容和研究意义。 第二章主要概述蛋白质折叠模式的一些基本概念,介绍目前常用的蛋白质数据 库,并介绍了国内外蛋白质折叠模式的学习研究状况,最后对本文所使用的一些基本 算法进行了阐述。 第三章主要描述基于s v m 分类器的蛋白质折叠模式的研究方法,使用s v m 作为 分类器,根据从s c o p 数据库中得到的不同训练集分别建立模型,对本文的测试集进 5 第一章引言 基于机器学习的蛋白质折叠模式预测研究 行预测,给出实验结果,并对得到的结果进行详细的分析。 第四章主要描述应用于从头预测的折叠模式预测及其应用,使用s v m 和贝叶斯 作为分类器,分别给出实验结果,并对得到的结果进行分析总结。最后把折叠模式预 测的结果应用于从头预测,给出了实验结果及分析。 第五章本文工作的总结及其展望。 6 基于机器学习的蛋白质折叠模式预测研究第二章蛋白质折叠模式预测概述 第二章蛋白质折叠模式预测概述 2 1引言 目前蛋白质结构的实验测量方法主要包含两类:x 射线衍射技术和核磁共振方 法。x 射线衍射技术需要得到高质量的晶体,结晶的时间长并且代价高。此外,由于 技术上的限制,许多蛋白质都无法得到合适的晶体。核磁共振方法不需要结晶,可以 在溶液中进行结构的测定,但它只限于较小的蛋白质结构测量,测试对象非常有限。 因此,急需发展快速的自动的理论计算方法来预测蛋白质结构。由氨基酸残基构成 的线性序列称为蛋白质的一级结构,也称多肽链( 图2 1 ) 。研究发现,在适当的环境 下,一条伸展的多肽链能够自动折叠成特定的空间结构。即使这种稳定的空间结构遭 到破坏,在适当的条件下,蛋白质序列仍可恢复其稳定的三维结构,如图2 1 。这就是 誊i i i 嫠 ,一静一鼍1 p 。:嗲 【, 纛鲁謦 、 t 卜豢。貔毒 麴0 、卜绣 h 0 瑚糠呵 图2 1 :蛋白质的结构层次 著名的蛋白质复性理论【2 】。它表明,氨基酸序列是决定蛋白质空间结构的最基本因 素,即蛋白质空间信息蕴含在氨基酸序列中。这为科学家们利用计算方法从序列出发 预测蛋白质结构提供了理论依据。然而,自然界中蛋白质结构种类的数目高达数十万 种,导致其研究复杂度非常高。研究发现,属于同种折叠模式的蛋白质功能相似,而 自然界存在的折叠模式为一千多种( 蛋白质结构分类数据库s c o p ) 。因此,通过蛋白 质折叠预测来研究蛋白质结构能大大降低复杂度。 2 2 蛋白质折叠模式的描述 蛋白质二级结构是指多肽链借助于氢键沿一维方向排列成具有周期性结构的构 象,是多肽链局部的空间结构( 构象) ,主要有q 一螺旋、b 一折叠、1 3 一转角等几种 7 第二章蛋白质折叠模式预测概述 基于机器学习的蛋白质折叠模式预测研究 形式,如图2 2 所示,它们是构成蛋白质高级结构的基本要素。折叠模式是指由蛋白 图2 2 :蛋白质的二级结构 质的二级结构堆砌具有的一定模式,蛋白质的折叠模式反映了一个蛋白质核心结构 的拓扑结构模式。蛋白质折叠模式预测是一种分析蛋白质结构的重要方法。 蛋白质的折叠模式远小于蛋白质所具有的自由度数,折叠所潜藏的物理的简单 性使我们预期:折叠速率和机制看上去在很大程度由天然态的拓扑所决定。蛋白质折 叠模式包含了蛋白质空间结构形成中起关键作用的疏水内核,同时,形成蛋白质折叠 模式的不同二级结构片段又通过长程相互作用实现空间紧邻。因此,抓住蛋白质折叠 模式研究问题可以将疏水内核在结构形成中的关键作用与长程相互作用两者有机组 合。对自然界存在的数千种折叠模式进行系统研究,探索蛋白质折叠模式形成的规 律,将有助于揭示蛋白质的折叠规律、解决蛋白质折叠问题。 2 3 常用的蛋白质数据库 2 3 1s c o p 数据库 蛋白质结构分类数据库s c o p ( s t r u c t u r a lc l a s s i f i c a t i o no fp r o t e i n s ) 是由英国医学 研究委员会( m e d i c a lr e s e a r c hc o u n c i l ,简称m r c ) 的分子生物学实验室和蛋白质工 程研究中心开发和维护【6 】。该数据库对已知三维结构的蛋白质进行分类,并描述了 它们之间的结构和进化关系。s c o p 数据库中的几乎全部分类过程都是依靠有声望的 科学家通过人工方法进行的。s c o p 数据库的目的是通过蛋白质序列结构关系建立一 种研究蛋白质进化的工具。 8 一 基于机器学习的蛋白质折叠模式预测研究第二章蛋白质折叠模式预测概述 s c o p 数据库从不同层次对蛋白质结构进行分类,以反映它们结构和进化的相关 性。可以把蛋白质分成许多层次,但通常将它们分成类( c l a s s ) ,折叠类型( f o l d ) ,超 家族( s u p e r f a m i l y ) 和家族( f a m i l y ) 。不同层次之间的界限并不十分严格,但通常层 次越高,越能清晰地反映结构的相似性。s c o p 数据库的第一个分类层次为类,类包 含了共同折叠。大多数的折叠都根据它们的二级结构成分属于5 个类中的一个:螺旋、 折叠、螺旋和折叠、螺旋加折叠、多重结构域。第二个分类层次为折叠类型,无论有 无共同的进化起源,只要二级结构单元具有相同的排列和拓扑结构,即认为这些蛋白 质具有相同的折叠方式。在这些情况下,结构的相似性主要依赖于二级结构单元的排 列方式或拓扑结构。第三个分类层次为超家族,如果序列相似性较低,但其结构和功 能特性表明它们有共同的进化起源,则将其视作超家族。第四个分类层次为家族,其 依据为序列相似性程度。通常将相似性程度在3 0 以上的蛋白质归入同一家族,即它 们之间有比较明确的进化关系。当然这一指标也并非绝对。某些情况下,尽管序列的 相似性低于这一标准,例如某些球蛋白家族的序列相似性只有1 5 ,也可以从结构和 功能相似性推断它们来自共同祖先。 s c o p 的最新统计数据及分类情况见表2 1 。 表2 1 :s c o p 数据库中的折叠模式分类 c l a s s ( 缩写) f o l d s a l la l p h ap r o t e i n s ( a ) 2 8 4 a l lb e t ap r o t e i n s ( b ) 1 7 4 a l p h aa n db e t ap r o t e i n s ( a b ) 1 4 7 a l p h aa n db e t ap r o t e i n s ( a + b ) 3 7 6 m u l t i - d o m a i np r o t e i n s ( x )6 6 m e m b r a n ea n dc e l ls u r f a c ep r o t e i n s ( m )5 8 s m a l lp r o t e i n s ( s )9 0 c o i l e dc o i lp r o t e i n s ( c )7 l o wr e s o l u t i o np r o t e i ns t r u c t u r e s ( 1 ) 2 6 p e p t i d e s ( p ) 1 2 1 d e s i g n e dproteins(d)44 t o t a l1 3 9 3 2 3 2c a t h 数据库 c a t h 是另一个著名的蛋白质结构等级结构域分类数据库,其含义为类型( c l a s s ) 、 构架( a r c h i t e c t u r e ) 、拓扑结构( t o p o l o g y ) 和同源性( h o m o l o g y ) ,它由英国伦敦大 学u c l 开发和维护【7 】。与s c o p 数据库一样,c a t h 数据库的构建既使用计算机程序, 也进行人工检查。c a t h 数据库的分类基础是蛋白质结构域。 9 第二章蛋白质折叠模式预测概述 基于机器学习的蛋白质折叠模式预测研究 c a t h 数据库中主要有4 个层次,类、结构体系、拓扑和同源超族。第一个层次为 类是最简单的层次,它描述了每个结构域的二级结构成分,类是根据蛋白质二级结构 成分和连接方式确定的。第二个层次为结构体系,说明了二级结构单位构象倾向,是 二级结构和独立连接的总排列。结构体系描述了蛋白质折叠形态的一般特征。第三个 层次为拓扑结构,即二级结构的形状和二级结构间的联系。同一个拓扑中的结构域是 相似的,但是功能可能不同。第四个

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论