付费下载
下载本文档
版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
基于离散增量结合二次判别分析法的蛋白质相互作用预测
0idqd算法用于pp预测的理论研究蛋白质相互作用(iu)是遗传因素复制、遗传因素调节、细胞代谢、信号调节和通信等许多生命活动的过程。虽然有许多传统的实验方法,但它们对人类疾病的分子机制的研究和药物开发也具有重要的理论意义。虽然有许多关于蛋白质相互作用的传统方法,如化学交联法、免疫共沉淀法和双壳素联合技术等。然而,这些实验方法需要很长时间,成本高。提出了遗传因素融合法、基因附近法、种系轮廓发生法等理论方法,以及支持向量机(svm)和贝叶斯评估算法等机器学习算法来预测蛋白质相互作用。随着系统生物学的快速发展,人们越来越意识到从系统和网络的角度研究蛋白质功能的新理论,并探索新的理论方法对蛋白质功能的研究具有重要价值。作为一种相对成熟的数据分类理论方法之一,分散扩散法(id)和二次评价分析表明了qd(qd)方法(qd)的引入和成功应用。在这项工作中,我们第一次将idqd方法应用于模型预测,并将人类蛋白质相互作用数据作为研究对象。根据蛋白质一的结构序列特征,利用idqd方法预测蛋白质相互作用,取得了良好的结果。结果表明,idqd算法可以用于预测填充数据。1材料和方法1.1ds特点(1)离散量和离散增量离散量(diversitymeasure)是对状态空间的信息描述,也是对样本整体不确定性的度量.对于状态空间X:{x1,x2,…,xd},每一个性状出现的频数分别是n1,n2,…,nd,则其离散量定义为:一般来说,样本本身的整体不确定性程度需要和标准源比较来确定,即由样本特征的离散分布D(X)和标准源特征的离散分布D(S)的比较来确定.定义标准源S的离散源为S:[m1,m2,…,md]对于两个离散源:X:[n1,n2,…,nd]和[m1,m2,…,md],离散增量(incrementofdiversity,ID)定义为:假设对一个样本可以提取r组特征,每组特征可由上式给出其ID描述.将r个ID构成一个r维二次判别向量R(ID1,ID2,…,IDr),则判别其分类归属的二次判别函数由下面的公式给出:这里δi=(R-μi)T(Ci)-1(R-μi),i=1,2.其中Ni是训练集(i=1,2,分别代表阳性训练集和阴性训练集)的样本总数,即先验概率,δi(i=1,2)是第i类别的R与μi之间的马氏距离,μi(i=1,2)是第i类别的训练集中R的平均向量,Ci(i=1,2)是第i类别的r×r维协方差矩阵,|Ci|是矩阵Ci的行列式值.两类样本的协方差矩阵为:上述判别函数由Bayes理论导出,这里是阳性集和阴性集后验概率比的自然对数.如果特征选的合适,阳性集和阴性集可在ξ空间的0附近区分开.不过,由于阴阳集样本数的有限性,并且可能对正态分布有偏离,这时两个集合在空间的分界点不一定是0,最佳分界值往往由经验确定.1.2非蛋白质相互作用对为了评价IDQD算法识别结果的准确性,定义了以下几个指标:敏感性Sn,特异性Sp,总体准确度TA,相关系数CC.其中,TP为真阳性样本数,表示预测正确的蛋白质相互作用对;FN为假阴性样本数,表示预测为无相互作用的蛋白质相互作用对;TN为真阴性样本数,表示预测正确的非蛋白质相互作用对;FP为假阳性样本数,表示预测为有相互作用的非蛋白质相互作用对.ROC(ReceiverOperatingCharacteristics)曲线常用来评价某一算法的优劣或对几种分类器的预测能力进行比较.ROC曲线是在分类器取不同阈值的情况下描点绘制成的二维曲线图.通常以假阳性率(falsepositiverate,FPR=1-Sp)为横坐标,以真阳性率(Sn)为纵坐标绘制ROC曲线.目前对预测模型的检验方式主要有三类:自洽检验,k-fold交叉检验和jack-knife检验.通常对所研究的样本进行自洽检验和jack-knife检验的结果都会优于k-fold交叉检验的结果,然而k-fold交叉检验更符合实际的需要.本文采用自洽检验和3-fold交叉检验结合上述四个指标和ROC曲线来评价IDQD算法的预测能力.1.3阳性数据集和阴性数据集的构建人类蛋白质相互作用数据、注释信息及蛋白质的一级序列数据均来自DIP(DatabaseofInteractingProteins)数据库,版本号为Hsapi_20090126,包括2171个相互作用蛋白对,涉及1815个蛋白.首先将原始数据中注释信息标识可信程度不高的相互作用对及缺少序列信息的数据去除,进一步剔除非物理相互作用蛋白对,最后将蛋白自身相互作用的情况过滤掉.经过以上筛选过程,最终获得由1962个蛋白质相互作用对(共涉及1703个蛋白)构成的阳性数据集.阴性数据集是由没有相互作用的蛋白对构成的.本工作首先将阳性数据集涉及的蛋白随机组对,并去除阳性集中出现的相互作用蛋白对.这里不考虑蛋白质相互作用的方向性,即认为A-B与B-A是同等的,因此,只保留一对即可.经上述去冗余处理后保留下来的组对认为都是没有相互作用的蛋白对.从此数据集中随机抽取与阳性数据量相当的数据构成阴性数据集.1.4氨基酸的分类氨基酸是蛋白质的基本组成单位,虽然自然界中存在许多种氨基酸,但是蛋白质中常见的氨基酸只有20种,这20种氨基酸的侧链在形状、大小、所带电荷、形成氢键的能力以及化学活性等方面都存在着差异.依据这些差异,可以从不同的角度对氨基酸进行分类.本文依据R基团的体积和极性将氨基酸约化为7类,见表1所示.基于这样的约化,蛋白质序列中的每一个氨基酸都被其所在的分类号取代,进而形成新的符号序列.例如序列“MTDNPQKRAC...”就被转化为“3364245517...”.依据氨基酸的化学特性,氨基酸同时又可以约化为8类,如表2所示.2蛋白质与蛋白质相互作用的预测2.1氨基酸约化和待测蛋白的增加考虑到蛋白质的组分特征和空间结构与相互作用的密切联系,我们选取蛋白质紧邻氨基酸多联体,即紧邻k-mer出现的频数作为IDQD分类的离散源.若直接统计20种氨基酸的k联体频次,对于每一个蛋白质就可构成20k维的离散源.当k=4时,离散源的维数便是160000.这样高的维数会使计算量急剧增加,所以我们按照氨基酸的物理化学性质对其进行约化以降低计算维数.结合1.4节中提到的氨基酸约化的两种方式,我们选择了两组参数,第一组参数选取氨基酸约化为7类时的5-mer出现频数,每对蛋白质构成2×8575维向量X1(合并倒序重复,如13456与65431被认为是一种组成形式).第二组参数选取氨基酸约化为8类时的5-mer出现频数,每对蛋白质构成2×16640维向量X2(同样合并倒序重复).X1和X2构成待测蛋白对的2个离散源.类似地,由训练阳性集和阴性集分别建立2个阳性集和2个阴性集标准源.通过式(1,2)计算得到待测蛋白对与阳性集标准源和阴性集标准源之间的4个离散增量ID1、ID2、ID3和ID4,构成待测蛋白对的4维二次判别参数,利用公式(3),(4)计算ξ,依据最佳阈值进行分类判别.2.2单氨基酸、2-mer检测文章基于上述特征使用IDQD算法对人类的PPI进行了预测,我们同时采取自洽检验和3-fold交叉检验对预测结果进行评价.在取最佳阈值ξ0时,预测结果见表3,其ROC曲线见图1.由表3可知,在最佳阈值时进行预测的自洽检验结果为:Sn=76.04%,Sp=75.74%,TA=75.89%,CC=0.52;3-fold交叉检验的结果为:Sn=64.22%,Sp=64.68%,TA=64.45%,CC=0.29.在图1中,曲线1指自洽检验的ROC曲线,曲线2指3折交叉检验的ROC曲线.作为比较,我们分别以蛋白对的单氨基酸、2-mer频数;氨基酸按照功能特性约化为4类时蛋白对的3-mer、5-mer频数;氨基酸根据R基团的体积和极性约化为7类时蛋白对的5-mer频数以及氨基酸依据自身的化学特性约化为8类时蛋白对的5-mer频数作为离散源进行IDQD预测,自洽检验的预测结果如表4所示,ROC曲线见图2.类型1、2分别指以蛋白对的单氨基酸和2-mer出现频数为特征;类型3、4各指以氨基酸约化为4类时蛋白对的3-mer、5-mer频数为特征;类型5指以氨基酸约化为7类时蛋白对的5-mer出现频数为特征;类型6指以氨基酸约化为8类时蛋白对的5-mer出现频数为特征;类型7指以氨基酸约化为7类和8类时蛋白对的5-mer出现频数为特征的ROC曲线.表4和图2表明,使用IDQD算法对人类PPI进行预测时,以氨基酸约化为7类和8类时蛋白对的5-mer频数为特征的预测结果明显优于选取其它特征参数时的预测结果.3idqd预测精度预测的未来研究方向由表3数据可以看出,整合7分类与8分类5-mer频数为特征时,自洽检验与交叉检验预测总体准确度分别达到75.89%和64.45%,这说明,该IDQD模型预测PPI具有一定的区分度.表4显示,单独以约化为7类时蛋白对的5-mer频数和单独以约化为8类时蛋白对的5-mer频数为特征的预测结果明显高于其它特征下的结果,这表明这两种特征更能够反映PPI形成过程的机理.R基团的体积和极性,氨基酸的化学性质以及氨基酸的空间位置在蛋白质相互作用中起着重要的作用.使用我们的IDQD模型对PPI进行预测时,既能反映蛋白质相互作用区域氨基酸残基的性质,同时又包含空间上距离比较近的残基特性,所以可达到有意义的预测效果.比较表3和表4,可以看出结合两种5-mer特征参数的预测结果处于单独约化为7类和8类的之间,这进一步表明PPI与这两种特征参数都相关,但又不是完全独立相关.为了进一步说明预测结果的精度并比较几种检验的差异性,本文也绘制了各自的ROC曲线.由图2可知,类型6最好,以两种5-mer频数为特征的ROC曲线次之,类型5居第三,而以两种5-mer频数为特征的ROC曲线更接近于类型6,这表明基于约化为8类时蛋白对的5-mer频数是PPI形成过程中的更重要因素.特征信息的准确提取,加上高维信息空间映射函数ID和非线性判别函数QD的结合,是IDQD算法成功的重要保证.本工作首次将IDQD算法用于蛋白质相互作用的预测研究,并在蛋白氨基酸序列不同特征的统计分析基础上,对蛋白质一级结构的组分特征进行比较与探讨,得到了有价值的预测效果,这对进一步理解蛋白质结构与其相互作用的关系有一定的
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026年人工智能研发项目融资说明(6篇)
- 远离网络陷阱健康成长导航小学主题班会课件
- 采购行业成本管控考核表
- 教案9 自然语言处理应用
- 新材料研发合作信函5篇范文
- 客户投诉处理反馈函宠物行业客户投诉处理场景(3篇)范文
- 2026年智能家居产品用户体验报告提交通知7篇范本
- 井下综采维修钳工(机电)岗位工作技术标准试题库带答案
- 远离校园暴力构建和平环境六年级主题班会课件
- 干旱影响粮食产量紧急应对通知(6篇)
- 2026湖南衡阳市衡东县第二批事业单位公开选调工作人员88人笔试备考题库及答案详解
- 2026湖南常德市鼎城区部分事业单位公开招聘高层次人才11人笔试备考试题及答案详解
- 《DGTJ082467-2025超低能耗建筑设计标准居住建筑》
- 陕西延长石油集团有限责任公司 招聘专用笔试题库(历年真题+完整答案详解)
- 手术医师人员档案
- 小学生班级管理培训课件
- 2025年重庆沙坪坝区西部重庆科学城沙兴实业发展集团有限公司招聘笔试参考题库附带答案详解
- 2025陕西延长石油(集团)有限责任公司招聘(1881人)笔试备考题库及答案解析
- 高顿财务培训
- DL∕T 5362-2018 水工沥青混凝土试验规程
- 厂房钢结构施工方案样本
评论
0/150
提交评论