生物信息学中代谢物组数据分析的应用_第1页
生物信息学中代谢物组数据分析的应用_第2页
生物信息学中代谢物组数据分析的应用_第3页
生物信息学中代谢物组数据分析的应用_第4页
生物信息学中代谢物组数据分析的应用_第5页
全文预览已结束

付费下载

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

生物信息学中代谢物组数据分析的应用

金融生物系统动力学研究内核:物理组学、生物研究同中生学在系统生物学的指导下,综合分析遗传、蛋白质和代谢水平上的各种外源性刺激,如药物、疾病、基因修养、营养和环境对生物系统的影响。我们可以在许多领域研究功能基础、代谢网络的调节、疾病的诊断、病理病理学等方面取得重大进展。代谢组学是基因组学、转换组学和蛋白组学之后的一种新兴的“组学”。研究对象为细胞、组织、器官和体液中所有小分子代谢物组成的代谢组。几种“组学”密切相关,构成了系统生物学研究的核心(图1)。与基因组学、转换组学和蛋白组学相比,代谢组学具有独特的优势。例如,相同物种的代谢总数远低于基因和蛋白质总数,以及代谢是所有生化过程的最终表现形式,因此,代谢组学的研究可以提供最直接、最可靠的评价和预测系统变化的最可靠的证据。此外,各种分析手段(如nmr等)可以连续分析生物样本,并研究随着时间的推移而改变其特征。近年来,代谢组的许多优点引起了世界的关注,相关领域的文章数量迅速增加(图2)。代谢物组学是数据趋动的科学研究,必然要求尽可能全面地获取生物系统的信息及高通量、高灵敏度、高分辨率的分析手段与之匹配.现有的各种分析手段如NMR系列、MS系列以及色谱系列等技术产生的数据信息已经相当丰富和复杂.如何从海量的波谱数据中挖掘有效信息并进行无偏差的定性、定量分析,建立代谢表型变化和影响因素之间的联系;如何建立数学模型并预测未知样本的性质;如何建立标准的代谢物组学数据库以促进数据的存储和交流并与其他领域进行整合?解决上述问题必须依靠多元统计分析、化学计量学和计算机科学等多种学科构成的生物信息学手段.本文从代谢物组学研究背景出发,对代谢物组学的信息标准、信息提取方法以及如何与相关领域进行整合等方面加以综述并对代谢物组学的前景进行展望.1衍生物功能基因在生物基因组学中的应用根据研究体系和侧重点的不同,代谢物组学研究可以分为两个流派.其一是以Oliver等为代表的metabolomics流派.他们首先提出了代谢物组的概念并将代谢物组学与转录组学、蛋白质组学并列作为功能基因组学的研究手段之一.通常单个基因的改变对一个生化途径产生的影响不大,而且单个基因的多效影响可能会改变表面上看似无联系的生化途径中的代谢物水平,这种研究生物系统中代谢物组的技术和方法称为代谢物组学.该流派主要进行以拟南芥和酿酒酵母为代表的植物和微生物体系的研究,且集中于以下几方面:(1)基因功能预测;(2)代谢网络控制;(3)代谢通量控制等领域.Teusink等提出了FANCY方法,为功能基因组学特别是沉默基因的功能研究提供了崭新的思路.Raamsdonk等成功利用该方法对敲除PFK26和PFK27基因的酿酒酵母突变株进行代谢表型的比较研究,发现两者对代谢表型具有类似的影响,从而判断PFK27具有与PFK26类似的编码功能.Fiehn等对拟南芥、番茄、笋瓜等植物进行代谢物组学研究,发现拟南芥样本之间的差异主要表现为苹果酸、柠檬酸、葡萄糖和果糖等代谢物的浓度差异,该结果与以前的观点吻合,即拟南芥的表型差异主要源于遗传自母本的线粒体和叶绿体相关的基因型之间的差异.Buchholz等利用对不同生长条件下的大肠杆菌进行代谢扰动,采用迅速采样技术并利用HPLC、LC/MS等手段对代谢物进行分析,对葡萄糖和丙三醇代谢途径进行分析.代谢物组学的另一流派是以Nicholson为代表的metabonomics流派,该流派将代谢物组学定义为定量测量生命系统由于受到病理生理刺激或者基因修饰而产生的与时间相关的多参数代谢应答的研究方法.其研究主要集中于不同疾病或者药物刺激条件下动物的代谢表型变化,从而在疾病诊断、药物安全性评价等方面进行探索.Brindle等对36例多层血管病变患者(triplevesseldisease,TVD)和30例冠心病患者(nomalcoronaryarteries,NCA)的血清和血浆样本进行代谢物组学分析,结合PCA等模式识别技术对动脉硬化进行诊断,准确率高于90%.该方法能够对轻度、中度以及重度样本进行区分,与传统的造影方法相比,患者痛苦明显缓解,同时在准确率方面比传统的测血压、低密度脂蛋白、脂肪胆固醇等指标更为可靠.Wang等通过比较血吸虫感染组和对照组小鼠的代谢物组差异,证明了感染血吸虫的小鼠三羧酸循环途径减弱,糖酵解途径增强,氨基酸代谢有所变化,表明了用代谢物组学方法有可能深入地研究生物系统对寄生虫感染的生化反应机制.2从代谢组的生物信息研究2.1生物体系的标准如前所述,代谢物组学是数据推动的研究过程,待解决的关键问题是如何通过分析手段获取综合性代谢物组数据并进行有效信息的提取和利用.与构成基因的4种碱基、蛋白质的20种氨基酸相比,代谢物的组成更加复杂.其物化性质,如极性、溶解性、挥发性等存在巨大差异,因此目前尚无通用的代谢物组学分析手段.传统上植物和微生物体系主要采用GC/MS、LC/MS,而哺乳动物体系更多应用NMR.MAS技术的迅速发展为开展组织内的代谢物组学研究创造了条件.文献对代谢物组学研究中常用的以及新兴FT/ICR/MS等方法进行了综述并分析了各自的优缺点.不同的平台和分析技术会产生各种格式和单位的数据,使得代谢物组学数据缺乏标准,操作条件的不同也会对实验数据产生影响.上述原因不利于代谢物组学数据的存储和交流及成果共享,必然阻碍学科的发展.转录组学和蛋白质组学研究也面临类似的问题,分别建立了MIAME和PEDRo标准规定了各自领域的数据格式和必要的信息,使问题得到解决.从长远的角度看,代谢物组学领域也必须建立专门标准.Bino等率先提出了代谢物组学数据标准——MIAMET.Jenkins等在MIAMET基础之上提出了更为具体的ArMet标准,针对以GC/MS为分析手段的植物体系的代谢物组学研究过程中的实验设计、采样、预处理、样本分析、信息提取等整个过程的数据记录都提出了正规细致的定义和要求.微生物体系的标准也在建立之中.2.2数据分析方法对于代谢的描述:积代谢物组学数据分析的指导思想是:每种外源刺激都会产生独特的代谢表型变化;性质相似的外源刺激会产生相似的代谢表型变化.目前的代谢物组学数据分析主要应用模式识别的方法,其指导思想是:通过对所有代谢物组分的无偏差分析,判断样本的代谢模式并发掘能够表征具体模式的生物标志物(群).如用于诊断重大疾病或作用靶器官的标志物,利用大量数据进行专家系统的建立;研究不同代谢物的变化关系,为发现新的代谢通路以及代谢调控奠定基础等.其基本流程如图3所示.2.2.1nmr检测峰的校正模式识别的处理对象为原始数据构成的矩阵Aj×k,j个样本构成行,对应的k个变量构成列.目前,自动识别波谱并对所有化合物定性的软件及完整的数据库尚不具备.如:最具代表性的拟南芥叶子中具有约5000个代谢物,其中只有10%利用现有的手段能够确认,其GC/MS图谱中高达70%的峰仍然不能进行确认.因此,用代谢物浓度作为样本变量目前尚存在一定难度.常用的解决办法是对波谱数据进行积分,以积分面积作为变量.AMIX软件是NMR系统的专用积分工具,能够按照预定步长将核磁共振谱积分.应用该软件应注意减少具体操作过程中由于pH值和温度等因素造成的官能团位移偏差,为此,Stoyanovaa等提出了用于校正NMR峰的方法.色谱方法由于实验条件及仪器本身的稳定性等因素也存在保留时间偏差的问题.Synovec等建立了快速校准GC-MS波谱的算法.Sumner等则提出了更为普适的MSFACTs方法,该法适用于NMR、色谱等多种图谱的校准、转换及格式化.其中的RTAlign工具包能够处理保留时间和积分面积对应的数据,而RICExtract能够直接对原始图谱数据进行处理.输出结果中面积与保留时间一一对应,显著促进了PCA等方法必要的积分步骤,进而为后续的模式识别过程奠定坚实的基础.2.2.2身份识别分类方法模式识别可分为无监督和有监督两大类方法.代谢物组学研究早期应用的主要是无监督方法.其优势在于能够在不具备任何背景知识的情况下通过对高维数据降维实现样本代谢表型内在关系的可视化.主要方法有PCA、HCA、LDA等,其中应用最广泛的方法是PCA.Beckonert等利用PCA和HCA对服用链脲霉素、HCBD、氯化汞以及对照组的Sprague-Dawley大鼠尿样进行归类,两种方法得到的结果一致.Shi等利用HPLC研究饮食控制对Fischer344xBrownNorway大鼠血液中的小分子代谢物造成的影响.分别利用雌性和雄性大鼠的血液样本中的101个和112个可识别组分进行模式识别,PCA和HCA分类正确率分别为100%,100%和100%,93%.针对PCA对奇异样本异常敏感的现象,Hubert等提出了稳健PCA——ROBPCA方法,改进了样本分类效果并且能够判断奇异样本.Eriksson等提出的等级PCA方法有效解决了样本变量较多情况下利用肉眼分析Loading图可靠性差的问题.Scholz等提出了ICA方法,首先利用PCA对数据进行降维,根据kurtosis标准确定最佳主成分数量,从中提取独立成分并进行聚类分析,更为有效地解决了样本间最大差异与研究焦点不一致的问题.随着代谢物组学研究的发展,出现了有监督和无监督方法并存的局面.有监督方法需要解决的关键问题是提高所建模型对未知样本类别的预测能力,理想的有监督方法还应具备识别生物标志物(群)的能力.主要的有监督方法有SIMCA、PLS、k-NN以及ANN等.最佳的建模方法随研究体系而有所不同.Shi等研究营养因素对血浆代谢物组影响时发现利用SMICA方法构建的模型预测能力始终优于k-NN,而Tominaga等利用PCA-LDA、SIMCA、PLS、ANNs和k-NN等7种方法建立抗真菌、抗细菌以及抗肿瘤药物的数学模型得到的结果则是k-NN的预测能力最强.建模过程关键要解决好输入变量的选择问题.文献认为选择与分类最为相关的变量建造的数学模型预测能力更强,而Paolucci等认为统计学意义不显著的变量对于增强模型的预测能力也有作用.模式识别方法基本原理可参见文献.基于投影原理进行聚类的模式识别方法(如PCA、SIMCA等)对数据预处理非常敏感,预处理方法甚至可能导致分析结果根本性的变化.现有的预处理方法如mean-center、auto-scaling、log等目的在于消除样本间浓度差异或者赋予所有变量相同的权重.文献将多元分析过程分为7个步骤并详细阐述了包括预处理以及模式识别方法选择等过程中的注意事项,同时介绍了常用的商业辅助软件.2.3着力发展着力互联网上的代际合作模式识别只能够在数学意义上进行样本归类和生物标志物(群)的识别.这种分析结果与生化系统的实际变化情况,如基因修饰、病理状态、药物等外源刺激的客观联系必然会受到来自传统学科,如医学、药学和生物学等领域的质疑.与mRNA和蛋白质不同,代谢物与基因之间不存在直接的对应关系,即通过代谢物(群)无法判断哪些基因的表达过量或受到抑制;同时,不同代谢通路之间的相互作用使得改变单个基因并不能保证目标产物产量的显著改变.因此,对生物系统的认识必须从路径发展为网络,实现从基因型到表型的系统认识.这一目标的实现需要充分利用现有的数据库资源进行代谢物组与转录组、蛋白组数据的有效整合.互联网上存在大量免费的资源(如表1).同时,代谢物组学是一项庞大的工程,单一的人员或者研究机构的力量是有限的,不同单位之间甚至国际间的交流合作显得尤为重要.2001年,国外六大医药公司(Bristol-Meyers-Squibb,Elililly,Hoffrnann-LaRoche,NovoNordisk,Pfizer,Pharmacia)和英国帝国学院(ImperialCollege,London)面对风险的挑战,组织并公布了一个研究计划(COMET),应用代谢物组学评价药物毒性,进行候选药物的临床前毒性评价.3年中利用大鼠和小鼠尿样的NMR图谱分析研究了150个肝肾毒性物质,并结合生理病理学以及毒理学等领域的知识构建了预测肝肾毒性的专家系统.2000年9月,美国国家基因毒理研究中心也启动了一个预计将跨越10余年的工程,以期建立一个整合了转录组学、蛋白组学和代谢物组学以及相关领域的CEBS知识库,被认为是药物安全性研究评价的革命.3全方位积极的评价体系近年来的研究表明代谢物组学能够为基因组学研究以及病理毒理学等诸多领域的研究开拓崭新的途径,并已经取得一定进展.随着人们对生活质量要求的不断提高,用药安全、环境安全、食品安全等方面的问题亟需得到解决.中药是我国传统瑰宝,但目前仍然缺乏与国际接轨的药效、毒性评价体系,中药的自主知识产权已受到严重的威胁,寻求新的研究方法以建立国际公认的评价体系刻不容缓.自2002年起,美国FDA开始探索利用代谢物组学进行药物临床和非临床安全性和有效性评价的适用性.该项目主要包括对乙酰氨基酚、他莫昔芬、胰岛素增敏剂、二口恶英、阿霉素等毒品、止痛剂及天然化合物毒性的研究和癌症及肝病等研究.中药

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论