(应用数学专业论文)支持向量机在基因表达数据分析中的应用.pdf_第1页
(应用数学专业论文)支持向量机在基因表达数据分析中的应用.pdf_第2页
(应用数学专业论文)支持向量机在基因表达数据分析中的应用.pdf_第3页
(应用数学专业论文)支持向量机在基因表达数据分析中的应用.pdf_第4页
(应用数学专业论文)支持向量机在基因表达数据分析中的应用.pdf_第5页
已阅读5页,还剩56页未读 继续免费阅读

(应用数学专业论文)支持向量机在基因表达数据分析中的应用.pdf.pdf 免费下载

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

摘要 毒萋鞠对 弋,照蕾基霾芯片技术豹广泛我麓,萎因苍鸶实验数箍爆炸式逮增妖。翠絮主簧数 聚类算法探索完全束知的基因表达模式。随着基因分类、基因表达模式的逐步明朗,许多更有效 的有监督学习算法得到了广泛应用,准确、高教地预测束知基因的功能。支持向擞机由于自身诸 多撬赵戆特淫,霞箕在蕉嚣表达蠛数攥势耩方嚣颇其蔽s 为。餐是+ 投其毒袋豹囊耪实验绩繁毒鬟 对于巨大的基因芯片数据来说,所提供的已知信息非常贫麓却很宝贵。如何针对熬因表达谱数据 的这一特点,进行有效地s v m s 分析,鲜有文献报道。本文正是针对这一特点,从拟南芥根部基 因表运数据分辑这一襄罂实际恻予出发,对蒸因表这谱数耀分板进簿深入黪臻戴; 本文主要研究工作如下: 1 针对类别数未知,但有极少量已知类别训练点的拟南芥根部基因功能分类的问题,提出 了一秘纂予距离凌量擎习静多势安支持巍量辘算法。 2 提出一种推理型多分类支持向量机,并将其转他成一个无约求最优化问鼷来求解。并将 其应用于拟南芥根部基因表达数据分析中,为基因表达数据分析提供了一种新途径。 3 讨论7 一静半整警支持彝繁撬摸型,渡模型将半艇餐分类的缀食往纯瓣鬏转纯戒半定撬 划问题来求解。运用半定规划软件包,完成了算法的具体定现。为基凶表达数据分析提供了又 种新方法。 蕊之,本文铮霹鏊因表这港数据分板瓣酝趣宠验知识掇其贫乏的特蛙,磷究势提供了三瓣鬲 同的分析方法,数据试验验证了它们的有效蚀。 关键词:拟南芥基阑表达谱数据分析, 分粪支持彝量辊,攘壤型多分类支持彝量规, 支持向量机,半定规划,基于罡巨离度量学习的多 半篮督多势类支持囊曩瓤 a b s t r a c t i nt h ep o s tg e n o m ee r a , w i t ht h ew i d ea p p l i c a t i o no fd n am i c r o a r r a yt e c h n o l o g y ,t h e e x p e r i m e n t a ld a t ao fm i c r o a r r a yi n c r e a s ee x p l o s i v e l y p r e v i o u s l y , c l u s t e r i n gm e t h o d s w a r eu s e dt o e x p l o r eu n k n o w ng e n ee x p r e s s i o np a t t e r n s b yt h ec l a r i t yo fg e n ec l a s s i f i c a t i o n sa n dg e n ee x p r e s s i o n p a t t e r n s ,m a n ys u p e r v i s e dm e t h o d sh a v eb e e nu s e dw i d e l yt op r e d i c tg e n e s ? u n k n o w nf u n c t i o n s a c c u r a t e l ya n de f f e c t i v e l ys u p p o r tv e c t o rm a c h i n e s ( s v m s ) ,w h i c hh a v em a n ye x c e l l e n tf e a t u r e s ,a r e a b s o r b i n gi ng e n ee x p r e s s i o nd a t aa n a l y s i s w h e r e a s ,r e l a t i v et ol a r g ea m o u n t so f g e n ee x p r e s s i o nd a t a , t h ek n o w ni n f o r m a t i o no f f e r e db yb i o l o g i ce x p e r i m e n t si st o op o o rb u tv a l u a b l e a b o u th o wt oa i ma t t h i sc h a r a c t e r i s t i ca n dt h e na n a l y s eg e n ee x p r e s s i o nd a t aw i t hs v m se f f e c t i v e l y ,t h e r ea r ef e wl i t e r a t u r e s t o d a y t h i sa r t i c l ej u s ta i m sa tt h i ss p e c i a l i t y , a n dr e s e a r c h e so ng e n ee x p r e s s i o nd a t aa n a l y s i sw i t h s v m s ,b ya ne x a m p l eo f a r a b i d o p s i sg e n ee x p r e s s i o nd a t aa n a l y s i s t h ef o l l o w i n gp a r t sa r em a i nw o r k s : 1 f o rt h ep r o b l e mo f a r a b i d o p s i sf o o tg e n ef u n c t i o nc l a s s i f i c a t i o n ,w h i c ht h en u m b e ro f c l a s s e si s u n k n o w na n dt h e r ea r ef e wk n o w n f u n c t i o ng e n e s ,t h i sa r t i c l ep r e s e n t san e wa l g o r i t h mo fm u l i - c l a s s s v m s ,w h i c hi sb a s e do nl e a r n e dd i s t a n c em e a s u r e 2 at r a n s d u e t i v em u l i - c l a s ss v m si sp r o p o s e d ,a n dw ec o n s t r u c ti m p r o v e dt t a n s d u c t i v em u l i - c l a s s s v m sb yt r a n s f o r m m i n gt h ec o n s t r a i n e do p t i m i z a t i o np r o b l e mi n t ou n c o n s t r a i n e dp r o b l e m t h e nw e a p p l yt h i sa l g o r i t h mt oa m b i d o p s i sg e n ee x p r e s s i o nd a t aa n a l y s i s t h e r e f o r ew eg i v eo u tan e wm e t h o d f o rg e n ee x p r e s s i o nd a t aa n a l y s i s 3 w ed i s c u s sas e m i s u p e r v i s e dm u l i c l a s ss v m s ,i nw h i c ht h eo p t i m i z a t i o np r o b l e mi s t r a n s f o r m e df r o mac o m b i n e dp r o g r a mi n t oas e m i d e f i n i t ep r o g r a m ( s d p ) t h e nb ys o m ep o p u l a r m o t h e d ss o l v i n gs d p , t h ea l g o r i t h mi sr e a l i z e di nt h ec o m p u t e r an e wm e t h o di sg a v e no u tt oa n a l y s e g e n ee x p r e s s i o nd a t a i naw o r d f o rt h es p e c i a l i t yo fg e n ee x p r e s s i o nd a t aa n a l y s i s 由a tt h ek n o w ni n f o r m a t i o ni st o o p o o r , t h i sa r t i c l ep r e s e n t st h r e ed i f f e r e n tm e t h o d sb a s e do ns v m s t h ee x p e r i m e n t sp r o v et h e i r e f f e c t i v e k e yw o r d s :a r a b i d o p s i sg e n ee x p r e s s i o n d a t aa n a l y s i s ,s u p p o r tv e c t o rm a c h i n e s , s e m i d e f i n i t ep r o g r a m ,m u l t i - c l a s ss v cb a s e do nl e a r n e dd i s t a n c e ,t r a n s d u c f i v em u t i c l a s ss v m s , s e m i - s u p e r v i s e dm u l l - c l a s ss v m s 独创性声明 y 9 3 8 3 7 0 本人声明所呈交的论文是我个人在导师指导下进行的研究工作及取得的研 究成果。尽我所知,除了文中特别加以标注和致谢的地方外,论文中不包含其他 人已经发表或撰写过的研究成果,也不包含为获得中国农业大学或其它教育机构 的学位或证书而使用过的材料。与我一同工作的同志对本研究所做的任何贡献均 已在论文中作了明确的说明并表示了谢意。 研究生签名:刀如、a 时间:御舞石月西 关于论文使用授权的说明 本人完全了解中国农业大学有关保留、使用学位论文的规定,即:学校有权 保留送交论文的复印件和磁盘,允许论文被查阅和借阅,可以采用影印、缩印或 扫描等复制手段保存、汇编学位论文。同意中国农业大学可咀用不同方式在不同 媒体上发表、传播学位论文的全部或部分内容。 ( 保密的学位论文在解密后应遵守此协议) 研究生签和厂、黾、约时问:2 卯磊钿由 名:久c 扣 帆小加卵 中国农业大学硕士学位论文 第一章绪论 第一章绪论 后基因时代,随着基因芯片( 微阵列) 技术在基因研究领域得到广泛戍用,以及其芯片图像 分析和数据提取技术日益完善,基因芯片实验数据爆炸式地增长。由于基因芯片数据具有数据量 庞大,观测数与样本量相差悬殊,缺失值繁多等特点,许多传统的统计学方法根本无法处理或者 分析效果极差,这带来了研究者们对新方法的广泛尝试。早期人们主要以聚类算法探索完全未知 的基因表达模式,其部分研究结果已经得到了肯定。随着基因分类、基因表达模式的逐步明朗 需要更为有效的算法,对这些信息加以利用,准确、高效地预测未知基因的功能。因此,以可靠 的生物学实验结果作为先验信息的有监督算法( s u p e r v i s e da l g o r i t h m ) 便以其独特的优势成为微 阵列实验数据分析研究的新热点。其中,统计学习理论中最年轻的分支一支持向量机( s v m s , s u p p o r tv e c t o rm a c h i n e s ) 作为一种最新的有监督算法,具有选取相似性函数的灵活性、处理大数 据集时解决方案的稀少性、处理高维特征空间的能力,以及识别异常值的能力等好的特性,使其 在基因表达谱数据分析方面颇具吸引力。但作为- - 1 7 机器学习的新技术s v m s 算法本身对于芯片 研究者来讲了解甚少。另外,关于如何针对基因表达谱数据的特点进行有效地s v m s 分析更是鲜 有文献报道。这为芯片实验者、生物工作者,带来了数据分析上极大的不足,使得我们虽然获得 了宝贵的手实验资料,却有可能因为算法的缺陷而与信息失之交臂。 本章作为全文的绪论部分,首先介绍了生物信息学、基因芯片技术以及模式植物拟南芥的一 些基础知识。然后详细介绍了基因表达数据分析方法的研究现状以及先验知识贫乏的特性,并提 出了本文需要研究的一个实际问题拟南芥基因表达数据分析。最后对本文的主要研究工作和 结论进行概述。 1 1 生物信息学简介 1 1 1 生物信息学产生的历史背景及其研究的主要内容 自2 0 世纪中叶以来,随着d n a 双螺旋结构的提出和蛋白质空间结构的解析,开始了分子 生物学时代。对遗传信息载体d n a 和生命功能的体现者蛋白质的研究,成为生命科学研究 的主要内容。2 0 世纪九十年代初,随着人类基因组计划( h g p ) 在世界范围内的开展,破译人类 及多种模式生物的遗传密码已成为生物学领域的重要课题,同时产生了巨量的基因组信息。面对 如此巨大且具有高度复杂性的生物学数据,如何有效地进行管理和分析这些信息是人类基因组研 究中必不可少的重要内容,从而也促进了生物信息学这门将牛物学与数学、物理、化学、计算机 信息科学等学科全面交叉融合的新学科的产生和发展 1 】 2 】【3 】。 生物信息学( b i o i n f o r m a t i c s ) 是生命科学与信息科学以及数学、物理、化学、计算机科学等 学科相互交融而成的新兴交叉学科。它包含了生物信息的获取、处理、存储、分发、分析和解释 等在内的许多方面。综合应用数学、物理、化学、计算机和生物学的各种工具,来阐明和理解大 量生物学数据所包含的生物学意义。因此,生物信息学的诞生,得益于d n a 测序技术的快速发 展和过去十多年来计算机软硬件技术和因特网的突飞猛进的高速发展。跨学科、跨领域融台以及 新思想新方法的不断涌现,使牛物信息学这一热门、前沿研究领域正以惊人的速度不断取得突破 性进展,成为世界生命科学研究领域中一颗璀璨的明珠。 堪称与曼哈顿工程和人类登月计划并列的人类基因组计划( h g p ) 是人类从理化生物学转向 信息生物学的里程碑。从此,牛物学被重新划分为“前基因组”和“后基因组”两个阶段。2 0 0 2 年2 月1 2 日,历时1 0 载耗资2 0 亿美元的人类基因组计划最终完成,标志着人类“后基因组时 代”的来临。但是,随着人类基因组测序的完成,科学家们发现即使获得了完整的基因图谱,想 要了解生命活动还有很大的难度。因为从图谱无法知道基因表达产物是否出现以及何时出现、基 因表达产物的浓度大小、以及是否存在转录后的修饰过程等一系列问题。这些问题的实质是不了 解按照特定的时间、空间所进行的基因表达。而获得基因表达的信息比测定d n a 序列的任务要 艰巨得多,因为基因表达是依赖于许多冈素的动态过程。这促成j ,高通量的实验技术核酸层 次上的c d n a 芯片( c d n a 微阵列) 技术和蛋白质层次上的二维凝胶电泳和测序质谱技术,即蛋 白质组( p r o t e o m e ) 技术的诞生。建立在这两项技术之上的“功能基因组学”已经成为后基因组 研究的核心内容。它强调发展和应用整体的( 基因组水平或系统水平) 实验方法分析基因组序列 信息,阐明基因的功能。其特点是采用与高通量的实验方法相结合的大规模数据统计计算方法进 行研究。 1 1 2 基因芯片技术 基因芯片是生物芯片中应用最广泛、技术最成熟的分支。基因芯片又可以分为寡核苷酸微阵 列( o l i g o n u c l e o t i d em i c r o a r r a y ) 和c d n a 微阵列( c d n a m i c r o a r r a y ) 。基因芯片上的探针是寡核 苷酸或c d n a 分子。通过对杂交信号的检测,可以快速地鉴定靶基因的存在、含量及单核苷酸的 变化。 作为“功能基因组学”的实验基础之一,c d n a 微阵列技术一经出现,就在生物医学研究和 药理学探索领域产生了极大的影响。它使生物学家们能够在一次杂交实验中检测成千l 万条基因 在不同实验条件下的转录变化,获得反映特征组织类型、发育阶段、环境条件应答、遗传改变等 状态的基因表达谱测量值。这在仅仅十年以前还是不可能甚至是无法想象的。然而,有效地应用 这一技术的困难在其本身迅速发展的同时也在增加。当微阵列实验数据不断积累时,研究者们所 面对的新问题足:如果将所有获得的数据集中起来,我们能否将未知功能的新基因归类到已知功 能分类中? 能否将基凶表达与基因功能联系起来? 很多初期的生物试验已经证明:具有相似功能 的基因在相同的微阵列杂交实验中会产生相似的表达模式 4 】。这使得通过计算的方法分析基因表 达谱数据来区分不同功能类的基因,进而对未知功能的基因进行分类成为可能。但是,每次微阵 列实验都会产生大量的基因表达谱数据,当把多个相关研究放在一起时,数据量有可能以数以兆 计的速度增加,传统的统计分析方法难于对立u 此巨大的海量数据进行有效的分析和信息提取。从 数据结构上看,微阵列数据的显著特点是基因数远大于检测的样品数,而微阵列的常规分析是基 于基因的,从而导致了观测数远小于变量数,大大限制了些传统统计学方法的使用。另外,由 于微阵列实验中干扰因素较多,使得基因表达谱数据具有典型的高噪音、高变异、高维数、高相 关等特点,为数据的统计学分析及有效的信息提取提出了新的挑战。 基因芯片( g e n e c h i p ) 技术已经开始应用于植物功能基因组的研究。植物功能基因组学是当 前植物学最前沿的领域之一。基因芯片技术可用于基因突变检测和基因表达检测。基因表达检测, 2 中国农业大学硕士学位论文 第一章绪论 就是生物在不同组织和不同发育阶段、不同生理状态下( 正常状态与疾病状态) ,不同外界环境 因素影响下,通过基因芯片技术获得相应的基因表达数据。基因表达数据的分析,就是寻找这些 不同状态f 的基因表达数据内部隐藏的自然规律。基因表达分析是当前生物信息学的一个莺要研 究部分1 5 】【6 】【7 】a 1 1 3 基因表达谱数据的分析方法 1 1 31 基因表达谱数据的分析的现状 目前,对于基因表达谱数据的分析主要分为无监督方法和有监督方法两类。 利用无监督方法( u n s u p e r v i s e dm e t h o d s ) 对基因功能分类,本质上是一个聚类问题即将基 因表达谱数据中最具相似性的基因分成一类,并希望聚成同类的基因具有相似的生物功能。聚类 方法从基因表达向量之间的距离( 或相似性) 定义出发,通过某种聚类算法,如系统聚类1 8 、自 组织图( s o m ) 【9 9 、k m e a n s 聚类等对基阁进行聚类。无监督的方法研究较为广泛,算法较为成 熟,易于理解、操作,无需任何有关基因功能类别的先验信息,适用于探索完全未知的基因表达 谱数据特征。但是,它们有两个显著的岗限性:首先,明确的聚类结果需要建立在分离得很好 ( w e l l s e p a r a t e d ) 的数据基础上。几乎所有现存的聚类算法都可以从相互区别的、不相重叠的类 中产牛同样的聚类结果。但是,如果类与类之间是扩散且互相渗透的,则每种算法的聚类结果将 有所不同,致使每种算法所界定的边界不清,得到各自不同的最佳结果。对生物学家来说,正确 解释来自不同聚类算法的结果的实际意义变得非常困难,只能根据经验以及可信度通过进一步的 序列比对来帮助解释和选取不同的聚类结粜。其次,上述所有的聚类方法分析的仅仅是基因间简 单的一对一的关系。虽然通过成对的线性比较,大大减少了发现基因表达向量之间关系的计算量, 但却忽视了生物系统中多因素和非线性的特点【1 0 】。 事实上,基因的大多数功能可以根据精确的生物试验测量出来,由此能准确地将生物功能类 别与基因相连。当有效地利用了这样的先验知识来指导基因分类时,聚类问题就转化为分类问题, 成为有监督方法( s u p e r v i s e dm e t h o d s ) 。该方法利用一个训练集,即属于某些功能类的若干基因 样本,以此来训练模型,帮助识别各个基因应该分别属于哪个功能类。由于利用了一定的先验特 征,在建模时有监督的分析往往比无监督的分析更为有效。并且在越来越多的基因分析领域巾, 发挥出更大的作用。近些年,出现了一种新的有监督算法支持向量机( s u p p o r t v e c t o r m a c h i n e s , s v m s ) ,其应用效果在有监督分折的多个研究领域都已得到了肯定。与常用的无监督方法相比, s v m s 具有两个主要的优势:首先,虽然都是用距离( 或相似性) 函数来比较基因表达的测量值, 但是s v m s 能够运用更多的距离( 相似性) 函数,其中包括线件函数和非线性函数,使s v m s 可 以更精确地考虑基因表达谱向量之间的联系。其次,s v m s 利用了训练集所具有的先验信息来区 分不同类别的基因,并有改进原有信息的潜力。在建好模型之后,其丰要作用是某个基因应该属 于哪个功能类,即s v m s 对于判别新样本的归属是十分有用的。 现今,国际上对s v m s 的讨论和进一步研究逐渐推广,大量关于基因表达谱数据处理的文献 也报道了支持向量机方法在处理此类数据方面所具有的优势。m i c h a e le s b r o w n 等将s v m s 与其 它4 种有监督的算法进行比较后,发现对于基因表达谱数据而言,s v m s 的处理效果最佳f 1 ; 中国农业大学硕士学位论文第一章绪论 t e r r e n c es f u r e y 等报道了s v m s 在处理与癌症相关的基因表达谱数据方面的可喜成果 1 2 】; q i n g h a iy e 等将s v m s 用于肝癌基因表达谱数据的分析,所得模型的预测准确率也高于其它现 有的算法【1 3 。但是,我国国内尚未在此领域开展广泛的研究,对于基因表达谱数据的分析仍刊 惯于采用常用的无蛉督聚类算法,如系统聚类、s o m ,k - m e a n s 聚类等。虽然s v m s 算法的独特 优势已经吸引了相当一部分生物工作者的兴趣,但受到统计理论知识和专业软件操作方面的限 制,而现有文献中又极少详细介绍如何应用s v m s 分析基因表达谱数据的分析流程,使得s v m s 在基因表达谱数据分析方面的实际应用尚难以实现和推广。因此,及时学习有关理论,掌握相关 的分析软件,开展有效的研究工作,才能使我们在这一有着重要意义的研究领域中尽快赶上国际 先进水平。 1 132 基因表达谱数据分析问题的特点 虽然,基因的大多数功能可以根据精确的生物试验测量出来,但是这种针对基因功能的测量 实验,使需要花费巨大的人力物力资源,而且所需时间也是相当漫长,效率非常低。所以,如此 实验所得的可靠性结果相对于巨大的基因芯片数据来说,所能提供的已知信息非常有限,也显得 格外宝贵。如何最大效率地利用这些先验知识,来指导机器学习? 这为机器学习算法提出了严格 的要求。先验知识的稀少性使得具体基因芯片数据分析的问题往往都是介于有监督和无监督之 间,即介于聚类和分类问题之间。如何针对基因表达谱数据分析的这一特点,进行有效地s v m s 分析,鲜有文献报道。致使基因研究人员虽然获得了宝贵的一手实验资料,却有可能因为算法的 缺陷而与信息失之交臂。 1 2 模式植物拟南芥 本文针对基因表达谱数据分析问题的先验知识稀少特点,以一个典型的实际问题拟南芥 根部基因表达数据分析为例,对基因表达谱数据分析进行深入的研究。 1 2 1 拟南芥的生物学特点 拟南芥( a r a b i d o p s i st h a l i a n a ) 是十字花科( c r u e i f e r ) 拟南芥属植物,它具有显花植物的全 部特征。拟南芥生长周期短,每年最少可繁殖6 代,为研究者提供了足够的试材。另外拟南芥种 籽容易得到这有利于各世代各遗传特性的充分表达和进行大量的遗传研究 1 4 1 。拟南芥的另 个特点是很容易进行人工诱变,产生大量突变体,这为基因克隆以及结构与功能的研究创造了有 利条件。 拟南芥没有特定的经济价值,但由于它具有一些独特的生物学、遗传学性质而成为植物分子 生物学研究中最受欢迎的模式植物( m o d e lp l a n t ) 。2 0 0 0 年底已经测定并发表了拟南芥完整的基 因组序列,在目前己知基因组大小的高等植物中,拟南芥的核基因组最小,使得基因库的构建、 筛选等过程变得更简便、快速。拟南芥基因组中具有较低比例的重复序列,基因组的8 0 是荦拷 贝基因 1 5 1 ,因此拟南芥可以产生大量突变体。这m 变异株为研究各基因在植物发育中的功能及 其调节提供了良好的实验材料。另外,拟南芥基因组中的基因通常也存在于其他作物中,人们通 4 中匿农业大学磺士学位论文第一章绪论 一i i 避难援南莽基因结构秘蟹 究,霉鞋增粕对荬健裹等檀鐾静生长_ 蘸l 发育i 雯程,撼麴与环境熬辐互捧 用以及植物的抗病和抗虫能力的认识和理解。由此越来越多的植物分予生物学家选择拟南芥作为 实验稀橱。 近年来拟南莽作为模式材料,已被广溅地用f 植物分子生物学及分子遗传学以及植物功能基 因蛆学的研究:基因芯片作为一种生物技术平台,也已经应用刘植物罨旰究中。利用蕊因芯片研究 拟瘫莽,可班获撂关予撞魏发育调节极理及代谢掺用祝理等多方蕊的鬟要信患。一大批拙露芬的 研究成粜将用于与人类密切相关的作物,以达到人们研究更为熨杂的高等植物和进行分子育种的 翳瓣。霹蒋基戮芯片在摄南芥研究r 豹主簧技术健连震燕发磊褰核营羧芯薨。 植物功能基因组学是当前植物学最前沿的领域之一,由于基因功能的研究涉及专利和知识产 权,对一个国家的长远发展怒战略健的律需,国醚竞争豳益自e 蒯。美圈蠡1 9 9 0 年启韵“植物基因 缀学”计划,2 0 0 0 年底公布了模式植物拟南芥的全部序列。2 0 0 1 年开始,美豳“2 0 1 0 年计划”又 全面启动,目标是到2 0 1 0 年确定拟南芥中所有基因的功熊。由予拟南芥是国际上第一个完成全部 基阑组黪判测定熬裹等植物,利媛其终连接式植物进行校物功戆基因缎学磅究在擞爨套国开展褥 如火如絷,大最涉及重要生命过程的基因被发现。我国也于2 0 0 1 启动了“拟南芥全部转录调控因 予簧蠡缓学研究”重大国际念箨毳 究顼秘,在较缝孵酎瓣海,墩褥了黧要遗栽。 + 2 。2 拟南芬差困袭达数援分掇 拟寇莽基因表选数据库( a r 互1 时是扶备葶巾虿圊豹资瓣收集8 撤南芬基因表达数掇,汇集成一 个能唯一查询的数据库1 1 6 】。在本文,我们研究它其中的一个数据集。这个数据集是由2 2 7 4 5 1 5 韵基因表达鼗镪拇减。它 f 】分羁是叛南莽2 2 ,7 4 5 个搬帮基因在5 个不鞫静蕴缀耩绥撬粪( s t e l & e n d o d e r m i s ,e n d o d e r m i sp l u sc o r t e x ,e p i d e r m a la t r i c h o b l a s tc e l l s ,l a t e r a lr o o tc a p 图i 1 ) 、3 种不同的 生长发商状态下的表达数据 1 7 1 。针对这个基因表达数据集,匿前所做研究强少。k e n n e t hb i m b a u m 等【1 7 】对其进行了聚娄分析。她们掇据其功能将基因聚娥8 个主要的类( 局部表达谱域l o c a l i z e d e x p r e s sd o m a i n s ,l e d s ) 。并从基因对荷尔蘩反应的功能的角度,具体分析了每个类基因的功能特 点,分别定经了3 类不溺反应瓣特征突出熬磬于基阁( 茁长素( 影晌v a s e u l a r 辣错弱生长发弯) ,赤霉 酸( 一种植物生长调节剂) ,菜莉酮类酸) 。本文,我们难是在此基础。匕,根据已知类别的这4 类 萋鳞( 3 5 个) 掰提供静多塞信崽,蒋新有基闲苁功辘豹角壤进章亍鬟缩羲静分类。我翻最终需簧解决 的问题是:根据已知的少量的有关拟南芥根部基因功能描述的专家信恩,通过机器学习方法,完 成对所有根部基因按功能的正确分粪。其中,类掰数爵彝i 除此4 类井其它类荆的样本麓困均采知, 这无形中绘解决问题增加了鄹难。然面,这问题又是基因表达谱分析中的典型闽题,很多实际生 物的基斛功能分析都怒这样的形式,即均悬在已测得非常少量附基因的功能越础上,力求通过机 器学习的方法,自魂竞残辑蠢基困功能豹分辑。鄹捷,磷完找类翘题鼹非常窍赞夔的。 5 蛋t - 1 强南莽榱蘸辩s 伞不篱蜒凝稻3 种不蓠生长发育状态 1 3 论文主要内容及结构 本文主要是从拟南芥根部纂因表达数据出发,深入研究了支持向量机在基因表达数据分析中 越艨震。 文章的大体结构为: 第二牵简单奔缁了支持商鬣视匏纂奉知诳和崭究现菰。 在文章的第三章,针对类别数未知,但商极少擐已知类剐的训练点的拟南芥报部基因功能分 类的问题,提出了一种慕于距离度量学习的多分类支持向爨视算法。人工产生一些属于其它豢的 训练点,菸在此基础上变现基因按功能的自动分类。 第四章中,提出一种推理型多分类支持向量机,并将其转化成一个无约束最优化问题来求解。 最嚣将筵冀洼盛攒j 二数露莽壤部基因袭速数据分辑中,菇基因表遮数据分辑提供了一种薪途径。 第五章,讨论了一种半监督支持向星机模型,该模型运用支持向量机晟大间隔的思想,将半 蓝督分类的组合傀耗两簇转纯成丰定糯翊问题来求解。运翔率定糯划静软件包,实现模型的其体 算法的实现。并将算法成用于拟南芥根部基因表达数据分析中,为基因袭达数据分析提供了又一 种新途径。 避质,燕六豢是对本文教毳 究进行总结秘醒望。 文章结构图如下: 6 7 中国农业大学硕士学位论文第二章支持向量机 第二章支持向量机 支持向量机( s u p p o r tv e c t o rm a c h i n e s ,简称s v m s ) 是一种新的通用机器学习方法。它是 c o r t e s 和v a p n i k 于1 9 9 5 年首先提出来的 1 8 ,已成为近年来机器学习研究的一项重大成果。v a p n i k 与c h e r v o n e n k i s 的统计学习理论( s t a t i s t i c a ll e a m i n gt h e o r y , s l t ) 【1 9 1 1 2 0 1 1 2 1 对有限样本情况下 模式识别中的一些根本性问题进行了系统的理论研究,很大程度上解决了模型选择与过学习问 题、非线性和维数灾难问题、局部极小点等问题,支持向量机正是在这一理论基础上发展起来的。 与传统的人工神经网络相比,支持向量机不仅结构简单,而且各种技术性能尤其是泛化 ( g e n e r a l i z a t i o n ) 能力明显提高,这已被大量实验证实 2 2 】。近年来对s v m s 的研究主要集中 在对s v m s 本身性质的研究和完善以及加大s v m s 应用研究的深度和广度两方面。到目前为止, 支持向量机已应用于模式分类、回归分析、函数估计等领域,并已成功应用到手写阿拉伯数字识 别 18 】、文本自动分类 2 3 】、人脸识别【2 4 】 2 5 】、计算机入侵检测1 2 6 、生物信息技术1 2 7 、遥感图 象分析1 2 8 】等诸多实际问题中。 本章首先介绍机器学习,统计学习理论的一些基本内容,然后详细介绍了支持向量机的晟大 间隔法思想和模型建立过程,然后简单介缁了支持向量机的研究现状。 2 1 机器学习 在人们对机器智能的研究中,希望能够】= j 机器来模拟人从实例学习的能力,这就是我们所说 的基于数据的机器学习问题【1 9 】,或者简单地称作机器学习问题。机器学习是现代智能技术中的重 要方面,研究从样本出发寻找铷律,利用这些规律对未来数据或无法j ! ! l i 测的数据进行预测。包括 模式识别、神经网络( a r t i f i c i a l n e u r a l n e t w o r k s ,a n n s ) 等在内,现有机器学习方法共同的重要理 论基础之足统计学。传统统计学研究的是样本数目趋于无穷大时的渐近理论,现有的学习方法 也多是基于此假设。但是,在实际问题中,样本数目往往是有限的,因此一些在理论上很优秀的 机器学习方法在实际中的表现却不尽人意。 与传统统计学相比,统计学习理论( s t a t i s t i c a l l e a r n i n g t h e o r y , s l t ) 是一种专l j 研究有限样本 情况下机器学习规律的理论。s l t 建立了套新的理论体系,该体系下的统计推理规则不仅考虑 了对渐近性的要求,而且追求在现有有限信息的条件下得到最优结果,为解决有限样本的学习问 题建立了一个较好的理论框架。它能将很多现有的机器学习方法纳入其中,有望帮助解决许多原 来难以解决的问题,如神经网络的结构选择问题、局部极小值问题等。 v l a d i m i rn v a p n i k 等人早在二十世纪六、七十年代就开始致力于此方面的研究【1 9 ,到九十 年代。p 期随着其理论的不断发展和成熟,也由于神经网络等方法在理论e 缺乏实质性的进展, 统计学习理论开始受到越来越广泛的重视,加之产生了s v m s 这一将理论付诸实现的有效的机器 学习方法,掀起了统计学习理论研究的新高潮。而s v m s 算法一经出现就在模式识别、回归估计、 概率密度函数估计等方面获得应用。尤其在模式识别方面,对于手写数字识别、语音识别、人脸 图像识别、文本分类等问题s v m s 算法在精度上已经超过了传统的学习算法或与之不相上下。 目前,s v m s 也开始应用于生物信息学基因层面上的数据分析。统计学习理论和支持向量机已经 成为继神经网络之后机器学习领域新的研究热点,将推动机器学习理论剃技术取得重大的发展。 8 2 1 1 机器学习的主要问题 机器学习的目的就是根据给定的训练样本求系统输入、输出之间的依赖关系。学习问题可以 一般地表示为:变量y 与x 之间存在的未知依赖关系,即遵循某一未知的联合概率p ( x ,y ) ( y 与 x 之问的确定关系可以看成其特例) 。机器学习问题就是根据,个独立同分布的观测样本: ( x 1 ,y 1 ) ,( x 2 ,y 2 ) ,( z ,y f ) ( 2 - 1 ) 其中x ,= ( 【x , ,【x , 。) 7 r ”,y ,er ,i = 1 ,z ,在一组函数 f ( x ,w ) 中,求一个最优的函 数f ( x ,w 。) ,对依赖关系进行估计,使期望风险最小: r w 】皇e l ( y ,f ( x ,w ) ) 】= 【l ( y ,f ( x ,w ) ) d p ( x ,y ) ( 2 - 2 ) 其中, ,( z ,w ) 称为预测函数集,w 为函数的广义参数;z ( y ,f ( x ,w ) ) 为损失函数,表示用 f ( x ,w ) 对y 进行预测造成的损失。它是评价预测准确程度的一啼十度量,可以根据具体问题不同 而选择不同的函数,常用的有o - 1 损失函数。 有三类基本的机器学习问题,即模式识别( 分类问题) 、函数逼近和概率密度估计。对模式 识别问题,输出y 是类别标号,两类情况下y = o ,1 ) 或y = - 1 ,1 ) ,预测函数称作指示函数,损 失函数一般是0 1 损失函数,定义为: lc 一,c 肛博;i 篇,? ? 口, 使风险最小就是b a y e s 决策中使错误率最小。在函数逼近问题中,y 是连续变量( 这里假设为单 值函数) ,损失函数可定义为: 上( y ,f ( x ,w ) ) = ( y f ( x ,w ) ) 2 ( 2 - 4 ) 即采用最小平方误差准则。而对概率密度估计问题,学习的目的是根据训练样本确定x 的概率密 度。记估计的密度函数为p ( x ,w ) ,则损失函数可以定义为: ( p ( x ,w ) ) = 一1 0 9p ( x ,w )( 2 - 5 ) 2 1 2 经验风险最小化 在卜面机器学习问题的表述中,学习的目标在于使期望风险最小化。而联合分布p ( x ,y ) 是未 知的,所以我们可以利用的信息只有样本的期望风险,但无法计算和最小化。因此t 在多数现有 统计学习方法中,都采用了所谓的经验风险最小化( e m p i r i c a l r i s k m i n i m i z a t i o n ,e r m ) 准则, 即用样本定义经验风险: 1 r 【w 】= l ( y ,f ( x ,w ) ) ( 2 - 6 ) lj = l 经验风险反映t i j i i 练误差的大小。而机器学习就是要设计学习算法使r ,。【w 】晟小,作为对 期望风险r w 1 的估计。这种估计方法存在着两个潜在的问题:首先,当样本数目有限时经验风 险和期望风险之间无法完全一致:其次,即使当样本数目趋向于无穷大时,经验风险也不一定趋 近于期望风险。这使得现有的统计学习方法在学习机的学习能力( c a p a c i t yo f t h em a c h i n e ) 和推 广能力( g e n e r a l i z a t i o na b i l i t y ) 之间存在一定的矛盾。一般,当学爿机的学习能力低时,推广能 力强,但无法有效地减小经验风险( 训练误差) ,出现所谓的“欠学习问题”;而提商了学习机的 学习能力,将经验风险( 训练误差) 降得很低时,模型的推广能力又比较差,出现所谓的“过学 9 习问题”。因此,经验风险最小并不一定意味着期望风险最小;学习机的学习能力不但与所研究 的系统有关,而且要和有限的学习样本相适应。我们需要种能够知道我们在小样本情况下建立 有效的学习和推广方法的理论。 2 2 统计学习理论 统计学习理论就是研究小样本统计估计和预测的理论,它从理论上给出了e r m 原则成立的 条件,有限样本情况f 经验风险与期望风险的关系等问题。主要内容包括四个方面【l9 】: 1 1 经验风险最小化准则下统计学习一致性的条件; 2 ) 在这些条件下关于统计学习方法推广性的界的结论; 3 ) 在这些界的基础上建立的小样本归纳推理准则; 4 ) 实现新的准则的实际方法( 算法) 。 这里学习的致性就是当训练样本数目趋于无穷大时,经验风险的最优值能够收敛到真实风 险的最优值。l 卜4 ) 中最有指导性的理论结果是推广性的界,与此相关的一个核心概念是v c 维。 2 2 1v c 维 为了研究学习过程一致收敛的速度和推广性,统计学习理论定义了一系列有关函数集学习性 能的指标,其中最重要的是v c 维( v a p n i k - c h e r v o n e n k i sd i m e n s i o n ) 。分类( 模式识别) 方法中 v c 维的直观定义是:对一个指示函数集,如果存在,个样本能够被函数集巾的函数按所有可能 的27 种形式分开,则称函数集能够把,个样本打散;函数集的v c 维就是它能打散的最大样本数 目,。若对任意数目的样本都有函数能将它们打散,则函数集的v c 维是无穷大。有界实函数的 v c 维可以通过用一定的阚值将它转化成指示函数来定义。 由v c 维的直观定义可知,f 的v c 维就是它能打散的j 巾的点的最大个数。即若存在,个 点组成的集合z j 能被f 打散,且任意,+ l 点的集合互+ 不能被f 打散,则,的v c 维就是,; 若任给正整数,都存在,个点组成的集台z j 能被f 打散,则f 的v c 维就是o o 。例如函数集 合: f = ( x ,口) = s g n ( s i n ( a x ) ) ,口r )( 2 - 7 ) 的v c 维就是。 v c 维反映了函数集的学习能力,v c 维越大则学习机器越复杂( 容量越大) 。遗憾的是,目 前尚没有通用的关于任意函数集v c 维计算的理论,只对一些特殊的函数集知道其v c 维。比如 在”维实数窄问中线性分类器和线性实函数的v c 维是”十1 ,对于一些比较复杂的学习机器( 如 神经网络) ,其v c 维除了与函数集( 神经网结构) 有关外,还受学习算法等的影响,其确定更 加困难。对于给定的学习函数集,如何( 用理论或实验的方法) 计算其v c 维是当前统计学习理 论i i 有待研究的个问题【2 9 。 2 2 2 推广l 生的界 统计学习理论系统地研究了对于各种类型的函数集,经验风险和实际风险之间的关系,即推 j 性的界【1 9 。关于两类分类问题的结论是:对预测函数集中的所有函数( 包括使经验风险最小的 1 0 中围农业大学硕士学位论文 第二章支持向量机 _ i _ 函数) ,经验风险r 。【w 】和期望风险r 【w 】之间以至少1 - 占的概率满足关系【3 0 】: r w 】托。( w 】+鬲8(h(弼in2+1)+in4) 萁中,h 是函数集鹩v c 维,0 参l 常数,t 式右边第二项称作置信区间,两式之和称捧结构 风险。结构风险是期望风殓的一个上器。这说明机器学习的实隧风险是由两部分控制的:一部分 是经验风险( 训练误差) ,另一部分是鬣信范围。置信区间反映了学习机结构的复杂性( 学习能力) 赝带来的风

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论