已阅读5页,还剩70页未读, 继续免费阅读
(模式识别与智能系统专业论文)支持向量机在工业质量检测中的应用研究.pdf.pdf 免费下载
版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
浙江大学硕l 学位论文 摘要 神经网络的理论基础是最小化经验误差,这种基于传统的渐进理论的学习方 法,在训练样本点无穷多时是适用的。但是实际的情况是训练样本点数通常是有 限的,有时甚至很少。因此在实际的工程应用中,支持向量机( s v m ) 作为一 种新型的小样本建模分析工具是更适合的。基于结构风险最小化原则的s v m , 一经提出便一起了很多研究者的关注,并取得了较多的研究成果,但是其目前的 应用领域主要集中于模式识别领域,如语音识别、图像分析和文本识别等方面。 而工业应用比较缺乏,因此本文的一个目的是探讨s v m 在工业应用中的可能性 及有效性,本文选择的主要应用领域为推断测量,用于水质c o d 值的监测和连 续重整装置中的参数检测。 在解决各个特定的工程问题时,本文又针对各自的特点,提出了相应的改进 算法以便于应用。具体的内容包括如下几个方面: 1 通过阅读大量的中英文文献,对统计学习理论、支持向量机的理论发展、 基本概念和研究方向做了比较系统完整的阐述。同时对推断测量这一应用领域进 行了简单的介绍。 2 首先分析了水质检测的背景和目前使用常用技术,在分析了常用技术的 缺陷之后,提出了利用s v m 进行水质检测的方法。该方法是一种基于最小二乘 支持向量机的在线自适应加权算法,这种算法可以自适应地选取和未知水样最相 近的标准样本进行建模,同时在建模中又利用加权的方法分别考虑了各个标准样 本重要性。实例分析表明,采用这种算法建立的模型具有比用传统技术( 如p l s , m l r ,b p 网络等) 更好的预估效果,同时预估值与标准分析值之间也显示了良 好的相关性。 3 将s v m 运用于连续重整装置中的参数预估问题,在简要介绍及说明了 工程应用中存在的问题之后,如训练数据是小样本,具有实时性的要求,而且在 线应用具有模型偏移的问题。为了消除模型偏移以及为应对训练样本较少的情 况,将移动窗口法运用于推断测量中,同时采用了最小二乘支持向量机递推估计 算法用于减少计算复杂度,以增加算法的实时性。另外,在上述递推算法的基础 上,引入了训练样本加权的思想以区分各个训练样本对于建模的重要性,进一步 提高和增强预估模型的总体性能。实例分析表明,采用这种算法建立的模型具有 比传统技术( 如b p 网络和r b f 网络等) 更好的预估效果,同时新算法的实时 性与标准s v m 和标准l s s v m 算法相比也有一定改进。最后实例分析也表明, 采用移动窗口方法可以在一定程度上扼制在线推断测量模型的模型漂移问题。 4 为弥补与克服推断测量的常用技术之一的神经网络中存在的隐节点难以 i i 摘要 确定和训练速度慢问题,提出了一种可用于多层前向神经网络模型的非迭代快速 训练算法。该算法将非线性拟合问题转化为一个近似等价的线性最小:”:乘问题, 并运用非迭代的最小二乘方法确定最佳网络权值,因而可以达到快速训练的f 1 的。同刚,为确保训练而成的模型具有最少的隐节点数,本算法根据拟合精度的 要求,逐步增加前向网络的隐节点数,直至达到拟合要求。即使当拟合精度要求 过高时,该算法也可以根据拟合精度的改善状况来确定是否继续增加隐节点,这 样的设计可以避免隐节点数的过分增加。与常规b p 网络所采用的基于梯度下降 的训练学习算法相比,经由本文算法训练而成的神经网络模型无论在拟合精度、 训练速度、泛化能力以及隐节点数等方面都要优于传统的b p 网络。 关键词:统计学习理论支持向量机水质分析化学需氧量自适应加权最小二 乘支持向量机连续重整装置模型漂移递推前向神经网络非迭代线性最小 二乘 浙姐大学硕士学位论文 a b s t r a c t i i i b e c a u s en e u r a ln e t w o r ki sb a s e d u p o ne m p i r i c a l r i s km i n i m i z a t i o na n d a s y m p t o t i ct h e o r i e s ,i ti ss u i t a b l et od e a lw i t hs i t u a t i o n sw h e r e t h ea n a o t m to f s a m p l e s i st r e m e n d o u sa n de v e ni n f i n i t e h o w e v e r , i nt h ei n d u s t r i a lp r a c t i c e ,f i n i t ea n dl i t t l e a m o u n to fs a m p l e si s u s u a l l yp r e s e n t s o an o v e l p r o m i s i n gm a c h i n el e a r n i n g t e c h n i q u es p e c i f i c a l l yd e v e l o p e d f o r a n a l y z i n g l i t t l ea m o u n to fs a m p l e s ,s v m ( s u p p o r t v e c t o rm a c h i n e ) ,w i l lb em o r es u i t a b l ei np r a c t i c a li n d u s t r i a la p p l i c a t i o n s v mh a s g a i n e di n c r e a s i n g a t t e n t i o n s p e r f o r m a n c e t r e m e n d o u s t h e o r e t i c a l r e c e n t l y f o ri t se x c e l l e n t p r o p e r t i e s a n d a d v a n c e m e n t sh a v eb e e na c h i e v e d i n c o m p a r i s o nt of e wa p p l i c a t i o nc a s e ss of a rw h i c h a r el i m i t e dt os p e e c hr e c o g n i t i o n , i m a g ep r o c e s s i n ga n d t e x tc l a s s i f i c a t i o ne t c e s p e c i a l l yt h e r ei sal a c ko fi n d u s t r i a l a p p l i c a t i o n s oi nt h i st h e s i s ,w ea t t e m p t t oa p p l ys v mi ni n d u s t r i a lp r a c t i c ea n dw e f o c u so u ra t t e n t i o no ni n d u s t r i a li n f e r e n t i a lm e a s u r e m e n t w h i l ec o p i n gw i t hs p e c i f i ce n g i n e e r i n gp r o b l e m s ,s e v e r a lv a r i e da l g o r i t h m sh a v e b e e np r o p o s e da n d a p p l i e di nt h i st h e s i s t h em a i n c o n t r i b u t i o n so ft h i st h e s i sa r ea s f o l l o w s : 1 r e v i e wt h ep r i n c i p l e s ,d e v e l o p m e n ta n ds t a t e o f - a r tt e c h n i q u e so fs t a t i s t i c a l l e a r n i n gt h e o r ya n ds u p p o r tv e c t o rm a c h i n e i nt h em e a d _ t i m e ,t h ec o n c e p t so f i n d u s t r i a li n f e r e n t i a lm e a s u r e m e n ta r ea l s ob r i e f l yi n t r o d u c e d 2 a f t e rr e v i e w i n gt h ep o p u l a rt e c h n i q u e su t i l i z e di nw a t e rq u a l i t ym o n i t o r i n gm a d a n a l y z i n gt h e i rd i s a d v a n t a g e s ,an o v e lm e t h o dt or a p i d l yd e t e c tc o d ( c h e m i c a l o x y g e nd e m a n d ) i np o l l u t e d w a t e rw i t hu v ( u l t r a - v i o l e t ) s p e c t r o a n a l y s i si s p r o p o s e d t h i sm e t h o du t i l i z e s a no n l i n ea l g o r i t h mb a s e du p o nl s s v m ( 1 e a s t s q u a r es u p p o r tv e c t o rm a c h i n e ) ,w h i c h c a r lb u i l da d a p t i v em o d e l st op r e d i c tt h e c o dv a l u e so fl l n k n o w nw a t e rs a m p l e sq u i c k l ya n da c c u r a t e l y i nt h em o d e l i n g p r o c e s s ,e v e r yt r a i n i n gs a m p l e i sa l s oa s s i g n e dap r i o rw e i g h tt ot a k et h e i r s i g n i f i c a n c e t ot h ef i n a l p r e d i c t i v e m o d e li n t oa c c o u n t p r a c t i e a l a p p l i c a t i o n r e s u l t ss h o wt h a tt h i sa d a p t i v ea l g o r i t h mc a nb u i l db e t t e re s t i m a t i o nm o d e l st h a n 也et r a d i t i o n a lm o d e l i n gt e c h n i q u e s ,s u c ha sp l s ,m l ra n db pn e u r a ln e t w o r k e t c m e a n w h i l e ,t h en e wc o dm o d e l s h o w s a g o o d c o r r e l a t i o nb e t w e e nc o d e s t i m a t e dv a l u e sa n dc o d a n a l y s i sv a l u e s 3 t h em e t h o d o l o g yb a s e du p o nl s s v mf o ro n - l i n ei n f e r e n t i a lm e a s u r e m e n th a s b e e np r o p o s e da n da p p l i e di n p a r a m e t e re s t i m a t i o np r o b l e me n c o u n t e r e d i na c o n t i n u o u s c a t a l y t i cr e f o r m i n g u n i t t od e a lw i t hm o d e ld e v i a t i o np r o b l e m , m o v i n gw i n d o w sf r a m e w o r k i si n c o r p o r a t e di n t oi n f e r e n t i a lm e a s u r e m e n t m e t h o d 1 va b 目口c l t h a t1 sb a s e du p o nl s s v m t or e d n c ec o m p u t a t i o n a ll o a df u r t h e r , ar e c u r s i v e l s s v ma l g o r i t h mi su t i l i z e d o nt h eo t h e rh a n d ,e v e r yt r a i n i n gs a m p l ei sa l s o a s s i g n e d ap r i o r w e t g h tb yt a k i n gt h e i rr e s p e c t i v e c o n t r i b u t i o nt ot h ef i n a l p r e d i c t i v em o d e li n t oa c c o u n t t h e o r e t i c a la n a l y s i sa n da p p l i c a t i o nr e s u l t ss h o w t h a tt h i sa l g o r i t h mc a nc o n s t r u c ta n d m o d i f yo n l i n es o f ts e n s o rm o d e lr a p i d l ya n d c i r c u m v e n tm o d e l d e v i a t i o n ,a c o n u t l o n p r o b l e mp r e s e n t i ni n f e r e n t i a l m e a s u r e m e m ,e f f i c i e n t l y s i m u l a t i o nr e s u l t sa l s os h o w t h a tt h ec o m p u t a t i o n a ll o a d o ft h i sp r o p o s e da l g o r i t h mi sl o w e rt h a ns t a n d a r ds v ma n dl s s v m a l g o r i t h m s f i n a l l y , s i m u l a t i o nr e s u l t ss h o wt h a ts o f ts e n s o r sb a s e do i lt h i sa l g o r i t h mh a v e m u c hb e t t e r p r e d i c t i v ea b i l i t yt h a nt h o s ec o n s t r u c t e db yu s i n gt r a d i t i o n a l s o f t s e n s o rm o d e l i n gt e c h n i q u e s ,s u c ha sr b fn e u r a ln e t w o r ka n db pn e u r a ln e t w o r k e t c 4 t oo v e r c o m et h ec o m m o np r o b l e m s ,d i f f i c u l t yo fd e t e r m i n i n gt h e o p t i m a l s t r u c t u r ea n ds l o w t r a i n i n gp r o c e s s ,p r e s e n t i nb pn e u r a ln e t w o r k ,an o v e l n o n i t e r a t i v et r a i n i n ga l g o r i t h mf o rm u l t i l a y e rf e e d f o r w a r dn e u r a ln e t w o r kh a s b e e np r o p o s e d b e c a u s et h i s t r m m n ga l g o r i t h m i s o n l yb a s e do nl i n e a r l e a s t s q u a r e s ,a n dn oi t e r a t i v el e a r n i n gp r o c e s si sn e e d e d , i t sc o m p u t a t i o n a ll o a di s r e l a t i v e l ys m a l l o nt h eo t h e rh a n d ,t h i sa l g o r i t h md e t e r m i n e st h eb e s tw e i g h t so f n e t w o r ka n dt h em i n i m a ln u m b e ro fh i d d e nn o d e sa u t o m a t i c a l l ya c c o r d i n gt ot h e d e m a n do fm o d e lp r e c i s i o na n dt h ep e r f o r m a n c eo ft e n t a t i v em o d e l c o m p a r e d w i t ht h ew e l l - k n o w nb p ( b a c k - p r o p a g a t i o n ) n e u r a ln e t w o r k ,s i m u l a t i o nr e s u l t s s h o wt h a tt h en e w t r a i n i n ga l g o r i t h m i sm o r ee f f i c i e n ti nm o d e lp e r f o r m a n c e ,r a t e o f c o n v e r g e n c ea n dg e n e r a l i z a t i o na b i l i t y k e y w o r d s :s t a t i s t i c a ll e a r n i n gt h e o r y ;s u p p o r t r e o r m a c h i n e ;w a t e rq u a l i t y m o n i t o r i n g ;c h e m i c a lo x y g e nd e m a n d ;w e i g h t e da d a p t i v ea l g o r i t h m ;l e a s ts q u a r e s u p p o r t v e c t o r m a c h i n e ;c o n t i n u o u sc a t a l y t i cr e f o r m i n gu n i t ;m o d e ld e v i a t i o n ; r e c u r s i v e ;m u l t i l a y e rf e e d f o r w a r d n e u r a ln e t w o r k ;n o n i t e r a t i v e ;l i n e a rl e a s ts q u a r e s 浙江大学砸十学位论文 致谢 v 在论文完成之际。我衷心地感谢戴连奎副教授近三年来对我孜孜不倦的教诲 和指导。戴老师将我带入了机器学习与智能技术研究的大门,不仅给予我细心的 指导,还为我提供了一个宽松、和谐的研究氛围,指引我在科研工作中一步步前 进,我的每一次进步和取得的成绩都是和戴老师的教导和帮助分不开的。戴老师 不仅在科研工作中给予我最大的帮助,同时在生活中也给予了我无微不至的关 怀。戴老师知识渊博、思维敏捷、治学态度严谨、为人乐观豁达,在工作之余, 戴老师又是一位随和平易、幽默风趣的人,和他在一起,总是令人感觉轻松愉快。 因此,他成为了我学习和生活上的榜样。 同时衷心地感谢吴铁军教授对我学习工作各个方面的帮助和指导。吴教授对 待学生总是和蔼可亲、热情幽默,令人如沐春风。吴教授的治学态度也十分严谨, 对工作总是一丝不苟,他对于科研事业孜孜不倦的追求精神令我非常敬佩和钦 佩。 武晓莉博士、常爱英博士及王彬博士在科研工作中给予我很大的帮助和支 持,在此表示诚挚的谢意。在学期间,姚晓刚、乐斌、覃旭松、陈鹏、纪竹亮、 汪敬华等同学也给了我很多的帮助,在此向他们表示深深的谢意。 特别感谢与我一个实验室的所有同学,谢谢他们给予我的帮助和支持。 对所有关心和帮助过我的同学与朋友们表示衷心的感谢。 衷心感谢我的父母和哥哥,感谢他们对我的支持与关爱,也感谢所有亲人对 我的关心和爱护。 最后感谢所有关心和爱护我的人,祝他们一生平安。 方骏 二零零四年二月于求是园 浙江大学碳“t 学位论文 第一章综述 统计方法是我们在面对数据而又缺乏理论模型时最基本( 同时也是唯一的) 分析处理手段。然而传统的统计学理论研究的是渐近性理论,即当样本数具有趋 向于无穷大时候的极限特性,譬如估计的一致性、无偏性和估计方法的界等概念。 实际应用的情况却常常是面对有限数量的样本,这时很多传统的统计学方法便难 以取得理想的效果。因此作为专门用于小样本统计分析的统计学习理论便日益受 到重视,其为研究有限样本情况下的统计模式识别与更广泛的机器学习问题建立 了个较好的理论框架,同时也发展了一种新的模式识别方法一支持向量机,能 够较好的解决小样本学习问题。本章便是对相关的基本内容进行介绍和总结。 1 1 统计学习理论发展概述 1 1 1 统计学习理论的发展历史 学习问题的研究历史可以分为4 个阶段( v a p n i k v n ,1 9 9 8 ) ,他们分别是: 一、第一个学习机器的创立;二、学习理论的基础创立;三、神经网络的创立; 四、神经网络替代方法的创立。 r o s e n n a t t 在1 9 6 2 年提出了第一个学习机器的模型,称作感知器,这标志着 人们对学习过程机进行数学研究的真正开始。感知器的思想并不十分新颖,已在 神经生物学领域中被讨论多年了。但是不寻常的是,r o s e n b l a t t 将这个模型表现 为一个计算机程序,并经由简单的试验说明这个模型具有一定的推广能力。接着, n o v i k o f f 于1 9 6 2 年证明了学习机器具有推广能力的原因和最小化训练集上的错 误分类数具有一定联系。这一结论使很多学者认为学习机器具有推广性的唯一因 素就是使它在训练集上的误差最小。这导致了对学习过程的研究分化为两个分 支:学习过程的应用分支和学习过程的理论分析分支。应用分支认为,要得到好 的推广性的学习机器只要选择能使训练误差最小的学习器就可以了。而理论分析 分支认为,最小化训练误差的原则不是不证自明的,而是要证明的。学习过程的 理论分析的主要目的就是找到能够达到最好推广能力的归纳原则,并构造算法实 现这一原则,这种想法可视为统计学习理论的起源。接着t i k h o n o v 、n a n o v 和 p h i l l i p s 发现了能够解决不适定问题的正则化原则( t i k h o n o v , 1 9 6 3 ;p h i l l i p s ,1 9 6 2 ; i v a n o v , 1 9 6 2 ) ,这种思想及其正贝l j 化技术在统计学引发了深远的影响。为了从范 围较宽的集合( 非参数集合) 中估计概率密度,必须采用某种新的推理方式,其 中便利用了正则化技术。在2 0 世纪6 0 年代,r o s e n b l a t t 、p a r z e n 、c h e n t s o v 提出 了几种此类( 非参数) 算法( r o s e n b l a t t ,1 9 5 6 ;p a r z e n ,1 9 6 2 ;c h e n t s o v , 1 9 6 3 ) 。而 第一章综述 v a p n i k 和s t e f a n y u k ( 1 9 7 8 ) 发现了创建此类算法的一般方法,它是建立在解决 不适定问题的标准做法上的,从而一举奠定了非参数统计学的基础。s o l o m o n o f f 、 k o l m o g o r o v 和c h a i t i n 在六十年代,提出了算法复杂度的思想,这种思想可是视 为信息论和统计学中最伟大的思想之一,丌创了推理问题的信息论方法 ( s o l o m o n o f r ,1 9 6 0 ;k o h n o g o r o v , 1 9 6 5 ;c h a i t i n ,1 9 6 6 ) 。同时在这一思想的基础 上,r i s s m a e n ( 1 9 7 8 ) 提出了对于学习问题的最小描述长度( m d l ,m i n i m a l d e s c r i p t i o n l e n g t h ) 的归纳原则。另外,早在1 9 6 8 年,v a p n i k 和c h e r v o n e n k i s 便 针对于指示函数集( 即模式识别问题) ,提出了v c 熵和v c 维的概念,这是统 计学习理论的核心理念。利用这些概念,泛函空间的大数定理被发现,v a p n i k 等人也研究了这一定理与学习过程的联系,并得到了关于收敛速度的非渐近界的 主要结论。在1 9 7 1 年,v a p n i k 和c h e r v o n e n k i s 发表了这些工作的完全证明。所 得到的这些界使得他们在1 9 7 4 年提出了结构风险最小化归纳原则,从而完成了 模式识别学习理论。 在1 9 8 6 年,由l e c u n 、r u m e l h a r t 、h i n t o n 和w i l l i a m s 分别独立地提出了同 时构造感知器所有神经元的向量系数的方法,反向传播算法,也常称为b p ( b a c k p r o p a g a t i o n ) 算法。这种利用梯度下降的方法,人们可以构造神经网络来逼近任 意的预期函数,尽管基于梯度的算法只能保证找到局部极小点。反向传播技术的 发现可以视为神经网络的第二次诞生,但是在此后的1 0 年的神经网络研究中, 并没有从本质上推进对学习过程本质的认识。 近几年,对神经网络的替代方法的研究吸引了人们更多的注意力。尤其是关 于结构风险最小化原则和最小描述长度原则成了分析研究的热点之一,和传统的 统计分析中的渐近性理论形成对比,关于小样本数理论的讨论研究广泛地开展起 来了。 1 。1 2 统计学习理论的基本概念 统计学习问题可以视为一个更广泛问题的特例,那就是基于数据的机器学习 问题。基于数据的机器学习问题是现代智能技术中十分重要的一个方面,主要研 究如何从一些独立、随机的观测数据( 样本数据) 出发得出目前不能经由原理分 析得到的规律和关系,利用这些规律去分析客观对象,从而对未来的新数据或无 法观测的数据进行预测。当我们将要研究的规律抽象为分类关系时,这种机器学 习问题便是模式识别,而当要得到的规律是函数关系时,这便归结为回归建模的 问题。由于我们将在基于数据的机器学习这个更大的领域开始讨论与分析,因此 在此先将涉及的基本概念解释如下: 学习如果一个系统可以经由某种过程或者程序达到改进其自身性能的目 的,我们便称之为学习。 浙江夫学顾十学位论文 机器学习主要研究由采集样本出发得出目前尚不能通过原理分析得到的 规律,并利用这些规律对未来数据或无法观测的数据进行预测”j 。 模式通过观测或检测从具体事物获取的具有时间和空间分布特性的信息 集合,称之为模式;而将所属的类别或同一类中模式的总体定义为模式类( 边 肇祺、2 0 0 0 ) 。 模式识别通过对表征事物的各种特征信息进行分析及处理,从而将某一 具体事物正确地归入某一特定类别的过程与方法。 传统的统计学理论基于样本数据量无穷大前提的渐近理论分析。 统计学习理论研究小样本估计和预测的理论( v a p n i k v n ,1 9 9 8 ) 。 1 1 3 统计学习理论的基本问题 机器学习问题的基本模型可以用图1 1 来表示。其中系统是我们所要研究与 分析的对象,其在一定的输入x 下得到一定的输出y ,学习机是我们得到的规律 的总和表示,预测输出为多。机器学习的目的便是由给定的训练样本求取对系统 输入输出之间依赖关系的估计,使学习机可以对未知的输入作出尽可能准确的预 测( 边肇祺,2 0 0 0 ) 。 输1 苎一一系统( s y 。t 。) l r ! 熊坠o ; l l 三三三仁:i 这样上述机器学习问题可以表述为:己知变量_ y 与输入x 之间存在一定的未 知依赖关系,即存在一个未知的联合概率f ( x ,y ) ,机器学习就是根据 个独立 ( x l ,y 1 ) ,( x 2 ,y 2 ) ,( x 。,y 。) ( 1 - 1 - 1 ) 在一个函数集合 ,( x ,酊) ( 0 7 是函数广义参数集合,万q ) 中,找到一个最优 的函数,( z ,珂。) ,使预测的期望风险: r ( 万) = 工( _ y ,( x ,口口) ) d f ( x ,y ) ( 1 1 _ 2 ) 最小。其中三( 弘f ( x ,刃) ) 为由于采用f ( x ,刃) 对y 进行预测而造成的损失。对于不 同类型的学习问题,可以引入不同形式的损失函数,这样便提出了以下三种典型 第一章综述 二、三种主要的学习问题 上述的学习问题是一般性的表述,利用不同的损失函数形式,我们可以得到 如下的三类基本问题:模式识别、回归函数估计和概率密度估计( v a p n i kv n 1 9 9 8 ) 。 对于模式识别问题,系统输出的是类别标号。这里仅讨论二分类问题,在这 种情况下y = 0 ,1 ) 或y = 一1 ,1 ) 是二值函数,这时的预测函数也称为指示函数 ( i n d i c a t o r h m c t i o n s ) 或判别函数。采用的损失函数可以是以下形式: 地抛硼= 0蒡多主麓男 h , 这时期望风险( 1 1 2 ) 就是分类误差的概率。因此当概率分布f ( x ,y ) 未知时, 对于训练样本的模式识别问题便是寻找一个能够最小化分类误差的函数。 对于回归函数估计问题,这时y 是一个连续变量( 这里仅讨论单值函数的问 题) ,它是输入x 的函数。而f ( x ,刃) ,万e q 是包含回归函数 f ( x ,吼) = l y d f ( y lx )( 1 1 4 ) 的实值函数集合。如果f ( x ,刃) l :,那么定义损失函数 l ( y ,f ( x ,叮) ) = ( y f ( x ,万) ) 2( 1 1 - 5 ) 当概率分布f ( x ,y ) 未知时,回归函数估计问题就是最小化风险函数( 1 1 2 ) 的 问题。 对于概率密度估计问题,学习的目的根据训练样本确定x 的概率分布。记待 估计的密度函数为p ( x ,万) ,则损失函数可以定义为 l ( p ( x ,刃) ) = 一l o g p ( x ,珂)( 1 1 - 6 ) 三、经验风险最小化原则 由于未知概率密度分布f ( x ,y ) ,因此要最小化风险函数( 1 1 2 ) 的话,我 们只能依靠训练样本集( 1 1 - 1 ) 提供的信息。但是这样的做法,便无法直接计算 和最小化( 1 1 2 ) 式定义的期望风险。而传统的学习方法采用的是所谓的经验风 险最小化( e r m ,e m p i r i c a l r i s km i m m i z a t i o n ) 原则,即用样本集来定义经验风 险 1 ” g e m p ( w ) = 二乏:三( y ,f ( x ,刃) ) ( 1 1 - 7 ) 丹,:1 来逼近式( 1 1 2 ) 定义的期望风险。对于分类问题的损失函数( 1 1 - 3 ) ,经验风 险就是训练样本的错误分类率;对于回归估计问题的损失函数( 1 1 5 ) ,经验风 险最小化准则就是最小二乘方法;针对密度估计问题中采用的损失函数( 1 1 6 ) , 经验风险最小化原则便等价于极大似然估计方法。 浙江大学硕士学位论史 但是从期望风险最小化原则到经验风险最小化原则并没有可靠的理论依据, 只是直观上的想当然做法。于是便存在一个学习过程一致性问题( v a p n i kv n , 1 9 9 8 ) : 首先,r ( 万) 和r ( w ) 都是河的函数,概率论中的大数定理只是说明,当样 本趋于无穷多时,r 。( 面) 将以一定的概率趋近于胄( 酊) ,并没有保证使r ( 酊) 最 小的珂+ 也同样可以使r ( 刃) 达到最小值。 其次,即使有办法使上述条件在样本趋于无穷的时候得到保证,也无法认定 在这些前提下得到的经验风险最小化方法在样本数目有限时仍能得到类似好的 结果。 然而,长期以来用经验风险最小化替代期望风险最小化来解决学习问题的思 想几乎统治了这一领域的所有研究。 四、复杂性与泛化能力 在早期的神经网络研究中,人们总是将注意力集中于如何使r ( 万) 更小, 但是很快人们便发现,训练误差小的学习机器并不能总取得好的预测效果。人们 将学习机器对未来输出进行正确预测的能力称作泛化能力( g e n e r a l i t y a b i l i t y ) , 或称为推广性。相反,在某些情况下,过小的训练误差反而导致泛化能力大幅下 降,这就是在训练神经网络过程中经常会碰到的过学习( o v e r f i t t i n g ) 问题。 发生过学习现象的原因一般有以下两个,是学习样本不充分,另一个便是 学习机器设计不合理,这两个因素也是相互联系的。例如,在神经网络的学习训 练过程中,对有限的训练样本,即使经验风险可以很快收敛到很小甚至为零,极 限情况就是网络的学习能力强到足以记住每一个训练样本。即便如此我们仍不能 保证训练完成的神经网络对于新的样本,具有好的预测能力。事实上,如果当用 一个十分复杂的模型去拟合有限样本时,常常导致学习机器丧失良好的推广能 力,这种现象就是在有限样本下学习机器的复杂性与推广性之间的矛盾。在很多 情况下,由于训练样本的有限性,即使我们已知样本是产生自某个比较复杂的模 型,用相对简单的预测函数学习的效果也要好于用复杂的预测函数学习的效果。 因此,我们可以得到如下结论( 边肇祺,2 0 0 0 ) : 1 ) 经验风险最小并不一定就意味着期望风险最小; 2 ) 学习机器的复杂性不但与所研究的系统有关,而且要和有限的学习样本 相适应。 在有限样本情况下,学习精度和泛化能力之间矛盾似乎是不可调和的。采用 复杂的学习机器虽然容易使学习误差更小,却往往丧失推广性。因此,人们研究 了很多解决办法,如在训练中增加与学习函数复杂度相关的惩罚项,或者利用交 叉检验等方法进行模型选择以控制模型复杂度等等。但这些方法大都源于经验, 第一章综述 | _ 面缺乏完善的理论体系。 1 1 4 统计学习理论的核心内容 统计学习理论被认为足目前针对小样本统计估计和预测学习问题的最佳理 论。它从理论上较系统地研究了经验风险最小化原则成立的条件、有限样本集条 件下经验风险与期望风险的关系以及如何利用这些理论找到新的学习原则和方 法等问题。其核心内容包括以下四个方面( v a p n i k vn ,1 9 9 8 ) : 1 ) 经验风险虽小化原则卜 的统计学习一致性的条件; 2 ) 学习过程收敛速度的非渐近性理论; 3 ) 控制学习过程的泛化能力的理论; 4 ) 构造学习算法的理论; 以上内容中最重要的理论成果就是泛化能力的界,它也是支持向量机这一新 兴机器学习技术的理论基础。与其相关的核心概念是v c 维和结构风险最小化原 则。 一、v c 维 为研究经验风险最小化函数集的学习一致收敛速度和推广性,统计学习理论 定义了一些指标来衡量函数集的性能,其中最重要的就是v c 维 ( v a p n i k c h e r v o n e n k i sd i m e n s i o n ) 。针对于模式识别的问题,v c 维可以直观定 义为:对于一个指示函数集 f ( x ,刃) ,0 7 q ,如果存在h 个样本能够被函数集里 的函数按照所有可能的2 种形式分开,则称函数集 ,( x ,刃) ,巧q 能够把h 个样 本打散( s h a t t e d n g ) 。而一个函数集的v c 维就是该函数集能够打散的最大样本 数目h 。如果对于无穷多的样本数,总有函数集能打散它们,则该函数集的v c 维便是无穷大。一般实值函数的v c 维可以通过一个域值将实值函数转化为指示 函数来加以定义。 v c 维是统计学习理论的核心概念,它是目前为止对函数集学习性能的最好 描述指标。一般而言,v c 维越大,学习机器的学习能力就越强,但同时学习机 器的复杂度也越高( 容量越大) ,这样可能导致生成的学习机器的泛化能力反而 降低。遗憾的是,目前还没有通用的关于计算任意函数集的v c 维的理论,只有 一些特殊函数集的v c 维可以准确知道,例如在以维实数空间中线性分类器和线 性实函数的v c 维是斛l 。而对于一些比较复杂的学习机器( 比如神经网络) , 其v c 维不仅与函数集的选择有关,而且也受学习算法等因素的影响。因此要确 定其v c 是十分困难的。对于给定的学习函数集,如何用理论或实验的方法计算 并确定其v c 维是当前统计学习理论研究中有待解决的一个难题。 浙江大学硕l j 学位论文 二、推广性的界 针对于各种类型的函数集合,统计学习理论系统地研究了经验风险和实际风 险之间的关系,也即推广性的界( v a p n i kvn ,1 9 9 8 ) 。这个概念是分析学习机 器的性能和发展新的学习算法的重要基础。根据这一重要理沦成果,对于指示函 数集中所有的函数而言,经验风险r 。( 酊) 和真实风险r ( 刃) 之间以至少1 1 7 概率 满足如下关系: r ( 刃) r e i n p ( 酊) + ,h ( 1 n ( 2 n h ) + 1 - l n ( q 4 ) ) ( 1 1 _ 8 ) y, 其中h 是函数集的v c 维,而n 则是训练样本数。这样我们可以看到,学习机器 的实际风险事实上由两部分组成:是训练样本的经验风险,另一部分是置信范 嗣,这一部分不仅同置信水平l 一卵有关,而且同学习机器的v c 维和训练样本数 有关系。将式( 1 1 8 ) 简化为如下形式: b 尺( 万) r ( 刃) + 巾( 二)( 1 1 - 9 ) ” 从上述的简化式( 1 1 - 9 ) 中可以看出,在训练样本数有限的情况下,学习机器的 v c 维h 越高,则置信范围就越大,导致实际风险与经验风险之间可能的差就越 大。这样就解释了为什么一般情况下,选用过于复杂的学习机器或神经网络往往 得不到很好效果的原因。当样本数目有限时,在设计学习机器时,就不但要使学 习机器的经验风险最小,还要使其对应的v c 维尽量小以缩小置信范围,从而达 到使实际风险最小的目的,也即对未来样本有较好的预测能力。 另外,需要注意的是,推广性的界是对于最坏情况下的结论,在很多情况下 所得出的界是很松的,尤其当学习机器的v c 维比较高时更是如此。有试验研究 表明,当h n o 3 7 时,这个推广的界是肯定松弛的,而且当v c 维为无穷大时, 这个界便不再成立。这里讨论的界只有在同一类函数集之间进行比较时才有效, 因此可以指导我们从已存在的函数集中选择最优的函数,而对于不同的函数集之 间进行比较却不一定有效。 三、结构风险最小化 由上述讨论可知,传统的机器学习方法中普遍采用的经验风险最小化原则 ( e r m ) 在样本数目有限时是并不合理的,因为我们需要同时最小化经验风险 和置信范围,这样才可以达到最小化期望风险的目的。在传统的机器学习方法中, 我们选择机器学习模型和训练算法的过程就是优化置信范围的过程,如果选择了 合适的学习模型,就可以取得比较好的效果。但是由于对于置信范围中,我们通 常缺乏必要的了解,因此只能依赖于先验知识和使用者的经验来选择模型及算 法,这样便造成了诸如神经网络等学习方法对于使用者的“技巧”的过分依赖。 相反的,统计学习理论采用了一种新的策略来解决上述问题,就是将函数集 第一章综述 合s = f ( x ,酊) ,刃q 分解为一个函数子集序列( 或称之为子集结构) s 1c s 2 c s 3 c s 女c c s ( 1 1 _ l o ) l 述各个子集按照置信范围巾的大小来排列,也就是按照v c 维的大小来排列, 即满足 h 1 h ,h h ( 1 1 - 1 1 ) 这
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 全国预防接种技能竞赛实践操作训练题库及答案
- 某电厂高空坠落安全措施及应急预案
- 弱电桥架安装施工工艺
- 2025-2026学年高一数学期中模拟试卷(人教版)试卷
- 柳州市人民医院《护理抢救工作制度》《防范住院患者走失管理制度》考试试题及答案
- 2025-2026年网络营销师考试移动营销策略模拟试题
- 2025-2026年医学考研免疫学重点知识巩固习题
- 2025-2026年考研法学宪法与行政法模拟试卷
- 2025-2026年区块链技术共识机制与智能合约解析模拟试题
- 2026年压疮创面换药操作质量指南考试试卷试题及答案
- 青少年脊柱侧弯诊疗指南(2026版)
- 关键工序工艺参数设定规范
- 2026年全国英语等级考试(PETS)三级模拟试题及答案二
- 《宁夏闽宁镇》课件
- 2026及未来5年中国实战射击系统行业发展研究报告
- 2026年吉林省中考数学真题
- 幼儿多动症早期康复训练指导手册
- (2026版)《中华人民共和国生态环境法典》培训
- 江苏太仓市城市发展集团有限公司招聘笔试题库2026
- 危重患者深静脉血栓的预防和护理
- 铜业企业制氧站、输氧管道防火安全管理规章制度
评论
0/150
提交评论