版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
1、支持向量机算法理论与算法研究摘要支持向量机是建立在统计学习理论VC维理论和结构风险最小化原理基础上的机器学习 方法。它在解决小样本、非线性和高维模式识别问题中表现出许多特有的优势,并在很大程 度上克服了 “维数灾难”和“过学习”等问题。此外,它具有坚实的理论基础,简单明了的 数学模型,因此,在模式识别、回归分析、函数估计、时间序列预测等领域都得到了长足的 发展,并被广泛应用于文本识别、手写字体识别、人脸图像识别、基因分类及时间序列预测 等。标准的支持向量机学习算法问题可以归结为求解一个受约束的二次型规划问题。对于 小规模的二次优化问题,禾I用牛顿法、内点法等成熟的经典最优化算法便能够很好的求
2、解。但是当训练集规模很大时,就会出现训练速度慢、算法复杂、效率低下等问题。目前一 些主流的训练算法都是将原有大规模的QP问题分解成一系列小的QP问题,按照某种迭代策略,反复求解小的QP问题,构造出原有大规模 的QP问题的近似解,并使该近似解逐渐收敛到最优解。但是如何对大规模的QP问题进行 分解以及如何选择合适的工作集是当前训练算法所面临的主要问题,并且也是各个算法优劣 的表现所在。另外,现有的大规模问题训练算法并不能彻底解决所面临的问题,因此,在原 有算法上进行合理的改进或研究新的训练算法势在必行。本文首先对支持向量机的理论进行 系统的介绍,进而对当今SVM训练算法进行综述,并对未来的研究方向
3、进行展望。 关键词模式识别;支持向量机;支持向量分类;支持向量回归1统计学习理论(SLT简介131.1背景现实世界中存在大量我们尚无法准确认识但却可以进行观测的事物,如何从一些观测数据 (样本)出发得出目前尚不能通过原理分析得到的规律,进而利用这些规律预测未来的数据,这 是统计模式识别(基于数据的机器学习的特例)需要解决的问题。统计是我们面对数据而又缺乏 理论模型时最基本的(也是唯一的)分析手段。Vapnik等人早在20世纪60年代就开始研究有 限样本情况下的机器学习问题,但这些研究长期没有得到充分的重视。近十年来,有限样本情况 下的机器学习理论逐渐成熟起来,形成了一个较完善的SLT体系。而同
4、时,神经网络等较新兴的 机器学习方法的研究则遇到一些重要的困难,比如如何确定网络结构的问题、过拟合与欠拟合问 题、局部极小点问题等。在这种情况下,试图从更本质上研究机器学习的SLT体系逐步得到重 视。1992- 1995年,Vapnik等在SLT勺基础上发展了 SVI算法,在解决小样本、非线性及 高维模式识别问题中表现出许多特有的优势,并能够推广应用到函数拟合等其它机器学习问题。 很多学者认为,它们正在成为继模式识别和神经网络研究之后机器学习领域中新的研究热点,并 将推动机器学习理论和技术有重大的发展。神经网络研究容易出现过拟合问题,是由于学习样本 不充分和学习机器设计不合理的原因造成的,由于
5、此矛盾的存在,所以造成在有限样本情况下:1)经验风险最小不一定意味着期望风 险最小;2)学习机器的复杂性不但与所研究的系统有关,而且要和有限的学习样本相适应。 SLT体系及其SVMJ法在解决“小样本难题”过程中所取得的核函数应用等方面的突出进展令 人鼓舞,已被认为是目前针对小样本统计估计和预测学习的最佳理论。1.2原理Vapnik的SLT勺核心内容包括下列四个方面:1)经验风险最小化原则下统计学习一致性的条件;2)在这些条件下关于统计学习方法推广性的界的结论;3)在这些界的基础上建立的小样本归纳推理原则;4)实现这些新的原则的实际方法(算法)。设训练样本集为凶,yn,xn ,xRm,yR,其拟
6、合(建模)的数学实质是从函数集中选 出合适的函数f(x),使风险函数:R f 二 XYW 一 f (x)2P(x, y) dxdy(1)为最小。但因其中的几率分布函数P(x,为未知,上式无法计算,更无法求其极小。传统的统计数学遂假定上述风险函数可用经验风险函数Rempf 代替:Rempg (y吟)2根据大数定律,式(2)只有当样本数n趋于无穷大且函数集足够小时才成立。这实际上是假定最小 二乘意义的拟合误差最小作为建模的最佳判据,结果导致拟合能力过强的算法的预报能力反而降 低。为此 SLT用结构风险函数Rhf 代替Remp f ,并证明了 Rhf可用下列函数求极小而得:r“丽 2n /h+1)I
7、 n(6/4):.心、miinRempf + jj(3)此处n为训练样本数目,S为VC维空间结构,h为VC维数,即对函数集复杂性或者学习 能力的度量。1-为表征计算的可靠程度的参数。SLT要求在控制以VC维为标志的拟合能力上界(以限制过拟合)的前提下追求拟合精度。 控制VC维的方法有三大类:1拉大两类样本点集在特征空间中的间隔;2缩小两类样本点各自在特征空间中的分布范围;3降低特征空间维数。一般认为特征空间维数是控制过拟合的唯一手段,而新理论强调靠前两种手段可以保证在高维特征空间的运算 仍有低的VC维,从而保证限制过拟合。对于分类学习问题,传统的模式识别方法强调降维,而SVM与此相反。对于特征
8、空间中两类点不能靠超平面分开的非线性问题,SVM采用映照方法将其映照到更高维的空间,并求得最佳区分二类样本点的超平面方程,作为判别未知样本的判据。这样,空间维数虽 较高,但VC维仍可压低,从而限制了过拟合。即使已知样本较少,仍能有效地作统计预报。对于回归建模问题,传统的化学计量学算法在拟合训练样本时,将有限样本数据中的误差也 拟合进数学模型了。针对传统方法这一缺点,SVR采用“;不敏感函数”,即对于用f (x)拟合目标值y时f(x)=wTx+b,目标值乂拟合在yi-wTx-b兰e时,即认为进一步拟合 是无意义的。这样拟合得到的不是唯一解,而是一组无限多个解。SVR方法是在一定约束条件 下,以w
9、2取极小的标准来选取数学模型的唯一解。这一求解策略使过拟合受到限制,显著提高 了数学模型的预报能力。2支持向量分类(SVC算法2.1线性可分情形SVM!法是从线性可分情况下的最优分类面(Optimal Hyperplane )提出的。所谓最优分类面就是要求分类面不但能将两类样本点无错误地分开,而且要使两类的分类空隙最大。 d维空间中线性判别函数的一般形式为gx =wtx b,分类面方程是wtx 0 我们将判别函数进行归一化,使两类所有样本都满足g x -1 ,此时离分类面最近的样本的g(x =而要求分类面对所有样本都能正确分类,就是要求它满足1 yi (wtb) 1 _0,i =1,2, ,n
10、。(4)式(4)中使等号成立的那些样本叫做支持向量(Support Vectors )。两类样本的分类空隙 (Margin)的间隔大小:Margin因此,最优分类面问题可以表示成如下的约束优化问题,函数=2/ w即在条件(4)的约束下,求(6)的最小值。为此,可以定义如下的Lagra nge函数:nL(w,b, : ) wt w - : J y/wk b)-1i 4其中,ai0为Lagrange系数,我们的问题是对w和b求Lagrange函数的最小值。把式(7)分别对w、b、: i求偏微分并令它们等于0,得::Ln0= w i yi xi.:wi iyi:Ln0=y bid -i:L希0= i
11、 yi (w0 xi b) -1 = 0以上三式加上原约束条件可以把原问题转化为如下凸二次规划的对偶问题:n 1 n nmax 瓦 ai Z Zjy/xXj)i=12 i=1 j =1ajZ0,i =1,.,nn7为 a: yi=0s.t(8)I这是一个不等式约束下二次函数机制问题,存在唯一最优解。若:*为最优解,(9)nw*z“a*yiXii =1:*不为零的样本即为支持向量,因此,最优分类面的权系数向量是支持向量的线性组合4 o.*T.b可由约束条件aiyi (w x +b)-1=0求解,由此求得的最优分类函数是(10)nf x 二 sgn(w ) x *b H sgn(* ai yixi
12、x b )*i=1sgn()为符号函数。2.2非线性可分情形当用一个超平面不能把两类点完全分开时(只有少数点被错分),可以引入松弛变 戛(j 0, i 二行),使超平面 wtx- b = 0满足:y.(wTx +b)一耳(11)当0 1时样本点*仍旧被正确分类,而当 1时样本点*被错分。为此,引入以下目标 函数:(w,)(12)其中C是一个正常数,称为惩罚因子,此时SVK可以通过二次规划(对偶规划)来实现:1 maX 瓦 ai -瓦 E 闪口 j yiyj(x Xj ) i 二 2 i 二 j 生 s.t 0 兰 ai兰 C,i =1,.,n(13)n迟 aiyi =03支持向量机(SVM的核
13、函数若在原始空间中的简单超平面不能得到满意的分类效果,则必须以复杂的超曲面作为分界 面,SVMT法是如何求得这一复杂超曲面的呢?首先通过非线性变换g将输入空间变换到一个高维空间,然后在这个新空间中求取最优线 性分类面,而这种非线性变换是通过定义适当的核函数(内积函数)实现的,令: TOC o 1-5 h z K*)彳(xj 区)(14)用核函数K(Xi,Xj)代替最优分类平面中的点积xt*,就相当于把原特征空间变换到了某一 新的特征空间,此时优化函数变为:nn nQa 八 ai二二: i: j%yjK X ,Xj(15)i=12 i=1 j =1而相应的判别函数式则为:f x=sgn(w )t
14、 (x) b =sga. yiK(Xi,X)n b )(16)i=1其中Xj为支持向量,X为未知向量,(16)式就是SVM在分类函数形式上类似于一个神经网 络,其输出是若干中间层节点的线性组合,而每一个中间层节点对应于输入样本与一个支持向 量的内积,因此也被叫做支持向量网络,如图1图1支持向量网络预报未知样本类别的示意图Fig.1 The sketch map of support vector network to predict an unknown sample由于最终的判别函数中实际只包含未知向量与支持向量的内积的线性组合,因此识别时的 计算复杂度取决于支持向量的个数。目前常用的核函数
15、形式主要有以下三类,它们都与已有的算法有对应关系。(1)多项式形式的核函数,即Kx,n二&丁务1q,对应SVM是一个q阶多项式分类器。径向基形式的核函数,即K(x,X.)=exp(-凶凹,对应SVM是一种径向基函数分 类器。S形核函数,如K(x5X.)=tanh(v(xTx)+C)5K U SVM实现的就是一个两层的感知器神经网络, 只是在这里不但网络的权值、而且网络的隐层节点数目也是由算法自动确定的。4支持向量回归(SVR方法SVR算法的基础主要是名不敏感函数(名-insensitive function)和核函数算法。若将拟合的数学模型表达为多维空间的某一曲线,则根据;不敏感函数所得的结果
16、就是包络该曲线和训练点的“;管道”。在所有样本点中,只有分布在“管壁”上的那一部分样本点 决定管道的位置。这一部分训练样本称为“支持向量” (support vectors) o为适应训练样本集 的非线性,传统的拟合方法通常是在线性方程后面加高阶项。此法诚然有效,但由此增加的可调 参数未免增加了过拟合的风险。SVR采用核函数解决这一矛盾。用核函数代替线性方程中的线性项可以使原来的线性算法“非线性化”,即能作非线性回 归。与此同时,弓进核函数达到了 “升维”的目的,而增加的可调参数却很少,于是过拟合仍 能控制。 4.1线性回归情形设样本集为:力,音,y*xRn, y巳回归函数用下列线性方程来表示
17、, f x 二 wtx b (17)其中C是设定的惩罚因子值,、Vapnik提出运用下列不敏感损耗函数:0(18)最佳回归函数通过求以下函数的最小极值得出,亦歹总)*卜十|主十立为松弛变量的上限与下限。for | 压 otherwise通过下面的优化方程:7113x(1,01*)= max-K 虬-C农-L)-日尸=|(19)(20)在下列约束条件下:求解:11 1-zz24I 4 j 4 argmin JI-Z纪i1(1 (fr i由此可得拉格朗日方程的待定系数:i和*,从而得回归系数和常数项:1w - 7-i 7” Xii =1b = -X Wxr - xs 12 r s r s(22)4
18、.2非线性回归情形类似于分类问题,一个非线性模型通常需要足够的模型数据,与非线性SV (方法相同,一个非线性映射可将数据映射到高维的特征空间中,在其中就可以进行线性回归。运用核函 数可以避免模式升维可能产生的维数灾难,即通过运用一个非敏感性损耗函数,非线性SVR 勺解即可通过下面方程求出:(23)其约束条件为:(24)0a ; C. i= 1L ii=l由此可得拉格朗日待定系数:i和*,回归函数f(x )则为:(25)/(髯)二工(瓦-t7jxx)5 ChemSV应用软件介绍sv.以解决化学化工上问题为目的,我们参照国际文献自编了包含SVM模块的应用软件“ ChemSVM,其中SVM算法涉及到
19、凸二次规划的求解,采用了序贯极小优化 (Sequential Minimal Optimization ) 算法 如。由于SVM算法在应用上不够方便的地方主要是核函数及其参数如何选取的问题,为此,“ ChmSVM针对该问题上作了一些改进,即一方面在程序的操作界面上提供各种核函数及其参 数,给用户自由选择和研究的方便;另一方面,程序可用单纯形优化方法自动选出待选的核函数及其参数,并根据数据集留一法预报正确率最高的目标来确定最终计算 用核函数及其参数,从而建立推广能力强的数学模型。以软件使用上的方便性、算法上的先进性和 解决具体问题的有效性为目的,“ChemSVM软件将不断地发展和完善。“ Che
20、mSVM软件提供了通用的支持向量机算法。在具体应用问题上,还可以将其与数据 库(含分门别类的数据表)、知识库(含数据挖掘规则等)、原子参数(由系统自动采集)及其它 数据挖掘方法有机地集成起来。比如,“ChemSVM已与熔盐相图智能数据库相融合,使SVM算法成为熔盐相图智能数据库的有效的数据挖掘手段。这方面应用成 果已另文报导在本刊有关SVM应用的系列论文中22:。6应用前景SLT和SVM算法之所以从20世纪90年代以来受到很大的重视,在于它们对有限样本情况 下模式识别中的一些根本性问题进行了系统的理论研究,并且在此基础上建立了一种较好的通用学 习算法。以往困扰很多机器学习方法的问题,比如模型选
21、择与过拟合问题、非线性和维数灾难问 题、局部极小点问题等,在这里都得到了很大程度上的解决。而且,很多传统的机器学习方法都可 以看作是SVM算法的一种实现,因而SLT和SVM被很多人视作研究机器学习问题的一个基本框架。一方面研究如何用这个新的理论框架解 决过去遇到的很多问题;另一方面则重点研究以SVM为代表的新的学习方法,研究如何让这些理论和方法在实际应用中发挥作用。SLT有比较坚实的理论基础和严格的理论分析,但其中还有很多问题仍需人为决定。比如结 构风险最小化原则中的函数子集结构的设计、SVM中的内积函数(包括参数)的选择等。尚没有明确的理论结果指导我们如何进行这些选择。另外,除了在监督模式识
22、别中 的应用外,SLT在函数拟合、概率密度估计等机器学习问题以及在非监督模式识别问题中的应用也 是一个重要研究方向。我们认为,SLT和SVM算法(包括SVC和SVR有可能在化学化工领域得到深入和广泛的 应用,以往用人工神经网络、传统统计模式识别和线性及非线性回归等数据挖掘算法研究和处理的 化学化工数据都可能在应用SVM算法后得到更好的处理结果23:。特别是样本少、维数多的“小样本难题”,应用SVM算法建模会特别有效。可以预计,将来在分析化学的数据处理、化学数据库的智能化、有机分子的构效关系(QSARQSPR)分子和材料设计、试验设计、化工生产优化、以及环境化学、临床化学、地质探矿等多方 面都有
23、可能展开SLT和SVM算法的应用研究,并取得良好效果。参考文献Domine D., Devillers J., Chastrette M., Karcher W. Non-linear mappingfor structure-activity and structure-propertymodeli ng. Jour nal ofChemomatrics 1993, 7: 227-242Wang Ziyi, Jenq-Hwang, Kowalski Bruce R., ChemNets: Theory and Application, Analytical Chemistry, 1995,
24、67(9):1497-1504Ruffini R. et al., Using n eural n etwork for spri ngback mini mizati on ina channel formi ng process, SAE Trans. J. Mater. Manu facture, 1998, 107, 65Fuk un aga K. I ntroductio n to statistical pattern recog niti on. Academic.New York; 19725Che n Nia nyi(陈念贻),Qin Pei(钦佩),Che n Ruilia
25、 ng(陈瑞亮),LuWencong (陆文聪), Applicatio n of Patter n Recog niti on in Chemistry and Chemical Engineering(模式识别在化学化工中的应用),Peking (北京),Scie nee Publisher(科学出版社),2000Chen Nia nyi, Lu Wencong, Chemometric Methods Applied to In dustrial Optimizati on and Materials Optimal Desig n, Chemometrics and in tellig
26、e nt laboratory systems, 1999, 45, 329-333Chen Nianyi, Lu Wencong, Software Package “Materials Designer ” and its Application in Materials Research, IPMM 99, Hawaii, USA, July, 1999LU Wen co ng, YAN Li-che ng, CHEN Nia n-yi, Pattern Recog nition and ANNSApplied to the Formobility of Complex Idide,Jo
27、urnal of MolecularScie nee, 1995,11 (1) : 33Liu Liang (刘亮), Bao Xinhua (包新华),Feng Jianxing (冯建星),Lu Wen co ng (陆文聪),Che n Nia nyi (陈念贻),Molecular Sievi ng of Pin aco lone(or 1-Aryletha none) Con ta ining 1H-1,2, 4-Triazole Group andTheir Reduced Products ( a -唑基-a -芳氧烷基频哪酮(芳乙酮)及其醇式衍生物抗真菌 活性的分子筛选),Co
28、mputer and Applied Chemistry (计算机与应用化学),2002,19 (4) :465Lu Wencong (陆文聪),Bao Xinhua (包新华),Wu Lan (吴兰),Kong Jie(孔杰),Yan Licheng (阎立诚),Chen Nianyi (陈念贻),Studies on HierarchicalProjectio n Method Applied to Regularities of Formati on ofBi nary Complex Compou nd in MBr- M Br?System (二元漠化物系(MBr-lM Br?)中间 化合物形成规律的逐级投影法研究),Computer and Applied Chemistry(计算机与应用化学),2002, 19:474Lu Wencong (陆文聪),Feng Jianxing (冯建星),Chen Nianyi (陈念贻), Ternary Intermetallic Com
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026年宁强县带编教师招聘笔试备考试题及答案解析
- 2026年平舆县带编教师招聘考试参考题库及答案解析
- 2026年镇安县带编教师招聘笔试备考试题及答案解析
- 2026年奉节县带编教师招聘笔试模拟试题及答案解析
- 2026年安阳县带编教师招聘考试备考题库及答案解析
- 2026年汶川县带编教师招聘考试参考题库及答案解析
- 2026年万载县带编教师招聘考试参考题库及答案解析
- 2026年苍南县带编教师招聘考试参考题库及答案解析
- 2026年五莲县带编教师招聘考试模拟试题及答案解析
- 2026年丹寨县带编教师招聘考试备考题库及答案解析
- 企业班组安全管理标准化通用规范
- GB/T 17421.2-2016机床检验通则第2部分:数控轴线的定位精度和重复定位精度的确定
- 2021年江苏省普通高中学业水平合格性考试物理(样卷及答案)
- 部编人教版六年级道德与法治上册全册教学课件
- 课程市场信息学(完整版适合电子商务相关方面的朋友)
- 泄漏电流能力验证终期报告
- ISO15189质量体系同济医院检验科ISO15189体系文件-质量手册
- 24度锥接头设计
- 水进、水退、吉尔伯特型湖波扇三角洲亚相和微相的特征
- 公路路基土石方工程施工技术方案(最全面)
- 金工实训金工实训课件
评论
0/150
提交评论