支持向量机讲座._第1页
支持向量机讲座._第2页
支持向量机讲座._第3页
支持向量机讲座._第4页
支持向量机讲座._第5页
已阅读5页,还剩71页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

1、(Support Vector Machine)唐耀庚唐耀庚一、机器学习的基本问题和方法统计学习统计学习大量的信息大量的信息发现发现知识。知识。学习,是系统在不断重复的工作中对本身能力的增强学习,是系统在不断重复的工作中对本身能力的增强或改进,使得系统在下一次执行相同或类似任务时,或改进,使得系统在下一次执行相同或类似任务时,能比现在做得更好或效率更高。能比现在做得更好或效率更高。统计学习:不是通过发现新的事实或者开发新技术,统计学习:不是通过发现新的事实或者开发新技术,而是通过改变我们的推理、实验和观点的形成方式。而是通过改变我们的推理、实验和观点的形成方式。 从数据中学习!从数据中学习!n

2、统计学:数据分析方法统计学:数据分析方法n机器学习:基于数据的学习机器学习:基于数据的学习 人类智慧中一个很重要的方面是从实例学习的能力,通过对已知事实的分析总结出规律,预测不能直接观测的事实。在这种学习中,重要的是能够举一反三,即利用学习得到的规律,不但可以较好地解释已知的实例,而且能够对未来的现象或无法观测的现象做出正确的预测和判断推广能力。 在人们对机器智能的研究中,希望能够用机器(计算机)来模拟这种学习能力基于数据的机器学习能力问题,或者简单地称作机器学习问题。 机器学习目的是,设计某种(某些)方法,使之能够通过对已知数据的学习,找到数据内在的相互依赖关系,从而对未知数据进行预测或对其

3、性质进行判断。 机器学习机器学习1、机器学习问题的表示n根据给定的训练样本求对某系统输入输出之间依赖关系的估计,使它能够对未知输出作出尽可能准确的预测。预 测 输 出y 训练器(S)学习机(LM)输入x输出y产生器(G),产生随机向量x属于Rn ,它们是从固定但未知的概率分布函数F(x)中独立抽取的。训练器(S),对每个输入向量x返回一个输出值y,产生输出的根据是同样固定但未知的条件分布函数 F(y|x)。学习机器(LM),它能够实现一定的函数集f(x, a),a属于A,其中A是参数集合。机器学习的基本问题机器学习的基本问题机器学习就是从给定的函数集f(x,)(是参数)中,择出能够最好地逼近训

4、练器响应的函数。机器学习的目的可以形式化地表示为:根据n个独立同分布的观测样本 ,在一组函数 中求出一个最优函数 对训练器的响应进行估计,使期望风险最小 其中 是未知的,对于不同类型的机器学习问题有不同形式的损失函数。 1122( ,),( ,),( ,)nnx yx yx y ( , )f x0 ( ,)f x( , )P x y( )( , ( , )( , )RL y f xdP x yL(y,f(x,a):损失函数:已知函数对给定样本的误差2、三类基本的机器学习问题模式识别问题:输出y是类别标号,两类情况下y=1,-1,预测函数称作指示函数(Indicator Function),损失

5、函数定义见下式,使期望风险最小就是Bayes决策中使错误率最小。函数拟合问题:输出y是连续变量,它是x的函数,损失函数定义见下式:概率密度估计问题:根据训练样本确定x的概率分布p(x,w),则损失函数可定义为:),(1),(0),(,(wfywfywfyLxxx2),(-),(,(wfywfyLxx),( -log),(wpwpLxx 模式识别问题的图示样本数据集:X训练学习集测试集检验集分类关系建立优化应用y=f (X, )3、机器学习实现方法经典的参数统计估计方法n需要已知样本分布形式n样本数目趋于无穷大经验非线性方法n缺乏统一的数学理论统计学习方法n专门研究给定样本(特别是小样本情况)下

6、的机器学习规律n追求现有信息条件下的最优结果SLT中的基本概念统计方法统计方法 从观测自然现象或者专门安排的实验所得到的数据去推断该事务可能的规律性。统计学习理论统计学习理论 在研究小样本小样本统计估计和预测的过程中发展起来的一种新兴理论。【注意注意】:这里所说的“小样本”是相对于无穷样本而言的,故只要样本数不是无穷,都可称为小样本,更严格地说,应该称为“有限样有限样本本”。统计学习方法概述统计方法是从事物的外在数量上的表现去推断该事物可能的规律性。 统计方法处理过程可以分为三个阶段:n(1)搜集数据:采样、实验设计n(2)分析数据:建模、知识发现、可视化n(3)进行推理:预测、分类常见的统计

7、方法有:n回归分析(多元回归、自回归等)n判别分析(贝叶斯判别、费歇尔判别、非参数判别等)n聚类分析(系统聚类、动态聚类等)n探索性分析(主元分析法、相关分析法等)等。主要统计学习方法主要统计学习方法统计推理n用数据的似然度(likelihood)和假设(Hypothesis)的概率去预测新实例的值wBayesian学习:预测时利用所有假设的概率wMAP:预测时只利用具有最高概率的假设wML:假定所有的假设均匀分布n朴素Bayes方法(Nave Bayes, NB)基于实例的学习n最近邻方法(Nearest Neighbor)神经网络(Neural Networks)支持向量机(Support

8、 Vector Machine)神经网络固有的一些缺陷1.网络结构难以确定2.容易陷入局部最优3.采用了经验风险最小化原则(ERM),即用经验风险取代期望风险:根据概率论中的大数定理,只有当样本数目趋向无穷时,经验风险才趋向于期望风险学习机器对未来输出进行正确预测的能力称作推推广能力(广能力(也称为“泛化能力泛化能力”)。)。在某些情况下,训练误差过小反而导致推广能力的下降,这就是过学习过学习问题。神经网络的过学习问题是经验风险最小化原则失败的一个典型例子。二、结构风险最小化原则实际风险由两部分组成:n经验风险(训练误差或分类精度)nVC置信范围(VC confidence),它和学习机器的V

9、C维及训练样本数有关。结构风险最小化(SRM)的基本思想n在有限训练样本下,学习机器的VC维越高则置信范围越大,真实风险与经验风险之间可能的差别越大.这就是为什么会出现过学习现象的原因。n机器学习过程不但要使经验风险最小,还要使VC维尽量小以缩小置信范围,才能取得较小的实际风险,即对未来样本有较好的推广性。结构风险最小化传统机器学习方法中普遍采用的经验风险最小化原则在样本数目有限时是不合理的,因此,需要同时最小化经验风险和置信范围。统计学习理论提出了一种新的策略,即把函数集构造为一个函数子集序列,使各个子集按照VC维的大小排列;在每个子集中寻找最小经验风险,在子集间折衷考虑经验风险和置信范围,

10、取得实际风险的最小。这种思想称作结构风险最小化(Structural Risk Minimization),即SRM准则。结构风险最小化就是在保证分类精度(经验风险)的同时,降低学习机器的 VC 维,可以使学习机器在整个样本集上的期望风险得到控制。结构风险最小化实现SRM原则的两种思路n在每个子集中求最小经验风险,然后选择使最小经验风险和置信范围之和最小的子集。n设计函数集的某种结构使每个子集中都能取得最小的经验风险,然后只需选择适当的子集使置信范围最小,则这个子集中使经验风险最小的函数就是最优函数。支持向量机方法实际上就是这种思路的实现。VCVC维维为了研究经验风险最小化函数集的学习一致收敛

11、速度和推广性,SLT定义了一些指标来衡量函数集的性能,其中最重要的就是VC维(Vapnik-Chervonenkis Dimension)。VCVC维维:对于一个指示函数(即只有0和1两种取值的函数)集,如果存在h个样本能够被函数集里的函数按照所有可能的2h种形式分开,则称函数集能够把h个样本打散,函数集的VC维就是能够打散的最大样本数目。如果对任意的样本数,总有函数能打散它们,则函数集的VC维就是无穷大。例: 直线能将3点分散在2个空间模型一般而言,VC维越大, 学习能力就越强,但学习机器也越复杂。目前还没有通用的关于计算任意函数集的VC维的理论,只有对一些特殊函数集的VC维可以准确知道。N

12、维实数空间中线性分类器和线性实函数的VC维是n+1。Sin(ax)的VC维为无穷大。支持向量机支持向量机,Support Vector Machines,SVM可以避免以上缺陷:1)将问题转化为二次规划问题,理论上可以得到全局最优解 2)建立在统计学的VC(Vapnik-Chervonenks Dimension)维理论和结构化风险最小化原则(Structural Risk Minimization, SRM)的基础上,有效地避免了维数灾难。 3)可以较好地解决小样本问题基于统计学习理论的支持向量机根据有限的样本信息在模型的复杂性(即对特定训练样本的学习精度)和学习能力(即无错误地识别任意样本

13、的能力)之间寻求最佳折衷,以获得最好的推广能力的方法。支持向量机(Support Vector Machine-SVM),从线性可分情况下的最优分类面发展而来。 1 1、支持向量机概述、支持向量机概述1963年,Vapnik在解决模式识别问题时提出了支持向量方法,这种方法从训练集中选择一组特征子集,使得对特征子集的划分等价于对整个数据集的划分,这组特征子集就被称为支持向量(SV)。1971年,Kimeldorf提出使用线性不等约束重新构造SV的核空间,解决了一部分线性不可分问题。1990年,Grace,Boser和Vapnik等人开始对SVM进行研究。1995年,Vapnik正式提出统计学习理

14、论。三、支持向量机的背景和原理2、什么是支持向量机()、什么是支持向量机()SVM从线性可分情况下的最优分类面发展而来。最优分类面就是要求分类线不但能将两类正确分开(训练错误率为0),且使分类间隔最大。SVM考虑寻找一个满足分类要求的超平面,并且使训练集中的点距离分类面尽可能的远,也就是寻找一个分类面使它两侧的空白区域(margin)最大。过两类样本中离分类面最近的点且平行于最优分类面的超平面上H1,H2的训练样本就叫做支持向量。支持向量支持向量直观表示直观地说,支持向量是两类集合边界上的点。所有非支持向量的数据都可以从训练数据集合中去掉而不影响问题解的结果。对于新的数据点 x,要对其进行分类

15、只需要计算 f(x) = sign (w x + b )其中w 和b是支持向量对应的参数。支持向量机用于分类 如下图的二分类问题,可以看作在特征空间的分类:wTx + b = 0wTx + b 0f(x) = sign(wTx + b)线性可分如何分类是最优? 3、最优分类平面线性分类函数和分类平面一个线性分类函数(discriminant function)是指由x的各个分量的线性组合而成的函数 两类情况:对于两类问题的决策规则为如果g(x)=0,则判定x属于C1,如果g(x)=0,则判定x属于C1,如果g(x)0,则判定x属于C2。 一般地,任意高次判别函数 g(x) 都可通过适当变换,化

16、为广义线性判别函数来处理。利用高次线性判别函数简单性解决复杂问题,但维数大大增加线性不可分解决线性不可分的一般方法:将原数据集影射到高维特征空间,从而实现线性可分:x (x)非线性可分线性可分:直观描述将训练样本非线性映射到高维特征空间 在高维空间构造线性支持向量机还原到原来的输入空间则是一个非线性决策面线性不可分Min wTw + Ci St. yi (wTxi + b) 1- i i 0Min wTw + Ci St. yi (wT ( xi ) + b) = 1- i 影射到高维特征空间后,约束表达式变为:影射到高维特征空间后,约束表达式变为:高维空间的分类决策函数为( ,)( )( )

17、iiiiK x yxy *1( )sgn( , )liiiif xyK x xb核函数令: ,即K(x,x)为特征空间的一个内积,则称K(x,x)为核函数。任何对称函数只要满足Mercer定理均可作为核函数 。常用的核函数有(,)()()()()TijijjiK x xxxxx多项式核函数(xTxi+1)pRBF核函数Sigmoid核函数th( oxTx+ 1)(有的学者提出了小波核函数))exp(2jixx Mercer条件2( , ),( )0( ),) ( ) ( )0K x xxx dxKxxx dxdx对于任意的对称函数它是某个特征空间中的内积运算的充要条件是,对于任意的且有(x,4

18、、支持向量机的构造 SVM分类函数形式上类似于一个神经网络,输出是中间节点的线性组合,每个中间节点对应一个输入样本与一个支持向量的内积,因此也叫支持向量网络。 y ),(1xxK ),(2xxK ),(xxKs 1x 2x . sx 11ya 22ya ssya 输出(决策规则) bxxKyysiiii)(1 权值 iiiyw 基于 s 个支持向量sxxx,.,21的非线性变换(内积) 输入向量).,(, 21dxxxx 四、支持向量回归线性回归:给定训练集(xi,yi),找个线性函数f(x)=wTx+b,来拟合数据最小二乘法(Least Square)其中 为回归误差.记 ,则目标函数可写为

19、解为NiiTibxwybwL12)(),(miniiTiybxwNTTiiTTxxXxxbww) 1 ,(,),(1) () () (wXywXywLTwXXyXwLTT22yXXXwTT1)(支持向量机用于回归对于线性可回归的数据集对于线性可回归的数据集xi ,yi ,SVM回归函数表达式为回归函数表达式为: 式中,式中,L为损失函数为损失函数 。这里选用。这里选用不敏感损失函数,其表达不敏感损失函数,其表达式为:式为: 0|( )|( , ( )|( )|yf xL y f xyf x如果其它 f(x ) =wTx + b 系数系数w和和b通过最小化下式得到通过最小化下式得到111(,(

20、)2nTiiiMinw wCLyf xn - 0 支持向量机用于回归 *对于回归错误的数据点,同样也引入松弛变量。将对于回归错误的数据点,同样也引入松弛变量。将 不敏感不敏感损失函数代入求得损失函数代入求得w和和b的最小化式中,可得到的最小化式中,可得到:*11min()2nTiiiw wC*.,0iiiiiiiiiiwxbyStwxby 在求解上式时,一般采用对偶理在求解上式时,一般采用对偶理论,把它转化成二次规划问题论,把它转化成二次规划问题 f(x ) =wTx + b 支持向量机用于回归建立拉格朗日方程:建立拉格朗日方程: 在极值处,上式对在极值处,上式对 求偏导为零求偏导为零:从而得

21、从而得*11*111( ,)()()2()(),0,1,.,nnTiiiiiiiiiiinniiiiiiiiiiiiiiiL ww wCwxbywxbyin *, ,iiw b *1*1()()000niiiiniiiiiiiwxCCSVM回归表达式根据Karush-Kuhn-Tucker定理 ,可求得 ,最终可得SVM回归函数为:*1( )()( , )niiiif xK x xb*,iib 四、四、SVR在热偶规真空传感器特性曲线拟合中的应用在热偶规真空传感器特性曲线拟合中的应用热偶规真空传感器原理热偶规真空传感器原理 热偶规是用来测量气体负压的一种传感器热偶规是用来测量气体负压的一种传感

22、器, 它是它是利用气体的热传导现象来测量气体压强的。当热偶利用气体的热传导现象来测量气体压强的。当热偶规在定流方式下工作时给热偶规热丝通入一恒定电规在定流方式下工作时给热偶规热丝通入一恒定电流流, 由热电偶测量热丝的温度由热电偶测量热丝的温度,压强高时气体导热性压强高时气体导热性能好能好, 热丝散走的热量多热丝散走的热量多, 所以热丝温度低所以热丝温度低; 压强低时压强低时气体导热性能下降气体导热性能下降, 热丝温度高热丝温度高, 将热电偶输出的毫将热电偶输出的毫伏数转换为压强值就实现了真空度的测量。伏数转换为压强值就实现了真空度的测量。 测量过程中压强值是热电偶输出毫伏值的函数测量过程中压强

23、值是热电偶输出毫伏值的函数p=f (v), v 是热电偶输出值是热电偶输出值, p 是压强值。是压强值。热偶规真空传感器测量真空度的原理热偶规真空传感器测量真空度的原理热偶规真空传感器特性的非线性热偶规真空传感器特性的非线性SVR在热耦规特性曲线拟合中的应用支持向量回归采用线性回归,回归函数为 f xxb式中,是权向量,b是阈值。估计样本为 1122,nniix yx yx yx yRyi为x i 的期望输出。目标函数为 21min2w.iiiistyxbxbySVR在热耦规特性曲线拟合中的应用在热耦规特性曲线拟合中的应用引入松弛变量引入松弛变量i、i*,因此(,因此(2)、()、(3)式可以

24、改)式可以改写成写成 2*11min2liiiwC*.,0iiiiiiiis tyxbxbyC为正则化参数。为正则化参数。 采用拉格朗日优化方法可以得到其对偶问题采用拉格朗日优化方法可以得到其对偶问题 *,1*111min2niijjiji jnniiiiiiix xy*1. .0,0,1,2,niiiiistC in 解上式得到最优解解上式得到最优解*i、i,就可得到回归式,就可得到回归式 *1(, )liiiifxk x xb其中核函数其中核函数K(x i, x)是非线性问题中用来替代内积的映射是非线性问题中用来替代内积的映射 序号电压值(V) 真空度(Pa)10.114100020.12

25、190030.12980040.13670050.14360060.1550070.15740080.220090.293100100.390110.32980120.460130.44350140.51440表1 样本集231.7642241.8710.9251.8790.8261.8860.7271.90.6281.9210.4291.9290.3301.9360.2150.63630161.210171.259181.3148191.3647201.55211.5844221.6643 由于真空度值跨度大,直接对由于真空度值跨度大,直接对10-1103Pa之间之间的数据进行拟合误差较大,

26、因此采用分段拟合的方的数据进行拟合误差较大,因此采用分段拟合的方法,将样本数据分成法,将样本数据分成0.11Pa,110Pa,10100Pa,1001000Pa四段,训练样本同表四段,训练样本同表1。拟合时将样本数据进行了归一化处理。拟合时将样本数据进行了归一化处理。 将样本数据分成将样本数据分成0.11Pa,110Pa,10100Pa,1001000Pa四段四段 对对0.11 Pa之间的曲线数据,拟合时参数设之间的曲线数据,拟合时参数设置为,置为,=0.005,C =1000,核函数采用高斯核,核函数采用高斯核,设定核心距设定核心距0.01。对其余三段的数据,拟合时参。对其余三段的数据,拟合

27、时参数设置为:数设置为:=0.005,C =50,核函数采用高斯,核函数采用高斯核,核心距为核,核心距为0.11。 (a) 0.11Pa (b) 110Pa(c) 10100Pa(d) 1001000Pa序号 电压(V)拟合值(Pa)实测值(Pa) 1 1.943 0.12 0.172 1.914 0.476 0.53 1.865 1.15 14 1.45 5.548 65 0.826 23.63 206 0.35 71.65 707 0.164 315.6 301表. 2 测试结果 基于炉热指数和改进支持向量机的高炉炉温预测研究基于炉热指数和改进支持向量机的高炉炉温预测研究 应用举例应用举例

28、 基于基于LSSVR的高炉炉温预测模型的预测输出的高炉炉温预测模型的预测输出 用用GA优化参数的高炉炉温优化参数的高炉炉温LSSVR预测模型的预测输预测模型的预测输 小时批数富氧含量风量风温压差风压顶压炉顶温度透气性指数每炉出铁S%碱度R2铁量差铁水温度煤气利用率综合负荷上一炉硅含量硅含量1234745002240118013529516116721019216416.40.0211.25.76146044.523.20.450.32645002250119013329116219318617819416.80.011.1115.81146144.773.060.320.36645002240119013329015824024020123816.70.0151.172.04147044.53.050.3

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论