判别分析四种方法_第1页
判别分析四种方法_第2页
判别分析四种方法_第3页
判别分析四种方法_第4页
判别分析四种方法_第5页
已阅读5页,还剩29页未读 继续免费阅读

付费下载

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

1、第六章判别分析 6.1什么是判别分析判别分析是判别样品所属类型的一种统计方法,其应用之广可与回归分析媲美。在生产、科研和日常生活中经常需要根据观测到的数据资料,对所研究的对象进行分类。例如在经济学中, 根据人均国民收入、 人均工农业产值、 人均消费水平等多种指标来判定一个国家的经济发展程度所属类型 ;在市场预测中,根据以往调查所得的种种指标,判别下季度产品是畅销、平常或滞销 ;在地质勘探中,根据岩石标本的多种特性来判别地层的地质年代,由采样分析出的多种成份来判别此地是有矿或无矿,是铜矿或铁矿等;在油田开发中,根据钻井的电测或化验数据,判别是否遇到油层、水层、干层或油水混合层;在农林害虫预报中,

2、根据以往的虫情、多种气象因子来判别一个月后的虫情是大发生、中发生或正常;在体育运动中,判别某游泳运动员的“苗子”是适合练蛙泳、仰泳、还是自由泳等;在医疗诊断中,根据某人多种体验指标(如体温、血压、白血球等)来判别此人是有病还是无病。总之,在实际问题中需要判别的问题几乎到处可见。判别分析与聚类分析不同。判别分析是在已知研究对象分成若干类型(或组别) 并已取得各种类型的一批已知样品的观测数据,在此基础上根据某些准则建立判别式,然后对未知类型的样品进行判别分类。对于聚类分析来说,一批给定样品要划分的类型事先并不知道,正需要通过聚类分析来给以确定类型的。正因为如此, 判别分析和聚类分析往往联合起来使用

3、, 例如判别分析是要求先知道各类总体情况才能判断新样品的归类, 当总体分类不清楚时, 可先用聚类分析对原来的一批样品进行分类,然后再用判别分析建立判别式以对新样品进行判别。判别分析内容很丰富, 方法很多。 判别分析按判别的组数来区分, 有两组判别分析和多组判别分析;按区分不同总体的所用的数学模型来分,有线性判别和非线性判别;按判别时所处理的变量方法不同,有逐步判别和序贯判别等。判别分析可以从不同角度提出的问题,因此有不同的判别准则,如马氏距离最小准则、 Fisher 准则、平均损失最小准则、最小平方准则、最大似然准则、最大概率准则等等,按判别准则的不同又提出多种判别方法。本章仅介绍四种常用的判

4、别方法即距离判别法、Fisher 判别法、 Bayes 判别法和逐步判别法。6.2距离判别法基本思想:首先根据已知分类的数据,分别计算各类的重心即分组(类)的均值,判别准则是对任给的一次观测,若它与第i 类的重心距离最近,就认为它来自第i 类。距离判别法,对各类(或总体)的分布,并无特定的要求。1两个总体的距离判别法设有两个总体(或称两类)G1 、 G2,从第一个总体中抽取n1 个样品,从第二个总体中抽取 n2 个样品,每个样品测量p 个指标如下页表。今任取一个样品,实测指标值为X( x1 , x p ) ,问 X 应判归为哪一类?首先计算 X 到 G1、 G2 总体的距离,分别记为D( X

5、,G1 ) 和 D( X ,G2 ) ,按距离最近准则1判别归类,则可写成:XG1,当D( X,G1)D(X ,G2)XG2,当D( X,G1)D(X ,G2)待判 ,当D(X,G1)D(X ,G2)G1 总体:G2 总体:(1)x1x2(1)x(n12)记 Xx1x2(1)x11x12x21(1)x22(1)xn(1)1xn(1)211x(1)(1)1x 2(i )( i )(i )( x1 , x p) ,i1,2x px1(1)px2(1p)(1)x(1)x px1x2x p( 2)(2 )( 2)( 2)x1x11x12x1 px2(2)x21(2)x22(2)x2(2p)xn(2)2

6、(2 )( 2)( 2)xn21xn2 2xn 2P(2 )( 2)( 2)x1x2x p如果距离定义采用欧氏距离,则可计算出D(X, G1)(1)(1)pxa(1)2(XX)(XX)a 1xaD(X, G2)(2)(2)pxa(2)2(XX)(XX)a 1xa然后比较 D ( X ,G1 ) 和 D( X ,G2 ) 大小,按距离最近准则判别归类。由于马氏距离在多元统计分析中经常用到,这里针对马氏距离对上述准则做较详细的讨论。设(1) 、(2) ,(1) 、(2 ) 分别为 G1、 G2 的均值向量和协方差矩阵。如果距离定义采用马氏距离即D 2 ( X ,Gi )( X( i) ( ( i

7、) )1 ( X( i ) )i 1,2这时判别准则可分以下两种情况给出:(1)当(1)(2)时考察 D2 (X,G2) 及 D 2(X,G1) 的差,就有:D2(X,G) D2(X,G ) X1X 2X1X (2)(2 )1 (2)21 X1 X2X1 (1)(1)1(1) 2 X1 (1)(2) )(1)(2) )1 (1)(2) )2 X1 (1)(2) )1 ( 1)(2) )2令1( (1)(2) )21 (1)(2) )W(X)( X)则判别准则可写成:2X G1,当W( X )0 即D 2(X,G2) D 2(X,G1)X G2,当W (X )0 即D2(X,G2) D2(X,G

8、1)待判 ,当W(X)0 即D 2(X,G2) D2(X,G1)当,(1) ,(2) 已知时,令a1( (1)( 2) ) (a1,a p ) 则x11W(X) (X) a a ( X) (a1 , , a p )xppa1 ( x11 )a p ( x pp )显然, W(X)是 x1 , x p 的线性函数,称W( X) 为线性判别函数,a 为判别系数。当, (1),( 2)未知时,可通过样本来估计。设X 1(i ) , X 2(i ) , , X n(ii) 来自 Gi的样本,i=1,2。1n1(1)?(1)X i(1)Xn1i 11n2( 2)?(2)X i( 2)Xn2i 1?1(

9、S1S2 )n1n22i其中Si( X t(i )X ( i ) )( X t(i )X ( i) )t11(1)X( 2)X( X)2线性判别函数为:W(X) (X X) ? 1(1)( 2)( XX )当 p=1 时 , 若 两 个 总 体 的 分 布 分 别 为 N (1 ,2)和 N( 2,2),判别函数W(X)X( 12 )12( 12 ) ,不妨设12 ,这时 W(X) 的符号取决于X2或 X。当 X时,判 XG1;当 X时,判 XG 2 。我们看到用距离判别所得到的准则是颇为合理的。但从下图又可以看出,用这个判别法有时也会得出错判。如X来自 G1,但却落入 D 2,被判为属 G2

10、,错判的概率为图中阴影的面积,记为P(2 /1) ,类似有 P(1/ 2) ,显然 P(2 /1) = P(1 / 2)= 112。23当两总体靠得很近(即| 12 |小),则无论用何种办法,错判概率都很大,这时作判别分析是没有意义的。因此只有当两个总体的均值有显著差异时,作判别分析才有意义。( 2)当(1)(2) 时按距离最近准则,类似地有:X G1,当D(X ,G1) D( X ,G2 )X G2,当D(X ,G1) D( X,G2 )待判 ,当D( X ,G1) D(X ,G2)仍然用 W(X)D2(X,G2) D2(X,G1)( X(2) ( (2) 1(X(2)( X(1) ( (1

11、) 1(X(1) )作为判别函数,它是X 的二次函数。多个总体的距离判别法类似两个总体的讨论推广到多个总体。设有 k 个总体 G1, Gk,它们的均值和协方差阵分别为(i ) , (i ) ,i1, k ,从每个总体 Gi 中抽取 ni 个样品, i =1,k, 每个样品测p 个指标。今任取一个样品,实测指标值为( x1 , , x p ) ,问 X 应判归为哪一类?G1 总体:Gk 总体:x1x1(1)x11(1)x2(1)x21(1)xn(2)x(1)11n1(1)x1记向量 X ( i )( 1)当(1)x2x px12(1)x1(1)px22(1)x2(1)pxn(1)2xn(1)p1

12、1(1)(1)x 2x p(i)(i )(i )i( x1 , x 2 , x p )( k )时x1( k )x2(k )( k )xn 21, kx1x2x( k )x( k)1112x 21(k)x22(k)x( 1k )x( k2)nn22( k )( k)x1x2x px1( kp)x2(kp)( k)xn 2p( k)x p此时 D 2 ( X , Gi ) ( X(i ) )1 ( XWij ( X )1 D 2 ( X, G j ) D 2 ( X ,Gi )2(i ) )i1, k 判别函数为:X1(i)( j )1 ( ( i )( j ) )i, j 1, , k2相应的

13、判别准则为:XGi ,当W ij ( X )0, 对一切 j i待判 ,若有某一个 Wij ( X ) 0当(1) , (1),未 知 时 可 用 其 估 计 量 代 替 , 设 从 Gi 中 抽 取 的 样 本 为(i ),(i ),i1, ,k,则 ?( i ), ? 的估计分别为X1, X ni4( i )1ni?(i )XX a(i)i 1, , knia 1?1kSink i 1ni其中 n n1ni ,Si( X a(i )X (i ) )( X a(i )X (i ) ) 为 Gi 的样本离差阵。12)当 (1) , , ( k) 不相等时此时判别函数为:W ji ( X ) (

14、 X( j ) ) V ( j ) 1 ( X( j ) )( X( i ) ) V ( i ) 1 ( X( i ) )相应的判别准则为:X Gi ,当 Wij ( X ) 0, 对一切 ji待判 ,若某一个 Wij ( X )0当(i) , (i ) (1,k) 未知时,可用(i )(i )的估计量代替,即i,?( i)X (i )?(i )1Sii 1,kni1例 1人文发展指数是联合国开发计划署于1990 年 5 月发表的第一份 人类发展报告中公布的。 该报告建议, 目前对人文发展的衡量应当以人生的三大要素为重点,衡量人生三大要素的指示指标分别要用出生时的预期寿命、成人识字率和实际人均

15、GDP,将以上三个指示指标的数值合成为一个复合指数,即为人文发展指数。资料来源:UNDP 人类发展报告 1995 年。今从 1995 年世界各国人文发展指数的排序中,选取高发展水平、中等发展水平的国家各五个作为两组样品,另选四个国家作为待判样品作距离判别分析。类别第一类(高发展水平国家)第二类(中等发展水平国家)待判样品数据选自世界经济统计研究1996 年第 1 期出生时的成人识字率( %)调正后人均 GDP序号国家名称予期寿命(岁)199219921x2x3x1美国769953742日本79.59953593瑞士789953724阿根廷72.195.952425阿联酋73.877.75370

16、6保加利亚71.29342507古巴75.394.934128巴拉圭7091.233909格鲁吉亚72.899230010南非62.980.6379911中国68.579.3195012罗马尼亚69.996.9284013希腊77.693.8523314哥伦比亚69.390.35158本例中变量个数 p=3 ,两类总体各有 5 个样品,即 n1 n2 5 ,有 4 个待判样品,假定两总体协差阵相等。5两组线性判别的计算过程如下:75.8870.44X(1)X( 2)94.0891.745343.43430.2( 2)计算样本协差阵,从而求出?ni(1)(1)(1)(1)S( X)( XXX )

17、1aaa136.22856.022448.7456.022344.228252.24448.74252.2412987.2类似地n2( X a(2)( 2)(2 )S2XX)( X a( 2)a186.812117.6824895.74117.682188.67211316.544895.7411316.542087384.8经计算123.04173.7044447SS1S2173.704532.911568.78444711568.782100372?n11( S1S2 )1 Sn22815.3821.713555.87521.71366.61251446.0975555.8751446.0

18、975262546.5?(1)0.1208960.038450.00004420.038450.0292780.00007990.00004420.00007990.00000434( 3)求线性判别函数W(X)解线性方程组 ?a(1)( 2)( XX) 得(1)X( 2)( 0.6523,0.0122,0.00873)a ? 1 ( XW ( X ) a ( X X ) a X1 ( XX)(1)(2 )20.6523x10.0122x20.00873x387.15254)对已知类别的样品判别分类对已知类别的样品(通常称为训练样品)用线性判别函数进行判别归类,结果如下,全部判对。6x1 经济

19、样品号判别函数 W(X)的值原类号判归类别110.545111212.697211311.83231146.8111158.8153116-2.4716227-7.0898228-10.7842229-18.37882210-11.974222( 5 对判别效果作检验判别分析是假设两组样品取自不同总体, 如果两个总体的均值向量在统计上差异不显著,作判别分析意义就不大。所谓判别效果的检验就是检验两个正态总体的均值向量是否相等,根据第三章 3.1 可知检验的统计量为:(n1 n22) p 1T2Fp n1n2p1)Fn2 2) p(,( n1n1 n2 ( X其中 T2(n1 n2 2)n1n2

20、( XX )S1X )(1)(2 )(1)(2)n1 n2n1n2将上边计算结果代入统计量后可得:F12.6746F0 .05 (3.6)4.76故在 a0.05 检验水平下,两总体间差异显著,即判别函数有效。( 6)对待判样品判别归类结果如下表:样品号国家判别函数 W(X) 的值判别类别11中国-24.47899212罗马尼亚-15.58135213希腊10.29443114哥伦比亚4.182891简短分析 :回代率为百分之百,这与统计资料的结果相符,而待判的四个样品的判别结果表明:中国、罗马尼亚为中等发展水平国家即第二类,希腊、哥伦比亚为高发展水平国家即第一类,这是符合当时实际的,即与当时

21、世界各国人文发展指数的水平相吻合。例 2对全国 30 个省市自治区1994 年影响各地区经济增长差异的制度变量:增长率( %)、 x2 非国有化水平( %)、 x3 开放度( %)、 x4 市场化程度( %)作判别分析。7类别第一组第二组待判样品资料来源:经济理论与经济管理1998 年第 1 期序号地区x1x2x3x41辽宁11.257.2513.4773.412河北14.967.197.8973.093天津14.364.7419.4172.334北京13.555.6320.5977.335山东16.275.5111.0672.086上海14.357.6322.5177.357浙江2083.9

22、415.9989.58福建21.868.0339.4271.99广东1978.3183.0380.7510广西1657.1112.5760.9111海南11.949.9730.769.212黑龙江8.730.7215.4160.2513吉林14.337.6512.9566.4214内蒙古10.134.637.6862.9615山西9.156.3310.366.0116河南13.865.234.6964.2417湖北15.355.626.0654.7418湖南1155.558.0267.4719江西1862.886.458.8320甘肃10.430.014.6160.2621宁夏8.229.28

23、6.1150.7122四川11.462.885.3161.4923云南11.628.579.0868.4724贵州8.430.236.0355.5525青海8.215.968.0440.2626新疆10.924.758.3446.0127西藏15.621.4428.6246.0128江苏16.580.058.8173.0429安徽20.681.245.3760.4330陕西8.642.068.8856.37(1)两类地区各变量的均值X (1)(15.7363665.0281825.1490973.80455)(2 )(11.562540.106259.22812558.105)X( 2)计算样

24、本协差阵,从而求出?和?19.85451823.9849414.278375.460767?23.98494212.05611.66556769.7318514.278371.665567202.03449.513565.46076769.731859.5135664.1182280.1686160.023120.012320.012615? 10.023120.0105320.0020080.009780.012320.0020080.0058980.002010.0126150.009780.002010.02546( 3)求线性判别函数解线性方程组 ?a(1)( 2)( XX )得 a?

25、 1(X(1)( 2)X)经计算(2 )XX( 4.17386424.9219315.9209715.69955)a(0.1294110.0443540.0609780.176547)1(1)( 2)52.5672217.18861 65.95477)( XX) (13.649432W ( X ) a ( X X ) a ( X1 ( XX )(1)(2 )20.129411x10.044354x20.060978x30.176547x416.79018( 4)对已知类别的样品回判(1)(2)0 为第二组。由于 XX , W( X) 0为第一组, W(X )样品序号W(X)原类号回归组别10.

26、9801571121.5031031131.8850841141.2728981152.0553511162.6450241176.2970841184.1458541198.4611641110-0.6665912111.0552431112-2.725142213-0.753782214-2.363462215-0.832162216-0.483752217-2.309532218-0.502152219-0.896632220-3.193432221-5.105072222-1.346272223-1.379982224-4.18744229p 个指标,列表如下:样品序号W(X)原类号回

27、归组别25-7.423092226-5.650372227-3.952322上述回判结果表明,第一组中只有第10 个样品判组号为2,与原组号不同,其余样品与原分组号相同;第二组中的各样品回判组号都是2,即与原组号完全相同。我们仔细研究第 10 号样品广西的指标数据,可以看到它有可能是属于原分组时的错分样品。总的回代判对率达 96.3%。5)对待判样品判别归类,结果如下:样品序号W(X)判归类别282.3278251290.475173130-3.318292待判样品中江苏和安徽被判属第一组,陕西被判属第二组,这与实际情况较吻合。6.3 费歇( Fisher )判别法Fisher 判别法是193

28、6 年提出来的,该法对总体的分布并未提出什么特定的要求。1 不等协差阵的两总体Fisher 判别法( 1)基本思想:从两个总体中抽取具有p 个指标的样品观测数据,借助方差分析的思想造一个判别函数或称判别式:y c1 x1c2 x2c p xp ,其中系数 c1 、 c2 、 c p 确定的原则是使两组间的区别最大, 而使每个组内部的离差最小。 有了判别式后, 对于一个新的样品,将它的 p 个指标值代入判别式中求出 y 值,然后与判别临界值 (或称分界点后面给出)进行比较,就可以判别它应属于哪一个总体。( 2)判别函数的导出假设有两个总体G1、G2,从第一个总体中抽取n1 个样品,从第二个总体中

29、抽取n2 个样品,每个样品观测G1 总体:G2 总体:x1x2x px1x2x px1(1)x11(1)x12(1)x1(1p)x1( 2)x11(2 )x12(2)x1( p2)x2(1)x21(1)x22(1)x2(1p)x2(2)x21(2)x22(2)x2(2p)xn(2)xn(1)1xn(1)2x(1)xn(2)x (2 )x( 2)x( 2)111n1 P2n21n2 2n 2P(1)(1)(1)(2 )( 2)( 2)x1x 2x px1x2x p假设新建立的判别式为y c1x1c2 x2c p x p ,今将属于不同两总体的样品观测值代入判别式中去,则得:yi(1)c1 xi(

30、11)c2 xi(12)c p xip(1)i 1,n1yi( 2)c1 xi(11)c2 xi(12)cp xip(2)i 1, ,n2对上边两式分别左右相加,再乘以相应的样品个数,则有:10p(1)ck xk(1)y 第一组样品的“重心”k1( 2)pck xk(2 )y 第二组样品的“重心”k 1为了使判别函数能够很好地区别来自不同总体的样品,自然希望:i)来自不同总体的两个平均值y (1) , y (2 ) 相差愈大愈好。n1ii )对于来自第一个总体的yi(1) (i 1, , n1 ) 要求它们的离差平方和( yi(1)y (1) ) 2 愈小i 1n2( yi( 2)y (2)

31、) 2愈好,同样也要求愈小愈好。i 1综合以上两点,就是要求:I( y (1)y (2 ) ) 2n1n2( yi(1)y(1) ) 2( yi( 2)y( 2) ) 2i1i1愈大愈好。记 QQ(c1 , c2, , c p )( y (1)y (2 ) ) 2 为两组间离差。n1(1)n2FF (c1 , c2 , ,c p )( yi(1)( yi( 2)y ) 2i 1i 1为两组内的离差。则IQF利用微积分求极值的必要条件可求出使I 达到最大值的 c1 , c2 ,为此将上式两边取对数:令ln Iln Qln F0k1, pckckck则1Q1FQc kFck即1QFIckcky (

32、2) ) 2, cp 。pp2而Q( y(1)y(2 ) ) 2ck x (k1)1pck ( xk(1)k 1ck xk(2)k12x(k2) )p2其中dkx(k1)x(k2)Qckck d k1p2cl d ldkl111n1而 Fi1n2( yi(1)y (1) ) 2( yi(2 )y ( 2) ) 2i1n1i1n1i1n2pck (xik(1)1pck ( xik(1)1pck (xik(2)2n2p2(1)( 2)ck (xik(2 )x k)xk )i1k1(1)pcl ( xil(1)(1)x k)x l )l1( 2)p( xil(2)( 2)clx k)xl )i 1k

33、 1l1ppn1(1)(1)n2(2)ck cl( xik(1)( xi(l1)( xik(2 )( xi(l2 )x kxl)x kk1l1i 1i 1ppck cl sklk1l1其中n1(1)n2( 2)( 2)s(x (1)(1)( xx k )( x(1)xl)( 2)xk )( x(2 )xl )klikilikili1i1Fpcl skl2ckl12pp从而cl d ld k2 cl sklIl1l11pp即cl d ld kcl sklk 1, , pIl1l1令1pI lcl dl1是常数因子, 不依赖于 k,它对方程组的解只起到共同扩大解 c , , c之间的相对比例关系。

34、对判别结果来说没有影响,所以取1pp( 2)xl)倍的作用, 不影响它的=1,于是方程组:clskl d kk 1, , pl 1s11c1s12 c2s1 p c pd1s21c1s22c2s2 p c pd2即s p1c1sp 2 c2spp c pd p写成矩阵形式为:s11s12s1 pc1d1s21s22s2 pc2d 2s p1s p2s ppcpd p12c1s11s12s1 p1d1c2s21s22s2 pd 2所以c psp1s p 2s ppd p值得说明的是 :本书有几处利用极值原理求极值时,只给出必要条件的数学推导,而有关充分条件的论证省略了, 因为在通常遇到的实际问题

35、中, 根据问题本身的性质就能肯定有最大值(或最小值) ,如果所求的驻点只有一个,这时就不需要根据极值存在的充分条件判定它是极大还是极小而就能肯定这唯一的驻点就是所求的最大值(或最小值) ,为了避免用到较多的数学知识或数学上的推导,这里不追求数学上的完整性。有了判别函数之后,欲建立判别准则还要确定判别临界值(分界点)y0,在两总体先验( 2)概率相等的假设下,一般常取y0 为 y与 y的加权平均值即(1)n2 y(2)n1 yy0n1n2(1)与 y(2)(1)( 2)如果由原始数据求得 y满足 y y,则建立判别准则为:对一个新样品X ( x1 , , x p ) 代入判别函数中去所得值记为y

36、,若 y y0,则判定 XG1 (见图一);若 yy0,(2 )则判定 XG2 。如果 y y,则建立判别准则为:若y y0,则判定XG2 (见图二);若 yy0,则判定XG1 (注:为直观起见,给出两个正态总体等方差情况下的图形)。( 3)计算步骤i)建立判别函数图一图二Q (c1 ,c p ), cp ,根据极值原理,需解方程组求 I的最大值点 c1 , c2F (c1 ,c p )ln I0c1ln I0c2ln Icp0可得到 c1 ,c p ,写出判别函数yc1 x1c p x p 。)计算判别临界值 y0 ,然后根据判别准则对新样品判别分类。iii )检验判别效果(当两个总体协差阵

37、相同且总体服从正态分布)。H 0 : Ex a(1)1 Ex a(2)2H1: 12检验统计量:13F( n1 n22) p 1 T 2 F ( p, n1 n2 p 1)(n1n2 2) p(在H 0成立 )其中T 2( n n2)n1n2(1)2( X1n1n2n1(1)( xai(1)S(sij ) p p , sijxi)( xaj(1)a1(i )(i )X( x1(i ) , , x p( 2) S1n1n2( X(1)( 2)Xn1X)n2(1)n2( xai(2)(2)( xaj(2)( 2)x j)xix j )a1给定检验水平 a, 查 F 分布表,确定临界值Fa ,若 F

38、Fa ,则 H 0 被否定,认为判别有效。否则认为判别无效。值得指出的是:参与构造判别式的样品个数不宜太少,否则会影响判别式的优良性;其次判别式选用的指标不宜过多,指标过多不仅使用不方便,而且影响预报的稳定性。所以建立判别式之前应仔细挑选出几个对分类特别有关系的指标, 要使两类平均值之间的差异尽量大些。例 1利用距离判别法中例1 的人文发展指数的数据作Fisher 判别分析。( 1)建立判别函数利用前例计算的结果,可得Fisher 判别函数的系数c1 、 c2 、 c3 为c1d1(1)(2 )c2S 1 d21?1(XX )c3d381 a0.08153750.00152580.001091

39、25所以判别函数为y0.0815375x10.001525x20.00109125x3( 2)计算判别临界值y0(1)3(1)y12.1615由于ck x kk1(2 )3( 2)y9.6266ck x kk1n1 y(1)n2y(2 )所以y010.8941n1n23)判别准则(2 )yy判别准则为当 y y0时, 判X G1 当 y y 0时, 判 X G 2当 y y0时, 待判14( 4)对已知类别的样品判别归类序号国家判别函数 y 的值原类号判归类别1美国12.2122112日本12.4812113瑞士12.3731114阿根廷11.7450115阿联酋11.9960116保加利亚1

40、0.5851227古巴10.0078228巴拉圭9.5460229格鲁吉亚8.59682210南非9.397322上述回判结果表明:总的回代判对率为 100%,这与统计资料的结果相符,而且与前面用距离判别法的结果也一致。( 5)对判别效果作检验由于F12.67463 64.76F (,)0.05所以在 a0.05 检验水平下判别有效。( 6)待判样品判别结果如下:序号国家判别函数 y 的值判属类别11中国7.8342212罗马尼亚8.9464213希腊12.1809114哥伦比亚11.41691判别结果与实际情况吻合。例 2 用距离判别法中例2 的制度变量对30 个省市自治区作Fisher 判

41、别分析。1)建立判别式经计算得:246.363599.6235356.9592136.5192599.62355301.40241.639171743.296S356.959241.639175050.86237.839136.51921743.296237.8391602.9550.0067450.000920.000490.000505S 10.000920.0004218.03E050.000390.000498.03E050.0002368E050.0005050.000398E050.001018判别式为 y0.005176 x1 0.001774 x2 0.002439 x30.0

42、07062x4( 2)求判别临界值y0,对所给样品判别分类(1)0.779369,( 2)0.563846yy15(1)( 2)y0n1 yn2 yn10.651651n2(1)(2 )y y 0 ,则判为第一组;若y y0 ,则判为由于 yy ,当样品代入判别工后,若第二组。回判结果如下:样品序号y 值原类号回判组别10.7108141120.7317311130.7470111140.7225231150.7538211160.7774081170.9234911180.8374411191.01005411100.64494412110.71381711120.56260222130.6

43、4145622140.57706922150.63832122160.65225721170.57922622180.65152122190.636574222200.5438722210.46740522220.61775722230.61640822240.5041122250.37468422260.44559322270.51351522等判样品判别结果样品序号y 值判属组号280.764721290.6906141300.5388753上述回判结果表明,第一组的第10 号仍被回判为第2 组,说明第10 号样品确为误分。而第二组的第16 号被回判为第一组,仔细研究其指标,发现其数据介于

44、第1 组和第 2 组之间,差别不显著造成的。总的回代判对率为 25/27=92.59% 。关于待判的三个样品的判别结果与用距离判别法的相同,说明其判别结果是比较好的。16多总体 Fisher 判别法类似两总体 Fisher 判别法可给出多总体 Fisher 判别法。设有 k 个总体 G1, , Gk,抽取样品数分别为n ,n, n ,令 nnn2n。12k1kxa(i )( xa(i1) , , xap(i) ) 为第 i 个总体的第 a 个样品的观测向量。假定所建立的判别函数为y(x)c1 x1c p x pc x其中c (c1,c p ) , x ( x1 , x p )记 x(i )(i

45、)分别是总体 Gi 内 x 的样本均值向量和样本协差阵,根据求随机变量线性组和 s合的均值和方差的性质可知,y(x) 在 Gi 上的样本均值和样本方差为( i)(i )2(i)yc x ,c sci记 x 为总的均值向量,则y c x 。在多总体情况下,Fisher 准则就是要选取系数向量c,使k(i)y) 2ni ( yi 1k2qiii 1达到最大,其中qi 是人为的正的加权系数,它可以取为先验概率。如果取qi ni1,(i )( i )yc x2c s(i) c 代入上式可化为:并将 yc x,ic Acc Ec其中 E 为组内离差阵,A 为总体之间样本协差阵,即kqi s(i)Ei 1

46、k(i )( i)Ani (xx)( xx)i1为求的最大值,根据极值存在的必要条件,令0,利用对向量求导的公式:2 Ac2EcCC(c Ec) 2 (c Ec)( c Ec) 2(c Ac)2 Ac2Ecc Acc Ecc Ecc Ec2 Ac2Ecc Ecc Ec因此2 Ac2 EcAc Ec00Cc Ecc Ec这说明 及 c 恰好是 A 、E 矩阵的广义特征根及其对应的特征向量。由于一般都要求加权协差阵 E 是正定的,因此由代数知识可知,上式非零特征根个数m 不超过 min ( k-1, p),又因为 A 为非负定的,所以非零特征根必为正根,记为12m 0 ,于是可构造m 个判别函数:

47、yl ( x) c (l ) xl 1, , m对于每一个判别函数必须给出一个用以衡量判别能力的指标pi 定义为:17lpimii 1l1, mm0个判别函数 y , ym0的判别能力定义为:1m0m01spm0l1plml1ii1如果 m0 达到某个人定的值(比如85% )则就认为 m0 个判别函数就够了。有了判别函数之后, 如何对待判的样品进行分类?Fisher 判别法本身并未给出最合适的分类法,在实际工作中可以选用下列分类法之一去作分类。( 1)当取 m0=1 时(即只取一个判别函数) ,此时有两种可供选用的方法i)不加权法若 y( x)(i )( j )ymin y( x) y1 j

48、k则判 xGi .)加权法(1)(2 ),( k )y (1)y ( 2)y (k ) ,相应判别函数的标准将 y, y, y按大小次序排列,记为差重排为(i) 。令d i,i(i 1) y( i )( i ) y( i 1)i1, , k -11( i) )(i 1)则 di ,i1 可作为 G ji与 G ji 1 之间分界点。如果x 使得 d i 1,iy( x) di ,i 1 ,则判 x G ji 。( 2)当取 m01时,也有类似两种供选用的方法i)不加权法(i )c(l ) x(i)l 1, m 0 ; i 1, k记 y l对待判样品 x( x1 , , x p ) ,计算yl

49、 ( x)c( l ) xm02Di2yl ( x)(i )i 1, , ky ll 1若 Dr2min Di2 , 则判 x Gr。1 ik)加权法考虑到每个判别函数的判别能力不同,记m0(i )22Diyl ( x) y lll 1其中l 是由 AcEc 求出的特征根。若 Dr2min Di2 , 则判 x Gr 。1 i k6.4 贝叶斯( Bayes)判别法18从上节看到Fisher 判别法随着总体个数的增加,建立的判别式也增加,因而计算起来还是比较麻烦的。 如果对多个总体的判别考虑的不是建立判别式,而是计算新给样品属于各总体的条件概率 P(l / x), l 1, k 。比较这 k

50、个概率的大小,然后将新样品判归为来自概率最大的总体,这种判别法称为Bayes 判别法。1 基本思想Bayes 判别法的基本思想总是假定对所研究的对象已有一定的认识,常用先验概率来描述这种认识。设有 k 个总体 G1, G2, , Gk,它们的先验概率分别为q1 , q2 , qk (它们可以由经验给出也可以估出 )。各总体的密度函数分别为 : f1 ( x), f2 ( x), f k ( x) (在离散情形是概率函数) ,在观测到一个样品 x 的情况下, 可用著名的 Bayes 公式计算它来自第g 总体的后验概率 (相对于先验概率来说,将它又称为后验概率):qg f g ( x)P( g /

51、 x)kqifi (x)i 1并且当P(h / x) max P( g / x)1g k时,则判 X 来自第 h 总体。有时还可以使用错判损失最小的概念作判决函数。定义为g1,k这时把 x 错判归第h 总体的平均损失qg f g ( x)E(h / x)g hkL ( h / g)qif i ( x)i 1其中 L(h / g) 称为损失函数。它表示本来是第g 总体的样品错判为第 h 总体的损失。显然上式是对损失函数依概率加权平均或称为错判的平均损失。当h = g 时,有 L (h / g) 0 ;当 hg 时,有 L (h / g) 0 。建立判别准则为如果E( h / x)min E (g

52、 / x)1 gk则判定 x 来自第 h 总体。原则上说,考虑损失函数更为合理,但是在实际应用中L(h / g) 不容易确定,因此常常在数学模型中就假设各种错判的损失皆相等,即0hgL( h / g)1hg这样一来,寻找h 使后验概率最大和使错判的平均损失最小是等价的,即hmax E(h / x)hp(h / x)min2 多元正态总体的Bayes 判别法在实际问题中遇到的许多总体往往服从正态分布,下面给出 p 元正态总体的Bayes 判别法。( 1)判别函数的导出由前面叙述已知, 使用 Bayes 判别法作判别分析, 首先需要知道待判总体的先验概率q g19和密度函数f g (x) (如果是

53、离散情形则是概率函数)。对于先验概率,如果没有更好的办法确定,可用样品频率代替,即令qgng,其中 ng为用于建立判别函数的已知分类数据中n来自第 g 总体样品的数目,且 n1n2nkn ,或者干脆令先检概率相等,即qg1 ,k这时可以认为先验概率不起作用。p 元正态分布密度函数为:f g ( x)(2 ) p 2( g )1 2exp1 ( x( g ) )( g ) 1 ( x( g ) )2式中( g ) 和( g)分别是第 g 总体的均值向量(p 维)和协差阵(p 阶)。把 f g (x) 代入P( g / x) 的表达式中, 因为我们只关心寻找使 P( g / x) 最大的 g,而分

54、式中的分母不论g 为何值都是常数,故可改令q g f g ( x)gmax取对数并去掉与g 无关的项,记为Z ( g / x) ln qg1 ln E( g)2ln q g1 ln E ( g )2则问题化为1 ( x( g ) )( g ) 1 (x( g ) )21 x( g ) 1 x1 ( g)(g ) 1 ( g )x( g) 1 ( g )22Z ( g / x)gmax( 2)假设协方差阵相等Z ( g / x) 中含有 k 个总体的协方差阵(逆阵及行列式值),而且对于x 还是二次函数,实 际 计 算 时 工 作 量 很 大 。 如 果 进 一 步 假 定k 个 总 体 协 方

55、差 阵 相 同 , 即(1)( 2)( K ),这时 Z ( g / x)中 1ln( g)和 1 x( g) 1 x 两项与 g 无关,求最22大时可以去掉, 最终得到如下形式的判别函数与判别准则(如果协方差阵不等,则有非线性判别函数);y( g / x)1(g )1( g )x1(g )ln qg2y( g / x)gmax上式判别函数也可以写成多项式形式:此处Ci( g )C0( g )py( g / x) ln qg C0(g )Ci( g ) xii1pij( g)vi 1, ,pjj 11( g )1( g )21 ppvij(g )( g )2 i1j 1ij1p( g )( g

56、 )2 i1C ii20 x ( x1 , x2 , xp )(g )( 1( g ), 2( g) , ,(pg ) )( vij ) p p ,1(vij ) p p( 3)计算后验概率作计算分类时,主要根据判别式y( g / x) 的大小,而它不是后验概率P(g / x) ,但是有了 y( g / x) 之后,就可以根据下式算出P( g / x) :P( g / x)expy( g / x)kexp y(i / x)i1因为y( g / x)ln( qgf g ( x)( x)其中(x) 是 ln(q gfg ( x) 中与 g 无关的部分。所以P(g / x)q g f g ( x)k

57、qi f i ( x)i 1exp y( g / x)( x)kexp y( i / x)( x)i1exp y( g / x) exp( x)kexp y( i / x) exp( x)i1exp y( g / x)kexp y( i / x)i1由上式知使 y 为最大的h,其 P( h / x) 必为最大,因此我们只须把样品x 代入判别式中:分别计算 y(g / x) , g1, k 。若(g/ )max(g/x)yx1g ky则把样品 x 归入第 h 总体。例 1 继续用前面距离判别法例 1 的人文发展指数的数据作 Bayes 判别分析。这里组数 k =2 ,指标数 p =3, n1 =

58、 n2 = 5q150.5q210ln q1ln q20.693147x(1)( 75.88, 94.08, 5343.4)x( 2)( 70.44, 91.74, 3430.4)210.1208960.038450.000044210.038450.0292780.00007990.00004420.00007990.00000434代入判别函数:y( g / x)1g1 (g )x1 (g )g1,2ln qg2得两组的判别函数分别为:f1323.171945.79239x10.26383x20.03406x3f 2236.020675.14013x10.25162x20.02533x3将

59、原各组样品进行回判结果如下:样品序号原类号判别函数 f1 值判别函数 f 2 值回判类别后验概率11326.2073315.663011.000021345.9698333.273511.000031337.7240325.892611.000041298.3032291.492910.998951307.7082298.893910.999962258.5374261.009720.922272254.2452261.335820.999282221.8201232.604921.000092202.9712221.350221.0000102191.8280203.802721.0000回

60、判结果表明,总的回代判对率为 100% ,这与统计资料的结果相符,并与前面的距离判别法、 Fisher 判别法的结果也相同。待判样品判别结果如下:样品序号国家判别函数 f1 值判别函数 f 2 值后验概率判属类号11中 国160.9455185.42521.0000212罗马尼亚202.2739219.59391.0000213希腊329.3008319.00730.99997114哥伦比亚277.7460273.56380.98501待判样品的结果表明, 判属类别与前面的判属类别完全相同, 即中国、罗马尼亚属于第二类,希腊、哥伦经亚属于第一类。例2继续用前面距离判别法例2 的制度变量的数据作

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论