SAS系统和数据分析主成分分析_第1页
SAS系统和数据分析主成分分析_第2页
SAS系统和数据分析主成分分析_第3页
SAS系统和数据分析主成分分析_第4页
SAS系统和数据分析主成分分析_第5页
已阅读5页,还剩24页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

1、 FILENAME Unit31Sas 商务数据分析 电子商务系列上海财经大学经济信息管理系IS/SHUFEPage PAGE 29 of NUMPAGES 29主成分分析主成分的导出主成分分析(principal component analysis)是1901年提出,再由Hotelling(1933)加以发展的一种统计方法。其主要目的是在于将许多变量减少,并使其改变为少数几个相互独立的线性组合形成的变量(主成分),而在经由线性组合而得的成分之方差会变为最大,使得原始维资料在这些成分上显示最大的个别差异来。用一句话来说,主成分分析是将多个变量化为少数综合变量的一种多元统计方法。设有组样品,每

2、组样品有个变量,记组样品数据见表35.1。表35.1 个变量的组样品数据 样品号变量1 2 n 嵌入 Equation.3 嵌入 Equation.3 嵌入 Equation.3 嵌入 Equation.3 嵌入 Equation.3 如果个变量是相互独立的,则可以将问题化为单变量逐个处理,这是比较简单的。但是对大量的实际问题中提出来的数据,各变量之间往往存在着不同程度的相关关系,这时要搞清这些数据之间的关系,就必须在高维空间中加以研究,这显然是比较麻烦的,为了克服这一困难,一个很自然的想法就是采取降维的方法,也就是利用全部个变量来重新构造个新的综合变量(),并使得这些较少的变量既能尽可能多地

3、反映原来个变量的统计特性,并且它们之间又是相互独立的。假定,是一组随机变量,并且,协方差阵嵌入 Equation.3 。考虑,的一个线性组合(或称线性变换):(35.1)这里。对于综合变量,我们要选择一组系数使得的方差最大;由于,对任意给定的常数,如果对不加以限制,上述问题就变得毫无意义。于是限制,求的最大值。根据限制性条件下的拉格朗日极值理论可以证明,在此情况下的的最大值等价于求:(35.2)的值,就等于矩阵的最大特征根,就是对应的特征向量。若记矩阵*的p个特征值 = = = 0,且m个非零特征值所对应的特征向量分别为,则:那么,把矩阵的非0特征根 0所对应的单位特征向量,分别作为,的系数向

4、量,分别称为随机向量的第1主成分、第2主成分,第m主成分。当时(35.3)所以,主成分之间是不相关的。而且可以看到,主成分分析主要就是由观察数据阵得到协方差的估计,从出发计算它的特征值和特征向量。维随机向量的主成分其实就是个变量的一些特殊的线性组合,在几何上这些线性组合正好把构成的原坐标系统经过旋转后产生新坐标系统,这个新坐标系统的轴方向上具有最大的变异,同时提供了协方差阵的最简洁的表示(非对角线上为0)。例如,我们有一个=2维随机向量的=100个点构成一个椭圆形状,如图351所示。第一主成分则是这个椭圆的长轴方向,因为原坐标系的100点按长轴方向旋转后数据最离散,具有最大的方差,设定旋转方向

5、的表示为单元圆上的一个单位方向,与长轴平行的单位方向具有,因此,不难求出第一主成分的系数向量的具体值。而椭圆的短轴与长轴是垂直的,是第二个主成分的方向,因为短轴是与长轴不相关方向中具有最大的方差,同样与短轴平行的单位方向具有,同求第一主成分的系数向量一样,我们也能容易求出的具体值。图图351 二维随机向量的第一、第二主成分示意图用开头个主成分形成的维子空间,从几何上看,当采用从每个数据点到子空间的垂直距离的平方和作为度量时,这个维子空间对数据点给出了最好的拟合。例如,在图351所示中,所有数据点到第一主成分轴(椭圆的长轴)的垂直距离的平方和是最小的。要特别注意,它不同于最小二乘回归的几何表示,

6、回归是最小化所有数据点到拟合直线的垂直偏差的平方和。贡献率与累积贡献率由主成分的性质可知,主成分的方差, ,与随机变量x1, x2,xp的方差S11,S22,Spp之间有关系:(35.4)我们称:嵌入 Equation.3 (35.5)为第k个主成分的贡献率,它反映了第k个主成分提取全部信息的多少。又称:(35.6)为前k个主成分的累积贡献率,它反映了前k个主成分共同提取全部信息的多少。我们进一步还可以考虑第k主成分与p个变量x1, x2,xp的相关系数,称其为因子负荷量,记为L(Zk,xi)(对相关阵的主成分或标准化后的数据),有:(35.7)其中,嵌入 Equation.3 为第k个特征值

7、所对应的特征向量的第i个分量。样本资料数据的主成分分析在实际分析中,我们一般得到如表(35.1)所示的数据资料,设,第i个样品的数据为,样本资料数据用矩阵表示为嵌入 Equation.3 ,则平均值向量为,其中,协方差矩阵的估计量为,其中。我们可以求出协方差矩阵的特征根和特征向量,不妨设为 0,其所对应的特征向量分别为,那么,就是向量的第一主成分、第二主成分,第m主成分。实际上我们没有必要求出向量的全部主成分。一般情况下,如果前m个主成分的累积贡献率大于等于85%,则就取m个主成分,就已经能够反映全部p个变量的绝大部分信息了。数据的标准化实际的数据单位往往不一致,这会给分析带来不便,为此,常将

8、数据进行标准化的处理,即使得第i个变量的均值为0,方差为1。设,令称为标准化后的数据。实际计算时首先对数据进行标准化处理,这样所得出的协方差阵与相关阵就是相同的。应注意的几个问题主成分分析,除了用来综合变量之间的关系外,亦可用来削减回归分析或聚类分析中的变量数目。此外,为了达到最大变异的目的,我们可用主成分分析将原来的变量转变为成分,在获得所要的成分之后,可将各变量的原始数据转换为成分数据,以供进一步深入的统计分析。通常,在进行主成分分析时,应注意下面几个问题:主成分分析是通过降维技术用少数几个综合变量来代替原始多个变量的一种统计分析方法。这些综合变量集中了原始变量的大部分信息。第一主成分所包

9、含的信息量最大,第二主成分其次,其他主成分依次递减,各主成分之间互不相关,这就保证了各主成分所含的信息互不重复。在实际研究里,研究者如果用不超过五或六个主成分,就能解释变异之70%80%,已可令人满意。取多少个主成分,既要考虑之前几个主成分的累计贡献率达到一定比例,也要考虑到应选取尽可能少的主成分以较好地达到降维的目的。Kaiser(1960)主张将特征值小于1的主成分予以放弃,而只保留特征值大于1的主成分。当各变量的单位不相同时,应从相关矩阵出发进行主成分分析。计算出主成分之后,应对要使用的前若干个主成分作出符合实际背景和意义的解释。princomp主成分过程主成分分析过程为princomp

10、,可以从原始变量分析,也可直接从协方差矩阵、相关系数矩阵或叉积阵(SSCP)分析。分析结果可以存储到数据集中,供其他过程调用。 princomp过程一般由下列语句控制:proc princomp data=数据集 ;var 变量列表;partial 变量列表;weight 变量;freq 变量;by 变量;run ; princomp过程的结果表包括每一变量的简单统计数、相关系数或方差协方差矩阵、特征值和特征向量等。proc princomp语句。typecov或typecorr指明数据集类型,例如,datanew typecorr:表明new为一相关系数corr数据集。out数据集名规定存储

11、原始数据和主分量得分的输出数据集。outstat数据集名生成一个包括变量的平均数、标准差、相关系数、特征值、特征向量的输出数据集。另外,如果规定cov选项,还包括由协方差矩阵进行的计算(一般由相关系数矩阵进行计算)。n个数指定主分量个数。std要求在out的数据集里把主成分得分标准化为单位方差。如果没有规定此项,主成分得分的方差等于相应的特征值。noint要求在模型中不含截距。noprint不打印输出分析结果。proc princomp过程中的主要语句。var语句指明分析的数值变量。如果省略var语句,则对所有数值变量进行分析。partial语句指明对偏相关阵或偏协方差矩阵进行分析时,被偏出去

12、的这些数值变量的名字。实例分析例35.1 调查美国50个州7种犯罪率,得结果列于表35.1,其中,给出的是美国50个州每100 000个人中七种犯罪的比率数据。这七种犯罪是:murder(杀人罪),rape(强奸罪),robbery(抢劫罪),assault(斗殴罪),burglary(夜盗罪),larceny(偷盗罪),auto(汽车犯罪),试作主成分分析。很难直接从这七个变量出发来评价各州的治安和犯罪情况,而使用主成分分析却可以把这些变量概括为两个或三个综合变量(即主成分),以便帮助我们较简便地分析这些数据。表35.1 美国50个州七种犯罪的比率数据state州Murder 杀人罪rape

13、强奸罪robbery抢劫罪assault斗殴罪burglary夜盗罪larceny偷盗罪auto汽车犯罪ALABAMA14.225.296.8278.31135.51881.9280.7ALASKA10.851.696.8284.01331.73369.8753.3ARIZONA9.534.2138.2312.32346.14467.4439.5ARKANSAS8.827.683.2203.4972.61862.1183.4CALIFORNIA11.549.4287.0358.02139.43499.8663.5COLORADO6.342.0170.7292.91935.23903.2477.

14、1CONNECTICUT4.216.8129.5131.81346.02620.7593.2DELAWARE6.024.9157.0194.21682.63678.4467.0FLORIDA10.239.6187.9449.11859.93840.5351.4GEORGIA11.731.1140.5256.51351.12170.2297.9HAWAII7.225.5128.064.11911.53920.4489.4IDAHO5.519.439.6172.51050.82599.6237.6ILLINOIS9.921.8211.3209.01085.02828.5528.6INDIANA7.

15、426.5123.2153.51086.22498.7377.4IOWA2.310.641.289.8812.52685.1219.9KANSAS6.622.0100.7180.51270.42739.3244.3KENTUCKY10.119.181.1123.3872.21662.1245.4LOUISIANA15.530.9142.9335.51165.52469.9337.7MAINE2.413.538.7170.01253.12350.7246.9MARYLAND8.034.8292.1358.91400.03177.7428.5MASSACHUSETTS3.120.8169.1231

16、.61532.22311.31140.1MICHIGAN9.338.9261.9274.61522.73159.0545.5MINNESOTA2.719.585.985.81134.72559.3343.1MISSISSIPPI14.319.665.7189.1915.61239.9144.4MISSOURI9.628.3189.0233.51318.32424.2378.4MONTANA5.416.739.2156.8804.92773.2309.2NEBRASKA3.918.164.7112.7760.02316.1249.1NEVADA15.849.1323.1355.02453.142

17、12.6559.2NEW HAMPSHIRE3.210.723.276.01041.72343.9293.4NEW JERSEY5.621.0180.4185.11435.82774.5511.5NEW MEXICO8.839.1109.6343.41418.73008.6259.5NEW YORK10.729.4472.6319.11728.02782.0745.8NORTH CAROLINA10.617.061.3318.31154.12037.8192.1NORTH DAKOTA0.99.013.343.8446.11843.0144.7OHIO7.827.3190.5181.11216

18、.02696.8400.4OKLAHOMA8.629.273.8205.01288.22228.1326.8OREGON4.939.9124.1286.91636.43506.1388.9PENNSYLVANIA5.619.0130.3128.0877.51624.1333.2RHODE3.610.586.5201.01489.52844.1791.4S11.933.0105.9485.31613.62342.4245.1S2.013.517.9155.7570.51704.4147.5TENNESSEE10.129.7145.8203.91259.71776.5314.0TEXAS13.33

19、3.8152.4208.21603.12988.7397.6UTAH3.520.368.8147.31171.63004.6334.5VERMONT1.415.930.8101.21348.22201.0265.2VIRGINIA9.023.392.1165.7986.22521.2226.7WASHINGTON4.339.6106.2224.81605.63386.9360.3WEST VIRGINIA6.013.242.290.9597.41341.7163.3WISCONSIN2.812.952.263.7846.92614.2220.7WYOMING5.421.939.7173.981

20、1.62772.2282.0建立数据文件程序如下:data princ1 ;input state $1-15 murder rape robbery assault burglary larceny auto ;title Crime rates per 100,000 population by state ;cards ;ALABAMA 14.2 25.2 96.8 278.3 1135.5 1881.9 280.7ALASKA 10.8 51.6 96.8 284.0 1331.7 3369.8 753.3WYOMING 5.4 21.9 39.7 173.9 811.6 2772.2

21、 282.0;run ;调用主成分分析princomp过程菜单操作方法为选择Globals/SAS/Assist/Data Analysis/Multivariate/Principal Components(主成分分析)命令,再选择Active data set为work.princ1,Columns to be analyzed为所有7个变量,在Additional options选项子菜单中,将Table to contain original data and scores项所指定的表数据集设为crimcomp,然后提交运行。编程方法如下:proc princomp data=prin

22、c1 out=crimcomp ;proc sort data=crimcomp ;by prin1 ;proc print ;id state ;var prin1 prin2 murder rape robbery assault burglary larceny auto ;proc sort data=crimcomp ;by prin2 ;proc print ;id state ;var prin1 prin2 murder rape robbery assault burglary larceny auto ;proc plot data=crimcomp formchar=|+

23、| vpct=65 hpct=65;plot prin2*prin1=state ;run ;程序说明:proc princomp语句进行主成分分析,结果存储在crimcomp数据集中(输出结果见表 35.2); proc sort过程按第一主成分prin1和第二主成分prin2进行排序,结果由proc print过程输出(输出结果见表 35.3和表 35.4);proc plot过程按第一和第二主成分作散点图(输出图这里省略)。运行后得到以下结果:表 35.2 对美国50个州七种犯罪比率的主成分分析Principal Component AnalysisPrincipal Component

24、 Analysis50 Observations7 Variables(a) Simple Statistics(简单描述统计量) MURDER RAPE ROBBERY ASSAULTMean 7.444000000 25.73400000 124.0920000 211.3000000StD 3.866768941 10.75962995 88.3485672 100.2530492 BURGLARY LARCENY AUTOMean 1291.904000 2671.288000 377.5260000StD 432.455711 725.908707 193.3944175(b) Co

25、rrelation Matrix(相关矩阵) MURDER RAPE ROBBERY ASSAULT BURGLARY LARCENY AUTOMURDER 1.0000 0.6012 0.4837 0.6486 0.3858 0.1019 0.0688RAPE 0.6012 1.0000 0.5919 0.7403 0.7121 0.6140 0.3489ROBBERY 0.4837 0.5919 1.0000 0.5571 0.6372 0.4467 0.5907ASSAULT 0.6486 0.7403 0.5571 1.0000 0.6229 0.4044 0.2758BURGLARY

26、 0.3858 0.7121 0.6372 0.6229 1.0000 0.7921 0.5580LARCENY 0.1019 0.6140 0.4467 0.4044 0.7921 1.0000 0.4442AUTO 0.0688 0.3489 0.5907 0.2758 0.5580 0.4442 1.0000(c) Eigenvalues of the Correlation Matrix(相关矩阵的特征值) Eigenvalue Difference Proportion CumulativePRIN1 4.11496 2.87624 0.587851 0.58785PRIN2 1.2

27、3872 0.51291 0.176960 0.76481PRIN3 0.72582 0.40938 0.103688 0.86850PRIN4 0.31643 0.05846 0.045205 0.91370PRIN5 0.25797 0.03593 0.036853 0.95056PRIN6 0.22204 0.09798 0.031720 0.98228PRIN7 0.12406 . 0.017722 1.00000(d) Eigenvectors(特征向量) PRIN1 PRIN2 PRIN3 PRIN4 PRIN5 PRIN6 PRIN7MURDER 0.300279 -.62917

28、4 0.178245 -.232114 0.538123 0.259117 0.267593RAPE 0.431759 -.169435 -.244198 0.062216 0.188471 -.773271 -.296485ROBBERY 0.396875 0.042247 0.495861 -.557989 -.519977 -.114385 -.003903ASSAULT 0.396652 -.343528 -.069510 0.629804 -.506651 0.172363 0.191745BURGLARY 0.440157 0.203341 -.209895 -.057555 0.

29、101033 0.535987 -.648117LARCENY 0.357360 0.402319 -.539231 -.234890 0.030099 0.039406 0.601690AUTO 0.295177 0.502421 0.568384 0.419238 0.369753 -.057298 0.147046 表 35.3 按第一主成分排序的美国50个州(给出前5条和后5条) STATE PRIN1 PRIN2 MURDER RAPE ROBBERY ASSAULT BURGLARY LARCENY AUTONORTH DAKOTA -3.96408 0.38767 0.9 9.0

30、 13.3 43.8 446.1 1843.0 144.7SoutH DAKOTA -3.17203 -0.25446 2.0 13.5 17.9 155.7 570.5 1704.4 147.5WEST VIRGINIA -3.14772 -0.81425 6.0 13.2 42.2 90.9 597.4 1341.7 163.3IOWA -2.58156 0.82475 2.3 10.6 41.2 89.8 812.5 2685.1 219.9WISCONSIN -2.50296 0.78083 2.8 12.9 52.2 63.7 846.9 2614.2 220.7STATE PRIN

31、1 PRIN2 MURDER RAPE ROBBERY ASSAULT BURGLARY LARCENY AUTONORTH DAKOTA -3.96408 0.38767 0.9 9.0 13.3 43.8 446.1 1843.0 144.7SoutH DAKOTA -3.17203 -0.25446 2.0 13.5 17.9 155.7 570.5 1704.4 147.5WEST VIRGINIA -3.14772 -0.81425 6.0 13.2 42.2 90.9 597.4 1341.7 163.3IOWA -2.58156 0.82475 2.3 10.6 41.2 89.

32、8 812.5 2685.1 219.9WISCONSIN -2.50296 0.78083 2.8 12.9 52.2 63.7 846.9 2614.2 220.7ARIZONA 3.01414 0.84495 9.5 34.2 138.2 312.3 2346.1 4467.4 439.5FLORIDA 3.11175 -0.60392 10.2 39.6 187.9 449.1 1859.9 3840.5 351.4NEW YORK 3.45248 0.43289 10.7 29.4 472.6 319.1 1728.0 2782.0 745.8CALIFORNIA 4.28380 0

33、.14319 11.5 49.4 287.0 358.0 2139.4 3499.8 663.5NEVADA 5.26699 -0.25262 15.8 49.1 323.1 355.0 2453.1 4212.6 559.2STATE PRIN1 PRIN2 MURDER RAPE ROBBERY ASSAULT BURGLARY LARCENY AUTOSTATE PRIN1 PRIN2 MURDER RAPE ROBBERY ASSAULT BURGLARY LARCENY AUTOMISSISSIPPI -1.50736 -2.54671 14.3 19.6 65.7 189.1 91

34、5.6 1239.9 144.4SoutH CAROLINA 1.60336 -2.16211 11.9 33.0 105.9 485.3 1613.6 2342.4 245.1ALABAMA -0.04988 -2.09610 14.2 25.2 96.8 278.3 1135.5 1881.9 280.7LOUISIANA 1.12020 -2.08327 15.5 30.9 142.9 335.5 1165.5 2469.9 337.7NORTH CAROLINA -0.69925 -1.67027 10.6 17.0 61.3 318.3 1154.1 2037.8 192.1DELA

35、WARE 0.96458 1.29674 6.0 24.9 157.0 194.2 1682.6 3678.4 467.0CONNECTICUT -0.54133 1.50123 4.2 16.8 129.5 131.8 1346.0 2620.7 593.2HAWAII 0.82313 1.82392 7.2 25.5 128.0 64.1 1911.5 3920.4 489.4RHODE MASSACHUSETTS 0.97844 2.63105 3.1 20.8 169.1 231.6 1532.2 2311.3 1140.1结果分析表35.2中输出结果(a)包括基本统计数,即每一变量的

36、平均数、标准差。表35.2中输出结果(b)为简单相关系数矩阵。表35.2中输出结果(c)为输出相关矩阵的特征值。表35.2中输出结果(d)为特征向量。我们从相关矩阵出发进行主成分分析。从表35.2中输出结果(c)可以看出,在最后一列累计贡献率中,前两个主成分的累计贡献率已达76.5,前三个主成分的累计贡献率达86.9,最终为100%。因此,可以考虑只取前面两个或三个主成分,它们能够很好地概括这组数据。其中第一主成分分量的特征值为4.11496,其方差为2.87624,贡献率为4.11496/7=58.7851%,请注意七个主成分分量的特征值之和为7。由表35.2中输出结果(d)中的7个特征值和

37、特征向量,我们可以写出由标准化变量所表达的第一主成分为:PRIN1=0.300279 murder + 0.431759 rape +0.396875 robbery +0.396652assault + 0.440157 burglary +0.357360arceny +0.295177auto其中,murder等为标准化变量,即murder=(murder7.444000000)/3.866768941。各标准化指标murder等前的系数,与该主成分所对应的特征值之平方根的乘积是该主成分与该指标之间的相关系数,如PRIN1与murder 相关系数为0.300279 =0.609127。第

38、一主成分单独地说明整个原始数据标准变异的58.78。同样我们可以写出第二主成分为:PRIN2=0.629174muder0.169435rape+0.042247robbery0.343528asault+0.203341burglary+ 0.402319larceny+0.502421 auto第二主成分为抢、盗罪(robbery,burglary,larceny和auto系数为正)与杀、淫罪(muder,rape和assault系数为负)的对比。第一、第二主成分结合,可说明标准总变异的76.48。由于第一主成分对所有变量都有近似相等的载荷,因此可认为第一主成分是对所有犯罪率的总度量。第二

39、主成分在变量auto和larceny上有高的正载荷,而在变量murder和assault上有高的负载荷;在burglary上存在小的正载荷,而在rape上存在小的负载荷。可以认为,这个主成分是用于度量暴力犯罪在犯罪性质上占的比重。第三主成分很难给出明显的解释。在依PRIN1排序的结果表35.3中,排在前面的PRIN1值较小的州犯罪率较低,即北达科他NORTH DAKOTA(PRIN1= -3.96408)州犯罪率最低,PRIN1值较大的州,犯罪率较高,即内华达NEVADA(PRIN1= 5.26699)州犯罪率最高。在依PRIN2排序的结果表35.4中,排在前面的PRIN2值较小州的暴力犯罪性

40、质比重较大,即密西比比MISSISSIPPI(PRIN2= -2.54671)州的暴力犯罪性质比重最大,PRIN2值较大州的暴力犯罪性质比重较小,即马萨诸塞MASSACHUSETTS(PRIN2= 2.63105)州的暴力犯罪性质比重最小。因子分析因子分析(Factor Analysis)是主成分分析的推广,它也是从研究相关矩阵内部的依赖关系出发,把一些具有错综复杂关系的变量归结为少数几个综合因子的一种多变量统计分析方法。具体地说,就是要找出某个问题中可直接测量的、具有一定相关性的诸指标,如何受少数几个在专业中有意义,又不可直接测量到,且相对独立的因子支配的规律,从而可用诸指标的测定来间接确定

41、诸因子的状态。何为因子分析因子分析的目的是用有限个不可观察的潜在变量来解释原变量间的相关性或协方差关系。在这里我们把不可观察的潜在变量称为公共因子(common factor)。在研究样品时,每个样品需要检测很多指标,假设测得个指标,但是这个指标可能受到( = = = 0,且m个非零特征值所对应的特征向量分别为,则的谱分解式为:(36.9)只要令:(36.10)就可以求出因子载荷矩阵。但在实际问题中,我们并不知道、,即不知道,已知的只是个样品,每个样品测得个指标,共有个数据,样品数据见表36.1。为了建立公因子模型,首先要估计因子载荷嵌入 Equation.3 和特殊因子方差。常用的参数估计方

42、法有以下三种:主成分法、主因子解法和极大似然法。主成分法主成分法求因子载荷矩阵的具体求法如下:首先从资料矩阵出发求出样品的协方差矩阵,记之为,其特征值为,相应的单位正交特征向量为,当最后个特征值较小时,则对进行谱分解可以近似为:(36.11)其中,0是协方差矩阵相应的前个较大特征值。先取,然后看是否接近对角阵。如果接近对角阵,说明公共因子只要取一个就行了,所有指标主要受到这一个公共因子的影响;如果不是近似对角阵,就取,然后看是否接近对角阵,如果接近对角阵,就取两个公共因子;否则,再取,直到满足“要求”为止。这里的“要求”要视具体情况而定,一般而言,就像主成分分析一样,直接取前个特征值和特征向量

43、,使得它们的特征值之和占全部特征值之和的85以上即可。此时,特殊因子方差。主因子解法主因子解法是主成分法的一种修正,它是从资料矩阵出发求出样品的相关矩阵,设,则。如果我们已知特殊因子方差的初始估计,也就是已知了先验公因子方差的估计为,则约相关阵为:(36.12)计算的特征值和特征向量,取前个正特征值及相应特征向量为,则有近似分解式:(36.13)其中,令,则和为因子模型的一个解,这个解就称为主因子解。上面的计算是我们假设已知特殊因子方差的初始估计,那么,特殊因子方差的初始估计值如何得到呢?由于在实际中特殊因子方差(或公因子方差)是未知的。以上得到的解是近似解。为了得到近似程度更好的解,常常采用

44、迭代主因子法。即利用上面得到的作为特殊方差的初始估计,重复上述步骤,直到解稳定为止。公因子方差(或称变量的共同度)常用的初始估计有下面三种方法:取为第个变量与其他所有变量的多重相关系数的平方(或者取,其中是相关矩阵的可逆矩阵的对角元素,则)取为第个变量与其他所有变量相关系数绝对值的最大值取=1,它等价于主成分解极大似然法假定公共因子f和特殊因子服从正态分布,那么我们可得到因子载荷阵和特殊方差的极大似然估计。设维的个观察向量为来自正态总体的随机样本,则样本似然函数为和的函数。设,取,对于一组确定的随机样本,已经变成了确定已知的值,则似然函数可以转换为和的函数。接下来,就可以求和取什么值,使函数能

45、达到最大。为了保证得到唯一解,可以附加唯一性条件对角阵,再用迭代方法可求得极大似然估计的和的值。因子旋转因子模型被估计后,还必须对得到的公因子进行解释。进行解释通常意味着对每个公共因子给出一种意义明确的名称,它用来反映在预测每个可观察变量中这个公因子的重要性,这个公因子的重要程度就是在因子模型矩阵中相应于这个因子的系数,显然这个因子的系数绝对值越大越重要,而接近0则表示对可观察变量没有什么影响。因子解释是一种主观的方法,有时侯,通过旋转公因子可以减少这种主观性,也就是要使用非奇异的线性变换。设维可观察变量满足因子模型。设嵌入 Equation.3 是任一正交阵,则因子模型可改写为:(36.14

46、)其中,。根据我们前面假定:每个公因子的均值为0,即,每个公因子的方差为1,即,各特殊因子之间及特殊因子与公共因子之间都是相互独立的,即及。可以证明:(36.15)(36.16)(36.17)(36.18)因此,。这说明,若和是一个因子解,任给正交阵嵌入 Equation.3 ,和也是因子解。由于正交阵嵌入 Equation.3 是任给的,因此,因子解不是唯一的。在实际工作中,为了使载荷矩阵有更好的实际意义,在求出因子载荷矩阵后,再右乘一个正交阵,这样就变换了因子载荷矩阵,这种方法称为因子轴的正交旋转。我们知道,一个所有系数接近0或1的旋转模型矩阵比系数多数为0与1之间的模型容易解释。因此,大

47、多数旋转方法都是试图最优化模型矩阵的函数。在初始因子提取后,这些公因子是互不相关的。如果这些因子用正交变换(orthogonal transformation)进行旋转,旋转后的因子也是不相关的。如果因子用斜交变换(oblique transformation)进行旋转,则旋转后的因子变为相关的。但斜交旋转常常产生比正交旋转更有用的模型。旋转一组因子并不能改变这些因子的统计解释能力。如果两种旋转模型导出不同的解释,这两种解释不能认为是矛盾的。倒不如说,是看待相同事物的两种不同方法。从统计观点看,不能说一些旋转比另一些旋转好。在统计意义上,所有旋转都是一样的。因此,在不同的旋转之间进行选择必须根

48、据非统计观点。在多数应用中,我们选择最容易解释的旋转模型。应注意的几个问题 因子分析是主成分分析的推广,它也是一种降维技术,其目的是用有限个不可观测的隐变量来解释原始变量之间的相关关系。 因子模型在形式上与线性回归模型很相似,但两者有着本质的区别:回归模型中的自变量是可观测到的,而因子模型中的各公因子是不可观测的隐变量。而且,两个模型的参数意义很不相同。 因子载荷矩阵不是唯一的,利用这一点通过因子的旋转,可以使得旋转后的因子有更鲜明的实际意义。 因子载荷矩阵的元素及一些元素组合有很明确的统计意义。 因子模型中常用的参数估计方法主要有:主成分法,主因子法和极大似然法。 在实际应用中,常从相关矩阵

49、R出发进行因子模型分析。 常用的因子得分估计方法有:巴特莱特因子得分和汤姆森因子得分两种方法。Factor因子分析过程因子分析用少数起根本作用、相互独立、易于解释通常又是不可观察的因子来概括和描述数据,表达一组相互关联的变量。通常情况下,这些相关因素并不能直观观测,这类分析通常需用因子分析完成。 factor过程一般由下列语句控制:proc factor data=数据集 ;priors 公因子方差 ;var 变量表 ;partial 变量表 ;freq 变量 ;weight 变量 ;by 变量 ;run ;proc factor语句的有关输出数据集选项out= 输出数据集创建一个输出数据集,

50、包括输入数据集中的全部数据和因子得分估计。outstat= 输出数据集用于存储因子分析的结果。这个结果中的部分内容可作为进一步因子分析的读入数据集。有关因子提取和公因子方差选项method= 因子选择方法包括principal(主成分法),prinit(迭代主因子法),usl(没有加权的最小二乘因子法),alpha(因子法或称harris法),ml(极大似然法),image(映象协方差阵的主成分法),pattern(从type=选项的数据集中读入因子模型)、score(从type=选项的数据集中读入得分系数)。常用方法为principal(主成分法)、ml(极大似然法)和prinit(迭代主因

51、子法)。heywood公因子方差大于1时令其为1,并允许迭代继续执行下去。因为公因子方差是相关系数的平方,我们要求它总是在0和1之间。这是公因子模型的数学性质决定的。尽管如此,但在最终的公因子方差的迭代估计时有可能超过1。如果公因子方差等于1,这种状况称为Heywood状况,如果公因子方差大于1,这种状况称为超-Heywood状况。在超-Heywood状况时,因子解是无效的。priors =公因子方差的计算方法名规定计算先验公因子方差估计的方法,即给各变量的公因子方差赋初值,包括one(等于1.0),max (最大绝对相关系数),smc(多元相关系数的平方),asmc (与多元相关系数的平方成

52、比例,但要适当调整使它们的和等于最大绝对相关),input(从data=指定的数据集中,按type=指定类型读入第一个观察中的先验公因子方差估计),random(0与1之间的随机数)。有关规定因子个数及收敛准则的选项nfactors=n要求保留n个公因子,否则只保留特征值大于1的那些公因子。mineigen=p规定被保留因子的最小特征值。proportion=p使用先验公因子方差估计,对被保留的因子规定所占公共方差比例为这个p值。converge=p当公因子方差的最大改变小于p时停止迭代。缺省值=0.001。maxiter=n规定迭代的最大数。缺省值为30。有关旋转方法的选项rotate因子转

53、轴方式名给出旋转方法。包括none,varimax,quartimax,equamax,orthomax,hk,promax,procrustes。常用的有varimax(正交的最大方差转轴法)、orthomax(由gamma=指定权数的正交方差最大转轴法)和promax(在正交最大方差转轴的基础上进行斜交旋转)。normkaiser | raw | weight | cov | none为了对因子模型进行旋转,规定模型矩阵中行的正规化方法。例如,norm=kaiser表示使用Kaiser的正规化方法。norm=weight表示使用Cureton-Mulaik方法进行加权。norm=cov表示

54、模型矩阵的这些行被重新标度为表示协方差而不是相关系数。norm=raw或none表示不进行正规化。gamma=p规定正交方差最大旋转的权数。prerotate因子转轴方式名规定预先旋转的方法。除了promax和procrustes的旋转方法,任何其他的旋转方法都可使用。有关控制打印输出的选项simple打印输出包括简单统计数。corr打印输出相关阵和偏相关阵。score打印因子得分模型中的系数。scree打印特征值的屏幕图。ev打印输出特征向量。residuals打印残差相关阵和有关的偏相关阵。nplot=n规定被作图的因子个数。plot在旋转之后画因子模型图。preplot在旋转之前画因子模

55、型图。msa打印被所有其余变量控制的每对变量间的偏相关,并抽样适当的Kaiser度量。reorder在打印输出时让各种因子矩阵的这些行重新排序。在第一个因子上具有最大绝对载荷的变量首先被输出,然后按最大载荷到最小输出,紧接着在第二个因子上输出具有最大绝对载荷的变量等等。priors语句为var变量设定公因子方差,值在0.0和1.0之间。其值的设定应与var语句的变量相对应。例如:proc factor;priors 0.7 0.8 0.9; var x y z;其他语句的使用略。Factor score因子得分过程无论是初始因子模型还是旋转后的因子模型,都是将指标表示为公因子的线性组合。在因子

56、分析中,还可以将公因子表示为指标的线性组合,这样就可以从指标的观测值估计各个公因子的值,这种值叫因子得分。它对样品的分类有实际意义。因子得分可由proc score过程完成。score过程一般由下列语句控制: proc score data=数据集 ;var 变量 ;run ;proc score语句选项包括out输出数据集,存储因子得分结果等。将factor和score两个过程书写在同一个程序中,可以提高分析的效率。实例分析例36.1 表36.1给出的数据是在洛杉矶十二个标准大都市居民统计地区中进行人口调查获得的。它有五个社会经济变量,分别是人口总数(pop) 、居民的教育程度或中等教育的年

57、数(school )、雇佣人总数(employ )、各种服务行业的人数(services )和中等的房价(house ),试作因子分析。表36.1 五个社会因素调查数据编号popschool employ services house 1570012.82500270250002100010.96001010000334008.810001090004380013.61700140250005400012.8160014025000682008.3260060120007120011.440010160008910011.5330060140009990012.5340018018000109

58、60013.73600390250001196009.63300801200012940011.4400010013000建立数据文件程序如下:data socecon;input pop school employ services house;title FIVE SOCIO-ECONOMIC VARIABLES;cards; 5700 12.8 2500 270 25000 1000 10.9 600 10 10000 9400 11.4 4000 100 13000;run;程序运行后,生成一个scoecon数据集。调用因子分析factor过程菜单操作方法,在SAS系统的主菜上,选择G

59、lobals/SAS/Assist 进入Assist的主菜单,再选择data analysis/multivar/factor analysis(因子分析)。编程方法如下:proc factor data=socecon method=prin priors=one simple corr score;run;proc factor data=socecon method=prin priors=smc msa scree residual preplot rotate=promax reorder plot outstat=fact_all ;run;proc factor data=soc

60、econ method=ml heywood nfacotors=1;run;proc factor data=socecon method=ml heywood nfactors=2;run;proc factor data=socecon method=ml heywood nfactors=3;run;程序说明:共调用了5个factor因子分析过程。第1个过程为主成分因子分析,第2个过程为主因子分析,第3个过程为提取一个因子的最大似然分析,第4个过程为提取二个因子的最大似然分析,第5个过程为提取三个因子的最大似然分析。第1个factor因子分析过程,由于选项method=prin 和pr

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论