版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
(五、六)主成分分析与因子分析第三章统计分析与SPSS应用5.主成分分析主成分概念首先由KarlPearson在1901年引进,当时只对非随机变量来讨论的。1933年Hotelling将这个概念推广到随机变量。在多数实际问题评估中,不同指标之间是有一定相关性。由于指标较多及指标间有一定的相关性,势必增加分析问题的复杂性。主成分分析就是设法将原来指标重新组合成一组新的互不相关的几个综合指标来代替原来指标。同时根据实际需要从中选取几个较少的综合指标尽可能多地反映原来的指标的信息。引例
一项十分著名的工作是美国的统计学家斯通(Stone)在1947年关于国民经济的研究。他曾利用美国1929一1938年各年的数据,得到了17个反映国民收入与支出的变量要素,例如雇主补贴、消费资料和生产资料、纯公共支出、净增库存、股息、利息外贸平衡等等。
在进行主成分分析后,竟以97.4%的精度,用三新变量就取代了原17个变量。根据经济学知识,斯通给这三个新变量分别命名为总收入F1、总收入变化率F2和经济发展或衰退的趋势F3。更有意思的是,这三个变量其实都是可以直接测量的。斯通将他得到的主成分与实际测量的总收入i、总收入变化率
i以及时间t因素做相关分析,得到下表:
F1F2F3i△itF11
F201
F3001
i0.995-0.0410.057l
i-0.0560.948-0.124-0.102l
t-0.369-0.282-0.836-0.414-0.1121
主成分分析是把各变量之间互相关联的复杂关系进行简化分析的方法。在社会经济的研究中,为了全面系统地分析和研究问题,必须考虑许多经济指标,这些指标能从不同的侧面反映我们所研究的对象的特征,但在某种程度上存在信息的重叠,具有一定的相关性。
主成分分析是考察多个数值变量间相关性的一种多元统计方法。对所导出几个主成分(综合指标),要求尽可能多地保留原始变量的信息,且彼此间不相关。它是研究如何通过少数几个主成分来解释多变量的方差—协方差结构。一般地,利用主成分分析得到的主成分与原始变量之间有下列关系:每一个主成分都是原始变量的线性组合主成分的数目大大少于原始变量的数目主成分保留了原始变量绝大多数信息各主成分之间互不相关5.1数学描述随机向量的方差-协方差矩阵所谓随机向量是指其各分量中至少有一个是随机变量的向量。由于在计量经济分析中不可避免地会涉及随机向量,因此下面简单介绍随机向量的特征。设是随机向量。则它的期望值为X的方差(方差—协方差矩阵)为由于通过这一表达式计算得到的矩阵不仅包括方差也包括协方差,所以常称它为方差—协方差矩阵,记为Var-Cov(X)(在不引起混淆的情况下也称为方差矩阵或协方差矩阵,记为Var(X)或Cov(X)).样本描述调查n个个体(样本)在这k(k<n)个指标下的数值(或者用这k个指标来评价n个对象),就可得到数据矩阵Xk
n:对样本也可计算相应的协方差矩阵为其中是Cov(Xi,Xj)=E[(Xi–E(Xi))(Xj–E(Xj))]的极大似然估计量,也可使用矩估计量,只需将上面的表达式中的系数由1/n换成1/(n–1)即可。例如对于二维数据由极大似然法估计的协方差矩阵为而由矩估计得到的协方差矩阵就是将上面矩阵中将系数换成1/2后的矩阵。协方差矩阵的意义在于它刻画了变量之间的相关性主成分分析的目标就是求原来变量的线性组合Yi:写成矩阵形式就是或而且使得满足Y的协方差矩阵Cov(Y)为对角矩阵,即诸Yi互不相关。Y的方差尽可能大(即,对n个对象的分辨率尽可能强,或者说信息损失尽可能少)。比如使trCov(Y)=trCov(X),就没有“辨识能力”方面的损失。然后,从Y1,Y2,…,Yk中选出对方差贡献最大的部分指标作为主成分。注:主成分分析的目标1)从相关的X1,X2,…,Xk,求出相互独立的(对于样本而言是相互正交的)Y1,Y2,…,Yk,同时2)Y=(Y1,Y2,…,Yk)T的方差(反映变化的能力)不损失,等于X=(X1,X2,…,Xk)T的方差。X与Y之间的计算关系是:即Y=AX5.2几何解释示例•••••••••••••••••••••••••••••••••••••为了方便,我们在二维空间中讨论主成分的几何意义。设有n个样品,每个样品有两个观测变量Xl和X2,在由变量Xl和X2
所确定的二维平面中,n个样本点所散布的情况大致如椭圆状。由图可以看出这n个样本点无论是沿着Xl
轴方向或X2轴方向都具有较大的离散性,其离散的程度可以分别用观测变量Xl
的方差和X2
的方差定量地表示。显然,如果只考虑Xl和X2
中的任何一个,那么包含在原始数据中的经济信息将会有较大的损失。如果我们将Xl
轴和X2轴先平移,再同时按逆时针方向旋转
角度,得到新坐标轴Yl和Y2。Yl和Y2是两个新变量。•••••••••••••••••••••••••••••••••••••平移、旋转坐标轴
旋转变换的目的是为了使得n个样品点在Yl轴方向上的离散程度最大,即Yl的方差最大。变量Yl代表了原始数据的绝大部分信息,在研究某经济问题时,即使不考虑变量Y2也无损大局。经过上述旋转变换原始数据的大部分信息集中到Yl轴上,对数据中包含的信息起到了浓缩作用。•••••••••••••••••••••••••••••••••••••主成分分析的几何解释平移、旋转坐标轴•••••••••••••••••••••••••••••••••••••主成分分析的几何解释平移、旋转坐标轴••••••••••••••••••••••••••••••••••••••主成分分析的几何解释平移、旋转坐标轴•••••••••••••••••••••••••••••••••••••••••••••••••••••••••••••••Yl,Y2除了可以对包含在Xl,X2中的信息起着浓缩作用之外,还具有不相关的性质,这就使得在研究复杂的问题时避免了信息重叠所带来的虚假性。二维平面上的各点的方差大部分都归结在Yl轴上,而Y2轴上的方差很小。Yl和Y2称为原始变量X1和X2的综合变量。Y简化了系统结构,抓住了主要矛盾。5.3有关矩阵知识的回顾一、两个线性代数的结论
其中是A的特征根。1、若A是k阶实对称阵,则一定可以找到正交阵U,使2、若上述矩阵A的各特征根所对应的单位特征向量为则实对称阵属于不同特征根所对应的特征向量构成的矩阵是正交的,即有令即5.4主成分的计算结论对矩阵COV(X)而言(它是k阶的实对称矩阵):(1)我们可以找到它的k个实特征根
1,
2,…,
k
。(2)相应的k个长度为1的、相互正交的特征向量b1,b2,…,bk,即特征向量矩阵式中,bj=(b1j,b2j,…,bkj)T,。也就是BTB=BBT=Ik×k。(3)按下法求主成分Yi:式中,X=(X1,X2,…,Xk)T。Yi(i=1,…,k)就是相互正交的综合向量(综合指标)。上式的压缩表达式是:Y=BTX,展开表达式进一步展开的表达式是这就是主成分Y1,Y2,…,Yk的计算公式。这样计算出的主成分Y1,Y2,…,Yk满足:(1)COV(Y)为对角阵,即Y1,Y2,…,Yk之间互不相关,而且Yi的方差为
i。即(2)Y与X的协方差矩阵的对角线上的元素之和相等,即trCOV(Y)=trCOV(X),这表明没有方差的损失,并且(3)trCOV(Y)==k若取
1,
2,…,
q,使
(
1+
2+…+
q)/(
1+
2+…+
k)≥85%
则,,就是反映了原来指标下数据主要信息的少数几个综合指标。精度分析1)贡献率:第i个主成分的方差在全部方差中所占比重,称为它的贡献率。贡献率说明该主成分反映了原来k个指标多大的信息,有多大的综合能力。2)累积贡献率:前s个主成分共有多大的综合能力,用这s个主成分的方差和在全部方差中所占比重来描述,称为累积贡献率。
我们进行主成分分析的目的之一是希望用尽可能少的主成分Y1,Y2,…,Ys(s≤k)代替原来的k个指标。到底应该选择多少个主成分,在实际工作中,采用的主成分个数s的多少取决于它们是否能够反映原来变量85%以上的信息量,即当累积贡献率≥85%时,主成分的个数就足够了。一些常见的问题中主成分为2到3个。5.5一个简单的等价算法1.数据的标准化对样本数据矩阵Xk
n中的数据Xij进行标准化处理:处理后的数据构成的矩阵记为x2.两个重要结论x的协方差矩阵Cov(x)的特征根和单位特征向量与原来数据X的协方差矩阵Cov(X)的特征根和单位特征向量相同.由X的原来数据所求得的相关系数矩阵Rk
k=标准化后的协方差矩阵Cov(x)。3.主成分的简化算法(1)由X的原始数据求出相关系数矩阵Rk
k;(2)求R的特征根
1,2,…,k(从大到小排列)及一组相互正交的单位特征向量b1,b2,…,bk;(3)取
1,2,…,q,使得累积贡献率满足则即为所求。对于步骤(3),也可以按如下方式进行:取所有特征根大于1的特征向量(设有s个)来计算主成分,即注:这种方法计算得到的主成分个数,可能与(3)中不同,因而有可能累积贡献率达不到85%以上。例在企业经济效益的评价中,涉及的指标往往很多.为了简化系统结构,抓住经济效益评价中的主要问题,我们可从原始数据矩阵出发求出主成分.在对我国部分省、市、自治区独立核算的工业企业的经济效益评价中,涉及到9项指标,X1—100元固定资产原值实现产值,X2—100元固定资产原值实现利税,X3—100元资金实现利税,X4—100元工业总产值实现利税,X5—100元销售收入实现利税,X6—每吨标准煤实现工业产值,X7—每千瓦时电力实现工业产值,X8—全员劳动生产率,X9—100元流动资金实现产值(数据见EX主成分分析)Y1=0.928*x1+0.977*x2+0.935*x3+0.232*x4+0.460*x5+0.934*x6+0.894*x7+0.959*x8+0.904*x9Y2=-0.329*x1+0.150*x2+0.310*x3+0.873*x4+0.568*x5-0.210*x6-0.288*x7-0.01679*x8-0.174*x96.因子分析6.1概述因子分析(factoranalysis)是一种数据简化的技术。它通过研究众多变量之间的内部依赖关系,探求观测数据中的基本结构,并用少数几个假想变量来表示其基本的数据结构。这几个假想变量能够反映原来众多变量的主要信息。原始的变量是可观测的显在变量,而假想变量是不可观测的潜在变量,称为(公共)因子。例如,在企业形象或品牌形象的研究中,消费者可以通过一个有24个指标构成的评价体系,评价百货商场的24个方面的优劣。
但消费者主要关心的是三个方面,即商店的环境、商店的服务和商品的价格。因子分析方法可以通过24个变量,找出反映商店环境、商店服务水平和商品价格等少数几个潜在的因子(例如三个),对商店进行综合评价。而原来变量可用这三个公共因子可以表示为:公共因子是不可观测的潜在因子。24个变量共享这三个因子,但是每个变量又有自己的个性,不被公共因子包含的部分,称为特殊因子。因子分析的主要作用:(1)寻求基本结构在多元统计分析中我们经常遇到诸多变量之间存在强相关的问题。这会对分析带来许多麻烦。例如回归分析中的多重共线性问题。通过因子分析,我们可以找出几个较少的有实际意义的因子,反映出原来数据的基本结构。(2)数据化简通过因子分析可以用所找出的少数几个因子代替原来的变量做回归分析、聚类分析、判别分析等。注:
因子分析与回归分析不同,因子分析中的因子是一个比较抽象的概念,而回归分析中的因子有非常明确的实际意义;
主成分分析与因子分析也有不同,主成分分析仅仅是变量变换,而因子分析需要构造因子模型。主成分分析:原始变量的线性组合表示新的综合变量,即主成分;因子分析:潜在的假想变量和随机影响变量的线性组合表示原始变量。6.2数学描述与主要特征由于数据的标准化不改变原来变量之间的相互关系,而又常常能使问题简化,因此以下的讨论都建立在已标准化的数据之上。因子分析最初由英国心理学家C.Spearman提出。他提出的问题是:学生的k门功课的成绩xi是由一个起公共作用的智力因子f与起特殊作用的因子ei所决定的。后来,美国心理学家L.Thurstone认为智力因子多于一个,于是模型成为因此,我们现在面临的数据矩阵Xk
n(k<n)是所面临的因子分析的(样本观察值的)数学模型是其中m<k。fj是公共因子(CommonFactors),它们之间是两两正交的(Orthogonal).ei是特殊因子(UniqueFactors),只对相应的xi起作用的因子它们都已经标准化aij是公共因子的负载(FactorLoadings),是第i个变量在第j个因子上的负载,相当于多元回归中的标准化回归系数(注意我们假设fj也是标准化了的)。矩阵称为公共因子的负载矩阵。除了假设公共因子之间互不相关(两两正交)外,进一步还假设特殊因子也互不相关,并且公共因子与特殊因子之间也互不相关。基于这样的假设,可以证明(1)aij也是xi与fj之间的简单相关系数。事实上,由于xi与fj都是标准化了的(其方差都为1),所以,它们之间的简单相关系数为(2)xi与xj的简单相关系数rij,是两个变量的公共因子对应系数的乘积之和。(3)xi的方差为:其中
(即负载矩阵第i行元素的平方和)称为公因子方差(Communality),又称为公共度或公共方差,代表了xi的方差中由公共因子决定的部分。若则表明xi的公共因子(f1,f2,…,fm)解释了xi的96%的方差(注意xi的方差等于1)。实际上(4)fj因子的贡献(Contribution,记为Vj),是该因子在模型中的所有负载的平方和(负载矩阵第j列元素的平方和):由于xi已标准化,所以k个变量的总方差为k,Vj/k表示第j个公共因子的贡献在所有方差中占的比例。6.3因子模型与主成分模型的区别因子模型主成分模型之间的区别:公共因子在因子模型等号的右边,而主成分在主成分模型等号的左边。此外在因子模型中除了公共因子外还存在特殊因子,因此公共因子只能解释原来变量的部分方差,而主成分能解释原来变量的所有方差。6.4对应于样本模型的总体模型样本模型可以简单地用矩阵表达如下:式中,x=(x1,x2,…,xk)T,f=(f1,f2,…,fm)T,e=(e1,e2,…,ek)T是因子负载矩阵。如果用大写字母表示相应的随机变量(相应样本值的总体变量),则总体模型可以表示为:其矩阵表示为:其中,A是确定型矩阵,X,F都是标准化了的随机向量,且F1,F2,…,Fm互不相关,所以E(X)=0,E(F)=0,Cov(F,F)=Cov(F)=Im
m,随机变量ε1,ε2,…,εk与F相互独立,且E(ε)=0,
6.2小节的结论就是基于上述假设得到的。6.5变量x1,x2,…,xk之间的相关性检验因子分析的前提是变量X1,X2,…,Xk之间的相关性,如果X1,X2,…,Xk之间正交,则它们之间就不会存在公共因子,因此作因子分析就失去意义了。所以在进行因子分析之前,必须先检验X1,X2,…,Xk之间的相关性。只有在相关性较高时,才适合做因子分析。有时这样的检验也称为适当性检验。检验变量之间的相关性是否高到适合进行因子分析的常用方法有如下两种:(1)KMO样本测度(Kaiser-Meyer-OlkinMeasureofSamplingAdequacy)。它是所有变量X1,X2,…,Xk的简单相关系数的平方和与这些变量之间的偏相关系数的平方和之差。
相关系数实际上反映的是公共因子起的作用。由于偏相关系数是在控制了其他变量对两变量影响的条件下,计算出来的净相关系数,如果变量之间确实存在较强的相互重叠传递影响,即如果变量中确实能够提取出公共因子,那么控制了这此影响后的偏相关系数必然比较小。
因此KMO越接近1,越适合于公共因子分析。KMO过小,则不适合作因子分析。(2)巴特莱特球体相关检验(Bartletttestofsphericity)。这个统计量(在一定条件下服从χ2分布)从整个相关系数矩阵来考虑问题,其零假设H0是相关系数矩阵为单位矩阵,可以按常规的假设检验的方法判断相关系数矩阵是否显著地异于单位矩阵。没有针对KMO测度的显著性检验。数据是否适合做因子分析一般采用如下主观判断。KMO
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 人工智能辅助分子设计加速氨三乙酸高端应用研发的商业化路径探索
- ESG标准对烘焙机械项目投资估值的隐性成本影响
- AIoT融合趋势中电子打卡钟从单一终端向边缘计算节点转型
- 2026年潍坊护理职业学院高职单招笔试物理试题库含答案解析2套试卷
- 2026年湖州职业技术学院高职单招笔试职业适应性测验试题库含答案解析3套试卷
- 2026年湖南吉利汽车职业技术学院高职单招笔试职业适应性测验试题库含答案解析2套试卷
- 2026年湖北工业职业技术学院高职单招笔试职业适应性测验试题库含答案解析2套试卷
- 2026年深圳信息职业技术学院高职单招笔试职业适应性测验试题库含答案解析3套试卷
- 2026年海南住院医师-海南住院医师皮肤科历年参考题库含答案解析
- 2026年浙江广厦建设职业技术学院高职单招笔试物理试题库含答案解析2套试卷
- 有限空间作业安全技术规范与实操培训
- 2026年天津中考地生会考(真题)及参考答案
- 黑龙江省龙东地区2026年中考历史真题真卷附答案
- 2026江苏南京市栖霞区人民政府迈皋桥街道办事处公开招聘编外聘用人员19人笔试题库(黄金题型)附答案详解
- 2026中国公证协会招5人笔试题库及参考答案详解
- 工艺技术变更管理流程
- 新人教版初中英语七八九年级全部单词全集
- 2026新教材语文 三年级上册第七单元22 《读不完的大书》说课教学课件
- 《精细化工生产技术 》课件-涂料新技术-创新驱动绿色未来
- 2026年文旅行业安全生产试题及答案
- 2026年三级健康管理师《操作技能》考试真题(后附答案及解析)
评论
0/150
提交评论