版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
1、学科分类号110 黑龙江科技大学本科学生毕业论文题目主成分与因子分析对黑龙江省城市经济发展水平的评价the principal components and factor analysis of urban economic development level ? evaluation of heilongjiang province 姓名学号院 (系)理学院专业、年级数学与应用数学指 导 教 师2014 年 6 月 12 日摘要经济是指一个国家国民经济的总称。我们要提高某地方人民的生活水平,要更好更快地发展某个地区,就必须充分了解这个地区现有的经济发展状况。因此,现有的经济发展状况研究对将来
2、的发展有着非常重要的指导意义。主成分分析也称主分量分析,就是设法将原来指标重新组合成一组新的互相无关的几个综合指标来代替原来指标。因子分析是主成分分析的推广和发展,它也是将具有错综复杂关系的变量综合为数量较少的几个因子,以再现原始变量与因子的相互关系,同时根据不同因子还可以对变量进行分类。主成分分析与因子分析都是多元分析中处理降维的一种统计方法。本文通过学习与查阅相关资料找到黑龙江省12个地级市的 10个具有代表性指标,运用spss 统计分析软件对这些指标进行主成分分析和因子分析得到特征值、方差贡献率及公共因子等相关数据。并利用这些数据对12个市经济水平划分等级。关键词主成分分析因子分析经济
3、spss 统计分析软件abstract economy refers to the floorboard of the national economy of a country. we will improve the level of a local peoples life, to somewhere better and faster development, we must fully understand the current situation of economic development. therefore, the existing research on the de
4、velopment of future economic development has a very important guiding significance. principal component analysis (also called principal component analysis, is to try the original index combined into a new set of several comprehensive index instead of the original index has nothing to do with each ot
5、her, at the same time, according to the actual need to recommend a few less comprehensive response as much as possible the original information of indicators. is a generalization of the principal component analysis and factor analysis, it is also will have the intricate relationship between variable
6、s comprehensive to a small number of several factors, and to recreate the relationship of the original variables and factor, at the same time according to different factors can also categorize variables,. principal component analysis and factor analysis is a multivariate analysis of a statistical me
7、thod of dealing with the dimension reduction. in this article, through learning and access to relevant data found nine representative indexes of 12 cities in heilongjiang province, using the spss statistical analysis software to the indicators of principal component analysis and factor analysis of t
8、he characteristic value, the variance contribution rate and public factor and related data. and using the data of 13 cities economic grade level. key words principal component analysis factor analysis economic spss statistical analysis softwar目录contents 第 1 章绪论选题的背景和提出1.1.1 选题的背景经济的发展不仅仅意味着规模的扩大,更意味
9、着经济和素质的提高。 所以,经济发展涉及的内容比单纯的更为广泛。就现代经济而言,发展的含义十分丰富复杂。发展总是与发达、增长之间交替使用。一般来说,经济发展包括三种含义1:第一种,经济量的增长 , 即一个或地区产品和的增加, 它是经济发展的物质基础;第二种,的改善,即一个或地区的技术、收入分配、及等经济结构的变化;第三种,经济质量的完善和提升,即一个或地区的提升、程度、卫生健康状况的完善、自然环境和以及政治、文化和人的现代化进程。在近 10 年加快改革开放的步伐中 , 我国地区之间的发展不平衡呈现了不断的加剧局面。有调查显示,目前中国城市与农村发展差异化比较严重,在第九个五年计划期间所统计到的
10、数据显示,中国农业从业者的收入一直在下降,粮食产品的价格也在下降,虽然收成增产了,但收入却不见增加,地方政府对城市经济发展的重视程度要远远大于农业。除了造成了农村经济发展失衡外,也促使了城市经济发展过程中贫富差距问题的深化,也使社会分配不公平现象得到剧增,更令社会当中不稳定的因素有所增加。除去城乡发展不平衡,我国东中西部发展差距也较大,主要表现在以下两方面:一是在资本存量方面:沿海地区由于开放得比较早,以乡镇企业为代表的民营经济迅速增长 , 资本大量累积 ; 同时因为改革开放一系列优惠政策的实施,成功地吸引了大量国外资本的输入, 这为沿海地区快速的经济增长提供了充足的资本投入。但是由于中西部地
11、理位置和政策的影响资本存量都不及东部,而而还有愈演愈烈的趋势。二是科技投入方面: 东部是优势地区, 据调查显示 1990 年东部地区从事科技活动人数是中部地区的2 倍,西部地区的 3 倍;迄今,东部此类人才数量增加到中部的倍, 西部的 4 倍。尤其是在 2000 年东部从事科技活动人员比上年激增 48%,但中西部地区同期分别只增长了19%、32%。东部地区 20 世纪 90 年代以来加大了研发经费投入力度, 2000 年东部研发经费支出比上年增长了87%, 到 2010这一年经费开支增加到2000 年的倍 , 而中西部地区研发经费支出基本保持 1 的态势,在 1990 到 1999 年增长较慢
12、 , 2000年开始逐年稳步增长,但从绝对数量来看远低于东部地区。经济发展不能以危害环境为代价,可持续发展的要求是一个或地区的发展不能影响其他国家或地区的发展,可持续性则意味着维持全人类福利的基础,使和经济社会。了解我国各省市经济发展情况对推动我国经济发展有着重要作用,所以对各省经济的研究是很必要的。1.1.2 选题的提出黑龙江省位于中国东北部,是我国着名的老工业基地,2008 年全年实现地区生产总值 (gdp)亿元,在各省自治区中排名17位,按可比价格计算比上年增长%,连续五年保持 %以上的增幅,整体经济继续在较高的增长平台运行。其中,第一产业增加了亿元,增长%;第二产业增加了亿元,增长%;
13、第三产业增加了 2855亿元,增长 %。三次产业构成为:。第一、二、三产业对gdp的增长贡献率分别为 %、%和%。人均地区生产总值为21727元,增长 %。经济发展布局进一步优化。全年哈大齐工业走廊项目区实现工业总产值亿元,比上年增长 %;创造利税亿元,增长 %。全年完成固定资产投资投资亿元,增加 241项新开工项目,新增入251 户区企业,新增了182 户的投产企业。东部煤电化基地建设区充分挖掘和发挥电力、煤化工、冶金、建材原料、生物工程等产业的优势,坚持走新型工业化道路。东北亚经济贸易开发区积极主动推进区域的经济贸易合作,打造了面向东北亚、亚欧大陆的经济贸易开发区。加快大小兴安岭生态功能保
14、护区发展特色产业、生态产业等替代产业,优化产业结构,加快基础设施建设,努力形成以生态经济为主的产业格局。两大平原农业综合开发试验区主要抓好农业基础建设、农业结构调整, 做大做强畜牧产业,以大力推进农业标准化、规模化和产业化经营,致力于打造销售收入千亿元以上龙头企业集群,创出一批知名品牌。北国风光特色旅游开发区积极开发具有国际性、地域性和市场竞争力较强的旅游精品和品牌。哈牡绥东对俄贸易加工区的对内对外开放战略升级逐步加快。增强了高新科技产业集中开发区发挥高新技术集聚效应,发展取得积极进展的有服务外包产业、动漫基地。黑龙江省主要有12个地级市,这些城市的综合发展是带动周边地区经济发展的重要动力。这
15、些城市的发展状况直接关系到城市自身和周边地区(尤其是小城镇)的进步,对这些城市进行分析评价, 从而有效的根据城市的实际情况,采取促进经济和社会发展的有效措施。对黑龙江省的经济研究的现况是没有把这 12 个城市放在一起进行多指标综合评价。 而目前国内外关于多指标综合评价的方法很多,根据权重确定方法的不同,这些方法可大致分为两类;一类是主观赋权法,如层次分析法,德尔菲法等,多是采用综合咨询评分的定向方法,这类方法因受到人为因素的影响,往往会夸大或降低了某些指标的作用,致使排序的结果不能完全真实地反应事物间真实关系;另一类是客观赋权法,即根据各指标间的相关关系或各指标值的变异程度来确定权数,避免了人
16、为因素带来的偏差,如主成分分析法和因子分析法。选题的意义和目的1.2.1 选题的意义经济是指一个国家国民经济的总称2。区域经济是在一定区域内经济发展的内部因素与外部条件相互影响而形成的综合性经济概念,它受到该区域的自然条件、资源开发和利用状况、社会经济条件以及经济政策等各种因素的制约和影响。经济发展为一个国家摆脱贫困落后状态,走向经济和社会生活现代化的过程。区域经济发展不仅意味着该区域国民经济规模的扩大,更意味着经济和社会生活素质的提高。我们要提高某地方人民的生活水平,要更好更快地发展某个地方,就必须充分了解这个地方现有的经济发展状况。因此,现有的经济发展状况研究对将来的发展有着非常重要的指导
17、意义。1.2.2 选题的目的本文利用主成分分析和因子分析的方法对经济发展水平进行综合分析,按照城市的经济实力评价各城市的发展层次,认识到城市之间竞争力的差异,城市经济发展的优势和劣势,从而促进各省经济全面、协调、共同发展。主成分分析和因子分析的发展及应用1.3.1 主成分分析的发展及应用主成分分析也称主分量分析,旨在利用降维的思想,把多指标转化为少数几个综合指标。首先是由k 皮尔森对非随机变量引入的3,而后 h 霍特林将此方法推广到随机变量的情形。信息的大小通常用离差平方和或方差来衡量。在实际课题中,为了全面分析问题,往往提出很多与此有关的变量(或因素)因为每个变量都在不同程度上反映这个课题的
18、客观信息。在实际问题研究中,为了全面、系统地分析问题,我们必须考虑众多影响因素。在用统计方法研究多变量问题时,变量太多会增加计算量和增加分析问题的复杂性,人们希望在进行定量分析的过程中,涉及的变量较少,得到的信息量较多。主成分分析正是适应这一要求产生的,是解决这类题的理想工具。主成分分析往往会在大型研究中成为一个中间环节,用于解决数据信息浓缩等问题,这就可能产生各种各样的组合方法。主成分所关心的问题,是通过一组变量的几个线性组合来解释这组变量的方差 -协方差结构,它的一般目的是数据的压缩以及数据的解释。在一些欧美国家用核主成分分析的方法也就是主成分分析的改进方法,其采用非线性方法提取主成分,把
19、核主成分分析应用到人脸识别中。在国外运用主成分分析的方法对肝素钠、肝素钙等低分子肝素相关产品的销售额数据进行处理,形成新的指标体系,而后应用bp 神经网络的方法建立模型,评价模型的拟合能力。在日本运用主成分分析的方法对地质行分析,从而来预测地震避免不必要的损失。同时,主成分作为一种优秀的降维提取主要信息的手段,先后在海洋学、地质学、地球物理学、资源科学等中都得到了一定程度的应用。我国经过近几十年来的发展,运用主成分分析的方法对高光谱遥感矿物信息特征提取已经取得了很大进展。在国内运用主成分分析的方法对人口、教育、地区的经济发展等方面研究,都取得了一定的成果。1.3.2 因子分析的发展及应用在对某
20、一个问题进行论证分析时,采集大量多变量的数据能为我们的研究分析提供更为丰富的信息和增加分析的精确度。然而,这种方法不仅需要巨大的工作量,并且可能会因为变量之间存在相关性而增加了我们研究问题的复杂性。因而分析法就是从研究变量内部相关的依赖关系出发把一些具有错综复杂关系的变量归结为少数几个综合因子的一种多变量统计分析方法。这样我们就对原始的数据进行分类归并,将相关比较密切的变量分别归类,归结多个综合指标,这些综合指标互不相关,即它们所综合的信息互相不重叠。这些综合指标就称为因子或公共子因子。因子分析法是两种分析形式的,即验证性分析和纯粹的探索性分析。因子分析最早是由英国的家charlesspear
21、man 在 1904年的时候,提出单一化的智能因子 (asingleintellectualfactor)开始。随着试验的深入,大量个体样本被分析研究, 证明了 spearman的单一智能因子理论是不充分的。同时,人们渐渐认识到有必要考虑多元因子。20世纪 30 年代,瑞典心理学家 thurstone打破了流行的单因子理论假设,经长期实践研究,他大胆提出了多元因子分析(multiplefactoranalysis) 理论。 thurstone在他的心智向量 (vectorsofmind ,1935)一书中,阐述了多元因子分析理论的数学和逻辑基础。因子分析的基本目的就是用少数几个因子去描述许多指
22、标或因素之间的联系,即将相关比较密切的几个变量归在同一类中,每一类变量就成为一个因子(之所以称其为因子,是因为它是不可观测的,即不是具体的变量),以较少的几个因子反映原资料的大部分信息。 因子分析法 (factor?analysis)就是寻找这些公共因子的模型分析方法,它是在主成分的基础上构筑若干意义较为明确的公因子,以它们为框架分解原变量,以此考察原变量间的联系与区别4。因子分析在市场调研中有着广泛的应用,主要包括:经济发展的研究、评价指标结构、消费者习惯和态度研究(u&a) 、品牌形象和特性研究、服务质量调查、个性测试、形象调查、市场划分识别、顾客、产品和行为分类。本文主要研究内容
23、本文首先是了解了国内外经济发展的基础及黑龙江省经济发展的现状,接着学习研究主成分分析和因子分析的基本思路和步骤,并将其理论与本文所研究的内容结合,其目的在于找到目前影响黑龙江省经济发展指标的主要因素,并根据得到的数学模型对黑龙江省经济发展情况进行综合分析。然后通过学习与查阅相关资料找到黑龙江省12 个地级市的 10 个具有代表性指标,运用spss统计分析软件对这些指标进行主成分分析和因子分析得到特征值、方差贡献率及公共因子等相关数据。 并利用这些数据对12个市经济水平划分等级。 最后对论文进行总体的评价,指出本文的不足,以期待改进的新方案。第 2 章 主成分与因子分析主成分分析的内容2.1.1
24、 主成分分析原理和基本思想karl parson 在 1901年最先引进了主成分的概念5,但是当时只是对非随机变量讨论的。 hotelling 在 1933 年将这个概念推广到随机变量。主成分分析的思想是降维,在损失很少信息的前提下把多个指标转化为较少的几个综合指标。通常情况下将转化生成的综合指标称为主成分,原始变量的线性组合就是每个主成分,且各个主成分之间是各不相关的,这就使得主成分比原始变量具有更优越的性能3。通常数学上的处理就是将原来p 个指标作线性组合,作为新的综合指标,但是这种现行组合,如果不加以限制,则可以有很多,我们应该选取方差最大的作为第一主成分,较大的作为第二主成分, 一次类
25、推可以构造出第三、 四, 等 p 个主成分。不难想像这些主成分之间不仅不相关,而且他们的方差一次递减。因此在实际问题中,就挑选前几个最大成分,虽然这样会损失一些信息,但是由于它使我们抓住了主要矛盾, 并从原始数据中进一步提取了某些新信息,因为在某次额实际工作中的研究中得益较多,这种不仅减少了变量的数目还抓住了主要矛盾的做法更有利于问题的分析和处理。2.1.2 主成分的几何意义从代数学的点看,成分就是p 个变量1,.,pxx的一些特殊的线性组合6,在几何上这些线性组合正是把1,.,pxx构成的坐标系旋转产生的新坐标系,新坐标轴使之通过样品变差最大方向(或说具有最大的样品方差) 。下面以最简单的二
26、元正态变量来说明主成分的几何意义6。设有n个样品,每个样品有p 个变量记为1,.,pxx,它们的综合变量记为12,.,pf ff。当2p时,原变量是12,xx设122(,) (, ),xxxn它们有图3-1 的相关关系:2f2x1f1x图 3-1 相关关系图对于二元正态分布变量,n个点的散步大致为一个椭圆,若在椭圆长轴方向取坐标轴1f,在短轴方向取2f,这相当于在平面上作一个坐标变换,即按逆时针方向旋转角度,根据旋轴变换公式新老坐标之间有关系:112212cossinsincosfxxfxx我们看到1f,2f是原变量1x和2x的线性组合,用矩阵表示是1122cossinsincosfxu xf
27、xag显然u ui 。从上图还容易看出二维平面上的n个点的波动(可用方差表示)大部分可以归结为在1f轴上的波动,而在2f轴上的波动是较小的。如果上图的椭圆是相当扁平的,那么我们可以只考虑1f方向上的波动,忽略2f方向的波动。这样一来,二维可以降为一维了,只取第一个综合变量1f即可。而1f是椭圆的长轴。一般情况, p 个变量组成 p 维空间,n个样品就是 p 维空间的n个点,对 p元正态分布变量来说,找主成分的问题就是找p 维空间中椭球体的主轴问题。2.1.3 主成分分析的性质(1) 各主成分之间互不相关,若原变量服从正态,则各主成分之间互相独立7;(2) 全部m个主成分所反映的n例样品的总信息
28、,等于m个原变量的总信息。信息量的多少,用变量的方差来度量。若将m个原变量标准化后,每个变量的方差都为,故方差之和为m,此时,求得主成分的方差之和也为m;(3) 各主成分的作用大小是:12mfff ;(4) 第 i 个主成分的贡献率是 (ik ) 100, k 为贡献率之和 ; (5) 前 p个主成分的累计贡献率是 ()iip/m) 100。在应用时 , 一般取累计贡献率为 7085或以上所对应的前p 个主成分即可。 在资料所含的变量个数、样品数及累计贡献率固定的前提下,/p m的比值越小,则说明此资料用主成分分析越合适。主成分分析的求解方法和数学模型求解主成分的方法主要有两种,一是从原始变量
29、的协方差矩阵结构入手,二是从原始变量的相关性矩阵结构入手。(1) 从协方差矩阵出发求解主成分为8:设 矩 阵aa , 将 a 的 特 征 值12,.,n依 大 小 顺 序 排 列 , 不 妨 设1212.,.pp为矩阵 a各特征值对应的标准正交特征向量,则对任意向量x有1max,minpx axx axx xx x所以我们把12,.,pxxx的协方差矩阵的非零特征值12.0p,对应的标准化特征像量1,2,pl,分别作为系数向量1122,.,ppfxfxfx1122,ppfx fx fx分别称为随机向量 x 的第一主成分,第二主成分, ,第 i 主成分。于是随机 x 与y 随机向量之间存在关系:
30、pppxxxlllxly222121(2-1)(2) 从相关系数矩阵出发求解主成分为:首先数据矩阵元素进行标准化11,1,2,. ;()/ ;() / (1);nniiiiiiiiiiixuzip uxnxxn(2-2)式中,iu和ii分别表示变量ix的期望与方差,于是有111222()0, var()1000000iippe zzllmmmml(2-3)于是对原始变量进行如下标准化:112()()zxu(2-4)显然有111122()0;cov()()()e zzr(2-5)因此, 原始变量12,.,pxxx的相关矩阵实际是对原始变量标准化后的协方差阵。由相关阵求主成分的过程与主成分个数的确
31、定准则实际上是与由协方差阵出发求主成分的过程与主成分个数的确定准则是一致的。求得的主成分与原始变量表示为:112()(),1,2,.,iiiyzxuip。数学模型设有n个样品,每个样品观测p 项指标(变量):12,.,pxxx,得到原始数据资料库:111 12221221212.(,.,)pppnnnpxx xxx xxxxxx xxmml(2-6)其中12iiinixxxxm,1,.,ip。用数据矩阵 x 的 p 个向量(即 p 个指标向量)1,.,pxx作线性组合(即综合指标向量)为9: 11111221221122221122.ppppmmmmppflxlxlxflxlxlxflxlxl
32、xm(2-7) 上述方程要求:222121iipjllll且系数ijl由下列原则决定:(1) if 与(; ,1,2,.,)jfij i jp不相关;(2) 1f是与12,.,px xx的一切线性组合(系数满足上述方程组)中方差最大的,2f与1f是不相关的12,.,pxxx的一切线性相关中方差最大的,1,.,kff是与121,.,kf ff都不相关的12,.,px xx的所有线性组合的最大者。这里要说明两点:一个是数学模型中为什么作线性组合?基于两种原因: 数学上比较容易处理 在实践中效果很好。另一个要说明的是每次选取的主成分要使var(if)最大,如果不加限制就可使var(if),这样就没什
33、么意义了,常用的限制是要求222121jjpjllll,1,jpl。主成分分析的基本步骤设原始资料矩阵为:111121(,)ppnnpxxxxxxxxlmomll(1) 将原始数据进行标准化处理:进行标准化的目的在于消除原始数据各指标的量纲不同,公式如下:,(1,2,., ;1,2,.,)ijjijjxxyin jps(2-8)其中11njijixxn为每一列指标的标准值;21()1nijjijxxsn为每一列指标的均方差。标准化处理后,得到新的矩阵()n pijn pyy(2) 建立变量的相关系数阵:根据公式1ry yn建立样本的相关系数矩阵r;(3) 求特征根和特征向量:根据公式0re求出
34、其前 p 个特征值12.0;p根据公式0ire x解出与特征值12,.,p对应的单位正交化特征向量12,.,pe ee。4. 写出主成分将原变量ix转换成主成分mf的线性组合,且具有正交特征,综合成为相应1().,)mm mpff个变量(,而基本信息量保持不变。这样确定的综合变量1.,mff,分别称作原变量的第一、第二、第m个主成分,且1.,mff,应在总方差中所占比例依次递减。11111221221122221122.ppppmmmmppfl xl xlxfl xlxlxflxlxlxm因子分析的内容2.4.1 因子分析原理和基本思想1904 年,charles spearman发表一篇着名
35、论文对智力检验得分进行统计分析视为因子分析的起点10。因子分析的形成和发展有相当长的历史,最早用以研究解决心理学和教育学方面的问题,由于计算量大,又缺少高速计算的设备使因子分析的应用和发展受到很大的限制,甚至停滞了很长的时间。 后来,由于电子计算机的出现,才使因子分析的理论研究和计算问题,有了很大的进展。目前这一方法的应用范围已十分广泛,在经济学、社会学、考古学、生物学、医学、地质学以及体育科学等各个领域都取得了显着的成绩。因子分析是主成分分析的推广和发展,它也是将具有错综复杂关系的变量(或样品)综合为数量较少的几个因子,以再现原始变量与因子的相互关系,同时根据不同因子还可以对变量进行分类,它
36、也是属于多元分析中处理降维的一种统计方法。因子分析的基本思想是通过变量(或样品)的相关系数矩阵(对样品是相似系数矩阵)内部结构的研究,找出能控制所有变量(或样品)的少数几个随机变量去描述多个变量(或样品)之间的相关(相似)关系,但在这里,这少数几个随机变量是不可观测的,通常称为因子。然后根据相关性的大小把变量分组,使得同组内的变量之间相关性较高,但不同的变量相关性较低。因为因子分析的内容很丰富,本文仅介绍因子分析常用的两种类型:r型因子分析(对变量作因子分析)和q型因子分析(对样品作因子分析) 。2.4.2 因子分析的性质因子分析是主成分分析的推广,也是一种把多个变量化为少数几个综合变量的多变
37、量分析方法,其目的是用有限个不可观测的隐变量解释原始变量之间的相关关系11。? 因子性质主要表现变量之间关联度上,根据关联度可以划分为特殊因子和公共因子,利用因子分析,减少分析变量个数,通过对变量的相关关系探测,将原始变量进行分类。其中共同度2ih表明 x 的第 i 个分量ix对于 f 的每一分量12,mf ffl共同依赖程度。如果它的值越大,依赖程度就越大.方差贡献2jg是衡量公共因子相对重要性的指标。2jg越大,表明公共因子jf对 x 的贡献越大,或者说对 x 的影响和作用就越大12。因子分析的求解方法和数学模型2.5.1 数学模型(正交因子模型)r型因子分析数学模/p>
38、2211222221122mmmmppppmmpxa fa fa fxa fa fafxa fafafllml简记为(p 1)(p m) (m 1)(1)pxaf且满足:i) mp;ii) (f,)0cov即 f 和是不相关的;iii) 101()01md fio即1,mffl不相关且方差皆为1. 212220( )0pdo即1,pl不相关,且方差不同。其 中1(,)pxxxl是 可 实 测 的 p 个 指 标 所 构 成 的 p 维 随 机 向 量 ,1(,)pfffl是不可观测的向量,f 称为 x 的公共因子或潜因子,即前面所说的综合变量,可以把它们理解为高维空间中相互垂直的m个坐标轴;a
39、ij称为因子载荷是第 i 个变量在第 j 个公共因子上的负荷,如果把变量ix看成m维因子空间中的一个向量,则aij表示ix在坐标轴jf上的投影,矩阵 a称为因子载荷矩阵;称为 x 的特殊因子,通常理论上要求的协方差阵是对角阵,包括随机误差14。因子分析的目的就是通过模型xaf以 f 代替 x ,由于,mp mn,从而达到简化变量维数的愿望。2.5.2 因子模型中公共因子,因子载荷量的统计意义为了便于对因子分析计算结果做解释,将因子分析数学模型中各个量的统计意义加以说明是十分必要的。假定因子模型中,各个变量以及公共因子、特殊因子都已经是标准化(均值为 0,方差为 1)的变量15。(1) 因子载荷
40、的统计意义已知模型:1122iiiijiimmixa fa fa fa fll由于在标准化下有:()0,( )0,var()1,()0,var1iiie fee xx因此()rijijx fe x f,()ijijf fe ffr,()rijijfef公式中 f 同一所以上式可写成:1212ijjjjjmjijx fif fif fijf fim f ffijra ra ra ra rrall(因为各因子不相关,所以相关系数为0)故因子载荷ija的统计意义就是第i 个变量与第 j 个公共因子的相关系数即表示ix依赖jf的分量(比重)。因此用统计学的术语应该叫做权,但由于历史的原因,心理学家将它
41、叫做载荷, 即表示第 i 个变量在第 j 个公共因子上的负荷, 它反映了第 i 个变量在第 j 个公共因子上的相对重要性。(2) 公因子jf的方差贡献率的统计意义将因子载荷矩阵中各列元素的平方和记为211,pjijisajpl称js为公共因子jf对 x 的贡献,即js表示同一公共因子jf对诸变量所提供的方差贡献之总和,它是衡量公共因子相对重要性指标。2.5.3 因子旋转与因子得分建立因子分析数学模型的目的不仅要找出公共因子以及对变量进行分组,更重要的是要知道每个因子的意义,以便对实际问题作出科学的分析,如果每个公共因子的涵义不清,不便于进行实际背景的解释,这时根据因子载荷阵的不唯一性,可对因子
42、载荷阵实行旋转即用一个正交阵右乘a使旋转后的因子载荷阵结构简化,便于对公共因子进行解释。所谓结构简化就是使每个变量仅在一个公共因子上有较大的载荷,而在其余公共因子上的载荷比较小,至多是中等大小。这种变换因子载荷的方法称为因子轴的旋转,而旋转的方法有很多。如正交旋转,斜交旋转等。因子分析的最后一步是计算因子得分。因子变量确定后,便可计算各因子得分即每个样本上的具体数值,新变量形成了因子变量,它和原变量的得分是相对应的。想要在以后分析中用因子变量代替原有变量进行数据建模,就要有因子得分,或利用因子变量对样本进行分类或评价等研究,进而实现降维和简化的目标16。计算步骤因子分析法的步骤入下:(1) 将
43、原始数据标准化,为书写方便记为ijx;(2) 建立变量的相系数阵()ijp prr;(3) 求 r的特征根及相应的单位特征向量,分别记为120pl和12,pu uul;(4) 对 a施行方差最大正交旋转;(5) 计算因子得分。第 3 章 主成分与因子分析在黑龙江省城市经济水平研究中的应用对黑龙江省 12 个地级市选取 10 个主要经济指标17(见表 3-1),1x- 国内生产总值(亿元)、2x-工业总产值(亿元)、3x- 人均 gdp(元) 、4x- 工业企业单位数(个)、5x-固定资产投资(亿元) 、6x- 社会消费品零售总额(亿元) 、7x-财政收入(万元)、8x- 金融机构存款年底余额(
44、亿元) 、9x-年末人口数(万人)、10x- 财政支出(万元)。运用 spss软件进行主成分和因子分析。表 3-1 经济指标城市1x2x3x4x5x哈尔滨45810 1142 齐齐哈尔22139 302 鸡西31076 122 鹤岗32968 143 双鸭山37490 193 大庆142067 413 伊春260 20686 112 佳木斯27774 306 七台河32308 114 牡丹江981 37001 441 黑河18892 85 绥化18474 267 表 3-1 经济指标续城市6x7x8x9x10x哈尔滨5814206 8417764 齐齐哈尔896871 3086815 鸡西74
45、9852 1298696 鹤岗455351 851063 双鸭山540332 1034629 大庆2240559 3082478 伊春205743 453 936280 佳木斯642216 1697016 七台河430529 649334 牡丹江1245000 1992704 黑河340828 1250417 绥化947769 577 2851102 主成分分析法将数据标准化,标准化后相应数据记为1f、2f、3f、4f、5f、6f、7f、8f、9f、10f,如表 3-2 所示18,表 3-2 标准化指标城市1f2f3f4f5f哈尔滨齐齐哈尔鸡西鹤岗双鸭山大庆伊春佳木斯七台河牡丹江黑河绥化表 3
46、-2 标准化指标续城市6f7f8f9f10f哈尔滨齐齐哈尔鸡西鹤岗双鸭山大庆伊春佳木斯七台河牡丹江黑河绥化利用 spss软件进行主成分分析,得出方差解释表,见表3-3。表3-3 方差解释表表3-3给出12个地级市经济发展水平的特征值、各主成分方差在总方差中的比重。表中显示第一主成分的特征值为,方差在总的方差中的比重为%;第二主成分的特征值为,方差在总的方差中的比重%。前两个特征值的累积贡献率达到%,且其特征值均大于 1,也就是说这两个主成分基本涵盖指标因子的主要信息,并且由于主成分分析得到的主成分彼此相互独立,互相不可替代。于是,取前2个因子作为主成分,碎石土的分析也说明了这一点19。图3-1
47、 碎石图图3-1是分析结果碎石图, 明显拐点为 2,可以得出保留前 2个因子将能概括大部分信息,前 2个因子贡献占总方差的比例为%,说明提取前 2个因子是比较合适的。表3-4 主成分载荷表从表 3-4 可以看出,固定资产投资、社会消费品零售总额、财政收入在第一主成分上的载荷较大, 即与第一主成分的关系数较高; 人均 gdp 在第二主成分上的载荷较大,即与第二主成分的关系数较高。 因此可将主成分命名如下: 第一主成分:产出及收入主成分;第二主成分:效益主成分12。表 3-5 成分得分系数矩阵表 3-5 给出了用原始变量表示主成分得分的系数信息。标准化第一主成分 =*1f+*2f+*3f+*4f+
48、*5f+*6f+*7f+*8f+*9f+*10f标准化第二主成分 =*1f+*2f+*3f*4f*5f- *6f*7f*8f*9f*10f到目前为止,通过主成分分析法,将10个指标转化为了具有典型经济涵义的2个综合评价指标。因子分析法首先,对这组数据的原始值进行kmo 和 bartlett s检验20,以判断数据是否适合进行因子分析。 结果为,kmo 抽样适度测定值统计量为, 在以上,bartlett球度检验统计量为,足够大,且其相应的p 值(sig=), 表示可以拒绝偏相关系数为 0 和相关系数矩阵 ( 见表 3-6) 为单位阵的原假设,所以数据适合进行因子分析(如表 3-7 所示)。表 3
49、-6 相关系数矩阵f1 f2 f3 f4 f5 f6 f7 f8 f9 f10 f1 1 f2 1 f3 1 f4 1 f5 1 f6 1 f7 1 f8 1 f9 1 f10 1 表 3-7 kmo 和 bartlett 的检验在进行因子分析之前,每项指标的原始值也需进行标准化处理,以消除变量间在数量和量纲上的不同。进行标准化处理后,平均水平为0,后面分析的结果会出现正值和负值,正值表示高于平均水平,负值表示低于平均水平。运用 spss软件对 10个变量的原始观测值进行相关系数的因子载荷估计,为了使主因子有明显地含义,采用方差最大正交法对因子载荷阵进行旋转,表3-8 为旋转后主因子对应特征值
50、的方差贡献率。以特征值大于1 为标准提取主因子,可以发现,前两个因子的累积方差贡献率达到%,能够反映原始数据的大部分信息。因此,可以运用这两个因子代替上面的10 个指标对黑龙江省个地级市经济发展状况进行综合评价。表 3-8 解释的总方差利用方差极大法对因子载荷矩阵进行旋转根据spss输出的旋转后的因子载荷阵,如表 3-9 所示,可以看出 10 个原始变量与两个因子的载荷情况。第一主因子拥有 %的解释变量,在财政支出 (10x)、金融机构存款年底余额 (8x)、社会消费品零售总额 (6x)等几个指标上有较高的载荷,主要反映了各市的经济规模和经济结构。 第二主因子拥有 %的解释变量,对人均 gdp
51、(3x)有较大载荷15,主要反映了各市的经济发展水平。这两个主因子的累计方差贡献率为%,可以比较准确的反应该系统中各原始指标的综合状况。表 3-9 旋转成份矩阵由于主因子的数值无法直接观测,所以我们通过具体原始数据来描述主因子的变化特征和水平差异。利用公共因子和原始变量之间的关系,采用回归方法可以估计两个主要因子的得分系数矩阵(见表3-10)。表 3-10 成份得分系数矩阵由此可的因子得分公式第一主因子得分1fs=*1f*2f*3f+*4f+*5f+ *6f+*7f+*8f+*9f+*10f第二主因子得分2fs=*1f+*2f+*3f*4f*5f- *6f+*7f*8f*9f*10f在上式的基
52、础上,用两个主因子的方差贡献率占累计贡献率的比重作为权重计算各个城市的综合得分zf (表 3-11),得到综合评价函数为:120.7180.282zffsfs某区域zf值的大小反映了该市经济发展状况在黑龙江省的相对位置。最后,可以针对两个主因子的得分以及加权后的综合得分,对各市的经济发展状况做出综合评价法21。表 3-11 经济系统主因子得分即综合得分城市第一主因子得分排名第二主因子得分排名综合因子得分排名哈尔滨1 2 1 齐齐哈尔2 9 3 鸡西7 7 7 鹤岗11 6 9 双鸭山10 3 8 大庆6 1 2 伊春9 10 11 佳木斯5 8 6 七台河12 5 12 牡丹江4 4 5 黑河
53、8 11 10 绥化3 12 4 综合评价结果分析由主成分和因子分析综合来看,财政(收入及支出)和社会消费品零售总额是影响这 12 个城市经济发展的第一主要因素; 人均 gdp 是影响这 12 个城市经济发展的第二主要因素。这些就是导致黑龙江省各市经济发展存在差异性的主要因素。从表 3-11可以看出,综合得分排名与第一主因子得分排名大体一致,这是因为第一主因子方差贡献率达到了%,在很大程度上反映了实际情况。由上表可知,第一因子得分较高的是哈尔滨、齐齐哈尔、绥化,说明这三个城市的消费能力及政府财政力度上比较大;第二因子得分高的是大庆、哈尔滨、双鸭山,说明这三个城市经济实力比较强。以上的结果可以将
54、这些城市大致分为三类,第一类是比较发达的城市:哈尔滨、大庆齐齐哈尔;第二类是发展中城市:绥化、牡丹江、佳木斯;第三类是有待发展的城市:鸡西、双鸭山、鹤岗、黑河、伊春、七台河。综合得分排在第一的哈尔滨市在财政、社会消费品零售总额和人均gdp上都比较高。作为黑龙江省的省会,它可以带动其他城市经济的发展。促进消费是改进其他城市经济发展的有力手段。可以根据在哈尔滨消费的调查,找到人们消费的热点商品,然后再将这些商品推广到其他城市,以此来带动各市的消费水平。从本文的研究结果可以看出,财政的支出和收入对城市的经济也有着很大的影响,提高了财政收入的同时也要增加财政支出。各市政府可以将财政支出多用在科教、卫生
55、、医疗等方面。让人们享受到更多的社会福利,对于提高人们生活水平和促进其他消费有很大的推动作用。各市在以后的工作中,在努力增加财政收入的同时要努力改善财政支出结构体系以有效的加大财政支出。其次是想办法提高人们对社会消费品的消费水平。我认为这样对促进各市经济全面、协调、共同的发展,会有一定的作用。结 论本文通过查阅 2013年的黑龙江省统计年鉴, 在介绍了国内外经济发展的基础上,阐述了黑龙江省的经济现状, 结合黑龙江省的实际情况得到了12 个地级市的 10个具有代表性的经济指标。 然后分别用主成分分析法和因子分析法两种方法对黑龙江省 12 个地级市的 10 个经济指标做出了综合分析,找到了影响经济
56、发展的两个主要因素,并对各因素的含义做了详细解释,对以后各市经济发展的调整提供了有利条件, 也为促进各市经济同步发展找到了一个大致的方向。并利用这些数据对黑龙江省地级市经济发展情况进行了排名。从本文可以看出,虽然主成分分析和因子分析都是从原始数据的协差阵(有时是相关系数阵)出发22,计算特征值与特征向量,按照累计贡献率大于85%的原则确定新的指标个数。但是为了避免混淆两种方法,在解释新的指标时应该回归到各自的模型上面来。即:按照主成分分析原理,新指标仅仅是原始指标的简单汇总,如果想用较少的几个变量替代原来的变量则用主成分分析;而对于因子分析新指标则是对所有原始指标皆有影响的那些公共因子,所以当
57、需要寻找潜在的影响要素时,倾向于用因子分析。明白了这一点,对新指标的解释也就变得顺理成章了。在黑龙江省地级市综合竞争力分析中23,从综合经济竞争力、人民生活水平、环境质量状况、基础设施竞争力、对外开放程度、科技文化竞争力6个方面选取 42 项指标利用均差法获取各因素权重, 利用现行加权法对黑龙江省12 个地级市的综合竞争力进行评价的结果是哈尔滨综合竞争力最强大,大庆、牡丹江、齐齐哈尔和佳木斯较强,鸡西、黑河双鸭山、七台河、鹤岗、伊春、绥化较弱。而本文得出的排名虽然与其有些差异,但基本一致,主要是由于可以衡量一个地区经济发展的评估指标体系涉及的指标变量很多,本文在选取经济指标的数量上不够全面。但本文仅用10 项指标,就得到了基本一致的结果。说明了本文采取的方法有一定的优越性。虽然本文用了两种统计方法,但还有很多统计分析评价方法可以进行综合评价,今后还有待于进一步的提高。致 谢四年的本科学习即将过去,在我的论文完成之际, 在黑龙江科技大学的学习期间,
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2025年河北省廊坊市安次区四年级数学下学期期末达标检测模拟试题含答案解析
- 政务处分考试试题及参考答案
- DB54-T 0698-2026雅江河谷地带核桃园建设技术规程
- 幼儿午睡水平检测试题及答案
- 考试要点试题及答案一览
- 考保安关键试题及精准答案
- 几何光学入门试题及对应答案
- 冷库及吊顶冷风机安装电气安全注意事项培训
- 知识产权代理公司培训师述职报告
- 大学俄语历年试题及权威答案
- 第5课 从小爱劳动 课件(内嵌视频)-2025-2026学年道德与法治三年级下册统编版
- 《航空材料无损检测》课件-任务一 绪论与行业特点
- 【课件】开启科学探索之旅+课件-2024-2025学年人教版(2024)八年级物理上册
- 氧化还原反应-专题训练及答案
- 传统中医养生讲座与体验行业跨境出海项目商业计划书
- 大专护理专业介绍
- 工程桩基施工验收标准与措施
- 2022年CSCO软组织肉瘤诊疗指南
- GB/T 44841-2024非合金及低合金铸铁焊接工艺评定试验
- DB41T 2466-2023 浸水电梯使用管理规范
- 人教版五年级数学上册专项计算题12套(每日一练)
评论
0/150
提交评论